Voice Compose

Compone brief di voice-design e chiamate generate_voice.js per personaggi e narrazione

di Utopai-Research · Utopai-Research/pai-pro

Richiede configurazione ★ 7.6/10

Voice Compose — Compone brief di voice-design e chiamate generate_voice.js per personaggi e narrazione

Cosa fa

Una skill per lo studio di produzione cinematografica locale PAI-Pro che modella i prompt di voice-design e l'invocazione CLI generate_voice.js per creare campioni di timbro riutilizzabili per personaggio o audio narratore/VO sulla tela. Si attiva quando l'utente chiede di dare una voce a un personaggio, di visualizzare in anteprima come suona un personaggio o di produrre l'audio finale di narrazione/lettura di battute. La produzione dell'audio effettivo richiede l'API PAI_KEY e un server canvas locale in esecuzione.

Rapporto di test

SKILL.md recuperato; il frontmatter viene analizzato (name+description). Riferimenti controllati a campione tramite fetch raw: server/cli/generate_voice.js e server/pai_voice_client.js entrambi HTTP 200; PROJECT_AGENT.md è 404 alla root ma esiste come agent-templates/PROJECT_AGENT.md, un template preparato per progetto in fase di esecuzione. La lettura di pai_voice_client.js ha confermato che il contratto della skill è reale: --prompt mappa a payload.instructions di un modello VoiceDesign TTS e --source-node-id è un edge di authorship del canvas, quindi la regola "describe the voice's sound, never name the character" è basata sul codice. Trigger giudicati 5/5: si attiva su "give the detective a voice", "what would this character sound like — make a sample", "record the final narrator VO for this line"; rifiuta correttamente "transcribe this audio to text" (STT) e "write the narrator's intro lines" (script-compose). Output NON misurato: il deliverable è audio allegato al canvas, che richiede PAI_KEY (a pagamento) più un visualizzatore/server locale in esecuzione che non posso avviare; ho potuto solo comporre la chiamata CLI, non eseguire generate_voice.js o ascoltare l'output. Nessun problema di sicurezza nella skill stessa (il repo .env.example documenta un PAI_AGENT_BYPASS che esegue agenti con --dangerously-skip-permissions, ma quella è l'infrastruttura del repo, non correlata a questa skill).

Testato il: 2026-07-31 · Claude Code 2.x (agent harness)

Installazione

git clone --depth 1 https://github.com/Utopai-Research/pai-pro.git /tmp/voice-compose-src
mkdir -p ~/.claude/skills
cp -R /tmp/voice-compose-src/skills/voice-compose ~/.claude/skills/voice-compose
# NOT standalone. The skill only shapes prompts + a CLI call; the CLI it invokes,
#   $PAI_REPO_ROOT/server/cli/generate_voice.js, lives in the full pai-pro repo.
# To actually generate/attach voice audio you must:
#   1. Keep the whole cloned repo and export PAI_REPO_ROOT=/tmp/voice-compose-src
#   2. Set PAI_KEY (paid; get at https://pai-pro.utopaistudios.com/keys) in .env
#   3. Run the local canvas viewer/server (./scripts/start.sh or docker-start.sh)
# Recommended real install is the plugin marketplace: this repo ships
#   .claude-plugin/marketplace.json exposing /pai-pro:voice-compose.

Comandi e prompt di esempio

  • /voice-composeCompone brief di voice-design e chiamate generate_voice.js per personaggi e narrazione

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Give this character a distinct voice
  • Preview how this character sounds speaking
  • Generate final narration audio for this scene