Voice Compose
Compone brief di voice-design e chiamate generate_voice.js per personaggi e narrazione
Richiede configurazione
Cosa fa
Una skill per lo studio di produzione cinematografica locale PAI-Pro che modella i prompt di voice-design e l'invocazione CLI generate_voice.js per creare campioni di timbro riutilizzabili per personaggio o audio narratore/VO sulla tela. Si attiva quando l'utente chiede di dare una voce a un personaggio, di visualizzare in anteprima come suona un personaggio o di produrre l'audio finale di narrazione/lettura di battute. La produzione dell'audio effettivo richiede l'API PAI_KEY e un server canvas locale in esecuzione.
Rapporto di test
SKILL.md recuperato; il frontmatter viene analizzato (name+description). Riferimenti controllati a campione tramite fetch raw: server/cli/generate_voice.js e server/pai_voice_client.js entrambi HTTP 200; PROJECT_AGENT.md è 404 alla root ma esiste come agent-templates/PROJECT_AGENT.md, un template preparato per progetto in fase di esecuzione. La lettura di pai_voice_client.js ha confermato che il contratto della skill è reale: --prompt mappa a payload.instructions di un modello VoiceDesign TTS e --source-node-id è un edge di authorship del canvas, quindi la regola "describe the voice's sound, never name the character" è basata sul codice. Trigger giudicati 5/5: si attiva su "give the detective a voice", "what would this character sound like — make a sample", "record the final narrator VO for this line"; rifiuta correttamente "transcribe this audio to text" (STT) e "write the narrator's intro lines" (script-compose). Output NON misurato: il deliverable è audio allegato al canvas, che richiede PAI_KEY (a pagamento) più un visualizzatore/server locale in esecuzione che non posso avviare; ho potuto solo comporre la chiamata CLI, non eseguire generate_voice.js o ascoltare l'output. Nessun problema di sicurezza nella skill stessa (il repo .env.example documenta un PAI_AGENT_BYPASS che esegue agenti con --dangerously-skip-permissions, ma quella è l'infrastruttura del repo, non correlata a questa skill).
Testato il: 2026-07-31 · Claude Code 2.x (agent harness)
Installazione
git clone --depth 1 https://github.com/Utopai-Research/pai-pro.git /tmp/voice-compose-src mkdir -p ~/.claude/skills cp -R /tmp/voice-compose-src/skills/voice-compose ~/.claude/skills/voice-compose # NOT standalone. The skill only shapes prompts + a CLI call; the CLI it invokes, # $PAI_REPO_ROOT/server/cli/generate_voice.js, lives in the full pai-pro repo. # To actually generate/attach voice audio you must: # 1. Keep the whole cloned repo and export PAI_REPO_ROOT=/tmp/voice-compose-src # 2. Set PAI_KEY (paid; get at https://pai-pro.utopaistudios.com/keys) in .env # 3. Run the local canvas viewer/server (./scripts/start.sh or docker-start.sh) # Recommended real install is the plugin marketplace: this repo ships # .claude-plugin/marketplace.json exposing /pai-pro:voice-compose.
Comandi e prompt di esempio
/voice-composeCompone brief di voice-design e chiamate generate_voice.js per personaggi e narrazione
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Give this character a distinct voicePreview how this character sounds speakingGenerate final narration audio for this scene