Voice Compose
Compose des briefs de conception vocale et des appels generate_voice.js pour les personnages et la narration
Fonctionne avec configuration
Ce que fait
Une compétence pour le studio de production cinématographique local PAI-Pro qui façonne les invites de conception vocale et l'invocation CLI generate_voice.js pour créer des échantillons de timbre réutilisables par personnage ou audio de narrateur/VO sur le canevas. Elle se déclenche lorsque l'utilisateur demande de donner une voix à un personnage, de prévisualiser le son d'un personnage, ou de produire l'audio final de narration/lecture de ligne. La production audio réelle nécessite l'API PAI_KEY et un serveur canvas local en cours d'exécution.
Rapport de test
SKILL.md récupéré ; le frontmatter est parsé (name+description). Références vérifiées via raw fetch : server/cli/generate_voice.js et server/pai_voice_client.js sont tous deux HTTP 200 ; PROJECT_AGENT.md est 404 à la racine mais existe en tant que agent-templates/PROJECT_AGENT.md, un modèle mis en scène par projet à l'exécution. La lecture de pai_voice_client.js a confirmé que le contrat de la compétence est réel : --prompt correspond à payload.instructions d'un modèle VoiceDesign TTS et --source-node-id est une arête d'auteur de canevas, donc la règle "décrire le son de la voix, ne jamais nommer le personnage" est fondée dans le code. Déclencheurs jugés 5/5 : activation sur "give the detective a voice", "what would this character sound like — make a sample", "record the final narrator VO for this line" ; rejet correct de "transcribe this audio to text" (STT) et "write the narrator's intro lines" (script-compose). Sortie NON mesurée : le livrable est un audio attaché au canevas, nécessitant PAI_KEY (payant) plus un visualiseur/serveur local en cours d'exécution que je ne peux pas démarrer ; je ne pouvais que composer l'appel CLI, pas exécuter generate_voice.js ou entendre la sortie. Aucune faille de sécurité dans la compétence elle-même (le fichier .env.example du dépôt documente un PAI_AGENT_BYPASS qui exécute des agents avec --dangerously-skip-permissions, mais cela concerne l'infrastructure du dépôt, sans rapport avec cette compétence).
Testé le: 2026-07-31 · Claude Code 2.x (agent harness)
Installation
git clone --depth 1 https://github.com/Utopai-Research/pai-pro.git /tmp/voice-compose-src mkdir -p ~/.claude/skills cp -R /tmp/voice-compose-src/skills/voice-compose ~/.claude/skills/voice-compose # NOT standalone. The skill only shapes prompts + a CLI call; the CLI it invokes, # $PAI_REPO_ROOT/server/cli/generate_voice.js, lives in the full pai-pro repo. # To actually generate/attach voice audio you must: # 1. Keep the whole cloned repo and export PAI_REPO_ROOT=/tmp/voice-compose-src # 2. Set PAI_KEY (paid; get at https://pai-pro.utopaistudios.com/keys) in .env # 3. Run the local canvas viewer/server (./scripts/start.sh or docker-start.sh) # Recommended real install is the plugin marketplace: this repo ships # .claude-plugin/marketplace.json exposing /pai-pro:voice-compose.
Commandes et exemples de prompts
/voice-composeCompose des briefs de conception vocale et des appels generate_voice.js pour les personnages et la narration
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Give this character a distinct voicePreview how this character sounds speakingGenerate final narration audio for this scene