Voice Compose

Compose des briefs de conception vocale et des appels generate_voice.js pour les personnages et la narration

par Utopai-Research · Utopai-Research/pai-pro

Fonctionne avec configuration ★ 7.6/10

Voice Compose — Compose des briefs de conception vocale et des appels generate_voice.js pour les personnages et la narration

Ce que fait

Une compétence pour le studio de production cinématographique local PAI-Pro qui façonne les invites de conception vocale et l'invocation CLI generate_voice.js pour créer des échantillons de timbre réutilisables par personnage ou audio de narrateur/VO sur le canevas. Elle se déclenche lorsque l'utilisateur demande de donner une voix à un personnage, de prévisualiser le son d'un personnage, ou de produire l'audio final de narration/lecture de ligne. La production audio réelle nécessite l'API PAI_KEY et un serveur canvas local en cours d'exécution.

Rapport de test

SKILL.md récupéré ; le frontmatter est parsé (name+description). Références vérifiées via raw fetch : server/cli/generate_voice.js et server/pai_voice_client.js sont tous deux HTTP 200 ; PROJECT_AGENT.md est 404 à la racine mais existe en tant que agent-templates/PROJECT_AGENT.md, un modèle mis en scène par projet à l'exécution. La lecture de pai_voice_client.js a confirmé que le contrat de la compétence est réel : --prompt correspond à payload.instructions d'un modèle VoiceDesign TTS et --source-node-id est une arête d'auteur de canevas, donc la règle "décrire le son de la voix, ne jamais nommer le personnage" est fondée dans le code. Déclencheurs jugés 5/5 : activation sur "give the detective a voice", "what would this character sound like — make a sample", "record the final narrator VO for this line" ; rejet correct de "transcribe this audio to text" (STT) et "write the narrator's intro lines" (script-compose). Sortie NON mesurée : le livrable est un audio attaché au canevas, nécessitant PAI_KEY (payant) plus un visualiseur/serveur local en cours d'exécution que je ne peux pas démarrer ; je ne pouvais que composer l'appel CLI, pas exécuter generate_voice.js ou entendre la sortie. Aucune faille de sécurité dans la compétence elle-même (le fichier .env.example du dépôt documente un PAI_AGENT_BYPASS qui exécute des agents avec --dangerously-skip-permissions, mais cela concerne l'infrastructure du dépôt, sans rapport avec cette compétence).

Testé le: 2026-07-31 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/Utopai-Research/pai-pro.git /tmp/voice-compose-src
mkdir -p ~/.claude/skills
cp -R /tmp/voice-compose-src/skills/voice-compose ~/.claude/skills/voice-compose
# NOT standalone. The skill only shapes prompts + a CLI call; the CLI it invokes,
#   $PAI_REPO_ROOT/server/cli/generate_voice.js, lives in the full pai-pro repo.
# To actually generate/attach voice audio you must:
#   1. Keep the whole cloned repo and export PAI_REPO_ROOT=/tmp/voice-compose-src
#   2. Set PAI_KEY (paid; get at https://pai-pro.utopaistudios.com/keys) in .env
#   3. Run the local canvas viewer/server (./scripts/start.sh or docker-start.sh)
# Recommended real install is the plugin marketplace: this repo ships
#   .claude-plugin/marketplace.json exposing /pai-pro:voice-compose.

Commandes et exemples de prompts

  • /voice-composeCompose des briefs de conception vocale et des appels generate_voice.js pour les personnages et la narration

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Give this character a distinct voice
  • Preview how this character sounds speaking
  • Generate final narration audio for this scene