Voice Compose
Compone resúmenes de diseño de voz y llamadas a generate_voice.js para personajes y narración
Funciona con configuración
Qué hace
Una habilidad para el estudio de cine local PAI-Pro que da forma a las indicaciones de diseño de voz y la invocación CLI generate_voice.js para crear muestras de timbre reutilizables por personaje o audio de narrador/VO en el lienzo. Se activa cuando el usuario pide dar voz a un personaje, previsualizar cómo suena un personaje o producir audio final de narración/lectura de líneas. La producción de audio real requiere la API PAI_KEY y un servidor local de lienzo en ejecución.
Informe de la prueba
SKILL.md obtenido; el frontmatter se analiza (name+description). Referencias verificadas mediante fetch raw: server/cli/generate_voice.js y server/pai_voice_client.js ambos HTTP 200; PROJECT_AGENT.md es 404 en la raíz pero existe como agent-templates/PROJECT_AGENT.md, una plantilla preparada por proyecto en tiempo de ejecución. La lectura de pai_voice_client.js confirmó que el contrato de la habilidad es real: --prompt se mapea a payload.instructions de un modelo TTS VoiceDesign y --source-node-id es un borde de autoría de lienzo, por lo que la regla "describe el sonido de la voz, nunca nombres al personaje" se basa en el código. Disparadores juzgados 5/5: se activa con "give the detective a voice", "what would this character sound like — make a sample", "record the final narrator VO for this line"; rechaza correctamente "transcribe this audio to text" (STT) y "write the narrator's intro lines" (script-compose). Salida NO medida: el entregable es audio adjunto al lienzo, que necesita PAI_KEY (de pago) más un visor/servidor local en ejecución que no puedo iniciar; solo pude componer la llamada CLI, no ejecutar generate_voice.js ni escuchar la salida. No hay problemas de seguridad en la habilidad en sí (repo .env.example documenta un PAI_AGENT_BYPASS que ejecuta agentes con --dangerously-skip-permissions, pero eso es infraestructura del repositorio, no relacionado con esta habilidad).
Probado el: 2026-07-31 · Claude Code 2.x (agent harness)
Instalación
git clone --depth 1 https://github.com/Utopai-Research/pai-pro.git /tmp/voice-compose-src mkdir -p ~/.claude/skills cp -R /tmp/voice-compose-src/skills/voice-compose ~/.claude/skills/voice-compose # NOT standalone. The skill only shapes prompts + a CLI call; the CLI it invokes, # $PAI_REPO_ROOT/server/cli/generate_voice.js, lives in the full pai-pro repo. # To actually generate/attach voice audio you must: # 1. Keep the whole cloned repo and export PAI_REPO_ROOT=/tmp/voice-compose-src # 2. Set PAI_KEY (paid; get at https://pai-pro.utopaistudios.com/keys) in .env # 3. Run the local canvas viewer/server (./scripts/start.sh or docker-start.sh) # Recommended real install is the plugin marketplace: this repo ships # .claude-plugin/marketplace.json exposing /pai-pro:voice-compose.
Comandos y prompts de ejemplo
/voice-composeCompone resúmenes de diseño de voz y llamadas a generate_voice.js para personajes y narración
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Give this character a distinct voicePreview how this character sounds speakingGenerate final narration audio for this scene