Voice Compose

Compone resúmenes de diseño de voz y llamadas a generate_voice.js para personajes y narración

Por Utopai-Research · Utopai-Research/pai-pro

Funciona con configuración ★ 7.6/10

Voice Compose — Compone resúmenes de diseño de voz y llamadas a generate_voice.js para personajes y narración

Qué hace

Una habilidad para el estudio de cine local PAI-Pro que da forma a las indicaciones de diseño de voz y la invocación CLI generate_voice.js para crear muestras de timbre reutilizables por personaje o audio de narrador/VO en el lienzo. Se activa cuando el usuario pide dar voz a un personaje, previsualizar cómo suena un personaje o producir audio final de narración/lectura de líneas. La producción de audio real requiere la API PAI_KEY y un servidor local de lienzo en ejecución.

Informe de la prueba

SKILL.md obtenido; el frontmatter se analiza (name+description). Referencias verificadas mediante fetch raw: server/cli/generate_voice.js y server/pai_voice_client.js ambos HTTP 200; PROJECT_AGENT.md es 404 en la raíz pero existe como agent-templates/PROJECT_AGENT.md, una plantilla preparada por proyecto en tiempo de ejecución. La lectura de pai_voice_client.js confirmó que el contrato de la habilidad es real: --prompt se mapea a payload.instructions de un modelo TTS VoiceDesign y --source-node-id es un borde de autoría de lienzo, por lo que la regla "describe el sonido de la voz, nunca nombres al personaje" se basa en el código. Disparadores juzgados 5/5: se activa con "give the detective a voice", "what would this character sound like — make a sample", "record the final narrator VO for this line"; rechaza correctamente "transcribe this audio to text" (STT) y "write the narrator's intro lines" (script-compose). Salida NO medida: el entregable es audio adjunto al lienzo, que necesita PAI_KEY (de pago) más un visor/servidor local en ejecución que no puedo iniciar; solo pude componer la llamada CLI, no ejecutar generate_voice.js ni escuchar la salida. No hay problemas de seguridad en la habilidad en sí (repo .env.example documenta un PAI_AGENT_BYPASS que ejecuta agentes con --dangerously-skip-permissions, pero eso es infraestructura del repositorio, no relacionado con esta habilidad).

Probado el: 2026-07-31 · Claude Code 2.x (agent harness)

Instalación

git clone --depth 1 https://github.com/Utopai-Research/pai-pro.git /tmp/voice-compose-src
mkdir -p ~/.claude/skills
cp -R /tmp/voice-compose-src/skills/voice-compose ~/.claude/skills/voice-compose
# NOT standalone. The skill only shapes prompts + a CLI call; the CLI it invokes,
#   $PAI_REPO_ROOT/server/cli/generate_voice.js, lives in the full pai-pro repo.
# To actually generate/attach voice audio you must:
#   1. Keep the whole cloned repo and export PAI_REPO_ROOT=/tmp/voice-compose-src
#   2. Set PAI_KEY (paid; get at https://pai-pro.utopaistudios.com/keys) in .env
#   3. Run the local canvas viewer/server (./scripts/start.sh or docker-start.sh)
# Recommended real install is the plugin marketplace: this repo ships
#   .claude-plugin/marketplace.json exposing /pai-pro:voice-compose.

Comandos y prompts de ejemplo

  • /voice-composeCompone resúmenes de diseño de voz y llamadas a generate_voice.js para personajes y narración

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Give this character a distinct voice
  • Preview how this character sounds speaking
  • Generate final narration audio for this scene