Voice Compose

Skapar röstdesignbriefar och generate_voice.js-anrop för karaktärer och berättarröst

av Utopai-Research · Utopai-Research/pai-pro

Fungerar med konfiguration ★ 7.6/10

Voice Compose — Skapar röstdesignbriefar och generate_voice.js-anrop för karaktärer och berättarröst

Vad den gör

En färdighet för PAI-Pro lokala filmstudio som formar röstdesignprompter och generate_voice.js CLI-anrop för att skapa återanvändbara klangprover per karaktär eller berättarröst/VO-ljud på canvasen. Den utlöses när användaren ber att ge en karaktär en röst, förhandsgranska hur en karaktär låter, eller producera slutlig berättarröst/replikljud. Att producera faktiskt ljud kräver PAI_KEY API och en körande lokal canvas-server.

Testrapport

Hämtade SKILL.md; frontmatter parsas (name+description). Kontrollerade referenser via rå hämtning: server/cli/generate_voice.js och server/pai_voice_client.js båda HTTP 200; PROJECT_AGENT.md är 404 vid roten men finns som agent-templates/PROJECT_AGENT.md, en mall iscensatt per projekt vid körning. Läsning av pai_voice_client.js bekräftade att färdighetens kontrakt är verkligt: --prompt mappas till payload.instructions i en VoiceDesign TTS-modell och --source-node-id är en canvas authorship edge, så regeln "beskriv röstens ljud, nämn aldrig karaktären" är förankrad i koden. Triggers bedömdes 5/5: aktiveras på "give the detective a voice", "what would this character sound like — make a sample", "record the final narrator VO for this line"; avvisar korrekt "transcribe this audio to text" (STT) och "write the narrator's intro lines" (script-compose). Utdata MÄTTES EJ: leveransen är ljud kopplat till canvasen, vilket kräver PAI_KEY (betald) plus en körande lokal visare/server som jag inte kan starta; jag kunde bara komponera CLI-anropet, inte köra generate_voice.js eller höra utdata. Inga säkerhetsbrister i själva färdigheten (repo .env.example dokumenterar en PAI_AGENT_BYPASS som kör agenter med --dangerously-skip-permissions, men det är repo-infrastruktur, orelaterat till denna färdighet).

Testad: 2026-07-31 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/Utopai-Research/pai-pro.git /tmp/voice-compose-src
mkdir -p ~/.claude/skills
cp -R /tmp/voice-compose-src/skills/voice-compose ~/.claude/skills/voice-compose
# NOT standalone. The skill only shapes prompts + a CLI call; the CLI it invokes,
#   $PAI_REPO_ROOT/server/cli/generate_voice.js, lives in the full pai-pro repo.
# To actually generate/attach voice audio you must:
#   1. Keep the whole cloned repo and export PAI_REPO_ROOT=/tmp/voice-compose-src
#   2. Set PAI_KEY (paid; get at https://pai-pro.utopaistudios.com/keys) in .env
#   3. Run the local canvas viewer/server (./scripts/start.sh or docker-start.sh)
# Recommended real install is the plugin marketplace: this repo ships
#   .claude-plugin/marketplace.json exposing /pai-pro:voice-compose.

Kommandon och exempelprompter

  • /voice-composeSkapar röstdesignbriefar och generate_voice.js-anrop för karaktärer och berättarröst

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Give this character a distinct voice
  • Preview how this character sounds speaking
  • Generate final narration audio for this scene