Voice Compose
Erstellt Voice-Design-Briefs und generate_voice.js-Aufrufe für Charaktere und Erzählungen
Funktioniert mit Setup
Was es kann
Eine Skill für das lokale PAI-Pro Filmstudio, die Voice-Design-Prompts und den generate_voice.js CLI-Aufruf formt, um wiederverwendbare Klangfarben-Samples pro Charakter oder Erzähler-/VO-Audio auf der Leinwand zu erstellen. Sie wird ausgelöst, wenn der Benutzer darum bittet, einem Charakter eine Stimme zu geben, eine Vorschau des Klangs eines Charakters zu erhalten oder finales Erzähl-/Line-Read-Audio zu produzieren. Die Erzeugung des tatsächlichen Audios erfordert die PAI_KEY API und einen laufenden lokalen Canvas-Server.
Testbericht
SKILL.md abgerufen; Frontmatter wird geparst (name+description). Referenzen per Raw-Fetch stichprobenartig überprüft: server/cli/generate_voice.js und server/pai_voice_client.js beide HTTP 200; PROJECT_AGENT.md ist 404 im Root, existiert aber als agent-templates/PROJECT_AGENT.md, eine pro Projekt zur Laufzeit bereitgestellte Vorlage. Das Lesen von pai_voice_client.js bestätigte, dass der Vertrag des Skills real ist: --prompt wird auf payload.instructions eines VoiceDesign TTS-Modells abgebildet und --source-node-id ist ein Canvas-Autorenschafts-Edge, sodass die Regel "beschreibe den Klang der Stimme, nenne niemals den Charakter" im Code verankert ist. Trigger 5/5 bewertet: Aktivierung bei "gib dem Detektiv eine Stimme", "wie würde dieser Charakter klingen — mach ein Sample", "nimm die finale Erzähler-VO für diese Zeile auf"; korrekte Ablehnung von "transkribiere dieses Audio in Text" (STT) und "schreibe die Einleitungszeilen des Erzählers" (script-compose). Ausgabe NICHT gemessen: Das Ergebnis ist Audio, das an den Canvas angehängt ist und PAI_KEY (kostenpflichtig) plus einen laufenden lokalen Viewer/Server benötigt, den ich nicht starten kann; ich konnte nur den CLI-Aufruf zusammenstellen, nicht generate_voice.js ausführen oder die Ausgabe hören. Keine Sicherheitslücken im Skill selbst (repo .env.example dokumentiert einen PAI_AGENT_BYPASS, der Agenten mit --dangerously-skip-permissions ausführt, aber das ist Repo-Infrastruktur, unrelated zu diesem Skill).
Getestet am: 2026-07-31 · Claude Code 2.x (agent harness)
Installation
git clone --depth 1 https://github.com/Utopai-Research/pai-pro.git /tmp/voice-compose-src mkdir -p ~/.claude/skills cp -R /tmp/voice-compose-src/skills/voice-compose ~/.claude/skills/voice-compose # NOT standalone. The skill only shapes prompts + a CLI call; the CLI it invokes, # $PAI_REPO_ROOT/server/cli/generate_voice.js, lives in the full pai-pro repo. # To actually generate/attach voice audio you must: # 1. Keep the whole cloned repo and export PAI_REPO_ROOT=/tmp/voice-compose-src # 2. Set PAI_KEY (paid; get at https://pai-pro.utopaistudios.com/keys) in .env # 3. Run the local canvas viewer/server (./scripts/start.sh or docker-start.sh) # Recommended real install is the plugin marketplace: this repo ships # .claude-plugin/marketplace.json exposing /pai-pro:voice-compose.
Befehle & Beispiel-Prompts
/voice-composeErstellt Voice-Design-Briefs und generate_voice.js-Aufrufe für Charaktere und Erzählungen
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Give this character a distinct voicePreview how this character sounds speakingGenerate final narration audio for this scene