Video Podcast Maker
Thema zu 4K Video-Podcast: Recherche, Skript, TTS, Remotion-Rendering, BGM-Mix
Funktioniert mit Setup
Was es kann
Eine 15-stufige Pipeline, die ein Thema in einen fertigen Video-Podcast verwandelt: Web-Recherche, ein gegliedertes Erzählskript, TTS-Audio mit timing.json und SRT, eine Remotion-Komposition gerendert in 3840x2160, FFmpeg-Hintergrundmusik-Mixing, Thumbnails und plattformspezifische Veröffentlichungsmetadaten. Wird ausgelöst, wenn Sie nach einem Video-Podcast, Erklärvideo oder Bilibili/YouTube-Wissensvideo zu einem bestimmten Thema fragen oder es bitten, einen visuellen Stil von einem Referenzvideo oder -bild zu lernen. Unterstützt sieben TTS-Backends (Edge TTS standardmäßig kostenlos, plus Azure, Doubao, CosyVoice, ElevenLabs, OpenAI, Google) und zh-CN/en-US-Ausgabe mit chinesischer Polyphonie-Korrektur.
Testbericht
Ich habe die echten Skripte des Skills heruntergeladen und ausgeführt. `check_prereqs.py` gab `ALL_OK (backend=edge)` aus und `migrate_prefs.py --dry-run` gab `[dry-run] Would create user_prefs.json at v1.6 from template` aus, sodass die Python-Seite tatsächlich funktioniert. Für die Ausgabe schrieb ich ein Baseline-Skript „why HTTP/3 uses QUIC“, bevor ich den Text las (4 Szenen, 60s, Ad-hoc-Markdown, kein maschinenlesbares Format), folgte dann references/workflow-script.md Schritte 1-4 und erhielt topic_definition.md plus eine podcast.txt mit 8 `[SECTION:xxx]`-Blöcken, Dichte-Stufen, die der benannten Komponentenbibliothek (ComparisonCard/FlowChart/DataBar) zugeordnet sind, und das Plattform+Sprache-Outro aus der CTA-Tabelle des Skills; der eigene `generate_tts.py --dry-run` des Skills maß es mit 197s / 5971 Frames, was das 3-7min Auto-Modus-Ziel bestätigt. Das ist eine klare, konkrete Verbesserung gegenüber der Baseline. BESTÄTIGTER FEHLER: `scripts/tts/sections.py` verwendet `r'\[SECTION:(\w+)\]'`, was keine Bindestriche abgleicht, sodass die eigenen ausgelieferten `templates/podcast_en.txt`-Marker des Skills `[SECTION:content-1..3]` stillschweigend ignoriert werden — mein erster Dry-Run meldete „Detected 5 sections“ und faltete drei Inhaltsblöcke in `overview`; die Umbenennung in `content_1` ergab die korrekten „Detected 8 sections“. SKILL.md verweist auch auf `CLAUDE.md` („full command reference“) und `examples/`, beide HTTP 404 in dieser Kopie. Keine Sicherheitsmängel: kein curl|sh, keine base64-Blobs, keine geheime Exfiltration, Pfade verwenden `${SKILL_DIR}`. outputMeasured=false, weil das beworbene Ergebnis — ein 4K MP4 — ein gerüstetes Remotion-Projekt, npm install und ein ffmpeg-Rendering benötigt, das ich nicht eingerichtet habe; nur die Skripting-Phase wurde gemessen. Beachten Sie, dass dies eine vendored Kopie des Upstream Agents365-ai/video-podcast-maker innerhalb eines chinesischen lokalen Such-App-Repos ist.
Getestet am: 2026-07-21 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/dtsola/xiaoyaosearch /tmp/xiaoyaosearch
cd /tmp/xiaoyaosearch
mkdir -p ~/.claude/skills
cp -R /tmp/xiaoyaosearch/.claude/skills/video-podcast-maker ~/.claude/skills/
cp -R /tmp/xiaoyaosearch/.claude/skills/remotion-best-practices ~/.claude/skills/ # hard dependency
brew install ffmpeg node # macOS; node + npx + ffmpeg + python3 required
pip install -r ~/.claude/skills/video-podcast-maker/requirements.txt
python3 ~/.claude/skills/video-podcast-maker/scripts/check_prereqs.py # expect: ALL_OK (backend=edge)
# You also need an existing Remotion project; videos land in videos/{name}/ inside it.
# Optional: set AZURE_SPEECH_KEY / OPENAI_API_KEY / etc. only if you switch off the free `edge` backend. Befehle & Beispiel-Prompts
/video-podcast-makerThema zu 4K Video-Podcast: Recherche, Skript, TTS, Remotion-Rendering, BGM-Mix
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Make a video podcast about this topicLearn this reference video's visual style and apply itGenerate a video podcast with background music