Video Podcast Maker

Ämne till 4K videopodcast: research, manus, TTS, Remotion-rendering, BGM-mix

av dtsola · dtsola/xiaoyaosearch

Fungerar med konfiguration ★ 7.2/10

Video Podcast Maker — Ämne till 4K videopodcast: research, manus, TTS, Remotion-rendering, BGM-mix

Vad den gör

En 15-stegs pipeline som förvandlar ett ämne till en färdig videopodcast: webbforskning, ett sektionerat berättarmanus, TTS-ljud med timing.json och SRT, en Remotion-komposition renderad i 3840x2160, FFmpeg bakgrundsmusikmixning, miniatyrbilder och plattformsspecifik publiceringsmetadata. Utlöses när du ber om en videopodcast, förklaringsvideo eller Bilibili/YouTube kunskapsvideo om ett givet ämne, eller ber den att lära sig visuell stil från en referensvideo eller bild. Stöder sju TTS-backends (Edge TTS gratis som standard, plus Azure, Doubao, CosyVoice, ElevenLabs, OpenAI, Google) och zh-CN/en-US-utdata med kinesisk polyfonkorrigering.

Testrapport

Jag laddade ner skicklighetens verkliga skript och körde dem. `check_prereqs.py` skrev ut `ALL_OK (backend=edge)` och `migrate_prefs.py --dry-run` skrev ut `[dry-run] Would create user_prefs.json at v1.6 from template`, så Python-sidan fungerar verkligen. För utdata skrev jag ett baslinje-skript "why HTTP/3 uses QUIC" innan jag läste brödtexten (4 scener, 60s, ad-hoc markdown, inget maskinläsbart format), sedan följde jag references/workflow-script.md Steg 1-4 och fick topic_definition.md plus en podcast.txt med 8 `[SECTION:xxx]`-block, densitetsnivåer mappade till det namngivna komponentbiblioteket (ComparisonCard/FlowChart/DataBar), och plattform+språk-outro från skicklighetens CTA-tabell; skicklighetens egen `generate_tts.py --dry-run` mätte den till 197s / 5971 frames, vilket bekräftar 3-7min auto-mode-målet. Det är en tydlig, konkret förbättring jämfört med baslinjen. BEKRÄFTAD BUGG: `scripts/tts/sections.py` använder `r'\[SECTION:(\w+)\]'`, vilket inte matchar bindestreck, så skicklighetens egna levererade `templates/podcast_en.txt`-markörer `[SECTION:content-1..3]` ignoreras tyst — min första torr-körning rapporterade "Detected 5 sections" och vek ihop tre innehållsblock till `overview`; att döpa om till `content_1` gav de korrekta "Detected 8 sections". SKILL.md pekar också på `CLAUDE.md` ("full command reference") och `examples/`, båda HTTP 404 i denna kopia. Inga säkerhetsbrister: ingen curl|sh, inga base64-blobar, ingen hemlig exfiltrering, sökvägar använder `${SKILL_DIR}`. outputMeasured=false eftersom den annonserade leveransen — en 4K MP4 — behöver ett scaffolded Remotion-projekt, npm install och en ffmpeg-rendering som jag inte satte upp; endast skriptfasen mättes. Obs detta är en levererad kopia av uppströms Agents365-ai/video-podcast-maker inuti ett kinesiskt lokalt sökapp-repo.

Testad: 2026-07-21 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/dtsola/xiaoyaosearch /tmp/xiaoyaosearch
cd /tmp/xiaoyaosearch
mkdir -p ~/.claude/skills
cp -R /tmp/xiaoyaosearch/.claude/skills/video-podcast-maker ~/.claude/skills/
cp -R /tmp/xiaoyaosearch/.claude/skills/remotion-best-practices ~/.claude/skills/   # hard dependency
brew install ffmpeg node                                    # macOS; node + npx + ffmpeg + python3 required
pip install -r ~/.claude/skills/video-podcast-maker/requirements.txt
python3 ~/.claude/skills/video-podcast-maker/scripts/check_prereqs.py   # expect: ALL_OK (backend=edge)
# You also need an existing Remotion project; videos land in videos/{name}/ inside it.
# Optional: set AZURE_SPEECH_KEY / OPENAI_API_KEY / etc. only if you switch off the free `edge` backend.

Kommandon och exempelprompter

  • /video-podcast-makerÄmne till 4K videopodcast: research, manus, TTS, Remotion-rendering, BGM-mix

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Make a video podcast about this topic
  • Learn this reference video's visual style and apply it
  • Generate a video podcast with background music