Video Podcast Maker

Emne til 4K videopodkast: forskning, manus, TTS, Remotion-rendering, BGM-miks

av dtsola · dtsola/xiaoyaosearch

Krever oppsett ★ 7.2/10

Video Podcast Maker — Emne til 4K videopodkast: forskning, manus, TTS, Remotion-rendering, BGM-miks

Hva den gjør

En 15-trinns pipeline som gjør et emne om til en ferdig videopodkast: webforskning, et seksjonert fortellermanus, TTS-lyd med timing.json og SRT, en Remotion-komposisjon rendret i 3840x2160, FFmpeg bakgrunnsmusikk-miksing, miniatyrbilder, og plattformspesifikk publiseringsmetadata. Utløses når du ber om en videopodkast, forklaringsvideo, eller Bilibili/YouTube kunnskapsvideo om et gitt emne, eller ber den om å lære visuell stil fra en referansevideo eller et bilde. Støtter syv TTS-backends (Edge TTS gratis som standard, pluss Azure, Doubao, CosyVoice, ElevenLabs, OpenAI, Google) og zh-CN/en-US utdata med kinesisk polyfonkorreksjon.

Testrapport

Jeg lastet ned ferdighetens virkelige skript og kjørte dem. `check_prereqs.py` skrev ut `ALL_OK (backend=edge)` og `migrate_prefs.py --dry-run` skrev ut `[dry-run] Would create user_prefs.json at v1.6 from template`, så Python-siden fungerer genuint. For utdata skrev jeg et grunnlinje "why HTTP/3 uses QUIC"-skript før jeg leste kroppen (4 scener, 60s, ad-hoc markdown, ingen maskinlesbart format), deretter fulgte jeg references/workflow-script.md Trinn 1-4 og fikk topic_definition.md pluss en podcast.txt med 8 `[SECTION:xxx]`-blokker, tetthetsnivåer mappet til det navngitte komponentbiblioteket (ComparisonCard/FlowChart/DataBar), og plattform+språk-outro fra ferdighetens CTA-tabell; ferdighetens egen `generate_tts.py --dry-run` målte den til 197s / 5971 rammer, noe som bekrefter 3-7min auto-modusmålet. Det er en klar, konkret forbedring over grunnlinjen. BEKREFTET FEIL: `scripts/tts/sections.py` bruker `r'\[SECTION:(\w+)\]'`, som ikke matcher bindestreker, så ferdighetens egne leverte `templates/podcast_en.txt`-markører `[SECTION:content-1..3]` blir stille droppet — min første tørrkjøring rapporterte "Detected 5 sections" og foldet tre innholdsblokker inn i `overview`; omdøping til `content_1` ga de korrekte "Detected 8 sections". SKILL.md peker også til `CLAUDE.md` ("full command reference") og `examples/`, begge HTTP 404 i denne kopien. Ingen sikkerhetslukter: ingen curl|sh, ingen base64 blobs, ingen hemmelig eksfiltrering, stier bruker `${SKILL_DIR}`. outputMeasured=false fordi den annonserte leveransen — en 4K MP4 — trenger et stillaset Remotion-prosjekt, npm install og en ffmpeg-rendering jeg ikke satte opp; kun skriptfasen ble målt. Merk at dette er en videresolgt kopi av oppstrøms Agents365-ai/video-podcast-maker inne i et kinesisk lokalt søkeapp-repo.

Testet på: 2026-07-21 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/dtsola/xiaoyaosearch /tmp/xiaoyaosearch
cd /tmp/xiaoyaosearch
mkdir -p ~/.claude/skills
cp -R /tmp/xiaoyaosearch/.claude/skills/video-podcast-maker ~/.claude/skills/
cp -R /tmp/xiaoyaosearch/.claude/skills/remotion-best-practices ~/.claude/skills/   # hard dependency
brew install ffmpeg node                                    # macOS; node + npx + ffmpeg + python3 required
pip install -r ~/.claude/skills/video-podcast-maker/requirements.txt
python3 ~/.claude/skills/video-podcast-maker/scripts/check_prereqs.py   # expect: ALL_OK (backend=edge)
# You also need an existing Remotion project; videos land in videos/{name}/ inside it.
# Optional: set AZURE_SPEECH_KEY / OPENAI_API_KEY / etc. only if you switch off the free `edge` backend.

Kommandoer og eksempelprompter

  • /video-podcast-makerEmne til 4K videopodkast: forskning, manus, TTS, Remotion-rendering, BGM-miks

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Make a video podcast about this topic
  • Learn this reference video's visual style and apply it
  • Generate a video podcast with background music