Video Podcast Maker

Téma na 4K video podcast: výzkum, skript, TTS, Remotion render, BGM mix

od dtsola · dtsola/xiaoyaosearch

Funguje s nastavením ★ 7.2/10

Video Podcast Maker — Téma na 4K video podcast: výzkum, skript, TTS, Remotion render, BGM mix

Co umí

15krokový pipeline, který přemění téma na hotový video podcast: webový výzkum, rozdělený narativní skript, TTS audio s timing.json a SRT, Remotion kompozice renderovaná v 3840x2160, FFmpeg mixování podkladové hudby, miniatury a metadata pro publikování specifická pro platformu. Spouští se, když požádáte o video podcast, vysvětlující video nebo Bilibili/YouTube znalostní video na dané téma, nebo požádáte o naučení vizuálního stylu z referenčního videa nebo obrázku. Podporuje sedm TTS backendů (Edge TTS zdarma ve výchozím nastavení, plus Azure, Doubao, CosyVoice, ElevenLabs, OpenAI, Google) a zh-CN/en-US výstup s čínskou polyfonní korekcí.

Testovací report

Stáhl jsem skutečné skripty dovednosti a spustil je. `check_prereqs.py` vytiskl `ALL_OK (backend=edge)` a `migrate_prefs.py --dry-run` vytiskl `[dry-run] Would create user_prefs.json at v1.6 from template`, takže Python strana skutečně funguje. Pro výstup jsem napsal základní skript "proč HTTP/3 používá QUIC" před přečtením těla (4 scény, 60s, ad-hoc markdown, žádný strojově čitelný formát), poté jsem následoval references/workflow-script.md Kroky 1-4 a získal topic_definition.md plus podcast.txt s 8 bloky `[SECTION:xxx]`, úrovně hustoty mapované na pojmenovanou knihovnu komponent (ComparisonCard/FlowChart/DataBar), a platform+language outro z CTA tabulky dovednosti; vlastní `generate_tts.py --dry-run` dovednosti to změřil na 197s / 5971 snímků, což potvrzuje cíl 3-7min auto-režimu. To je jasné, konkrétní zlepšení oproti základu. POTVRZENÁ CHYBA: `scripts/tts/sections.py` používá `r'\[SECTION:(\w+)\]'`, což neodpovídá pomlčkám, takže vlastní dodané značky `templates/podcast_en.txt` dovednosti `[SECTION:content-1..3]` jsou tiše vynechány — můj první suchý běh hlásil "Detected 5 sections" a složil tři bloky obsahu do `overview`; přejmenování na `content_1` dalo správných "Detected 8 sections". SKILL.md také odkazuje na `CLAUDE.md` ("full command reference") a `examples/`, obojí HTTP 404 v této kopii. Žádné bezpečnostní problémy: žádné curl|sh, žádné base64 bloby, žádná exfiltrace tajemství, cesty používají `${SKILL_DIR}`. outputMeasured=false, protože inzerovaný výsledek — 4K MP4 — potřebuje scaffoldovaný Remotion projekt, npm install a ffmpeg render, který jsem nenastavil; měřena byla pouze fáze skriptování. Poznámka: toto je vendored kopie upstream Agents365-ai/video-podcast-maker uvnitř čínského repozitáře lokální vyhledávací aplikace.

Testováno: 2026-07-21 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/dtsola/xiaoyaosearch /tmp/xiaoyaosearch
cd /tmp/xiaoyaosearch
mkdir -p ~/.claude/skills
cp -R /tmp/xiaoyaosearch/.claude/skills/video-podcast-maker ~/.claude/skills/
cp -R /tmp/xiaoyaosearch/.claude/skills/remotion-best-practices ~/.claude/skills/   # hard dependency
brew install ffmpeg node                                    # macOS; node + npx + ffmpeg + python3 required
pip install -r ~/.claude/skills/video-podcast-maker/requirements.txt
python3 ~/.claude/skills/video-podcast-maker/scripts/check_prereqs.py   # expect: ALL_OK (backend=edge)
# You also need an existing Remotion project; videos land in videos/{name}/ inside it.
# Optional: set AZURE_SPEECH_KEY / OPENAI_API_KEY / etc. only if you switch off the free `edge` backend.

Příkazy a ukázkové prompty

  • /video-podcast-makerTéma na 4K video podcast: výzkum, skript, TTS, Remotion render, BGM mix

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Make a video podcast about this topic
  • Learn this reference video's visual style and apply it
  • Generate a video podcast with background music