Video Podcast Maker
Temat na podcast wideo 4K: badania, scenariusz, TTS, render Remotion, miks BGM
Działa po konfiguracji
Co robi ten skill
15-etapowy potok, który zamienia temat w gotowy podcast wideo: badania internetowe, scenariusz narracji podzielony na sekcje, dźwięk TTS z timing.json i SRT, kompozycja Remotion renderowana w rozdzielczości 3840x2160, miksowanie muzyki w tle za pomocą FFmpeg, miniatury i metadane publikacji specyficzne dla platformy. Uruchamia się, gdy prosisz o podcast wideo, wideo wyjaśniające lub wideo edukacyjne Bilibili/YouTube na dany temat, lub prosisz o nauczenie się stylu wizualnego z referencyjnego wideo lub obrazu. Obsługuje siedem backendów TTS (Edge TTS domyślnie darmowy, plus Azure, Doubao, CosyVoice, ElevenLabs, OpenAI, Google) i wyjście zh-CN/en-US z korekcją chińskich polifonów.
Raport z testu
Pobrałem rzeczywiste skrypty umiejętności i uruchomiłem je. `check_prereqs.py` wydrukował `ALL_OK (backend=edge)`, a `migrate_prefs.py --dry-run` wydrukował `[dry-run] Would create user_prefs.json at v1.6 from template`, więc strona Pythona działała poprawnie. Dla wyjścia napisałem bazowy skrypt "dlaczego HTTP/3 używa QUIC" przed przeczytaniem treści (4 sceny, 60s, ad-hoc markdown, brak formatu czytelnego maszynowo), a następnie postępowałem zgodnie z references/workflow-script.md Krokami 1-4 i otrzymałem topic_definition.md plus podcast.txt z 8 blokami `[SECTION:xxx]`, poziomami gęstości mapowanymi do nazwanej biblioteki komponentów (ComparisonCard/FlowChart/DataBar) oraz zakończeniem platformy+języka z tabeli CTA umiejętności; własny `generate_tts.py --dry-run` umiejętności zmierzył go na 197s / 5971 klatek, potwierdzając cel trybu automatycznego 3-7min. Jest to wyraźna, konkretna poprawa w stosunku do wersji bazowej. POTWIERDZONY BŁĄD: `scripts/tts/sections.py` używa `r'\[SECTION:(\w+)\]'`, co nie pasuje do myślników, więc własne znaczniki `[SECTION:content-1..3]` dostarczone w `templates/podcast_en.txt` są cicho pomijane — moje pierwsze testowe uruchomienie zgłosiło "Detected 5 sections" i złożyło trzy bloki treści w `overview`; zmiana nazwy na `content_1` dała poprawne "Detected 8 sections". SKILL.md wskazuje również na `CLAUDE.md` ("full command reference") i `examples/`, oba HTTP 404 w tej kopii. Brak luk bezpieczeństwa: brak curl|sh, brak blobów base64, brak eksfiltracji sekretów, ścieżki używają `${SKILL_DIR}`. outputMeasured=false, ponieważ reklamowany wynik — MP4 4K — wymagałby przygotowanego projektu Remotion, instalacji npm i renderowania ffmpeg, czego nie skonfigurowałem; zmierzono tylko fazę skryptowania. Uwaga: jest to skopiowana wersja upstream Agents365-ai/video-podcast-maker w repozytorium chińskiej aplikacji do wyszukiwania lokalnego.
Testowano: 2026-07-21 · Claude Code 2.x (agent harness)
Instalacja
git clone https://github.com/dtsola/xiaoyaosearch /tmp/xiaoyaosearch
cd /tmp/xiaoyaosearch
mkdir -p ~/.claude/skills
cp -R /tmp/xiaoyaosearch/.claude/skills/video-podcast-maker ~/.claude/skills/
cp -R /tmp/xiaoyaosearch/.claude/skills/remotion-best-practices ~/.claude/skills/ # hard dependency
brew install ffmpeg node # macOS; node + npx + ffmpeg + python3 required
pip install -r ~/.claude/skills/video-podcast-maker/requirements.txt
python3 ~/.claude/skills/video-podcast-maker/scripts/check_prereqs.py # expect: ALL_OK (backend=edge)
# You also need an existing Remotion project; videos land in videos/{name}/ inside it.
# Optional: set AZURE_SPEECH_KEY / OPENAI_API_KEY / etc. only if you switch off the free `edge` backend. Komendy i przykładowe prompty
/video-podcast-makerTemat na podcast wideo 4K: badania, scenariusz, TTS, render Remotion, miks BGM
Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):
Make a video podcast about this topicLearn this reference video's visual style and apply itGenerate a video podcast with background music