Video Podcast Maker
Sujet en podcast vidéo 4K : recherche, script, TTS, rendu Remotion, mix BGM
Fonctionne avec configuration
Ce que fait
Un pipeline en 15 étapes qui transforme un sujet en un podcast vidéo fini : recherche web, un script de narration sectionné, audio TTS avec timing.json et SRT, une composition Remotion rendue en 3840x2160, mixage de musique de fond FFmpeg, vignettes et métadonnées de publication spécifiques à la plateforme. Se déclenche lorsque vous demandez un podcast vidéo, une vidéo explicative ou une vidéo de connaissance Bilibili/YouTube sur un sujet donné, ou que vous lui demandez d'apprendre un style visuel à partir d'une vidéo ou d'une image de référence. Prend en charge sept backends TTS (Edge TTS gratuit par défaut, plus Azure, Doubao, CosyVoice, ElevenLabs, OpenAI, Google) et une sortie zh-CN/en-US avec correction des polyphones chinois.
Rapport de test
J'ai téléchargé les scripts réels de la compétence et les ai exécutés. `check_prereqs.py` a affiché `ALL_OK (backend=edge)` et `migrate_prefs.py --dry-run` a affiché `[dry-run] Would create user_prefs.json at v1.6 from template`, donc la partie Python fonctionne réellement. Pour la sortie, j'ai écrit un script de base "pourquoi HTTP/3 utilise QUIC" avant de lire le corps (4 scènes, 60s, markdown ad-hoc, pas de format lisible par machine), puis j'ai suivi les étapes 1 à 4 de references/workflow-script.md et j'ai obtenu topic_definition.md plus un podcast.txt avec 8 blocs `[SECTION:xxx]`, des niveaux de densité mappés à la bibliothèque de composants nommée (ComparisonCard/FlowChart/DataBar), et l'outro plateforme+langue du tableau CTA de la compétence ; le propre `generate_tts.py --dry-run` de la compétence l'a mesuré à 197s / 5971 images, confirmant la cible de 3-7min en mode automatique. C'est une amélioration claire et concrète par rapport à la base de référence. BUG CONFIRMÉ : `scripts/tts/sections.py` utilise `r'\[SECTION:(\w+)\]'`, qui ne correspond pas aux tirets, donc les propres marqueurs `[SECTION:content-1..3]` de `templates/podcast_en.txt` de la compétence sont silencieusement ignorés — ma première simulation a signalé "Detected 5 sections" et a regroupé trois blocs de contenu dans `overview` ; le renommage en `content_1` a donné le bon "Detected 8 sections". SKILL.md pointe également vers `CLAUDE.md` ("full command reference") et `examples/`, tous deux HTTP 404 dans cette copie. Pas de problèmes de sécurité : pas de curl|sh, pas de blobs base64, pas d'exfiltration de secrets, les chemins utilisent `${SKILL_DIR}`. outputMeasured=false car le livrable annoncé — un MP4 4K — nécessite un projet Remotion échafaudé, une installation npm et un rendu ffmpeg que je n'ai pas mis en place ; seule la phase de script a été mesurée. Notez qu'il s'agit d'une copie fournie de Agents365-ai/video-podcast-maker en amont dans un dépôt d'application de recherche locale chinoise.
Testé le: 2026-07-21 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/dtsola/xiaoyaosearch /tmp/xiaoyaosearch
cd /tmp/xiaoyaosearch
mkdir -p ~/.claude/skills
cp -R /tmp/xiaoyaosearch/.claude/skills/video-podcast-maker ~/.claude/skills/
cp -R /tmp/xiaoyaosearch/.claude/skills/remotion-best-practices ~/.claude/skills/ # hard dependency
brew install ffmpeg node # macOS; node + npx + ffmpeg + python3 required
pip install -r ~/.claude/skills/video-podcast-maker/requirements.txt
python3 ~/.claude/skills/video-podcast-maker/scripts/check_prereqs.py # expect: ALL_OK (backend=edge)
# You also need an existing Remotion project; videos land in videos/{name}/ inside it.
# Optional: set AZURE_SPEECH_KEY / OPENAI_API_KEY / etc. only if you switch off the free `edge` backend. Commandes et exemples de prompts
/video-podcast-makerSujet en podcast vidéo 4K : recherche, script, TTS, rendu Remotion, mix BGM
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Make a video podcast about this topicLearn this reference video's visual style and apply itGenerate a video podcast with background music