Video Podcast Maker
Tema a video podcast 4K: investigación, guion, TTS, renderizado Remotion, mezcla BGM
Funciona con configuración
Qué hace
Un pipeline de 15 pasos que convierte un tema en un video podcast terminado: investigación web, un guion de narración seccionado, audio TTS con timing.json y SRT, una composición Remotion renderizada a 3840x2160, mezcla de música de fondo con FFmpeg, miniaturas y metadatos de publicación específicos de la plataforma. Se activa cuando se solicita un video podcast, video explicativo o video de conocimiento para Bilibili/YouTube sobre un tema dado, o se le pide que aprenda un estilo visual de un video o imagen de referencia. Admite siete backends TTS (Edge TTS gratuito por defecto, más Azure, Doubao, CosyVoice, ElevenLabs, OpenAI, Google) y salida zh-CN/en-US con corrección de polifonía china.
Informe de la prueba
Descargué los scripts reales de la habilidad y los ejecuté. `check_prereqs.py` imprimió `ALL_OK (backend=edge)` y `migrate_prefs.py --dry-run` imprimió `[dry-run] Would create user_prefs.json at v1.6 from template`, por lo que el lado Python funciona genuinamente. Para la salida, escribí un script de línea base "why HTTP/3 uses QUIC" antes de leer el cuerpo (4 escenas, 60s, markdown ad-hoc, sin formato legible por máquina), luego seguí los Pasos 1-4 de references/workflow-script.md y obtuve topic_definition.md más un podcast.txt con 8 bloques `[SECTION:xxx]`, niveles de densidad mapeados a la biblioteca de componentes nombrada (ComparisonCard/FlowChart/DataBar), y el outro de plataforma+idioma de la tabla CTA de la habilidad; el propio `generate_tts.py --dry-run` de la habilidad lo midió en 197s / 5971 frames, confirmando el objetivo de modo automático de 3-7min. Eso es una mejora clara y concreta sobre la línea base. ERROR CONFIRMADO: `scripts/tts/sections.py` usa `r'\[SECTION:(\w+)\]'`, que no coincide con guiones, por lo que los propios marcadores `[SECTION:content-1..3]` de `templates/podcast_en.txt` de la habilidad se eliminan silenciosamente — mi primera ejecución en seco informó "Detected 5 sections" y plegó tres bloques de contenido en `overview`; renombrar a `content_1` dio el correcto "Detected 8 sections". SKILL.md también apunta a `CLAUDE.md` ("full command reference") y `examples/`, ambos HTTP 404 en esta copia. No hay problemas de seguridad: no curl|sh, no blobs base64, no exfiltración de secretos, las rutas usan `${SKILL_DIR}`. outputMeasured=false porque el entregable anunciado — un MP4 4K — necesita un proyecto Remotion estructurado, npm install y un renderizado ffmpeg que no configuré; solo se midió la fase de scripting. Tenga en cuenta que esta es una copia vendida del upstream Agents365-ai/video-podcast-maker dentro de un repositorio de aplicación de búsqueda local china.
Probado el: 2026-07-21 · Claude Code 2.x (agent harness)
Instalación
git clone https://github.com/dtsola/xiaoyaosearch /tmp/xiaoyaosearch
cd /tmp/xiaoyaosearch
mkdir -p ~/.claude/skills
cp -R /tmp/xiaoyaosearch/.claude/skills/video-podcast-maker ~/.claude/skills/
cp -R /tmp/xiaoyaosearch/.claude/skills/remotion-best-practices ~/.claude/skills/ # hard dependency
brew install ffmpeg node # macOS; node + npx + ffmpeg + python3 required
pip install -r ~/.claude/skills/video-podcast-maker/requirements.txt
python3 ~/.claude/skills/video-podcast-maker/scripts/check_prereqs.py # expect: ALL_OK (backend=edge)
# You also need an existing Remotion project; videos land in videos/{name}/ inside it.
# Optional: set AZURE_SPEECH_KEY / OPENAI_API_KEY / etc. only if you switch off the free `edge` backend. Comandos y prompts de ejemplo
/video-podcast-makerTema a video podcast 4K: investigación, guion, TTS, renderizado Remotion, mezcla BGM
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Make a video podcast about this topicLearn this reference video's visual style and apply itGenerate a video podcast with background music