Video Podcast Maker

Da argomento a video podcast 4K: ricerca, script, TTS, rendering Remotion, mix BGM

di dtsola · dtsola/xiaoyaosearch

Richiede configurazione ★ 7.2/10

Video Podcast Maker — Da argomento a video podcast 4K: ricerca, script, TTS, rendering Remotion, mix BGM

Cosa fa

Una pipeline in 15 passaggi che trasforma un argomento in un video podcast finito: ricerca web, uno script di narrazione sezionato, audio TTS con timing.json e SRT, una composizione Remotion renderizzata a 3840x2160, mixaggio di musica di sottofondo FFmpeg, miniature e metadati di pubblicazione specifici della piattaforma. Si attiva quando si chiede un video podcast, un video esplicativo o un video di conoscenza Bilibili/YouTube su un dato argomento, o si chiede di imparare lo stile visivo da un video o un'immagine di riferimento. Supporta sette backend TTS (Edge TTS gratuito per impostazione predefinita, più Azure, Doubao, CosyVoice, ElevenLabs, OpenAI, Google) e output zh-CN/en-US con correzione polifonica cinese.

Rapporto di test

Ho scaricato gli script reali della skill e li ho eseguiti. `check_prereqs.py` ha stampato `ALL_OK (backend=edge)` e `migrate_prefs.py --dry-run` ha stampato `[dry-run] Would create user_prefs.json at v1.6 from template`, quindi la parte Python funziona genuinamente. Per l'output ho scritto uno script di base "why HTTP/3 uses QUIC" prima di leggere il corpo (4 scene, 60s, markdown ad-hoc, nessun formato leggibile dalla macchina), quindi ho seguito references/workflow-script.md Passaggi 1-4 e ho ottenuto topic_definition.md più un podcast.txt con 8 blocchi `[SECTION:xxx]`, livelli di densità mappati alla libreria di componenti nominata (ComparisonCard/FlowChart/DataBar), e l'outro piattaforma+lingua dalla tabella CTA della skill; il `generate_tts.py --dry-run` della skill stessa l'ha misurato a 197s / 5971 frame, confermando il target di 3-7min in modalità automatica. Questo è un miglioramento chiaro e concreto rispetto alla baseline. BUG CONFERMATO: `scripts/tts/sections.py` usa `r'\[SECTION:(\w+)\]'`, che non corrisponde ai trattini, quindi i marcatori `[SECTION:content-1..3]` del `templates/podcast_en.txt` della skill stessa vengono silenziosamente ignorati — la mia prima esecuzione a secco ha riportato "Detected 5 sections" e ha piegato tre blocchi di contenuto in `overview`; la ridenominazione in `content_1` ha dato il corretto "Detected 8 sections". SKILL.md punta anche a `CLAUDE.md` ("full command reference") e `examples/`, entrambi HTTP 404 in questa copia. Nessun problema di sicurezza: nessun curl|sh, nessun blob base64, nessuna esfiltrazione di segreti, i percorsi usano `${SKILL_DIR}`. outputMeasured=false perché il deliverable pubblicizzato — un MP4 4K — richiede un progetto Remotion scaffoldato, npm install e un rendering ffmpeg che non ho configurato; è stata misurata solo la fase di scripting. Nota: questa è una copia venduta di Agents365-ai/video-podcast-maker upstream all'interno di un repo di app di ricerca locale cinese.

Testato il: 2026-07-21 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/dtsola/xiaoyaosearch /tmp/xiaoyaosearch
cd /tmp/xiaoyaosearch
mkdir -p ~/.claude/skills
cp -R /tmp/xiaoyaosearch/.claude/skills/video-podcast-maker ~/.claude/skills/
cp -R /tmp/xiaoyaosearch/.claude/skills/remotion-best-practices ~/.claude/skills/   # hard dependency
brew install ffmpeg node                                    # macOS; node + npx + ffmpeg + python3 required
pip install -r ~/.claude/skills/video-podcast-maker/requirements.txt
python3 ~/.claude/skills/video-podcast-maker/scripts/check_prereqs.py   # expect: ALL_OK (backend=edge)
# You also need an existing Remotion project; videos land in videos/{name}/ inside it.
# Optional: set AZURE_SPEECH_KEY / OPENAI_API_KEY / etc. only if you switch off the free `edge` backend.

Comandi e prompt di esempio

  • /video-podcast-makerDa argomento a video podcast 4K: ricerca, script, TTS, rendering Remotion, mix BGM

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Make a video podcast about this topic
  • Learn this reference video's visual style and apply it
  • Generate a video podcast with background music