AI Multimodal

Analýza zvuku/obrazu/videa/PDF s podporou Gemini + generování obrazu pomocí dávkových skriptů

od mrgoonie · mrgoonie/claudekit-skills

Funguje s nastavením ★ 7.2/10

AI Multimodal — Analýza zvuku/obrazu/videa/PDF s podporou Gemini + generování obrazu pomocí dávkových skriptů

Co umí

Obaluje multimodální API Google Gemini do tří Python dávkových skriptů pro přepis zvuku, analýzu obrázků/videa, extrakci strukturovaných dat z PDF a generování obrázků. Spouští se při práci s mediálními soubory, snímky obrazovky, extrakcí PDF nebo úkoly text-to-image. Vyžaduje instalaci google-genai SDK a GEMINI_API_KEY.

Testovací report

Načten strom repozitáře a raw SKILL.md: jedná se o jednu dovednost z ~40 v tomto monorepo, soběstačnou pod .claude/skills/ai-multimodal/. Ověřeny všechny tři odkazované skripty (gemini_batch_process.py, media_optimizer.py, document_converter.py) plus testy a requirements.txt; čtyři referenční dokumenty existují, ale references/document-extraction.md (odkazovaný v Reference Navigation) vrací 404. Bezpečnost čistá: skripty čtou GEMINI_API_KEY pouze z env/.env a volají oficiální google-genai SDK, žádné curl|sh/base64/exfiltration. SPUŠTĚNÍ (5/5): načetlo by se — „Přepiš toto MP3 s časovými razítky“, „Extrahuj tabulky z tohoto PDF jako JSON“, „Vygeneruj obrázek futuristického města při západu slunce, 16:9“; NENAČETLO by se — „Napiš blogový příspěvek o multimodálních AI trendech“, „Nastav mou GitHub Actions CI pipeline“. VÝSTUP: NENÍ měřen (není měřená ztráta) — runtime potřebuje google-genai SDK + živý Gemini API klíč, který nemohu zajistit, takže nebylo možné srovnání základního stavu s dovedností; hodnoceno 5 jako neměřený-neutrální. INSTALACE snížena kvůli závislosti na externím SDK+API klíči (inertní při samotné kopii) a jednom chybějícím referenčním dokumentu; DOKUMENTACE snížena kvůli tomuto mrtvému odkazu a neověřitelným tvrzením o kapacitě Gemini.

Testováno: 2026-07-20 · Claude Code 2.x (agent harness)

Instalace

Copy .claude/skills/ai-multimodal/ into your project's .claude/skills/, then `pip install google-genai python-dotenv pillow` and set GEMINI_API_KEY (env or .env). Get a key at https://aistudio.google.com/apikey.

Příkazy a ukázkové prompty

  • /ai-multimodalAnalýza zvuku/obrazu/videa/PDF s podporou Gemini + generování obrazu pomocí dávkových skriptů

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Transcribe and summarize this audio recording
  • Extract tables from this scanned PDF
  • Detect objects and answer questions about this image