AI Multimodal
Analýza zvuku/obrazu/videa/PDF s podporou Gemini + generování obrazu pomocí dávkových skriptů
Funguje s nastavením
Co umí
Obaluje multimodální API Google Gemini do tří Python dávkových skriptů pro přepis zvuku, analýzu obrázků/videa, extrakci strukturovaných dat z PDF a generování obrázků. Spouští se při práci s mediálními soubory, snímky obrazovky, extrakcí PDF nebo úkoly text-to-image. Vyžaduje instalaci google-genai SDK a GEMINI_API_KEY.
Testovací report
Načten strom repozitáře a raw SKILL.md: jedná se o jednu dovednost z ~40 v tomto monorepo, soběstačnou pod .claude/skills/ai-multimodal/. Ověřeny všechny tři odkazované skripty (gemini_batch_process.py, media_optimizer.py, document_converter.py) plus testy a requirements.txt; čtyři referenční dokumenty existují, ale references/document-extraction.md (odkazovaný v Reference Navigation) vrací 404. Bezpečnost čistá: skripty čtou GEMINI_API_KEY pouze z env/.env a volají oficiální google-genai SDK, žádné curl|sh/base64/exfiltration. SPUŠTĚNÍ (5/5): načetlo by se — „Přepiš toto MP3 s časovými razítky“, „Extrahuj tabulky z tohoto PDF jako JSON“, „Vygeneruj obrázek futuristického města při západu slunce, 16:9“; NENAČETLO by se — „Napiš blogový příspěvek o multimodálních AI trendech“, „Nastav mou GitHub Actions CI pipeline“. VÝSTUP: NENÍ měřen (není měřená ztráta) — runtime potřebuje google-genai SDK + živý Gemini API klíč, který nemohu zajistit, takže nebylo možné srovnání základního stavu s dovedností; hodnoceno 5 jako neměřený-neutrální. INSTALACE snížena kvůli závislosti na externím SDK+API klíči (inertní při samotné kopii) a jednom chybějícím referenčním dokumentu; DOKUMENTACE snížena kvůli tomuto mrtvému odkazu a neověřitelným tvrzením o kapacitě Gemini.
Testováno: 2026-07-20 · Claude Code 2.x (agent harness)
Instalace
Copy .claude/skills/ai-multimodal/ into your project's .claude/skills/, then `pip install google-genai python-dotenv pillow` and set GEMINI_API_KEY (env or .env). Get a key at https://aistudio.google.com/apikey.
Příkazy a ukázkové prompty
/ai-multimodalAnalýza zvuku/obrazu/videa/PDF s podporou Gemini + generování obrazu pomocí dávkových skriptů
Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):
Transcribe and summarize this audio recordingExtract tables from this scanned PDFDetect objects and answer questions about this image