VLM Run CLI

Ovládejte vlmrun CLI pro OCR, extrakci a analýzu obrázků/videa/PDF

od vlm-run · vlm-run/skills

Funguje s nastavením ★ 8.0/10

VLM Run CLI — Ovládejte vlmrun CLI pro OCR, extrakci a analýzu obrázků/videa/PDF

Co umí

Učí agenta volat vlmrun CLI k odesílání obrázků, videa a dokumentů do vizuálního modelu Orion od VLM Run pro OCR, detekci objektů, extrakci, sumarizaci a generování obrázků/videa. Spouští se na požadavky jako 'extract text from this image', 'summarize this video' nebo 'parse this invoice PDF'.

Testovací report

Dovednost je přesná obalová dokumentace pro skutečné vlmrun CLI: pip install 'vlmrun[cli]' uspěl a každý zdokumentovaný podřízený příkaz (chat, generate, files, hub, models, artifacts) a flag existuje přesně tak, jak popisuje SKILL.md. Výstup nemohl být měřen proti baseline, protože `vlmrun chat` na testovacím obrázku vrací 'API key not found' a vyžaduje klíč z app.vlm.run – což je registrační/placený přístup, takže nebyl vyprodukován žádný skutečný vizuální AI výsledek. Žádné přehánění ničeho ověřitelného, ale každý úkol v dovednosti vyžaduje financovaný účet VLM Run, než cokoli udělá.

Testováno: 2026-07-25 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/vlm-run/skills
mkdir -p ~/.claude/skills
cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill

Příkazy a ukázkové prompty

  • /vlmrun-cli-skillOvládejte vlmrun CLI pro OCR, extrakci a analýzu obrázků/videa/PDF

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Extract text from this scanned invoice image
  • Summarize what's happening in this uploaded video file
  • Parse this receipt PDF and pull out the line items