VLM Run CLI
Driv vlmrun CLI för att OCR:a, extrahera och analysera bilder/video/PDF:er
Fungerar med konfiguration
Vad den gör
Lär agenten att anropa vlmrun CLI för att skicka bilder, video och dokument till VLM Runs Orion visuella modell för OCR, objektdetektering, extraktion, sammanfattning och bild-/videogenerering. Utlöses vid förfrågningar som 'extract text from this image', 'summarize this video' eller 'parse this invoice PDF'.
Testrapport
Färdigheten är en korrekt omslagsdokumentation för den verkliga vlmrun CLI: pip install 'vlmrun[cli]' lyckades och varje dokumenterat underkommando (chat, generate, files, hub, models, artifacts) och flagga existerar exakt som SKILL.md beskriver. Utdata kunde inte mätas mot en baslinje eftersom `vlmrun chat` på en testbild returnerar 'API key not found' och kräver en nyckel från app.vlm.run – en registrerings-/betalvägg, så inget verkligt visuellt AI-resultat producerades. Ingen överförsäljning av något kontrollerbart, men varje uppgift i färdigheten kräver ett finansierat VLM Run-konto innan den gör något.
Testad: 2026-07-25 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/vlm-run/skills mkdir -p ~/.claude/skills cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill
Kommandon och exempelprompter
/vlmrun-cli-skillDriv vlmrun CLI för att OCR:a, extrahera och analysera bilder/video/PDF:er
Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):
Extract text from this scanned invoice imageSummarize what's happening in this uploaded video fileParse this receipt PDF and pull out the line items