VLM Run CLI

Driv vlmrun CLI för att OCR:a, extrahera och analysera bilder/video/PDF:er

av vlm-run · vlm-run/skills

Fungerar med konfiguration ★ 8.0/10

VLM Run CLI — Driv vlmrun CLI för att OCR:a, extrahera och analysera bilder/video/PDF:er

Vad den gör

Lär agenten att anropa vlmrun CLI för att skicka bilder, video och dokument till VLM Runs Orion visuella modell för OCR, objektdetektering, extraktion, sammanfattning och bild-/videogenerering. Utlöses vid förfrågningar som 'extract text from this image', 'summarize this video' eller 'parse this invoice PDF'.

Testrapport

Färdigheten är en korrekt omslagsdokumentation för den verkliga vlmrun CLI: pip install 'vlmrun[cli]' lyckades och varje dokumenterat underkommando (chat, generate, files, hub, models, artifacts) och flagga existerar exakt som SKILL.md beskriver. Utdata kunde inte mätas mot en baslinje eftersom `vlmrun chat` på en testbild returnerar 'API key not found' och kräver en nyckel från app.vlm.run – en registrerings-/betalvägg, så inget verkligt visuellt AI-resultat producerades. Ingen överförsäljning av något kontrollerbart, men varje uppgift i färdigheten kräver ett finansierat VLM Run-konto innan den gör något.

Testad: 2026-07-25 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/vlm-run/skills
mkdir -p ~/.claude/skills
cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill

Kommandon och exempelprompter

  • /vlmrun-cli-skillDriv vlmrun CLI för att OCR:a, extrahera och analysera bilder/video/PDF:er

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Extract text from this scanned invoice image
  • Summarize what's happening in this uploaded video file
  • Parse this receipt PDF and pull out the line items