VLM Run CLI
Styr vlmrun CLI'en til OCR, udtræk og analyser billeder/video/PDF'er
Virker med opsætning
Hvad det gør
Lærer agenten at kalde vlmrun CLI'en for at sende billeder, video og dokumenter til VLM Runs Orion visuelle model til OCR, objektgenkendelse, udtræk, opsummering og billed-/videogenerering. Udløses ved anmodninger som 'extract text from this image', 'summarize this video' eller 'parse this invoice PDF'.
Testrapport
Skill'en er en nøjagtig wrapper-dokumentation for den ægte vlmrun CLI: pip install 'vlmrun[cli]' lykkedes, og hver dokumenteret underkommando (chat, generate, files, hub, models, artifacts) og flag eksisterer præcis som SKILL.md beskriver. Output kunne ikke måles mod en baseline, fordi `vlmrun chat` på et testbillede returnerer 'API key not found' og kræver en nøgle fra app.vlm.run – en tilmeldings-/betalingsmur, så intet reelt visuelt-AI-resultat blev produceret. Ingen oversalg af noget kontrollerbart, men hver opgave i skill'en kræver en finansieret VLM Run-konto, før den gør noget.
Testet: 2026-07-25 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/vlm-run/skills mkdir -p ~/.claude/skills cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill
Kommandoer og eksempelprompter
/vlmrun-cli-skillStyr vlmrun CLI'en til OCR, udtræk og analyser billeder/video/PDF'er
Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):
Extract text from this scanned invoice imageSummarize what's happening in this uploaded video fileParse this receipt PDF and pull out the line items