VLM Run CLI

Styr vlmrun CLI'en til OCR, udtræk og analyser billeder/video/PDF'er

Af vlm-run · vlm-run/skills

Virker med opsætning ★ 8.0/10

VLM Run CLI — Styr vlmrun CLI'en til OCR, udtræk og analyser billeder/video/PDF'er

Hvad det gør

Lærer agenten at kalde vlmrun CLI'en for at sende billeder, video og dokumenter til VLM Runs Orion visuelle model til OCR, objektgenkendelse, udtræk, opsummering og billed-/videogenerering. Udløses ved anmodninger som 'extract text from this image', 'summarize this video' eller 'parse this invoice PDF'.

Testrapport

Skill'en er en nøjagtig wrapper-dokumentation for den ægte vlmrun CLI: pip install 'vlmrun[cli]' lykkedes, og hver dokumenteret underkommando (chat, generate, files, hub, models, artifacts) og flag eksisterer præcis som SKILL.md beskriver. Output kunne ikke måles mod en baseline, fordi `vlmrun chat` på et testbillede returnerer 'API key not found' og kræver en nøgle fra app.vlm.run – en tilmeldings-/betalingsmur, så intet reelt visuelt-AI-resultat blev produceret. Ingen oversalg af noget kontrollerbart, men hver opgave i skill'en kræver en finansieret VLM Run-konto, før den gør noget.

Testet: 2026-07-25 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/vlm-run/skills
mkdir -p ~/.claude/skills
cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill

Kommandoer og eksempelprompter

  • /vlmrun-cli-skillStyr vlmrun CLI'en til OCR, udtræk og analyser billeder/video/PDF'er

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Extract text from this scanned invoice image
  • Summarize what's happening in this uploaded video file
  • Parse this receipt PDF and pull out the line items