VLM Run CLI
Driv vlmrun CLI for å OCR, ekstrahere og analysere bilder/video/PDFer
Krever oppsett
Hva den gjør
Lærer agenten å kalle vlmrun CLI for å sende bilder, video og dokumenter til VLM Runs Orion visuelle modell for OCR, objektgjenkjenning, ekstraksjon, oppsummering og bilde-/videogenerering. Utløses ved forespørsler som 'extract text from this image', 'summarize this video', eller 'parse this invoice PDF'.
Testrapport
Ferdigheten er en nøyaktig wrapper doc for den virkelige vlmrun CLI: pip install 'vlmrun[cli]' lyktes, og hver dokumenterte underkommando (chat, generate, files, hub, models, artifacts) og flagg eksisterer nøyaktig som SKILL.md beskriver. Utdata kunne ikke måles mot en baseline fordi `vlmrun chat` på et testbilde returnerer 'API key not found' og krever en nøkkel fra app.vlm.run – en registrerings-/betalingsvegg, så ingen reelle visuelle-AI-resultater ble produsert. Ingen oversalg av noe sjekkbart, men hver oppgave i ferdigheten krever en finansiert VLM Run-konto før den gjør noe.
Testet på: 2026-07-25 · Claude Code 2.x (agent harness)
Installer
git clone https://github.com/vlm-run/skills mkdir -p ~/.claude/skills cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill
Kommandoer og eksempelprompter
/vlmrun-cli-skillDriv vlmrun CLI for å OCR, ekstrahere og analysere bilder/video/PDFer
Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):
Extract text from this scanned invoice imageSummarize what's happening in this uploaded video fileParse this receipt PDF and pull out the line items