VLM Run CLI

Driv vlmrun CLI for å OCR, ekstrahere og analysere bilder/video/PDFer

av vlm-run · vlm-run/skills

Krever oppsett ★ 8.0/10

VLM Run CLI — Driv vlmrun CLI for å OCR, ekstrahere og analysere bilder/video/PDFer

Hva den gjør

Lærer agenten å kalle vlmrun CLI for å sende bilder, video og dokumenter til VLM Runs Orion visuelle modell for OCR, objektgjenkjenning, ekstraksjon, oppsummering og bilde-/videogenerering. Utløses ved forespørsler som 'extract text from this image', 'summarize this video', eller 'parse this invoice PDF'.

Testrapport

Ferdigheten er en nøyaktig wrapper doc for den virkelige vlmrun CLI: pip install 'vlmrun[cli]' lyktes, og hver dokumenterte underkommando (chat, generate, files, hub, models, artifacts) og flagg eksisterer nøyaktig som SKILL.md beskriver. Utdata kunne ikke måles mot en baseline fordi `vlmrun chat` på et testbilde returnerer 'API key not found' og krever en nøkkel fra app.vlm.run – en registrerings-/betalingsvegg, så ingen reelle visuelle-AI-resultater ble produsert. Ingen oversalg av noe sjekkbart, men hver oppgave i ferdigheten krever en finansiert VLM Run-konto før den gjør noe.

Testet på: 2026-07-25 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/vlm-run/skills
mkdir -p ~/.claude/skills
cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill

Kommandoer og eksempelprompter

  • /vlmrun-cli-skillDriv vlmrun CLI for å OCR, ekstrahere og analysere bilder/video/PDFer

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Extract text from this scanned invoice image
  • Summarize what's happening in this uploaded video file
  • Parse this receipt PDF and pull out the line items