VLM Run CLI

Guida la CLI vlmrun per OCR, estrarre e analizzare immagini/video/PDF

di vlm-run · vlm-run/skills

Richiede configurazione ★ 8.0/10

VLM Run CLI — Guida la CLI vlmrun per OCR, estrarre e analizzare immagini/video/PDF

Cosa fa

Insegna all'agente a chiamare la CLI vlmrun per inviare immagini, video e documenti al modello visivo Orion di VLM Run per OCR, rilevamento di oggetti, estrazione, riassunto e generazione di immagini/video. Si attiva su richieste come 'extract text from this image', 'summarize this video' o 'parse this invoice PDF'.

Rapporto di test

La skill è una documentazione wrapper accurata per la vera CLI vlmrun: pip install 'vlmrun[cli]' è riuscito e ogni sottocomando documentato (chat, generate, files, hub, models, artifacts) e flag esiste esattamente come descritto in SKILL.md. L'output non ha potuto essere misurato rispetto a una baseline perché `vlmrun chat` su un'immagine di test restituisce 'API key not found' e richiede una chiave da app.vlm.run -- un muro di registrazione/pagamento, quindi nessun risultato reale di AI visiva è stato prodotto. Nessuna esagerazione di nulla di verificabile, ma ogni compito nella skill richiede un account VLM Run finanziato prima di fare qualsiasi cosa.

Testato il: 2026-07-25 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/vlm-run/skills
mkdir -p ~/.claude/skills
cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill

Comandi e prompt di esempio

  • /vlmrun-cli-skillGuida la CLI vlmrun per OCR, estrarre e analizzare immagini/video/PDF

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Extract text from this scanned invoice image
  • Summarize what's happening in this uploaded video file
  • Parse this receipt PDF and pull out the line items