VLM Run CLI
Guida la CLI vlmrun per OCR, estrarre e analizzare immagini/video/PDF
Richiede configurazione
Cosa fa
Insegna all'agente a chiamare la CLI vlmrun per inviare immagini, video e documenti al modello visivo Orion di VLM Run per OCR, rilevamento di oggetti, estrazione, riassunto e generazione di immagini/video. Si attiva su richieste come 'extract text from this image', 'summarize this video' o 'parse this invoice PDF'.
Rapporto di test
La skill è una documentazione wrapper accurata per la vera CLI vlmrun: pip install 'vlmrun[cli]' è riuscito e ogni sottocomando documentato (chat, generate, files, hub, models, artifacts) e flag esiste esattamente come descritto in SKILL.md. L'output non ha potuto essere misurato rispetto a una baseline perché `vlmrun chat` su un'immagine di test restituisce 'API key not found' e richiede una chiave da app.vlm.run -- un muro di registrazione/pagamento, quindi nessun risultato reale di AI visiva è stato prodotto. Nessuna esagerazione di nulla di verificabile, ma ogni compito nella skill richiede un account VLM Run finanziato prima di fare qualsiasi cosa.
Testato il: 2026-07-25 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/vlm-run/skills mkdir -p ~/.claude/skills cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill
Comandi e prompt di esempio
/vlmrun-cli-skillGuida la CLI vlmrun per OCR, estrarre e analizzare immagini/video/PDF
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Extract text from this scanned invoice imageSummarize what's happening in this uploaded video fileParse this receipt PDF and pull out the line items