VLM Run CLI

Pilote le CLI vlmrun pour OCR, extraire et analyser des images/vidéos/PDFs

par vlm-run · vlm-run/skills

Fonctionne avec configuration ★ 8.0/10

VLM Run CLI — Pilote le CLI vlmrun pour OCR, extraire et analyser des images/vidéos/PDFs

Ce que fait

Apprend à l'agent à appeler le CLI vlmrun pour envoyer des images, des vidéos et des documents au modèle visuel Orion de VLM Run pour l'OCR, la détection d'objets, l'extraction, la synthèse et la génération d'images/vidéos. Se déclenche sur des requêtes comme 'extract text from this image', 'summarize this video', ou 'parse this invoice PDF'.

Rapport de test

La compétence est une documentation wrapper précise pour le vrai CLI vlmrun : pip install 'vlmrun[cli]' a réussi et chaque sous-commande documentée (chat, generate, files, hub, models, artifacts) et flag existe exactement comme décrit dans le SKILL.md. La sortie n'a pas pu être mesurée par rapport à une base de référence car `vlmrun chat` sur une image de test renvoie 'API key not found' et exige une clé de app.vlm.run -- un mur d'inscription/payant, donc aucun résultat réel d'IA visuelle n'a été produit. Pas de surestimation de quoi que ce soit de vérifiable, mais chaque tâche de la compétence nécessite un compte VLM Run financé avant de faire quoi que ce soit.

Testé le: 2026-07-25 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/vlm-run/skills
mkdir -p ~/.claude/skills
cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill

Commandes et exemples de prompts

  • /vlmrun-cli-skillPilote le CLI vlmrun pour OCR, extraire et analyser des images/vidéos/PDFs

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Extract text from this scanned invoice image
  • Summarize what's happening in this uploaded video file
  • Parse this receipt PDF and pull out the line items