VLM Run CLI

Steuert die vlmrun CLI zum OCR, Extrahieren und Analysieren von Bildern/Videos/PDFs

von vlm-run · vlm-run/skills

Funktioniert mit Setup ★ 8.0/10

VLM Run CLI — Steuert die vlmrun CLI zum OCR, Extrahieren und Analysieren von Bildern/Videos/PDFs

Was es kann

Bringt dem Agenten bei, die vlmrun CLI aufzurufen, um Bilder, Videos und Dokumente an VLM Runs visuelles Modell Orion für OCR, Objekterkennung, Extraktion, Zusammenfassung und Bild-/Videoerzeugung zu senden. Wird ausgelöst bei Anfragen wie 'extract text from this image', 'summarize this video' oder 'parse this invoice PDF'.

Testbericht

Der Skill ist eine genaue Wrapper-Dokumentation für die echte vlmrun CLI: pip install 'vlmrun[cli]' war erfolgreich und jeder dokumentierte Unterbefehl (chat, generate, files, hub, models, artifacts) und Flag existiert genau wie in der SKILL.md beschrieben. Die Ausgabe konnte nicht gegen eine Baseline gemessen werden, da `vlmrun chat` bei einem Testbild 'API key not found' zurückgibt und einen Schlüssel von app.vlm.run verlangt – eine Anmelde-/Bezahlschranke, sodass kein echtes visuelles KI-Ergebnis erzeugt wurde. Keine Übertreibung von überprüfbaren Dingen, aber jede Aufgabe im Skill benötigt ein finanziertes VLM Run-Konto, bevor sie etwas tut.

Getestet am: 2026-07-25 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/vlm-run/skills
mkdir -p ~/.claude/skills
cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill

Befehle & Beispiel-Prompts

  • /vlmrun-cli-skillSteuert die vlmrun CLI zum OCR, Extrahieren und Analysieren von Bildern/Videos/PDFs

Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):

  • Extract text from this scanned invoice image
  • Summarize what's happening in this uploaded video file
  • Parse this receipt PDF and pull out the line items