VLM Run CLI
Steuert die vlmrun CLI zum OCR, Extrahieren und Analysieren von Bildern/Videos/PDFs
Funktioniert mit Setup
Was es kann
Bringt dem Agenten bei, die vlmrun CLI aufzurufen, um Bilder, Videos und Dokumente an VLM Runs visuelles Modell Orion für OCR, Objekterkennung, Extraktion, Zusammenfassung und Bild-/Videoerzeugung zu senden. Wird ausgelöst bei Anfragen wie 'extract text from this image', 'summarize this video' oder 'parse this invoice PDF'.
Testbericht
Der Skill ist eine genaue Wrapper-Dokumentation für die echte vlmrun CLI: pip install 'vlmrun[cli]' war erfolgreich und jeder dokumentierte Unterbefehl (chat, generate, files, hub, models, artifacts) und Flag existiert genau wie in der SKILL.md beschrieben. Die Ausgabe konnte nicht gegen eine Baseline gemessen werden, da `vlmrun chat` bei einem Testbild 'API key not found' zurückgibt und einen Schlüssel von app.vlm.run verlangt – eine Anmelde-/Bezahlschranke, sodass kein echtes visuelles KI-Ergebnis erzeugt wurde. Keine Übertreibung von überprüfbaren Dingen, aber jede Aufgabe im Skill benötigt ein finanziertes VLM Run-Konto, bevor sie etwas tut.
Getestet am: 2026-07-25 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/vlm-run/skills mkdir -p ~/.claude/skills cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill
Befehle & Beispiel-Prompts
/vlmrun-cli-skillSteuert die vlmrun CLI zum OCR, Extrahieren und Analysieren von Bildern/Videos/PDFs
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Extract text from this scanned invoice imageSummarize what's happening in this uploaded video fileParse this receipt PDF and pull out the line items