VLM Run CLI
Sterowanie CLI vlmrun do OCR, ekstrakcji i analizy obrazów/wideo/PDF
Działa po konfiguracji
Co robi ten skill
Uczy agenta wywoływania CLI vlmrun do wysyłania obrazów, wideo i dokumentów do wizualnego modelu Orion VLM Run w celu OCR, wykrywania obiektów, ekstrakcji, podsumowywania oraz generowania obrazów/wideo. Uruchamia się na żądania takie jak 'extract text from this image', 'summarize this video' lub 'parse this invoice PDF'.
Raport z testu
Umiejętność jest dokładną dokumentacją opakowującą dla rzeczywistego CLI vlmrun: pip install 'vlmrun[cli]' zakończyło się sukcesem, a każda udokumentowana podkomenda (chat, generate, files, hub, models, artifacts) i flaga istnieją dokładnie tak, jak opisano w SKILL.md. Wynik nie mógł być zmierzony w stosunku do bazowej wersji, ponieważ `vlmrun chat` na obrazie testowym zwraca 'API key not found' i wymaga klucza z app.vlm.run — ściana rejestracji/płatności, więc nie uzyskano rzeczywistego wizualnego wyniku AI. Brak przesadnego marketingu w czymkolwiek, co można sprawdzić, ale każde zadanie w umiejętności wymaga opłaconego konta VLM Run, zanim cokolwiek zrobi.
Testowano: 2026-07-25 · Claude Code 2.x (agent harness)
Instalacja
git clone https://github.com/vlm-run/skills mkdir -p ~/.claude/skills cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill
Komendy i przykładowe prompty
/vlmrun-cli-skillSterowanie CLI vlmrun do OCR, ekstrakcji i analizy obrazów/wideo/PDF
Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):
Extract text from this scanned invoice imageSummarize what's happening in this uploaded video fileParse this receipt PDF and pull out the line items