VLM Run CLI

Sterowanie CLI vlmrun do OCR, ekstrakcji i analizy obrazów/wideo/PDF

Autor: vlm-run · vlm-run/skills

Działa po konfiguracji ★ 8.0/10

VLM Run CLI — Sterowanie CLI vlmrun do OCR, ekstrakcji i analizy obrazów/wideo/PDF

Co robi ten skill

Uczy agenta wywoływania CLI vlmrun do wysyłania obrazów, wideo i dokumentów do wizualnego modelu Orion VLM Run w celu OCR, wykrywania obiektów, ekstrakcji, podsumowywania oraz generowania obrazów/wideo. Uruchamia się na żądania takie jak 'extract text from this image', 'summarize this video' lub 'parse this invoice PDF'.

Raport z testu

Umiejętność jest dokładną dokumentacją opakowującą dla rzeczywistego CLI vlmrun: pip install 'vlmrun[cli]' zakończyło się sukcesem, a każda udokumentowana podkomenda (chat, generate, files, hub, models, artifacts) i flaga istnieją dokładnie tak, jak opisano w SKILL.md. Wynik nie mógł być zmierzony w stosunku do bazowej wersji, ponieważ `vlmrun chat` na obrazie testowym zwraca 'API key not found' i wymaga klucza z app.vlm.run — ściana rejestracji/płatności, więc nie uzyskano rzeczywistego wizualnego wyniku AI. Brak przesadnego marketingu w czymkolwiek, co można sprawdzić, ale każde zadanie w umiejętności wymaga opłaconego konta VLM Run, zanim cokolwiek zrobi.

Testowano: 2026-07-25 · Claude Code 2.x (agent harness)

Instalacja

git clone https://github.com/vlm-run/skills
mkdir -p ~/.claude/skills
cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill

Komendy i przykładowe prompty

  • /vlmrun-cli-skillSterowanie CLI vlmrun do OCR, ekstrakcji i analizy obrazów/wideo/PDF

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Extract text from this scanned invoice image
  • Summarize what's happening in this uploaded video file
  • Parse this receipt PDF and pull out the line items