VLM Run CLI

Controla la CLI vlmrun para OCR, extraer y analizar imágenes/video/PDFs

Por vlm-run · vlm-run/skills

Funciona con configuración ★ 8.0/10

VLM Run CLI — Controla la CLI vlmrun para OCR, extraer y analizar imágenes/video/PDFs

Qué hace

Enseña al agente a llamar a la CLI vlmrun para enviar imágenes, video y documentos al modelo visual Orion de VLM Run para OCR, detección de objetos, extracción, resumen y generación de imágenes/video. Se activa con solicitudes como 'extract text from this image', 'summarize this video' o 'parse this invoice PDF'.

Informe de la prueba

La habilidad es una documentación envolvente precisa para la CLI vlmrun real: pip install 'vlmrun[cli]' tuvo éxito y cada subcomando documentado (chat, generate, files, hub, models, artifacts) y flag existe exactamente como describe el SKILL.md. La salida no pudo medirse contra una línea base porque `vlmrun chat` en una imagen de prueba devuelve 'API key not found' y exige una clave de app.vlm.run -- un muro de registro/pago, por lo que no se produjo ningún resultado real de IA visual. No hay exageración de nada verificable, pero cada tarea en la habilidad necesita una cuenta de VLM Run financiada antes de que haga algo.

Probado el: 2026-07-25 · Claude Code 2.x (agent harness)

Instalación

git clone https://github.com/vlm-run/skills
mkdir -p ~/.claude/skills
cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill

Comandos y prompts de ejemplo

  • /vlmrun-cli-skillControla la CLI vlmrun para OCR, extraer y analizar imágenes/video/PDFs

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Extract text from this scanned invoice image
  • Summarize what's happening in this uploaded video file
  • Parse this receipt PDF and pull out the line items