VLM Run CLI
Controla la CLI vlmrun para OCR, extraer y analizar imágenes/video/PDFs
Funciona con configuración
Qué hace
Enseña al agente a llamar a la CLI vlmrun para enviar imágenes, video y documentos al modelo visual Orion de VLM Run para OCR, detección de objetos, extracción, resumen y generación de imágenes/video. Se activa con solicitudes como 'extract text from this image', 'summarize this video' o 'parse this invoice PDF'.
Informe de la prueba
La habilidad es una documentación envolvente precisa para la CLI vlmrun real: pip install 'vlmrun[cli]' tuvo éxito y cada subcomando documentado (chat, generate, files, hub, models, artifacts) y flag existe exactamente como describe el SKILL.md. La salida no pudo medirse contra una línea base porque `vlmrun chat` en una imagen de prueba devuelve 'API key not found' y exige una clave de app.vlm.run -- un muro de registro/pago, por lo que no se produjo ningún resultado real de IA visual. No hay exageración de nada verificable, pero cada tarea en la habilidad necesita una cuenta de VLM Run financiada antes de que haga algo.
Probado el: 2026-07-25 · Claude Code 2.x (agent harness)
Instalación
git clone https://github.com/vlm-run/skills mkdir -p ~/.claude/skills cd skills && cp -r skills/vlmrun-cli-skill ~/.claude/skills/vlmrun-cli-skill
Comandos y prompts de ejemplo
/vlmrun-cli-skillControla la CLI vlmrun para OCR, extraer y analizar imágenes/video/PDFs
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Extract text from this scanned invoice imageSummarize what's happening in this uploaded video fileParse this receipt PDF and pull out the line items