Document Extraction (ADE)
Análisis de PDF/imagen/hoja de cálculo sin plantilla a Markdown+JSON estructurado con extracción de esquema y bounding boxes.
Probado · Funciona
Qué hace
Envuelve la API/SDK de Agentic Document Extraction (ADE) de LandingAI para analizar PDFs, imágenes, hojas de cálculo y presentaciones en Markdown estructurado con grounding por fragmento, luego extrae campos específicos a través de un JSON Schema o un modelo Pydantic. También cubre la clasificación y división de lotes de documentos mixtos, la generación de una tabla de contenido y trabajos asíncronos para archivos grandes. Se activa con la extracción basada en esquemas, clasificación de páginas, división de documentos, generación de TOC o cualquier mención de bounding boxes/grounding/ubicaciones de palabras.
Informe de la prueba
Diseñó la misma tarea de extracción de campos de factura dos veces: la línea base alcanzó OCR + conjeturas de regex/LLM, la ruta Pydantic-to-JSON-Schema + client.extract() de la skill devuelve los campos más la trazabilidad de fragmentos por campo y las puntuaciones de confianza de forma predeterminada.
Probado el: 2026-07-14 · Claude Code 2.x (agent harness)
Instalación
git clone https://github.com/landing-ai/ade-document-processing-skills cd ade-document-processing-skills mkdir -p ~/.claude/skills cp -r plugins/ade-document-processing/skills/document-extraction ~/.claude/skills/document-extraction
Comandos y prompts de ejemplo
/document-extractionAnálisis de PDF/imagen/hoja de cálculo sin plantilla a Markdown+JSON estructurado con extracción de esquema y bounding boxes.
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Extract the invoice number, date, and total from this PDFSplit this folder of mixed invoices and receipts by typePull the exact text location for each clause in this contract