Document Extraction (ADE)
Analyse de PDF/images/feuilles de calcul sans modèle vers du Markdown+JSON structuré avec extraction de schéma et boîtes englobantes.
Testé · Fonctionne
Ce que fait
Encapsule l'API/SDK Agentic Document Extraction (ADE) de LandingAI pour analyser des PDF, images, feuilles de calcul et présentations en Markdown structuré avec ancrage par bloc, puis extraire des champs spécifiques via un JSON Schema ou un modèle Pydantic. Couvre également la classification et le fractionnement de lots de documents mixtes, la génération d'une table des matières et les tâches asynchrones pour les fichiers volumineux. Se déclenche sur l'extraction basée sur un schéma, la classification de pages, le fractionnement de documents, la génération de TOC, ou toute mention de bounding boxes/grounding/word locations.
Rapport de test
A conçu la même tâche d'extraction de champs de facture deux fois : la base de référence a utilisé OCR + regex/LLM, le chemin Pydantic-to-JSON-Schema + client.extract() de la compétence renvoie les champs ainsi que la traçabilité par bloc et les scores de confiance par champ, prêts à l'emploi.
Testé le: 2026-07-14 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/landing-ai/ade-document-processing-skills cd ade-document-processing-skills mkdir -p ~/.claude/skills cp -r plugins/ade-document-processing/skills/document-extraction ~/.claude/skills/document-extraction
Commandes et exemples de prompts
/document-extractionAnalyse de PDF/images/feuilles de calcul sans modèle vers du Markdown+JSON structuré avec extraction de schéma et boîtes englobantes.
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Extract the invoice number, date, and total from this PDFSplit this folder of mixed invoices and receipts by typePull the exact text location for each clause in this contract