Document Extraction (ADE)
Parsing di PDF/immagini/fogli di calcolo senza template in Markdown+JSON strutturato con estrazione di schema e bounding box.
Promosso
Cosa fa
Incapsula l'API/SDK Agentic Document Extraction (ADE) di LandingAI per analizzare PDF, immagini, fogli di calcolo e presentazioni in Markdown strutturato con grounding per chunk, quindi estrarre campi specifici tramite uno JSON Schema o un modello Pydantic. Copre anche la classificazione e la suddivisione di lotti di documenti misti, la generazione di un indice e lavori asincroni per file di grandi dimensioni. Si attiva su estrazione basata su schema, classificazione di pagine, suddivisione di documenti, generazione di TOC o qualsiasi menzione di bounding boxes/grounding/posizioni di parole.
Rapporto di test
Progettato due volte lo stesso compito di estrazione di campi da fattura: la baseline ha raggiunto l'OCR + regex/LLM guesswork, il percorso Pydantic-to-JSON-Schema + client.extract() della skill restituisce i campi più la tracciabilità dei chunk per campo e i punteggi di confidenza out of the box.
Testato il: 2026-07-14 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/landing-ai/ade-document-processing-skills cd ade-document-processing-skills mkdir -p ~/.claude/skills cp -r plugins/ade-document-processing/skills/document-extraction ~/.claude/skills/document-extraction
Comandi e prompt di esempio
/document-extractionParsing di PDF/immagini/fogli di calcolo senza template in Markdown+JSON strutturato con estrazione di schema e bounding box.
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Extract the invoice number, date, and total from this PDFSplit this folder of mixed invoices and receipts by typePull the exact text location for each clause in this contract