Document Extraction (ADE)
Skabelonfri PDF-/billede-/regneark-parsing til struktureret Markdown+JSON med skemaudtræk og bounding boxes.
Testet · Virker
Hvad det gør
Indkapsler LandingAI's Agentic Document Extraction (ADE) API/SDK til at parse PDF'er, billeder, regneark og præsentationer til struktureret Markdown med per-chunk grounding, og derefter udtrække specifikke felter via et JSON Schema eller Pydantic-model. Dækker også klassificering og opdeling af blandede dokumentbatcher, generering af indholdsfortegnelse og asynkrone jobs for store filer. Udløses ved skemabaseret udtræk, sideklassificering, dokumentopdeling, TOC-generering eller enhver omtale af bounding boxes/grounding/ordplaceringer.
Testrapport
Designede den samme faktura-feltudtrækningsopgave to gange: baseline opnåede OCR + regex/LLM-gætteri, skillens Pydantic-til-JSON-Schema + client.extract()-sti returnerer felterne plus per-felt chunk-sporbarhed og konfidensscore ud af boksen.
Testet: 2026-07-14 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/landing-ai/ade-document-processing-skills cd ade-document-processing-skills mkdir -p ~/.claude/skills cp -r plugins/ade-document-processing/skills/document-extraction ~/.claude/skills/document-extraction
Kommandoer og eksempelprompter
/document-extractionSkabelonfri PDF-/billede-/regneark-parsing til struktureret Markdown+JSON med skemaudtræk og bounding boxes.
Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):
Extract the invoice number, date, and total from this PDFSplit this folder of mixed invoices and receipts by typePull the exact text location for each clause in this contract