Document Extraction (ADE)

Skabelonfri PDF-/billede-/regneark-parsing til struktureret Markdown+JSON med skemaudtræk og bounding boxes.

Af landing-ai · landing-ai/ade-document-processing-skills

Testet · Virker ★ 9.2/10

Document Extraction (ADE) — Skabelonfri PDF-/billede-/regneark-parsing til struktureret Markdown+JSON med skemaudtræk og bounding boxes.

Hvad det gør

Indkapsler LandingAI's Agentic Document Extraction (ADE) API/SDK til at parse PDF'er, billeder, regneark og præsentationer til struktureret Markdown med per-chunk grounding, og derefter udtrække specifikke felter via et JSON Schema eller Pydantic-model. Dækker også klassificering og opdeling af blandede dokumentbatcher, generering af indholdsfortegnelse og asynkrone jobs for store filer. Udløses ved skemabaseret udtræk, sideklassificering, dokumentopdeling, TOC-generering eller enhver omtale af bounding boxes/grounding/ordplaceringer.

Testrapport

Designede den samme faktura-feltudtrækningsopgave to gange: baseline opnåede OCR + regex/LLM-gætteri, skillens Pydantic-til-JSON-Schema + client.extract()-sti returnerer felterne plus per-felt chunk-sporbarhed og konfidensscore ud af boksen.

Testet: 2026-07-14 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/landing-ai/ade-document-processing-skills
cd ade-document-processing-skills
mkdir -p ~/.claude/skills
cp -r plugins/ade-document-processing/skills/document-extraction ~/.claude/skills/document-extraction

Kommandoer og eksempelprompter

  • /document-extractionSkabelonfri PDF-/billede-/regneark-parsing til struktureret Markdown+JSON med skemaudtræk og bounding boxes.

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Extract the invoice number, date, and total from this PDF
  • Split this folder of mixed invoices and receipts by type
  • Pull the exact text location for each clause in this contract