Document Extraction (ADE)

Mal-fri PDF-/bilde-/regneark-parsing til strukturert Markdown+JSON med skjemaekstraksjon og bounding boxes.

av landing-ai · landing-ai/ade-document-processing-skills

Bestått ★ 9.2/10

Document Extraction (ADE) — Mal-fri PDF-/bilde-/regneark-parsing til strukturert Markdown+JSON med skjemaekstraksjon og bounding boxes.

Hva den gjør

Pakker LandingAIs Agentic Document Extraction (ADE) API/SDK for å parse PDF-er, bilder, regneark og presentasjoner til strukturert Markdown med per-chunk forankring, deretter trekke ut spesifikke felt via et JSON Schema eller Pydantic-modell. Dekker også klassifisering og splitting av blandede dokumentbatcher, generering av innholdsfortegnelse og asynkrone jobber for store filer. Utløses ved skjema-basert ekstraksjon, sideklassifisering, dokumentsplitting, TOC-generering, eller enhver omtale av bounding boxes/grounding/ordplasseringer.

Testrapport

Designet den samme faktura-felt-ekstraksjonsoppgaven to ganger: baseline oppnådd for OCR + regex/LLM-gjetting, ferdighetens Pydantic-til-JSON-Schema + client.extract()-sti returnerer feltene pluss per-felt chunk-sporbarhet og konfidenspoeng ut av boksen.

Testet på: 2026-07-14 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/landing-ai/ade-document-processing-skills
cd ade-document-processing-skills
mkdir -p ~/.claude/skills
cp -r plugins/ade-document-processing/skills/document-extraction ~/.claude/skills/document-extraction

Kommandoer og eksempelprompter

  • /document-extractionMal-fri PDF-/bilde-/regneark-parsing til strukturert Markdown+JSON med skjemaekstraksjon og bounding boxes.

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Extract the invoice number, date, and total from this PDF
  • Split this folder of mixed invoices and receipts by type
  • Pull the exact text location for each clause in this contract