Document Extraction (ADE)

Parsování PDF/obrázků/tabulek bez šablon do strukturovaného Markdown+JSON s extrakcí schématu a ohraničujícími rámečky.

od landing-ai · landing-ai/ade-document-processing-skills

Otestováno · Funguje ★ 9.2/10

Document Extraction (ADE) — Parsování PDF/obrázků/tabulek bez šablon do strukturovaného Markdown+JSON s extrakcí schématu a ohraničujícími rámečky.

Co umí

Obálka pro LandingAI's Agentic Document Extraction (ADE) API/SDK pro parsování PDF, obrázků, tabulek a prezentací do strukturovaného Markdownu s uzemněním na úrovni chunků, a následnou extrakci specifických polí pomocí JSON Schema nebo Pydantic modelu. Pokrývá také klasifikaci a rozdělování smíšených dávek dokumentů, generování obsahu a asynchronní úlohy pro velké soubory. Spouští se na základě extrakce založené na schématu, klasifikace stránek, rozdělování dokumentů, generování TOC nebo jakékoli zmínky o ohraničujících rámečcích/uzemnění/umístění slov.

Testovací report

Stejný úkol extrakce polí z faktury byl navržen dvakrát: základní řešení dosáhlo OCR + odhadů regex/LLM, cesta skillu Pydantic-to-JSON-Schema + client.extract() vrací pole plus sledovatelnost chunků pro každé pole a skóre spolehlivosti ihned po spuštění.

Testováno: 2026-07-14 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/landing-ai/ade-document-processing-skills
cd ade-document-processing-skills
mkdir -p ~/.claude/skills
cp -r plugins/ade-document-processing/skills/document-extraction ~/.claude/skills/document-extraction

Příkazy a ukázkové prompty

  • /document-extractionParsování PDF/obrázků/tabulek bez šablon do strukturovaného Markdown+JSON s extrakcí schématu a ohraničujícími rámečky.

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Extract the invoice number, date, and total from this PDF
  • Split this folder of mixed invoices and receipts by type
  • Pull the exact text location for each clause in this contract