Document Extraction (ADE)
Parsování PDF/obrázků/tabulek bez šablon do strukturovaného Markdown+JSON s extrakcí schématu a ohraničujícími rámečky.
Otestováno · Funguje
Co umí
Obálka pro LandingAI's Agentic Document Extraction (ADE) API/SDK pro parsování PDF, obrázků, tabulek a prezentací do strukturovaného Markdownu s uzemněním na úrovni chunků, a následnou extrakci specifických polí pomocí JSON Schema nebo Pydantic modelu. Pokrývá také klasifikaci a rozdělování smíšených dávek dokumentů, generování obsahu a asynchronní úlohy pro velké soubory. Spouští se na základě extrakce založené na schématu, klasifikace stránek, rozdělování dokumentů, generování TOC nebo jakékoli zmínky o ohraničujících rámečcích/uzemnění/umístění slov.
Testovací report
Stejný úkol extrakce polí z faktury byl navržen dvakrát: základní řešení dosáhlo OCR + odhadů regex/LLM, cesta skillu Pydantic-to-JSON-Schema + client.extract() vrací pole plus sledovatelnost chunků pro každé pole a skóre spolehlivosti ihned po spuštění.
Testováno: 2026-07-14 · Claude Code 2.x (agent harness)
Instalace
git clone https://github.com/landing-ai/ade-document-processing-skills cd ade-document-processing-skills mkdir -p ~/.claude/skills cp -r plugins/ade-document-processing/skills/document-extraction ~/.claude/skills/document-extraction
Příkazy a ukázkové prompty
/document-extractionParsování PDF/obrázků/tabulek bez šablon do strukturovaného Markdown+JSON s extrakcí schématu a ohraničujícími rámečky.
Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):
Extract the invoice number, date, and total from this PDFSplit this folder of mixed invoices and receipts by typePull the exact text location for each clause in this contract