Document Extraction (ADE)
Bezszablonowe parsowanie PDF/obrazów/arkuszy do ustrukturyzowanego Markdown+JSON z ekstrakcją schematu i ramkami ograniczającymi.
Testowano · Działa
Co robi ten skill
Otacza API/SDK LandingAI's Agentic Document Extraction (ADE) w celu parsowania plików PDF, obrazów, arkuszy kalkulacyjnych i prezentacji do ustrukturyzowanego Markdown z ugruntowaniem dla każdego fragmentu, a następnie ekstrakcji specyficznych pól za pomocą JSON Schema lub modelu Pydantic. Obejmuje również klasyfikację i dzielenie mieszanych partii dokumentów, generowanie spisu treści oraz zadania asynchroniczne dla dużych plików. Uruchamia się przy ekstrakcji opartej na schemacie, klasyfikacji stron, dzieleniu dokumentów, generowaniu spisu treści lub jakiejkolwiek wzmiance o bounding boxes/grounding/word locations.
Raport z testu
Zaprojektowano to samo zadanie ekstrakcji pól faktury dwukrotnie: punkt odniesienia osiągnięto dla OCR + zgadywania regex/LLM, ścieżka Pydantic-to-JSON-Schema + client.extract() umiejętności zwraca pola wraz ze śledzeniem fragmentów dla każdego pola i wynikami ufności od razu.
Testowano: 2026-07-14 · Claude Code 2.x (agent harness)
Instalacja
git clone https://github.com/landing-ai/ade-document-processing-skills cd ade-document-processing-skills mkdir -p ~/.claude/skills cp -r plugins/ade-document-processing/skills/document-extraction ~/.claude/skills/document-extraction
Komendy i przykładowe prompty
/document-extractionBezszablonowe parsowanie PDF/obrazów/arkuszy do ustrukturyzowanego Markdown+JSON z ekstrakcją schematu i ramkami ograniczającymi.
Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):
Extract the invoice number, date, and total from this PDFSplit this folder of mixed invoices and receipts by typePull the exact text location for each clause in this contract