PDF to Markdown

Estrae un intero PDF in Markdown pulito e strutturato con intestazioni, tabelle e immagini reali.

di aliceisjustplaying · aliceisjustplaying/claude-skill-pdf-to-markdown

Promosso ★ 9.6/10

PDF to Markdown — Estrae un intero PDF in Markdown pulito e strutturato con intestazioni, tabelle e immagini reali.

Cosa fa

Uno skill basato su CLI che converte un intero PDF in Markdown usando PyMuPDF/pymupdf4llm (o Docling per tabelle ad alta precisione), preservando intestazioni, grassetto/corsivo, ordine di lettura multi-colonna, tabelle e immagini estratte, con caching aggressivo degli hash dei contenuti. Si attiva quando un utente desidera che l'intero PDF o 'entire document' sia caricato nel contesto anziché un approccio grep/ricerca o pagina per pagina.

Rapporto di test

Ho eseguito lo script pymupdf4llm incluso su un PDF di test con una tabella, testo in grassetto/corsivo e un elenco puntato: ha prodotto intestazioni markdown reali, una tabella con pipe e ha preservato la formattazione in grassetto/corsivo, mentre la lettura PDF predefinita del harness è ricaduta su un blocco indifferenziato di testo semplice senza marcatori di struttura.

Testato il: 2026-07-14 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/aliceisjustplaying/claude-skill-pdf-to-markdown
cd claude-skill-pdf-to-markdown
mkdir -p ~/.claude/skills
cp -r . ~/.claude/skills/pdf-to-markdown

Comandi e prompt di esempio

  • /pdf-to-markdownEstrae un intero PDF in Markdown pulito e strutturato con intestazioni, tabelle e immagini reali.

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Load this entire PDF into context, not just search it
  • Convert this whole PDF report into clean markdown with tables
  • Extract all the text and tables from this PDF, preserve formatting