Adversarial Claims Reviewer
Revisione ostile-arbitro di paper/whitepaper che ricalcola ogni equazione e numero con script reali.
Richiede configurazione
Cosa fa
Inventaria ogni equazione e affermazione quantitativa in un documento tecnico, verifica ciascuna esattamente come nominata (mai una parafrasi) con script deterministici (SymPy/numpy), e classifica VERIFICATO/CONFUTATO/NON VERIFICABILE/VACUO. Si attiva su richieste di controllo di un paper, verifica di affermazioni, o audit di una derivazione/benchmark; declina esplicitamente la revisione del codice sorgente, la postura di sicurezza e la valutazione della qualità della prosa, che appartengono a skill sorelle.
Rapporto di test
Ha piantato due affermazioni false in un mini-paper usa e getta (una derivata sin/cos scambiata, e un titolo di miglioramento relativo del 40% che SymPy/aritmetica in realtà ha posto al 23,1%) — un passaggio di revisione generico le ha lodate entrambe come valide, il protocollo reale di INVENTARIO-a-REPORT della skill le ha catturate entrambe con script eseguiti e riproducibili e ha correttamente lasciato in pace l'unica vera affermazione. La sua stessa sezione 'Disciplina dei Tier' richiede .claude/rules/review-tiers.md e ../findings-ledger/SKILL.md, entrambi fratelli esterni alla cartella della skill che un semplice git-clone-and-cp solo di questa directory non porterà con sé.
Testato il: 2026-07-15 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/LazyIsEfficient/agentic-os mkdir -p ~/.claude/skills cp -r agentic-os/.claude/skills/adversarial-claims-reviewer ~/.claude/skills/adversarial-claims-reviewer
Comandi e prompt di esempio
/adversarial-claims-reviewerRevisione ostile-arbitro di paper/whitepaper che ricalcola ogni equazione e numero con script reali.
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Can you check if the math in this paper's derivation is correct?Verify these benchmark numbers in my whitepaper actually add up.Recompute the equations in this draft and flag anything wrong.