Adversarial Claims Reviewer
Vijandige scheidsrechterbeoordeling van papers/whitepapers die elke vergelijking en elk getal opnieuw berekent met echte scripts.
Werkt met setup
Wat het doet
Inventariseert elke vergelijking en kwantitatieve claim in een technisch document, verifieert elk exact zoals benoemd (nooit een parafrase) met deterministische scripts (SymPy/numpy), en classificeert VERIFIED/REFUTED/UNVERIFIABLE/VACUOUS. Triggers op verzoeken om een paper te controleren, claims te verifiëren, of een afleiding/benchmark te auditen; weigert expliciet broncodebeoordeling, beveiligingshouding, en beoordeling van prozaische kwaliteit, die thuishoren bij zuster-skills.
Testrapport
Plakte twee valse claims in een wegwerp mini-paper (een verwisselde sin/cos afgeleide, en een 40%-relatieve-verbetering kop die SymPy/rekenkunde feitelijk op 23,1% zette) — een generieke beoordelingsronde prees beide als correct, het echte INVENTORY-to-REPORT protocol van de skill ving beide met uitgevoerde, reproduceerbare scripts en liet de ene ware claim correct onaangeroerd. Zijn eigen 'Tier discipline' sectie vereist .claude/rules/review-tiers.md en ../findings-ledger/SKILL.md, beide zussen buiten de skill-map die een simpele git-clone-and-cp van alleen deze map niet meebrengt.
Getest op: 2026-07-15 · Claude Code 2.x (agent harness)
Installatie
git clone https://github.com/LazyIsEfficient/agentic-os mkdir -p ~/.claude/skills cp -r agentic-os/.claude/skills/adversarial-claims-reviewer ~/.claude/skills/adversarial-claims-reviewer
Commando's en voorbeeldprompts
/adversarial-claims-reviewerVijandige scheidsrechterbeoordeling van papers/whitepapers die elke vergelijking en elk getal opnieuw berekent met echte scripts.
Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):
Can you check if the math in this paper's derivation is correct?Verify these benchmark numbers in my whitepaper actually add up.Recompute the equations in this draft and flag anything wrong.