Adversarial Claims Reviewer
Feindselige Schiedsrichterprüfung von Papieren/Whitepapern, die jede Gleichung und Zahl mit echten Skripten neu berechnet.
Funktioniert mit Setup
Was es kann
Inventarisiert jede Gleichung und quantitative Behauptung in einem technischen Dokument, verifiziert jede exakt wie benannt (nie eine Paraphrase) mit deterministischen Skripten (SymPy/numpy) und klassifiziert VERIFIZIERT/WIDERLEGT/UNVERIFIZIERBAR/VACH. Löst bei Anfragen zur Überprüfung eines Papiers, zur Verifizierung von Behauptungen oder zur Auditierung einer Herleitung/eines Benchmarks aus; lehnt explizit die Überprüfung von Quellcode, die Sicherheitslage und die Bewertung der Prosaqualität ab, die zu Geschwisterfähigkeiten gehören.
Testbericht
Pflanzte zwei falsche Behauptungen in ein Wegwerf-Mini-Papier (eine vertauschte Sin/Cos-Ableitung und eine Schlagzeile über eine relative Verbesserung von 40 %, die SymPy/Arithmetik tatsächlich bei 23,1 % einordneten) – ein generischer Überprüfungslauf lobte beide als solide, das tatsächliche INVENTORY-to-REPORT-Protokoll der Fähigkeit erfasste beide mit ausgeführten, reproduzierbaren Skripten und ließ die einzige wahre Behauptung korrekt in Ruhe. Seine eigene 'Tier-Disziplin'-Sektion erfordert .claude/rules/review-tiers.md und ../findings-ledger/SKILL.md, beides Geschwister außerhalb des Fähigkeitsordners, die ein einfaches git-clone-and-cp nur dieses Verzeichnisses nicht mitbringt.
Getestet am: 2026-07-15 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/LazyIsEfficient/agentic-os mkdir -p ~/.claude/skills cp -r agentic-os/.claude/skills/adversarial-claims-reviewer ~/.claude/skills/adversarial-claims-reviewer
Befehle & Beispiel-Prompts
/adversarial-claims-reviewerFeindselige Schiedsrichterprüfung von Papieren/Whitepapern, die jede Gleichung und Zahl mit echten Skripten neu berechnet.
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Can you check if the math in this paper's derivation is correct?Verify these benchmark numbers in my whitepaper actually add up.Recompute the equations in this draft and flag anything wrong.