Adversarial Claims Reviewer

Fientlig domargranskning av papper/vitböcker som räknar om varje ekvation och siffra med verkliga skript.

av LazyIsEfficient · LazyIsEfficient/agentic-os

Fungerar med konfiguration ★ 9.6/10

Adversarial Claims Reviewer — Fientlig domargranskning av papper/vitböcker som räknar om varje ekvation och siffra med verkliga skript.

Vad den gör

Inventerar varje ekvation och kvantitativt påstående i ett tekniskt dokument, verifierar varje exakt som namngivet (aldrig en parafras) med deterministiska skript (SymPy/numpy), och klassificerar VERIFIERAD/MOTBEVISAD/IVERIFIERBAR/TOM. Triggers vid förfrågningar om att kontrollera ett papper, verifiera påståenden, eller granska en härledning/benchmark; avböjer uttryckligen källkodgranskning, säkerhetsattityd och bedömning av prosakvalitet, som tillhör systerfärdigheter.

Testrapport

Införde två falska påståenden i ett engångs mini-papper (en omkastad sin/cos-derivata, och en 40%-relativ-förbättring-rubrik som SymPy/aritmetik faktiskt placerade på 23,1%) – en generell granskning berömde båda som sunda, färdighetens verkliga INVENTORY-till-REPORT-protokoll fångade båda med exekverade, reproducerbara skript och lämnade korrekt det enda sanna påståendet ifred. Dess egen 'Tier discipline'-sektion kräver .claude/rules/review-tiers.md och ../findings-ledger/SKILL.md, båda syskon utanför färdighetsmappen som en enkel git-clone-and-cp av endast denna katalog inte kommer att ta med sig.

Testad: 2026-07-15 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/LazyIsEfficient/agentic-os
mkdir -p ~/.claude/skills
cp -r agentic-os/.claude/skills/adversarial-claims-reviewer ~/.claude/skills/adversarial-claims-reviewer

Kommandon och exempelprompter

  • /adversarial-claims-reviewerFientlig domargranskning av papper/vitböcker som räknar om varje ekvation och siffra med verkliga skript.

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Can you check if the math in this paper's derivation is correct?
  • Verify these benchmark numbers in my whitepaper actually add up.
  • Recompute the equations in this draft and flag anything wrong.