Adversarial Claims Reviewer

Fiendtlig dommergjennomgang av artikler/hvitbøker som regner om hver ligning og tall med ekte skript.

av LazyIsEfficient · LazyIsEfficient/agentic-os

Krever oppsett ★ 9.6/10

Adversarial Claims Reviewer — Fiendtlig dommergjennomgang av artikler/hvitbøker som regner om hver ligning og tall med ekte skript.

Hva den gjør

Inventariserer hver ligning og kvantitative påstand i et teknisk dokument, verifiserer hver nøyaktig som navngitt (aldri en parafrase) med deterministiske skript (SymPy/numpy), og klassifiserer VERIFISERT/AVVIST/UVERIFISERBAR/TOM. Utløses ved forespørsler om å sjekke en artikkel, verifisere påstander, eller revidere en utledning/benchmark; avslår eksplisitt kildekode-gjennomgang, sikkerhetspostur, og vurdering av prosakvalitet, som tilhører søsterferdigheter.

Testrapport

Plasserte to falske påstander i en forkastbar mini-artikkel (en byttet sin/cos derivert, og en 40%-relativ-forbedring-overskrift som SymPy/aritmetikk faktisk satte til 23,1%) — en generell gjennomgang roste begge som sunne, ferdighetens ekte INVENTORY-to-REPORT-protokoll fanget begge med utførte, reproduserbare skript og lot den ene sanne påstanden være urørt. Dens egen 'Tier discipline'-seksjon krever .claude/rules/review-tiers.md og ../findings-ledger/SKILL.md, begge søsken utenfor ferdighetsmappen som en ren git-clone-and-cp av kun denne mappen ikke vil ta med.

Testet på: 2026-07-15 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/LazyIsEfficient/agentic-os
mkdir -p ~/.claude/skills
cp -r agentic-os/.claude/skills/adversarial-claims-reviewer ~/.claude/skills/adversarial-claims-reviewer

Kommandoer og eksempelprompter

  • /adversarial-claims-reviewerFiendtlig dommergjennomgang av artikler/hvitbøker som regner om hver ligning og tall med ekte skript.

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Can you check if the math in this paper's derivation is correct?
  • Verify these benchmark numbers in my whitepaper actually add up.
  • Recompute the equations in this draft and flag anything wrong.