Adversarial Claims Reviewer

Fjendtlig referee-gennemgang af papers/whitepapers, der genberegner hver ligning og hvert tal med reelle scripts.

Af LazyIsEfficient · LazyIsEfficient/agentic-os

Virker med opsætning ★ 9.6/10

Adversarial Claims Reviewer — Fjendtlig referee-gennemgang af papers/whitepapers, der genberegner hver ligning og hvert tal med reelle scripts.

Hvad det gør

Inventariserer hver ligning og kvantitativ påstand i et teknisk dokument, verificerer hver præcis som navngivet (aldrig en parafrase) med deterministiske scripts (SymPy/numpy), og klassificerer VERIFIED/REFUTED/UNVERIFIABLE/VACUOUS. Udløses ved anmodninger om at tjekke et paper, verificere påstande eller auditere en derivation/benchmark; afviser eksplicit source-code review, security posture og prose-quality scoring, som tilhører søskende-skills.

Testrapport

Plantede to falske påstande i et midlertidigt mini-paper (en byttet sin/cos-derivat, og en 40%-relativ-forbedringsoverskrift, som SymPy/aritmetik faktisk satte til 23,1%) — en generisk gennemgang roste begge som sunde, skill'ens reelle INVENTORY-to-REPORT-protokol fangede begge med udførte, reproducerbare scripts og lod korrekt den ene sande påstand være. Dens egen 'Tier discipline'-sektion kræver .claude/rules/review-tiers.md og ../findings-ledger/SKILL.md, begge søskende uden for skill-mappen, som en simpel git-clone-and-cp af kun denne mappe ikke vil medføre.

Testet: 2026-07-15 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/LazyIsEfficient/agentic-os
mkdir -p ~/.claude/skills
cp -r agentic-os/.claude/skills/adversarial-claims-reviewer ~/.claude/skills/adversarial-claims-reviewer

Kommandoer og eksempelprompter

  • /adversarial-claims-reviewerFjendtlig referee-gennemgang af papers/whitepapers, der genberegner hver ligning og hvert tal med reelle scripts.

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Can you check if the math in this paper's derivation is correct?
  • Verify these benchmark numbers in my whitepaper actually add up.
  • Recompute the equations in this draft and flag anything wrong.