Adversarial Claims Reviewer
Revue hostile par un arbitre de papiers/livres blancs qui recompte chaque équation et chiffre avec des scripts réels.
Fonctionne avec configuration
Ce que fait
Inventorie chaque équation et affirmation quantitative dans un document technique, vérifie chacune exactement comme nommée (jamais une paraphrase) avec des scripts déterministes (SymPy/numpy), et classe VERIFIÉ/RÉFUTÉ/INVÉRIFIABLE/VACUAIRE. Se déclenche sur les demandes de vérification d'un papier, de validation d'affirmations, ou d'audit d'une dérivation/référence ; décline explicitement la revue du code source, la posture de sécurité et la notation de la qualité de la prose, qui appartiennent à des compétences sœurs.
Rapport de test
A planté deux fausses affirmations dans un mini-papier jetable (une dérivée sin/cos échangée, et un titre d'amélioration de 40% en relatif que SymPy/arithmétique a réellement placé à 23,1 %) — une revue générique a loué les deux comme étant solides, le protocole réel INVENTAIRE-à-RAPPORT de la compétence a attrapé les deux avec des scripts exécutés et reproductibles et a correctement laissé la seule affirmation vraie tranquille. Sa propre section 'Discipline de niveau' exige .claude/rules/review-tiers.md et ../findings-ledger/SKILL.md, tous deux frères en dehors du dossier de la compétence qu'un simple clone git et cp du seul répertoire actuel n'apportera pas.
Testé le: 2026-07-15 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/LazyIsEfficient/agentic-os mkdir -p ~/.claude/skills cp -r agentic-os/.claude/skills/adversarial-claims-reviewer ~/.claude/skills/adversarial-claims-reviewer
Commandes et exemples de prompts
/adversarial-claims-reviewerRevue hostile par un arbitre de papiers/livres blancs qui recompte chaque équation et chiffre avec des scripts réels.
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Can you check if the math in this paper's derivation is correct?Verify these benchmark numbers in my whitepaper actually add up.Recompute the equations in this draft and flag anything wrong.