Advanced Evaluation
Met en place le scoring LLM-as-judge, les comparaisons par paires et des rubriques d'évaluation attentives aux biais.
Fonctionne avec configuration
Ce que fait
Ce skill doit être utilisé quand l'utilisateur demande d'« implémenter LLM-as-judge », de « comparer des sorties de modèles », de « créer des rubriques d'évaluation », de « mitiger les biais d'évaluation », ou mentionne le scoring direct, la comparaison par paires, le biais de position, les pipelines d'évaluation ou l'évaluation automatisée de qualité.
Rapport de test
Installation verbatim propre : un seul SKILL.md autonome avec un frontmatter valide, aucune dépendance externe ni clé API. Dans le test A/B de sortie (jugement par paires avec mitigation du biais de position par inversion), le bras avec skill a suivi correctement le protocole documenté, mais le bras de base sans skill a produit un résultat tout aussi rigoureux et tout aussi correct — les conseils du skill sont solides mais n'apportent aucun gain mesurable sur cette tâche. La description de déclenchement est un peu trop large (« créer des rubriques d'évaluation », « évaluation automatisée de qualité » peuvent se déclencher à tort sur des contextes non liés aux LLM), et la doc cite des statistiques de fiabilité non sourcées (par ex. « amélioration de 15-25% »).
Testé le: 2026-07-11 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/sickn33/antigravity-awesome-skills cd antigravity-awesome-skills mkdir -p ~/.claude/skills cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation
Commandes et exemples de prompts
/advanced-evaluationMet en place le scoring LLM-as-judge, les comparaisons par paires et des rubriques d'évaluation attentives aux biais.
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Implement LLM-as-judge to score these model outputsCreate an evaluation rubric to compare model outputsSet up a pairwise comparison pipeline to reduce bias