Advanced Evaluation

Met en place le scoring LLM-as-judge, les comparaisons par paires et des rubriques d'évaluation attentives aux biais.

par sickn33 · sickn33/antigravity-awesome-skills

Fonctionne avec configuration ★ 6.4/10

Advanced Evaluation — Met en place le scoring LLM-as-judge, les comparaisons par paires et des rubriques d'évaluation attentives aux biais.

Ce que fait

Ce skill doit être utilisé quand l'utilisateur demande d'« implémenter LLM-as-judge », de « comparer des sorties de modèles », de « créer des rubriques d'évaluation », de « mitiger les biais d'évaluation », ou mentionne le scoring direct, la comparaison par paires, le biais de position, les pipelines d'évaluation ou l'évaluation automatisée de qualité.

Rapport de test

Installation verbatim propre : un seul SKILL.md autonome avec un frontmatter valide, aucune dépendance externe ni clé API. Dans le test A/B de sortie (jugement par paires avec mitigation du biais de position par inversion), le bras avec skill a suivi correctement le protocole documenté, mais le bras de base sans skill a produit un résultat tout aussi rigoureux et tout aussi correct — les conseils du skill sont solides mais n'apportent aucun gain mesurable sur cette tâche. La description de déclenchement est un peu trop large (« créer des rubriques d'évaluation », « évaluation automatisée de qualité » peuvent se déclencher à tort sur des contextes non liés aux LLM), et la doc cite des statistiques de fiabilité non sourcées (par ex. « amélioration de 15-25% »).

Testé le: 2026-07-11 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/sickn33/antigravity-awesome-skills
cd antigravity-awesome-skills
mkdir -p ~/.claude/skills
cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation

Commandes et exemples de prompts

  • /advanced-evaluationMet en place le scoring LLM-as-judge, les comparaisons par paires et des rubriques d'évaluation attentives aux biais.

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Implement LLM-as-judge to score these model outputs
  • Create an evaluation rubric to compare model outputs
  • Set up a pairwise comparison pipeline to reduce bias