Advanced Evaluation

Configura evaluación con LLM como juez, comparaciones por pares y rúbricas de evaluación conscientes del sesgo.

Por sickn33 · sickn33/antigravity-awesome-skills

Funciona con configuración ★ 6.4/10

Advanced Evaluation — Configura evaluación con LLM como juez, comparaciones por pares y rúbricas de evaluación conscientes del sesgo.

Qué hace

Esta skill debe usarse cuando el usuario pida "implementar LLM-as-judge", "comparar salidas de modelos", "crear rúbricas de evaluación", "mitigar el sesgo de evaluación", o mencione puntuación directa, comparación por pares, sesgo de posición, pipelines de evaluación o evaluación automatizada de calidad.

Informe de la prueba

La instalación literal funcionó de forma limpia: un único SKILL.md autocontenido con frontmatter válido, sin dependencias externas ni claves de API. En la prueba A/B de salida (evaluación por pares con mitigación del sesgo de intercambio de posición) el brazo con skill siguió correctamente el protocolo documentado, pero el brazo base sin skill produjo un resultado igual de riguroso y correcto — la guía de la skill es sólida pero no aportó ninguna ventaja medible en esta tarea. La descripción de activación es algo demasiado amplia ('crear rúbricas de evaluación', 'evaluación automatizada de calidad' pueden dispararse por error en contextos ajenos a LLM), y el documento cita estadísticas de fiabilidad sin fuente (por ejemplo, 'mejora del 15-25%').

Probado el: 2026-07-11 · Claude Code 2.x (agent harness)

Instalación

git clone https://github.com/sickn33/antigravity-awesome-skills
cd antigravity-awesome-skills
mkdir -p ~/.claude/skills
cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation

Comandos y prompts de ejemplo

  • /advanced-evaluationConfigura evaluación con LLM como juez, comparaciones por pares y rúbricas de evaluación conscientes del sesgo.

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Implement LLM-as-judge to score these model outputs
  • Create an evaluation rubric to compare model outputs
  • Set up a pairwise comparison pipeline to reduce bias