Advanced Evaluation
Configura evaluación con LLM como juez, comparaciones por pares y rúbricas de evaluación conscientes del sesgo.
Funciona con configuración
Qué hace
Esta skill debe usarse cuando el usuario pida "implementar LLM-as-judge", "comparar salidas de modelos", "crear rúbricas de evaluación", "mitigar el sesgo de evaluación", o mencione puntuación directa, comparación por pares, sesgo de posición, pipelines de evaluación o evaluación automatizada de calidad.
Informe de la prueba
La instalación literal funcionó de forma limpia: un único SKILL.md autocontenido con frontmatter válido, sin dependencias externas ni claves de API. En la prueba A/B de salida (evaluación por pares con mitigación del sesgo de intercambio de posición) el brazo con skill siguió correctamente el protocolo documentado, pero el brazo base sin skill produjo un resultado igual de riguroso y correcto — la guía de la skill es sólida pero no aportó ninguna ventaja medible en esta tarea. La descripción de activación es algo demasiado amplia ('crear rúbricas de evaluación', 'evaluación automatizada de calidad' pueden dispararse por error en contextos ajenos a LLM), y el documento cita estadísticas de fiabilidad sin fuente (por ejemplo, 'mejora del 15-25%').
Probado el: 2026-07-11 · Claude Code 2.x (agent harness)
Instalación
git clone https://github.com/sickn33/antigravity-awesome-skills cd antigravity-awesome-skills mkdir -p ~/.claude/skills cp -r plugins/agentic-awesome-skills-claude/skills/advanced-evaluation ~/.claude/skills/advanced-evaluation
Comandos y prompts de ejemplo
/advanced-evaluationConfigura evaluación con LLM como juez, comparaciones por pares y rúbricas de evaluación conscientes del sesgo.
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Implement LLM-as-judge to score these model outputsCreate an evaluation rubric to compare model outputsSet up a pairwise comparison pipeline to reduce bias