Evaluación y Medición
Una evaluación es un instrumento conectado a una decisión. Muestra casos, aplica mediciones o juicios, agrega incertidumbre y define si un sistema cruza un umbral de producto, seguridad u operación.
Modelo mental
Diseñá la evaluación desde el contrato real: población, slices, fallas costosas, baseline y regla de decisión. Un score de benchmark sin ese contexto es evidencia incompleta.
Hoja de ruta
- Diseñar eval sets
- Métricas para evals LLM
- LLM como juez
- Análisis sistemático de errores
- Evaluar RAG
- Evaluar agentes
Conecta con: Investigación y Experimentación · Evals en el Producto · Interpretabilidad
Fuentes principales
- HELM — evaluación transparente y multi-escenario.
- Judging LLM-as-a-Judge — sesgos y límites de jueces automáticos.
- RAGAS — métricas por componente para RAG.
- The ML Test Score — vínculo entre evidencia offline y readiness.