Las evaluaciones de IA o evals son pruebas sistemáticas que miden cómo se comporta un modelo o sistema frente a casos, criterios y riesgos definidos. Sirven para comparar opciones, detectar regresiones y decidir si una versión está preparada para un uso concreto.
Una colección de respuestas revisadas a mano puede iniciar una evaluación, pero una eval repetible necesita datos, criterio de puntuación, versión y umbrales explícitos.
Las piezas de una evaluación
| Pieza | Pregunta |
|---|---|
| Unidad | ¿Qué trabajo concreto se está evaluando? |
| Casos | ¿Representan usuarios, segmentos, excepciones y riesgos reales? |
| Criterio | ¿Qué convierte una salida o trayectoria en aceptable? |
| Evaluador | ¿Regla, referencia, persona, modelo juez o combinación? |
| Umbral | ¿Qué nivel permite desplegar y en qué condiciones? |
| Versión | ¿Qué modelo, prompt, datos, herramientas y código se probaron? |
Las pruebas deterministas funcionan bien para esquemas, cálculos, permisos y citas existentes. La revisión humana aporta juicio para resultados abiertos. Un modelo juez permite escala, pero debe calibrarse contra decisiones humanas y puede compartir sesgos o errores con el sistema evaluado.
- Define éxito y daño. Expresa resultado útil, errores tolerables y fallos críticos.
- Reúne casos reales. Incluye producción, expertos y escenarios diseñados para romper supuestos.
- Construye una línea base. Mide la versión vigente antes de optimizar.
- Separa capas. Evalúa recuperación, herramientas, permisos y salida cuando corresponda.
- Compara de forma estable. Ejecuta candidatos sobre los mismos casos y revisa diferencias.
- Alimenta la regresión. Convierte incidentes y correcciones en nuevas pruebas.
Ejemplo empresarial
Una empresa evalúa un extractor de facturas. No puntúa «parece correcto». Comprueba campos obligatorios, coincidencia con el documento, formato, abstención cuando la imagen es ilegible y resultado por proveedor e idioma.
Un número de cuenta erróneo es crítico; una abreviatura de dirección quizá sea tolerable. El conjunto contiene facturas normales, duplicadas, manipuladas y sin datos suficientes.
Del laboratorio a producción
Una evaluación offline facilita comparar antes de desplegar. En producción deben vigilarse aceptación, correcciones, escalados, incidentes, coste y resultado posterior. Ambas capas se conectan: los fallos reales actualizan el conjunto offline.
Evita contaminar la prueba usando los mismos casos para iterar y declarar éxito. Mantén una parte separada y revisa periódicamente si la distribución de uso cambió.
Errores frecuentes
- Utilizar un benchmark general como sustituto de la tarea empresarial.
- Puntuar solo estilo o parecido con una respuesta de referencia.
- Promediar y ocultar un segmento con fallos graves.
- Evaluar el texto final e ignorar herramientas o permisos.
- Cambiar prompt y modelo a la vez sin conservar versiones.
- Definir el umbral después de ver el resultado.
Qué no debe confundirse con evals
- Benchmark: conjunto común para comparar; puede no representar el caso propio.
- Monitorización: observa producción; una eval ejecuta casos con criterios controlados.
- Prueba de software: verifica comportamiento determinista; las evals cubren además calidad probabilística.
- KPI de negocio: mide resultados organizativos; debe conectarse con la calidad técnica.
- Red teaming: busca fallos de seguridad y abuso; complementa la evaluación habitual.
Los guardrails también necesitan evals propias: detectar ataques sin bloquear casos legítimos es parte del resultado.
La decisión útil
Antes de cambiar el prompt o comprar otro modelo, escribe diez casos que definan «mejor». Si no puedes acordar cómo se puntúan, el problema todavía no está especificado para implantación.
Fuentes y lecturas recomendadas
- OpenAI Developers: working with evals, diseño y ejecución de evaluaciones, consultado el 20 de agosto de 2026.
- NIST: AI test, evaluation, validation and verification, recursos de TEVV, consultado el 20 de agosto de 2026.
- INSTINTIA: qué KPI debe tener cada proyecto de IA, conexión entre calidad técnica y resultado empresarial.
Definición y vigencia revisadas el 20 de agosto de 2026.