Un proyecto puede mejorar la precisión del modelo y empeorar el proceso. También puede ganar usuarios mientras aumenta el reproceso. Elegir un único KPI técnico deja demasiadas formas de declarar éxito sin haber creado valor.
Cada proyecto necesita una métrica principal de resultado y un pequeño conjunto de guardas que impidan conseguirla a costa de calidad, seguridad, experiencia o coste.
La regla: una métrica norte y varias guardas
La métrica norte responde qué resultado debería mejorar si el proyecto funciona. No es “precisión del modelo” ni “usuarios activos”, salvo que ese sea literalmente el resultado de negocio.
Las guardas evitan una optimización dañina. Un agente de soporte podría reducir el coste por contacto si cierra casos demasiado pronto. La tasa de reapertura y la satisfacción impiden celebrar ese falso avance.
OpenAI propone empezar por una unidad de trabajo y medir trabajo útil, coste por tarea aceptada y dependabilidad (OpenAI). NIST recuerda que las métricas deben responder al contexto y que precisión, seguridad, robustez, privacidad y sesgo requieren medidas distintas (NIST).
Un cuadro de mando de seis capas
| Capa | Pregunta | Ejemplos de KPI |
|---|---|---|
| Resultado | ¿Cambió el objetivo del proceso? | resolución, conversión, plazo, riesgo evitado |
| Calidad | ¿La salida cumple la barra? | listo para usar, error crítico, cita correcta |
| Eficiencia | ¿Qué recursos requiere? | tiempo total, coste por caso, reintentos |
| Adopción | ¿Se usa en el workflow previsto? | cobertura, recurrencia, abandono |
| Experiencia | ¿Qué ocurre a clientes y empleados? | esfuerzo, satisfacción, espera, reclamación |
| Seguridad | ¿Se mantiene dentro de límites? | accesos indebidos, acciones bloqueadas, incidentes |
No hace falta llenar un panel con veinte indicadores por capa. Elija los que puedan cambiar una decisión. Si nadie sabe qué haría cuando una métrica se mueve, probablemente es decorativa.
La ficha que evita discusiones después
Para cada KPI conviene escribir:
- nombre y propósito;
- fórmula exacta, incluidos numerador y denominador;
- fuente de datos y responsable de su calidad;
- población, segmentos y exclusiones;
- periodo y frecuencia;
- línea base e incertidumbre;
- objetivo, límite y acción asociada.
“Tasa de resolución” puede significar cierre declarado, ausencia de reapertura durante siete días o confirmación del cliente. Las tres cifras serán diferentes. La definición se acuerda antes del piloto.
Un KPI sin acción asociada es una observación. “Si el error crítico supera el 1%, se detiene la ruta automática” convierte la métrica en control.
Ejemplo trabajado: revisión de facturas
La métrica norte es facturas conciliadas correctamente dentro de 24 horas. No basta contar documentos procesados.
El cuadro de mando podría ser:
| Tipo | Métrica | Decisión asociada |
|---|---|---|
| Norte | % conciliado correctamente en 24 h | escalar si mejora 15 puntos sin romper guardas |
| Calidad | error monetario por 1.000 facturas | detener si supera el límite acordado |
| Eficiencia | coste completo por factura aceptada | revisar modelo o flujo si crece dos periodos |
| Adopción | % de facturas elegibles que entra en el flujo | investigar barreras por equipo |
| Experiencia | minutos de revisión por excepción | rediseñar evidencia si no baja |
| Seguridad | accesos o acciones fuera de política | incidente y suspensión inmediata |
Además se segmenta por proveedor, idioma, tipo de factura e importe. Una media puede ocultar que el sistema funciona bien en PDF estándar y falla en abonos internacionales.
Métricas adelantadas y retrasadas
El resultado económico suele aparecer tarde. Por eso se combinan métricas adelantadas, que anticipan problemas, y retrasadas, que confirman impacto.
Correcciones, latencia y escalados pueden verse cada semana. Retención, ingreso o reducción de reclamaciones necesitan más tiempo. La relación entre ambas debe probarse: una respuesta más rápida no garantiza mayor satisfacción si la respuesta es incorrecta.
Los indicadores técnicos son valiosos como diagnóstico. Tokens, llamadas, caché o error de herramienta explican por qué cambia el coste por resultado; no sustituyen el resultado.
Cómo evitar que el KPI sea manipulado
Cuando una métrica se convierte en objetivo, los equipos encuentran formas de mejorarla. Algunas son útiles y otras cambian el denominador.
- Conserve definiciones y exclusiones versionadas.
- Muestre volumen junto a porcentajes.
- Segmente casos difíciles y poblaciones afectadas.
- Audite muestras fuera del propio sistema.
- Combine la métrica norte con guardas difíciles de optimizar simultáneamente.
NIST advierte que el resultado de un benchmark y su generalización a una población más amplia son medidas diferentes y requieren supuestos explícitos (NIST AI 800-3). El mismo cuidado se aplica a un piloto empresarial.
Qué cambia según la fase
Exploración
La pregunta es si la tecnología puede abordar la tarea. Se miden calidad básica, fallos y coste aproximado sobre una muestra.
Validación
Se compara con línea base, usuarios reales y casos límite. Entran adopción, experiencia, seguridad y coste completo.
Producción
Importan resultado sostenido, deriva, incidentes, segmentos, capacidad y economía. Las métricas alimentan operación y decisiones de inversión.
Escalado
Se comprueba que el valor crece más rápido que el coste sin degradar guardas. Una media mejor puede esconder nuevos segmentos mal atendidos.
Preguntas frecuentes
¿Cuántos KPI debe tener un proyecto?
Los suficientes para decidir sin ocultar riesgos. Como punto de partida: una métrica norte y entre cuatro y seis guardas o diagnósticos.
¿La precisión del modelo nunca puede ser KPI principal?
Puede serlo en una evaluación técnica acotada. Para un proyecto de negocio suele ser una métrica de calidad dentro de un resultado mayor.
¿Cómo fijar el objetivo sin datos anteriores?
Mida una línea base con una muestra antes del piloto. Si no existe, defina un intervalo inicial y actualícelo cuando haya evidencia.
¿Quién debe ser propietario del KPI?
El responsable del resultado de negocio. Tecnología y Datos son propietarios de métricas del sistema, pero no deberían asumir solos el beneficio.
¿Cada cuánto se revisa el cuadro de mando?
Con más frecuencia al principio y cuando cambia modelo, datos o proceso. La cadencia debe permitir intervenir antes de que el daño se acumule.
Un panel pequeño obliga a elegir
La dificultad no está en encontrar algo que medir. Está en acordar qué resultado importa y qué deterioro no se aceptará para conseguirlo.
Si el comité necesita veinte gráficos para saber si el proyecto funciona, probablemente todavía no ha definido “hecho”.
Fuentes consultadas
- A scorecard for the AI age — OpenAI
- AI test, evaluation, validation and verification — NIST
- NIST AI RMF Core
- NIST AI 800-3
Fuentes y vigencia revisadas el 18 de agosto de 2026.