Un guardrail es un control diseñado para prevenir, detectar o contener un comportamiento no permitido en un sistema de IA. Puede actuar sobre entradas, contexto, uso de herramientas, salidas o efectos externos.
No existe una definición técnica única ni un guardrail universal. Es un término práctico para controles distintos que deben vincularse a un riesgo y a una respuesta concreta.
Capas de control
| Momento | Ejemplo | Respuesta posible |
|---|---|---|
| Entrada | dato sensible o solicitud fuera de alcance | bloquear, minimizar o redirigir |
| Contexto | documento no autorizado o instrucción externa | filtrar, etiquetar o aislar |
| Decisión | herramienta incompatible con el estado | retirar capacidad o exigir aprobación |
| Argumentos | importe o destinatario no válido | rechazar por esquema o regla |
| Salida | afirmación sin evidencia o contenido prohibido | abstener, corregir o escalar |
| Efecto | acción sensible o irreversible | confirmar, limitar o ejecutar en sandbox |
Algunos controles utilizan clasificadores o modelos adicionales; otros son reglas, permisos, tipos, límites de gasto o procesos humanos. La composición importa más que la etiqueta.
Ejemplo empresarial
Un asistente de recursos humanos redacta comunicaciones, pero no decide contrataciones. La entrada elimina identificadores innecesarios; las fuentes se filtran por rol; la salida debe citar la política; y cualquier recomendación sobre una persona se bloquea y escala.
Una regla de aplicación impide enviar mensajes automáticamente. El control sigue funcionando aunque el modelo ignore una instrucción.
Cómo diseñar un guardrail
- Describe el daño o incumplimiento que quieres reducir.
- Sitúa el control antes del primer punto donde ese daño puede producirse.
- Define señales observables y una respuesta segura.
- Conserva contexto para que una persona pueda revisar la activación.
- Evalúa ataques, entradas normales y casos límite.
- Registra quién puede modificar, desactivar o exceptuar el control.
Los controles pueden degradar la experiencia o bloquear casos legítimos. Por eso necesitan propietarios, métricas y revisión. Un filtro que nadie puede explicar ni recurrir puede trasladar el riesgo al proceso humano.
Qué no puede garantizar
Un guardrail basado en modelo es también probabilístico. Puede ser evadido, comportarse distinto por idioma o fallar ante datos nuevos. Varias capas reducen riesgo; no prueban seguridad absoluta.
La severidad debe determinar la arquitectura. Para una recomendación reversible puede bastar detección y revisión. Para pagos, derechos o datos sensibles hacen falta permisos externos, límites y comprobaciones independientes.
Cómo se evalúa
Construye un conjunto con intentos que deben bloquearse, casos permitidos cercanos y variaciones de idioma o formato. Mide detección, bloqueo indebido, latencia y resultado después de activar el control. Repite al cambiar modelo, prompt, herramienta o política.
Qué no debe confundirse con guardrail
- Moderación: detecta categorías de contenido; es una posible capa de guardrail.
- Política: define lo permitido; el guardrail intenta aplicarlo.
- Validación: comprueba estructura o reglas concretas.
- Supervisión humana: intervención con contexto y autoridad, no un filtro automático.
- Alineamiento del modelo: comportamiento aprendido; no sustituye controles del sistema.
La inyección de prompt es uno de los riesgos que exige combinar controles de modelo con límites externos.
La decisión útil
No preguntes «qué guardrail instalamos». Escribe el escenario de daño, el punto de intervención y la acción segura. Después elige la combinación de regla, permiso, modelo y persona que pueda demostrarse.
Fuentes y lecturas recomendadas
- NIST AI 600-1, perfil de IA generativa, gestión y medición de riesgos, julio de 2024.
- OpenAI Agents SDK: guardrails, controles de entrada, salida y herramientas, consultado el 20 de agosto de 2026.
- INSTINTIA: cuánta autonomía debe tener un agente, controles según impacto y reversibilidad.
Definición y vigencia revisadas el 20 de agosto de 2026.