“¿Qué obligaciones cambian para nuestros distribuidores franceses si aplicamos la política nueva?” no es una consulta. Son varias: localizar la política vigente, distinguir Francia, identificar distribuidores, comparar versiones y quizá consultar una fuente externa. Un RAG clásico puede devolver cinco fragmentos relevantes y aun así no resolver la pregunta.
Agentic RAG añade una capa que planifica la búsqueda, evalúa lo encontrado y decide si necesita otra consulta. La mejora no es gratis: aparecen más llamadas, más latencia y nuevos modos de fallo.
Qué cambia respecto a RAG clásico
El patrón clásico convierte la pregunta en una consulta, recupera fragmentos, los ordena y genera una respuesta. Agentic RAG puede descomponer la pregunta, elegir una fuente, reformular, buscar en paralelo, detectar un hueco y repetir.
Azure AI Search documenta en 2026 un flujo de recuperación agentic con planificación, subconsultas paralelas, búsqueda híbrida, reranking semántico, referencias y registro de actividad. También advierte que añade latencia frente a una sola consulta (Microsoft Learn). Es una buena descripción del patrón, aunque la arquitectura no depende de ese proveedor.
La planificación debe producir algo inspeccionable
No basta con dejar que el modelo “piense más”. Conviene pedir una salida estructurada: subpregunta, fuente prevista, filtros, motivo y criterio de cobertura. Así se pueden probar planes sin confundirlos con la calidad final de la respuesta.
Una pregunta sobre contratos puede dividirse en cláusula aplicable, versión firmada y excepción comercial. Otra sobre una incidencia puede requerir manual técnico, registro de cambios y ticket del cliente. La descomposición debe respetar qué fuentes puede consultar el usuario; planificar no otorga acceso.
Las subconsultas independientes pueden ejecutarse en paralelo. Las dependientes esperan: no tiene sentido buscar la excepción de una cláusula que todavía no se ha identificado.
Recuperar más no equivale a tener más evidencia
La búsqueda híbrida combina coincidencia léxica y similitud semántica. Es útil cuando aparecen códigos, nombres o cifras que los embeddings pueden diluir. Los metadatos aplican permisos, idioma, estado y fechas antes del ranking.
Después llega el reranker. Su tarea es priorizar pasajes respecto a la consulta concreta, no decidir si una afirmación es verdadera. La aplicación debe mantener identificador de documento, versión, página o sección y fragmento exacto.
Una cita que abre el documento correcto pero no respalda la frase sigue siendo un fallo.
Cuándo volver a buscar
El agente necesita señales observables:
- falta una entidad, periodo o jurisdicción necesaria;
- dos fuentes autorizadas se contradicen;
- el documento hallado está caducado;
- una subpregunta no tiene evidencia;
- la respuesta depende de una inferencia no respaldada;
- la búsqueda repite resultados sin aumentar cobertura.
La última señal evita bucles. Un presupuesto de consultas, tiempo y coste debe combinarse con una medida de progreso. Cuando no aparece información nueva, el sistema escala o declara el hueco.
Ejemplo mínimo: una investigación de política interna
De una pregunta a un expediente breve
Un empleado pregunta si puede contratar a un proveedor que aloja datos fuera del EEE. El agente identifica tres cuestiones: política de proveedores, clasificación de datos y excepción de transferencias.
Busca únicamente versiones aprobadas, filtra por fecha y conserva tres citas. Encuentra que la política general permite excepciones, pero no localiza quién puede aprobarlas. Reformula la búsqueda por rol y procedimiento. Si tampoco aparece, responde con lo que sí consta y señala el dato ausente; no inventa un aprobador plausible.
El resultado incluye fuentes, versión, consultas ejecutadas y el punto que requiere confirmación de privacidad.
La evaluación necesita tres capas
Evaluar solo la respuesta oculta dónde falló el sistema.
| Capa | Pregunta de prueba | Métrica útil |
|---|---|---|
| planificación | ¿descompuso lo necesario sin abrir ramas inútiles? | cobertura de subpreguntas y coste |
| recuperación | ¿trajo evidencia pertinente, autorizada y vigente? | recall, precisión, violaciones de filtro |
| respuesta | ¿cada afirmación está apoyada y bien citada? | exactitud, cobertura de citas y abstención |
Prepare conjuntos con preguntas simples, compuestas, irresolubles y adversariales. Incluya documentos duplicados, versiones vencidas y permisos distintos. Compare contra un RAG clásico: si la calidad apenas cambia, la complejidad no se justifica.
Cuándo no utilizarlo
Una FAQ estable, una búsqueda por número de pedido o una consulta con latencia muy estricta suelen resolverse mejor con rutas deterministas o RAG clásico. También conviene detenerse cuando el corpus carece de propietarios, metadatos o versiones: un agente buscará con más insistencia dentro del mismo desorden.
Microsoft ofrece incluso un esfuerzo mínimo que omite planificación con LLM para reducir coste y latencia. La posibilidad subraya una idea útil: “agentic” debería ser una decisión por consulta, no una propiedad obligatoria de toda la aplicación.
Preguntas frecuentes
¿Agentic RAG necesita varios agentes?
No. Un único orquestador con herramientas de búsqueda puede planificar e iterar. Añadir agentes especializados solo compensa cuando existen responsabilidades, fuentes o evaluaciones realmente separadas.
¿Puede buscar en Internet y en documentos internos?
Sí, si las fuentes y políticas lo permiten. Debe diferenciar procedencia, confianza, fecha y permisos, y evitar que contenido externo instruya al agente.
¿Cómo se evita que cite mal?
Con citas a nivel de pasaje, validación de entailment o revisión, y pruebas que penalicen afirmaciones sin respaldo. Mostrar una lista de enlaces al final no basta.
¿Qué latencia cabe esperar?
Depende de subconsultas, fuentes y modelos. Mídala por fases y paralelice solo ramas independientes. Establezca un camino rápido para preguntas sencillas.
La mejor respuesta puede ser una investigación incompleta bien cerrada
Cuando el sistema distingue lo probado, lo contradictorio y lo ausente, el lector puede decidir. Una respuesta fluida que oculta el hueco parece más competente durante unos segundos y resulta mucho menos útil después.
Fuentes y lecturas recomendadas
- Agentic Retrieval Overview — Azure AI Search
- RAG and Generative AI — Azure AI Search
- A practical guide to building agents — OpenAI
Fuentes y vigencia revisadas el 18 de agosto de 2026.