El documento correcto estaba en el repositorio. El agente citó otro: una versión de 2023 con el mismo título y mejor puntuación semántica. Este fallo no se arregla pidiendo al modelo que “compruebe mejor”.
El conocimiento empresarial fiable se construye antes de generar la respuesta: durante la ingesta, en los metadatos, al aplicar permisos y en la forma de recuperar y presentar evidencia.
La ingesta empieza por decidir qué es verdad
Antes de indexar conviene inventariar fuentes y propietarios. ¿Qué sistema contiene la política vigente? ¿Qué documento sustituye a cuál? ¿Un correo es norma o excepción? Si copiamos todo a un índice sin resolver estas relaciones, aceleramos la confusión.
Cada documento necesita identificador estable, fuente, propietario, tipo, ámbito, fecha de vigencia, versión, estado y permisos. Los fragmentos heredan esos datos y conservan un enlace al original. Cuando cambia una política, el proceso debe retirar o marcar la anterior; añadir la nueva no basta.
La ingesta también registra fallos. Un PDF sin texto, una tabla rota o un conector que no sincroniza no debería desaparecer silenciosamente. La cobertura del índice es una métrica operativa.
Dividir sin perder estructura
El troceado permite recuperar pasajes concretos, pero puede separar una cláusula de sus excepciones o una cifra de su encabezado. El tamaño óptimo depende del contenido. Contratos, manuales y tablas requieren estrategias diferentes.
Conviene conservar títulos, numeración, página, sección y relaciones padre-hijo. Para algunas preguntas se recupera un fragmento y se amplía con sus vecinos; para otras, primero se localiza el documento y después se busca dentro. No existe un único tamaño universal.
Una prueba temprana consiste en tomar preguntas reales y comprobar si el fragmento recuperado contiene por sí mismo la evidencia necesaria. Si necesita contexto adyacente, la tubería debe aportarlo.
Recuperación híbrida y reranking
La búsqueda vectorial encuentra similitud de significado. La búsqueda léxica destaca nombres, códigos y términos exactos. Juntas suelen cubrir mejor el lenguaje empresarial. Azure AI Search documenta el patrón híbrido, que ejecuta texto y vectores en paralelo, fusiona los resultados y puede aplicar ranking semántico (Microsoft).
Después del primer conjunto, un reranker evalúa la relación entre pregunta y pasaje con mayor precisión. Los metadatos aplican filtros o preferencias: país, producto, fecha, tipo documental y estado aprobado.
El orden importa. Los permisos y exclusiones obligatorias se aplican antes de que el contenido llegue al modelo. El reranking decide entre candidatos autorizados; nunca debe “compensar” una restricción.
Los permisos también se indexan
Un agente no puede responder con información que el usuario no podría abrir en el sistema original. Filtrar después de generar es demasiado tarde. La identidad del solicitante debe acompañar la consulta y el motor devolver solo documentos autorizados.
Microsoft describe varias opciones de control documental y advierte que los cambios de permisos solo se reflejan cuando los metadatos se sincronizan con el índice (Microsoft). Esa latencia es parte del riesgo. Si se retira un acceso urgente, puede ser necesario invalidar el índice de inmediato.
Los permisos deben aplicarse a búsqueda léxica, vectorial, cachés y fragmentos vecinos. Una ruta olvidada abre una fuga. Las pruebas incluyen usuarios de grupos distintos y cambios de membresía.
Responder con evidencia, no con confianza
El modelo recibe pasajes etiquetados con fuente, fecha y versión. La instrucción le pide apoyar afirmaciones materiales y abstenerse cuando la evidencia es insuficiente o conflictiva. Las citas deben apuntar al documento y ubicación que el usuario puede comprobar.
No basta con mostrar tres enlaces al final. Debe quedar claro qué fuente respalda cada afirmación. Si dos políticas vigentes chocan, el agente señala el conflicto y lo eleva; no elige la que produce una respuesta más fluida.
La verificación puede comprobar automáticamente que cada cita existe, que el texto citado pertenece a la fuente y que el usuario conserva acceso. Para respuestas críticas, un evaluador adicional compara afirmaciones con pasajes.
Vigencia y frescura como controles
Cada fuente tiene una expectativa de actualización. Un catálogo puede cambiar cada hora; un procedimiento, cada trimestre. Definimos acuerdos de frescura y alertas cuando una sincronización falla. “Última indexación correcta” es más útil que la fecha del último intento.
Las consultas sensibles pueden exigir una versión mínima o acudir a la fuente en tiempo real. También conviene mostrar la fecha de vigencia, no solo la de publicación. Un documento futuro puede estar publicado y aún no aplicar.
La caché debe respetar las mismas reglas. Una respuesta correcta ayer puede ser incorrecta hoy si cambió la política o el permiso.
Evaluar la cadena completa
Separamos recuperación y generación. Para recuperación medimos si aparecen los pasajes necesarios, en qué posición y con qué ruido. Para generación, fidelidad a las fuentes, cobertura, citas y abstención. Después probamos el flujo completo con latencia y coste.
El conjunto incluye preguntas sin respuesta, términos internos, códigos exactos, documentos obsoletos, conflictos y usuarios sin permiso. También consultas conversacionales que requieren reformulación.
Azure distingue RAG clásico —más simple y controlable— de recuperación agentic para consultas complejas con descomposición y varias fuentes (Microsoft). La segunda opción no debe adoptarse por defecto: añade llamadas, latencia y trayectorias que evaluar.
La arquitectura mínima
Una base sólida tiene cinco componentes: conectores con control de cambios; índice con texto, vectores y metadatos; capa de autorización; recuperación híbrida con reranking; y generación con citas y trazas. Alrededor, evaluación, monitorización de frescura y herramientas de corrección.
El modelo es reemplazable. La procedencia no. Si sabemos qué documento se usó, qué versión estaba vigente y qué permisos se aplicaron, podemos investigar y mejorar. Sin eso, una respuesta convincente solo es una apuesta con buena redacción.
Preguntas frecuentes
¿Basta con una base vectorial?
Rara vez. Los códigos y nombres exactos se benefician de búsqueda léxica; permisos, vigencia y ámbito requieren metadatos y filtros.
¿Cómo tratamos documentos duplicados?
Con identificadores canónicos, relaciones de versión y reglas de sustitución durante la ingesta. No espere que el ranking resuelva duplicados contradictorios.
¿Qué ocurre si no hay evidencia suficiente?
El agente debe decirlo, mostrar qué buscó y proponer el siguiente paso. Inventar una respuesta rompe la confianza más rápido que una abstención útil.
¿Las citas garantizan que la respuesta sea correcta?
No. Una cita puede ser irrelevante o no respaldar la afirmación. Hay que verificar correspondencia, vigencia y permisos.
¿Cuándo merece la pena la recuperación agentic?
Cuando las preguntas requieren descomposición, varias fuentes o búsquedas iterativas y esa mejora compensa latencia, coste y complejidad de evaluación.