RAG —Retrieval-Augmented Generation o generación aumentada mediante recuperación— es un patrón de arquitectura que busca información externa relevante y la incorpora al contexto de un modelo generativo antes de producir una respuesta.
RAG permite trabajar con conocimiento privado, especializado o cambiante sin incorporarlo de forma permanente a los parámetros del modelo. No garantiza que la respuesta sea correcta: la calidad depende de qué se recupera, qué contexto se entrega y cómo se valida la salida.
Cómo funciona un sistema RAG
La recuperación aporta evidencia; el modelo sigue necesitando instrucciones, controles y criterios de salida.
En una implementación empresarial suelen aparecer estas etapas:
- Preparar el conocimiento. Se identifican fuentes, propietarios, versiones, fechas de vigencia, estructura y permisos. Los documentos pueden dividirse en unidades recuperables, pero deben conservar su relación con el original.
- Representar e indexar. El contenido se almacena de forma que permita búsqueda léxica, semántica o híbrida. Una base vectorial es una opción técnica, no la definición de RAG.
- Recuperar. La pregunta se transforma en una o varias consultas. El sistema filtra por permisos y metadatos, recupera candidatos y puede reordenarlos según relevancia.
- Construir el contexto. Se seleccionan fragmentos, documentos o registros que caben en la ventana del modelo y aportan la evidencia necesaria.
- Generar y controlar. El modelo responde con ese contexto. La aplicación puede exigir citas, detectar ausencia de evidencia, aplicar reglas y registrar qué recibió el modelo.
El trabajo decisivo suele estar antes de la generación. Un índice con documentos caducados, duplicados o mal autorizados no se arregla con un prompt mejor.
Ejemplo empresarial
Una persona pregunta a un asistente interno qué gastos de viaje puede aprobar en Francia. El sistema identifica al usuario, filtra las políticas vigentes para su filial, recupera el apartado aplicable y genera una respuesta con enlace a la fuente y fecha de vigencia.
Si encuentra dos políticas contradictorias o ninguna evidencia suficiente, la respuesta adecuada no es completar el hueco con conocimiento general. Debe indicar la incertidumbre y dirigir el caso al propietario de la política.
Cuándo conviene utilizar RAG
RAG encaja cuando el conocimiento cambia con más frecuencia que el modelo, procede de fuentes privadas, debe filtrarse por identidad o necesita trazabilidad. Es habitual en buscadores conversacionales, soporte técnico, consulta de políticas, análisis documental y asistentes internos.
Puede no ser la mejor opción cuando:
- la tarea no necesita conocimiento externo, como transformar un texto ya proporcionado;
- existe una API o consulta estructurada que devuelve directamente el dato correcto;
- el conjunto de documentos es pequeño, seleccionado y cabe completo en el contexto;
- el repositorio carece de propietarios, permisos o versiones fiables;
- una respuesta aproximada no es aceptable y el proceso requiere una regla determinista.
La comparación no es solo «RAG o fine-tuning». También puede ser RAG, contexto largo, una herramienta estructurada o una combinación. La guía de INSTINTIA sobre RAG, contexto largo o memoria aprendida desarrolla esa decisión.
Cómo se evalúa
Separar recuperación y generación evita atribuir todos los fallos al modelo.
| Capa | Pregunta de evaluación | Señales útiles |
|---|---|---|
| Recuperación | ¿Entró la evidencia necesaria? | cobertura de la fuente correcta, posición, permisos y vigencia |
| Contexto | ¿Se entregó suficiente información sin ruido? | fragmentos relevantes, duplicados, contradicciones y pérdida de estructura |
| Respuesta | ¿La afirmación está respaldada? | fidelidad a las fuentes, citas válidas, completitud y abstención |
| Sistema | ¿Funciona en el proceso real? | latencia, coste, seguridad, satisfacción, correcciones e impacto operativo |
Una respuesta fluida no demuestra calidad. Prueba preguntas normales, ambiguas, irresolubles, con documentos vencidos, con permisos distintos y con instrucciones maliciosas dentro de las fuentes.
Qué no debe confundirse con RAG
- Búsqueda semántica: recupera contenido parecido; RAG añade una etapa generativa.
- Base de datos vectorial: es una posible infraestructura de recuperación, no el sistema completo.
- Fine-tuning: modifica parámetros del modelo; RAG aporta contexto en el momento de la consulta.
- Contexto largo: permite introducir más información en una llamada, pero no decide qué fuentes son pertinentes o autorizadas.
- Agentic RAG: permite que un sistema planifique y repita búsquedas. Añade flexibilidad, coste y nuevos modos de fallo; no es necesario para cada consulta.
La decisión útil
No preguntes primero qué base vectorial utilizar. Pregunta qué evidencia necesita cada respuesta, quién puede verla, cómo se mantiene vigente y qué debe ocurrir cuando no aparece.
Para profundizar en consultas complejas, consulta Agentic RAG: cuando recuperar documentos ya no es suficiente.
Fuentes y lecturas recomendadas
- Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, trabajo que introdujo el término RAG, 2020.
- Microsoft Learn: RAG and generative AI, arquitectura y variantes de recuperación, consultado el 20 de agosto de 2026.
- INSTINTIA: diseñar un agente de conocimiento empresarial fiable, aplicación práctica de fuentes, permisos, evaluación y operación.
Definición y vigencia revisadas el 20 de agosto de 2026.