Recursos / Glosario de IA / RAG (Retrieval-Augmented Generation)

RAG (Retrieval-Augmented Generation)

IA

RAGRetrieval-Augmented Generation o generación aumentada mediante recuperación— es un patrón de arquitectura que busca información externa relevante y la incorpora al contexto de un modelo generativo antes de producir una respuesta.

RAG permite trabajar con conocimiento privado, especializado o cambiante sin incorporarlo de forma permanente a los parámetros del modelo. No garantiza que la respuesta sea correcta: la calidad depende de qué se recupera, qué contexto se entrega y cómo se valida la salida.

Cómo funciona un sistema RAG

Pregunta, identidad y contexto del usuario
Buscar y filtrar
Seleccionar evidencia
Construir el contexto
Responder, citar o abstenerse

La recuperación aporta evidencia; el modelo sigue necesitando instrucciones, controles y criterios de salida.

En una implementación empresarial suelen aparecer estas etapas:

  1. Preparar el conocimiento. Se identifican fuentes, propietarios, versiones, fechas de vigencia, estructura y permisos. Los documentos pueden dividirse en unidades recuperables, pero deben conservar su relación con el original.
  2. Representar e indexar. El contenido se almacena de forma que permita búsqueda léxica, semántica o híbrida. Una base vectorial es una opción técnica, no la definición de RAG.
  3. Recuperar. La pregunta se transforma en una o varias consultas. El sistema filtra por permisos y metadatos, recupera candidatos y puede reordenarlos según relevancia.
  4. Construir el contexto. Se seleccionan fragmentos, documentos o registros que caben en la ventana del modelo y aportan la evidencia necesaria.
  5. Generar y controlar. El modelo responde con ese contexto. La aplicación puede exigir citas, detectar ausencia de evidencia, aplicar reglas y registrar qué recibió el modelo.

El trabajo decisivo suele estar antes de la generación. Un índice con documentos caducados, duplicados o mal autorizados no se arregla con un prompt mejor.

Ejemplo empresarial

Una persona pregunta a un asistente interno qué gastos de viaje puede aprobar en Francia. El sistema identifica al usuario, filtra las políticas vigentes para su filial, recupera el apartado aplicable y genera una respuesta con enlace a la fuente y fecha de vigencia.

Si encuentra dos políticas contradictorias o ninguna evidencia suficiente, la respuesta adecuada no es completar el hueco con conocimiento general. Debe indicar la incertidumbre y dirigir el caso al propietario de la política.

Cuándo conviene utilizar RAG

RAG encaja cuando el conocimiento cambia con más frecuencia que el modelo, procede de fuentes privadas, debe filtrarse por identidad o necesita trazabilidad. Es habitual en buscadores conversacionales, soporte técnico, consulta de políticas, análisis documental y asistentes internos.

Puede no ser la mejor opción cuando:

  • la tarea no necesita conocimiento externo, como transformar un texto ya proporcionado;
  • existe una API o consulta estructurada que devuelve directamente el dato correcto;
  • el conjunto de documentos es pequeño, seleccionado y cabe completo en el contexto;
  • el repositorio carece de propietarios, permisos o versiones fiables;
  • una respuesta aproximada no es aceptable y el proceso requiere una regla determinista.

La comparación no es solo «RAG o fine-tuning». También puede ser RAG, contexto largo, una herramienta estructurada o una combinación. La guía de INSTINTIA sobre RAG, contexto largo o memoria aprendida desarrolla esa decisión.

Cómo se evalúa

Separar recuperación y generación evita atribuir todos los fallos al modelo.

Capa Pregunta de evaluación Señales útiles
Recuperación ¿Entró la evidencia necesaria? cobertura de la fuente correcta, posición, permisos y vigencia
Contexto ¿Se entregó suficiente información sin ruido? fragmentos relevantes, duplicados, contradicciones y pérdida de estructura
Respuesta ¿La afirmación está respaldada? fidelidad a las fuentes, citas válidas, completitud y abstención
Sistema ¿Funciona en el proceso real? latencia, coste, seguridad, satisfacción, correcciones e impacto operativo

Una respuesta fluida no demuestra calidad. Prueba preguntas normales, ambiguas, irresolubles, con documentos vencidos, con permisos distintos y con instrucciones maliciosas dentro de las fuentes.

Qué no debe confundirse con RAG

  • Búsqueda semántica: recupera contenido parecido; RAG añade una etapa generativa.
  • Base de datos vectorial: es una posible infraestructura de recuperación, no el sistema completo.
  • Fine-tuning: modifica parámetros del modelo; RAG aporta contexto en el momento de la consulta.
  • Contexto largo: permite introducir más información en una llamada, pero no decide qué fuentes son pertinentes o autorizadas.
  • Agentic RAG: permite que un sistema planifique y repita búsquedas. Añade flexibilidad, coste y nuevos modos de fallo; no es necesario para cada consulta.

La decisión útil

No preguntes primero qué base vectorial utilizar. Pregunta qué evidencia necesita cada respuesta, quién puede verla, cómo se mantiene vigente y qué debe ocurrir cuando no aparece.

Para profundizar en consultas complejas, consulta Agentic RAG: cuando recuperar documentos ya no es suficiente.

Fuentes y lecturas recomendadas

Definición y vigencia revisadas el 20 de agosto de 2026.

Elaborado con asistencia de herramientas de IA y revisado por el equipo de INSTINTIA, que asume la responsabilidad editorial del contenido.

¿Quieres aplicar esto en tu empresa?

Solicitar diagnóstico gratuito AI Discovery Day