Qué es RAG: buscar antes de responder no garantiza acertar
RAG añade una fase de búsqueda antes de que el modelo responda. La clave es separar la calidad del corpus, la recuperación y la generación para saber dónde falla.
El 22 de mayo de 2020, un grupo de investigadores presentó un sistema que hacía algo sencillo de explicar y difícil de ejecutar bien: antes de redactar una respuesta, buscaba pasajes en una colección externa. El trabajo que dio nombre a la generación aumentada con recuperación, o RAG por sus siglas en inglés, combinaba dos memorias. Una estaba dentro de los parámetros de un modelo; la otra era un índice consultable de Wikipedia.
Ese patrón aparece hoy detrás de asistentes que contestan sobre manuales, catálogos o documentación interna. Su ventaja no es que convierta al modelo en una autoridad. Es más concreta: permite poner delante del generador información seleccionada en el momento de la consulta y cambiar esa colección sin volver a entrenarlo. Su límite también es concreto: si la selección es mala, la respuesta puede quedar peor informada que si no se hubiera recuperado nada.
La capacidad útil para el lector consiste en no evaluar un sistema RAG como una caja única. Hay que formular tres preguntas distintas: ¿la evidencia existía en la colección?, ¿el buscador la recuperó?, ¿la respuesta dice únicamente lo que esa evidencia permite sostener? Cada pregunta corresponde a un fallo diferente y exige una corrección diferente.
Dos memorias y cinco pasos
El RAG original distinguía entre memoria paramétrica y no paramétrica. La primera es lo que el modelo ha incorporado durante el entrenamiento: regularidades del lenguaje y conocimiento comprimido en sus pesos. La segunda es texto exterior que puede inspeccionarse y sustituirse. En el experimento de 2020, esa memoria exterior era una copia de Wikipedia de diciembre de 2018, dividida en unos 21 millones de fragmentos de cien palabras. Esa fecha importa: el sistema podía consultar su índice, pero no conocer en él hechos posteriores a la copia.
En una aplicación contemporánea, el recorrido suele tener cinco etapas. Primero se incorporan documentos: hay que extraer el texto de PDF, páginas o registros y conservar datos como la fecha, la versión y los permisos. Después se dividen en fragmentos. En tercer lugar, una consulta se transforma en una representación apta para buscar. El recuperador ordena pasajes candidatos y entrega unos pocos al modelo. Por último, el generador redacta usando la pregunta, las instrucciones y el contexto recuperado.
La preparación no es una tarea administrativa menor. Un documento ausente no puede recuperarse. Una tabla mal extraída puede perder la relación entre una cifra y su encabezado. Un fragmento demasiado corto puede separar una excepción de la regla a la que limita; uno demasiado largo puede llenar la ventana de contexto con material irrelevante. También hay que decidir qué versión prevalece cuando dos políticas se contradicen y qué usuario está autorizado a ver cada resultado.
Cómo busca: palabras, significado y límites
Un buscador clásico como BM25 valora coincidencias de términos. Un recuperador denso representa la pregunta y los pasajes mediante vectores y los compara matemáticamente. El paper de Dense Passage Retrieval, o DPR, mostró en 2020 que un sistema de doble codificador podía superar a una implementación fuerte de BM25 en varios conjuntos de preguntas abiertas. La cifra destacada por sus autores fue una mejora absoluta de entre 9 y 19 puntos en la probabilidad de que uno de los veinte primeros pasajes contuviera la respuesta.
Esa cifra no significa que la búsqueda semántica sea universalmente superior. En el propio estudio, DPR quedó por debajo de BM25 en SQuAD, un conjunto donde pregunta y pasaje compartían muchas palabras. El análisis cualitativo también encontró el reparto de fortalezas: DPR captaba variaciones léxicas y relaciones semánticas, pero podía perder frases raras y decisivas que el emparejamiento literal sí encontraba. Por eso algunos sistemas combinan búsqueda densa y léxica y añaden un segundo ordenador de resultados.
La similitud tampoco certifica autoridad. Un pasaje puede ser cercano a la pregunta y estar anticuado, expresar una opinión o describir una excepción. El recuperador asigna relevancia según su función de puntuación; no realiza por sí solo una investigación sobre la veracidad del documento. Más resultados tampoco garantizan una respuesta mejor: cada fragmento adicional puede aportar evidencia, pero también ruido o contradicciones.
Qué hace el generador con los pasajes
El artículo fundacional probó dos formulaciones. RAG-Sequence condicionaba toda la respuesta a los mismos documentos recuperados; RAG-Token permitía que distintos tokens dependieran de documentos diferentes. Las variantes comerciales actuales no tienen por qué reproducir esa arquitectura, pero la distinción enseña algo duradero: recuperar y generar son operaciones separadas. Un pasaje puede llegar correctamente al modelo y aun así quedar mal resumido, mezclado con otro o ignorado.
El generador tampoco queda encerrado automáticamente dentro de las fuentes. El experimento original observó respuestas correctas incluso cuando la respuesta no estaba literalmente en los pasajes recuperados, porque el modelo podía recurrir a su memoria paramétrica. Esa flexibilidad ayudaba en las pruebas, pero impide asumir que cada frase proviene del índice. Mostrar un enlace al lado de una respuesta solo es útil si la afirmación concreta se desprende realmente del texto enlazado.
Ésa es la diferencia entre procedencia y respaldo. La procedencia dice qué documentos vio el sistema. El respaldo exige comprobar que esos documentos contienen evidencia para la frase, que no existe una negación perdida y que la respuesta no añadió una precisión ausente. Una interfaz puede producir citas impecables en apariencia y, sin embargo, atribuir al pasaje una conclusión que éste nunca formula.
Los tres lugares donde falla
El primer fallo está en la colección. Puede faltar el documento correcto, sobrar una versión derogada o haberse roto la extracción. Se diagnostica buscando directamente la evidencia en el corpus y verificando metadatos, fechas y permisos. Reentrenar el modelo no arregla una política que nunca se incorporó al índice.
El segundo fallo está en la recuperación. La evidencia existe, pero no aparece entre los candidatos entregados al generador. Para verlo hay que inspeccionar los pasajes recuperados y medir si el conjunto de los primeros resultados contiene el soporte necesario. Ajustar la consulta, combinar recuperación léxica y densa, cambiar la fragmentación o reordenar candidatos puede ayudar. Pedirle al generador que sea más cuidadoso no recuperará un texto que nunca vio.
El tercer fallo está en la generación. La evidencia correcta llegó, pero la respuesta la contradice, la amplía sin apoyo o no señala sus límites. Aquí se evalúan fidelidad y corrección afirmación por afirmación. Las soluciones pueden incluir mejores instrucciones, formatos que obliguen a asociar frase y fuente, verificación posterior o abstención. Una puntuación final de respuesta no basta para localizar cuál de las tres capas produjo el error.
Cuando la respuesta correcta es no responder
Las demostraciones suelen probar preguntas contestables: la evidencia existe y el sistema debe encontrarla. Eso deja fuera un caso cotidiano, la pregunta que la base no puede resolver. El marco UAEval4RAG presentado en ACL 2025 se diseñó precisamente para medir si un RAG rechaza solicitudes no contestables. Sus autores distinguieron seis tipos, desde preguntas ambiguas o con una premisa falsa hasta solicitudes fuera de la base, y comprobaron que ninguna configuración fue óptima a la vez para preguntas contestables y no contestables en todos los conjuntos estudiados.
El resultado no autoriza una cifra universal sobre todos los sistemas: el estudio empleó consultas sintetizadas, evaluó interacciones de un solo turno y señaló que harían falta más fuentes verificadas por personas y pruebas adaptadas a cada aplicación. Sí establece un criterio de producto: medir solo cuántas respuestas acierta recompensa a un sistema que contesta incluso cuando carece de evidencia. También hay que medir cuándo pide una aclaración, reconoce el límite de su base o se abstiene.
Recuperar información engañosa puede empeorar el resultado
RAG suele venderse como remedio contra las alucinaciones, pero el corpus real no es limpio. Puede contener errores, propaganda o textos que presentan datos ciertos de forma engañosa. Un trabajo de NeurIPS 2025 sobre verificación de hechos construyó una prueba con afirmaciones verificadas y pasajes procedentes de debates en Reddit. En ese escenario concreto, todos los modelos RAG evaluados rindieron peor al recibir contexto potencialmente engañoso que sus versiones sin contexto.
La conclusión tiene límites: las etiquetas intermedias se apoyaron en GPT-4, la prueba se centró en verificación política y el estudio humano tuvo solo 64 casos y cuatro participantes. No demuestra que cualquier RAG empeore siempre ni que Reddit represente todo corpus empresarial. Demuestra algo más preciso: recuperar texto no es una operación neutral, y las evaluaciones con documentos ideales pueden sobrestimar la robustez frente a información contradictoria o manipuladora.
Una auditoría que sirve para cualquier RAG
Antes de confiar en una respuesta, conviene recorrer la cadena en orden. Primero, delimitar la colección: qué fuentes contiene, cuándo se actualizaron, quién puede modificarlas y qué permisos se respetan. Segundo, mirar los pasajes realmente recuperados, no solo las citas elegidas para la interfaz. Tercero, dividir la respuesta en afirmaciones y comprobar si cada una está respaldada, contradicha o no resuelta por esos pasajes.
Para evaluar el sistema, las métricas deben conservar esa separación. La recuperación puede medirse por la presencia de la evidencia necesaria entre los primeros resultados. La generación, por fidelidad a la evidencia y corrección. El sistema completo, por aciertos, citas realmente sustentadas y abstenciones adecuadas. También necesita pruebas con documentos antiguos, versiones enfrentadas, preguntas ambiguas y contenido engañoso, no únicamente ejemplos donde la respuesta está preparada para aparecer.
RAG no es una vacuna contra el error, sino una arquitectura que hace parte del camino más visible y actualizable. Su valor aparece cuando esa visibilidad se usa para diagnosticar. Si la evidencia no estaba en la colección, falló la memoria externa; si estaba pero no llegó al modelo, falló la recuperación; si llegó y la respuesta no la respetó, falló la generación. Poder distinguir esas tres averías es mucho más útil que saber repetir las siglas.
Fuentes de esta pieza
Esta pieza se apoya en 6 fuente(s) primaria(s), recogidas durante la investigación.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.