Moonxi
Agendar diagnóstico
Guía · IA y arquitectura

RAG: cómo la IA responde sobre tu base sin reentrenar el modelo.

El mecanismo en cuatro pasos, qué decide de verdad la calidad de la respuesta, y las dos situaciones en que RAG es la herramienta equivocada y alguien lo descubre tarde.

La respuesta corta.

RAG es el modelo consultando una base que es tuya antes de responder. AWS lo describe como el proceso de optimizar la salida de un modelo de lenguaje para que consulte una base de conocimiento confiable fuera de las fuentes de entrenamiento. El modelo sigue siendo el mismo; lo que cambia es lo que lee antes de escribir.

La sigla viene de un artículo de 2020, de Patrick Lewis y colegas, presentado en NeurIPS. Ahí los modelos combinan dos memorias: la paramétrica, que está en los pesos del modelo, y la no paramétrica, que es un índice consultado en el momento. Toda implementación de RAG que existe hoy es una variación de esa idea.

Para una empresa, la consecuencia práctica es directa: el modelo puede responder sobre política interna, contratos, catálogo y historial sin mandar nada de eso a un entrenamiento, y sin esperar la próxima versión del modelo.

Los cuatro pasos.

Es la secuencia que describe AWS, en el orden en que ocurre con cada pregunta. El cuarto paso es el que más proyectos olvidan.

01.

Preparar la base externa

Los documentos que están fuera del entrenamiento del modelo se convierten en representaciones numéricas y se guardan en una base vectorial. Es esa base la que el modelo va a consultar, y es tuya, no del proveedor del modelo.

02.

Recuperar lo relevante

La pregunta de la persona también se convierte en una representación numérica y se compara con la base. Vuelven los fragmentos más cercanos por cálculo de similitud, no por palabra clave.

03.

Aumentar el prompt

Los fragmentos recuperados entran junto con la pregunta original en el pedido que se envía al modelo. El modelo responde mirando ese contexto, en vez de responder solo con lo que memorizó en el entrenamiento.

04.

Actualizar la base

El documento y la representación numérica se actualizan de forma automática o por lotes. Sin esta etapa el sistema envejece en silencio: sigue respondiendo con seguridad, ahora sobre la versión vieja de la política, del precio o del contrato.

La pregunta que lo decide todo: ¿cuál es la unidad que indexas?

Antes de elegir el modelo, elige el fragmento. Si la unidad indexada es un corte ciego de mil caracteres, la recuperación devuelve media frase de una cláusula y el comienzo de otra, y la respuesta sale mal con toda la apariencia de estar bien.

Un corte con significado

Cláusula, sección, ítem de catálogo, respuesta de un ticket. La unidad tiene que ser algo que una persona citaría entero.

La fuente pegada al fragmento

Documento, versión, página y fecha viajan con el fragmento. Sin eso la respuesta no puede mostrar de dónde salió, y después nadie audita nada.

El permiso en la recuperación

Quién puede ver qué se filtra antes de que el fragmento llegue al modelo. Pedirle al modelo que no lo cuente es control de acceso basado en buena voluntad.

Un conjunto de preguntas reales

Treinta preguntas que el negocio hace de verdad, con la respuesta correcta escrita al lado. Es lo que convierte "mejoró" en un número, y es lo que casi nadie arma antes.

Cuándo RAG resuelve, y cuándo no.

El patrón es bueno para una clase de problema y pésimo para otra. Saber la diferencia antes ahorra un trimestre.

Resuelve
  • Una pregunta cuya respuesta está escrita en algún documento de la empresa, y nadie encuentra el documento.
  • Conocimiento que cambia todas las semanas y no puede esperar una nueva versión de modelo.
  • Atención que tiene que citar la política vigente y mostrar el fragmento que usó.
  • Triaje: leer mucho y señalar qué debe mirar primero una persona.
No resuelve
  • Números. El saldo, el precio, el score y el plazo salen de un cálculo determinista y probado, con el modelo escribiendo solo el texto alrededor.
  • Respuestas que dependen de estado en vivo: el stock ahora, la posición del pedido ahora. Eso es una llamada a un sistema, no recuperación de documentos.
  • Una base que nadie mantiene. Si el documento fuente está desactualizado, RAG entrega el error más rápido y con más convicción.
  • Una decisión que tiene que ser siempre igual para la misma entrada. Una regla es una regla: escríbela como regla.

Preguntas sobre RAG.

¿Qué es RAG?

AWS define RAG como el proceso de optimizar la salida de un modelo de lenguaje para que consulte una base de conocimiento confiable, fuera de las fuentes de entrenamiento, antes de generar la respuesta. El término viene del artículo de Lewis y colegas, presentado en NeurIPS en 2020, que describió modelos combinando memoria paramétrica, entrenada, con memoria no paramétrica, recuperada de un índice.

¿RAG es lo mismo que entrenar el modelo con mis datos?

No. Entrenar cambia los pesos del modelo; RAG no toca el modelo y cambia la base que consulta. AWS señala el costo como la razón principal para preferir RAG: reentrenar un modelo fundacional con información específica de una organización tiene un costo computacional y financiero alto, y RAG introduce dato nuevo sin eso.

¿RAG elimina la alucinación?

La reduce, no la elimina. El modelo pasa a responder sobre un contexto que tú controlas, y eso corta la categoría de error en que inventa por no tener la información. Sigue siendo posible que interprete mal el fragmento recuperado; por eso la respuesta tiene que mostrar la fuente, para que la persona verifique en un clic.

¿Qué decide la calidad de un sistema RAG?

La recuperación, casi siempre. Si el fragmento correcto no vuelve de la base, ningún modelo salva la respuesta. Lo que más mueve la aguja es el tamaño y el corte del fragmento indexado, qué entra en la base, y qué se actualiza y con qué frecuencia. Nada de eso es una elección de modelo.

¿Cuándo RAG es la herramienta equivocada?

Cuando la respuesta es una cuenta y no un texto. El saldo, el precio, el score y el plazo deben salir de un cálculo determinista y probado; el modelo escribe el texto alrededor. El número siempre sale del cálculo. También es la herramienta equivocada cuando cada persona puede ver un pedazo distinto de la base: ahí el permiso tiene que aplicarse en la recuperación, y no pedírsele al modelo.

¿Necesito una base vectorial para hacer RAG?

Necesitas alguna forma de recuperar el fragmento correcto. La base vectorial es la implementación más común porque compara significado, no palabra exacta. En una base chica y bien estructurada, una búsqueda convencional bien hecha resuelve, y sale más barata de operar.

¿Quieres saber si tu base aguanta esto hoy?

En la mayoría de las empresas la respuesta es no. Lo que traba es el dato. El diagnóstico mira lo que tienes, dice qué hay que cambiar antes y cuánto cuesta cada parte.

Agendar diagnóstico → Leer la guía de agentes en producción

Fuentes

La definición y los cuatro pasos vienen de la página de AWS; el origen del término viene del artículo original, ambos abiertos el 9 de agosto de 2026. El resto es práctica de implantación y está descrito como práctica, no como hecho citable.