
Un modelo de lenguaje no conoce tu política de devoluciones. Se entrenó con texto público meses antes de que alguien preguntara, y tu documentación no estaba ahí.
RAG es la forma de cerrar ese hueco sin reentrenar nada. El modelo lee tus documentos en el momento de la pregunta, y después responde desde lo que leyó.
Los cuatro pasos, cada vez
Generación aumentada por recuperación son cuatro palabras que describen dos mitades. La recuperación encuentra los fragmentos relevantes; la generación escribe la respuesta usándolos. Entre medio no se memoriza nada.
Recorre una pregunta paso a paso acá abajo y mira qué tiene, y qué no tiene, el modelo en cada etapa.
El cuarto paso es el que sorprende. El modelo no está recordando tu política: está leyendo un fragmento de ella que llegó hace medio segundo, igual que leerías una hoja que alguien te desliza sobre la mesa.
Por qué los documentos se cortan primero
Antes de todo esto, tus documentos se parten en fragmentos y cada fragmento se convierte en un vector. Ese vector es una posición en un espacio donde lo que significa cosas parecidas queda cerca.
Por eso una pregunta redactada de una forma que no se parece en nada a tu documentación igual la encuentra. "¿Puedo devolver esto?" y "Se aceptan devoluciones dentro de los 30 días" no comparten ninguna palabra útil, y aun así caen cerca.
Por qué no pegar todo en el prompt
La alternativa obvia es saltarse la recuperación y darle al modelo tu centro de ayuda completo. Tres cosas salen mal.
El tercero es el contraintuitivo. Más contexto no es más precisión. La recuperación es un filtro, y el filtro es lo que hace que la respuesta sea específica.
Qué no es RAG
Tres cosas se confunden con esto constantemente, y cada una cambia algo distinto.
Hacerle fine-tuning a un modelo con tu centro de ayuda es la forma cara de conseguir un resultado peor: los hechos quedan horneados adentro, así que actualizar uno significa volver a entrenar, y el modelo no puede decirte de qué página salió una respuesta.
Las citas vienen gratis, y ese es el punto
Como los fragmentos se conocen antes de escribir la respuesta, el sistema puede mostrarlos. Eso convierte una respuesta en algo verificable en vez de una afirmación.
También te da una vía de reparación. Cuando una respuesta está mal puedes leer el fragmento que la sostiene y ver de inmediato si el documento está mal o si la recuperación falló.
Dónde se rompe
RAG falla en la recuperación mucho más seguido que en la generación. Si el fragmento correcto nunca llega al modelo, ningún prompt salva la respuesta.
Las causas habituales son fragmentos cortados del tamaño equivocado, documentos que se contradicen y contenido que nunca se escribió. Las tres tienen arreglo, y ninguna es un problema del modelo.
welcomeai.devCómo mejorar recuperación cambiando tamaño de chunksQué necesita un montaje que funcione
- Un lugar donde vivan los documentos, y una forma de mantenerlos vigentes
- Un modelo de embeddings, usado igual para documentos y para preguntas
- Un índice vectorial que se pueda buscar lo bastante rápido como para caber en un request
- Un paso de recuperación que devuelva fragmentos con scores que puedas leer
- Un modelo instruido para responder desde esos fragmentos, y para decirlo cuando no cubren la pregunta
La quinta línea es lo que separa un sistema que dice "no lo sé" de uno que se inventa la respuesta.
Preguntas frecuentes
Si estás decidiendo si RAG encaja, la pregunta no es técnica. Es si las respuestas que necesitas dependen de documentos que cambian, y si quien las lee necesita ver de dónde salió cada una.


