IdiomaENES
RetrievalSep 10, 2026 · 7 min de lectura

¿Qué es RAG? La generación aumentada por recuperación, explicada

Un modelo de lenguaje no conoce tu política de devoluciones. RAG es cómo lee tus documentos en el momento de la pregunta y responde desde lo que leyó.

Hernan MoyaCo-Founder
Four retrieved passages ranked by score, the strongest at 0.71 and the weakest at 0.35
Four retrieved passages ranked by score, the strongest at 0.71 and the weakest at 0.35

Un modelo de lenguaje no conoce tu política de devoluciones. Se entrenó con texto público meses antes de que alguien preguntara, y tu documentación no estaba ahí.

RAG es la forma de cerrar ese hueco sin reentrenar nada. El modelo lee tus documentos en el momento de la pregunta, y después responde desde lo que leyó.

Los cuatro pasos, cada vez

Generación aumentada por recuperación son cuatro palabras que describen dos mitades. La recuperación encuentra los fragmentos relevantes; la generación escribe la respuesta usándolos. Entre medio no se memoriza nada.

Recorre una pregunta paso a paso acá abajo y mira qué tiene, y qué no tiene, el modelo en cada etapa.

InteractiveRecorre una pregunta paso a paso

El cuarto paso es el que sorprende. El modelo no está recordando tu política: está leyendo un fragmento de ella que llegó hace medio segundo, igual que leerías una hoja que alguien te desliza sobre la mesa.

Por qué los documentos se cortan primero

Antes de todo esto, tus documentos se parten en fragmentos y cada fragmento se convierte en un vector. Ese vector es una posición en un espacio donde lo que significa cosas parecidas queda cerca.

Por eso una pregunta redactada de una forma que no se parece en nada a tu documentación igual la encuentra. "¿Puedo devolver esto?" y "Se aceptan devoluciones dentro de los 30 días" no comparten ninguna palabra útil, y aun así caen cerca.

Por qué no pegar todo en el prompt

La alternativa obvia es saltarse la recuperación y darle al modelo tu centro de ayuda completo. Tres cosas salen mal.

Problema
Qué pasa
No entra
Un centro de ayuda mediano son cientos de miles de tokens; las ventanas de contexto hoy son grandes, pero no tanto, y no son gratis
Cuesta en cada pregunta
Pagas los tokens de entrada cada vez que alguien pregunta, así que volcar todo hace que la pregunta más barata cueste como la más difícil
Baja la precisión
Un modelo al que le das cuarenta páginas encuentra la respuesta con menos fiabilidad que uno al que le das los cuatro fragmentos que importan

El tercero es el contraintuitivo. Más contexto no es más precisión. La recuperación es un filtro, y el filtro es lo que hace que la respuesta sea específica.

Qué no es RAG

Tres cosas se confunden con esto constantemente, y cada una cambia algo distinto.

Enfoque
Qué cambia
Cuándo sirve
RAG
Lo que el modelo puede leer al responder
Hechos que cambian, y que deben estar vigentes y ser citables
Fine-tuning
Cómo escribe el modelo, su formato y tono
Una forma de salida consistente o un estilo de casa
Entrenamiento
El modelo base en sí
No es algo que una empresa haga para sumar su propia política
Memoria de chat
Lo que recuerda de esta conversación
Continuidad dentro de una sesión, no conocimiento de empresa

Hacerle fine-tuning a un modelo con tu centro de ayuda es la forma cara de conseguir un resultado peor: los hechos quedan horneados adentro, así que actualizar uno significa volver a entrenar, y el modelo no puede decirte de qué página salió una respuesta.

Las citas vienen gratis, y ese es el punto

Como los fragmentos se conocen antes de escribir la respuesta, el sistema puede mostrarlos. Eso convierte una respuesta en algo verificable en vez de una afirmación.

Las fuentes no son una nota al pie. Son los fragmentos desde los que se escribió la respuesta.

También te da una vía de reparación. Cuando una respuesta está mal puedes leer el fragmento que la sostiene y ver de inmediato si el documento está mal o si la recuperación falló.

Dónde se rompe

RAG falla en la recuperación mucho más seguido que en la generación. Si el fragmento correcto nunca llega al modelo, ningún prompt salva la respuesta.

Las causas habituales son fragmentos cortados del tamaño equivocado, documentos que se contradicen y contenido que nunca se escribió. Las tres tienen arreglo, y ninguna es un problema del modelo.

welcomeai.devCómo mejorar recuperación cambiando tamaño de chunks

Qué necesita un montaje que funcione

  1. Un lugar donde vivan los documentos, y una forma de mantenerlos vigentes
  2. Un modelo de embeddings, usado igual para documentos y para preguntas
  3. Un índice vectorial que se pueda buscar lo bastante rápido como para caber en un request
  4. Un paso de recuperación que devuelva fragmentos con scores que puedas leer
  5. Un modelo instruido para responder desde esos fragmentos, y para decirlo cuando no cubren la pregunta

La quinta línea es lo que separa un sistema que dice "no lo sé" de uno que se inventa la respuesta.

Preguntas frecuentes

Si estás decidiendo si RAG encaja, la pregunta no es técnica. Es si las respuestas que necesitas dependen de documentos que cambian, y si quien las lee necesita ver de dónde salió cada una.

Etiquetadoragretrievalembeddingsknowledge-basecitations
Escrito porHernan Moya

Sigue leyendo

    ¿Qué es RAG? Generación aumentada por recuperación