RAG: la recuperación como retorno a la similitud
Convierte la consulta en embedding, halla los fragmentos más cercanos por producto escalar y pégalos al contexto.
¿Cuándo y dónde es el retiro del equipo?
Llegaste al final de la muestra gratis. La siguiente lección necesita tu pase:
Pero responder es pasivo: ¿y actuar?
5.3 Herramientas y agentes: el bucle alrededor de un modelo congeladoPreguntas frecuentes
¿De qué trata "RAG: la recuperación como retorno a la similitud"?
¿Qué pregunta responde esta lección?
¿Qué sabré hacer después de esta lección?
¿Qué viene después?
Qué muestra esta lección
Convierte la consulta en embedding, halla los fragmentos más cercanos por producto escalar y pégalos al contexto.
La pregunta con la que abre
¿Cómo responde sobre cosas con las que nunca se entrenó?
El recorrido, en palabras de la propia lección
- Buen instinto. Toca cualquier otro fragmento para comparar y luego míralo funcionar.
- Un modelo congelado, cuatro documentos privados que nunca leyó. Toca el fragmento que te responde.
- Una pasada comentada: entra la pregunta, sale una respuesta con fundamento.
- Para que responda sobre tus documentos privados, tienes que reentrenar o hacer fine-tuning del modelo con ellos.
- Los pesos nunca cambian. La recuperación solo encuentra el fragmento correcto por similitud y lo pega en el context window, así el mismo modelo congelado lee la respuesta en vez de adivinarla.
- El modelo lee fielmente lo que gane la recuperación. Gana un fragmento plausible pero desactualizado, y la respuesta es errónea con total seguridad: la calidad de la recuperación decide la calidad de la respuesta. La lección E.15, la siguiente, trata de diseñar la recuperación para que esto no pase.
- Los pesos del modelo nunca cambian. La recuperación solo entrega el fragmento correcto a la ventana de contexto: el mismo modelo congelado de la Lección 5.1 ahora lee la respuesta en lugar de adivinarla.
- Este embed-y-pega de una sola pasada es el pipeline RAG clásico, y todavía impulsa buena parte de la búsqueda en documentos. Pero los asistentes modernos suelen buscar de forma agéntica: el modelo escribe búsquedas por palabra clave y multi-query, lee los resultados y vuelve a buscar hasta tener suficiente (lección 6.9). El principio es el mismo: encontrar el texto correcto y ponerlo en la window.
- Un bot de soporte no puede responder preguntas sobre tu producto, pero todas las respuestas están en los artículos de tu centro de ayuda. ¿Cuál es el arreglo más simple?
- Incrusta cada artículo y la pregunta del usuario, recupera el más cercano por similitud y déjalo caer en la ventana de contexto: eso es RAG. Sin reentrenar: solo le entregas al modelo congelado el texto correcto para leer, así que agregas documentos nuevos y al día siguiente ya responde.
- El fragmento de la reunión es el que te responde, y nunca dice la palabra offsite. Ahora mira CÓMO lo encuentra el sistema sin leer cada línea.
- Lo identificaste por significado, no por palabras clave. El significado vive como dirección en el espacio de coordenadas, así que el mismo producto punto de la Lección 1.3 puntúa cada fragmento frente a tu pregunta.
- Toca otro fragmento para ver por qué pierde, o continúa para ver la pasada.
- Demo de juguete: documentos enteros y un solo ganador. Los sistemas reales primero parten los documentos en fragmentos (chunks), recuperan los mejores en vez de uno solo y a menudo los reordenan; la E.15 muestra por qué importa el corte.
La idea clave
RAG = el truco de la similitud + pegar en el contexto.
Qué puedes hacer después de esta lección
Puedes explicar RAG: busca por similitud en tus documentos y pega los mejores en el contexto.
Ponte a prueba: ¿Qué es RAG, en esencia?
- Encontrar documentos relevantes por similitud y pegarlos en el contexto(correcta)
- Volver a entrenar el modelo con tus documentos
- Una ventana de contexto más grande
- Un decodificador más rápido
RAG recupera fragmentos relevantes por similitud y los pega en el prompt. El modelo sigue congelado; le das contexto nuevo, no lo reentrenas.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: RAGBases de datos vectorialesRAG o fine-tuning
Adónde lleva: Pero responder es pasivo: ¿y actuar?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.