Saltar al contenido
todas las lecciones
Salas electivasE.15Bloqueada

Ingeniería de retrieval: por qué RAG acierta o falla

Le diste los documentos al modelo, y aun así citó el equivocado y se saltó un hecho obvio. Se suponía que RAG arreglaba esto.

La idea que hay dentro

La calidad del retrieval se diseña: chunking, búsqueda híbrida (keyword + semántica), reranking, citas y frescura deciden si el contexto correcto siquiera llega al modelo.

Después de esta lección

Puedes diagnosticar por qué falla una respuesta de RAG y arreglarla en la capa de retrieval (chunking, búsqueda híbrida, reranking, citas, frescura) en vez de culpar al modelo.

Adónde lleva

El retrieval ya encuentra el texto correcto. Pero responder sigue siendo pasivo, ¿y actuar?

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

La calidad del retrieval se diseña: chunking, búsqueda híbrida (keyword + semántica), reranking, citas y frescura deciden si el contexto correcto siquiera llega al modelo.

La pregunta con la que abre

Le diste los documentos al modelo, y aun así citó el equivocado y se saltó un hecho obvio. Se suponía que RAG arreglaba esto.

El recorrido, en palabras de la propia lección

  • Ajusta el pipeline de retrieval hasta que el bot responda 30 días, anclado en el documento correcto.
  • La búsqueda semántica clava el significado. Predice si puede encontrar un número de pieza exacto.
  • Cuando RAG falla, el modelo casi nunca es el problema. Lo es el retrieval.
  • La semántica sola pone primero el chunk de devoluciones general, nunca ve el código exacto. La de palabra clave sola encuentra el código pero no distingue la política vigente de la archivada. Usa búsqueda híbrida, activa el reranking para subir el match exacto arriba y activa el filtro de frescura para descartar el duplicado viejo de 14 días.
  • Los puntajes aquí son ilustrativos, no un motor de ranking real, pero los modos de fallo que muestran sí son reales.
  • La búsqueda semántica es excelente con el significado. ¿Encontrará de forma fiable un documento por un número de pieza exacto como RX-2024?
  • Los embeddings capturan el significado, así que un token exacto como RX-2024 se difumina entre ideas cercanas. Los tokens e IDs exactos necesitan coincidencia por palabra clave (léxica). La búsqueda híbrida corre ambas, la léxica para atrapar el código literal y la semántica para atrapar el significado, y luego combina los resultados.
  • El chunking es el corte que ocurre antes incluso de buscar. Muy grande y la frase con la respuesta queda enterrada en ruido que el embedding promedia. Muy chico y la respuesta queda partida entre chunks, así que ninguno la contiene entera.
  • RAG solo significa darle los documentos al modelo.
  • El retrieval se diseña: el chunking, la búsqueda híbrida (palabra clave + semántica), el reranking, las citas y la frescura deciden si el contexto correcto llega siquiera al modelo.
  • Un bot de soporte con RAG cita con confianza el documento equivocado, o se pierde un dato que está claramente en los docs. ¿Dónde está el bug, casi con seguridad?
  • En el retrieval, no en el LLM. El modelo solo puede responder con lo que llegó a su contexto. Chunks malos, búsqueda solo semántica que se pierde IDs exactos, sin reranking o un índice viejo significan que el pasaje correcto nunca apareció. Arregla el retrieval antes de culpar o cambiar el modelo.
  • ¿Y si la pregunta y los documentos están en idiomas distintos?
  • Una falla común. La búsqueda por palabras clave se rompe primero: una pregunta en español no coincidirá palabra por palabra con documentos en inglés. Los embeddings ayudan, porque un modelo multilingüe pone 'return policy' y 'política de devoluciones' cerca, pero solo si el modelo de embedding es de verdad multilingüe. La recuperación entre idiomas es un hueco real, así que pruébala con documentos bilingües, no solo del mismo idioma.
  • Puedes diagnosticar por qué un sistema RAG acierta o falla leyendo el pipeline de retrieval: chunking, búsqueda híbrida, reranking, citas y frescura, en vez de asumir que la culpa es del modelo.
  • La búsqueda híbrida encontró el código exacto, el reranking lo subió al #1 y el filtro de frescura descartó el duplicado viejo de 14 días. Ahora la respuesta está anclada en el documento correcto.
  • La respuesta es incorrecta o sin anclaje. Lee el primer resultado de arriba y luego cambia un control para arreglar lo que le llega al bot.
  • Muy chico: la frase con la respuesta queda partida entre dos chunks, así que ninguno la contiene entera.
  • Muy grande: la respuesta es una línea enterrada en una página de texto sin relación que el embedding promedia.
  • Equilibrado: la respuesta queda entera dentro de un solo chunk enfocado, fácil de recuperar y citar.

La idea clave

Arreglaste una respuesta fallida ajustando el retrieval: la búsqueda híbrida atrapó el código exacto, el reranking subió el chunk correcto al tope, y un filtro de frescura descartó el obsoleto.

Qué puedes hacer después de esta lección

Puedes diagnosticar por qué falla una respuesta de RAG y arreglarla en la capa de retrieval (chunking, búsqueda híbrida, reranking, citas, frescura) en vez de culpar al modelo.

Ponte a prueba: En un sistema RAG, ¿qué decide más a menudo si la respuesta es correcta?
  • Si la recuperación trajo el pasaje correcto (chunking, búsqueda, reranking)(correcta)
  • Qué tan grande es el modelo de lenguaje
  • El ajuste de temperatura
  • Qué tan largo es el prompt

En RAG, la respuesta suele ser tan buena como la recuperación. El chunking, la búsqueda híbrida y el reranking deciden si el pasaje correcto siquiera llega al modelo; un modelo más grande no arregla una mala recuperación.

Adónde lleva: El retrieval ya encuentra el texto correcto. Pero responder sigue siendo pasivo, ¿y actuar?

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.