Widget interactivo · gratis · insertable
RAG: mira a un modelo congelado responder con documentos que nunca leyó
Cuatro documentos privados, un modelo congelado. Toca el fragmento que crees que responde la pregunta, y mira al sistema encontrarlo por similitud y pegarlo en el contexto.
¿Cuándo y dónde es el retiro del equipo?
Qué vas a hacer
- 1Un modelo congelado y cuatro docs privados con los que nunca entrenó. Toca el fragmento que responde la pregunta.
- 2Mira cómo lo encuentra el sistema: la pregunta y cada fragmento se vuelven vectores, y un producto punto puntúa a cada uno.
- 3Mira una corrida anotada: pregunta que entra, fragmento recuperado pegado en la ventana de contexto, respuesta fundamentada que sale.
Qué muestra
Un bot de soporte no puede responder preguntas sobre tu producto, y todas las respuestas viven en los artículos de tu centro de ayuda. El instinto es reentrenar al modelo con ellos. Este widget muestra la jugada barata. Los pesos del modelo nunca cambian. La recuperación encuentra el fragmento correcto por similitud y lo pega en la ventana de contexto, así que el mismo modelo congelado lee la respuesta en vez de adivinarla.
Primero encuentras tú el fragmento ganador, por significado y no por palabras clave; el pasaje correcto nunca contiene la palabra que buscaste. Después el escenario muestra cómo el sistema hace lo mismo: el significado vive como dirección en un espacio de coordenadas, así que el producto punto que compara dos embeddings puede puntuar cada fragmento contra tu pregunta. La puntuación más alta gana y se pega adentro.
El último paso corre toda la tubería una vez, anotada, para que veas dónde entra el texto recuperado y por qué la respuesta sale fundamentada. Cambia por un fragmento plausible pero desactualizado y la respuesta sale equivocada con toda confianza. La calidad de la recuperación decide la calidad de la respuesta.
Por qué importa
Esta es la diferencia concreta entre RAG y fine-tuning. RAG cambia lo que el modelo lee al momento de responder; el fine-tuning cambia los pesos. Agrega un documento nuevo esta noche y RAG responde con él mañana, con cita, y lo olvida en cuanto lo borras. El fine-tuning sirve para enseñar un estilo o un formato, no para guardar hechos que cambian. Los asistentes modernos suelen buscar de forma agéntica, escribiendo varias consultas y leyendo resultados en bucle, pero el principio del escenario es el mismo: encontrar el texto correcto y ponerlo en la ventana.
La idea clave
RAG es el truco de similitud más pegar en el contexto. Sin reentrenar, y el modelo lee la respuesta en vez de adivinarla.
Nota honesta: Esto es un juguete: documentos enteros y un solo ganador. Los sistemas reales parten los documentos en chunks, recuperan los mejores varios en vez de uno, y a menudo los reordenan antes de que el modelo vea nada.
Este widget es una etapa de una lección completa, con la historia alrededor.
Gratis, sin código, sin registro.
Inserta este widget
Pega esto en cualquier página HTML, plataforma de cursos, wiki o herramienta de diapositivas que acepte un iframe. Funciona sin cuenta, no pone cookies propias y enlaza de vuelta aquí.
La atribución ya viene incluida. Si escribes sobre él, un enlace a esta página es todo lo que pedimos.
Preguntas frecuentes
- ¿Cuándo conviene hacer fine-tuning en vez de usar RAG?
- Cuando el problema es el comportamiento, no el conocimiento: un tono, un formato, una habilidad estrecha que el modelo hace mal incluso con los datos correctos delante. Para hechos que cambian, documentos privados y todo lo que necesite una cita, gana la recuperación porque puedes actualizarla sin una corrida de entrenamiento.
- ¿Por qué RAG a veces da una respuesta equivocada con toda confianza?
- Porque el modelo lee fielmente lo que gane la recuperación. Si un fragmento desactualizado o fuera de tema puntúa más alto, el modelo fundamenta su respuesta en eso. El chunking, el reranking y los evals de calidad de recuperación existen para atrapar exactamente esa falla.
- ¿Puedo insertar esta demo de RAG en mi documentación o curso?
- Sí. Usa el fragmento iframe de esta página. Funciona donde se permita un iframe, no necesita cuenta y enlaza de vuelta a la lección completa y al explicador de RAG contra fine-tuning.
Explicadores relacionados
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.