Saltar al contenido

Explicador en lenguaje claro

Embeddings, explicados con geometría

¿Qué es un embedding, y cómo captura el significado?

Un embedding convierte un trozo de texto en una lista de números, un vector, colocado de forma que los significados parecidos queden cerca. El significado se vuelve geometría. Las palabras y frases que se usan de forma parecida terminan próximas, aunque no compartan ninguna palabra exacta. Eso es lo que permite que un buscador encuentre el artículo de ayuda correcto con otra redacción, y lo que permite que la recuperación traiga el documento relevante para una respuesta de IA. El modelo aprende estas posiciones a partir de cómo se usa el lenguaje de verdad.

Revisado por última vez el

No te quedes en leerlo. Opera tú mismo el mecanismo en una lección interactiva corta.

Míralo funcionar: Embeddings: el significado como coordenadas

Gratis, sin código, sin registro.

Lo que la gente entiende mal

  • Los embeddings guardan la definición de una palabra. Guardan una posición aprendida del uso, no una entrada de diccionario.
  • Coincidir significa compartir palabras clave. Los embeddings coinciden por significado, así que 'coche' y 'automóvil' quedan cerca sin compartir letras.
  • Un embedding es el significado verdadero de una palabra. El significado cambia con el contexto, que es lo que después ajusta la atención.

Dónde lo ves en productos reales

  • La búsqueda semántica ordena por cercanía de vectores.
  • El RAG usa embeddings para traer los documentos más relacionados con una pregunta.
  • Las recomendaciones y la deduplicación agrupan elementos que quedan cerca en el espacio de vectores.

Preguntas frecuentes

¿Cuál es la diferencia entre un token y un embedding?
Un token es un trozo de texto con un número de id, un símbolo. Un embedding es la lista de números que el modelo aprendió a asociar a ese id: una posición en un espacio de significado. El token dice qué palabra es, el embedding carga lo que el modelo sabe de ella.
¿Cuántos números tiene un embedding?
De cientos a unos miles. Los modelos de retrieval pequeños usan 384 o 768 dimensiones, los grandes varios miles. Más dimensiones pueden guardar distinciones más finas y cuestan más de almacenar y comparar, por eso muchos sistemas eligen un modelo pequeño a propósito.
¿Puedo comparar embeddings de dos modelos distintos?
No. Cada modelo aprende su propio espacio, así que la misma frase cae en un lugar sin relación en las coordenadas del otro. Si cambias de modelo de embeddings, tienes que volver a generar todo lo que tenías guardado.

Explicadores relacionados

Más en Fundamentos

Una idea a la vez, en tu correo

Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.

Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.