Explicador en lenguaje claro
La IA multimodal, explicada
¿Cómo se convierten imágenes, audio y documentos en algo sobre lo que un modelo puede razonar?
Los modelos multimodales convierten cada entrada, texto, imagen, audio o una captura, en vectores dentro de un mismo espacio compartido, y luego razonan sobre todos juntos. Una imagen se corta en parches y cada parche se vuelve un vector, el mismo tipo de vector en que se convierte una palabra. Como viven en el mismo espacio, el modelo puede comparar una foto y un pie de imagen, responder una pregunta sobre un gráfico o describir lo que hay en una pantalla. Es la misma maquinaria que con el texto, apuntada a más tipos de entrada.
Revisado por última vez el
Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.
Empieza gratis: Embeddings: el significado como coordenadas →Gratis, sin código, sin registro.
Y después ve más a fondo: Más allá del texto: las imágenes también se vuelven tokens Bloqueada
Lo que la gente entiende mal
- El modelo 've' como un ojo. Convierte los píxeles en vectores y razona sobre ellos, no sobre la imagen cruda.
- La visión es un modelo aparte añadido. Los modelos multimodales modernos comparten una representación entre entradas.
- Lee cualquier imagen a la perfección. La letra pequeña, los gráficos densos y los formatos raros aún lo confunden.
Dónde lo ves en productos reales
- Los asistentes responden preguntas sobre fotos, capturas y PDFs.
- La IA de documentos extrae datos de escaneos y formularios.
- Los agents de voz y los de uso de la computadora se apoyan en la comprensión multimodal.
Preguntas frecuentes
- ¿Cómo ve una imagen un modelo?
- La imagen se corta en parches, cada parche se convierte en un vector, y esos vectores se suman a los tokens de texto en la misma secuencia. A partir de ahí la attention los trata igual, y por eso un modelo responde sobre una foto sin un programa de visión aparte.
- ¿Es un solo modelo o varios pegados?
- Cada vez más, uno solo. Los primeros productos le colgaban un generador de descripciones a un modelo de texto. Los actuales se entrenan con texto e imágenes entrelazados desde el principio, y eso es lo que les permite razonar sobre detalles de la imagen y no sobre una descripción de ella.
- ¿Puede leer el texto dentro de una imagen?
- Normalmente sí, y no siempre bien. Los títulos claros y las capturas de pantalla funcionan bien. Las tablas densas, la letra manuscrita y la letra chica son donde aparecen los errores, así que revisa todo lo que habrías pasado por una herramienta de OCR de verdad.
Explicadores relacionados
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.