Más allá del texto: las imágenes también se vuelven tokens
Si un modelo solo hace matemáticas con vectores de token, ¿cómo puede 'ver' una imagen o 'escuchar' audio?
La idea que hay dentro
Las imágenes y el audio se convierten en vectores en el mismo espacio que los tokens de texto.
Después de esta lección
Puedes explicar cómo los modelos multimodales convierten imágenes y audio en vectores en el mismo espacio que el texto, para que el modelo los compare igual que compara palabras.
Adónde lleva
Todo ya son vectores. Demuestra que puedes colocar palabras por tu cuenta, y luego predecimos la siguiente palabra.
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Las imágenes y el audio se convierten en vectores en el mismo espacio que los tokens de texto.
La pregunta con la que abre
Si un modelo solo hace matemáticas con vectores de token, ¿cómo puede 'ver' una imagen o 'escuchar' audio?
El recorrido, en palabras de la propia lección
- Toca el patch que brilla para enviarlo al espacio de vectores. Luego toca el resto.
- Encuentra el patch que coincide con el producto punto de 1.3.
- Caen en el mismo espacio que los vectores de las palabras.
- Un modelo necesita un sistema de visión aparte, añadido, para manejar imágenes.
- Los patches de imagen se vuelven vectores en el mismísimo espacio que las palabras, así que una sola máquina maneja ambos.
- Palabras, patches de imagen, fotogramas de audio: una vez que todos son vectores, el modelo puede comparar cualquiera de ellos con el
- Pegas una captura de pantalla en un chatbot y le preguntas sobre ella con palabras, y responde como si hubiera leído ambas cosas juntas. ¿Cómo maneja un solo modelo una imagen y texto a la vez?
- La imagen se corta en parches y cada uno se vuelve un vector en el mismo espacio compartido que tus palabras, así que el modelo trata píxeles y texto como un solo flujo de tokens. Nada especial los une: siempre fueron el mismo tipo de vector.
- La pregunta completa también se aprieta en una sola flecha. Cómo varios vectores de palabras se combinan en uno es trabajo del Acto 3.
- Puntuaciones inventadas que muestran la comparación, no mediciones de un modelo real.
- No: esto es solo el paso de comparación. El modelo real ejecuta atención + predicción del siguiente token sobre estos vectores para producir su respuesta.
- Puntuado. El patch del gato gana con la puntuación de producto punto más alta: palabras y píxeles se comparan en un mismo espacio. Esto es solo el paso de comparación; el modelo real ejecuta atención y predicción del siguiente token para producir su respuesta.
La idea clave
Los modelos multimodales reutilizan el mismo truco: todo se vuelve vectores en un espacio compartido.
Qué puedes hacer después de esta lección
Puedes explicar cómo los modelos multimodales convierten imágenes y audio en vectores en el mismo espacio que el texto, para que el modelo los compare igual que compara palabras.
Ponte a prueba: ¿Cómo 've' una imagen un modelo multimodal?
- Los patches de la imagen se vuelven vectores en el mismo espacio que los tokens de texto(correcta)
- Hace OCR y solo lee texto
- Adivina por el nombre del archivo
- No puede, los modelos son solo de texto
La imagen se corta en parches que se vuelven vectores en el mismo espacio que los tokens de texto, así el modelo procesa píxeles y palabras con una sola máquina.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: IA multimodal
Adónde lleva: Todo ya son vectores. Demuestra que puedes colocar palabras por tu cuenta, y luego predecimos la siguiente palabra.
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.