Saltar al contenido
todas las lecciones
Operación y escalado4.7Bloqueada

Cómo crecieron los modelos

¿Qué tan grande es 'grande', en realidad?

La idea que hay dentro

La misma arquitectura escalada en varios órdenes de magnitud.

Después de esta lección

Puedes explicar que los modelos de frontera son la misma arquitectura, solo que escalada enormemente.

Adónde lleva

Escalar el modelo es un eje. Pero hay otro: dejarlo pensar más en el momento de responder.

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

La misma arquitectura escalada en varios órdenes de magnitud.

La pregunta con la que abre

¿Qué tan grande es 'grande', en realidad?

El recorrido, en palabras de la propia lección

  • La misma máquina. Solo que en órdenes de magnitud mayores.
  • GPT-2 es la mota a la izquierda. Arrastra el control hasta un modelo de frontera.
  • Aquí está el salto, a escala real. GPT-2 es una mota; la frontera se sale del borde.
  • Te toca: recorre los años. Cambia la escala para encontrar los modelos pequeños.
  • GPT-2, el transformer que construiste en el Acto 3, tenía 1500 millones de parámetros. ¿Cuánto más grande es un modelo de frontera de 2026? Arrastra y descúbrelo.
  • Unas 2000× los parámetros de GPT-2: el mismo transformer, escalado enormemente.
  • Hay una bajada más adelante, y es a propósito: Chinchilla es más pequeño porque los datos pueden importar más que el tamaño (lección 4.4).
  • Más parámetros = los mismos bloques transformer del Acto 3, solo que apilados más profundo y con embeddings más anchos.
  • Escala real: GPT-2 es una mota y la frontera se sale del borde.
  • La escala logarítmica comprime las brechas enormes para que todos los modelos quepan en pantalla.
  • La línea base: todos los demás modelos se miden contra esta.
  • No es un error. Chinchilla es más pequeño a propósito: la lección 4.4 mostró que a menudo es mejor añadir DATOS que solo parámetros.
  • Muestra · cifras públicas aproximadas, no un modelo en vivo.
  • Son los mismos bloques transformer del Acto 3, solo apilados más profundo y más anchos. Ninguna idea nueva. Solo más.
  • De 1500 millones a billones de parámetros: ninguna idea nueva, solo más. Ya conoces la máquina.
  • La escala es el titular, no toda la historia. Los asistentes modernos también suman post-training y ajuste por preferencias (2.6), modos de razonamiento que gastan tokens extra pensando (4.8), herramientas y bucles de agente (Actos 5 y 6), e imágenes y audio vía multimodalidad (1.5). La misma máquina en el fondo, con entrenamiento nuevo y piezas nuevas alrededor.
  • Un modelo más nuevo resuelve una petición complicada que uno más viejo falló, aunque ambos solo predicen el siguiente token. Si la máquina es la misma, ¿qué cambió en realidad?
  • De GPT-2 a los modelos de frontera de hoy es el mismo transformer, solo escalado en órdenes de magnitud en parámetros, datos y contexto. Esa escala extra es lo que desbloqueó nuevas capacidades, así que cuando una tarea pide más, a menudo la solución práctica es recurrir a un modelo más grande y nuevo en vez de a una máquina distinta.

La idea clave

Es la misma máquina, escalada enormemente.

Qué puedes hacer después de esta lección

Puedes explicar que los modelos de frontera son la misma arquitectura, solo que escalada enormemente.

Adónde lleva: Escalar el modelo es un eje. Pero hay otro: dejarlo pensar más en el momento de responder.

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.