Saltar al contenido
todas las lecciones
Salas electivasE.4Bloqueada

Interpretabilidad

¿Podemos ver lo que ocurre por dentro?

La idea que hay dentro

Explora patrones de atención reales / activaciones de características sobre entradas seleccionadas.

Después de esta lección

Puedes explicar la interpretabilidad: las características dentro de un modelo siguen conceptos humanos.

Adónde lleva

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Explora patrones de atención reales / activaciones de características sobre entradas seleccionadas.

La pregunta con la que abre

¿Podemos ver lo que ocurre por dentro?

El recorrido, en palabras de la propia lección

  • Los “pensamientos” de una capa, a media frase. Parece ruido. ¿hay algo que se pueda leer?
  • Un ejemplo resuelto: mira cómo se enciende un solo concepto.
  • Te toca. Elige un concepto, mira qué lo activa, y luego súbelo.
  • No es ruido. Escondida en ese muro de números hay una característica (feature): un puñado de ellos que se encienden juntos para un concepto humano, aquí, “color”. Atrapémosla en el acto.
  • Una característica es una combinación específica de esos números, una “dirección” en el espacio de activaciones. Como en el espacio de palabras del Acto 1, donde las direcciones tenían significado (king − man + woman cayó cerca de queen), las activaciones INTERNAS del modelo también tienen direcciones con significado. Es un espacio distinto, estos números viven en medio de la red, no en los embeddings de palabras, pero la misma idea.
  • La característica de “palabras de color” ignora a Anna, los números, las cometas, y se activa solo en rojos y azules.
  • Ese único número es la bandera privada del modelo para “esto es un color”. Encuentra el número correcto y puedes leer un concepto directamente de la caja.
  • La misma característica: el número que se activó al LEER ahora se sube, y dirige al modelo para que ESCRIBA sobre ese concepto.
  • Apagada: una frase normal y corriente. Ahora arrastra el dial hacia arriba.
  • Súbela y el concepto se apodera de la salida, prueba de que está realmente cableado dentro.
  • Una señal más fuerte fluye por las capas → cambian las puntuaciones de la siguiente palabra → el concepto se apodera de la salida. Esa es la prueba de que está realmente cableado dentro, no pintado por encima.
  • Las características se activan con colores, números, nombres, incluso ideas abstractas. Anthropic subió una característica hasta que un modelo no paraba de hablar del puente Golden Gate.
  • Dentro del modelo cada número es polisémico: una unidad se enciende para muchas cosas no relacionadas a la vez, así que no puedes leerla sin más. Un autoencoder disperso separa esa maraña en miles de features más limpias, cada una encendiéndose para un solo concepto como los de aquí. Esas features se conectan en circuitos que ejecutan un comportamiento paso a paso. El detalle: un modelo tiene millones de features y la mayoría sigue sin nombre, así que la interpretabilidad hoy es real pero parcial, unas pocas habitaciones iluminadas en un edificio enorme.
  • Un laboratorio anuncia que encontró la feature del engaño y que puede subir o bajar la honestidad de un modelo. ¿Qué está pasando en realidad, y cuál es el detalle?
  • Usaron herramientas como autoencoders dispersos para aislar una dirección interna que sigue ese concepto, y luego la leyeron o la subieron, el mismo leer-y-dirigir que acabas de hacer. Es influencia real sobre el comportamiento de un modelo. El detalle: cubre una porción mínima de los millones de features que tiene dentro, así que dirigir una cosa no es lo mismo que entender el modelo entero.
  • Demostración · activaciones ilustrativas, no una sonda en vivo.
  • Ese se queda apagado, no es parte de esta característica. Los tres que brillan sí lo son.
  • Tres de ellos se activaron juntos: esa es la característica de “color”. Toca cualquier celda para probarla.
  • Toca la tira para rastrear estructura oculta.

La idea clave

Asómate al interior de la caja con trazas honestas y precalculadas.

Qué puedes hacer después de esta lección

Puedes explicar la interpretabilidad: las características dentro de un modelo siguen conceptos humanos.

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.