Saltar al contenido

Explicador en lenguaje claro

La ventana de contexto, explicada

¿Qué es la ventana de contexto y por qué la IA olvida cosas a mitad de conversación?

La ventana de contexto es todo lo que el modelo puede ver mientras escribe su siguiente palabra: tus mensajes, sus respuestas, instrucciones, documentos, todo medido en tokens hasta un límite fijo. Es memoria de trabajo, no almacenamiento. Cuando una conversación supera la ventana, lo más viejo se descarta o se resume, y el modelo responde como si nunca hubiera existido. Por eso olvidó tu nombre de hace una hora. Nada se guardó, así que nada se podía recordar.

Revisado por última vez el

Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.

Empieza gratis: El harness: el bucle, hecho realidad

Gratis, sin código, sin registro.

Y después ve más a fondo: Qué hay en el context window Bloqueada

¿Qué es exactamente la ventana de contexto?

La ventana de contexto es la cantidad de texto que un modelo puede considerar a la vez, medida en tokens, los fragmentos de palabra que los modelos leen en realidad. Cada petición tiene un máximo fijo, y lo que no cabe simplemente no existe para el modelo mientras escribe. Es su memoria de trabajo: no lo que sabe por su entrenamiento, ni una transcripción guardada, solo lo que tiene enfrente ahora mismo.

Todo comparte ese único presupuesto. Las instrucciones ocultas que agrega el producto, la conversación completa hasta ahora, los documentos que pegaste, los resultados de herramientas como la búsqueda web y la respuesta que el modelo va escribiendo salen del mismo fondo. Entrada y salida son un solo presupuesto, y por eso pegar un archivo enorme puede dejar muy poco espacio para una respuesta larga.

La parte sin estado sorprende. El modelo no conserva nada entre peticiones. Cada vez que envías un mensaje, el producto reenvía el historial visible y el modelo lo relee todo desde cero antes de predecir los siguientes tokens. Lo que se siente como memoria es repetición. Y cuando algo ya no cabe y se descarta, no queda archivado en ningún lugar al alcance del modelo. Desaparece.

¿Qué tan grandes son las ventanas de contexto ahora?

El crecimiento fue empinado. GPT-2 salió en 2019 con una ventana de 1,024 tokens. ChatGPT se lanzó a fines de 2022 con unos 4,000. En 2023 la familia GPT-4 fue de 8k a 128k, y entre 2024 y 2025, 128k a 200k se volvió el estándar cotidiano mientras llegaban los primeros modelos de un millón de tokens. A mediados de 2026, los modelos insignia de los grandes laboratorios anuncian ventanas de alrededor de un millón de tokens, con el largo de la respuesta limitado por separado, a menudo cerca de 128k tokens.

Para convertir tokens en algo tangible, usa la regla práctica estándar: un token promedia unos cuatro caracteres de inglés, así que 100 tokens son unas 75 palabras. El código, las palabras raras y la mayoría de los idiomas no ingleses cuestan más tokens por palabra, así que la misma ventana les alcanza para menos.

Ventanas de contexto anunciadas a lo largo del tiempo. Las filas de mediados de 2026 describen cifras de titular y cambian seguido.
Modelo o épocaVentana de contextoEn palabras, aprox.
GPT-2 (2019)1,024 tokens~770 palabras, un email largo
ChatGPT al lanzarse (fines de 2022)~4k tokens~3,000 palabras, un cuento corto
Era GPT-4 (2023)8k a 128k tokenshasta ~96,000 palabras, una novela
Estándar cotidiano (2024-25)128k a 200k tokensuna novela larga o dos
Insignias de frontera (mediados de 2026)~1M de tokens anunciado~750,000 palabras, varias novelas
Titulares extremos (mediados de 2026)10M declarados (Llama 4 Scout); 100M en investigaciónun estante entero de libros

¿Qué llena la ventana en un producto real?

Mucho más que tu mensaje. Delante de lo que escribes, un producto de chat apila un system prompt con instrucciones de tono, formato, reglas de seguridad y la fecha actual, más tu memoria guardada si el producto tiene esa función. Si el asistente puede usar herramientas, el nombre, la descripción y los parámetros de cada herramienta también van escritos en la ventana como texto. En un asistente completo, ese costo fijo puede llegar a miles de tokens antes de que digas una palabra.

Después viene lo dinámico. La conversación visible completa se reenvía en cada turno. Si el producto hace recuperación, lo que se conoce como RAG, los pasajes que trajo de tus documentos se pegan adentro. Y cuando un modelo usa herramientas, cada resultado, una página web, un archivo, la salida de un comando, cae en la ventana como más texto. En productos con agents, los resultados de herramientas suelen ser de lejos lo que más consume la ventana, muy por encima de lo que tú escribiste.

Por eso ahora se habla de ingeniería de contexto: recortar salidas de herramientas, resumir turnos viejos, recuperar solo los fragmentos más relevantes. Cada token de plomería es un token que no queda disponible para tu problema, y como toda la ventana se reprocesa en cada turno, el desperdicio también cuesta dinero real, suavizado en la práctica por el prompt caching.

¿Qué pasa cuando la conversación supera la ventana?

Algo tiene que salir. Una petición cruda a la API que excede el límite se rechaza con un error. Los productos de chat lo evitan haciendo espacio en silencio: algunos mantienen una ventana deslizante con solo los turnos más recientes, otros llevan un resumen continuo que reemplaza los mensajes viejos con una recapitulación corta. En ambos casos el modelo responde como si lo recortado nunca hubiera pasado, y justo por eso un chat largo recuerda perfecto los últimos mensajes y pierde lo que acordaron hace una hora.

Los agentes lo hacen a propósito y lo llaman compactación. Un agente de código que lleva una hora leyendo archivos y corriendo comandos se va a acercar al techo a mitad de la tarea, así que el harness pausa, le pide al modelo un resumen denso de la sesión, conserva los pasos recientes tal cual y continúa desde ahí. Funciona, pero el resumen de un resumen se vuelve borroso, así que los agentes bien construidos también escriben el estado importante en archivos que viven fuera de la ventana.

La otra salida es no llenar la ventana desde el principio. La recuperación mantiene tus documentos fuera del modelo y pega solo los pasajes relevantes para la pregunta actual. Y si quieres sentir la mecánica, la lección interactiva de este sitio te deja ver cómo una ventana se llena turno a turno y qué mensajes se caen primero.

¿Por qué una ventana más grande no sale gratis?

Primero, el cómputo. Para escribir cada token nuevo, la attention lo compara contra los tokens que ya están en la ventana, así que el trabajo sube empinado con el largo, cuadrático en el diseño básico del transformer. Servir un contexto largo también implica guardar un estado de trabajo por token llamado KV cache, que en modelos grandes puede ocupar decenas de gigabytes de memoria del acelerador con la ventana llena. Lo sientes como latencia, los prompts largos esperan un buen rato antes de la primera palabra, y como precio: pagas por token de entrada, y a mediados de 2026 algunos proveedores cobran aproximadamente el doble por token cuando una petición cruza un umbral como 200k.

Segundo, la confiabilidad. La ventana anunciada es una promesa de capacidad, no de comprensión. Investigadores de Stanford mostraron en 2023 que los modelos aprovechan mucho mejor la información al inicio y al final de un contexto largo que la enterrada en el medio, con caídas de decenas de puntos de precisión en la misma pregunta. El hallazgo se conoce como lost in the middle, perdido en el medio. Benchmarks posteriores como RULER midieron que el largo efectivo de muchos modelos es una fracción del anunciado, y un benchmark de 2025 llamado NoLiMa encontró a la mayoría de los modelos probados por debajo de la mitad de su precisión de contexto corto ya a los 32k tokens cuando la pregunta dejaba de compartir palabras con el texto.

Un informe de julio de 2025 de Chroma le puso nombre a la versión cotidiana: context rot, el deterioro del contexto. De los 18 modelos de frontera que probó, todos sin excepción se volvieron menos confiables a medida que crecía la entrada, incluso en tareas deliberadamente simples. Una ventana de un millón de tokens es capacidad real. No es un millón de tokens de atención plena.

¿Cómo trabajas con la ventana en vez de contra ella?

Las reglas prácticas salen directo de la mecánica. Un chat largo no falla solo cuando se desborda. Se degrada antes, porque cada turno viejo es una distracción más que compite por la atención del modelo y un aporte más al context rot.

  • Abre un chat nuevo cuando cambies de tarea. Arrastrar una hora de historial ajeno en cada petición cuesta dinero, latencia y precisión, y no te compra nada.
  • ¿Cierras una sesión larga a mitad de proyecto? Pide un resumen corto de decisiones y pendientes, y pégalo en el chat fresco.
  • Pon lo importante en los bordes. Las instrucciones clave y la pregunta real rinden mejor al inicio o al final de un prompt largo, no enterradas en el medio.
  • Pega la sección relevante, no el documento entero. Diez párrafos bien elegidos suelen ganarle a trescientas páginas quizá relevantes.
  • En herramientas de agentes, mira el medidor de contexto y compacta en una pausa natural, sin dejar que se dispare a mitad de un trabajo delicado.
  • Para datos que el modelo siempre debería saber, usa la memoria o las instrucciones personalizadas del producto en vez de reescribirlos en cada conversación.

Lo que la gente entiende mal

  • La IA recuerda conversaciones pasadas. Cada petición ve solo lo que está dentro de la ventana en ese momento, salvo que el producto guarde datos explícitamente.
  • Una ventana más grande resuelve la memoria. Los modelos tienden a aprovechar mejor lo que está en los bordes que lo enterrado en el medio, así que más espacio no es automáticamente más recuerdo.
  • La ventana se mide en palabras o mensajes. Se mide en tokens, y por eso un documento largo pegado consume tanta.
  • La ventana anunciada es lo que el modelo realmente aprovecha. Los benchmarks que miden el largo efectivo encuentran una y otra vez que la confiabilidad cae mucho antes del límite, así que toma la cifra de titular como capacidad, no como comprensión.

Dónde lo ves en productos reales

  • Empezar un chat nuevo borra todo: ventana fresca, pizarra en blanco.
  • Las especificaciones anuncian ventanas de 128k o 1M de tokens como titular.
  • Las funciones de memoria existen justo porque la ventana es finita: reinyectan datos guardados en cada petición.
  • Los agentes de código muestran un medidor de contexto en vivo y compactan la sesión cuando se acerca al tope.

Preguntas frecuentes

¿Qué pasa cuando un chat supera la ventana de contexto?
El producto tiene que descartar algo. Casi todas las apps de chat recortan o resumen en silencio los turnos más viejos, y por eso una conversación larga olvida tu nombre mientras recuerda perfectamente los últimos mensajes. El modelo nunca ve lo que se cortó.
¿Una ventana de contexto más grande siempre es mejor?
No. El costo y la latencia crecen con lo que realmente envías, y la precisión tiende a caer con datos enterrados en medio de una entrada muy larga. Un contexto corto y bien elegido suele ganarle a pegarlo todo.
¿El modelo se acuerda de mí entre conversaciones?
Por sí solo, no. Todo lo que recuerda es una función del producto: notas guardadas que se vuelven a pegar en el contexto al empezar el siguiente chat. Borra ese almacén y el modelo vuelve a ser un desconocido.
¿Cuántas palabras caben en una ventana de contexto de 128k?
Unas 96,000 palabras de inglés, usando la regla práctica de que un token promedia unos tres cuartos de palabra. Eso es una novela completa en un solo prompt. Una ventana de 200k ronda las 150,000 palabras, y un millón de tokens anda por las 750,000. El código, las palabras raras y la mayoría de los idiomas no ingleses cuestan más tokens por palabra, así que la misma ventana les alcanza para menos.
¿El límite de tokens es lo mismo que la ventana de contexto?
Casi. La ventana de contexto es el presupuesto total que comparten entrada y salida. Los proveedores suelen sumar un tope aparte para la respuesta, los max output tokens, mucho menor que la ventana, a menudo cerca de 128k en modelos insignia a mediados de 2026. Así que algo puede fallar de dos maneras: la petición completa supera la ventana, o la respuesta sola choca con el tope de salida y se corta a media frase.
¿Por qué la IA empeora en chats largos antes de llegar al límite?
Se suman dos efectos. Los turnos viejos actúan como distracción: el modelo atiende sobre todo lo presente, y el contenido rancio o contradictorio desvía las respuestas. Y la confiabilidad medida simplemente baja a medida que crece la entrada, el efecto que los investigadores llaman context rot. Ambos empiezan mucho antes del límite duro, y por eso un chat fresco sembrado con un resumen corto suele ganarle a seguir una sesión maratónica.
¿Las apps de chat te dan toda la ventana anunciada del modelo?
Muchas veces no. La cifra anunciada es el máximo del modelo, normalmente alcanzable vía API. Los planes de chat de consumo suelen operar ventanas de trabajo más chicas para controlar costos, y parte de lo que recibes ya está gastado en el system prompt, las herramientas y la memoria. Si el tamaño exacto te importa, revisa la documentación del plan del producto, no la ficha del modelo.
¿Las funciones de memoria y el RAG son lo mismo que una ventana más grande?
No. Son maneras de gastar bien una ventana limitada. La memoria guarda datos fuera del chat y reinyecta unas pocas líneas en cada petición. El RAG mantiene colecciones enteras de documentos fuera del modelo y recupera solo los pasajes relevantes para la pregunta actual. Ambos ponen en la ventana una porción chica y elegida, que suele ser más confiable que un prompt gigante.

Explicadores relacionados

Más en Fundamentos

Una idea a la vez, en tu correo

Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.

Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.