Explicador en lenguaje claro
Cómo funcionan los LLM, sin matemáticas
¿Cómo funciona de verdad un modelo de lenguaje grande?
Un modelo de lenguaje grande es un predictor de la siguiente palabra. Convierte tu texto en números, los pasa por miles de millones de pesos aprendidos y produce una probabilidad para cada token posible que podría venir. Elige uno, lo añade al texto y repite. No hay base de datos de hechos ni paso de búsqueda. La inteligencia es una muy buena conjetura estadística sobre qué viene después, aprendida de una enorme cantidad de texto. Todo lo demás, el chat, el código, los agents, se construye sobre ese único bucle.
Revisado por última vez el
No te quedes en leerlo. Opera tú mismo el mecanismo en una lección interactiva corta.
Míralo funcionar: ¿Cómo piensa una IA? →Gratis, sin código, sin registro.
El pipeline: qué pasa cuando pulsas enviar
El paso uno es la tokenización. El modelo nunca ve letras ni palabras. Tu texto se corta en tokens, fragmentos comunes de un vocabulario fijo, así que 'strawberry' puede volverse dos o tres piezas, cada una con su número de id. Por eso los modelos se cobran por token y por eso contar letras dentro de una palabra les cuesta tanto.
El paso dos es el embedding. Cada id de token busca una lista larga de números, su posición en un mapa aprendido del significado, donde los significados parecidos quedan cerca. De aquí en adelante, todo es aritmética sobre esas listas.
El paso tres es el transformer: docenas de capas apiladas donde la atención deja que cada token mire a los demás y jale los que cambian su significado, así 'banco' junto a 'río' termina cargando un vector distinto que 'banco' junto a 'dinero'. El paso cuatro convierte el vector final en un puntaje para cada token del vocabulario, y una softmax convierte puntajes en probabilidades. El paso cinco muestrea un token de esa distribución, lo añade, y todo vuelve a correr. Una respuesta de 500 palabras es ese bucle ejecutado unos cientos de veces, tan rápido que parece tipeo.
De dónde sale el 'conocimiento': el entrenamiento
Todos esos pesos empiezan como números aleatorios. El preentrenamiento lo arregla con un ejercicio brutalmente simple, repetido billones de veces: mostrarle al modelo un trozo de texto real, esconder el siguiente token, dejarlo adivinar, medir el error y ajustar los pesos para errar menos. Hazlo sobre billones de tokens de páginas web, libros y código, y los pesos quedan obligados a absorber gramática, hechos, estilo y patrones de código, porque absorberlos es la única forma de seguir adivinando bien.
Un modelo preentrenado crudo es una máquina de continuar, no un asistente. Hazle una pregunta y puede continuar con tres preguntas más, porque esa es una continuación plausible. El post-entrenamiento lo vuelve producto: se le muestran ejemplos de diálogo útil y se lo ajusta con juicios de preferencia humanos (y cada vez más de IA), un proceso cuyo ingrediente más famoso es RLHF, aprendizaje por refuerzo con feedback humano. Ahí 'predecir texto' se convierte en 'responde al usuario, rechaza lo dañino, admite incertidumbre'.
La división importa para lo que puedes esperar. El entrenamiento pasó en el pasado, una vez, a un costo enorme. Cuando chateas, nada está aprendiendo: los pesos están congelados, y tu conversación cambia el comportamiento del modelo solo mientras vive en la ventana de contexto. Mañana arranca en blanco, salvo que el producto guarde memoria por ti a propósito.
¿Qué tan grandes son estos modelos, en números reales?
Las cifras exactas de los modelos de frontera son secreto industrial, pero el registro público da anclas honestas. La tabla mezcla números históricos publicados con cifras comúnmente reportadas a mediados de 2026.
- Un parámetro es un número aprendido. 'Miles de millones de parámetros' significa miles de millones de perillas que el entrenamiento ajustó.
- Las ventanas de contexto crecieron unas mil veces en seis años, y por eso un modelo ya puede leer un libro o un repositorio entero en un prompt.
| Era del modelo | Parámetros | Texto de entrenamiento | Ventana de contexto |
|---|---|---|---|
| GPT-2 (2019, publicado) | 1.5 mil millones | ~8 mil millones de tokens | 1,024 tokens |
| GPT-3 (2020, publicado) | 175 mil millones | ~300 mil millones de tokens | 2,048 tokens |
| Pesos abiertos grande (p. ej. Llama 3.1, publicado) | 405 mil millones | ~15 billones de tokens | 128k tokens |
| Nivel frontera (2025-26, reportado) | sin publicar; las estimaciones llegan a billones, a menudo mixture-of-experts | decenas de billones de tokens | 200k a 1M+ tokens |
¿Por qué a veces inventa cosas?
Porque nada en el bucle compara la frase con la realidad. El modelo siempre emite el token más probable, y la prosa fluida y segura es la forma probable de una respuesta, esté o no el hecho en sus datos de entrenamiento. Cuando el hecho está bien representado, lo probable y lo verdadero coinciden. Cuando es raro o no está, el modelo rellena el hueco con el patrón más plausible, una cita inventada, una fecha errada, producidos por la misma maquinaria que produce lo correcto. Ese fallo tiene nombre, alucinación, y se gestiona, no se cura: los productos anclan respuestas en documentos recuperados y búsqueda web, citan fuentes y entrenan a los modelos a abstenerse más, pero el motor de predicción de abajo no trae una línea entre recordado y plausible.
Esa es también la manera honesta de leer su confianza. Su tono es una propiedad del texto que predice, no una medición de certeza. La regla práctica para lo que importa: pregunta en qué está anclada la respuesta, y abre la fuente que cita.
¿Qué cambiaron los modelos de razonamiento?
Desde fines de 2024, la mayoría de los sistemas de frontera puede gastar tokens pensando antes de responder: generan una cadena privada de pasos intermedios, exploran, retroceden y recién entonces escriben la respuesta. Nada del bucle central cambió, los tokens de pensamiento siguen siendo predicción del siguiente token, pero presupuestar cómputo extra al momento de responder resultó comprar mejoras reales en matemáticas, código y problemas de varios pasos. Es el mismo truco que usas al resolver en borrador en vez de soltar lo primero.
La trampa es el costo y el encaje. Pensar multiplica los tokens, así que multiplica latencia y precio, y en preguntas fáciles no compra nada, a veces hasta convence al modelo de abandonar una respuesta correcta. Por eso los productos traen modos rápido y pensante, o rutean entre ellos solos. Pensar más no es saber más: un modelo de razonamiento sigue alucinando hechos que nunca aprendió, solo es mejor trabajando con los que tiene.
Lo que un LLM no es
- No es una base de datos. Adentro no hay tabla de hechos, solo pesos que hacen probables las buenas conjeturas. Borrar o editar un hecho concreto es un problema abierto de investigación.
- No está buscando en internet, salvo que el producto lo envuelva en una herramienta de búsqueda y pegue los resultados en el prompt. El mismo modelo puede estar al día en una app y desactualizado en otra.
- No te recuerda entre chats por sí solo. La continuidad viene de que el producto reenvíe el historial o guarde memoria, y ambas cosas viven fuera del modelo.
- No ejecuta tu código ni verifica su aritmética de forma nativa. Cuando acierta en matemáticas a escala, casi siempre hay una calculadora o una herramienta de código de por medio.
- No es consciente, y 'pensar' es una metáfora. Lo que ves salir es una distribución de probabilidad siendo muestreada, token a token.
Lo que la gente entiende mal
- Busca las respuestas en una base de datos guardada. No es así. Predice texto probable, y por eso puede equivocarse con total seguridad.
- Entiende como una persona. Modela patrones del lenguaje, no experiencia ni significado vivido.
- Más grande siempre es más listo. La escala ayuda, pero la calidad de los datos y cómo usas el modelo importan igual.
- Aprende de tu conversación. Los pesos están congelados durante el chat; lo que 'aprende' dura lo que dura la ventana de contexto.
Dónde lo ves en productos reales
- Los asistentes de chat generan cada respuesta token a token.
- Las herramientas de escritura y autocompletado ordenan la siguiente palabra igual.
- Los agents de código envuelven ese mismo predictor en un bucle que puede ejecutar herramientas.
- El texto que aparece palabra a palabra en cada app de chat es el bucle, en vivo.
Preguntas frecuentes
- ¿Un LLM busca las respuestas en internet?
- Por sí solo, no. El modelo responde con los patrones de sus pesos, que dejaron de cambiar cuando terminó el entrenamiento. La búsqueda solo ocurre si el producto envuelve al modelo en una herramienta que trae páginas y las pega en el prompt. Por eso el mismo modelo puede estar al día en una app y desactualizado en otra.
- ¿Por qué suena tan seguro cuando se equivoca?
- Porque la seguridad no es algo que mida. Elige el token más probable dado todo lo anterior, y un texto fluido y firme es la forma más probable de una respuesta. Nada en el bucle compara la frase con la realidad, así que una cita inventada sale de la misma maquinaria que una correcta.
- ¿Cuánto texto ha leído un modelo así?
- Billones de tokens de texto público, libros y código, filtrados y sin duplicados. La mezcla y la limpieza importan más que la cantidad bruta, y los laboratorios tratan la receta exacta como secreto industrial, así que desconfía de cualquier cifra pública precisa.
- ¿ChatGPT es lo mismo que un LLM?
- ChatGPT es un producto construido alrededor de LLMs. El modelo predice tokens; el producto añade la interfaz de chat, el historial, herramientas como búsqueda web y ejecución de código, capas de seguridad y memoria. Muchas conductas que la gente atribuye 'al modelo', recordarte, navegar, correr código, son en realidad el envoltorio del producto.
- ¿Qué es exactamente un token?
- Un fragmento común de texto del vocabulario fijo del modelo, típicamente una palabra, parte de una palabra o un signo. En promedio, un token equivale a unas tres cuartas partes de una palabra en inglés. Los modelos leen, generan y cobran en tokens, y por eso los proveedores cotizan precios por millón de tokens.
- Si solo predice la siguiente palabra, ¿cómo puede escribir código o razonar?
- Porque predecir bien sobre billones de tokens de código y argumentos obliga a los pesos a codificar los patrones que los generan: sintaxis, lógica, algoritmos comunes, formas de demostrar. La predicción es el objetivo de entrenamiento, no el techo de lo aprendido. Si eso cuenta como razonamiento 'de verdad' se debate; lo medible es que las predicciones resuelven problemas.
- ¿Los LLM funcionan igual en español y otros idiomas?
- El mecanismo es idéntico, y los modelos grandes se entrenan en muchos idiomas a la vez. La calidad sigue a cuánto de cada idioma hubo en la mezcla de entrenamiento, así que los idiomas grandes funcionan muy bien y los de pocos recursos ven más errores, y los tokenizers suelen partir el texto no inglés en más tokens, lo que puede encarecer un poco la misma frase.
Explicadores relacionados
Más en Fundamentos
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.