← Volver al curso
Explicadores de IA
Guías en lenguaje claro y con la respuesta primero sobre cómo funciona la IA moderna. Cada una responde la pregunta de entrada, nombra lo que la gente entiende mal y enlaza a una lección interactiva corta donde operas tú la idea.
Fundamentos
Qué es un modelo de lenguaje y cómo convierte tus palabras en una respuesta.
- Cómo funcionan los LLM¿Cómo funciona de verdad un modelo de lenguaje grande?Un modelo de lenguaje grande es un predictor de la siguiente palabra. Convierte tu texto en números, los pasa por miles de millones de pesos aprendidos y produce una probabilidad para cada token posible que podría venir. Elige uno, lo añade al texto y repite. No hay base de datos de hechos ni paso de búsqueda. La inteligencia es una muy buena conjetura estadística sobre qué viene después, aprendida de una enorme cantidad de texto. Todo lo demás, el chat, el código, los agents, se construye sobre ese único bucle.Leer el explicador →
- Tokenización¿Qué es un token, y por qué la IA cuenta tokens en vez de palabras?Un token es un trozo de texto, a menudo un fragmento de palabra y no una palabra entera. Antes de leer tu texto, el modelo lo parte en tokens y asigna un número a cada uno. Los modelos cobran y presupuestan en tokens, no en palabras, porque los tokens son la unidad real que procesan. La misma idea puede costar más o menos según cómo se parta: las palabras comunes en inglés son un token, mientras que el código, las palabras raras y muchos idiomas no ingleses se rompen en más tokens por palabra.Leer el explicador →
- Embeddings¿Qué es un embedding, y cómo captura el significado?Un embedding convierte un trozo de texto en una lista de números, un vector, colocado de forma que los significados parecidos queden cerca. El significado se vuelve geometría. Las palabras y frases que se usan de forma parecida terminan próximas, aunque no compartan ninguna palabra exacta. Eso es lo que permite que un buscador encuentre el artículo de ayuda correcto con otra redacción, y lo que permite que la recuperación traiga el documento relevante para una respuesta de IA. El modelo aprende estas posiciones a partir de cómo se usa el lenguaje de verdad.Leer el explicador →
- Ventana de contexto¿Qué es la ventana de contexto y por qué la IA olvida cosas a mitad de conversación?La ventana de contexto es todo lo que el modelo puede ver mientras escribe su siguiente palabra: tus mensajes, sus respuestas, instrucciones, documentos, todo medido en tokens hasta un límite fijo. Es memoria de trabajo, no almacenamiento. Cuando una conversación supera la ventana, lo más viejo se descarta o se resume, y el modelo responde como si nunca hubiera existido. Por eso olvidó tu nombre de hace una hora. Nada se guardó, así que nada se podía recordar.Leer el explicador →
- Predicción del siguiente token¿ChatGPT de verdad solo predice la siguiente palabra?Sí, y no es poca cosa. Todo el modelo se entrena con un solo objetivo: dado un texto, adivinar el siguiente token. Hazlo casi perfecto sobre billones de tokens y la adivinanza tiene que absorber gramática, hechos, estilo, patrones de código y cadenas con forma de razonamiento, porque todo eso mejora la predicción. El chat es el mismo truco apuntado a una transcripción: el modelo predice qué diría a continuación un asistente útil, token a token.Leer el explicador →
- Analogías de vectores¿Por qué rey menos hombre más mujer cae cerca de reina?Porque cuando las palabras se vuelven vectores, las relaciones se vuelven direcciones. En un espacio de embeddings bien entrenado, la flecha de hombre a mujer apunta casi igual que la flecha de rey a reina: una 'dirección de género' que el modelo aprendió solo de cómo co-ocurren las palabras en el texto. Suma esa flecha a rey y caes cerca de reina. La demo famosa, de word2vec en 2013, fue la primera prueba llamativa de que el significado podía ser geometría, la idea sobre la que se construye todo modelo moderno.Leer el explicador →
- Entrenamiento o inferencia¿Cuál es la diferencia entre entrenamiento e inferencia?El entrenamiento es donde se aprenden los números: el modelo lee cantidades enormes de texto, se equivoca, y cada peso se ajusta para fallar menos. Ocurre una vez, cuesta una fortuna y se detiene. La inferencia es cada vez que usas el resultado: los pesos están congelados y se leen, no se cambian. Nada de lo que escribes durante la inferencia se aprende. Ese solo hecho explica por qué el modelo no sabe las noticias de hoy, por qué olvida tu conversación anterior y por qué se cobra por token.Leer el explicador →
Dentro del transformer
La arquitectura con la que está hecho todo modelo moderno, parte por parte.
- Attention¿Qué hace el mecanismo de atención en un transformer?La atención permite que cada palabra mire a las demás palabras de la frase y decida cuáles importan para ella en ese momento. En 'el trofeo no cabía en la maleta porque era demasiado grande', la atención es lo que le dice al modelo que 'era' se refiere al trofeo. Cada posición reúne una mezcla ponderada de las otras, apoyándose más en las que encajan. Así maneja el modelo los pronombres, las referencias a distancia y la forma en que el significado de una palabra cambia con su contexto.Leer el explicador →
- Mixture of Experts¿Qué es un modelo Mixture of Experts y por qué lo usan los laboratorios?Un modelo Mixture of Experts reemplaza algunas capas por muchas sub-redes en paralelo, los experts, más un pequeño router que elige unos pocos para cada token. El modelo puede tener una cantidad enorme de parámetros, pero solo corren los experts elegidos, así que cada token cuesta una fracción del cómputo. Ese es el truco: la capacidad de un modelo gigante a un precio más cercano al de uno pequeño. Las decisiones del router se aprenden, no se programan.Leer el explicador →
- Softmax¿Qué hace softmax y dónde lo usa un LLM?Softmax convierte una lista de puntuaciones crudas en porcentajes que suman 100. Exagera las diferencias: una puntuación apenas por delante se vuelve una porción muy por delante, y las bajas se encogen hacia cero sin llegar a tocarlo. Los modelos de lenguaje lo usan en los dos lugares que más importan: en la salida, para convertir puntuaciones de palabras en las probabilidades de la siguiente palabra, y dentro de attention, para decidir cuánto aporta cada palabra anterior a la actual.Leer el explicador →
- Codificación posicional¿Cómo sabe un transformer el orden de las palabras, si attention mira todo a la vez?Attention por sí sola trata una frase como una bolsa de palabras: 'perro muerde hombre' y 'hombre muerde perro' se verían idénticas. Por eso los modelos mezclan una señal de posición en el vector de cada token antes de que corra attention. Cada posición recibe su propio sello matemático, y el sello pasa a ser parte del significado, así que 'primera palabra' y 'séptima palabra' son distintas incluso para la misma palabra. Muchos modelos modernos usan una variante rotatoria, RoPE, que codifica la distancia relativa entre palabras.Leer el explicador →
- Transformers¿Qué es un transformer y cómo funciona de verdad la arquitectura?Un transformer es una pila de bloques idénticos, y cada uno hace dos cosas. Primero, attention: cada token mira a los tokens anteriores y trae lo que necesita, así el significado fluye entre palabras. Segundo, una red feed-forward transforma cada token por su cuenta, y ahí vive la mayor parte del conocimiento aprendido. Una representación de cada token atraviesa la pila, refinada un poco por bloque, hasta que arriba está lo bastante afilada para puntuar cada posible siguiente token.Leer el explicador →
- Query, Key, Value¿Qué significan de verdad Query, Key y Value en attention?Attention es una búsqueda. Cada token hace una pregunta, su Query. Cada token también anuncia lo que contiene, su Key, y lleva el contenido que entregaría, su Value. Comparar una Query con todas las Keys produce puntuaciones, softmax las convierte en porciones, y la nueva representación del token es la mezcla de los Values pesada por esas porciones. Los tres papeles se calculan del mismo vector del token mediante matrices aprendidas. Nadie las escribe; el entrenamiento las encuentra.Leer el explicador →
Cómo se entrenan los modelos
De dónde salen los números y qué cambia un modelo después del entrenamiento.
- Descenso de gradiente¿Cómo aprende de verdad una red neuronal?Entrenar es un bucle. El modelo hace una predicción, una función de pérdida mide cuánto se equivocó, y el cálculo le dice a cada peso qué pequeño empujón habría reducido el error. Todos los pesos toman su empujón, y el bucle se repite miles de millones de veces. Eso es el descenso de gradiente: bajar por un paisaje de error que nunca ves completo, un pasito a la vez. Nadie escribe las reglas. Las reglas son los valores de los pesos donde el descenso se asienta.Leer el explicador →
- Fine-tuning o prompting¿Cuándo conviene hacer fine-tuning y cuándo basta con el prompt?El prompting cambia la entrada: instrucciones, ejemplos, documentos recuperados, todo con los pesos congelados, instantáneo y reversible. El fine-tuning cambia los pesos: entrenamiento extra con tus datos, a menudo mediante pequeños adaptadores LoRA, más lento y más pegajoso. La regla práctica: prompting más recuperación para el conocimiento y los comportamientos puntuales, fine-tuning para la forma, cuando necesitas un estilo, formato o habilidad consistente horneada en miles de llamadas. La mayoría de los sistemas en producción nunca lo necesita.Leer el explicador →
- Leyes de escalado¿Por qué hacer los modelos más grandes los hacía mejores?Los investigadores descubrieron que el error de un modelo baja por curvas suaves y predecibles al crecer tres cosas: parámetros, datos de entrenamiento y cómputo. Predecible es la palabra clave: los laboratorios podían pronosticar qué tan bueno saldría un entrenamiento antes de pagarlo, y eso justificó pagar más. El resultado Chinchilla añadió el equilibrio: con un presupuesto fijo de cómputo, un modelo más pequeño entrenado con más datos gana a uno más grande con menos, más o menos veinte tokens de datos por parámetro.Leer el explicador →
- RLHF¿Qué es RLHF y por qué un predictor de texto se comporta como asistente?El preentrenamiento produce un predictor crudo que continúa texto en cualquier dirección, útil o no. RLHF es la escuela de acabado: humanos comparan pares de respuestas del modelo y eligen la mejor, un modelo de recompensa aprende a imitar esas preferencias, y el LLM se entrena después para puntuar alto en esa recompensa. El resultado responde preguntas, sigue instrucciones y rechaza pedidos dañinos, no porque le dictaran reglas, sino porque las respuestas con esa forma puntuaban mejor.Leer el explicador →
- Aprendizaje en contexto¿Cómo puede un modelo aprender de ejemplos en el prompt sin reentrenarse?Pon tres ejemplos de una tarea en tu prompt y el modelo hace la cuarta con el mismo patrón, sin cambiar un solo peso. Eso es el aprendizaje en contexto. Funciona porque el preentrenamiento premió sin descanso continuar patrones, así que seguir patrones se volvió uno de los reflejos más fuertes del modelo. El aprendizaje es real pero alquilado: existe solo dentro de la ventana de contexto actual, y desaparece en cuanto la conversación termina.Leer el explicador →
- Destilación¿Qué es la destilación de modelos y por qué la versión mini es tan buena?La destilación entrena un modelo estudiante pequeño con las salidas de un modelo maestro grande, en vez de solo con texto crudo. Las respuestas del maestro son más limpias y consistentes que internet, y en las versiones más ricas el estudiante también aprende de cuánta confianza tenía el maestro en cada opción, no solo de su elección final. El estudiante termina mucho mejor que un modelo de su tamaño entrenado desde cero. Hereda el estilo del maestro y también sus errores, y no lo supera.Leer el explicador →
Velocidad, costo y control
Qué pasa cuando un modelo corre de verdad, y qué pagas por ello.
- Routing de modelos¿Qué es el routing de modelos, y cómo eliges qué modelo de IA usar?El routing de modelos manda cada petición al modelo más barato que aún pueda resolverla, en vez de usar un modelo grande para todo. La mayoría de las peticiones son fáciles, así que un modelo pequeño y barato las resuelve, y solo las pocas difíciles necesitan un modelo de frontera. Un router puede decidir por adelantado, o hacer cascada: probar un modelo pequeño, comprobar el resultado y escalar solo si se queda corto. Bien hecho, mantienes el nivel de calidad mientras recortas costo y latencia, porque dejas de pagar precios de frontera por trabajo fácil.Leer el explicador →
- KV cache¿Qué es la KV cache y por qué importa para la velocidad y el costo?Cuando un modelo genera texto, cada token nuevo tiene que mirar hacia atrás a todos los anteriores mediante attention. Recalcular esa mirada desde cero en cada paso sería lentísimo. La KV cache guarda las claves y valores de attention de cada token la primera vez que se calculan, así cada paso posterior los reutiliza y solo calcula el token más nuevo. El precio es memoria: la cache crece con el largo del context, y por eso las conversaciones largas consumen memoria de GPU.Leer el explicador →
- Cuantización¿Qué es la cuantización y cómo permite correr modelos grandes en hardware pequeño?La cuantización guarda cada peso del modelo con menos bits, por ejemplo 4 en vez de 16. El modelo conserva el mismo número de pesos, pero cada uno se vuelve un número más grueso, así que el modelo entero se encoge a un cuarto de la memoria y se mueve más rápido por el hardware. Bien hecha, la pérdida de calidad es pequeña, porque los pesos no necesitaban tanta precisión. Es la razón principal de que hoy corran modelos capaces en laptops y teléfonos.Leer el explicador →
- Temperature¿Qué hace de verdad el ajuste de temperatura en un modelo de IA?La temperatura remodela las probabilidades de la siguiente palabra antes de que el modelo elija una. Con temperatura baja se afilan: la opción principal gana casi siempre y las respuestas salen consistentes. Con temperatura alta se aplanan: la segunda y la tercera opción tienen oportunidades reales, lo que se lee como variedad o creatividad, y a veces como disparate. No cambia nada de lo que el modelo sabe. Solo cambia cuánto riesgo toma al elegir entre palabras que ya considera plausibles.Leer el explicador →
- GPUs para IA¿Por qué las GPUs, y no las CPUs, son el hardware del boom de la IA?Casi todo lo que hace un modelo de lenguaje es multiplicar cuadrículas enormes de números, y esos millones de pequeñas multiplicaciones no dependen unas de otras. Una CPU tiene unos pocos núcleos rápidos hechos para correr pasos uno tras otro. Una GPU tiene miles de núcleos simples hechos para aplicar la misma operación a lotes gigantes a la vez. Para la matemática de matrices, ganan los miles. Los gráficos necesitaron esa matemática primero, y por eso el chip de videojuegos se volvió el chip de la IA.Leer el explicador →
- Modelos de razonamiento¿Cómo funcionan de verdad los modelos de razonamiento?Un modelo de razonamiento escribe un borrador largo y privado antes de responder. Ese borrador se genera igual que cualquier otro texto, token a token, pero le da al modelo un lugar donde partir el problema en pasos, probar un camino y corregirse. Gastar más tokens en el momento de responder mejora de forma consistente las matemáticas difíciles, el código y la lógica de varios pasos. Cuesta más y tarda más, y en preguntas simples no aporta nada.Leer el explicador →
- Speculative decoding¿Qué es el speculative decoding y por qué acelera a los modelos?Un modelo chico y rápido borronea los siguientes tokens, y después el modelo grande los verifica todos en una sola pasada. Verificar varios tokens a la vez cuesta casi lo mismo que generar uno, porque el cuello de botella es leer los pesos desde la memoria, no la aritmética. Cada token del borrador que el modelo grande acepta es velocidad gratis; el primer desacuerdo se corrige y el borrador vuelve a empezar. La salida es idéntica a la que habría producido el modelo grande solo. Lo único que cambia es el reloj.Leer el explicador →
- Prompt caching¿Qué es el prompt caching y cuánto ahorra de verdad?Casi todas las peticiones a un asistente repiten una apertura larga e idéntica: las instrucciones del sistema, las definiciones de herramientas, el documento sobre el que preguntas. El prompt caching guarda la forma ya procesada de ese prefijo para que la siguiente petición se salte volver a calcularlo. Los proveedores cobran un descuento grande por la entrada cacheada y además vuelve más rápido. Las reglas son estrictas: el prefijo tiene que coincidir exactamente desde el primer token, y la cache expira tras minutos sin uso, así que premia poner primero lo estable.Leer el explicador →
- Costo de la inferencia¿Por qué operar IA es tan caro y qué estás pagando?Cada respuesta se calcula desde cero en hardware que hay que reservar lo uses o no. No hay una página cacheada que servir. El costo escala con los tokens de tu prompt más los tokens generados, y la generación es la mitad cara porque cada token nuevo obliga a volver a leer el modelo entero desde la memoria. Por eso los precios se cotizan por token, por eso la salida cuesta varias veces más que la entrada, y por eso el contexto largo y el pensar largo aparecen los dos en la factura.Leer el explicador →
Agents y herramientas
Qué cambia cuando el modelo puede actuar, no solo responder.
- Agents de IA¿Qué hace que un agent de IA sea distinto de un chatbot?Un agent es un modelo de lenguaje dentro de un bucle que puede tomar acciones. Un chatbot escribe una respuesta y se detiene. Un agent propone una llamada a una herramienta, un harness la ejecuta, el resultado vuelve al context y el modelo decide el siguiente paso, hasta terminar la tarea. El modelo sigue solo prediciendo texto. La potencia viene del bucle: leer un archivo, buscar, llamar a una API, comprobar el resultado, reintentar. Ese bucle convierte a un predictor en algo que hace el trabajo.Leer el explicador →
- Ingeniería de contexto¿Qué es la ingeniería de contexto, y en qué se diferencia del prompt engineering?La ingeniería de contexto es decidir todo lo que el modelo ve para una tarea, no solo el prompt. Un sistema moderno arma su context desde muchas fuentes: instrucciones, la petición del usuario, documentos recuperados, turnos anteriores, resultados de herramientas, memoria y archivos. El modelo solo puede razonar sobre lo que está en esa ventana, y la ventana es un presupuesto limitado. Una buena ingeniería de contexto mete la información correcta, deja fuera el ruido y la ordena. Es la disciplina que reemplazó a los 'trucos de prompt' cuando los sistemas se volvieron complejos.Leer el explicador →
- Prompt injection¿Qué es el prompt injection, y por qué las apps de IA son inseguras de formas nuevas?El prompt injection ocurre cuando contenido no confiable que el modelo lee trae instrucciones que lo secuestran. Un modelo no puede distinguir con fiabilidad tus instrucciones del texto dentro de una página web, un correo o un documento que le pidieron procesar. Un atacante puede esconder 'ignora tu tarea y haz esto otro' en ese contenido. Es peligroso cuando un agent combina tres cosas: acceso a datos privados, exposición a contenido no confiable y una vía para sacar datos. Esa combinación, la trifecta letal, es la receta de la exfiltración de datos.Leer el explicador →
- Agents que usan la computadora¿Cómo puede una IA hacer clic por las apps, y cuándo es seguro?Un agent de uso de la computadora opera la pantalla como una persona: toma una captura, planea un paso, hace clic o escribe, mira el resultado y verifica antes de seguir. Ese bucle, mirar, planear, actuar, verificar, permite al modelo usar software sin API. El problema es que las interfaces son frágiles y algunas acciones no se pueden deshacer. Por eso la verificación y la aprobación humana en los pasos arriesgados no son extras; son lo que separa a un agent útil de uno que hace clic con seguridad en el botón equivocado.Leer el explicador →
- MCP¿Qué es el Model Context Protocol y por qué importa?MCP, el Model Context Protocol, es un estándar abierto que permite a un asistente de IA descubrir y llamar herramientas y datos externos. Antes, cada asistente necesitaba código a medida para cada herramienta: N asistentes por M herramientas eran N por M integraciones. Con MCP, una herramienta publica un servidor que describe lo que sabe hacer y cualquier asistente que hable MCP puede usarla. Es un estándar de enchufe, no un modelo. Lo que cambia es cuánto alcanza un asistente sin que nadie escriba pegamento antes.Leer el explicador →
- Agents de código¿Cómo funcionan los agents de IA para programar?Un agent de código es un modelo de lenguaje envuelto en un bucle con herramientas: leer un archivo, buscar en el repositorio, editar, correr los tests, leer la salida, volver a decidir. El modelo nunca edita tu proyecto directamente. Propone una llamada a una herramienta, el harness la ejecuta y el resultado vuelve como texto que el modelo lee en el turno siguiente. Casi todo lo que separa a un buen agent de uno malo vive en ese harness: qué herramientas hay, qué contexto se junta y dónde se le pide confirmación a una persona.Leer el explicador →
- Agent o chatbot¿Cuál es la diferencia entre un agente de IA y un chatbot?El modelo es el mismo. Un chatbot toma tu mensaje y responde una vez. Un agent decide una acción, ejecuta una herramienta, lee lo que volvió y vuelve a decidir, repitiendo hasta que considera cumplido el objetivo. Ese bucle es toda la diferencia, y cambia todo lo que lo rodea: un agent necesita herramientas, permisos, un límite de pasos y un lugar donde una persona apruebe lo irreversible. Un chatbot que busca en la web una vez sigue siendo un chatbot. Lo que lo convierte en agent es elegir el siguiente paso por su cuenta.Leer el explicador →
Construir encima, y confiar en ello
Anclar las respuestas en tus datos, medir la calidad y conocer los límites.
- RAG¿Qué es la generación aumentada por recuperación (RAG)?RAG es cómo una IA responde a partir de tus documentos en vez de solo su entrenamiento. Cuando preguntas, el sistema busca en tu contenido los pasajes más relevantes, los pega en el context del modelo y le pide responder usándolos. El modelo nunca memorizó tus datos. Lee el texto recuperado al responder. Por eso RAG puede citar fuentes y mantenerse al día, y por eso casi todos sus fallos son en realidad fallos de recuperación: si el pasaje correcto no se trajo, el modelo no puede usarlo.Leer el explicador →
- Evals de LLM¿Qué son los evals, y cómo saben los equipos que una función de IA funciona?Un eval es una prueba repetible para una función de IA: un conjunto de entradas y una forma de puntuar si las salidas son lo bastante buenas. Como los modelos no son deterministas y 'se ve bien' no escala, los equipos construyen evals para atrapar regresiones antes que los usuarios. La puntuación puede ser comprobaciones exactas, rúbricas u otro modelo que actúa como juez. Lo difícil es mantener los evals honestos: un conjunto offline congelado puede quedar obsoleto o filtrarse al entrenamiento, así que las pruebas en producción y adversariales atrapan el resto.Leer el explicador →
- Alucinaciones¿Por qué los modelos de IA inventan cosas con total seguridad?Porque están construidos para continuar texto de forma plausible, no para reportar hechos. Un modelo de lenguaje siempre produce las siguientes palabras más probables. Cuando la verdad está en sus datos de entrenamiento, lo probable y lo cierto suelen coincidir. Cuando no, el modelo rellena el hueco con algo que suena bien, en prosa perfecta, porque nada en su interior distingue un hecho recordado de un patrón plausible. La alucinación no es un fallo encima del sistema. Es el sistema, corriendo sin anclaje.Leer el explicador →
- Bases de datos vectoriales¿Qué es una base de datos vectorial y por qué todo stack de RAG tiene una?Una base de datos vectorial guarda embeddings, las listas de números que codifican significado, y responde rápido una sola pregunta: ¿qué elementos guardados quedan más cerca de este vector nuevo? Eso es buscar por significado en vez de por palabra clave. Conviertes tus documentos en embeddings una vez, conviertes la pregunta del usuario al momento, traes los fragmentos más cercanos y los pegas en el context del modelo. Ese paso de traer es la recuperación de RAG, y los índices especializados existen porque comparar millones de vectores a lo bruto sería lentísimo.Leer el explicador →
- Límites de los LLM¿Cuáles son los límites reales de los modelos de lenguaje?La lista honesta: no pueden saber con fiabilidad lo que no saben, así que la seguridad y el acierto se separan. No tienen memoria más allá de la ventana de contexto salvo que un producto se la añada. La aritmética exacta y el conteo fallan sin una calculadora como herramienta. No pueden verificar hechos contra el mundo, solo contra patrones del texto de entrenamiento. Y no pueden actuar, navegar ni ejecutar código por sí solos; todo 'agent' es un arnés de herramientas y permisos alrededor del mismo predictor.Leer el explicador →
- LLM como juez¿Qué es usar un LLM como juez y funciona?Es usar un modelo para calificar la salida de otro modelo contra una rúbrica escrita, en vez de pagarle a una persona por leer cada respuesta. Es rápido, barato y consistente, y por eso es el estándar en casi todos los pipelines de evaluación. También hereda los puntos ciegos del juez: premia respuestas largas, seguras y bien formateadas, puede preferir texto de un modelo parecido a él, y favorece a la primera respuesta que vio. Calíbralo contra etiquetas humanas antes de confiar en él.Leer el explicador →
- RAG o fine-tuning¿Uso RAG o fine-tuning?Pregúntate qué te falta. Si al modelo le faltan datos, usa retrieval: deja los documentos fuera del modelo y trae los relevantes al prompt, así corregir un dato es una edición y las respuestas pueden citar su fuente. Si el modelo tiene los datos pero falla en el formato, el tono o la tarea, haz fine-tuning: compra consistencia y prompts más cortos. El conocimiento es retrieval, el comportamiento es fine-tuning. Casi todos necesitan retrieval, y quienes empiezan por fine-tuning suelen terminar haciendo las dos cosas.Leer el explicador →
- Data flywheel¿Qué es un data flywheel y por qué dicen que es el foso de la IA?Un data flywheel es un bucle donde usar un producto genera datos que lo mejoran, lo que atrae más uso, que genera más datos. En productos de IA el bucle es concreto: el tráfico se registra, los fallos se detectan y etiquetan, y el resultado alimenta evals y fine-tuning, así que la calidad se acumula con cada vuelta. Se le llama el foso porque los modelos base fuertes están al alcance de todos, mientras que tus datos de producción, lo que tus usuarios preguntan de verdad y dónde falla el producto, son solo tuyos.Leer el explicador →
Más allá del texto
Imágenes, audio y video, sobre las mismas ideas de fondo.
- IA multimodal¿Cómo se convierten imágenes, audio y documentos en algo sobre lo que un modelo puede razonar?Los modelos multimodales convierten cada entrada, texto, imagen, audio o una captura, en vectores dentro de un mismo espacio compartido, y luego razonan sobre todos juntos. Una imagen se corta en parches y cada parche se vuelve un vector, el mismo tipo de vector en que se convierte una palabra. Como viven en el mismo espacio, el modelo puede comparar una foto y un pie de imagen, responder una pregunta sobre un gráfico o describir lo que hay en una pantalla. Es la misma maquinaria que con el texto, apuntada a más tipos de entrada.Leer el explicador →
- Modelos de difusión¿Cómo funcionan de verdad los generadores de imágenes con IA?Un modelo de difusión se entrena tomando imágenes reales, agregándoles ruido hasta que son estática y aprendiendo a deshacer un paso de ese ruido. Para generar, parte de ruido puro y ejecuta muchas veces ese paso aprendido, empujando cada vez la imagen hacia algo más parecido a una foto. Tu prompt guía cada paso, así que el ruido se resuelve en una imagen que encaja con la descripción. No se copia ni se recupera nada. La imagen se quita del ruido hasta existir.Leer el explicador →
- Video y world models¿Cómo genera video la IA y qué es un world model?Los generadores de video extienden la difusión de imágenes al tiempo: en vez de limpiar una foto, limpian juntos un bloque de fotogramas, así el movimiento se mantiene coherente de uno a otro. Para que una pelota que rebota o una bebida que se sirve resulten creíbles, el modelo tiene que absorber regularidades aproximadas de cómo se mueven las cosas. Ese sentido implícito y aprendido de cómo se comporta el mundo es lo que se llama world model. Se aprende de video, no se programa, así que es aproximado y falla.Leer el explicador →