Hablas con Claude y te responde en un español claro, natural y bien organizado. Parece que te entiende. Pero ¿qué pasa realmente por dentro? No es magia, y tampoco es una "mente de verdad". Son matemáticas que trabajan con pequeños bloques de texto. Cuando lo entiendes, empiezas a usar la IA con más eficacia.
Lo esencial
La mayoría de la gente usa un LLM (Large Language Model, modelo de lenguaje grande) como una caja negra: haces una pregunta y recibes una respuesta. Eso funciona. Pero saber cómo funciona la caja por dentro te da ventajas prácticas: ahorras dinero, obtienes mejores respuestas y entiendes por qué la IA a veces se equivoca y cómo evitarlo.
Esta lección es una radiografía de un modelo de lenguaje. Sin fórmulas. Solo imágenes.
Conceptos clave
- Token: la unidad de texto más pequeña con la que trabaja la IA
- Preentrenamiento: cómo aprende un modelo a partir de enormes cantidades de texto
- Embedding: cómo la IA convierte las palabras en números y significado
- Transformer y atención: el diseño que lo cambió todo
- Ventana de contexto: la memoria de la IA dentro de una sola conversación
- Temperatura: la perilla de la "aleatoriedad creativa"
- Alucinación: por qué la IA a veces dice cosas falsas con total seguridad
Teoría
1. Qué es un token: los átomos del lenguaje
Lo primero: la IA no lee palabras. Ve tokens, las unidades de texto más pequeñas con las que trabaja (piensa en las fichas de las maquinitas: piezas pequeñas y estándar que la máquina cuenta una por una).
Un token no es una palabra. Es un trozo de texto que el modelo de lenguaje trata como una pieza que ya no puede dividir. A veces un token es una palabra entera. A veces es parte de una palabra. A veces es un solo carácter.
Ejemplos (con palabras en inglés; las cifras son aproximadas, porque cada modelo corta el texto a su manera):
- La palabra
cat("gato") = 1 token (corta y común) - La palabra
catastrophe("catástrofe") puede dividirse en 3 tokens:cat+ast+rophe - Una palabra larga y poco común como
anthropomorphism("antropomorfismo") = varios tokens - Las palabras de otros idiomas suelen dividirse en más pedazos que las del inglés
Un detalle importante: el inglés es el idioma "más barato" en tokens. Muchos otros idiomas necesitan bastantes más tokens para decir lo mismo (la proporción exacta depende del modelo y del texto). Eso importa porque en tokens se cuentan los límites de tu chat, y en tokens pagan los desarrolladores que usan la API (la conexión con la que los programas le hablan a la IA).
Una regla práctica aproximada, según Anthropic: 1,000 tokens ≈ 750 palabras en inglés. Los modelos de Claude más nuevos cortan el texto en pedazos más pequeños, así que en ellos 1,000 tokens equivalen más bien a unas 555 palabras. El texto en otros idiomas suele ocupar más tokens para la misma cantidad de significado.
Por qué importa en la práctica:
- El uso se cuenta en tokens, no en palabras: en el chat, los tokens gastan tu límite; en la API, los desarrolladores pagan por ellos. Cuanto más corto y concreto sea tu prompt (tu solicitud a la IA), menos gastas
- Los textos largos en otros idiomas pueden ocupar más tokens que el mismo texto en inglés
- Un prompt compacto, sin relleno, puede bajar bastante el gasto sin perder calidad
2. Cómo aprende la IA: el preentrenamiento
¿Cómo sabe Claude qué significa la palabra "gato"? ¿Cómo sabe que después de "El sol brilla en el" viene "cielo"? ¿Cómo sabe de historia, física, programación?
La respuesta: el preentrenamiento (la primera etapa del entrenamiento de un modelo de lenguaje).
Imagina que los creadores del modelo reúnen una biblioteca gigante de textos. No solo grande: inimaginablemente grande. Enciclopedias en muchos idiomas, libros, artículos científicos, código de programas, noticias, foros, documentos legales. A esto se le llama corpus (del latín "cuerpo": una gran colección de textos que se usa para entrenar).
Después el modelo se entrena con ese corpus: billones de tokens, meses de cálculo en miles de chips especializados.
La tarea del entrenamiento es casi absurdamente sencilla: adivinar el siguiente token.
En concreto: el modelo ve el texto "La Tierra gira alrededor del" y tiene que predecir qué sigue. La respuesta correcta: "Sol". El modelo predijo "estrellas": incorrecto. Se ajustan los parámetros. Otra vez. Y otra. Billones de veces.
¿Suena primitivo? Pero todo nace de esta única tarea sencilla. Para adivinar bien la siguiente palabra en un artículo médico, hay que entender de medicina. Para adivinar bien en código, hay que entender la lógica de la programación. Para adivinar bien en poesía, hay que sentir el ritmo.
3. Embeddings: cómo ve la IA el significado
Una computadora solo entiende números. Entonces, ¿cómo trabaja con texto?
La respuesta: cada token se convierte en un vector de números.
Un embedding (la posición de una palabra en un espacio hecho de números) es una forma de convertir cualquier palabra en una lista de números, de modo que las palabras con significados parecidos terminen con números parecidos.
Un vector (una lista ordenada de números) para la palabra "gato" podría verse así: [0.32, -0.71, 0.15, 0.88, -0.03, ...]: miles de números en una lista. La palabra "gatito" recibe una lista muy parecida. La palabra "plátano" recibe una completamente distinta.
Estos vectores viven en un espacio matemático con una cantidad enorme de dimensiones. Las palabras de significado parecido quedan cerca en ese espacio. Las de significado distinto quedan lejos.
Una propiedad notable de los embeddings: hacer cuentas con ellos realmente tiene sentido.
Hay un ejemplo famoso: vector("rey") - vector("hombre") + vector("mujer") ≈ vector("reina"). Hacer cuentas con texto dio la respuesta correcta sobre cómo se relacionan las ideas. No es casualidad; así está organizado el espacio del significado.
4. El transformer y el mecanismo de atención
En 2017, investigadores de Google publicaron un artículo llamado "Attention Is All You Need" ("La atención es todo lo que necesitas"). Ese artículo cambió la historia de la IA.
El transformer (una arquitectura de red neuronal inventada en Google en 2017) es el tipo de diseño que se volvió la base de todos los modelos de lenguaje modernos: GPT, Claude, Gemini, Llama.
Antes de los transformers, la IA leía el texto como una persona lee un libro aburrido: de izquierda a derecha, palabra por palabra, olvidando el principio para cuando llegaba al final. Los textos largos le costaban.
El transformer resolvió esto de forma radical: ve TODO el texto a la vez.
El mecanismo clave es la atención: la capacidad del modelo de tomar en cuenta cada parte del texto mientras procesa cada palabra.
Cuando un transformer procesa la palabra "él" en una oración, el mecanismo de atención se pregunta: ¿a qué otras palabras de este texto tengo que prestarles atención para saber quién es "él"?
Ejemplo: "El banco del parque estaba recién pintado" vs "El banco aprobó un préstamo al 12%".
La palabra "banco" es la misma. Pero en el primer caso, el mecanismo de atención nota la palabra "parque" y entiende: es un asiento. En el segundo, nota la palabra "préstamo" y entiende: es una institución financiera. Una palabra, dos significados distintos, diferenciados correctamente al prestar atención al contexto.
5. La ventana de contexto: el escritorio de la IA
La ventana de contexto (la cantidad máxima de texto que la IA puede tener a la vista durante una conversación) probablemente es el ajuste más importante en la práctica cuando trabajas con IA.
Todo lo que está dentro de la ventana de contexto, la IA lo "ve" y lo toma en cuenta. Todo lo que queda fuera no existe para la IA en ese momento.
Tamaños de la ventana de contexto (a octubre de 2026, para Claude en la API):
- Claude Fable 5.1, Opus 5.5, Sonnet 5.5: 1,000,000 tokens ≈ 555,000 palabras en inglés (estos modelos cortan el texto en tokens más pequeños que los anteriores) ≈ 1,800 páginas de libro
- Claude Haiku 4.5: 200,000 tokens ≈ 150,000 palabras en inglés ≈ 500 páginas
ChatGPT, Gemini y otros asistentes también tienen ventanas de cientos de miles o millones de tokens, pero las cifras exactas dependen del modelo y del plan: revisa la documentación del proveedor y la página Lo vigente. En una app normal (por ejemplo, el chat de claude.ai), la cantidad disponible para ti puede ser distinta a la de la API.
Son números grandes. Pero en el trabajo real, el contexto se gasta más rápido de lo que crees: el prompt de sistema (las instrucciones de fondo que la app le da al modelo), el historial de la conversación, los documentos que subes y las propias respuestas de la IA ocupan espacio en la ventana de contexto.
Qué pasa cuando el contexto se llena: Las partes anteriores de la conversación quedan "empujadas fuera", y la IA deja de tomarlas en cuenta. Lo vas a notar: la IA "olvida" lo que se dijo al principio de un chat largo. No es falta de inteligencia; es un límite propio de cómo funciona el modelo.
Conclusiones prácticas:
- Un contexto grande es cómodo. Pero cuesta más: en la API pagas por cada token de la solicitud, y en el chat una conversación larga gasta tu límite más rápido
- Para más adelante, cuando llegues a Claude Code (el agente para programar, casi al final del curso): en proyectos largos, su comando
/compactcomprime el historial de la conversación y conserva lo esencial - Organiza tus conversaciones: abre un chat nuevo para cada tarea nueva en lugar de meter todo en uno
6. Cómo genera la IA una respuesta, paso a paso
Escribiste: "Explícame la mecánica cuántica con palabras sencillas". ¿Qué pasa después?
Paso 1: Tokenización Tu texto se divide en tokens: "Explícame", "la", "mecánica", "cuántica" y así. Las palabras más largas o menos comunes se pueden dividir en varios tokens.
Paso 2: Embeddings Cada token se convierte en un vector de números. Ahora tu solicitud existe como un conjunto de puntos en un espacio matemático.
Paso 3: El transformer lo procesa El mecanismo de atención recorre todos los tokens, construye conexiones entre ellos y descifra el contexto. "Mecánica" + "cuántica" + "con palabras sencillas": tres partes, y cada una importa para entender la tarea.
Paso 4: Calcular probabilidades El modelo mira todo lo que hay en el contexto y calcula: ¿cuál es el siguiente token más probable? No una sola opción, sino una distribución de probabilidades sobre todo su vocabulario (decenas de miles de tokens). "La": 12%, "Vamos": 8%, "Imagina": 15%...
Paso 5: Muestreo (elegir el siguiente token a partir de la distribución de probabilidades) El modelo elige un token. Cómo elige exactamente depende de la temperatura (más sobre eso abajo).
Paso 6: Repetir El token elegido se agrega al contexto. Los pasos 4 y 5 se repiten para el siguiente token. Y otra vez. Y otra, hasta que la respuesta está completa.
7. Temperatura: la perilla de la aleatoriedad
La temperatura (un ajuste que controla cuánta "aleatoriedad" entra al elegir el siguiente token; el rango cambia según el servicio, casi siempre de 0 a 1 o de 0 a 2) es una idea importante para entender por qué las respuestas varían.
⚠️ Una aclaración, a octubre de 2026. En la API de los modelos de Claude más nuevos (Opus 4.7 y posteriores, incluido Opus 5.5), se quitó el control manual de la temperatura: cualquier valor distinto al predeterminado devuelve un error, y el comportamiento se guía con la forma en que redactas tu solicitud. Las apps de chat normales no tienen este ajuste. Algunos otros modelos y servicios todavía lo ofrecen, así que vale la pena conocer el principio de abajo, pero revisa la documentación de tu modelo.
Recuerda: en el paso de elegir el token, el modelo tiene una distribución de probabilidades. La temperatura decide cómo elegir dentro de ella.
Temperatura = 0: El modelo siempre elige el token con la probabilidad más alta. Un modo totalmente determinista (determinista quiere decir predecible: la misma entrada da la misma salida). Haz la misma pregunta 10 veces y vas a obtener la misma respuesta. Predecible. Confiable. Aburrido. (Incluso con temperatura cero, no siempre está garantizada una respuesta idéntica.)
Sirve para: instrucciones precisas, sacar datos de documentos, tareas estructuradas, código.
Temperatura = 1 (la predeterminada): Un equilibrio entre predictibilidad y variedad. Es el ajuste predeterminado de Claude. Las respuestas son coherentes, pero no mecánicas.
Temperatura = 1.5 a 2: El modelo toma tokens de menor probabilidad: elecciones "inesperadas". Las respuestas se vuelven creativas, sorprendentes, a veces raras. Con temperaturas muy altas, se convierten en disparates.
Guía práctica (donde tu herramienta te deje ajustar la temperatura):
- Escribir código / extraer datos → temperatura de 0 a 0.3
- Conversación normal / análisis → temperatura de 0.7 a 1.0
- Lluvia de ideas / escritura creativa → temperatura de 1.0 a 1.3
- Más de 1.5: solo para experimentos
8. Parámetros del modelo: qué son
Un parámetro (un valor numérico que el modelo aprendió durante el entrenamiento) es uno de los números dentro de una red neuronal que determinan cómo "piensa".
Dicho de forma sencilla: una red neuronal es una función matemática con miles de millones de variables. El entrenamiento es el proceso de encontrar los valores correctos para esas variables, de modo que la función se vuelva buena para predecir el siguiente token.
Comparación de tamaños:
- GPT-3 (2020): 175 mil millones de parámetros
- Los modelos insignia actuales de OpenAI, Anthropic y Google: las empresas no revelan su tamaño, y cualquier cifra que encuentres en internet es una suposición
- Llama 3.1 (Meta, de pesos abiertos, es decir, cualquiera puede descargar el modelo): versiones de 8, 70 y 405 mil millones
Más parámetros ≠ un mejor modelo. Es un error común. Lo que importa no es la cantidad, sino la calidad del entrenamiento, los datos y la arquitectura. Modelos más nuevos y más pequeños suelen superar a sus antecesores más grandes.
9. Ajuste fino: así nace un asistente
Después del preentrenamiento básico, tienes un modelo de lenguaje potente pero "en bruto". Sabe predecir tokens. Pero no sabe ser un asistente útil: podría citar propaganda nazi o dar instrucciones para autolesionarse, simplemente porque "eso también era texto de los datos de entrenamiento".
Para convertir un "predictor de texto" en un "asistente útil", los desarrolladores usan el ajuste fino o fine-tuning (entrenamiento adicional de un modelo ya entrenado con datos específicos para un objetivo específico).
RLHF: el método clave detrás de ChatGPT, GPT-4 y la mayoría de los modelos comerciales
RLHF (Reinforcement Learning from Human Feedback, aprendizaje por refuerzo con retroalimentación humana) funciona así:
- El modelo genera varias respuestas posibles a la misma pregunta
- Revisores humanos las ordenan: esta es mejor, aquella es peor
- Esas clasificaciones se usan para entrenar un modelo de recompensa aparte (un modelo que califica respuestas)
- El modelo principal aprende a producir respuestas que el modelo de recompensa califique alto
Constitutional AI: el método de Anthropic para Claude
Constitutional AI o IA constitucional (un método de entrenamiento en el que el modelo se guía por un conjunto de principios) es el enfoque que Anthropic usa como base del entrenamiento de Claude.
En lugar de depender solo de calificaciones humanas (las personas se equivocan y tienen sesgos), Claude se entrena para seguir un conjunto de principios explícitos, una "constitución": ser útil, ser honesto, evitar daños. El modelo aprende a criticar sus propias respuestas con base en esos principios y a mejorarlas.
10. Por qué alucina la IA
Una alucinación (cuando la IA afirma con seguridad algo que es falso) es el problema más común que vas a encontrar con los modelos de lenguaje.
La IA cita con seguridad artículos científicos que no existen. Les atribuye frases a personas reales que nunca las dijeron. Da fechas equivocadas de hechos históricos. Y hace todo eso con el mismo tono seguro que usa cuando tiene razón.
Por qué pasa:
Recuerda: el modelo está optimizado para "adivinar el siguiente token de modo que el texto suene creíble". No para "decir la verdad". Creíble y verdadero son dos cosas distintas.
Si en los datos de entrenamiento hay muchos textos que mencionan a alguien como "el profesor Martínez de la Universidad de Guadalajara", el modelo va a producir un creíble "profesor Martínez de la Universidad de Guadalajara" aunque esa persona no exista. Porque es un patrón creíble.
Si un dato concreto apareció pocas veces en los datos de entrenamiento, o en contextos contradictorios, el modelo llena el hueco con la opción "más probable". Que puede ser falsa.
La IA no "sabe" datos como una persona sabe algo que leyó en una fuente confiable. La IA vio patrones en textos sobre hechos, y reproduce esos patrones.
Cómo protegerte:
- Verifica siempre los datos importantes en una fuente independiente
- Revisa dos veces fechas, nombres y estadísticas
- Para información actual, pídele a Claude que busque en internet (tiene búsqueda web integrada) y revisa los enlaces que cita
- Pregúntale a Claude: "¿Estás seguro de esto? ¿Qué tan probable es que te equivoques?". Los modelos entrenados para ser honestos muchas veces admiten su incertidumbre
11. Por qué esto importa en la práctica
Esto no es una clase académica. Cada sección tiene un uso directo en tu trabajo.
Tokens → cuidar tu límite y tu dinero: Los tokens gastan tu límite en el chat, y en la API cuestan dinero. Cuando entiendes qué es un token:
- Escribes prompts más compactos (menos relleno = menos tokens = menos gasto)
- Sabes que el inglés suele ser el idioma más barato en tokens, así que un documento largo en español gasta tu límite más rápido que el mismo documento en inglés
- No cargas documentos enteros al contexto, solo las partes que necesitas
Ventana de contexto → trabajar con documentos grandes: Sabiendo que el contexto tiene límites:
- Divides los documentos grandes en partes y los trabajas uno por uno
- Más adelante, en Claude Code, usas el comando
/compactcuando una conversación se alarga - Abres un chat nuevo para cada tarea nueva en lugar de meter todo en uno
Temperatura → consistencia o creatividad: Sabiendo cómo funciona la temperatura:
- Pones una temperatura baja para tareas que necesitan resultados repetibles (generar código, extraer datos), donde tu herramienta te deja cambiarla
- Pones una más alta para lluvias de ideas y generar propuestas
- Entiendes por qué el mismo prompt da resultados distintos en distintos intentos
Alucinaciones → pensamiento crítico: Sabiendo de dónde vienen las alucinaciones:
- No confías ciegamente en la IA en preguntas sobre datos
- Siempre verificas lo importante en fuentes primarias
- Usas la IA para ordenar tus ideas, no como sustituto de la verificación de datos
Práctica
Ejercicio 1: Un experimento con tokens
Entra a claude.ai y escribe:
Aquí hay una lista de palabras. Para cada una, dime más o menos cuántos tokens ocupa: cat, catastrophe, computer, AI, internationalization, hello, hola, computadora, anthropomorphism, i18n
Mira la respuesta. Es una estimación aproximada: la cantidad de tokens depende del modelo, y el conteo exacto solo se obtiene a través de la API (la interfaz que usan los desarrolladores). La documentación de Anthropic explica cómo funciona: Token counting (en inglés). Tú no tienes que contar nada: basta con ver que las palabras cortas y comunes ocupan un token, y las largas o poco comunes, varios.
Objetivo: darte una idea de cómo cambia el número de tokens entre idiomas y entre palabras.
Ejercicio 2: Un experimento de temperatura repitiendo la pregunta
Escribe el mismo prompt tres veces seguidas sin cambiar nada (abre un chat nuevo cada vez, para que Claude no vea sus respuestas anteriores):
Inventa un nombre poco común para una cafetería al estilo del realismo mágico. Solo el nombre, sin explicación.
¿Las respuestas coincidieron? ¿Cambiaron un poco? ¿Cambiaron mucho? Eso es la temperatura en acción.
Ejercicio 3: Una prueba de la ventana de contexto
Toma cualquier artículo largo de internet (de al menos 5,000 palabras). Pégalo en un chat con Claude y haz una pregunta sobre detalles del principio del artículo. Después pregunta por detalles del final. Compara qué tan precisas son las respuestas.
Luego prueba dividir el mismo artículo en dos solicitudes y fíjate si cambia la calidad de las respuestas.
Qué esperar: un artículo de este tamaño cabe entero en la ventana de contexto, así que Claude debería responder igual de bien sobre el principio y sobre el final. El "olvido" solo empieza en conversaciones muy largas.
Ejercicio 4: Detectar alucinaciones
Pregúntale a Claude por un dato concreto y poco conocido: por ejemplo, la segunda ciudad más grande de un país poco conocido, o el año en que se fundó una universidad pequeña en particular. Anota la respuesta. Verifícala en Wikipedia. ¿Coincidió?
Objetivo: crear el reflejo de verificar los datos importantes.
Ideas clave
La IA no es una máquina que piensa. Es un predictor del siguiente token muy avanzado. Eso explica tanto sus fortalezas (patrones, conexiones, velocidad) como sus debilidades (alucinaciones, ninguna comprensión "real").
Los tokens son la moneda del trabajo con IA. Cuantos menos tokens innecesarios haya en tu prompt, más barato el resultado, y muchas veces más preciso.
La ventana de contexto es el escritorio de la IA. Lo que está sobre el escritorio, lo ve. Lo que está fuera, no. Administra lo que pones sobre el escritorio.
La temperatura fija el equilibrio entre predictibilidad y creatividad. Baja para el código. Alta para las ideas.
Las alucinaciones son una propiedad de la arquitectura. No son mala intención ni una falla al azar. El modelo está optimizado para lo creíble, no para la verdad. Verifica lo importante.
El ajuste fino convirtió un "predictor de texto" en un "asistente útil". Constitutional AI es el enfoque de Anthropic, y el comportamiento de Claude se construye sobre él.
Próxima lección
→ La historia de la IA: de Turing a Claude, de dónde salió todo esto y por qué el punto de quiebre está pasando ahora.
La comparación de los asistentes (Claude, ChatGPT, Gemini y otros) viene en el módulo siguiente, en la lección Comparación de modelos de IA.
La marca se guarda solo en este navegador y no se envía a ningún sitio. Mi progreso