Ya sabés qué es un chatbot y usás IA seguido — esto es un paso más técnico: cómo procesa el texto un modelo, cómo "aprende" en realidad, y por qué alucina. Sin llegar a ingeniería de agentes.
Nivel: Medio
texto → tokens → modelo (con ventana de contexto, a veces con RAG) → respuesta generada palabra por palabra
2′
Cómo usar esto
14′
Tokens y contexto
14′
Entrenar vs promptear
14′
Embeddings y RAG
14′
Límites reales
00 · antes de arrancar
2 min
Cómo usar esta guía
Este módulo asume que ya sabés qué es un chatbot de IA y lo usás seguido. La idea es abrir el capó un poco más: cómo procesa el texto, qué significa "entrenar", y por qué alucina — vocabulario intermedio, no el nivel de quien diseña agentes.
Mismo formato que siempre: idea en un párrafo, modelo mental, términos clave, video corto, y lo importante para no olvidar. Al final, un quiz de 6 preguntas con Score.
01 · la unidad mínima
14 min
Tokens y ventana de contexto
Antes de "leer" tu texto, el modelo lo corta en pedazos llamados tokens — no son palabras exactas, a veces son fragmentos de una palabra o hasta un solo carácter. Todo lo que el modelo puede "ver" a la vez (tu prompt + la conversación + lo que va generando) tiene un límite de tokens: la ventana de contexto.
Modelo mental
Pensá la ventana de contexto como el tamaño del escritorio donde trabaja el modelo — lo que no entra en el escritorio, literalmente no lo puede ver en ese momento, aunque lo hayas escrito antes en la charla.
Token
la unidad mínima de texto que procesa el modelo: fragmento de palabra, palabra completa o símbolo.
Ventana de contexto
el máximo de tokens (entrada + salida) que el modelo puede manejar en un momento dado.
"Se olvidó"
lo que parece memoria perdida en una charla larga suele ser, en realidad, que algo se salió de la ventana de contexto.
Los tokens no son "una palabra = un token" — palabras largas o poco comunes se parten en varios.
Una ventana de contexto más grande no garantiza mejores respuestas — info en el medio de un contexto largo se puede "perder" igual.
Si un chat se pone raro después de mucho ida y vuelta, probablemente sea un problema de contexto, no que el modelo "se puso tonto".
02 · cuándo aprende, en serio
14 min
Cómo "aprende" un modelo: entrenamiento vs prompting
El "aprendizaje" real de un modelo pasa una sola vez, durante el entrenamiento (pre-training): se ajustan miles de millones de parámetros internos mirando enormes cantidades de texto. Cuando vos chateás, no estás entrenando nada — estás dándole instrucciones (prompting) a un modelo que ya quedó fijo.
Modelo mental
El entrenamiento es como estudiar toda una carrera antes del examen; el prompting es la pregunta puntual que le hacés después, en el examen — no puede "ir a estudiar más" en el momento, solo usa lo que ya sabe más lo que vos le pasás en el prompt.
Pre-training
la etapa larga y cara donde el modelo aprende patrones generales del lenguaje con enormes cantidades de texto.
Fine-tuning
un ajuste posterior, más chico, para especializar un modelo ya entrenado en una tarea o estilo particular.
Prompting / in-context learning
darle ejemplos o instrucciones dentro del prompt mismo, sin tocar los parámetros del modelo — efecto temporal, solo para esa conversación.
Entrenar un modelo desde cero es carísimo y lento; hacerle fine-tuning o simplemente promptearlo bien es rápido y barato.
Un chat no "entrena" al modelo en tiempo real — lo que aprende ahí no queda guardado para la próxima conversación (salvo memoria explícita del producto).
"Explicarle mejor" en el prompt (in-context learning) puede mejorar mucho la respuesta sin tocar el modelo.
03 · buscar por significado
14 min
Embeddings y RAG
Un embedding es una forma de representar el significado de un texto (o imagen) como una lista de números — dos textos con significado parecido quedan "cerca" en ese espacio numérico. Eso permite hacer búsqueda semántica y es la base de RAG: dejar que el modelo consulte documentos reales antes de responder, en vez de confiar solo en lo que memorizó durante el entrenamiento.
Modelo mental
Los embeddings son como coordenadas en un mapa de significados — "perro" y "gato" quedan cerca; "perro" y "termodinámica" quedan lejos. RAG es como darle al modelo una biblioteca puntual para consultar antes de responder, en vez de confiar solo en su memoria.
Embedding
representación numérica (vector) del significado de un texto.
Búsqueda semántica
buscar por parecido de significado, no por coincidencia exacta de palabras.
RAG (Retrieval-Augmented Generation)
el modelo primero busca información relevante en una fuente externa (documentos, base de datos) y después genera la respuesta usando eso como contexto.
RAG reduce alucinaciones porque el modelo responde citando algo que efectivamente leyó en ese momento, no solo lo que "recuerda" del entrenamiento.
Los embeddings son la base técnica de "buscar por significado" en vez de por palabra exacta.
Un modelo con RAG puede responder sobre documentos privados o información muy reciente que nunca vio en su entrenamiento.
04 · lo que no hay que romantizar
14 min
Límites reales: alucinación, sesgo, temperatura
El modelo no "sabe" hechos como una enciclopedia — genera la palabra más probable en base a patrones estadísticos, lo cual explica por qué a veces inventa con total seguridad. Además, refleja los sesgos de sus datos de entrenamiento, y un parámetro llamado temperatura controla cuánto "se anima" a elegir palabras menos obvias.
Modelo mental
Pedirle "la verdad" a un modelo generativo es como pedirle a alguien que complete una frase lo más natural posible — a veces esa frase natural coincide con la verdad, a veces no, porque el objetivo del modelo es "sonar plausible", no "verificar hechos".
Alucinación
información inventada, generada porque sonaba estadísticamente probable, no porque fuera verificada.
Sesgo (bias)
patrones injustos o desbalanceados presentes en los datos de entrenamiento que el modelo reproduce.
Temperatura
parámetro que controla cuán "arriesgado" es el modelo al elegir la próxima palabra — baja = más predecible, alta = más variado (y más propenso a inventar).
Alucinar no es un bug raro — es una consecuencia directa de cómo funciona un modelo generativo (predice, no verifica).
El sesgo no se "arregla" solo con buena voluntad — viene de los datos, y hay que diseñar contra él a propósito.
Bajar la temperatura hace respuestas más predecibles, pero no elimina las alucinaciones — solo las hace menos "creativas".
05 · atando cabos
2 min
Síntesis
Bajo el capó, un LLM corta tu texto en tokens, los procesa dentro de una ventana de contexto limitada, y genera la respuesta más probable en base a patrones aprendidos durante un entrenamiento carísimo que ya terminó — el prompting no reentrena nada, solo lo instruye en el momento. Cuando hace falta precisión sobre datos puntuales, RAG le da una biblioteca real para consultar en vez de confiar solo en su memoria. Y como su objetivo es generar texto plausible, no verificar hechos, alucina, hereda sesgos de sus datos, y su temperatura decide cuánto se arriesga al elegir cada palabra.
Término
En una línea
Token
la unidad mínima de texto que procesa el modelo
Ventana de contexto
cuánto puede "ver" el modelo a la vez
Pre-training / Prompting
cuándo aprende de verdad vs. cuándo solo lo instruís
RAG
el modelo consulta documentos reales antes de responder
Quiz — ¿quedó claro?
6 preguntas, corrección inmediata acá mismo, con un Score al final. No se guarda ni se envía a ningún lado por ahora.
0/100
Este Score queda solo en tu navegador por ahora. Cuando el sitio tenga cuentas (v2), vas a poder guardarlo y compararlo con el de otros.