0 / 60 min
← todos los microlearnings
Micro-learning · nivel medio · ~60 min

La IA por Dentro

Ya sabés qué es un chatbot y usás IA seguido — esto es un paso más técnico: cómo procesa el texto un modelo, cómo "aprende" en realidad, y por qué alucina. Sin llegar a ingeniería de agentes.

Nivel: Medio
El texto se corta en tokens, entra a la ventana de contexto del modelo — a veces junto con documentos recuperados por RAG — y sale una respuesta generada palabra por palabra. texto tokens modelo ventana de contexto respuesta generada documentos (RAG)
texto → tokens → modelo (con ventana de contexto, a veces con RAG) → respuesta generada palabra por palabra
2′
Cómo usar esto
14′
Tokens y contexto
14′
Entrenar vs promptear
14′
Embeddings y RAG
14′
Límites reales
00 · antes de arrancar
2 min

Cómo usar esta guía

Este módulo asume que ya sabés qué es un chatbot de IA y lo usás seguido. La idea es abrir el capó un poco más: cómo procesa el texto, qué significa "entrenar", y por qué alucina — vocabulario intermedio, no el nivel de quien diseña agentes.

Mismo formato que siempre: idea en un párrafo, modelo mental, términos clave, video corto, y lo importante para no olvidar. Al final, un quiz de 6 preguntas con Score.

01 · la unidad mínima
14 min

Tokens y ventana de contexto

Antes de "leer" tu texto, el modelo lo corta en pedazos llamados tokens — no son palabras exactas, a veces son fragmentos de una palabra o hasta un solo carácter. Todo lo que el modelo puede "ver" a la vez (tu prompt + la conversación + lo que va generando) tiene un límite de tokens: la ventana de contexto.

Modelo mental Pensá la ventana de contexto como el tamaño del escritorio donde trabaja el modelo — lo que no entra en el escritorio, literalmente no lo puede ver en ese momento, aunque lo hayas escrito antes en la charla.
Token
la unidad mínima de texto que procesa el modelo: fragmento de palabra, palabra completa o símbolo.
Ventana de contexto
el máximo de tokens (entrada + salida) que el modelo puede manejar en un momento dado.
"Se olvidó"
lo que parece memoria perdida en una charla larga suele ser, en realidad, que algo se salió de la ventana de contexto.
AI tokens explained: How LLMs count and charge for your prompts youtube.com — qué es un token, en la práctica Why LLMs get dumb (Context Windows Explained) youtube.com — bonus, la ventana de contexto en profundidad
02 · cuándo aprende, en serio
14 min

Cómo "aprende" un modelo: entrenamiento vs prompting

El "aprendizaje" real de un modelo pasa una sola vez, durante el entrenamiento (pre-training): se ajustan miles de millones de parámetros internos mirando enormes cantidades de texto. Cuando vos chateás, no estás entrenando nada — estás dándole instrucciones (prompting) a un modelo que ya quedó fijo.

Modelo mental El entrenamiento es como estudiar toda una carrera antes del examen; el prompting es la pregunta puntual que le hacés después, en el examen — no puede "ir a estudiar más" en el momento, solo usa lo que ya sabe más lo que vos le pasás en el prompt.
Pre-training
la etapa larga y cara donde el modelo aprende patrones generales del lenguaje con enormes cantidades de texto.
Fine-tuning
un ajuste posterior, más chico, para especializar un modelo ya entrenado en una tarea o estilo particular.
Prompting / in-context learning
darle ejemplos o instrucciones dentro del prompt mismo, sin tocar los parámetros del modelo — efecto temporal, solo para esa conversación.
Large Language Models explained briefly youtube.com — pretraining, chatbots y transformers, sin vueltas
03 · buscar por significado
14 min

Embeddings y RAG

Un embedding es una forma de representar el significado de un texto (o imagen) como una lista de números — dos textos con significado parecido quedan "cerca" en ese espacio numérico. Eso permite hacer búsqueda semántica y es la base de RAG: dejar que el modelo consulte documentos reales antes de responder, en vez de confiar solo en lo que memorizó durante el entrenamiento.

Modelo mental Los embeddings son como coordenadas en un mapa de significados — "perro" y "gato" quedan cerca; "perro" y "termodinámica" quedan lejos. RAG es como darle al modelo una biblioteca puntual para consultar antes de responder, en vez de confiar solo en su memoria.
Embedding
representación numérica (vector) del significado de un texto.
Búsqueda semántica
buscar por parecido de significado, no por coincidencia exacta de palabras.
RAG (Retrieval-Augmented Generation)
el modelo primero busca información relevante en una fuente externa (documentos, base de datos) y después genera la respuesta usando eso como contexto.
What Are Embeddings? Explained Simply for Beginners youtube.com — qué es un embedding RAG Explained Simply | Retrieval-Augmented Generation for Beginners youtube.com — bonus, cómo se arma un RAG
04 · lo que no hay que romantizar
14 min

Límites reales: alucinación, sesgo, temperatura

El modelo no "sabe" hechos como una enciclopedia — genera la palabra más probable en base a patrones estadísticos, lo cual explica por qué a veces inventa con total seguridad. Además, refleja los sesgos de sus datos de entrenamiento, y un parámetro llamado temperatura controla cuánto "se anima" a elegir palabras menos obvias.

Modelo mental Pedirle "la verdad" a un modelo generativo es como pedirle a alguien que complete una frase lo más natural posible — a veces esa frase natural coincide con la verdad, a veces no, porque el objetivo del modelo es "sonar plausible", no "verificar hechos".
Alucinación
información inventada, generada porque sonaba estadísticamente probable, no porque fuera verificada.
Sesgo (bias)
patrones injustos o desbalanceados presentes en los datos de entrenamiento que el modelo reproduce.
Temperatura
parámetro que controla cuán "arriesgado" es el modelo al elegir la próxima palabra — baja = más predecible, alta = más variado (y más propenso a inventar).
Why Does AI Hallucinate? The Probability Problem Behind LLM Hallucinations, Explained youtube.com — la explicación técnica de por qué alucina
05 · atando cabos
2 min

Síntesis

Bajo el capó, un LLM corta tu texto en tokens, los procesa dentro de una ventana de contexto limitada, y genera la respuesta más probable en base a patrones aprendidos durante un entrenamiento carísimo que ya terminó — el prompting no reentrena nada, solo lo instruye en el momento. Cuando hace falta precisión sobre datos puntuales, RAG le da una biblioteca real para consultar en vez de confiar solo en su memoria. Y como su objetivo es generar texto plausible, no verificar hechos, alucina, hereda sesgos de sus datos, y su temperatura decide cuánto se arriesga al elegir cada palabra.

TérminoEn una línea
Tokenla unidad mínima de texto que procesa el modelo
Ventana de contextocuánto puede "ver" el modelo a la vez
Pre-training / Promptingcuándo aprende de verdad vs. cuándo solo lo instruís
RAGel modelo consulta documentos reales antes de responder

Quiz — ¿quedó claro?

6 preguntas, corrección inmediata acá mismo, con un Score al final. No se guarda ni se envía a ningún lado por ahora.

1. ¿Qué es un "token"?

2. ¿Qué es la "ventana de contexto"?

3. Cuando chateás con un modelo, ¿estás "entrenándolo" en tiempo real?

4. ¿Para qué sirve un embedding?

5. ¿Qué hace RAG (Retrieval-Augmented Generation)?

6. ¿Por qué alucina un modelo generativo?