Qué es un LLM y por qué la IA "alucina": curso gratis, capítulo 1
Explica qué es un LLM, por qué genera respuestas plausibles pero no siempre verdaderas, y cómo funcionan tokens, costes, inferencia y KV cache.
Recomendado, valoración editorial 4 de 5
verificado 2026-10-05 — sigue siendo gratis en YouTube
Empezar en YouTubeRespuesta rápida
Curso gratis de Programación en YouTube (45 min). Nuestra valoración: 4/5, recomendado. Comprobamos que sigue siendo gratis el 5 de octubre de 2026.
- Veredicto
- 4/5 · Recomendado
- Para quién
- Programadores que usan asistentes como Cursor y quieren entender qué ocurre por dentro de un LLM antes de diseñar sistemas con agentes.
- Duración
- 45 min · 40 capítulos
- Precio
- Gratis en YouTube
- Publicado
- 2026
- Plan sugerido
- 2 sem. · 3 h/sem.
- Verificado
- el 5 de octubre de 2026
Nuestro veredicto
Recomendado, valoración editorial 4 de 5Capítulo conceptual muy bien estructurado que explica cómo funciona un LLM, sus costes y su inferencia con analogías claras. Es ideal para quien usa herramientas de IA y quiere entender lo que hay debajo. Al ser solo el inicio de una serie, conviene verlo como base.
Puntos fuertes
- Estructura clara en 40 capítulos con marcas de tiempo que permiten repasar temas concretos.
- Explica los conceptos con analogías y ejemplos, sin exigir matemáticas.
- Publicado en 2026 y orientado a agentes y costes reales de uso de APIs.
A tener en cuenta
- Es solo el primer capítulo de una serie; el recorrido completo hasta agentes aún no está en este vídeo.
- No se mencionan ejercicios ni proyecto práctico, es sobre todo explicación conceptual.
- Usa expresiones rioplatenses y da por hecho cierto contexto de desarrollo de software.
De qué trata
Primer capítulo de un curso gratuito de inteligencia artificial que va de los tokens a los agentes. Dura unos 45 minutos y está dividido en 40 marcas de tiempo.
Empieza explicando qué es un LLM, el transformer y por qué el modelo genera respuestas plausibles que no siempre son verdaderas. Sigue con el entrenamiento, el tamaño de los modelos, la API sin estado, los tokens y su coste, la velocidad de inferencia y, al final, la atención con Q, K y V y el KV cache. Se plantea sin matemática obligatoria.
- Qué es un LLM y generación autorregresiva
- Por qué plausibilidad no es verdad
- Pretraining, fine tuning y RLHF
- Tokens, costes por API y español frente a inglés
- Prefill, decode y KV cache
Para quién es este curso
- Programadores que usan asistentes como Cursor y quieren entender qué ocurre por dentro de un LLM antes de diseñar sistemas con agentes.
- Personas con curiosidad técnica que quieren entender tokens, coste por API, latencia y memoria sin necesidad de matemáticas avanzadas.
Mejor busca otro si…
- Quien ya conoce en detalle el transformer, el KV cache y la inferencia en prefill/decode y busca implementación o código.
- Quien busca un curso práctico de programación con proyecto: este capítulo es conceptual.
Antes de empezar
La información publicada del curso no detalla requisitos previos.
Qué sabrás hacer al terminar
- Entender qué es un LLM y cómo genera texto de forma autorregresiva.
- Explicar por qué un modelo produce respuestas plausibles pero no necesariamente verdaderas.
- Distinguir pretraining, fine tuning y RLHF, y el concepto de knowledge cutoff.
- Entender qué es un token, cómo se factura por API y por qué el español resulta más caro que el inglés.
- Comprender la inferencia en dos fases, TTFT frente a tokens por segundo y el papel del KV cache.
Estructura del curso
- 01
Introducción y motivación
Bienvenida, por qué conviene saber qué ocurre bajo el capot, la analogía del coche, el paso de usar Cursor a diseñar sistemas de agentes y la estructura del capítulo. Desde 0:00.
- 02
Qué es un LLM y por qué "alucina"
El LLM como máquina de predecir, el transformer y la atención, probabilidades, generación autorregresiva y la tesis de que plausibilidad no es verdad. Desde 3:43.
- 03
Entrenamiento
Pretraining, fine tuning y RLHF, knowledge cutoff y por qué el modelo se equivoca con confianza. Desde 9:04.
- 04
Tamaño y arquitectura
Parámetros, VRAM, cálculo de un modelo 7B, modelos frontier y Mixture of Experts. Desde 14:34.
- 05
API sin estado y memoria
La API es stateless, sesión CLI frente a endpoint, qué no forma parte del modelo y el problema que resuelve el KV cache. Desde 17:33.
- 06
Tokens y costes
Qué es un token, entrada frente a salida, tokenización y Byte Pair Encoding, el caso de strawberry, coste del español, precios por API y coste del system prompt. Desde 21:31.
- 07
Velocidad e inferencia
Prueba en vivo, TTFT frente a tokens por segundo, prefill y decode, compute bound frente a memory bound. Desde 30:24.
- 08
Atención y KV cache
Q, K y V con la analogía de la biblioteca, la fórmula de atención, el KV cache y la matemática de memoria. Cierre con el avance de prompt caching. Desde 37:44.
Capítulos del vídeo
- 0:00Bienvenida: el primero de muchos videos del curso gratis
- 0:30Por qué tenés que saber qué pasa bajo el capot
- 1:14La analogía del auto en la ruta
- 1:45De "yo uso Cursor" a diseñar sistemas de agentes
- 2:22La estructura del capítulo
- 2:47Los 4 conceptos que tenés que tener en la cabeza
- 3:43Qué es un LLM: una máquina de predecir
- 4:39El transformer y la atención
- 5:47Probabilidades: por qué París y no Roma
- 6:18Generación autorregresiva: la salida es la entrada
- 7:03200 líneas de React son millones de iteraciones
- 7:46Consecuencia 1: no piensa
Ver los 28 restantes
- 8:01La IA no alucina: plausibilidad vs verdad
- 9:04Entrenamiento: pretraining, fine tuning y RLHF
- 10:08Knowledge cutoff: por qué te responde con Angular viejo
- 10:43Fine tuning: nuestro primer harness
- 11:34RLHF: vos sos el conejillo de Indias
- 13:30Por qué se equivoca con tanta confianza
- 14:34Tamaño: parámetros, VRAM y el cálculo de un 7B
- 15:43Qué es un modelo frontier
- 16:14Mixture of Experts: 8 especialistas, elijo 2
- 17:33La API es stateless: sesión CLI vs endpoint
- 19:43Recordar, buscar y ejecutar NO son el modelo
- 20:49El problema que resuelve el KV cache
- 21:31Qué es un token: la unidad con la que pagás
- 22:20Token de entrada vs token de salida
- 23:26Tokenización y Byte Pair Encoding
- 24:52Cuántas R tiene strawberry
- 25:57Por qué el español es más caro que el inglés
- 27:42Precio por API: la salida cuesta 5 veces más
- 28:46System prompt: 50 millones de tokens al día
- 30:24Velocidad: la prueba en vivo con Pi
- 32:21TTFT vs tokens por segundo
- 34:10Inferencia en dos fases: prefill y decode
- 35:46Compute bound vs memory bound
- 37:44Q, K y V: la analogía de la biblioteca
- 39:00La fórmula de atención sin miedo
- 40:44KV cache: no recalcular lo que no cambia
- 43:29La matemática de memoria: 8B, 8K, 1 GB
- 44:10Cierre: la próxima, prompt caching
Plan de estudio sugerido
2 semanas · unas 3 h por semana
- 1.Sesión 1 (0:00–17:33): introducción, qué es un LLM, entrenamiento y tamaño. Resume con tus palabras por qué la IA no «alucina».
- 2.Sesión 2 (17:33–30:24): API stateless, tokens y precios. Cuenta los tokens de un texto en español y en inglés.
- 3.Sesión 3 (30:24–44:10): velocidad, inferencia, Q/K/V y KV cache. Repite el cálculo de memoria del final.
- 4.Repaso final: revisa los capítulos que te hayan costado y prepara el siguiente capítulo sobre prompt caching.
El plan cuenta con tiempo para pausar y practicar, no solo con la duración del vídeo. Si quieres adaptarlo a tu semana, lee cómo montar tu plan de estudio semanal.
Consejos para seguirlo
- Pausa en 14:34 y 43:29 e intenta hacer los cálculos de memoria antes de ver la solución.
- Compara cuántos tokens usa un mismo texto en español y en inglés tras ver 25:57.
- En 37:44–40:44 ve despacio: Q, K, V y el KV cache se apoyan unos en otros.
- Anota qué parte de lo que haces con tu asistente es el modelo y cuál es el sistema alrededor (19:43).
Antes y después de este curso
- Después de este cursoAgentic AI – Complete Course for BeginnersContinúa hacia el diseño de sistemas de agentes, objetivo declarado de esta serie.
- Después de este cursoEl fin del Vibe Coding: Crea software robusto con este métodoAplica a la práctica el uso de IA para programar con más rigor.
Cómo lo presenta el autor
Gentleman Programming | Qué es un LLM | Qué es un LLM y por qué la IA "alucina": arranca el curso gratis de inteligencia artificial, de tokens a agentes, sin humo y desde las entrañas. Capítulo 1: el modelo, la inferencia y el KV cache.
Este es el primero de muchos videos de un curso completamente gratuito. ¿La idea? Que dejes de ser "yo uso Cursor" y pases a ser la persona que diseña sistemas…
Extracto de la descripción original en YouTube.
Preguntas frecuentes
+¿Necesito saber matemáticas?
La descripción indica que hay cero matemática obligatoria y que los conceptos se explican con ejemplos de la vida real.
+¿Cuánto dura?
Unos 45 minutos. Con pausas y repasos, cuenta con unas 2-3 horas en total.
+¿Qué cubre?
LLM, transformer, entrenamiento, tokens, precios por API, inferencia y KV cache. El siguiente capítulo tratará el prompt caching.
+¿Hay material para profundizar?
La descripción dice que buena parte del curso procede de un libro gratuito, donde se puede profundizar.
Análisis editorial elaborado con ayuda de IA a partir de la descripción, los capítulos y la duración publicados en YouTube, y revisado según nuestro método. El contenido del curso es obra de su autor; si ves algún error, avísanos.
Guías para sacarle partido
Más cursos de Programación
Aprende Accesibilidad Web paso a paso
Introducción práctica a la accesibilidad web: pautas y leyes, contenido, navegación, diseño e interacción accesibles, relación con el SEO y evaluación de sitios.
Aprende Godot - Curso completo desde cero
Crea tu primer videojuego 3D en Godot 4 desde cero: escenas, nodos, GDScript, físicas, animaciones, sonido y exportación a .exe.
Aprende JavaScript Ahora! curso completo desde cero para principiantes
Curso de JavaScript desde cero: entorno, variables, tipos, operadores, control de flujo, diez ejercicios y objetos con funciones constructoras.
Aprende JavaScript - Curso Completo Desde Cero
Curso de JavaScript desde cero: variables, operadores, cadenas, arreglos, funciones, condicionales y switch, explicado paso a paso con ejemplos.