cursos.
← Programación
Ficha 005.569YouTubeGRATIS

Qué es un LLM y por qué la IA "alucina": curso gratis, capítulo 1

Explica qué es un LLM, por qué genera respuestas plausibles pero no siempre verdaderas, y cómo funcionan tokens, costes, inferencia y KV cache.

Recomendado, valoración editorial 4 de 5

verificado 2026-10-05 — sigue siendo gratis en YouTube

Empezar en YouTube

Respuesta rápida

Curso gratis de Programación en YouTube (45 min). Nuestra valoración: 4/5, recomendado. Comprobamos que sigue siendo gratis el 5 de octubre de 2026.

Veredicto
4/5 · Recomendado
Para quién
Programadores que usan asistentes como Cursor y quieren entender qué ocurre por dentro de un LLM antes de diseñar sistemas con agentes.
Duración
45 min · 40 capítulos
Precio
Gratis en YouTube
Publicado
2026
Plan sugerido
2 sem. · 3 h/sem.
Verificado
el 5 de octubre de 2026

Nuestro veredicto

Recomendado, valoración editorial 4 de 5

Capítulo conceptual muy bien estructurado que explica cómo funciona un LLM, sus costes y su inferencia con analogías claras. Es ideal para quien usa herramientas de IA y quiere entender lo que hay debajo. Al ser solo el inicio de una serie, conviene verlo como base.

Puntos fuertes

  • Estructura clara en 40 capítulos con marcas de tiempo que permiten repasar temas concretos.
  • Explica los conceptos con analogías y ejemplos, sin exigir matemáticas.
  • Publicado en 2026 y orientado a agentes y costes reales de uso de APIs.

A tener en cuenta

  • Es solo el primer capítulo de una serie; el recorrido completo hasta agentes aún no está en este vídeo.
  • No se mencionan ejercicios ni proyecto práctico, es sobre todo explicación conceptual.
  • Usa expresiones rioplatenses y da por hecho cierto contexto de desarrollo de software.

De qué trata

Primer capítulo de un curso gratuito de inteligencia artificial que va de los tokens a los agentes. Dura unos 45 minutos y está dividido en 40 marcas de tiempo.

Empieza explicando qué es un LLM, el transformer y por qué el modelo genera respuestas plausibles que no siempre son verdaderas. Sigue con el entrenamiento, el tamaño de los modelos, la API sin estado, los tokens y su coste, la velocidad de inferencia y, al final, la atención con Q, K y V y el KV cache. Se plantea sin matemática obligatoria.

  • Qué es un LLM y generación autorregresiva
  • Por qué plausibilidad no es verdad
  • Pretraining, fine tuning y RLHF
  • Tokens, costes por API y español frente a inglés
  • Prefill, decode y KV cache

Para quién es este curso

  • Programadores que usan asistentes como Cursor y quieren entender qué ocurre por dentro de un LLM antes de diseñar sistemas con agentes.
  • Personas con curiosidad técnica que quieren entender tokens, coste por API, latencia y memoria sin necesidad de matemáticas avanzadas.

Mejor busca otro si…

  • Quien ya conoce en detalle el transformer, el KV cache y la inferencia en prefill/decode y busca implementación o código.
  • Quien busca un curso práctico de programación con proyecto: este capítulo es conceptual.

Antes de empezar

La información publicada del curso no detalla requisitos previos.

Qué sabrás hacer al terminar

  • Entender qué es un LLM y cómo genera texto de forma autorregresiva.
  • Explicar por qué un modelo produce respuestas plausibles pero no necesariamente verdaderas.
  • Distinguir pretraining, fine tuning y RLHF, y el concepto de knowledge cutoff.
  • Entender qué es un token, cómo se factura por API y por qué el español resulta más caro que el inglés.
  • Comprender la inferencia en dos fases, TTFT frente a tokens por segundo y el papel del KV cache.

Estructura del curso

  1. 01

    Introducción y motivación

    Bienvenida, por qué conviene saber qué ocurre bajo el capot, la analogía del coche, el paso de usar Cursor a diseñar sistemas de agentes y la estructura del capítulo. Desde 0:00.

  2. 02

    Qué es un LLM y por qué "alucina"

    El LLM como máquina de predecir, el transformer y la atención, probabilidades, generación autorregresiva y la tesis de que plausibilidad no es verdad. Desde 3:43.

  3. 03

    Entrenamiento

    Pretraining, fine tuning y RLHF, knowledge cutoff y por qué el modelo se equivoca con confianza. Desde 9:04.

  4. 04

    Tamaño y arquitectura

    Parámetros, VRAM, cálculo de un modelo 7B, modelos frontier y Mixture of Experts. Desde 14:34.

  5. 05

    API sin estado y memoria

    La API es stateless, sesión CLI frente a endpoint, qué no forma parte del modelo y el problema que resuelve el KV cache. Desde 17:33.

  6. 06

    Tokens y costes

    Qué es un token, entrada frente a salida, tokenización y Byte Pair Encoding, el caso de strawberry, coste del español, precios por API y coste del system prompt. Desde 21:31.

  7. 07

    Velocidad e inferencia

    Prueba en vivo, TTFT frente a tokens por segundo, prefill y decode, compute bound frente a memory bound. Desde 30:24.

  8. 08

    Atención y KV cache

    Q, K y V con la analogía de la biblioteca, la fórmula de atención, el KV cache y la matemática de memoria. Cierre con el avance de prompt caching. Desde 37:44.

Capítulos del vídeo

  1. 0:00Bienvenida: el primero de muchos videos del curso gratis
  2. 0:30Por qué tenés que saber qué pasa bajo el capot
  3. 1:14La analogía del auto en la ruta
  4. 1:45De "yo uso Cursor" a diseñar sistemas de agentes
  5. 2:22La estructura del capítulo
  6. 2:47Los 4 conceptos que tenés que tener en la cabeza
  7. 3:43Qué es un LLM: una máquina de predecir
  8. 4:39El transformer y la atención
  9. 5:47Probabilidades: por qué París y no Roma
  10. 6:18Generación autorregresiva: la salida es la entrada
  11. 7:03200 líneas de React son millones de iteraciones
  12. 7:46Consecuencia 1: no piensa
Ver los 28 restantes
  1. 8:01La IA no alucina: plausibilidad vs verdad
  2. 9:04Entrenamiento: pretraining, fine tuning y RLHF
  3. 10:08Knowledge cutoff: por qué te responde con Angular viejo
  4. 10:43Fine tuning: nuestro primer harness
  5. 11:34RLHF: vos sos el conejillo de Indias
  6. 13:30Por qué se equivoca con tanta confianza
  7. 14:34Tamaño: parámetros, VRAM y el cálculo de un 7B
  8. 15:43Qué es un modelo frontier
  9. 16:14Mixture of Experts: 8 especialistas, elijo 2
  10. 17:33La API es stateless: sesión CLI vs endpoint
  11. 19:43Recordar, buscar y ejecutar NO son el modelo
  12. 20:49El problema que resuelve el KV cache
  13. 21:31Qué es un token: la unidad con la que pagás
  14. 22:20Token de entrada vs token de salida
  15. 23:26Tokenización y Byte Pair Encoding
  16. 24:52Cuántas R tiene strawberry
  17. 25:57Por qué el español es más caro que el inglés
  18. 27:42Precio por API: la salida cuesta 5 veces más
  19. 28:46System prompt: 50 millones de tokens al día
  20. 30:24Velocidad: la prueba en vivo con Pi
  21. 32:21TTFT vs tokens por segundo
  22. 34:10Inferencia en dos fases: prefill y decode
  23. 35:46Compute bound vs memory bound
  24. 37:44Q, K y V: la analogía de la biblioteca
  25. 39:00La fórmula de atención sin miedo
  26. 40:44KV cache: no recalcular lo que no cambia
  27. 43:29La matemática de memoria: 8B, 8K, 1 GB
  28. 44:10Cierre: la próxima, prompt caching

Plan de estudio sugerido

2 semanas · unas 3 h por semana

  1. 1.Sesión 1 (0:00–17:33): introducción, qué es un LLM, entrenamiento y tamaño. Resume con tus palabras por qué la IA no «alucina».
  2. 2.Sesión 2 (17:33–30:24): API stateless, tokens y precios. Cuenta los tokens de un texto en español y en inglés.
  3. 3.Sesión 3 (30:24–44:10): velocidad, inferencia, Q/K/V y KV cache. Repite el cálculo de memoria del final.
  4. 4.Repaso final: revisa los capítulos que te hayan costado y prepara el siguiente capítulo sobre prompt caching.

El plan cuenta con tiempo para pausar y practicar, no solo con la duración del vídeo. Si quieres adaptarlo a tu semana, lee cómo montar tu plan de estudio semanal.

Consejos para seguirlo

  • Pausa en 14:34 y 43:29 e intenta hacer los cálculos de memoria antes de ver la solución.
  • Compara cuántos tokens usa un mismo texto en español y en inglés tras ver 25:57.
  • En 37:44–40:44 ve despacio: Q, K, V y el KV cache se apoyan unos en otros.
  • Anota qué parte de lo que haces con tu asistente es el modelo y cuál es el sistema alrededor (19:43).

Antes y después de este curso

Cómo lo presenta el autor

Gentleman Programming | Qué es un LLM | Qué es un LLM y por qué la IA "alucina": arranca el curso gratis de inteligencia artificial, de tokens a agentes, sin humo y desde las entrañas. Capítulo 1: el modelo, la inferencia y el KV cache.

Este es el primero de muchos videos de un curso completamente gratuito. ¿La idea? Que dejes de ser "yo uso Cursor" y pases a ser la persona que diseña sistemas…

Extracto de la descripción original en YouTube.

Preguntas frecuentes

+¿Necesito saber matemáticas?

La descripción indica que hay cero matemática obligatoria y que los conceptos se explican con ejemplos de la vida real.

+¿Cuánto dura?

Unos 45 minutos. Con pausas y repasos, cuenta con unas 2-3 horas en total.

+¿Qué cubre?

LLM, transformer, entrenamiento, tokens, precios por API, inferencia y KV cache. El siguiente capítulo tratará el prompt caching.

+¿Hay material para profundizar?

La descripción dice que buena parte del curso procede de un libro gratuito, donde se puede profundizar.

Análisis editorial elaborado con ayuda de IA a partir de la descripción, los capítulos y la duración publicados en YouTube, y revisado según nuestro método. El contenido del curso es obra de su autor; si ves algún error, avísanos.

Guías para sacarle partido