cursos.
← Programación
Ficha 005.485YouTubeGRATIS

KV Cache vs. Prompt: la ingeniería detrás de los agentes que vuelan, cap 2

Explica la atención (Query, Key, Value), por qué el KV cache acelera la generación y cómo ordenar el system prompt para aprovechar el caché de prefijo y reducir costes.

Recomendado, valoración editorial 4 de 5

verificado 2026-10-05 — sigue siendo gratis en YouTube

Empezar en YouTube

Respuesta rápida

Curso gratis de Programación en YouTube (41 min). Nuestra valoración: 4/5, recomendado. Comprobamos que sigue siendo gratis el 5 de octubre de 2026.

Veredicto
4/5 · Recomendado
Para quién
Desarrolladores que usan agentes como Claude Code o Cursor y quieren entender por qué se ralentizan o encarecen.
Duración
41 min · 38 capítulos
Precio
Gratis en YouTube
Publicado
2026
Plan sugerido
1 sem. · 1.5 h/sem.
Verificado
el 5 de octubre de 2026

Nuestro veredicto

Recomendado, valoración editorial 4 de 5

Clase bien estructurada que combina teoría con analogías y aplicación práctica sobre KV cache y caché de prefijo. Es especialmente útil para quien trabaja con agentes o APIs de LLM y quiere reducir latencia y coste.

Puntos fuertes

  • Buena progresión: de la teoría con analogías a la aplicación práctica.
  • Tres demos y una tarea de 5 minutos para aplicar lo aprendido.
  • Capítulos detallados que facilitan volver a cada tema.
  • Publicación reciente (2026) para un tema que cambia rápido.

A tener en cuenta

  • Es el capítulo 2 de una serie y conviene verlo dentro del curso.
  • Las cifras de coste y precios dependen del proveedor y pueden cambiar.
  • La descripción no detalla herramientas ni ejercicios más allá de la tarea final.

De qué trata

Segundo capítulo de un curso gratuito de inteligencia artificial, de tokens a agentes. Dura 41 minutos y se divide en dos mitades.

La primera repasa la atención con la analogía de la biblioteca (Query, Key y Value, multi-head), plantea el problema de rehacer todo para cada palabra, muestra una demo con y sin caché y explica la causalidad que permite guardar los valores. También trata por qué la salida cuesta más que la entrada y por qué las sesiones largas se vuelven lentas.

La segunda mitad es práctica: caché de prefijo, el efecto de poner un timestamp al principio o al final del system prompt, la regla «lo fijo adelante, lo variable atrás», el cálculo del coste y tres síntomas de lentitud con su diagnóstico. Termina con una tarea de 5 minutos.

  • Atención: Query, Key y Value y multi-head
  • Qué es el KV cache y por qué acelera la generación
  • Causalidad: por qué el pasado no se puede cambiar
  • Caché de prefijo y orden del system prompt
  • Coste de cache read frente a cache creation

Para quién es este curso

  • Desarrolladores que usan agentes como Claude Code o Cursor y quieren entender por qué se ralentizan o encarecen.
  • Quien construye aplicaciones con LLM y quiere optimizar el system prompt para aprovechar el caché.
  • Personas curiosas por cómo funciona la atención en los modelos, explicada con analogías.

Mejor busca otro si…

  • Quien ya conoce en detalle la atención y el KV cache y busca solo una referencia de precios concretos.
  • Quien empieza de cero en IA y no ha visto el capítulo 1 del curso.

Antes de empezar

  • Nociones básicas de qué es un modelo de lenguaje y un token; el capítulo 1 del curso puede ayudar, aunque incluye un repaso.

Qué sabrás hacer al terminar

  • Entender la atención con Query, Key y Value y el papel de las cabezas múltiples.
  • Explicar por qué generar sin caché crece de forma cuadrática y cómo lo evita el KV cache.
  • Distinguir entre cache read y cache creation y su efecto en el coste.
  • Reordenar un system prompt colocando lo fijo al principio y lo variable al final.
  • Diagnosticar tres síntomas habituales de lentitud o sobrecoste.

Estructura del curso

  1. 01

    Repaso de la atención

    Desde 0:00. Analogía de la biblioteca: Query, Key y Value, el bibliotecario que puntúa, la fórmula de atención y multi-head.

  2. 02

    El problema y la demo con caché

    Desde 8:03. Rehacer la biblioteca en cada palabra, la cuenta del coste cuadrático y la Demo 1 sin caché frente a con caché.

  3. 03

    Causalidad y KV cache

    Desde 14:36. El pasado no cambia, el modelo no ve el futuro, los valores quedan congelados y la solución es guardar y añadir solo lo nuevo.

  4. 04

    Costes y límites del caché

    Desde 20:53. La imprenta y el calígrafo, por qué la salida cuesta 5 veces más, memoria, sesiones lentas y Demo 2 de TTFT con 51.000 tokens.

  5. 05

    Caché de prefijo en la práctica

    Desde 26:02. El caché se corta en el primer carácter que cambia, el error de la fecha en el system prompt, Demo 3 y cache read frente a creation.

  6. 06

    Reglas, costes y diagnóstico

    Desde 33:04. Regla de lo fijo delante, cuenta de ahorro, tres síntomas con diagnóstico, resumen, tarea y reflexión final.

Capítulos del vídeo

  1. 0:00Arranca la claseña número dos
  2. 0:51Sin esto no existirían Claude Code ni Cursor
  3. 1:32Para los que caen hoy: repaso completo
  4. 2:19La biblioteca: Query, Key y Value
  5. 3:36El bibliotecario compara y pone puntaje
  6. 4:47La fórmula de atención leída a nivel humano
  7. 6:46Multi-head: varios bibliotecarios a la vez
  8. 8:03El problema: rehacer la biblioteca en cada palabra
  9. 9:49La cuenta: medio millón de lomos para 1.000 palabras
  10. 10:30Demo 1: sin caché vs con caché (50x, 500x, 5.000x)
  11. 13:03La parte más ofensiva: el mismo lomo millones de veces
  12. 14:36La condición: el pasado no se puede cambiar
Ver los 26 restantes
  1. 15:31Causalidad: el modelo no puede ver el futuro
  2. 16:13Si pudiera ver el futuro, el entrenamiento sería una farsa
  3. 17:47La consecuencia: el lomo queda congelado para siempre
  4. 18:36Sin esto los agentes serían inviables
  5. 19:10La solución: guardar y agregar solo lo nuevo
  6. 19:55El mozo que te repite la comanda entera
  7. 20:53La imprenta y el calígrafo
  8. 22:07Por qué la salida cuesta 5 veces más
  9. 22:52El caché no es gratis: memoria y sesiones lentas
  10. 24:06Demo 2: TTFT con prompt corto vs 51.000 tokens
  11. 26:02Segunda mitad: esto lo tenés que tocar vos
  12. 26:44Caché de prefijo
  13. 27:24El caché se corta en el primer carácter que cambia
  14. 27:57Pusiste la fecha en el system prompt y mataste el caché
  15. 28:51Demo 3: timestamp al principio vs al final
  16. 32:02Cache read vs cache creation: 99% a precio de lectura
  17. 33:04La regla: lo fijo adelante, lo variable atrás
  18. 33:47La cuenta: $150 por día, $4.500 por mes
  19. 34:20Esto es ingeniería de agentes, no prolijidad
  20. 35:34Tres síntomas con diagnóstico
  21. 36:36Síntoma 2: cambié una cosita y explotó el costo
  22. 36:56Síntoma 3: en local vuela, en producción es un desastre
  23. 37:44Qué te llevás de la clase de hoy
  24. 38:31Tarea: mirá las 3 primeras líneas de tu system prompt
  25. 39:17Reflexión final: usuario o ingeniero
  26. 40:21La próxima: contexto como presupuesto

Plan de estudio sugerido

1 semana · unas 1,5 h por semana

  1. 1.Sesión 1: ve 0:00–14:36 (atención y problema del coste) y reproduce la analogía con tus palabras.
  2. 2.Sesión 2: ve 14:36–26:02 (causalidad, KV cache, costes) y anota por qué la salida cuesta más.
  3. 3.Sesión 3: ve 26:02–41:00 (caché de prefijo) y haz la tarea de revisar las 3 primeras líneas de tu system prompt.

El plan cuenta con tiempo para pausar y practicar, no solo con la duración del vídeo. Si quieres adaptarlo a tu semana, lee cómo montar tu plan de estudio semanal.

Consejos para seguirlo

  • Pausa en 4:47 e intenta explicar la fórmula de atención sin mirar antes de seguir.
  • En la Demo 3 (28:51) compara el resultado con tus propios prompts si usas una API con caché.
  • Haz la tarea final con un system prompt real y busca fechas o datos variables al principio.
  • Si ya dominas la atención, puedes saltar el repaso y empezar en 8:03.

Antes y después de este curso

Cómo lo presenta el autor

Gentleman Programming | KV cache | Qué es el KV cache y por qué la IA se pone lenta: capítulo 2 del curso gratis de inteligencia artificial, de tokens a agentes. Sin lo que vemos hoy no existirían Claude Code, Cursor ni ningún agente que trabaje media hora seguida sobre tu código.

Arrancamos con un repaso completo de la atención con la analogía de la biblioteca (Query, Key y Value, el…

Extracto de la descripción original en YouTube.

Preguntas frecuentes

+¿Cuánto dura y cómo se organiza?

Dura 41 minutos y tiene 38 capítulos. La primera mitad es teórica (atención y KV cache) y la segunda, práctica (caché de prefijo y diagnóstico).

+¿Hay que ver el capítulo 1?

Incluye un repaso completo de la atención para quien llega ahora, pero forma parte de un curso y el capítulo 1 puede dar más contexto.

+¿Hay tarea?

Sí, al final propone una tarea de 5 minutos: mirar las tres primeras líneas de tu system prompt.

+¿Qué viene después?

El siguiente capítulo anunciado trata el contexto como presupuesto.

Análisis editorial elaborado con ayuda de IA a partir de la descripción, los capítulos y la duración publicados en YouTube, y revisado según nuestro método. El contenido del curso es obra de su autor; si ves algún error, avísanos.

Guías para sacarle partido