KV Cache vs. Prompt: la ingeniería detrás de los agentes que vuelan, cap 2
Explica la atención (Query, Key, Value), por qué el KV cache acelera la generación y cómo ordenar el system prompt para aprovechar el caché de prefijo y reducir costes.
Recomendado, valoración editorial 4 de 5
verificado 2026-10-05 — sigue siendo gratis en YouTube
Empezar en YouTubeRespuesta rápida
Curso gratis de Programación en YouTube (41 min). Nuestra valoración: 4/5, recomendado. Comprobamos que sigue siendo gratis el 5 de octubre de 2026.
- Veredicto
- 4/5 · Recomendado
- Para quién
- Desarrolladores que usan agentes como Claude Code o Cursor y quieren entender por qué se ralentizan o encarecen.
- Duración
- 41 min · 38 capítulos
- Precio
- Gratis en YouTube
- Publicado
- 2026
- Plan sugerido
- 1 sem. · 1.5 h/sem.
- Verificado
- el 5 de octubre de 2026
Nuestro veredicto
Recomendado, valoración editorial 4 de 5Clase bien estructurada que combina teoría con analogías y aplicación práctica sobre KV cache y caché de prefijo. Es especialmente útil para quien trabaja con agentes o APIs de LLM y quiere reducir latencia y coste.
Puntos fuertes
- Buena progresión: de la teoría con analogías a la aplicación práctica.
- Tres demos y una tarea de 5 minutos para aplicar lo aprendido.
- Capítulos detallados que facilitan volver a cada tema.
- Publicación reciente (2026) para un tema que cambia rápido.
A tener en cuenta
- Es el capítulo 2 de una serie y conviene verlo dentro del curso.
- Las cifras de coste y precios dependen del proveedor y pueden cambiar.
- La descripción no detalla herramientas ni ejercicios más allá de la tarea final.
De qué trata
Segundo capítulo de un curso gratuito de inteligencia artificial, de tokens a agentes. Dura 41 minutos y se divide en dos mitades.
La primera repasa la atención con la analogía de la biblioteca (Query, Key y Value, multi-head), plantea el problema de rehacer todo para cada palabra, muestra una demo con y sin caché y explica la causalidad que permite guardar los valores. También trata por qué la salida cuesta más que la entrada y por qué las sesiones largas se vuelven lentas.
La segunda mitad es práctica: caché de prefijo, el efecto de poner un timestamp al principio o al final del system prompt, la regla «lo fijo adelante, lo variable atrás», el cálculo del coste y tres síntomas de lentitud con su diagnóstico. Termina con una tarea de 5 minutos.
- Atención: Query, Key y Value y multi-head
- Qué es el KV cache y por qué acelera la generación
- Causalidad: por qué el pasado no se puede cambiar
- Caché de prefijo y orden del system prompt
- Coste de cache read frente a cache creation
Para quién es este curso
- Desarrolladores que usan agentes como Claude Code o Cursor y quieren entender por qué se ralentizan o encarecen.
- Quien construye aplicaciones con LLM y quiere optimizar el system prompt para aprovechar el caché.
- Personas curiosas por cómo funciona la atención en los modelos, explicada con analogías.
Mejor busca otro si…
- Quien ya conoce en detalle la atención y el KV cache y busca solo una referencia de precios concretos.
- Quien empieza de cero en IA y no ha visto el capítulo 1 del curso.
Antes de empezar
- Nociones básicas de qué es un modelo de lenguaje y un token; el capítulo 1 del curso puede ayudar, aunque incluye un repaso.
Qué sabrás hacer al terminar
- Entender la atención con Query, Key y Value y el papel de las cabezas múltiples.
- Explicar por qué generar sin caché crece de forma cuadrática y cómo lo evita el KV cache.
- Distinguir entre cache read y cache creation y su efecto en el coste.
- Reordenar un system prompt colocando lo fijo al principio y lo variable al final.
- Diagnosticar tres síntomas habituales de lentitud o sobrecoste.
Estructura del curso
- 01
Repaso de la atención
Desde 0:00. Analogía de la biblioteca: Query, Key y Value, el bibliotecario que puntúa, la fórmula de atención y multi-head.
- 02
El problema y la demo con caché
Desde 8:03. Rehacer la biblioteca en cada palabra, la cuenta del coste cuadrático y la Demo 1 sin caché frente a con caché.
- 03
Causalidad y KV cache
Desde 14:36. El pasado no cambia, el modelo no ve el futuro, los valores quedan congelados y la solución es guardar y añadir solo lo nuevo.
- 04
Costes y límites del caché
Desde 20:53. La imprenta y el calígrafo, por qué la salida cuesta 5 veces más, memoria, sesiones lentas y Demo 2 de TTFT con 51.000 tokens.
- 05
Caché de prefijo en la práctica
Desde 26:02. El caché se corta en el primer carácter que cambia, el error de la fecha en el system prompt, Demo 3 y cache read frente a creation.
- 06
Reglas, costes y diagnóstico
Desde 33:04. Regla de lo fijo delante, cuenta de ahorro, tres síntomas con diagnóstico, resumen, tarea y reflexión final.
Capítulos del vídeo
- 0:00Arranca la claseña número dos
- 0:51Sin esto no existirían Claude Code ni Cursor
- 1:32Para los que caen hoy: repaso completo
- 2:19La biblioteca: Query, Key y Value
- 3:36El bibliotecario compara y pone puntaje
- 4:47La fórmula de atención leída a nivel humano
- 6:46Multi-head: varios bibliotecarios a la vez
- 8:03El problema: rehacer la biblioteca en cada palabra
- 9:49La cuenta: medio millón de lomos para 1.000 palabras
- 10:30Demo 1: sin caché vs con caché (50x, 500x, 5.000x)
- 13:03La parte más ofensiva: el mismo lomo millones de veces
- 14:36La condición: el pasado no se puede cambiar
Ver los 26 restantes
- 15:31Causalidad: el modelo no puede ver el futuro
- 16:13Si pudiera ver el futuro, el entrenamiento sería una farsa
- 17:47La consecuencia: el lomo queda congelado para siempre
- 18:36Sin esto los agentes serían inviables
- 19:10La solución: guardar y agregar solo lo nuevo
- 19:55El mozo que te repite la comanda entera
- 20:53La imprenta y el calígrafo
- 22:07Por qué la salida cuesta 5 veces más
- 22:52El caché no es gratis: memoria y sesiones lentas
- 24:06Demo 2: TTFT con prompt corto vs 51.000 tokens
- 26:02Segunda mitad: esto lo tenés que tocar vos
- 26:44Caché de prefijo
- 27:24El caché se corta en el primer carácter que cambia
- 27:57Pusiste la fecha en el system prompt y mataste el caché
- 28:51Demo 3: timestamp al principio vs al final
- 32:02Cache read vs cache creation: 99% a precio de lectura
- 33:04La regla: lo fijo adelante, lo variable atrás
- 33:47La cuenta: $150 por día, $4.500 por mes
- 34:20Esto es ingeniería de agentes, no prolijidad
- 35:34Tres síntomas con diagnóstico
- 36:36Síntoma 2: cambié una cosita y explotó el costo
- 36:56Síntoma 3: en local vuela, en producción es un desastre
- 37:44Qué te llevás de la clase de hoy
- 38:31Tarea: mirá las 3 primeras líneas de tu system prompt
- 39:17Reflexión final: usuario o ingeniero
- 40:21La próxima: contexto como presupuesto
Plan de estudio sugerido
1 semana · unas 1,5 h por semana
- 1.Sesión 1: ve 0:00–14:36 (atención y problema del coste) y reproduce la analogía con tus palabras.
- 2.Sesión 2: ve 14:36–26:02 (causalidad, KV cache, costes) y anota por qué la salida cuesta más.
- 3.Sesión 3: ve 26:02–41:00 (caché de prefijo) y haz la tarea de revisar las 3 primeras líneas de tu system prompt.
El plan cuenta con tiempo para pausar y practicar, no solo con la duración del vídeo. Si quieres adaptarlo a tu semana, lee cómo montar tu plan de estudio semanal.
Consejos para seguirlo
- Pausa en 4:47 e intenta explicar la fórmula de atención sin mirar antes de seguir.
- En la Demo 3 (28:51) compara el resultado con tus propios prompts si usas una API con caché.
- Haz la tarea final con un system prompt real y busca fechas o datos variables al principio.
- Si ya dominas la atención, puedes saltar el repaso y empezar en 8:03.
Antes y después de este curso
- Después de este cursoCLAUDE CODE 2026: Curso Completo en Español (actualizado)Aplica el conocimiento de caché y contexto a una herramienta de agentes concreta.
- AlternativaAgentic AI – Complete Course for BeginnersOfrece otra introducción a los agentes de IA, en inglés.
Cómo lo presenta el autor
Gentleman Programming | KV cache | Qué es el KV cache y por qué la IA se pone lenta: capítulo 2 del curso gratis de inteligencia artificial, de tokens a agentes. Sin lo que vemos hoy no existirían Claude Code, Cursor ni ningún agente que trabaje media hora seguida sobre tu código.
Arrancamos con un repaso completo de la atención con la analogía de la biblioteca (Query, Key y Value, el…
Extracto de la descripción original en YouTube.
Preguntas frecuentes
+¿Cuánto dura y cómo se organiza?
Dura 41 minutos y tiene 38 capítulos. La primera mitad es teórica (atención y KV cache) y la segunda, práctica (caché de prefijo y diagnóstico).
+¿Hay que ver el capítulo 1?
Incluye un repaso completo de la atención para quien llega ahora, pero forma parte de un curso y el capítulo 1 puede dar más contexto.
+¿Hay tarea?
Sí, al final propone una tarea de 5 minutos: mirar las tres primeras líneas de tu system prompt.
+¿Qué viene después?
El siguiente capítulo anunciado trata el contexto como presupuesto.
Análisis editorial elaborado con ayuda de IA a partir de la descripción, los capítulos y la duración publicados en YouTube, y revisado según nuestro método. El contenido del curso es obra de su autor; si ves algún error, avísanos.
Guías para sacarle partido
Más cursos de Programación
Aprende Accesibilidad Web paso a paso
Introducción práctica a la accesibilidad web: pautas y leyes, contenido, navegación, diseño e interacción accesibles, relación con el SEO y evaluación de sitios.
Aprende Godot - Curso completo desde cero
Crea tu primer videojuego 3D en Godot 4 desde cero: escenas, nodos, GDScript, físicas, animaciones, sonido y exportación a .exe.
Aprende JavaScript Ahora! curso completo desde cero para principiantes
Curso de JavaScript desde cero: entorno, variables, tipos, operadores, control de flujo, diez ejercicios y objetos con funciones constructoras.
Aprende JavaScript - Curso Completo Desde Cero
Curso de JavaScript desde cero: variables, operadores, cadenas, arreglos, funciones, condicionales y switch, explicado paso a paso con ejemplos.