Code a Reinforcement Learning Library in C from Scratch (Full Course)
Construye en C un motor de autograd, un entorno del juego Snake y el algoritmo REINFORCE con actor-crítico para entrenar un agente de aprendizaje por refuerzo.
Recomendado, valoración editorial 4 de 5
verificado 2026-10-05 — sigue siendo gratis en YouTube
Empezar en YouTubeRespuesta rápida
Curso gratis de Programación en YouTube (2 h 18 min). Nuestra valoración: 4/5, recomendado. Comprobamos que sigue siendo gratis el 5 de octubre de 2026.
- Veredicto
- 4/5 · Recomendado
- Para quién
- Programadores con base en C que quieren entender cómo funcionan por dentro el autograd y el aprendizaje por refuerzo.
- Duración
- 2 h 18 min
- Precio
- Gratis en YouTube
- Publicado
- 2026
- Plan sugerido
- 2 sem. · 4 h/sem.
- Verificado
- el 5 de octubre de 2026
Nuestro veredicto
Recomendado, valoración editorial 4 de 5Curso práctico y bien estructurado que construye de principio a fin un sistema de aprendizaje por refuerzo en C. Es ideal para quien ya programa en C y quiere entender el autograd y REINFORCE por dentro; no es una introducción para principiantes.
Puntos fuertes
- Recorrido completo y progresivo: de las matemáticas base al agente entrenado.
- Doce capítulos con marcas de tiempo que facilitan la navegación.
- Publicación reciente (2026) y enfoque práctico construyendo todo desde cero.
A tener en cuenta
- El curso está en inglés.
- La descripción no detalla ejercicios ni material complementario.
- Dos horas es poco para cubrir autograd, entorno y RL, por lo que conviene saber de antemano los conceptos.
De qué trata
Curso de unas 2 horas y 18 minutos que construye desde cero un framework de aprendizaje por refuerzo en C. Empieza con un motor de grafo computacional y diferenciación automática (autograd) que gestiona operaciones con matrices, con pasadas hacia delante y hacia atrás.
Después desarrolla un entorno propio del juego Snake, con codificación del vector de estado y lógica de recompensas por colisión. Por último implementa el algoritmo de gradiente de política REINFORCE, los rollouts de trayectorias y un pipeline de entrenamiento completo. Está dividido en doce capítulos, desde la introducción hasta el paso del optimizador y la evaluación.
- Motor de autograd y grafo computacional en C
- Multiplicación de matrices y operaciones forward/backward
- Entorno del juego Snake con sistema de recompensas
- Modelo actor-crítico, retornos y ventajas
- Pipeline de entrenamiento con REINFORCE
Para quién es este curso
- Programadores con base en C que quieren entender cómo funcionan por dentro el autograd y el aprendizaje por refuerzo.
- Personas que usan frameworks de deep learning y quieren ver cómo se construyen sus piezas desde cero.
- Estudiantes interesados en implementar REINFORCE sin librerías externas.
Mejor busca otro si…
- Quien busca una introducción general al aprendizaje automático sin programar en C.
- Quien prefiere usar frameworks ya hechos en lugar de implementar las piezas a mano.
Antes de empezar
- Conocimientos de programación en C, ya que el curso se desarrolla en ese lenguaje.
- Nociones de matrices y redes neuronales, que los capítulos asumen al construir el autograd.
Qué sabrás hacer al terminar
- Construir un motor de autograd con grafo computacional en C.
- Implementar operaciones con matrices, incluida la multiplicación y su pasada hacia atrás.
- Crear un entorno del juego Snake con codificación de estado y recompensas.
- Implementar REINFORCE con un modelo actor-crítico, retornos y ventajas.
- Montar un pipeline de entrenamiento y evaluación de un agente.
Estructura del curso
- 01
Introducción y motor de autograd
Introducción (0:00:00), configuración del motor de autograd y variables (desde 0:02:48), creación y asignación de matrices (desde 0:16:09) y construcción de nodos y recorrido del grafo computacional (desde 0:26:27).
- 02
Operaciones y multiplicación de matrices
Operaciones de activación hacia delante y hacia atrás (desde 0:56:12) y multiplicación de matrices con orden row-major y transpuestas (desde 1:04:40).
- 03
Entorno Snake
Construcción del entorno de RL del juego Snake (desde 1:23:49), codificación del vector de estado y sistema de recompensas (desde 1:37:16).
- 04
Entrenamiento con REINFORCE
Pipeline de entrenamiento y buffers de rollout (desde 1:44:10), modelo actor-crítico (desde 1:59:22), retornos, ventajas y pasada hacia atrás (desde 2:07:39), y paso del optimizador, evaluación y conclusión (desde 2:14:41).
Plan de estudio sugerido
2 semanas · unas 4 h por semana
- 1.Semana 1, sesión 1: capítulos 0:00 a 0:56 (autograd, matrices y grafo); programa cada pieza en C a la vez.
- 2.Semana 1, sesión 2: 0:56 a 1:23 (operaciones y multiplicación de matrices); prueba las pasadas forward y backward con ejemplos pequeños.
- 3.Semana 2, sesión 1: 1:23 a 1:44 (entorno Snake, estado y recompensas); juega el entorno a mano antes de entrenar.
- 4.Semana 2, sesión 2: 1:44 al final (actor-crítico, retornos y optimizador); ejecuta el entrenamiento y evalúa el agente.
El plan cuenta con tiempo para pausar y practicar, no solo con la duración del vídeo. Si quieres adaptarlo a tu semana, lee cómo montar tu plan de estudio semanal.
Consejos para seguirlo
- Escribe el código a la vez que el vídeo y compila con frecuencia; en el autograd un error de memoria o de índices se arrastra a todo lo posterior.
- Repasa el capítulo de multiplicación de matrices (1:04:40) con calma: la gestión row-major y de transpuestas es clave para la pasada hacia atrás.
- Antes de llegar a REINFORCE (1:44:10), comprueba que el entorno Snake devuelve estados y recompensas coherentes.
- Repasa los conceptos de retorno y ventaja antes del capítulo 2:07:39 si no los conoces.
Antes y después de este curso
- Antes de este cursoCS50x em Português - Aula 1 - CIntroduce el lenguaje C, necesario para seguir este curso.
- Antes de este cursoCS50x em Português - Aula 4 - MemóriaTrata la memoria en C, útil para la asignación de matrices del curso.
Cómo lo presenta el autor
Learn how to build a complete reinforcement learning framework from scratch in C. The course begins with constructing a custom computational graph and automatic differentiation (autograd) engine to handle matrix operations alongside forward and backward passes. It then walks through developing a standalone Snake game environment from the ground up, including custom state vector encoding and…
Extracto de la descripción original en YouTube.
Preguntas frecuentes
+¿Qué necesito saber antes de empezar?
Los capítulos asumen que programas en C y que conoces nociones de matrices y redes neuronales. La descripción no indica requisitos explícitos.
+¿Cuánto dura?
El vídeo dura unas 2 horas y 18 minutos. Con pausas para programar, cabe en unas dos semanas a 4 horas semanales.
+¿Qué algoritmo de aprendizaje por refuerzo se implementa?
REINFORCE, un método de gradiente de política, con rollouts de trayectorias, un modelo actor-crítico, retornos y ventajas.
+¿Está en español?
No, el curso está en inglés.
Análisis editorial elaborado con ayuda de IA a partir de la descripción, los capítulos y la duración publicados en YouTube, y revisado según nuestro método. El contenido del curso es obra de su autor; si ves algún error, avísanos.
Guías para sacarle partido
Más cursos de Programación
Agentic AI – Complete Course for Beginners
Curso de unas 24 horas para construir sistemas de agentes de IA con LangChain y LangGraph: Pydantic, flujos de trabajo, memoria, RAG y despliegue en AWS y Render.
Aprende Accesibilidad Web paso a paso
Introducción práctica a la accesibilidad web: pautas y leyes, contenido, navegación, diseño e interacción accesibles, relación con el SEO y evaluación de sitios.
Aprende Godot - Curso completo desde cero
Crea tu primer videojuego 3D en Godot 4 desde cero: escenas, nodos, GDScript, físicas, animaciones, sonido y exportación a .exe.
Aprende JavaScript Ahora! curso completo desde cero para principiantes
Curso de JavaScript desde cero: entorno, variables, tipos, operadores, control de flujo, diez ejercicios y objetos con funciones constructoras.