cursos.
← Programación
Ficha 005.118YouTubeGRATIS

Code a Reinforcement Learning Library in C from Scratch (Full Course)

Construye en C un motor de autograd, un entorno del juego Snake y el algoritmo REINFORCE con actor-crítico para entrenar un agente de aprendizaje por refuerzo.

Recomendado, valoración editorial 4 de 5

verificado 2026-10-05 — sigue siendo gratis en YouTube

Empezar en YouTube

Respuesta rápida

Curso gratis de Programación en YouTube (2 h 18 min). Nuestra valoración: 4/5, recomendado. Comprobamos que sigue siendo gratis el 5 de octubre de 2026.

Veredicto
4/5 · Recomendado
Para quién
Programadores con base en C que quieren entender cómo funcionan por dentro el autograd y el aprendizaje por refuerzo.
Duración
2 h 18 min
Precio
Gratis en YouTube
Publicado
2026
Plan sugerido
2 sem. · 4 h/sem.
Verificado
el 5 de octubre de 2026

Nuestro veredicto

Recomendado, valoración editorial 4 de 5

Curso práctico y bien estructurado que construye de principio a fin un sistema de aprendizaje por refuerzo en C. Es ideal para quien ya programa en C y quiere entender el autograd y REINFORCE por dentro; no es una introducción para principiantes.

Puntos fuertes

  • Recorrido completo y progresivo: de las matemáticas base al agente entrenado.
  • Doce capítulos con marcas de tiempo que facilitan la navegación.
  • Publicación reciente (2026) y enfoque práctico construyendo todo desde cero.

A tener en cuenta

  • El curso está en inglés.
  • La descripción no detalla ejercicios ni material complementario.
  • Dos horas es poco para cubrir autograd, entorno y RL, por lo que conviene saber de antemano los conceptos.

De qué trata

Curso de unas 2 horas y 18 minutos que construye desde cero un framework de aprendizaje por refuerzo en C. Empieza con un motor de grafo computacional y diferenciación automática (autograd) que gestiona operaciones con matrices, con pasadas hacia delante y hacia atrás.

Después desarrolla un entorno propio del juego Snake, con codificación del vector de estado y lógica de recompensas por colisión. Por último implementa el algoritmo de gradiente de política REINFORCE, los rollouts de trayectorias y un pipeline de entrenamiento completo. Está dividido en doce capítulos, desde la introducción hasta el paso del optimizador y la evaluación.

  • Motor de autograd y grafo computacional en C
  • Multiplicación de matrices y operaciones forward/backward
  • Entorno del juego Snake con sistema de recompensas
  • Modelo actor-crítico, retornos y ventajas
  • Pipeline de entrenamiento con REINFORCE

Para quién es este curso

  • Programadores con base en C que quieren entender cómo funcionan por dentro el autograd y el aprendizaje por refuerzo.
  • Personas que usan frameworks de deep learning y quieren ver cómo se construyen sus piezas desde cero.
  • Estudiantes interesados en implementar REINFORCE sin librerías externas.

Mejor busca otro si…

  • Quien busca una introducción general al aprendizaje automático sin programar en C.
  • Quien prefiere usar frameworks ya hechos en lugar de implementar las piezas a mano.

Antes de empezar

  • Conocimientos de programación en C, ya que el curso se desarrolla en ese lenguaje.
  • Nociones de matrices y redes neuronales, que los capítulos asumen al construir el autograd.

Qué sabrás hacer al terminar

  • Construir un motor de autograd con grafo computacional en C.
  • Implementar operaciones con matrices, incluida la multiplicación y su pasada hacia atrás.
  • Crear un entorno del juego Snake con codificación de estado y recompensas.
  • Implementar REINFORCE con un modelo actor-crítico, retornos y ventajas.
  • Montar un pipeline de entrenamiento y evaluación de un agente.

Estructura del curso

  1. 01

    Introducción y motor de autograd

    Introducción (0:00:00), configuración del motor de autograd y variables (desde 0:02:48), creación y asignación de matrices (desde 0:16:09) y construcción de nodos y recorrido del grafo computacional (desde 0:26:27).

  2. 02

    Operaciones y multiplicación de matrices

    Operaciones de activación hacia delante y hacia atrás (desde 0:56:12) y multiplicación de matrices con orden row-major y transpuestas (desde 1:04:40).

  3. 03

    Entorno Snake

    Construcción del entorno de RL del juego Snake (desde 1:23:49), codificación del vector de estado y sistema de recompensas (desde 1:37:16).

  4. 04

    Entrenamiento con REINFORCE

    Pipeline de entrenamiento y buffers de rollout (desde 1:44:10), modelo actor-crítico (desde 1:59:22), retornos, ventajas y pasada hacia atrás (desde 2:07:39), y paso del optimizador, evaluación y conclusión (desde 2:14:41).

Plan de estudio sugerido

2 semanas · unas 4 h por semana

  1. 1.Semana 1, sesión 1: capítulos 0:00 a 0:56 (autograd, matrices y grafo); programa cada pieza en C a la vez.
  2. 2.Semana 1, sesión 2: 0:56 a 1:23 (operaciones y multiplicación de matrices); prueba las pasadas forward y backward con ejemplos pequeños.
  3. 3.Semana 2, sesión 1: 1:23 a 1:44 (entorno Snake, estado y recompensas); juega el entorno a mano antes de entrenar.
  4. 4.Semana 2, sesión 2: 1:44 al final (actor-crítico, retornos y optimizador); ejecuta el entrenamiento y evalúa el agente.

El plan cuenta con tiempo para pausar y practicar, no solo con la duración del vídeo. Si quieres adaptarlo a tu semana, lee cómo montar tu plan de estudio semanal.

Consejos para seguirlo

  • Escribe el código a la vez que el vídeo y compila con frecuencia; en el autograd un error de memoria o de índices se arrastra a todo lo posterior.
  • Repasa el capítulo de multiplicación de matrices (1:04:40) con calma: la gestión row-major y de transpuestas es clave para la pasada hacia atrás.
  • Antes de llegar a REINFORCE (1:44:10), comprueba que el entorno Snake devuelve estados y recompensas coherentes.
  • Repasa los conceptos de retorno y ventaja antes del capítulo 2:07:39 si no los conoces.

Antes y después de este curso

Cómo lo presenta el autor

Learn how to build a complete reinforcement learning framework from scratch in C. The course begins with constructing a custom computational graph and automatic differentiation (autograd) engine to handle matrix operations alongside forward and backward passes. It then walks through developing a standalone Snake game environment from the ground up, including custom state vector encoding and…

Extracto de la descripción original en YouTube.

Preguntas frecuentes

+¿Qué necesito saber antes de empezar?

Los capítulos asumen que programas en C y que conoces nociones de matrices y redes neuronales. La descripción no indica requisitos explícitos.

+¿Cuánto dura?

El vídeo dura unas 2 horas y 18 minutos. Con pausas para programar, cabe en unas dos semanas a 4 horas semanales.

+¿Qué algoritmo de aprendizaje por refuerzo se implementa?

REINFORCE, un método de gradiente de política, con rollouts de trayectorias, un modelo actor-crítico, retornos y ventajas.

+¿Está en español?

No, el curso está en inglés.

Análisis editorial elaborado con ayuda de IA a partir de la descripción, los capítulos y la duración publicados en YouTube, y revisado según nuestro método. El contenido del curso es obra de su autor; si ves algún error, avísanos.

Guías para sacarle partido