¿Qué es el aprendizaje por refuerzo?
El aprendizaje por refuerzo (o RL, de Reinforcement Learning) es enseñar a un agente a base de premios y castigos, sin decirle nunca cómo hacer la tarea. Prueba, se equivoca, y poco a poco descubre solo qué le conviene.
Q-learning y SARSA
Para entender cómo aprende un agente, lo mejor es el caso más simple: un robot en un laberinto de casillas. Aquí no hace falta MuJoCo ni redes neuronales, solo una tabla de números. Son los algoritmos Q-learning y SARSA.
Tu primer agente con Stable-Baselines3
Ya sabes cómo aprende un agente en un laberinto. Para robots con física continua, en vez de programar el algoritmo a mano usamos Stable-Baselines3 (SB3): una librería con los mejores algoritmos de RL ya implementados y probados.
Un humanoide que aprende a andar
Juntamos todo lo de esta sección: MuJoCo pone la física, Gymnasium pone las reglas y el aprendizaje por refuerzo pone la inteligencia. El resultado es un humanoide de 17 articulaciones que aprende a caminar solo.