Reinforcement Learning
Reinforcement learning es aprender de consecuencias a lo largo del tiempo. El objeto aprendido no es un predictor de etiquetas sino una policy o una estimación de valor para decisiones secuenciales bajo incertidumbre.
Modelo mental
Un agente observa un estado, elige una acción, recibe recompensa y transiciona. El return agrega recompensas futuras; una policy mapea estados a distribuciones de acciones; las value functions resumen retorno esperado. Las ecuaciones de Bellman exponen la recursión que aproximan los algoritmos.
Overview actual
Roadmap
MDPs · Bellman y dynamic programming · Monte Carlo y TD · Q-learning/DQN · policy gradients · actor-critic · exploración · offline RL · model-based RL/world models · reward hacking y RLHF.
Conecta con: IA Clásica y Razonamiento · RLHF con PPO · Autonomía y control
Fuentes principales
- Reinforcement Learning: An Introduction — texto canónico de Sutton y Barto.
- David Silver RL course — recorrido riguroso desde MDPs a policy gradients.
- OpenAI Spinning Up — ecuaciones e implementaciones mínimas.