indexintermediateplannedReinforcement Learning#reinforcement-learning#decision-making#policies#rewards

Reinforcement Learning

Reinforcement learning es aprender de consecuencias a lo largo del tiempo. El objeto aprendido no es un predictor de etiquetas sino una policy o una estimación de valor para decisiones secuenciales bajo incertidumbre.

Modelo mental

Un agente observa un estado, elige una acción, recibe recompensa y transiciona. El return agrega recompensas futuras; una policy mapea estados a distribuciones de acciones; las value functions resumen retorno esperado. Las ecuaciones de Bellman exponen la recursión que aproximan los algoritmos.

Overview actual

Roadmap

MDPs · Bellman y dynamic programming · Monte Carlo y TD · Q-learning/DQN · policy gradients · actor-critic · exploración · offline RL · model-based RL/world models · reward hacking y RLHF.

Conecta con: IA Clásica y Razonamiento · RLHF con PPO · Autonomía y control

Fuentes principales