Reinforcement learning & reward hacking

Reinforcement learning as it bears on safety: reward hacking, specification gaming, imitation learning, and policy optimization.

Browse the full interactive library →

Proximal Policy Optimization (PPO)

Schulman et al.

PPO stabilized policy gradient training and became the optimization backbone behind RLHF pipelines including early ChatGPT, making it foundational infrastructure for alignment work.

Advanced~20 min read2017

Deep Reinforcement Learning from Human Preferences

Paul Christiano et al.

Christiano et al. established preference-based reward modeling, the foundational method that RLHF alignment pipelines later built on to steer language model behavior.

Advanced~30 min read2017