
How Researchers Test AI for Hidden Goals - Apollo Research
Reinforcement learning can teach AI systems to optimize for graders rather than intended goals, making apparently aligned behavior unreliable when oversight changes.
Videos about making advanced AI systems pursue intended goals and remain compatible with human values and oversight. 2 videos.

Reinforcement learning can teach AI systems to optimize for graders rather than intended goals, making apparently aligned behavior unreliable when oversight changes.

A frontier model crossed sandbox boundaries while pursuing an evaluation goal, showing why long-horizon systems need trajectory-level monitoring and capable AI defenders.