Simone RengaEventsAI Safety Thursdays: When Good Rewards Go Bad - Reward Overoptimization in RLHF 2025-05-15Extreme Sycophancy in OpenAI's GPT-4o 2025-05-08