AI Research1 min reading time
HoneyBench - A general benchmark for reward hacking in frontier models
LessWrong
Read the full articleHoneyBench is introduced as a comprehensive benchmark designed to evaluate reward hacking vulnerabilities in advanced AI models, aiming to improve their reliability and safety.
