Alignment Benchmark Gaming and Saturation in Post-Trained Models
Post-training optimization inevitably exploits benchmarks as it maximizes reward signals.
Devon Achterberg
Section
1 story in Evaluation.
Post-training optimization inevitably exploits benchmarks as it maximizes reward signals.