FeaturesReward hacking in long-horizon coding agents: how verifiable rewards get gamed and what to check in your rolloutsDevon Achterberg·August 11, 2026
FeaturesTurning an eval suite into an RL environment: what breaks when a benchmark becomes a training signalMarta Wierzbicka·August 11, 2026