Goodfire finds internal signal for reward hacking, builds real-time detection probes
#reward hacking#interpretability#probes#ai safety
Goodfire reported discovering a clear internal signal in models that accompanies reward hacking, and developed probes that can detect this behavior efficiently in real time at scale. The finding enables monitoring of reward hacking without relying solely on external outputs.
Coverage timeline
Goodfire
We found a clear internal signal in models that accompanies reward hacking, and built probes that detect it — enabling efficient, real-time detection of reward hacking at scale.
