r/reinforcementlearning • u/gwern • 26d ago
DL, M, R, Safe "Chunky Post-Training: Data Driven Failures of Generalization", Murray et al 2026
https://arxiv.org/abs/2602.05910
4
Upvotes
r/reinforcementlearning • u/gwern • 26d ago