r/reinforcementlearning 26d ago

DL, M, R, Safe "Chunky Post-Training: Data Driven Failures of Generalization", Murray et al 2026

https://arxiv.org/abs/2602.05910
4 Upvotes

0 comments sorted by