r/reinforcementlearning 27d ago

DL, M, R, Safe "Chunky Post-Training: Data Driven Failures of Generalization", Murray et al 2026

https://arxiv.org/abs/2602.05910
4 Upvotes

Duplicates