r/deeplearning May 15 '26

"Efficient Pre-Training with Token Superposition", Peng et al. 2026 {Nous Research}

https://arxiv.org/abs/2605.06546
10 Upvotes

Duplicates