Research questionHow can Muon use gradient-variance information to improve language-model pretraining efficiency?Muon orthogonalizes momentum updates but does not explicitly account for gradient variance. That omission may limit convergence speed and compute efficiency during language-model pretraining.