Research questionHow can validation loss track language-model capabilities across changing training distributions without benchmark evaluation?Standard validation loss may not reflect downstream capability gains when the training distribution changes, while benchmark scores can contain task- or scenario-specific artifacts. The challenge is to measure shared capabilities in a way that remains predictive without repeatedly evaluating downstream benchmarks.