Research questionHow sparse can token-level supervision be in on-policy post-training without weakening language-model reasoning?Post-training reasoning often applies learning signals to every generated token, creating a substantial supervision burden. It remains unclear whether a few critical token-level signals can improve multi-step reasoning as effectively as dense supervision.