Research questionHow should on-policy distillation select examples for data-efficient reasoning post-training?On-policy distillation can use many training examples, but it remains unclear which examples provide the most useful learning signal. Example difficulty, reasoning-trace length, and token-level uncertainty may not contribute equally to improving reasoning ability.