Research questionHow can on-policy LLM reasoning turn unreliable skill-derived signals into reliable token-level supervision?On-policy self-distillation needs dense token-level signals, but skill-derived privileged information can be irrelevant or misleading. The difficulty is determining when those signals should guide a reasoning rollout rather than reinforce incorrect behavior.