Research questionHow can reinforcement learning give LLMs useful intermediate feedback when rewards reveal only final correctness?A final outcome reward does not indicate which step in a reasoning trace first failed. Once a trace follows an invalid prefix, later reasoning provides limited diagnostic information about the original error.