Research questionHow can we evaluate LLM reasoning quality beyond final-answer accuracy across deployment contexts?Final-answer correctness can conceal inconsistent, fragile, locally incoherent, or inefficient reasoning. These hidden differences make it difficult to choose models reliably for particular deployment contexts.