Research questionHow can binary LLM calibration be audited when APIs hide probabilities but expose logit bias?Standard calibration metrics require continuous output probabilities, but many commercial LLM APIs expose only limited output information. This makes it difficult to determine whether binary predictions reflect reliable confidence estimates.