Research questionHow can multiple-choice music audio-language models estimate uncertainty well enough to abstain without costly ensembles or retraining?Multiple-choice evaluation forces a model to choose even when its musical understanding is weak, so a lucky guess can resemble genuine competence. A single predictive distribution provides limited evidence about answer reliability, while independently trained ensembles are expensive.