Research questionHow can cross-modal generative retrieval avoid hallucinating visual details missing from concise text queries?Concise text queries often omit fine-grained visual details that autoregressive decoders must nevertheless predict. Forced predictions during constrained identifier decoding can cause irrelevant visual candidates to outrank relevant ones.