Research questionHow reliably do vision-language models correct repeated visually grounded false premises across dialogue turns?A model may initially identify what an image shows but then accept or repeat an incorrect user assumption in later turns. This makes it difficult to distinguish persistent visual grounding from conversational compliance when false premises recur.