Research questionHow can vision-language models infer 3D geometry and temporal continuity from 2D visual observations?A 2D image omits depth and can make different 3D arrangements look similar. Understanding changing scenes also requires maintaining consistency across observations over time.