Get Started
Home
Topics
Search
Library
Research questionHow can vision-language models infer 3D geometry and temporal continuity from 2D visual observations?A 2D image omits depth and can make different 3D arrangements look similar. Understanding changing scenes also requires maintaining consistency across observations over time.
AI
Computer Vision
Evaluation & Benchmarks
Image & Video Processing
Multimodal Models
Reasoning
Reinforcement Learning
Latest papersRecent research connected to this question, newest first.Unfold The World: Factorize 4D Properties in Reinforcing Spatial ReasoningThe source concerns vision-language models evaluated on multi-view and video benchmarks. It reports gains in 3D and 4D reasoning, including 5.9% on VSI-Bench and 4.5% on All-Angles-Bench; these results do not by themselves establish performance beyond those settings.research paper · Sep 3, 2026
Related questions
How can we diagnose vision-language-action models’ failures on spatially ambiguous, long-horizon manipulation tasks?How can multimodal world models maintain physically coherent 3D scenes during closed-loop interaction?How can robot world-action models use 3D geometry to predict actions beyond RGB observations?How reliably can open-set vision-language 3D scene graphs support outdoor navigation and object retrieval?