Get Started
Home
Topics
Search
Library
Topic · 53 recaps
Computer Vision
Visual understanding and synthesis — object detection, segmentation, recognition, vision-language models, and 3D perception.
...
Sort
Newest
Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding
Inference Optimization · Aug 28
0
Video Generative Models as Geometry Learner
Diffusion · Aug 28
0
4DAnyone: Create Anyone in 4D from a Casual Monocular Video
Multimodal · Aug 20
0
Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
Multimodal · Aug 20
0
Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision
Image Generation · Aug 17
0
DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
Mechanistic Interpretability · Aug 13
0
Beyond Pixels: From Video Priors to 4D Worlds
Diffusion · Aug 11
0
SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
Inference Optimization · Aug 7
0
Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning
Multimodal · Aug 6
0
GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?
Evaluation · Aug 6
0