Get Started
Home
Topics
Search
Library
Topic · 53 recaps

Computer Vision

Visual understanding and synthesis — object detection, segmentation, recognition, vision-language models, and 3D perception.
Sort
Newest
Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding
Inference Optimization · Aug 28
Video Generative Models as Geometry Learner
Diffusion · Aug 28
4DAnyone: Create Anyone in 4D from a Casual Monocular Video
Multimodal · Aug 20
Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
Multimodal · Aug 20
Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision
Image Generation · Aug 17
DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
Mechanistic Interpretability · Aug 13
Beyond Pixels: From Video Priors to 4D Worlds
Diffusion · Aug 11
SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
Inference Optimization · Aug 7
Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning
Multimodal · Aug 6
GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?
Evaluation · Aug 6