Get Started
Topic · 79 recaps

Computer Vision

Visual understanding and synthesis — object detection, segmentation, recognition, vision-language models, and 3D perception.
PostsQuestions
Home
Topics
Search
Library
Sort
Newest
SyncWorld: Visual Calibration Enables World Models as Zero-Shot Simulators
Reinforcement Learning · Sep 8
Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation
Diffusion · Sep 8
WorldSculpt: Generating Compositional Worlds from Grounded Videos
Image Generation · Sep 7
Agentic Visual Generation: From Generative Models to Agentic Control
Agents · Sep 6
VDiff-Bench: A Challenging Benchmark for Fine-Grained Image Difference Identification
Evaluation · Sep 5
DriveZero: End-to-End Driving Beyond Human Demonstrations
Reinforcement Learning · Sep 5
Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning
Multimodal · Sep 3
LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
Diffusion · Sep 3 · 7:30
Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding
Inference Optimization · Sep 3
Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States
Image Generation · Sep 3