Get Started
Home
Topics
Search
Library
Topic · 24 recaps

Video Generation

Generating coherent video from text, images, or other video — covering temporal consistency, long-form synthesis, and the world-model framing of recent video models.
Sort
Newest
Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding
Inference Optimization · Aug 28
Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
Multimodal · Aug 20
4DAnyone: Create Anyone in 4D from a Casual Monocular Video
Multimodal · Aug 20
DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
Mechanistic Interpretability · Aug 13
Beyond Pixels: From Video Priors to 4D Worlds
Diffusion · Aug 11
WorldClaw: Agentic 3D Open-World Generation at Scale
Agents · Aug 5
JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
Diffusion · Aug 4
PhiZero: A World Model Built Around Physical Language
Diffusion · Jul 30
DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation
Diffusion · Jul 29
Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
Diffusion · Jul 27