Research questionHow can multimodal reasoning guide diffusion models for controllable video generation and editing?Multimodal models can interpret complex visual and textual intent, while diffusion models produce detailed video pixels. Coordinating these capabilities without losing semantic control, visual fidelity, or training efficiency is difficult.