Get Started
Home
Topics
Search
Library
Research questionHow can referring multi-object tracking reliably follow every language-matched object across video with low latency?Referring multi-object tracking must connect language expressions to the correct objects and preserve their identities over time. Using multimodal models for this decision can improve language-vision matching but may add latency or produce inconsistent tracks.
AI
Computer Vision
Image & Video Processing
Inference Optimization
Multimodal Models
Latest papersRecent research connected to this question, newest first.YesTrack: Referring Multi-Object Tracking via MLLM-based Yes/No VerificationThe setting is video-based referring multi-object tracking, with an additional application to generic multi-object tracking. Evidence is reported on Refer-KITTI and Refer-KITTI-V2, including an implementation using the smallest Qwen3-VL variant.research paper · Sep 2, 2026
Related questions
How can language-guided multi-object tracking preserve identities and context across long-horizon actions in 360° video?How can referring expression comprehension localize multiple targets and reject expressions with no valid match in open-world scenes?How can streaming video-language models cut frame-encoding latency while preserving question-relevant evidence?How can detector-free end-to-end multi-object trackers improve detection without disrupting track association?