Get Started
Home
Topics
Search
Library
Research questionHow can fine-grained audio-visual segmentation learn new classes continually without semantic drift or co-occurrence confusion?Sequentially learning fine-grained audio-visual segmentation classes can cause sounding objects to be treated as background in later tasks. Frequent class co-occurrences can also make visually or acoustically related objects difficult to distinguish.
AI
Audio & Speech Processing
Computer Vision
Image & Video Processing
Machine Learning
Multimodal Models
Latest papersRecent research connected to this question, newest first.Taming Modality Entanglement in Continual Audio-Visual SegmentationThe source defines Continual Audio-Visual Segmentation as continuously segmenting new classes guided by audio. It analyzes multimodal semantic drift and co-occurrence confusion across three audio-visual incremental scenarios, with evidence from experiments comparing against single-modal continual learning methods.research paper · Sep 1, 2026
Related questions
How can vision systems discover unknown fine-grained classes without capture-device bias distorting cross-device evaluation?How can models segment arbitrary visual concepts precisely from one or a few annotated exemplars without task-specific training?How can continual VideoQA learn new tasks without forgetting earlier ones or accumulating task-specific prompts?How can cooperative semantic communication jointly support classification and regression in visual perception?