Get Started
Home
Topics
Search
Library
Research questionHow can large vision-language models reduce visual hallucinations without extra training or decoding passes?Large vision-language models can generate visual content that is not supported by the input image. Common mitigation strategies may require curated data, additional training, or repeated decoding, increasing computational demands.
AI
Alignment & Safety
Computer Vision
Inference Optimization
Information Retrieval
Machine Learning
Multimodal Models
Latest papersRecent research connected to this question, newest first.RVSD: Retrieval Vision Sparse Decoding for Mitigating Visual Hallucinations in Large Vision-Language ModelsThe source describes a training-free, plug-and-play single-pass decoding framework that combines semantics-directed token sparsification with semantic-space visual retrieval. Its experiments include long-context generation and report hallucination suppression, but the input does not specify model-access, latency, or deployment constraints.research paper · Sep 2, 2026
Related questions
How can we detect object hallucinations in vision-language models when visual grounding shifts across layers?How can speech recognition avoid hallucinated transcripts on non-speech without degrading genuine speech?How can streaming video-language models cut frame-encoding latency while preserving question-relevant evidence?How can vision-language models maintain visual recognition when modalities are missing and source training data is unavailable?