Get Started
Home
Topics
Search
Library
Research questionHow can text-conditioned visual autoregressive models increase image diversity without sacrificing quality?Text-conditioned visual autoregressive models can generate nearly identical images for the same prompt, even when those images are high quality. Increasing variation can sharply reduce image quality, creating a difficult diversity–quality trade-off.
AI
Computer Vision
Image & Video Processing
Image Generation
Machine Learning
Latest papersRecent research connected to this question, newest first.DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive ModelsThe source studies test-time diversity enhancement for text-conditioned visual autoregressive models, using no retraining or fine-tuning and aiming for limited computational overhead. Its evidence comes from experiments evaluating the balance between generated-image diversity and quality.research paper · Sep 1, 2026
Related questions
How can text-to-image models preserve variation in unspecified visual factors under long, semantically dense prompts?How can text-to-image diffusion models preserve prompt alignment without the extra sampling cost of classifier-free guidance?How can open image generators follow fine-grained editing instructions without sacrificing image quality or inference speed?How can we measure whether generative models preserve conditional diversity without multiple reference outputs per input?