Research questionHow should vision-language model post-training balance perception and reasoning under SFT versus reinforcement learning?Post-training can strengthen a vision-language model’s reasoning more than its ability to extract accurate visual information. This imbalance limits end-to-end visual reasoning, and its cause differs between supervised fine-tuning and reinforcement learning.