Research questionHow can multimodal models learn when and where to zoom in without supervised warm-start data?High-resolution image tasks require models to inspect informative regions, but learning those zoom decisions often depends on costly supervised warm-start data.