Research questionHow can we assess vision-language models’ instruction following across languages and instruction-hijacking attacks?Many vision-language evaluations provide limited language coverage and omit adversarial instruction-hijacking scenarios. As a result, model reliability in multilingual, safety-sensitive interactions is difficult to characterize.