Research questionHow can vision-language models maintain visual recognition when modalities are missing and source training data is unavailable?At deployment, incomplete modality inputs can shift a vision-language model’s predictions and degrade recognition accuracy. This is particularly restrictive when privacy, storage, or accessibility constraints prevent access to the original source training data.