Research questionHow can video facial-expression recognition personalize vision-language models under shifts without costly test-time optimization?People express emotions differently, and recording conditions can vary across subjects, causing models trained on other data to lose accuracy. Updating model parameters during testing can also impose computational overhead that limits practical use.