Research questionHow can vision-language reward models remain consistent when equivalent robot goals are paraphrased?A reward model may judge the same robot behavior differently solely because a goal description uses different wording. Such inconsistency can turn identical behavior into opposite progress or success assessments, undermining reward-guided learning.