Research questionHow can referring expression comprehension localize multiple targets and reject expressions with no valid match in open-world scenes?Standard referring expression comprehension often assumes simple images and exactly one matching object. That assumption makes it difficult to determine whether a model can identify all valid referents or recognize when an expression has no match in complex visual environments.