Research questionHow can we translate instruction-tuning data without corrupting task constraints or required outputs?Translated instruction examples can change task-critical constraints and required outputs even when their wording remains fluent. Models trained on such data may improve on surface-level text metrics while following instructions less reliably.