Research questionHow can reward models distinguish fine-grained translation quality across candidate groups during GRPO post-training?Independent quality scores evaluate translations in isolation, making subtle differences between candidates difficult to resolve. This can weaken the relative rewards used to improve open-ended machine translation.