Research questionHow can we evaluate machine translation reliably and actionably as standard benchmarks saturate?Standard translation benchmarks increasingly distinguish poorly among stronger systems, while automatic metrics can be unreliable or reward-hacked. Human evaluation can identify problems but may lack reproducibility, objectivity, and scalability.