Research questionCan automatic metrics and LLM judges reliably reflect human judgments of multilingual summary quality?Automatic evaluation makes it practical to compare summaries, but its scores may not capture how people judge summary quality. This makes it difficult to know which evaluators can be trusted across languages and criteria.