Research questionHow can DeepResearch systems obtain scalable, query-specific reward signals for report quality?Generic rubrics may miss the fine-grained requirements of a particular research query, while manually writing such rubrics is expensive and difficult to scale. This makes it difficult to turn human judgments about report quality into reliable signals for system improvement.