Research questionHow can dangerous capabilities in LLMs be compared consistently across models and releases?Fragmented safety evaluations make it difficult to determine whether models differ in dangerous knowledge, resistance to unsafe requests, or harmful outputs. They also obscure whether newer releases are becoming safer.