Research questionHow can safety assessors scale credibility judgments for virtual-testing toolchains across automated-driving decisions of differing criticality?Automated-driving systems cover complex behaviors and broad operational design domains, making exclusive physical testing impractical. Approval decisions may therefore rely on multi-tool virtual-testing environments whose assumptions, interactions, and limitations are difficult to assess consistently.