Research questionHow can robot manipulation policies be evaluated for execution quality without costly, unstable repeated hardware trials?Physical evaluation requires repeated hardware trials, manual scene resets, and operator monitoring, while success rates can hide meaningful differences in how policies execute.