Research questionHow should LiDAR semantic segmentation be evaluated for deployment under coarse labels, sensor corruption, and domain shift?Clean, fine-grained, single-domain benchmarks can hide whether segmentation models preserve safety-relevant performance when LiDAR sensing degrades or deployment environments change. Inference speed on embedded hardware is another practical constraint that standard accuracy rankings often omit.