Research questionHow can RGB-D visual pretraining improve 3D awareness without sacrificing semantic transfer?RGB-only pretraining lacks the explicit geometric information provided by depth sensors, limiting 3D understanding in embodied systems. Incorporating depth must also retain features useful for semantic tasks.