Research questionHow can mixture-of-experts language models preserve safety when adversaries manipulate sparse expert routing?Sparse routing makes a model’s safety behavior depend on which experts are activated. Jailbreaks, malicious fine-tuning, and pruning can disrupt those safety-critical pathways, allowing harmful behavior despite prior alignment.