Research questionHow can diffusion image and video generators be preference-aligned without inefficient training exploration or inference-time search?Policy-gradient preference optimization can explore inefficiently, become trapped in local optima, and exploit reward signals in ways that reduce semantic faithfulness or visual realism. Alignment must also avoid requiring extra search during generation.