Research questionHow can audio-video diffusion models preserve intended conditioning when biased cross-modal attention reroutes semantics?In audio-video diffusion generation, cross-attention among text, audio, and video can route semantics bidirectionally rather than respecting intended conditioning. Learned biases may cause one modality to override prompts, producing visually canonical but semantically incorrect outputs.