Research questionHow can sequence parallelism reduce communication costs for long-context LLM training across batch sizes?Long-context LLM training places heavy demands on memory and inter-GPU communication. Uniform sequence-parallel communication can remain inefficient across different batch sizes.