Research questionHow can LLM serving adapt KV-cache capacity as attention demand changes during long-output reasoning?Fixed per-request KV-cache capacity cannot reflect either differences between requests or changing attention demand during generation. This limits memory efficiency when reasoning outputs are long.