Research questionHow can streaming video-language models cut frame-encoding latency while preserving question-relevant evidence?In streaming video understanding, encoding each incoming frame can dominate end-to-end inference time. Pruning visual tokens after encoding cannot recover computation already spent on redundant frames.