Research questionHow can autoregressive language models add recurrent cross-token memory without breaking KV caching or one-forward-per-token decoding?Standard transformers rely on attention and cached keys and values during generation, but they do not naturally carry a separate recurrent state across tokens. Adding one can alter the decoding interface or require additional forward passes.