Research questionHow can reinforcement-learning network controllers meet packet deadlines amid dynamic congestion without costly, unstable training?Volume-based congestion measures do not reflect packet urgency, while training controllers from scratch can require many interactions and behave unpredictably early in training. The challenge is maintaining strict end-to-end peak-latency guarantees as network conditions change.