Research questionHow can reinforcement learning reliably satisfy Value-at-Risk constraints during policy training?Tail-risk constraints such as Value-at-Risk can be difficult to estimate and enforce stably during policy updates, particularly with tight violation thresholds and dense costs.