Get Started
Topic · 48 recaps

Reinforcement Learning

Learning from reward signals through trial and interaction with an environment. Spans classic RL, RLHF, and modern post-training methods for language and agent models.
PostsQuestions
Home
Topics
Search
Library
Sort
Newest
SyncWorld: Visual Calibration Enables World Models as Zero-Shot Simulators
Reinforcement Learning · Sep 8
Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation
LLM Training · Sep 8 · 7:52
NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness
Agents · Sep 8
Online Draft Co-Training for Speculative Decoding in Large-Scale, Long-Context RL Post-Training
Inference Optimization · Sep 7
DriveZero: End-to-End Driving Beyond Human Demonstrations
Reinforcement Learning · Sep 5
RISE: Recursive Improvement via Self-Extrapolating Policy Distillation
LLM Training · Sep 4
Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning
Multimodal · Sep 3
DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
Agents · Sep 3
WorldReward: Reward Modeling for Camera-Conditioned World Models
Evaluation · Sep 3
Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation
Code Generation · Sep 2 · 6:50