Get Started
Home
Topics
Search
Library
Topic · 45 recaps

LLM Pretraining & Post-training

How large language models are built: data curation and mixtures, pretraining objectives, scaling laws, instruction tuning, preference learning, and the full post-training stack.
Sort
Newest
J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data
Evaluation · Aug 27
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
Inference Optimization · Aug 27
Fast Weight Attention for Continual Learning
LLM Training · Aug 27
TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming
Inference Optimization · Aug 21
DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents
Agents · Aug 19
Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision
Image Generation · Aug 17
On-Policy Self-Distillation without Any Supervision
LLM Training · Aug 9
SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
LLM Training · Aug 6
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
Agents · Aug 6
Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes
LLM Training · Aug 5