Get Started
Home
Topics
Search
Library
Topic · 40 recaps
Inference Optimization
Techniques that make trained models faster and cheaper to serve: quantization, speculative decoding, KV-cache tricks, kernel fusion, batching, and architectural choices for low-latency generation.
...
Sort
Newest
Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding
Inference Optimization · Aug 28
0
Sliding-window beats linear attention
Inference Optimization · Aug 28
0
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
Inference Optimization · Aug 27
0
TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming
Inference Optimization · Aug 21
0
BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
Inference Optimization · Aug 10
0
LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers
Agents · Aug 7
0
SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
Inference Optimization · Aug 7
0
JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
Diffusion · Aug 4
0
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
Inference Optimization · Jul 29
0
Metis: Memory Foundation Model
Inference Optimization · Jul 29
0