DualDeadline adds separate gate/up and down-projection transfer deadlines to exact MoE offloading, with H200 validation and Triton-optimized predictors.
reproducible-research gpu cuda pytorch triton moe inference-optimization mixture-of-experts llm-inference systems-research expert-prefetching model-offloading
-
Updated
Jul 30, 2026 - Python