vllm-project/vllm v0.18.1
This is a patch release on top of v0.18.0 to address a few issues:
Key points
- Change default SM100 MLA prefill backend back to TRT-LLM (#38562)
- Fix mock.patch resolution failure for standalonecompile.FakeTensorMode on Python <= 3.10 (#37158)
- Disable monolithic TRTLLM MoE for Renormalize routing #37605
- Fix DeepGemm E8M0 accuracy degradation for Qwen3.5 FP8 on Blackwell (#38083)
Sources (1)
- [1]vllm-project/vllm v0.18.1GitHub: vllm-project/vllm · Mar 31, 12:53 AM
This is a patch release on top of v0.18.0 to address a few issues:
- Change default SM100 MLA prefill backend back to TRT-LLM (#38562)
Extractive summary: sentences quoted from the sources.
Before this
- Mar 28, 2026sgl-project/sglang v0.5.10rc0
- Mar 23, 2026pytorch/pytorch v2.11.0: PyTorch 2.11.0 Release
- Feb 24, 2026sgl-project/sglang v0.5.9
- Jan 23, 2026sgl-project/sglang v0.5.8
- Jan 1, 2026sgl-project/sglang v0.5.7