AION
Open-source releaseMLOps, Tooling & Infrastructure1 source · Mar 31, 2026

vllm-project/vllm v0.18.1

This is a patch release on top of v0.18.0 to address a few issues:

Key points

  • Change default SM100 MLA prefill backend back to TRT-LLM (#38562)
  • Fix mock.patch resolution failure for standalonecompile.FakeTensorMode on Python <= 3.10 (#37158)
  • Disable monolithic TRTLLM MoE for Renormalize routing #37605
  • Fix DeepGemm E8M0 accuracy degradation for Qwen3.5 FP8 on Blackwell (#38083)

Sources (1)

  • [1]vllm-project/vllm v0.18.1
    GitHub: vllm-project/vllm · Mar 31, 12:53 AM
    This is a patch release on top of v0.18.0 to address a few issues:
    - Change default SM100 MLA prefill backend back to TRT-LLM (#38562)

Extractive summary: sentences quoted from the sources.

Before this

  1. Mar 28, 2026sgl-project/sglang v0.5.10rc0
  2. Mar 23, 2026pytorch/pytorch v2.11.0: PyTorch 2.11.0 Release
  3. Feb 24, 2026sgl-project/sglang v0.5.9
  4. Jan 23, 2026sgl-project/sglang v0.5.8
  5. Jan 1, 2026sgl-project/sglang v0.5.7

Related