开源vLLM Releases·原文 2026年9月9日本站收录 2026年9月11日

vLLM v0.29.0发布:Model Runner V2成为所有模型默认运行器

该版本包含 594 次提交、277 名贡献者(其中 91 名新贡献者),新增Hy4-preview、Qwen3.8-Flash-Next等模型支持,并移除了十个已弃用的模型架构。

AI解读:对部署方来说,更实际的影响在默认值和准入控制上:FlashInfer all-reduce在TP CUDA组中默认启用(可用VLLM_ALLREDUCE_USE_FLASHINFER=0 关闭),prefix-cache的NONE_HASH默认确定化,分布式KV cache用户不必再固定PYTHONHASHSEED,同时新增 --max-num-queued-reqs / --max-num-queued-tokens两个排队准入参数。

这是一次带破坏性变更的版本:十个已弃用模型架构被移除,FlexOlmo、Olmo3、Hunyuan V1/VL迁移到Transformers建模后端,PyAV视频解码后端被移除,python -m vllm.entrypoints.openai.api_server被弃用,改用vllm serve。依赖这些接口或架构的部署需要先迁移。

模型支持面继续扩大:Hy4-preview是腾讯的 770B总参数、49B激活参数MoE,带Gated DeepSeek Sparse Attention和原生MTP;还新增Qwen3.8-Flash-Next、GraniteSWA/GraniteMoeSWA、NemotronH_Omni_Reasoning_V3以及Kimi K3 NVFP4 checkpoints。

性能改进集中在Kimi-K3与DeepSeek V4:K3潜在尾部融合MXFP4 top-k收尾带来约 5% 端到端延迟改善,K3 Mamba元数据准备合并为一次Triton启动获得 6.6-7.6 倍内核加速,Hopper低延迟GEMM调优后也调度到SM100并用于eh_proj,内核加速 12.9~25.2%。这些数字来自发布说明,未提供独立复现数据。

vLLM发布v0.29.0,包含 594 次提交,来自 277 名贡献者,其中 91 名是新贡献者。

发布说明列出的首要变化是Model Runner V2(MRV2)成为所有模型的默认运行器(#53183),完成了此前从池化模型开始的推广(#48290)。少数ROCm模型以及MRV2尚不支持的功能仍使用MRV1。

MRV2同时新增CUDA graph显存分析用于KV cache自动定容(#53306)、按batch分片的采样使每步logits显存降低 1/TP(#50465)、prompt embeds(#42963)、extract_hidden_states推测(#49811)、spec decode下均匀decode的padded FULL cudagraph调度(#53407),以及EAGLE/MTP draft prefill前的DP-sync跳过(#53694)。

新增模型:Hy4-preview、Qwen3.8-Flash-Next、Kimi K3 NVFP4等

发布说明列出的新模型包括:Hy4-preview(#54160),腾讯的 770B总参数、49B激活参数MoE,带Gated DeepSeek Sparse Attention和原生MTP;Qwen3.8-Flash-Next(#53896),支持BF16/FP8/NVFP4与MTP;GraniteSWA和GraniteMoeSWA(#52706),通过现有Granite实现支持;NemotronH_Omni_Reasoning_V3(#52929,Nemotron VL模型的MTP见 #53121);Kimi K3 NVFP4 checkpoints(#53132)。

其他模型支持变更包括双向注意力用于DeepSeek backbone嵌入模型(#52948)、FP8 ModernBERT(#53101)、FlexOlmo、Olmo3和Hunyuan V1/VL迁移到Transformers建模后端(#53615),以及权重绑定现在会检查checkpoint,即使配置声称绑定嵌入也加载真实的lm_head(#51665、#53170)。

Kimi-K3与DeepSeek V4的性能改动

针对Kimi-K3,发布说明列出:K3潜在尾部融合MXFP4 top-k收尾带来约 5% 端到端延迟改善(#53152);K3 Mamba元数据准备合并为一次Triton启动,内核加速 6.6-7.6 倍(#52388);调优后的Hopper低延迟GEMM(#54088)现在也调度到SM100(#53534)并用于eh_proj,内核加速 12.9~25.2%(#53942)。

  • GEMM-RS扩展到GEMM-AR(#53053)
  • MLA gate合并进QKV-A投影(#54015)
  • K3 DCP配合DSpark(#52188)以及DCP部分prefix cache命中(#50493)
  • DeepSeek V4共享专家融合进MegaMoE(#53040),自适应top-k宽度重新落地(#52823),Humming MoE的原生SwiGLU clamp内核(#53685),以及可选的FlashInfer moe_ep专家后端(#49636)

推测解码与RL权重同步

推测解码方面,OpenAI API响应可通过 --per-request-spec-decode-metrics提供按请求的接受统计(#48915);自适应验证扩展到logprobs(#52242);新增SM100上GLM-5.2稀疏MLA(#52783)和SM90上DeepSeek V4(#52795);Qwen3-Omni DSpark drafts(#52560);PLaMo3 EAGLE-3/DFlash(#54239);以及从speculators格式加载DFlash2(#53797)。

  • RL权重同步新增sharded_rdt P2P后端,每个worker只通过NIXL或Ray Direct Transport拉取自己的TP/EP分片(#43375)
  • rank本地IPC权重更新(#52497)
  • 通过原生权重加载器做稀疏checkpoint坐标更新(#50723、#53751)
  • gpt-oss的路由专家加载(#52209)

Mamba前缀缓存、新默认值与破坏性变更

Mamba前缀缓存方面,内部prefill checkpoints带来 9%~25% 的TTFT改善(#52789);prefix_cache_retention_interval现在是CLI参数,默认值为 0(#52216),使用EAGLE/MTP的混合模型会自动恢复dense retention(#55760、#55861)。

新默认值方面:FlashInfer all-reduce在TP CUDA组中默认启用,可用VLLM_ALLREDUCE_USE_FLASHINFER=0 关闭(#52998);prefix-cache的NONE_HASH默认确定化,分布式KV cache用户不再需要固定PYTHONHASHSEED(#51875);新增 --max-num-queued-reqs / --max-num-queued-tokens准入控制参数(#49445)。

破坏性变更:移除十个已弃用的模型架构(#53608);FlexOlmo、Olmo3和Hunyuan V1/VL迁移到Transformers建模后端(#53615);移除PyAV视频解码后端(#54231);弃用python -m vllm.entrypoints.openai.api_server,改用vllm serve(#52131);移除VLLM_TEST_FORCE_FP8_MARLIN(#52182)和VLLM_ROCM_USE_AITER_FP4_ASM_GEMM(#53141)。

量化、API与硬件支持

量化新增后端包括FlashInfer TRT-LLM MXFP8 linear(#52204)、面向SM120/SM121的b12x FP4 MoE(#52018)、AutoRound分块FP8(#47434)、MXFP4权重加block-FP8激活的Humming MoE(#51332),以及compressed-tensors WNA16 MoE的Humming(#48918)。

API与前端方面,新增 /v1/messages/render用于Anthropic Messages API(#45803)、/cohere/v2/chat/render(#53219)、空闲流的SSE keep-alive注释(#51034)、视频embeds输入(#54242),池化请求可以设置padding(#51157)。Rust前端新增带本地XGrammar结构标签的HY3统一解析器(#53054)、gRPC音频/视频输入(#53760)、gRPC LoRA生命周期控制(#52840、#52031、#53756)、--generation-config vllm(#53044)和truncate_prompt_tokens(#48584)。

硬件与性能方面,NVIDIA侧DeepSeek V3.2 / GLM-5.2 DSA在所有GPU上路由到优化CUDA路径(#52861),并在SM103上调优FlashInfer all-reduce(#53318、#53606)。AMD ROCm侧新增双流decode配合hipgraphs(#52033),W4A4 preshuffled asm GEMM默认启用,在Llama-3.3-70B MXFP4上吞吐提升 15%(#53141);ROCr/CLR更新修复graph replay段错误,TPOT最多改善约 20%(#53712)。Intel XPU新增INC int4 W4A8 linear后端(#50501)和AutoRound MXFP8 MoE(#51248)。CPU侧新增用于DeepSeek V2/V3/R1的AMX高性能MLA后端(#52616),MLA现在可以端到端运行(#51471)。

信息来源

vLLM Releases原始来源