开源llama.cpp Releases·原文 2026年9月11日

llama.cpp b10899发布:为Qwen优化Vulkan小M矩阵乘法

该版本针对Qwen在Vulkan后端的小M场景做了三项改动:m=1 的mul_mat改为交换A/B、允许小M使用split_k、coopmat2的小/中tile选择改为依赖M而非只看N。

llama.cpp发布构建版本b10899,提交标题为“vulkan: small M matrix optimizations for qwen (#28457)”,即针对Qwen的Vulkan小M矩阵优化。

该提交列出三项改动:一,通过交换A/B优化m=1 的mul_mat;二,改善小M性能,允许小M使用split_k;三,对于coopmat2,小tile与中tile的选择改为取决于M,而不只是N。

版本页提供attestations,以及macOS/iOS、Linux、Android、Windows、openEuler与UI的构建产物。其中macOS Apple Silicon的KleidiAI启用版标注为DISABLED(关联PR #23780),openEuler相关构建同样标注为DISABLED(关联PR #23705)。

信息来源

llama.cpp Releases原始来源