llama.cpp b10905发布:为RDNA4开启head size 256的MMA Flash Attention
该版本集中在CUDA/HIP的Flash Attention调优,HIP后端在RDNA4(gfx1201)上为head size 256启用mma FA并调整配置;AMD WMMA路径改为优先整块tile的FA网格而非stream-k。
llama.cpp发布b10905版本,主改动是CUDA/HIP的Flash Attention调优,PR编号 #28102,标题标注目标为gfx1201(AMD RDNA4)。
提交说明列出三项改动:HIP在RDNA4上为head size 256启用mma Flash Attention并调整配置;在AMD WMMA路径上优先使用整块tile的FA网格,而非stream-k;修订stream_k逻辑;修订内核选择逻辑。
提交由Johannes Gäßler合作完成,提交信息中注明Assisted-by: Claude、Assisted-by: Codex。
发布页照常附带各平台预编译包下载,涵盖macOS、Linux、Android、Windows与UI。macOS Apple Silicon的KleidiAI启用版本与openEuler构建标记为DISABLED。
b10905的两处HIP内核改动
按发布说明,HIP后端在RDNA4(gfx1201)上为head size 256启用了mma Flash Attention,并对配置做了调优。此前该组合是否走mma路径,发布内容未作对比说明。
另一项改动针对AMD WMMA路径:FA网格选择优先整块tile,而不是stream-k。提交同时修订了stream_k逻辑与内核选择逻辑,说明在什么条件下用哪种网格、用哪个内核属于本次调整范围。
发布说明没有给出速度、显存或吞吐的量化数字,因此这些改动在具体显卡和模型上带来多大差异,需要用户自行在对应硬件与模型配置下测量。
- 改动范围:CUDA/HIP的Flash Attention路径
- 目标硬件标注:gfx1201,即AMD RDNA4
- HIP改动 1:head size 256启用mma FA,并调configs
- HIP改动 2:AMD WMMA上优先整块tile FA网格,替代stream-k
- 附带修订:stream_k逻辑、内核选择逻辑
- 合作者:Johannes Gäßler;提交信息标注Claude、Codex协助
发布包与仍被禁用的构建
该版本提供的预编译包按平台划分。macOS/iOS包括Apple Silicon(arm64)、Intel(x64)和iOS XCFramework;其中macOS Apple Silicon开启KleidiAI的版本仍标记为DISABLED,链接指向PR 23780。
Linux侧覆盖Ubuntu x64、arm64、s390x的CPU包,以及Vulkan(x64、arm64)、ROCm 10.0 x64、OpenVINO 2026.3.1 x64、SYCL FP32与FP16 x64。Android提供arm64 CPU包。
Windows侧包括x64与arm64的CPU包、arm64的OpenCL Adreno、x64的CUDA 12.4与 13.3、arm64的CUDA 13.4,以及对应的CUDA运行时DLL包;另有Vulkan、OpenVINO 2026.3.1、SYCL和ROCm 10.0的x64包。openEuler的x86 310p、x86 910b(ACL Graph)、aarch64 310p、aarch64 910b(ACL Graph)全部标记为DISABLED,链接指向PR 23705。UI包单独提供。