llama.cpp发布b10887:为s390x架构的q4_0量化加入repack支持
llama.cpp新构建版本b10887的主要代码变更为在ggml-cpu的s390x平台上为q4_0量化添加repack支持(#28667),同时清理了ggml-cpu的注释,由Aaron Teo提交。
AI解读:这条新闻真正相关的读者很窄:在IBM s390x(大型机)上跑llama.cpp CPU推理的人。b10887给这个架构的q4_0量化补上了repack支持,属于让特定硬件路径更完整的一小步。
q4_0是llama.cpp里常用的 4 位量化格式,repack意味着权重在运行时会被重新打包成更适合该CPU指令布局的形式。此前s390x上缺这一环,升级后该平台处理q4_0模型的路径与其它架构拉齐。
其余变更只是清理ggml-cpu的注释,没有功能改动。如果你不在s390x上跑CPU推理,这次更新对你几乎没有可感知区别,不必急着升级。
需要注意的是,来源只是发布说明和构建产物清单,没有给出性能数字,也没有说明加速幅度,因此无法判断实际收益有多大。
llama.cpp发布构建版本b10887。该版本列出的代码变更为:在ggml-cpu的s390x平台上为q4_0量化加入repack支持(#28667),以及清理ggml-cpu的注释。提交信息署名为Aaron Teo。
该发布同时提供各平台的预编译产物,包括macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Ubuntu(x64、arm64、s390x,以及Vulkan、ROCm 10.0、OpenVINO、SYCL FP32/FP16等变体)、Android arm64、Windows(CPU、CUDA 12.4/13.3/13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0、OpenCL Adreno)以及独立的UI包。
部分构建变体在b10887中处于关闭状态
发布页面标注macOS Apple Silicon(arm64,启用KleidiAI)为DISABLED,并链接到PR #23780;openEuler相关构建(x86 310p、x86 910b ACL Graph、aarch64 310p、aarch64 910b ACL Graph)同样标注为DISABLED,链接到PR #23705。
以上信息来自该版本的发布说明与产物清单,未包含性能数据或适用条件的进一步说明。