Multiverse Computing的新论文不再按“主题”一刀切拒答,而是聚焦“主题内子集”边界。在政治操纵场景下,新方法使良性侧过拒从 32.94% 降至 4.16%,有害侧拒答仅小幅回落;研究同时警示,单纯提高拒答率可能带来严重的过拒问题。
阅读全文开源项目
关注开放的模型、工具与代码,找到值得动手的项目。
LangChain发布langchain-openai 1.6.1:支持异步工具调用与Azure AD认证
新版本修复GPT-5推理努力级别配置,并针对OpenAI 3.8调整Azure AD认证。
阅读全文llama.cpp发布b10863:修复Metal后端mul_mv_iq3_xxs内核中ne00的空闲线程问题
新版修复了Metal后端在特定矩阵乘法操作中的线程调度缺陷,同时提供多平台预编译二进制供下载。
阅读全文llama.cpp发布b10859:修复多处编译错误,补充缺失头文件
新版本解决在特定构建环境下因缺少头文件导致的编译失败问题,共涉及至少 6 个bug修复。
llama.cpp b10858发布:Vulkan后端融合激活函数与乘法运算,覆盖gemma3n等模型模式
新版将GELU、SIGMOID、SILU、SOFTPLUS与MUL融合为单一Vulkan内核,针对gemma4、qwen3next等架构的共享专家门控,修复 10-18% 的预填充性能回退。
llama.cpp b10857发布:修复 32 位平台Vulkan句柄使用问题
llama.cpp发布b10857版本,修复Vulkan-Hpp在 32 位目标上的句柄使用问题,并同步提供各平台预编译二进制。
llama.cpp b10856发布:拆分模板解析器,chat.cpp规模缩减逾一半
llama.cpp发布b10856版本,将 14 个专用模板解析器从chat.cpp拆分为独立文件,chat.cpp代码行数降至 1513 行,无功能变化。
llama.cpp b10855发布:修复OpenCL后端conv2d非连续输入处理
新版本主要修复OpenCL后端conv2d对非连续输入的stride处理问题,并同步更新各平台预编译包。
llama.cpp b10853发布:新增Kimi-K3循环状态回滚支持
llama.cpp发布b10853版本,核心变更为支持Kimi-K3模型的循环状态回滚功能。
llama.cpp b10852发布:为Hexagon DSP后端新增RELU与LEAKY_RELU算子
新版本主要为Qualcomm Hexagon后端补齐两种激活函数算子,涉及代码合并(PR #28585)。
llama.cpp发布b10850版本:修复L2_NORM测试在GCC 12下的编译告警
新版本仅包含一项测试代码修复,将L2_NORM批次数绑定到局部变量并为数组初始化,解决aarch64 Release构建在GCC 12下因“可能未初始化”告警导致的编译失败。
llama.cpp b10844为Vulkan后端加入DeepSeek-V4超连接融合算子
Vulkan成为最后一个为DeepSeek-V4添加融合算子(DSV4_HC_COMB/PRE/POST)的主要后端,此前在Strix Halo上未融合的Sinkhorn链约占解码操作时间的 32%。
llama.cpp b10842发布:ggml新增gfx90c HIP支持
新版本为ggml添加面向AMD gfx90c平台的HIP后端并使其符合规范,同时更新了多个平台的预编译二进制。
llama.cpp b10840发布:CUDA分支无跳转解包提速Q4_K/Q5_K,DGX Spark获L2预取
新版本针对批大小大于 1 的mmvq场景优化,将Q4_K/Q5_K解包改为无分支计算,避免每列重复执行缩放解包;同时为NVIDIA DGX Spark加入L2预取支持。
llama.cpp b10839发布:修复Vulkan后端GET_ROWS崩溃,Qwen3-TTS与Qwen3-VL可正常加载
llama.cpp发布b10839,修复Vulkan后端因张量偏移未对齐导致GET_ROWS运算断言失败的问题,该问题影响Qwen3-TTS和Qwen3-VL等模型。
GOSIM开源大会首次落地深圳,10 月 16 日开幕,DHH与英伟达、微软等 150+ 讲师参会
10 月 16-17 日,GOSIM Shenzhen 2026将在深圳南山伊敦酒店举办,设 6 大技术主题论坛、7 场Workshop、4 场Hackathon和Spotlight路演,早鸟票 9 月 17 日截止。
llama.cpp b10837发布:修复内容类型检查逻辑
本次更新包含一项针对type内容处理的重检修复。
llama.cpp b10835发布:修复CUDA后端f16 Flash Attention的分支屏障错误
本次更新包含两个ggml-cuda补丁:修复f16 flash attention中的divergent barrier问题,并避免重复的元数据指针设置。修复主要影响NVIDIA GPU上使用半精度Flash Attention的场景。
llama.cpp b10834发布:ggml后端输入不再强制创建额外split
本次更新允许ggml后端输入不创建另一个split,并更新了各平台构建产物。
llama.cpp b10833:Vulkan后端融合RMS_NORM操作,Gemma系模型性能提升约 4%
llama.cpp发布b10833,为Vulkan后端新增RMS_NORM与MUL、ADD、VIEW、SET_ROWS等操作的融合支持,并扩展ROPE对IMROPE的支持,作者称在其系统上Gemma模型性能提升约 4%。
llama.cpp b10831发布:Vulkan后端新增TQ1_0量化支持
新版本在Vulkan后端加入TQ1_0量化格式的矩阵乘法、矩阵向量乘等内核,并将 3 的幂打包进 32 位常量以优化实现。
OpenBMB发布MiniCPM5-2B:2.6B参数密集推理模型,4B以下开源模型中智能指数最高
MiniCPM5-2B在Artificial Analysis Intelligence Index v4.2上得15分,超越Granite 4.2 3B(11分),但落后于Ling 3.0 Tiny(16分)。

llama.cpp发布b10830:新增 --fuse-qkv参数,转换时合并Q/K/V矩阵
llama.cpp发布b10830版本,核心变化是在HF到GGUF转换工具中新增 --fuse-qkv参数,可在模型转换阶段将查询、键、值矩阵融合为QKV。各平台安装包同步发布。
llama.cpp b10829发布:修复GDN归一化,从max改为rsqrt,对齐参考实现
此修复改变了GDN q/k归一化的epsilon处理方式,影响Qwen3-Next等模型的数值行为,cuda、vulkan等预编译二进制已同步更新。
llama.cpp b10828发布:新增Spark 2.5模型架构支持
llama.cpp发布b10828版本,新增对Spark2_5ForCausalLM模型实现的支持,并同步提供各平台预编译二进制下载。
llama.cpp b10827发布:修复OpenCL后端q4_K/q5_K乘法的权重打包选择
新版本包含一项OpenCL修复,涉及q4_K与q5_K量化格式在矩阵乘法中的权重打包逻辑,同时为各平台提供预编译二进制。
llama.cpp b10826发布:修复CUDA后端mmid与mmf中的竞态条件
新版本主要针对CUDA后端的多模态推理(如mmid、mmf)进行并发修复,并同步更新各平台预编译二进制文件。
llama.cpp b10825发布:修复grammar最大重复阈值问题
llama.cpp发布b10825版本,修复了grammar中的最大重复阈值问题,并同步更新了各平台构建产物。
llama.cpp b10823发布:新增 --log-jsonl结构化日志选项
llama.cpp最新版本b10823已发布,为common组件添加了 --log-jsonl命令行选项(PR #28437),允许以JSONL格式输出日志。
llama.cpp b10822发布:UI资源改用CMake直接内嵌,简化跨平台编译
新版本移除构建期C++辅助代码和外部gzip依赖,UI资产完全内嵌于二进制,同时提供涵盖macOS、Linux、Windows、Android及多后端(CUDA、Vulkan、ROCm等)的预构建包。