量子位对话Archify开发者涂少坤:这个把模糊想法画成图表的Agent项目总揽5.88万Star、3.8k Fork,项目与开发者本人同时登上GitHub热榜第一,他目前是小红书AI Native工程师。
阅读全文开源项目
关注开放的模型、工具与代码,找到值得动手的项目。
llama.cpp b10938为Vulkan后端加互斥锁,绕过英伟达驱动队列提交缺陷
llama.cpp发布b10938版本,主改动是在Vulkan后端为queue submit加互斥锁,原因是同一VkDevice上两个队列同时提交会破坏内部同步,该缺陷来自英伟达驱动、修复前一直保留此变通方案。
阅读全文LiteLLM发布v1.102.0-rc.1:新增多个OCR适配器与Azure/Vertex Mistral支持
该候选版本把OCR接入Azure Document Intelligence、Azure Mistral、Vertex Mistral、Vertex DeepSeek和Reducto,并加入Claude Code与Codex的网关密钥配置命令。
阅读全文llama.cpp b10936发布:改进qwen3-coder复杂类型解析
llama.cpp新构建b10936的聊天功能改进了qwen3-coder的复杂类型解析,增强了qwen3解析器的schema支持并清理了语法。
llama.cpp b10935发布:新增LOG_JSON宏记录结构化日志
llama.cpp发布构建b10935,核心变更是common组件新增LOG_JSON宏,用于输出结构化数据,并在fit中加入演示;同时附带了各平台预编译包下载。
llama.cpp b10934重构JSON Schema处理:引入common_chat_schema内部表示
llama.cpp发布b10934构建版本,核心变更是为JSON Schema实现common_schema内部表示,并将json-schema-to-grammar迁移到该表示上。
llama.cpp b10933发布:Jinja模板支持点属性后接整数字面量
llama.cpp发布b10933版本,唯一列出的改动是修复Jinja模板解析,使其支持点属性后面跟整数字面量的写法(PR #28817)。
llama.cpp b10932修复Clang预编译头时间戳导致的缓存构建失败
ggml-org发布的llama.cpp b10932在cmake中让Clang预编译头不再记录源文件修改时间,解决从其他checkout恢复缓存头后构建报错的问题,同时照例提供多平台预编译包。
Claude Code v2.1.270修复只读git命令误报权限问题
该版本回退了 2.1.269 引入的回归:会话运行一段时间后,Bash中的只读git命令会意外弹出权限确认。
llama.cpp b10930修复模型数量达上限时无法下载模型的问题
该版本针对issue #26809 修复了server在已加载模型数达到上限时不允许下载新模型的限制,并同步发布macOS、Linux、Windows、Android等多平台预编译包。
llama.cpp b10929发布:为AMD GCN架构在HIP后端加专属配置表
llama.cpp发布b10929版本,核心变更是提交 #27841——在ggml-cuda的HIP路径中为AMD GCN架构新增专门的配置表,同时更新了覆盖macOS、Linux、Windows、Android等多平台的预编译产物。
llama.cpp发布b10927:把cpp-httplib升级到 0.56.0
这是一个构建号更新,唯一实质代码改动是vendored的HTTP库cpp-httplib升到 0.56.0(PR #28787),各平台预编译产物随新构建号一并重新生成。
llama.cpp发布b10926,改进对不支持tq1_0量化格式的失败处理
llama.cpp新版本b10926由贡献者syscl提交的 #28681 改动,让程序在遇到不支持的tq1_0量化时优雅失败,而不是异常崩溃。
llama.cpp b10924修复路由子进程状态命令被日志污染的问题
llama.cpp发布b10924构建,修复子进程状态命令与日志共用管道时因颜色重置转义序列导致命令被当作日志转发、已完成下载卡在downloading状态的问题。
llama.cpp发布b10923:修复OpenCL后端多处崩溃
该版本的主要变更是修复OpenCL后端导致程序中止的若干bug,同时照例放出覆盖macOS、Linux、Windows、Android等的预编译包。
llama.cpp发布b10922:为OpenCL加入Q4_K A8二值化GEMM内核
该版本新增kernel_gemm_noshuffle_q4_k_f32_32b_trans_ila_a8_bin,针对非MoE的A8 Q4_K场景,并修正了布局兼容性、重命名了二值内核选择辅助函数。
llama.cpp b10921修复WebGPU块量化张量绑定偏移
llama.cpp发布b10921版本,WebGPU后端将张量绑定偏移回退对齐到类型块大小,使块量化视图在着色器中获得有效元素偏移。
llama.cpp b10920为Hexagon后端加入多设备行切分支持
该版本允许把模型按行切分到多台Hexagon设备上运行,并为此修正了矩阵乘、注意力、ROPE等大量算子的多设备分区逻辑,同时更新了开发者文档和运行脚本。
llama.cpp发布b10919:ggml-webgpu升级到新版Dawn
llama.cpp的b10919版本更新了ggml-webgpu后端所依赖的Dawn版本,并同步提供macOS、Linux、Windows、Android等多平台预编译包。
gemini-cli发布v0.61.0 nightly,修复间接提示注入与沙箱文件系统边界
该nightly版本包含两项安全修复:阻止通过构建文件修改和不可信标志触发的间接提示注入,并加固沙箱文件系统边界、隔离运行时状态。
llama.cpp发布b10917:MSVC下跳过llama-server的预编译头
该版本修复了此前引入PCH时在MSVC上引发的问题,关联issue #28758,并同步更新了macOS、Linux、Windows、Android等平台的预编译产物。
GitHub日本韩国市场负责人用Copilot把活动运营写成代码
Tomoko Tanaka在GitHub官方博客披露:把活动立项、报名筛选、会后上传CRM全流程交给GitHub Issue表单、标签触发的Actions和Copilot,过去手工花一两天搭建的活动现在从单个Issue自动跑起来。
LangChain发布langchain-core 1.6.3:可根据网关响应覆盖模型名与提供商追踪元数据
该版本在 1.6.2 基础上新增一项功能:允许基于网关响应覆盖模型名称和提供商的追踪元数据,另有测试和文档清理。
llama.cpp b10909:Metal后端融合表重构,修复约5% token生成性能回退
这次更新把Metal后端所有可融合算子模式集中到一张融合表,同时修掉一个因输出索引用错相对索引、导致norm/MUL融合静默失效并造成约 5% token生成回退的bug。
llama.cpp b10908修复Metal后端IQ矩阵乘内核空转线程
该版本针对ne00=4 的剩余iq mul_mv内核修复空闲线程问题,并整理行切片偏移逻辑;K-quants存在同类问题但需单独改动。
llama.cpp b10907修复deepseek2、glm4moe等架构的MTP上下文KV缓存分配
该版本为deepseek2、glm4moe、cohere2moe架构修复MTP上下文KV缓存分配问题,并加入逆架构门控;同时发布覆盖macOS、Linux、Windows、Android的多平台预编译包。
llama.cpp b10905发布:为RDNA4开启head size 256的MMA Flash Attention
该版本集中在CUDA/HIP的Flash Attention调优,HIP后端在RDNA4(gfx1201)上为head size 256启用mma FA并调整配置;AMD WMMA路径改为优先整块tile的FA网格而非stream-k。
LiteLLM发布v1.102.0-dev.2,新增OCR适配器与按TTFT百分位路由
该开发版仍以cosign签名验证为基础,更新集中在MCP授权、消费追踪、Terraform资源与路由策略等修复和功能上。
RunningHub开源MiniMax H3多卡加速方案,称4卡RTX 6000D生成提速约12倍
量子位报道,一站式AIGC创作平台RunningHub将MiniMax H3的推理加速方案开源至GitHub,称在4张RTX 6000D上生成5秒1344×768视频从348.8秒降至28.7秒,且保留BF16精度。
llama.cpp发布b10901:Vulkan后端在上下文空闲时改用CPU写入
该版本唯一的代码改动是ggml_backend_vk_cpy_tensor_async在上下文空闲时使用CPU写入,同时照例放出各平台预编译包。