本次夜间版包含三项修复,涉及A2A服务器陈旧取消错误、写策略中的顶层安全检查器声明,以及历史回滚和重试提示优化。
阅读全文开源项目
关注开放的模型、工具与代码,找到值得动手的项目。
Google发布gemini-cli v0.57.0-preview.1,修补预览版补丁
该修复版针对v0.57.0-preview.0的补丁,由gemini-cli-robot自动合入。
阅读全文ONNX Runtime WebGPU Plugin EP 0.3.0发布:新增PagedAttention与量化KV缓存支持
微软发布ONNX Runtime WebGPU Plugin EP 0.3.0,扩展模型与数据类型覆盖,改进生成式模型性能,并加强配置与可靠性选项。
阅读全文gemini-cli发布v0.56.0-nightly版本,更新日志指向常规夜间构建
谷歌gemini-cli仓库发布了编号为v0.56.0-nightly.20260823.g5411f113c的夜间版本,但发布说明仅有完整更新日志链接,未列出任何具体变更。
Claude Code发布v2.1.241:修复缺陷并提升可靠性
Anthropic于 2 月 28 日发布Claude Code命令行工具v2.1.241,主要包含错误修复和可靠性改进。
LiteLLM v1.98.0发布:为所有Docker镜像启用cosign签名验证,并新增多项路由与成本追踪功能
BerriAI发布LiteLLM v1.98.0,所有Docker镜像均已用cosign签名,用户可通过固定commit hash验证镜像完整性;同时引入PTU成本归属、逐部署故障策略覆盖、SSE心跳等多项更新。
Claude Code发布v2.1.240版本,修复错误并提升可靠性
Anthropic发布Claude Code v2.1.240,仅包含错误修复与可靠性改进,无新功能。
SGLang发布v0.5.18:新增多模态与扩散模型支持,启动速度提升最高 2.38 倍
该版本整合了来自 212 名贡献者的 710 个PR,新增Muse Glimmer等模型,并引入重叠检查点暂存、TP LMHead All-to-All等性能优化。
Ollama v0.33.0发布:支持Claude Desktop作为第三方网关,修复KV缓存失效问题
新版本允许开发者将Ollama配置为Claude Desktop的第三方网关,并修复了多个缓存问题,包括取消预填充后恢复不佳和KV缓存被破坏。
Diffusers 0.40.0发布:新增LTX-2.5、MiniMax-H3等管线,Modular Diffusers转正,初步支持张量并行
Hugging Face发布Diffusers 0.40.0,新增多条视频、音频管线,将Modular Diffusers从实验性转为稳定支持,并加入张量并行推理支持;同时移除JAX/Flax支持并弃用torch_dtype。
LlamaIndex发布v0.14.24:修复core多项bug,新增Claude Sonnet 5与GPT-5.6支持
此次版本更新涵盖core、多个LLM集成与向量存储等模块,包含对AgentWorkflow、流式响应及多模态输入等能力的修复与增强。
Ollama v0.32.15发布:缓存模型元数据使首字延迟减半,优化桌面首次启动流程
新版本通过缓存已解析的模型元数据,将时间到首字(TTFT)从约 995 ms降至约 524 ms;同时修复流式解析错误导致会话卡死的问题。
Hugging Face Transformers发布v5.15.1补丁,修复DFlash、MTP及图像处理问题
Transformers v5.15.1修复了DFlash和MTP候选生成器的若干问题,以及Lanczos滤镜在加速器上无法处理图像的问题。
Ollama发布v0.32.14:llama-server支持WebP图像转码,Qwen渲染器放宽系统消息位置限制
Ollama于 2025 年 5 月 27 日发布v0.32.14,修复llama-server的WebP图像处理并让Qwen渲染器容忍非开头的系统消息。
Google ADK Python发布v2.7.0:模型自主声明能力,工具可返回媒体,Jinja2模板支持
Google的Agent Development Kit (ADK) Python库发布v2.7.0。此版本定位为“正确性发布”,重点改进模型输入输出处理,并引入模型能力声明、媒体工具返回等功能。
ComfyUI v0.32.0发布:支持Qwen-Image 3.0 Pro、Grok Imagine 2.0和LTX 2.5,PyTorch最低要求升至 2.7
新版ComfyUI将官方支持的PyTorch最低版本提升至 2.7,并新增多个模型节点,同时修复了低显存模式下的超分模型错误和MiniMax-H3的VAE解码崩溃问题。
vLLM发布v0.27.1补丁,支持量化DSpark Markov头
该补丁版本在v0.27.0基础上新增对量化DSpark Markov头的支持。
vLLM v0.27.0发布:支持Kimi K3全栈推理、新模型及PyTorch 2.13升级
vLLM v0.27.0带来 561 项提交,首次实现Kimi K3的完整推理栈支持,新增多款模型,并升级至PyTorch 2.13.0(破坏性变更)。
Transformers v5.15发布,新增Meta Muse Glimmer
新版本加入Meta的多模态模型Muse Glimmer,并更新模型加载与处理组件。
ComfyUI v0.31.0发布:新增Wan-Animate2与SeeDance 2.5,提速LTX和Wan视频生成
ComfyUI v0.31.0已发布,新增对Wan-Animate2、SeeDance 2.5、Flux 3等模型的支持,并优化Linux内存管理、修复MiniMax音频问题。
SGLang v0.5.17发布:day-0支持Kimi K3与MiniMax-H3,启动Rust服务端
新版本合并了来自 194 名贡献者的 582 个PR,新增对 2.8T参数多模态模型Kimi K3和视频生成模型MiniMax-H3的首日支持,并迁移部分服务端到Rust。
NVIDIA NeMo Speech 3.0发布:拆分仓库、移除80万行弃用代码,新增语音模型训练与推理功能
首个主版本聚焦技术债清理:仓库更名并聚焦语音任务,SpeechLM2支持NeMo Automodel训练,新增Nemotron VoiceChat模块,并带来流式ASR、MagpieTTS更新。
谷歌DeepMind开源WeatherNext气旋预报模型,可提前一天预测飓风路径
研究论文发表在《自然》杂志,模型在预测气旋路径、强度和风场结构方面达到最优水平,相当于提前一天预警。
vLLM v0.26.0发布:新增Inkling模型支持,并针对DeepSeek-V4及多硬件进行性能优化
新版本包含 411 个提交,来自 212 位贡献者,其中 61 位是首次贡献者。重点包括对Inkling模型家族的完整支持、针对DeepSeek-V4的专项优化、fp32 lm_head精度改进,以及KV卸载和分层二级存储的成熟。
SGLang v0.5.16发布:新增DSpark投机解码与 975B Inkling模型支持
SGLang v0.5.16合并 574 个PR,引入置信度驱动的DSpark投机解码算法、对 975B参数多模态MoE模型Inkling的支持,并默认启用UnifiedRadixTree。
Hugging Face Transformers发布v5.14.1补丁,修复Inkling模型集成问题
该补丁修复了引入Inkling模型后出现的几个问题,包括辅助生成与预填充阶段的缓存和位置偏置相关缺陷。
Transformers v5.14发布,加入Inkling模型适配
新版本新增Thinking Machines的Inkling模型支持,并合并多项社区贡献。
vLLM发布v0.25.1补丁:修复FFmpeg缺失导致的启动阻塞及混合精度RMSNorm量化融合错误
vLLM v0.25.1作为v0.25.0的补丁版本,包含两项针对性bug修复:系统缺少FFmpeg时TorchCodec不再阻塞模型启动;混合精度(如BF16激活与FP32权重)的allreduce+RMSNorm+量化融合路径被引导至安全路径,避免输出乱码。
SGLang发布v0.5.15.post1补丁版本,主要修复GLM 5.2相关功能
该补丁版本主要修复GLM 5.2在PD分离和上下文并行设置下的IndexShare问题,以及若干非CUDA/HIP设备启动和FP4 MoE内核NaN输出问题。
vLLM v0.25.0发布:MRv2成为所有稠密模型默认执行路径,删除PagedAttention
新版本包含 558 个提交,新增LLaVA-OneVision-2、Unlimited OCR等模型,Transformers后端性能追平原生vLLM,并强化流式解析引擎。