Motus2把行动、预测、评估三种能力放进同一个模型,用自预测和价值反馈更新策略。真机测试中,规划加基于模型的强化学习让基础策略成功率从65%提升到75%;接入触觉模块后,两项任务平均成功率从60%升至72.5%。
阅读全文模型发布
追踪模型的新能力,理解每一次迭代带来的变化。
Cognition用GPT‑6 Astra让Devin自测代码
OpenAI称GPT‑6 Astra提升了Devin测试软件并证明其可用的能力,目标是让工程师少审代码、多交付。
阅读全文OpenAI将Habitat从Python库扩展为支撑 10 亿用户的全球存储平台
OpenAI称其Habitat已从Python库演变为全球分布式存储平台,服务超过 10 亿ChatGPT用户,峰值处理 2200 万次请求/秒。
阅读全文AWS为SageMaker HyperPod推出模型缓存,推理冷启动从30分钟缩短至秒级
该功能将模型权重和容器镜像预加载到集群节点的本地NVMe存储上,已在所有支持HyperPod的区域正式可用,但权重缓存按节点复制,NVMe容量需匹配模型大小。

Skild AI发布S1机器人基础模型:看一段视频即学新任务,无需重训权重
Skild AI称S1通过上下文学习,从单段视频演示中学会此前未见的长程任务,单步成功率约 66%,对照系统为 9%;公司还称达到 1 亿美元年化营收、10 个月内建立 60 多个部署合作。

AWS发布模型无关的PII检测器,用提示词替代重训练
该检测器把要识别的PII类型写进系统提示词而非代码,可在Amazon Bedrock或自托管GPU上运行;在五个公开语料、49,365 条记录上评测,Core F1介于 74.9% 到 83.1%。

OpenAI在ChatGPT Work中推出Data agent
OpenAI新闻页称,该Data agent可连接公司数据、发现洞察,并用自然语言构建交互式仪表盘。
DeepSeek发布V4.1-Flash:KV缓存内存降至前代约四分之一
该多模态模型总参数 5520 亿、单token激活约 160 亿,上下文最长 100 万token;DeepSWE v1.1编程基准得分 74.2%,以MIT许可在Hugging Face开放,API价格与V4-Flash相同。

高德发布3D原生城市世界模型ABot-Earth 0.7,覆盖196个国家和地区
高德称该模型可在消费级GPU上用10分钟生成公里级3D城市场景,效率比传统模式提升1000倍,体验官网已上线并应用于飞行街景2.0。
OpenAI推出ChatGPT for Financial Services,内置金融数据并搭载GPT-6 Astra
OpenAI新闻页面显示,该产品面向研究、建模和客户可用材料,结合内置金融数据与GPT-6 Astra。来源仅有摘要,未披露定价、上线时间或可用范围。
OpenAI与美国GSA合作:向联邦、州、地方及部落政府提供零许可费和五折用量优惠
OpenAI新闻消息称,OpenAI与美国总务管理局(GSA)将面向符合条件的联邦、州、地方及部落政府提供 0 美元许可费、用量五折以及扩展的网络防御支持。
安努智能一周发布六款模型,覆盖数据生成到端到端部署环节
六款模型分别为Helios、SimLab、ActiWorld、EvoHIL、AnuVerse-0.5和Nexus;安努称富临精工绵阳工厂料箱搬运场景已有批量订单在跑,单班回本周期12-18个月。
京东发布JoyAI-Echo WM世界模型,WBench Navigation评测81.6分排名第一
京东在2026全球科技探索者大会上公布算力、数据、模型三大AI基建进展:与摩尔线程等打造国产万卡集群并规划十万卡集群,JoyAI-Echo WM在交互式世界模型评测WBench Navigation中获81.6分排名第一。
OpenAI推出Agents API,用Codex harness托管云端智能体
OpenAI宣布Agents API,一项由Codex harness驱动的托管服务,用于构建和上线云端智能体,支持编排、长时运行会话和工具调用。
OpenAI在API中推出GPT-Live-1,支持全双工语音对话
OpenAI称该模型带来自然、全双工语音对话,并具备更强的指令遵循能力、自定义音色和电话(telephony)支持。
Cohere发布North Small Translate:218B总参数MoE翻译模型,WMT26平均得分 83.6
该模型以CC BY-NC 4.0许可开放权重,支持 50 多种语言,最低可在单张B200或两张H100上以W4A4量化运行。

Mistral与Cloudera合作,将主权AI引入企业本地数据
双方将把Mistral模型集成到Cloudera混合数据平台,支持私有云、本地和完全气隙环境中的推理与定制模型训练,企业可保留数据和模型所有权。
DeepSeek发布V4.1-Flash:552B MoE,输入仅激活 8B,KV缓存降至上代 1/4 HBM
DeepSeek上线新架构家族最小模型V4.1-Flash,采用因果编码器—解码器与非对称架构,输入 8B、输出 16B激活参数;官方称多项测试中其性能、成本、速度与总运行时间均超过V4-Pro,并将逐步停用V4-Pro。

Suno发布v6音乐模型:首次采用唱片行业授权数据训练
Suno v6包含三个子模型,免费版v6-mini主打快速生成;新模型显著提升对音乐类型的理解,但仍无法生成“自然瑕疵”的不完美音乐。

谷歌与NASA JPL发布AI模型MAPL-EMIT,从太空追踪全球甲烷排放
新模型基于NASA EMIT仪器数据,能比人类专家多探测50%的甲烷羽流,并识别出全球25个最大排放垃圾填埋场中的24个。

保罗·克里斯蒂亚诺加入OpenAI基金会董事会及安全与安保委员会
OpenAI于本周三宣布,AI对齐领域知名研究者保罗·克里斯蒂亚诺已加入其基金会董事会,并将参与安全与安保委员会的工作。
谷歌发布Gemini处理行政事务的四种方法:四成政务对话发生在非工作时间
谷歌AI官方博客介绍Gemini如何帮助用户填写表格、参与公民生活、查找政府机构和申请社会服务,并引用ATLAS研究称近半数相关对话发生在政府办公室关闭的时段。

IBM发布Granite Time Series PatchTST-FM-r2时序基础模型,宽松许可下GIFT-Eval零样本表现最佳
约3.85亿参数,支持最长8192步上下文与99分位数概率预测;在GIFT-Eval可复现零样本模型中综合排名第二,许可模型排名第一。
Suno发布v6音乐模型:与华纳、BMG及Believe合作,可文本指令局部修改歌曲
Suno推出v6系列三款音乐模型,停用旧版;旗舰版与实验版面向订阅用户,免费版v6-mini对所有用户开放。

OpenAI发布GPT-6 Astra:面向企业的高级推理与计算机操作模型
OpenAI宣布推出GPT-6 Astra,称其为公司迄今最强大的商用模型,具备高级推理、计算机使用及更强的写作与设计判断能力。
蚂蚁百灵发布首个金融增强模型Ling-3.0-flash-Fin,已开源
该模型瞄准真实投研工作流,覆盖信息检索、研究推理、估值建模、研报撰写等环节,并同步开放金融搜索Agent评测基准FinFIRST。
SkyProduction限免活动第二期:MiniMax H3会员限时无限用,9月9日至14日
SkyProduction推出MiniMax H3模型限时免费活动,9月9日会员可无限使用,10日至14日新会员或充值积分可获赠限免天数,覆盖中国大陆版。
Recraft Studio上线三款视频生成模型:Gemini Omni Flash 1.1、MiniMax H3 Turbo、阿里Wan 3.0
Recraft公告称,三款新模型已在Recraft Studio开放使用,分别面向多模态参考输入、快速迭代和单次长视频生成。

Mistral用AI智能体帮助欧洲能源运营商将4万行Fortran 77代码迁移至C++
Mistral公司使用AI智能体帮助一家欧洲能源运营商将4万行Fortran 77代码迁移到C++,并分享了在迁移过程中总结的经验教训。
OpenAI图像模型ChatGPT Images 2.5上线Recraft Studio
Recraft宣布其Studio现已集成OpenAI最快的图像生成与编辑模型ChatGPT Images 2.5。
.png&w=560&q=78)