Vinyals离职创业Discovery Loop:AI自我改进会到来,但不会引爆智能爆炸
谷歌DeepMind前研究副总裁Oriol Vinyals在Agentic AI Summit 2026上表示,递归自我改进必然到来但过程缓慢,真正的瓶颈是“提出想法”和“判断结果”。他已与Jeff Dean、Sanjay Ghemawat、Quoc Le共同创办Discovery Loop,计划先自动化AI研究本身。
AI解读:Vinyals的判断可以拆成两半:AI会加速科研和工程任务,速度提升可能达到十倍以上;但他不认为这会演变成突然自我加速的智能爆炸。这个区别很重要——它意味着即便按最激进的自动化路径走,短期内仍是渐进式投入,而不是一夜之间的能力跳变。
他把障碍落在两个具体环节:提出值得做的想法,以及判断一次改动到底有没有用。中间的写代码和做实验,AI已经能覆盖,但两头仍缺。这也解释了为什么现有的SWE-Bench Pro、ML-Bench这类排行榜分数刷得再高,也不能直接证明系统在自我改进,因为这些测试恰好只测了中间两步。
对做AI研究的人和团队来说,这条新闻的实际含义是:未来一段时间内,工具会更快,但“研究品味”和评估方法仍是稀缺资源。Vinyals说人类与机器会先一起提出假设,说明早期产品的定位更接近科研协作者,而不是替代研究员。
谨慎的地方在于,他提到的直接衡量自我改进的评测“才刚刚出现”,成本高,每次评估需要智能体工作数小时,而且任务与最终目标相去甚远。他举的例子是智能体在优化俄罗斯方块,而真正的目标是自动化整个研究实验室——这两者之间的距离,就是当前评测的局限所在。
谷歌DeepMind前研究副总裁Oriol Vinyals认为,AI系统的递归自我改进(RSI)不可避免,但过程缓慢,不会引发智能爆炸。他在离开谷歌数天后,于Agentic AI Summit 2026上发表上述观点。
Vinyals曾参与AlphaStar、AlphaCode和Gemini等项目。他表示,AI能将某些研究和工程任务加速十倍甚至更多,但突然自我加速的智能爆炸不太可能出现。
他同时宣布正在创办一家创业公司,以解决阻碍自我改进的两个最大瓶颈。
“自我改进”到底改什么:从权重、数据到评估指标
Vinyals提出的第一个问题是:到底什么在改进?一个AI系统有很多可动部件,它可以调整神经网络权重、更换训练数据、重做训练方法,也可以修改每次查询时收到的指令,或者重建数据库访问、代码执行等外部工具。同样,它还可以改变用来追踪自身进度的指标。
他说,每一种改动都带来不同的技术和监管挑战。一个试图自我改进的AI系统需要:一个有前景的想法、实现它的代码、测试它的实验,以及可靠判断改动是否真的有帮助的方法。
Vinyals认为,AI已经在中间两步取得进展,但想法生成和评估仍是AI系统欠缺的地方。找出想法和判断结果,是当前最大的两个瓶颈。
- 可调整对象:神经网络权重、训练数据、训练方法、每次查询的指令、数据库访问和代码执行等外部工具、以及自身进度指标
- 自我改进所需四步:想法、实现代码、测试实验、判断改动是否有效
- 现状:AI在写代码和做实验两步已有进展,想法生成和评估仍不足
现有基准测的是中间两步,直接衡量自我改进的评测才刚出现
如今实验室大多通过SWE-Bench Pro、ML-Bench等能力基准来间接衡量自我改进,看着排行榜上升,希望自我改进作为副作用出现。Vinyals指出,这些测试便宜且定义明确,但它们主要覆盖实现和实验,也就是已经能跑通的步骤。
除此之外,过拟合和“钻空子”(scheming)是真实存在的问题。Vinyals根据多年构建游戏智能体的经验知道,系统会以意外方式利用目标,击败评分系统而不是真正玩游戏。
更有意义的基准应该直接测试自我改进。最初的这类评测开始出现:给系统一个指标和计算预算,研究人员测量它改进了自己多少。这种方法昂贵,因为每次评估都需要一个智能体在远离最终目标的任务上工作数小时。Vinyals举例说,智能体在优化俄罗斯方块,而真正的目标是自动化整个研究实验室并构建世界上最好的模型。
- 现有基准(SWE-Bench Pro、ML-Bench):便宜、定义明确,但只覆盖实现和实验
- 问题:过拟合,以及系统击败评分系统而非真正完成任务
- 新评测思路:给系统一个指标和计算预算,测量它自我改进了多少;每次评估需智能体工作数小时、成本高,任务与最终目标距离远
瓶颈一:AI还不会“研究品味”,人类评审也不擅长识别好想法
想法生成同样不成熟。好的研究需要一种直觉,判断哪些想法值得pursue,Vinyals称之为“研究品味”(research taste)。在LLM训练中,还没有人真正研究过如何教这种品味。
他预计,未来的评估不仅会测量系统实现了多少改进,还会测量它是如何做到的。对想法而言,这意味着要采用与会议审稿人相同的标准:原创性、优雅性、效率,以及一项技术能否经受时间考验。
其中一部分可以写成规则,通过奖励模型检查,再用强化学习训练,但Vinyals说这非常困难,需要更多时间。人类评审流程也很昂贵,而且在识别强想法方面并不特别擅长。
- “研究品味”在LLM训练中缺乏研究
- 未来评估会同时看改进幅度和改进路径
- 想法评价标准:原创性、优雅性、效率、能否经受时间考验
- 部分标准可转为规则并用奖励模型加强化学习训练,但难度高、耗时长
- 人类评审昂贵且不擅长识别强想法
物理限制与AlphaGo的未知上限
Vinyals还指出硬性物理约束。芯片的计算速度不能超过其设计和光速允许的范围,所以即使AI设计出更好的算法,它仍受限于运行它的硬件。
在某些领域,人类表现可能已经接近上限。Vinyals说,比起完美的围棋比赛,AlphaGo到底有多好?没有人知道。
- 芯片速度受设计和光速限制,更好的算法仍受硬件约束
- 人类表现在某些领域可能已接近上限;AlphaGo与完美围棋的差距无人知晓
Discovery Loop:先自动化AI研究,人类与机器共同提出假设
Vinyals正将上述分析付诸实践,与Jeff Dean(CEO)、谷歌高级研究员Sanjay Ghemawat、谷歌大脑联合创始人Quoc Le共同创办Discovery Loop。该公司希望自动化完整的科学循环,从形成假设、运行实验到评估结果,包括AI目前仍欠缺的那两步。
四位创始人中有三位位列被引用最多的AI研究员之列,Ghemawat是分布式系统领域被引用最多的人之一。团队计划先自动化AI研究,把Discovery Loop作为自己的第一个客户,正如Dean所说。其他科学领域将在之后跟进。
在公司网站上,创始人描述了一个未来:“少数人可以比今天庞大的科学家和工程师团队更快、更高质量地开展科学研究和工程任务。”Vinyals承认想法生成仍是最难的部分,因此在早期阶段,人类和机器将共同提出假设。
- Discovery Loop创始人:Oriol Vinyals、Jeff Dean(CEO)、Sanjay Ghemawat、Quoc Le
- 目标:自动化完整科学循环——形成假设、运行实验、评估结果,包括AI缺的想法生成与评估两步
- 首位客户是自己:先自动化AI研究,其他科学领域后跟进
- 创始人团队背景:三位位列被引用最多的AI研究员,Ghemawat在分布式系统领域引用极高
- 早期阶段人类与机器共同提出假设