2026 年 8 月 5 日,Jeff Dean、Sanjay Ghemawat、Quoc Le 和 Oriol Vinyals 宣布创办 Discovery Loop。
这是一支很难不让技术圈多看一眼的团队。四个人共同经历了 Google 从大规模计算基础设施到深度学习、再到基础模型的多轮技术迁移。现在,他们选择离开已经拥有海量算力、数据和人才的成熟组织,从零开始做一家新公司。
但如果只把它写成“Google 传奇工程师创业”,我们会错过更重要的问题。
Discovery Loop 目前还没有公开 benchmark、技术论文或科学发现结果。它公开的是一套路线:用前沿模型和大规模计算基础设施,自动完成“提出实验—运行实验—读取评价—继续迭代”的完整循环;先从机器学习研究与工程开始,把自己作为第一个客户,再扩展到具有可测量结果的科学和工程问题。
这不是一个已经被验证的成功故事。它更像一个来自顶级系统建造者的领先信号:AI 的下一阶段,竞争可能不再只是谁能生成更好的答案,而是谁能让机器进入一个持续、可执行、可评价的发现循环。
Jeff Dean 一直在做同一类事
Jeff Dean 的履历很长,但理解 Discovery Loop 不需要把它全部复述一遍。只需要看到一条主线:他长期在把原本只有少数专家能驾驭的复杂系统,封装成更多人可以调用的基础设施。
2004 年,他与 Sanjay Ghemawat 发表 MapReduce 论文。程序员只需要表达 map 和 reduce,运行时负责把任务分散到大量机器上,并处理数据分区、调度、机器故障和通信。它的关键不只是“算得更快”,而是把分布式计算中最麻烦的复杂性移出了普通程序员的工作界面。
两年后的 Bigtable,继续处理跨数千台服务器、PB 级数据的存储问题。2015 年,Jeff Dean 与 Rajat Monga 发布 TensorFlow,把原本紧耦合于 Google 内部基础设施的机器学习系统,改造成更通用、可移植、可公开使用的框架。
MapReduce、Bigtable 和 TensorFlow 当然都不是 Jeff Dean 一个人的作品。真正值得注意的是他反复参与的那种工程动作:找到一个限制规模化的复杂环节,把它重新设计成系统。
沿着这条线看,Discovery Loop 可以被理解为一次“第三次抽象”——这是本文的判断,不是 Jeff Dean 的原话:
规模化计算
↓
规模化机器学习
↓
规模化发现
过去被隐藏的是机器集群的复杂性;这一次,他们试图隐藏并自动化实验迭代的复杂性。
公司名字里更重要的是 Loop
Discovery Loop 官方页面把科研瓶颈描述为一系列缓慢、顺序执行、依赖人工的实验循环:提出实验,实施和运行,检查结果,再据此修改下一轮。
公司的设想,是让 AI 系统快速提出、运行并从评价中学习,同时并行执行成千上万次实验。长期目标非常大,覆盖药物、能源、水资源、网络安全和科学工具等工程挑战。
但这些现在都只是目标。真正透露其进入策略的,是两个不那么宏大的选择:
- 第一个领域是机器学习研究与工程;
- Discovery Loop 自己会成为第一个客户。
Jeff Dean 在创办说明中给出的理由很直接:自己使用可以产生快速反馈。团队将先建设基础设施、模型和系统,用它们自动进行大规模机器学习实验。
这意味着 Discovery Loop 没有从最开放、最昂贵的湿实验科学起步。它先站在科学与软件的交界处:研究对象仍然是模型和算法,但行动环境已经数字化,实验可以复制,指标可以计算,失败可以重跑,结果甚至可以反过来改善研究系统自身。
ML-first 不是一个产品范围说明。它揭示了 AI 原生系统最可能跨过临界点的地方。
软件开发为什么先跨过去
今天的软件 Agent 已经不只是补全下一行代码。Codex 的公开说明展示了一套典型环境:Agent 获得代码仓库,在隔离环境中读写文件、运行命令、调用测试、lint 和类型检查,再根据输出继续修改,并留下终端日志和测试结果供人复核。
这套系统能够形成闭环,不只是因为模型会写代码,而是软件世界已经为它准备好了四个条件:
- 世界可读取:代码、依赖、文档、日志和版本历史大多已经数字化;
- 行动可执行:Agent 可以直接编辑文件和运行程序,不必把建议交给另一个执行者;
- 反馈够快:编译、测试和性能测量通常在秒、分钟或小时内返回;
- 失败可回滚:版本控制、沙箱和持续集成降低了试错的不可逆成本。
因此,软件 Agent 的基本单位不再是“一次回答”,而可以是一段持续运行的工作:理解目标,修改系统,观察结果,再继续推进。
这不意味着软件评价拥有完美真值。测试可能漏掉真实需求,benchmark 可能被针对性优化,代码能运行也不等于安全、可维护或对用户有价值。软件只是把行动和反馈放进了同一个机器可操作的环境,评价环比多数现实任务更紧。
科学也有 Loop,但没有统一的编译器
科学研究表面上与软件开发非常相似:
软件:目标 → 实现 → 运行 → 测试 → 修改
科学:问题 → 假设 → 实验 → 观察 → 修正
区别从“实验”两个字开始。
在生命科学里,模型提出的下一个候选,可能需要合成、培养、检测和解释;在材料研究里,候选需要被制备和表征;在工程现场,结果还会受到设备、环境和操作条件影响。Agent 给出实验方案,不等于实验已经发生。
Aviv Regev 描述的 Lab in the Loop,就是让实验或临床数据训练模型,再由模型预测下一组实验,然后持续迭代。这个方向的关键不是多一个聊天界面,而是让实验数据和下一次行动真正接起来。
已经存在的闭环系统也说明了物理世界的时间尺度。SAMPLE 自驱动实验室把学习 Agent 连接到机器人蛋白质工程实验,但 20 轮运行仍接近六个月,设备停机和样品运输都会进入循环。模型推理可以按秒计算,真实实验不会因此自动变成软件测试。
而且,科学没有一套统一的 tests passed。
一次实验得到支持性结果,可能仍然受测量误差、样本选择、对照设计和偶然性影响。它还需要回答结果是否新颖、能否复现、是否真的支持所声称的机制。正如我们在“AI 完成科学发现”的验证阶梯里强调的,单次评价成功不自动等于 discovery。
临界点不是模型智商,而是闭环条件
软件开发与科学研究的差距,可以压缩成三个问题。
一、行动接口
Agent 能否直接作用于研究对象?
对代码而言,答案通常是仓库、终端和云环境。对科学而言,可能是模拟器、数据库、实验仪器、自动化工作站,也可能仍然是一名收到实验建议的人类研究员。
只会生成方案的系统是助手;能够执行、观察并继续行动的系统,才真正进入循环。
二、评价可信度
系统能否知道一次行动是否更接近真实目标?
“有指标”不等于“指标可信”。如果评价函数只奖励容易测量的代理变量,大规模并行只会让系统更快找到指标漏洞。越能自动运行,evaluator 的错误就越会被放大。
三、迭代经济性
完成一轮行动和评价,需要多少时间、资金、人力与不可逆资源?
当一轮循环从数月降到数小时,并且可以安全并行,Agent 才可能改变研究的生产函数。反过来,如果每个候选都需要昂贵样品、稀缺设备和长周期验证,再聪明的模型也只能加速闭环中的一部分。
所以,AI 原生生产真正的临界点可以写成:
机器可执行的行动
×
可信、可计算的评价
×
可承受的迭代成本
三者同时成立,Loop 才会从演示变成生产系统。
科学不会在同一天变成 Agent 原生
“科学研究”不是一个统一场景。它会按照闭环条件的成熟度分层推进。
最先发生的,是计算原生研究。机器学习、算法搜索、部分芯片设计和仿真驱动工程,大部分行动发生在计算环境,评价速度快、实验容易复制。Discovery Loop 从 ML 开始,正是在选择这一端。
随后是计算—实验混合领域。材料、化学和部分生物研发已经拥有高通量设备、标准化 assay 或机器人实验,但模型、实验、数据和质量控制之间仍需要大量接口。这里最重要的进展不会只是更强模型,而是让下一批实验可以可靠落地并把结果无损带回系统。
最远的是开放性科学问题。当问题本身是否值得研究、什么算解释、什么证据足够,都无法被预先写成清楚的评价函数时,人类科学家的设题、判断和共同体审查仍处在循环中心。Agent 可以扩大搜索和执行,但不能用一次内部打分替代知识成立。
这也意味着,AI 原生科学的前景不应该被写成一个统一倒计时。不同学科、不同研究阶段,会在不同时间跨过不同的门。
真正的机会可能不在“科研聊天机器人”
如果这个判断成立,价值不会只停留在模型层。
第一类机会是 evaluator。谁能定义与真实科学价值一致、又能被机器读取的评价,谁就在决定循环优化的方向。可靠 assay、强基线、失败条件、跨实验室复现和指标审计,都会从研究配套变成核心基础设施。
第二类机会是 现实世界接口。实验室设备 API、机器人工作站、仿真与湿实验编排、样品和仪器状态管理,看起来不像最闪耀的 AI 产品,却决定 Agent 能不能从“建议下一步”走到“执行下一步”。
第三类机会是 研究轨迹与数据资产。自动化系统需要的不只是成功论文,还包括参数、负结果、失败原因、环境条件和恢复路径。谁拥有高质量、连续产生的反馈数据,谁就拥有比一次性语料更难复制的上下文。
第四类机会是 垂直闭环公司。它们不出售一个通用科研助手,而是围绕某一类高价值问题,把模型、领域知识、实验能力、评价标准和交付责任放进同一套系统。客户购买的不是 token,也不是研究工时,而是经过定义和验证的结果。
这里会发生一次价值重心迁移:当通用模型能力逐渐扩散,稀缺的部分将变成谁能控制实验接口、获得独特反馈、维护可信 evaluator,并承担循环最终输出的责任。
Discovery Loop 现在证明了什么
严格说,它还没有证明自动化科学发现可行。
截至 2026 年 8 月 21 日,我们找到的公开官方材料主要是公司使命、创始团队、进入顺序与招聘信息;尚未看到系统架构、benchmark、成本、人类投入、失败率或发现结果。公司所说的“数千个并行实验”和“解决具有可测量结果的学习循环”都应被视为待验证目标。
但它已经提供了一个值得认真对待的信号。
过去二十多年里,一批顶级工程师把计算、数据和机器学习变成了可规模调用的基础设施。现在,其中几位最具代表性的系统建造者,开始把“发现过程”本身视为下一个可以重新架构的系统。
软件开发让我们第一次大规模看见:当 Agent 拥有完整环境、执行权限和即时反馈,它可以从生成内容走向经营任务。Discovery Loop 的赌注,是科学与工程中越来越多的领域也能获得这样的环境。
这场变化真正的分界线,不是 AI 会不会提出一个聪明假设。
而是它提出之后,能否让世界给出一个足够快、足够便宜、也足够可信的回答。
事实、推断与未知
- 事实:Discovery Loop 公开宣布将自动化实验循环,初始聚焦机器学习研究与工程,并把自己作为第一个客户;公司尚未在我们检索的官方公开材料中提供性能或发现结果。软件工程 Agent 已能在配置好的代码环境中读写文件、运行命令和测试;部分科学团队也已建设模型—实验闭环。
- 推断:Jeff Dean 的职业轨迹可以被理解为从规模化计算、规模化机器学习走向规模化发现;AI 原生系统的临界点取决于行动接口、评价可信度和迭代经济性,而不是单一模型能力。
- 未知:Discovery Loop 的 evaluator、成本、Human 工时、失败与复现机制尚未公开;从 ML 研究扩展到物理实验后,数据权属、仪器接口、安全、监管和跨实验室泛化将如何解决,也仍没有答案。