“AI Scientist”已经被用来描述几种很不一样的系统:有的生成和筛选假设,有的可以写出一篇完整论文,有的把实验方案交给 Human 执行,还有的直接连接机器人实验室。如果只看名称,它们仿佛都在走向同一个终点;如果看证据,跨过的却是完全不同的门。

这篇前沿简报不做排行榜,只问一个更朴素的问题:每个系统究竟把哪一步从“可以想象”推进到了“已经验证”?

Co-Scientist:跨过假设组织,而非自治发现

Google DeepMind 的 Co-Scientist 把生成、反思、排序、演化和汇总交给不同 Agent,再由 supervisor 围绕研究目标组织循环。Nature 论文还报告了特定生命科学问题中的实验跟进。

它跨过的关键一步,是把“模型给一个答案”变成“系统形成、批评和选择一组候选假设”。实验结果提高了证据等级,但问题选择、实验条件、结果解释与结论责任仍由研究团队承担。因此它支持的是“Agent 能参与可检验假设的形成”,不是“通用自治科学家已经成立”。

AI Scientist-v2:跨过论文形成与一次评审门槛

AI Scientist-v2 报告了一篇由系统生成、通过机器学习会议 workshop 评审的论文。系统展示了从想法、实验代码、结果分析到写作的长链条自动化。

这里跨过的是“形成可被外部评审的研究制品”。但 workshop 接收不等于主要会议的完整门槛,更不等于物理世界中的新发现。团队自己也把稳定质量、突破性假设和更高评审标准列为限制。把“论文通过一次评审”写成“AI 独立完成科学发现”,会把制品验证和自然证据混为一谈。

Virtual Lab 与 Robin:跨过可执行实验和 lab-in-the-loop

Virtual Lab 的 Nature 论文描述了一个 AI PI 与多个科学家 Agent 组成的团队,在 Human 高层反馈下设计 92 个纳米抗体候选,再由真实实验测试。论文报告了功能性结合结果,其中两个候选相对原设计表现出更好的结合。

Robin 的 2026 Nature 论文则把文献检索、假设、实验策略、数据分析和后续实验连接成连续工作流。它也把 Human 工作写得更具体:研究者审核候选排序、提供实验 protocol、因材料可得性调整 beads 与细胞模型、指定分析方式、执行物理实验,并在候选达到满意标准时结束循环。团队把关键智力步骤归因于 Robin;这是开发团队经过同行评议发表的主张,仍不等于独立共同体已经复现。

这两类系统跨过了重要一步:Agent 输出不再停留在文本,而是进入了可执行实验与反馈循环。当前所引来源尚未建立独立团队复现;是否已有独立实验室完成逐项复现,以及完整 Human 工作量和跨任务稳定性,仍是待核对的未知。

SAMPLE:跨过机器人闭环,但范围非常具体

SAMPLE把学习 Agent 连接自动化蛋白质工程实验,四个 Agent 在不到 2% 的序列空间中找到热稳定性至少提高 12°C 的酶。它是更接近 design-test-learn 物理闭环的证据。

但它优化的是边界清楚的序列—功能问题,并不是开放式 LLM 科学家。论文还给出一个容易被演示视频遮蔽的事实:20 轮真实运行接近六个月,其中包括设备停机和样品运输。实验吞吐、失败恢复和现实物流仍是系统能力的一部分。

先说清“在哪一段自治”

比较这些系统后,一个更可靠的表达不是“它有多自治”,而是:问题由谁提出,文献和数据怎样接地,候选怎样被反驳,实验由谁执行,结果在哪里接触物理世界,是否出现独立复现,以及失败成本是否公开。

沿着这条证据链看,AI Scientist 已经跨过若干真实门槛;它们并不在同一层,也没有共同跨过最后一层。眼下最值得警惕的,不是系统进步得太快,而是我们的语言比证据快得更多。

事实、推断与未知

  • 事实:上述系统分别报告了假设选择、论文生成、可执行实验、Human 执行的物理验证或机器人闭环中的一部分能力。
  • 推断:自治应按研究阶段描述;“形成论文”“得到一次实验结果”和“完成可复现发现”是不同主张。
  • 未知:代表性结果的独立复现率、完整 Human 工时、统一预算下的失败率和跨任务表现仍缺少可比数据。