“AI 完成了一项科学发现”是一句信息密度很低的话。它没有告诉我们:问题是谁选的,假设是否接地,实验在哪里发生,失败是否被保留,结果由谁解释,又有没有独立团队复现。
比较 Co-Scientist、AI Scientist-v2、Virtual Lab、Robin 与 SAMPLE 后,我们形成了一套初始验证框架。它是 AI4SBlog 用来阅读公开证据的分析工具,不是科学共同体已经采用的标准或 benchmark;它不为系统打总分,而是要求每个公开主张说明自己过了哪道门、停在哪里。
门 0:问题价值与目标归属
先问研究问题从哪里来。Human 给出疾病、靶点和成功指标,与 Agent 从开放文献中自主识别值得研究的问题,不是同一种能力。更重要的是,目标是否代表真正的科学价值,还是一个容易优化但会误导判断的代理指标。
这一门不能被后续高分补偿。一个系统可以完美完成错误目标。
门 1:主张与证据接地
假设中的关键事实能否追溯到论文、数据库和原始数据?系统是否区分直接证据、作者解释和自己的推断?面对冲突来源时,它如何降级结论?
Co-Scientist用专门 Agent 进行反思和排序,说明内部反驳可以被结构化;但多 Agent 互相同意仍不是外部证据。接地的最低要求,是他人能定位每个关键主张,而不是只看到一段流畅综合。
门 2:可证伪的计算测试
一个想法需要变成带失败条件的测试。对于机器学习研究,这可能是预先定义的数据、基线和统计指标;对于分子与材料研究,则可能是模拟、结构预测或候选排序。
AI Scientist-v2展示了从想法到代码、实验与论文的自动化,并有论文通过 workshop 评审。这证明系统可以形成可评议制品,但评审接收主要检验研究表达和计算结果,不等于自然机制已在物理世界得到确认。
门 3:可执行的实验设计
实验方案要包含样本、对照、测量指标、停止条件与失败解释,并能被现实实验者执行。Virtual Lab与 Robin的重要进展正在这里:Agent 形成的候选和策略进入了 Human 可执行的实验循环。
Robin 论文已经披露了多处具体介入:Human 审核候选排序、提供实验 protocol、替换实际可获得的材料和细胞模型、指定分析方式、执行物理实验并决定循环停止。仍待补足的是这些动作的完整人时、失败轨迹和对结果的边际贡献。只用一句 Human-in-the-loop,会隐藏决定系统是否真正可用的工作。
门 4:物理世界验证
样本、仪器或真实环境是否产生了支持结果?实验是否包含适当对照,数据与代码是否公开,失败结果是否被选择性隐藏?
Virtual Lab 报告了 92 个纳米抗体候选的实验测试与功能性结合结果;SAMPLE把学习 Agent 直接连接机器人实验,找到热稳定性至少提高 12°C 的酶。这些是比文本和模拟更强的证据。
物理验证也让成本变得可见。SAMPLE 的 20 轮实际运行接近六个月,设备停机和样品运输都进入时间账本。真正的自治不是演示中链条不断,而是失败后能恢复、成本可核算、异常不被删掉。
门 5:独立复现与外推
最后问:与开发团队无关的实验室能否依据公开方法重复结果?换一种样本、仪器或问题,结论是否仍成立?
同行评审很重要,但不能代替独立复现。一次成功实验支持“在这个设置中得到这个结果”,不自动支持“系统能稳定完成此类发现”。跨过这一门,需要时间、公开方法、失败记录和共同体参与。
两条不能被阶梯遮住的横轴
第一条是 Human 工作与责任。每一门都应记录谁设题、谁修订、谁执行、谁解释、谁批准公开,以及伦理和安全责任归谁。自治是分阶段的,责任不能因为 Agent 参与而消失。
第二条是 成本与失败。需要同时记录模型调用、数据获取、仪器、人时、失败次数与恢复路径。只展示成功路径,会把研究系统写成营销漏斗。
更诚实的主张模板
与其写“AI 发现了 X”,不如写:
在 Human 定义的问题与指标下,Agent 完成了文献整合、候选生成和实验设计;Human 执行的实验在指定设置中得到 Y;结果尚未被独立复现。
这句话没有削弱进展,反而让进展可以被比较、质疑和继续推进。AI Scientist 的未来不需要靠模糊语言放大;真正跨过的每一道门,本身已经足够重要。
事实、推断与未知
- 事实:代表性系统已经在上述不同门槛上提供同行评议论文、公开代码、实验结果或外部评审证据。
- 推断:最可靠的比较单位是“研究阶段 × 证据等级 × Human 介入”,不是一个统一自治分数。
- 未知:独立复现、跨任务泛化、隐藏 Human 工时和统一成本指标仍不足以支持系统级强排名。