AI Scientist 的证据边界
从生成一个看似新颖的假设,到完成一次可以被共同体验证的科学发现,AI Scientist 中间究竟跨过了哪些门?
Current thesis
当前判断
AI Scientist 应按研究阶段与证据等级描述,而不是压缩成一个自治分数。强主张至少要说明问题与目标归属、证据接地、可证伪计算测试、可执行实验、物理验证和独立复现;Human 工作与责任、总成本和失败记录是贯穿各阶段的横轴。
Facts
已经有证据支持
- Co-Scientist 使用多个专门 Agent 生成、反思、排序和演化假设;同行评议论文与官方材料报告了若干生命科学问题中的实验跟进,但并不等于跨领域自治发现已经成立。
- AI Scientist-v2 报告了一篇完全由系统生成并通过主要机器学习会议 workshop 评审的论文;作者同时把 workshop 与 conference 标准、稳定质量和突破性假设列为限制。
- Virtual Lab 由一个 AI PI 和多个科学家 Agent 协作,在 Human 高层反馈下形成纳米抗体设计管线,设计 92 个候选,并由真实实验报告若干具有功能性结合表现的结果。
- Robin 的 2026 Nature 论文把文献检索、假设、实验策略和数据分析编排为连续工作流,并报告了 lab-in-the-loop 结果;论文也披露 Human 审核候选排序、提供实验 protocol、调整材料和细胞模型、指定分析方式、执行物理实验并决定何时结束循环。它是开发团队的同行评议证据,不是独立复现。
- SAMPLE 把学习 Agent 直接连接自动化蛋白质工程实验,形成 design-test-learn 闭环;它证明特定实验空间中的自治优化可行,但不等同于通用 LLM 科学家。
- Stanford HAI 的公开讨论把 Human 作用集中在选择重要问题、处理数据与代理指标偏差、解释结果和维持共同体验证;其会议笔记还记录了“更高质量论文在早期假设与设计阶段获得更多 Human 输入”的观察。
- Google DeepMind 2026 年政策报告把 AI 生成科学想法后的验证能力描述为新的系统瓶颈,并把实验、数据、同行评议与科学基础设施列为需要共同扩容的环节。
Inferences
目前的推断
- “自治程度”不是一个单一百分比;同一系统可以在文献、分析或写作阶段高度自治,却仍在问题选择、实验执行和结论强度上依赖 Human。
- 当假设和论文生成成本下降,稀缺资源会向高质量实验、失败记录、复现与可信同行判断迁移。
- “AI 完成发现”应被拆成一条可审计的证据链,而不是由系统名称、论文流畅度或一次成功结果直接决定。
Unknowns
仍然不知道
- 代表性 AI Scientist 结果有多少已经被与开发团队无关的实验室独立复现?解决标准:找到独立团队公开的方法、数据与结果,并能把它与原系统的具体主张逐项对应。
- 不同系统在同类开放研究任务上的失败率、成本和有效发现率能否直接比较?解决标准:出现共享任务、统一预算、预注册指标和公开失败结果的独立比较研究。
Evidence lens
我们如何检查“发现”主张
问题与目标
研究问题、优化目标和成功指标由谁提出,目标是否代表真正的科学价值?
证据接地
系统如何读取文献、数据和工具,错误主张能否被定位并排除?
新颖性
新颖是模型内部未见、文献检索未见,还是领域共同体此前没有提出?
可执行验证
输出是否转化为具有对照、指标和失败条件的实验或计算测试?
物理验证
结果是否接触真实样本、仪器或环境,而不只停留在模型和基准中?
独立复现
独立团队能否依据公开方法重复结果,并把结论外推到原始设置之外?
Open questions
下一步不是更多内容,而是解决这些未知
- 已解决
初始六段证据阶梯是否遗漏了“问题价值”和“共同体验证”两个不能被线性排序的维度?
将问题价值与目标归属设为门 0,把独立复现与共同体验证设为门 5,并把 Human 责任、成本与失败记录作为横轴,而非用单一阶梯分数遮蔽它们。 - 开放
在无法穷尽未公开知识时,系统应如何诚实表述“新颖假设”?
- 开放
当 Agent 负责大部分工作流时,哪一个 Human 或机构应对结论强度、实验伦理和公开主张负责?
Mission outputs
阶段性文章
一次「AI 完成科学发现」的主张,至少要过哪几道门
提出一套可审计的 AI Scientist 验证框架,把问题价值、证据接地、计算测试、物理实验、独立复现和责任归属分开检查。
当假设变得便宜,人类判断会变得更贵吗?
精读 Stanford HAI 关于 AI for Science 的公开讨论:当系统可以大量生成假设,问题价值、实验验证、数据偏差与共同体判断反而成为稀缺环节。
从 Co-Scientist 到 Virtual Lab:AI Scientist 究竟跨过了哪一步
把五类被称作 AI Scientist 的系统放在同一张证据地图上,区分假设生成、论文形成、实验闭环、物理验证与独立复现。
Change log
判断如何变化
- Mark 批准 LM-001,Mission 进入本地提案状态。
第一版把 AI Scientist 视为分阶段能力组合,并把验证能力而非想法数量设为主要瓶颈;该判断仍待逐项来源核验。
- Mark 批准第一阶段公开发布,Mission 进入 active,并公开第一篇证据地图。
五类系统的比较已完成来源审计;当前判断仍把独立复现、隐藏 Human 工作与统一失败率列为未知,不因公开而升级结论强度。
- Mark 批准第二阶段公开讨论精读,Mission 增加“生成变便宜后,验证与分阶段 Human 判断更显稀缺”的证据变化。
Stanford HAI 的会议总结与 DeepMind 的政策报告支持把问题选择、数据偏差、实验资源和共同体验证视为显性瓶颈;这仍是机构讨论与阶段性推断,不构成“Human 必然更重要”的普遍因果结论。
- Mark 批准最终深研与 Mission 完成;六道门经五类系统测试后保留为可审计分析框架。
初版线性阶梯被修订为六道门加两条横轴:问题价值进入门 0,共同体验证进入门 5,Human 责任与成本失败贯穿各阶段。独立复现、跨任务泛化和隐藏 Human 工时仍保留为未知。