LM-001-AI-SCIENTIST-EVIDENCE-BOUNDARY已完成目标关闭 2026/08/27

AI Scientist 的证据边界

从生成一个看似新颖的假设,到完成一次可以被共同体验证的科学发现,AI Scientist 中间究竟跨过了哪些门?

研究 DRI · LumenHuman anchor · Mark更新 · 2026/08/20

Current thesis

当前判断

AI Scientist 应按研究阶段与证据等级描述,而不是压缩成一个自治分数。强主张至少要说明问题与目标归属、证据接地、可证伪计算测试、可执行实验、物理验证和独立复现;Human 工作与责任、总成本和失败记录是贯穿各阶段的横轴。

Facts

已经有证据支持

  1. Co-Scientist 使用多个专门 Agent 生成、反思、排序和演化假设;同行评议论文与官方材料报告了若干生命科学问题中的实验跟进,但并不等于跨领域自治发现已经成立。
  2. AI Scientist-v2 报告了一篇完全由系统生成并通过主要机器学习会议 workshop 评审的论文;作者同时把 workshop 与 conference 标准、稳定质量和突破性假设列为限制。
  3. Virtual Lab 由一个 AI PI 和多个科学家 Agent 协作,在 Human 高层反馈下形成纳米抗体设计管线,设计 92 个候选,并由真实实验报告若干具有功能性结合表现的结果。
  4. Robin 的 2026 Nature 论文把文献检索、假设、实验策略和数据分析编排为连续工作流,并报告了 lab-in-the-loop 结果;论文也披露 Human 审核候选排序、提供实验 protocol、调整材料和细胞模型、指定分析方式、执行物理实验并决定何时结束循环。它是开发团队的同行评议证据,不是独立复现。
  5. SAMPLE 把学习 Agent 直接连接自动化蛋白质工程实验,形成 design-test-learn 闭环;它证明特定实验空间中的自治优化可行,但不等同于通用 LLM 科学家。
  6. Stanford HAI 的公开讨论把 Human 作用集中在选择重要问题、处理数据与代理指标偏差、解释结果和维持共同体验证;其会议笔记还记录了“更高质量论文在早期假设与设计阶段获得更多 Human 输入”的观察。
  7. Google DeepMind 2026 年政策报告把 AI 生成科学想法后的验证能力描述为新的系统瓶颈,并把实验、数据、同行评议与科学基础设施列为需要共同扩容的环节。

Inferences

目前的推断

  1. “自治程度”不是一个单一百分比;同一系统可以在文献、分析或写作阶段高度自治,却仍在问题选择、实验执行和结论强度上依赖 Human。
  2. 当假设和论文生成成本下降,稀缺资源会向高质量实验、失败记录、复现与可信同行判断迁移。
  3. “AI 完成发现”应被拆成一条可审计的证据链,而不是由系统名称、论文流畅度或一次成功结果直接决定。

Unknowns

仍然不知道

  1. 代表性 AI Scientist 结果有多少已经被与开发团队无关的实验室独立复现?解决标准:找到独立团队公开的方法、数据与结果,并能把它与原系统的具体主张逐项对应。
  2. 公开的自治流程之外,问题设定、工具调试、数据清洗和失败筛选中仍包含多少未计量的 Human 工作?解决标准:系统报告公开完整的人时、干预点、失败轨迹和纳入或排除规则。
  3. 不同系统在同类开放研究任务上的失败率、成本和有效发现率能否直接比较?解决标准:出现共享任务、统一预算、预注册指标和公开失败结果的独立比较研究。

Evidence lens

我们如何检查“发现”主张

01

问题与目标

研究问题、优化目标和成功指标由谁提出,目标是否代表真正的科学价值?

02

证据接地

系统如何读取文献、数据和工具,错误主张能否被定位并排除?

03

新颖性

新颖是模型内部未见、文献检索未见,还是领域共同体此前没有提出?

04

可执行验证

输出是否转化为具有对照、指标和失败条件的实验或计算测试?

05

物理验证

结果是否接触真实样本、仪器或环境,而不只停留在模型和基准中?

06

独立复现

独立团队能否依据公开方法重复结果,并把结论外推到原始设置之外?

Open questions

下一步不是更多内容,而是解决这些未知

  • 已解决

    初始六段证据阶梯是否遗漏了“问题价值”和“共同体验证”两个不能被线性排序的维度?

    将问题价值与目标归属设为门 0,把独立复现与共同体验证设为门 5,并把 Human 责任、成本与失败记录作为横轴,而非用单一阶梯分数遮蔽它们。
  • 开放

    在无法穷尽未公开知识时,系统应如何诚实表述“新颖假设”?

  • 开放

    当 Agent 负责大部分工作流时,哪一个 Human 或机构应对结论强度、实验伦理和公开主张负责?

Mission outputs

阶段性文章

Change log

判断如何变化

  1. Mark 批准 LM-001,Mission 进入本地提案状态。

    第一版把 AI Scientist 视为分阶段能力组合,并把验证能力而非想法数量设为主要瓶颈;该判断仍待逐项来源核验。

  2. Mark 批准第一阶段公开发布,Mission 进入 active,并公开第一篇证据地图。

    五类系统的比较已完成来源审计;当前判断仍把独立复现、隐藏 Human 工作与统一失败率列为未知,不因公开而升级结论强度。

  3. Mark 批准第二阶段公开讨论精读,Mission 增加“生成变便宜后,验证与分阶段 Human 判断更显稀缺”的证据变化。

    Stanford HAI 的会议总结与 DeepMind 的政策报告支持把问题选择、数据偏差、实验资源和共同体验证视为显性瓶颈;这仍是机构讨论与阶段性推断,不构成“Human 必然更重要”的普遍因果结论。

  4. Mark 批准最终深研与 Mission 完成;六道门经五类系统测试后保留为可审计分析框架。

    初版线性阶梯被修订为六道门加两条横轴:问题价值进入门 0,共同体验证进入门 5,Human 责任与成本失败贯穿各阶段。独立复现、跨任务泛化和隐藏 Human 工时仍保留为未知。