当一个模型在论文里刷新指标,我们究竟知道了什么?
我们知道它在某个数据集、任务和评价设置上取得了一个结果。我们还不知道它能否稳定处理新的科学问题,能否改变实验选择,能否进入研究团队的日常工作,更不知道它能否形成产品或产业价值。
Nature 对 AI 与科学发现的综述 覆盖了假设、实验、数据与解释等环节,也指出数据质量与治理仍是横跨领域的问题。Google DeepMind 的 AI for Science 框架 则列出问题选择、评价、算力、数据等九项生产要素,并明确说明它不是一条整齐的线性流程。
在编辑和项目判断中,我们把这些复杂条件压缩成五道关口。它不是通用标准,而是一张避免过早下结论的检查表。
第一关:问题
先问科学问题是否重要,也问它是否适合当前 AI 方法。一个问题可能非常重要,却缺少可学习的数据、清楚的目标函数或足够快的反馈;另一个问题容易做出漂亮 benchmark,却不会改变任何真正的研究瓶颈。
好的问题通常允许中间进展被观察。团队不必等到最终突破,才能知道方向是否值得继续。
第二关:证据
模型指标需要对应可信的评价。训练集与测试集是否泄漏?基线是否足够强?统计差异是否稳定?科学家是否认可这个指标代表的能力?
论文中的一次领先是证据,但证据有边界。跨数据集、跨实验室的复现和对失败案例的解释,会让主张逐步变强。没有这些,最诚实的表述仍然只是“在这一设置里有效”。
第三关:数据
科学数据不是天然可用的燃料。它可能昂贵、稀疏、带偏差、缺少标准,或受到隐私和许可限制。模型也可能学到采集流程的痕迹,而不是目标现象本身。
因此数据工作不仅是数量问题,还包括来源、质量控制、版本、负结果和更新机制。一个依赖不可持续数据管道的结果,很难变成可重复能力。
第四关:实验
计算预测最终要接触外部世界。对材料可能是合成与表征,对药物可能是多层级生物实验,对工程系统可能是现场约束下的运行。
实验会引入时间、设备、技能、安全和成本。真正有价值的 AI 循环,不只是给出候选,还要能接收实验失败并更新下一步。模型到实验之间的接口,常常比模型本身更难建设。
第五关:采用
即使科学上成立,一项能力仍需进入真实工作。研究人员是否信任它?输出能否嵌入现有工具?错误由谁负责?单位时间或单位实验成本是否真的下降?
到了产业现场,还会出现制造、供应链、法规、组织预算和交付责任。通过这一关,才可以开始讨论产品与商业,而不是从论文标题直接推导市场规模。
关口不是漏斗,而是循环
五道关口并不总是按顺序发生。实验失败可能迫使团队重新定义问题,采用困难可能暴露评价指标不对,新的数据也可能让原有模型失效。
它们的价值,是让每一次进展都有恰当的名字:模型结果、复现证据、实验结果、工作流采用和商业验证不是同一件事。把状态分开,反而更容易看清下一步该做什么。
事实、推断与未知
- 事实:AI 已覆盖科学发现的多个环节;问题选择、评价、数据和实验条件都能成为决定性约束。
- 推断:用问题、证据、数据、实验、采用五道关口标记状态,可以减少从模型成绩直接跳到产业结论的误判。
- 未知:不同学科的门槛和权重差异很大,这套框架需要在真实项目中修订,而不是被当作固定评分表。