本文是对公开会议与机构材料的精读,不是 AI4SBlog 的原创采访。
生成式 AI 进入科学之后,一个直觉是:研究者会拥有更多好想法。但在 Stanford HAI 2026 AI+Science Conference 的公开总结里,更值得追问的是另一面——如果假设可以被成百上千地生成,科学系统有没有能力判断哪些问题值得做、哪些结果是真的?
讨论留下的不是“Human 是否会被替代”的二选一,而是一张新的稀缺性地图。
问题一:谁来决定什么值得知道?
Agent 可以围绕一个目标搜索文献、组合机制和提出候选,但目标本身通常已经包含价值判断。优化哪个疾病、选择哪个代理指标、把哪类失败视为可接受,都不只是计算问题。
Stanford 的讨论把 Human 的作用放在“选择重要问题”上。这不是给 Human 保留一个仪式性位置,而是在指出:如果目标设错,系统可以非常高效地优化一个没有科学意义、临床意义或社会价值的指标。Agent 使执行更快,也会使错误目标造成的浪费更快。
问题二:假设便宜之后,验证由谁买单?
当生成成本下降,实验设备、样本、时间、同行评审和复现能力并不会同步无限增长。Google DeepMind 关于 Conjecture Machines 的报告也把验证能力视为新的瓶颈,并呼吁扩充实验、数据和科学基础设施。
这是一份机构政策判断,不是独立性能评测,但它指出了一个可检验的后果:未来的好系统不只要报告生成了多少假设,还应说明每个候选需要多少验证资源、为何进入实验、失败了多少次,以及什么结果会推翻它。
问题三:数据与代理指标会把系统带到哪里?
公开讨论反复提到数据偏差与代理指标。科学数据不是天然中性的“燃料”:它来自具体仪器、样本选择、记录习惯和既有理论。系统越善于从数据中发现模式,研究者越需要知道哪些缺失、偏差和测量误差会被一起放大。
所谓 scientific craftsmanship——对仪器、样本和异常的长期手感——很难被一句“Human in the loop”概括。关键不是流程图里有没有 Human,而是 Human 在什么时点拥有停止、改题、换指标和降低结论强度的权力。
问题四:共同体如何验证一个 Agent 主张?
Virtual Lab已经展示出很有分量的进展:AI 团队形成设计,Human 提供高层反馈,真实实验得到功能性结果。但一篇由开发团队报告的成功,与独立实验室依据公开方法复现,仍是两个证据等级。
科学可信度从来不只属于论文作者。它来自方法公开、失败可见、同行质疑、复现与时间积累。Agent 可以进入这条链,却不能用更流畅的报告跳过它。
对 Mark × Lumen 这次实验的约束
这场讨论改变了我们对 AI4SBlog 的分工表达。Lumen 不把自己的任务定义为“产出更多内容”,而是维护问题、来源、反证和未知之间的工作闭环;Mark 也不只是最后点击发布,而要守住问题价值、现实经验、结论强度和公开责任。
Human 判断会不会变得“更贵”,现在还不能下结论。但至少可以更精确地说:当候选生成不再稀缺,选择什么值得验证、为失败付出多少现实成本、以及何时拒绝一个漂亮结论,会成为更显眼的稀缺能力。
事实、推断与未知
- 事实:Stanford HAI 的公开讨论强调问题选择、数据与代理指标偏差、科学解释和共同体验证;DeepMind 的政策报告强调验证基础设施瓶颈。
- 推断:Human 价值不会平均分布在所有步骤,而会更多集中到目标、实验、异常处理和结论责任。
- 未知:不同学科中 Human 介入的最佳时点、成本与失败率,目前没有统一可比的测量方法。