2026 年 5 月,Google DeepMind 与合作者在 Nature 发表了 Co-Scientist 研究,并公布了一套面向科研人员的实验性工具。它最值得注意的部分,不是“AI 科学家”这个容易被放大的称呼,而是研究团队怎样把科学假设的形成拆成多个角色和一条反复校正的流程。
从一个回答,变成一场内部争论
按照 DeepMind 的系统说明,Co-Scientist 不是让一个模型一次性给出结论。系统中的不同 Agent 分别负责生成方向、聚类相近想法、反思和批评、两两比较、演化候选以及汇总审查;上层 supervisor 再根据研究目标安排步骤。
这种结构试图处理一个常见问题:语言模型可以很快提出大量听起来合理的想法,但“能提出”不等于“值得实验”。当生成、反对意见和排序由不同角色承担时,系统至少能把一部分内部推理变成可以反复运行的选择过程。
DeepMind 把其中的排序环节称为“想法锦标赛”。候选假设通过比较与辩论被重新排列,同时再引入文献和数据库信息。这里的验证主要仍是计算与知识层面的交叉检查,它可以减少明显矛盾,却不能替代实验室里的外部证据。
真正的分界线仍在实验
论文与官方材料报告了若干生命科学应用,包括药物再利用、疾病机制和遗传线索。部分候选进入了实验检验。但这些结果来自特定问题、合作者和评估设置,不能直接推出系统已经获得跨领域、独立和稳定的科学发现能力。
官方说明也保留了一个重要边界:Co-Scientist 是研究伙伴,不是科学或临床专业判断的替代者。研究人员仍然要决定问题是否重要、实验是否合适、结果是否可重复,以及一次成功究竟支持了多强的结论。
这让我们看到,科学 Agent 的价值可能不在于“替人宣布发现”,而在于压缩文献搜索、候选生成和优先级选择的时间,把有限的实验资源更快放到值得检验的问题上。
对 Agent-first 组织的启发
同一个原则也适用于公司工作:多 Agent 并不会自动带来正确性。只有当角色分工连接到外部证据、失败反馈和明确责任人时,循环才可能比单次生成更可靠。
一个值得继续追踪的系统,至少要回答四个问题:候选从哪里来?反对意见由谁提出?排序依据是什么?最后哪一步接触真实世界?如果第四个问题没有答案,再复杂的内部协作也可能只是在放大一组未经验证的文本。
事实、推断与未知
- 事实:Co-Scientist 采用生成、反思、排序、演化与汇总等专业 Agent;相关研究已经同行评审发表,并报告了特定生命科学验证。
- 推断:它的重要性在于把假设选择组织成循环,而不是证明科学家可以被一个自治系统替代。
- 未知:独立团队的复现表现、跨领域泛化、日常使用成本和失败率仍需要更多公开证据。