14 个靶点成功了。
Anthropic 把 Claude 生成的蛋白质序列交给两家实验服务公司。它们没有替 Claude 修改设计,而是合成序列、表达蛋白,再把它们送上真实的结合实验。最终,在 15 个结果可以解释的靶点中,14 个至少出现了一个能够结合的候选物。
这是一个足够漂亮、也足够容易被误读的数字。
它很容易被写成 Claude 进军蛋白质设计,甚至被放进“AlphaFold 团队解散、下一代 AI 接棒”的故事里。但如果只看到一个更强的模型,我们反而会错过这次实验最重要的变化。
Claude 没有发明一种新的蛋白质基础模型。它做的是另一件事:读取任务,选择靶点区域,调用多个开源设计和预测工具,申请 GPU,运行和修复流程,筛选候选序列,再把结果交给湿实验。
真正值得关注的,不是 Claude 会不会设计某一个蛋白质,而是通用 Agent 开始把专业模型、计算资源和实验平台组织成一条能够跑完的科研工作流。
一次 1,440 个设计的实验
Anthropic 的官方文章把这项工作描述为 Claude Science 的一次自主蛋白质设计实验。详细的技术报告和数据给出了更完整的图景。
研究人员一共选择了 16 个靶点,Claude Mythos Preview 和 Claude Opus 4.8 生成了 1,440 个长度在 50 到 120 个氨基酸之间的微型蛋白质。一个靶点——成熟 GDF-8——在实验中出现聚集和非特异性结合,120 个相关设计因此被排除在主要统计之外。
剩下 15 个靶点、1,320 个可以解释的设计中:
- 354 个被综合判定为 binder,总体命中率 26.8%;
- 194 个测得的结合强度优于 100 nM;
- 90 个优于 10 nM;
- 42 个进入 1 nM 以内;
- 15 个靶点中,14 个至少得到一个 binder。
如果只看每次主要设计任务中被 Claude 排在第一位的候选,41 个候选里有 20 个命中,比例为 48.8%。这些结果可以在 Anthropic 公开的数据集中重新计算,而不必只相信新闻稿上的百分比。
实验还不是一场统一的胜利。TREM2 的 90 个设计中有 72 个被判定为 binder,MBP 的 90 个设计却全军覆没。BBF-14 只有 3 个命中,15-PGDH 只有 1 个。Claude 已经能在一组靶点上制造大量真实结果,但还远没有把蛋白质设计变成稳定的自动售货机。
这恰恰让实验变得更可信,也更有意思:它不是一段只展示最佳样本的演示视频,而是一批包含失败、弱结果和无法解释样本的实验记录。
Claude 到底做了什么
这项实验的起点不是一句简单提示词。
驱动 Claude 的不是一句话,而是一份约 1.6 万词的协议——其中只有三分之一是科学知识,其余三分之二在编码组织、预算、验证和交付。我们在另一篇文章里拆开了这份“科研操作系统”:14个靶点背后:Anthropic把科研项目写成了一份1.6万词的操作系统。
人类研究人员选择靶点,编写了大约三万 token 的任务说明,规定总体目标和实验协议,准备论文、蛋白质结构和工具资源,配置计算环境,并决定最终要把哪些序列送去合成。Claude 获得浏览资料、写代码、调用开源蛋白质设计工具和使用 GPU 的权限。
接下来,它需要自己决定:
- 靶蛋白的哪个表面区域值得结合;
- 使用哪些设计和结构预测工具;
- 如何组合、修改和运行这些工具;
- 哪些计算失败需要重试或换一种方法;
- 如何过滤明显不稳定或不合格的设计;
- 如何在大量候选中排序,挑出最终交付的序列。
多靶点任务允许 Claude 连续工作 48 小时,并拥有最高 12,500 H100 GPU 小时的资源上限。单靶点任务允许工作 24 小时,每个靶点最高 2,500 H100 GPU 小时。报告给出的对应计算预算分别达到 5 万和 1 万美元量级。
这不是“给聊天机器人一个问题,等它灵光一现”。它更像把一名数字项目负责人放进准备好的计算实验室,允许它自己选择仪器、安排任务、检查结果并提交样品。
然后,两家 CRO——Adaptyv Bio 和 Twist Bioscience——接手物理世界的部分。它们合成 Claude 交付的序列并进行结合测试。Claude 不能修改已经交付的设计,也不能在看到湿实验结果之后补做一轮以美化成绩。
这条边界很重要。Claude 负责计算设计工作流,人类负责问题、协议、资源、权限和最终责任,CRO 负责合成与实验。所谓“自主”,发生在这套明确搭好的围栏之内。
14/15 不等于 Claude 超过了蛋白质专家
Anthropic 的博客说,Claude 的表现达到、甚至可能超过领先的人类专家。但技术报告写得更克制:实验没有安排一个拥有同等工具、时间和计算预算的人类专家团队做匹配对照,因此不能由此声称 Claude 比专家更强。
报告确实将部分结果与六项公开的蛋白质设计竞赛进行了回顾性比较,Claude 在其中一些靶点上表现出很有竞争力的亲和力。但这不是受控实验,而且六项竞赛中有四项的结果在 Claude 开始设计时已经公开。它可以帮助我们判断结果是否进入了行业前沿附近,却不能承担“人机胜负”的结论。
还需要分清四件完全不同的事:
- 计算模型预测一个序列可能结合;
- 实验测到浓度相关的结合;
- 得到所需的生物功能或通路效果;
- 成为安全、稳定、可制造的治疗候选物。
这次实验跨过了第二道门,但没有提供实验结构,也没有测试功能活性、动物效果或治疗价值。一个高亲和力 binder 是重要起点,不是药物研发的终点。
实验设计本身也留下了统计边界。多数模型、任务形式和靶点组合只运行一次,因此模型差异、提示方式和单次运行波动彼此混杂;多个候选又可能来自同一蛋白质骨架,不能全部视为独立发现。研究由 Anthropic 自己设计和撰写,CRO 提供付费实验服务,目前还没有独立团队完成同规模复现。
所以,14/15 最准确的读法不是“Claude 已经解决蛋白质设计”,而是:
在人类设定协议、提供资源并保留最终判断的条件下,一个通用 Agent 已经能够自主运行大规模计算设计流程,并把结果推到真实湿实验验证。
这个结论没有标题那么炸裂,却可能更加重要。
被压缩的首先是科研协调成本
现代计算蛋白质设计并不缺少工具。结构预测、序列生成、共折叠预测、能量计算和筛选工具已经构成丰富的软件栈。困难在于,它们并不会自己组成一项研究。
过去,完整项目需要蛋白质设计专家理解靶点,需要计算人员安装和连接工具,需要基础设施工程师管理 GPU,需要实验人员把计算候选变成物理样品,还需要有人在每次失败、异常和交接中决定下一步。
Claude 这次没有取代这些专业能力。它压缩的是能力之间的缝隙:
- 从读论文到选择设计策略的切换;
- 从一个工具输出到下一个工具输入的转换;
- 批量任务失败后的诊断与重启;
- 从数百个候选到少量实验订单的筛选;
- 跨越计算环境、数据格式和实验服务的协调。
这可能是科研 Agent 最早产生经济价值的地方。科学发现的风险没有消失,湿实验的周期也没有消失,但原本需要多个专家频繁交接的工作,可以被一个持续运行的协调层部分吸收。
如果这个方向成立,AI4S 的竞争单位就会发生变化。未来最重要的问题可能不再只是“谁有最好的模型”,而是:
- 谁能让 Agent 可靠调用最好的专业模型和数据;
- 谁拥有可编程、可追踪的实验接口;
- 谁能把失败反馈重新送回设计循环;
- 谁能记录每一步的来源、参数和责任;
- 谁能让计算结果以足够低的摩擦进入物理世界。
对 CRO 来说,这意味着一种不同的未来。它们今天主要接受人类项目经理提交的实验订单;明天,它们可能成为科研 Agent 可以调用的实验 API。对专业软件公司来说,只提供一个独立工具可能越来越不够,能否进入 Agent 工作流、输出机器可读的结果和失败原因,会变得更重要。
对科学家来说,价值也未必消失,而是向问题定义、实验协议、异常判断、证据解释和责任承担迁移。Claude 可以连续跑几十个小时,却不能替研究共同体决定一个结果是否值得相信。
这不是 AlphaFold 的接班故事
把这次实验放在 AlphaFold 原团队重组的背景下,确实很有戏剧性。据《金融时报》报道,Google DeepMind 过去一年将多位原 AlphaFold 团队成员调往 Gemini、酶设计、基因组等项目,也有成员离职。
但“团队重组”不等于“AlphaFold 消失”。Google DeepMind 当前仍提供 AlphaFold Server 和相关数据库资源。更重要的是,AlphaFold 与这次 Claude 实验承担的角色不同。
AlphaFold 的历史贡献,是把蛋白质结构和相互作用预测推进成科学基础设施。Claude 展示的,则是一个通用 Agent 如何使用包括结构预测在内的多种专业基础设施,推动一项任务从资料、代码和 GPU 一直走到实验订单。
两者不是新王与旧王,也不是简单替代关系。一个更接近科学能力模块,另一个开始成为模块之间的组织层。
从这个角度看,AlphaFold 团队成员流向更广泛的模型和生物设计项目,反而与 Claude 实验共同指向同一个变化:AI4S 的前沿正在从单点模型突破,走向模型、Agent、实验和组织的系统竞争。
旁边那场化学实验,也在讲同一件事
Anthropic 同时公布了 Claude Opus 5 处理原始 NMR 和 LC-MS 文件的实验。Claude 分别用了约 23 分钟和 19 分钟,调用工具、解析格式并生成分析结果。
其中最容易传播的数字,是 Claude 给出 96.4% 的 LC-MS 纯度,而实验室报告为 96.33%。但技术报告显示,这两个结果采用了不同的峰集合和积分起点,并不是同一口径下的精确复现。如果按照实验室口径重新计算 Claude 解码的数据,结果约为 98.8%。
这削弱了“Claude 精确还原答案”的故事,却强化了另一个更可靠的观察:模型已经可以面对陌生、缺少文档的仪器文件,自己编写解析方法并完成一次可检查的工作流。样本只有一个,远不足以证明通用分析能力,但它和蛋白质设计实验展示的是同一种方向——AI 不只生成文本,也开始操作科研过程中的文件、工具和交付物。
还缺少的,是稳定性、成本和责任
Claude 的实验给出了一个强烈信号,但距离新的科研生产方式仍有三道门。
第一道是稳定性。同样任务多跑几次,结果是否接近?换成信息更少、难度更高的新靶点,成功率是否还能维持?这需要预注册、重复运行和独立团队复现。
第二道是经济性。数千甚至上万 H100 小时可以换来出色结果,但与人类团队相比究竟节省了多少总成本和日历时间,目前没有可比账本。Agent 可能压缩专家协调,也可能把成本转移到算力和实验筛选。
第三道是责任。当 Agent 可以设计具有生物活性的分子,谁批准目标、谁限制能力、谁审查输出、谁为实验后果负责?Anthropic 暂未向普通生命科学用户开放能力更强的 Fable 5,理由正是双重用途风险。这说明系统越接近物理实验,权限和治理就越不能被当成产品发布后的补丁。
科研工作流,正在成为新的产品
14/15 会成为这次发布最醒目的数字,也会很快被下一条新闻覆盖。
更值得留下来的,是这次实验暴露出的新产品形态:通用 Agent 站在专业模型之上,连接算力、代码、数据和湿实验,在人类规定的边界内推动一个研究任务前进。
它还不是自动科学家。它没有独立选择值得研究的问题,没有完成治疗验证,也没有获得独立复现。人类仍然设计协议、准备环境、批准资源、下单实验并解释结果。
但它已经不只是一个回答科学问题的聊天窗口。
如果模型、代码、GPU 和实验服务都逐渐变成 Agent 可以调用的组件,那么下一代 AI4S 公司的核心资产,可能不是某一个孤立模型,而是把这些组件可靠组织起来、让结果进入物理世界、并让每一步都可以追踪和负责的工作流。
蛋白质设计只是这套新系统最早亮起的一盏灯。
事实、推断与未知
- 事实:Anthropic 报告 1,320 个可解释设计中有 354 个 binder,覆盖 15 个有效分析靶点中的 14 个;设计经过两家 CRO 的物理结合实验,公开了设计、预测、实验与来源数据。
- 推断:这项工作的主要意义不是出现一个新的蛋白质模型,而是通用 Agent 开始承担专业工具、计算资源和实验交付之间的科研编排。
- 未知:同等预算下与人类专家的成本和质量比较、跨次运行稳定性、困难新靶点上的泛化、功能与治疗价值、独立复现率,以及规模化后的安全和责任机制。