如果你读过上一篇关于 Claude 蛋白质设计的文章,你可能已经记住了 14/15 这个数字,也知道了通用 Agent 开始编排专业工具、算力和湿实验。
但那篇文章留下了一个没有拆开的问题:Claude 究竟是被什么驱动的?
答案不是一句巧妙的提示词。
429 个词,和 16,281 个词
Anthropic 公开了驱动这场实验的全部文本。启动每一轮 campaign 的用户消息——也就是 kickoff message——只有 429 个英文词。它的作用大致相当于按下一个开关:告诉 Claude 任务开始了,靶点已经写在系统上下文里。
真正作为每一个 Agent 系统上下文的,是一份 16,281 个英文词的协议提示词(protocol prompt)。它被加载为 campaign 中每一个 Agent——包括主 Agent 和它派生出的子 Agent——的 system prompt。换句话说,429 词是点火,16,281 词是整台发动机。
这份协议不指定任何靶点的结合区域,不指定用哪种蛋白质骨架生成方法,不预设任何氨基酸序列。它只规定一件事:一个专家级的蛋白质设计 campaign 应该怎么跑。
Anthropic 的技术报告把这份协议拆成了 15 个主题块,并统计了每一块的词数。结果揭示了一个很有传播力的反差:
- 科学与工具(Science and tooling):5,570 词,占 34.2%;
- 编排与验证(Orchestration and verification):5,646 词,占 34.7%;
- 运营(Operations):5,065 词,占 31.1%。
只有约三分之一的篇幅在讲蛋白质科学和工具知识。其余约三分之二,都在规定组织怎么搭、时间怎么分配、预算怎么花、结果怎么验证、失败怎么处理、最终交付什么。
这不是一份普通的提示词。这是一套被写成自然语言、能够被 Agent 执行的科研操作系统。
第一层:把专家知识编码进去
科学部分的 5,570 词,是 Claude 设计蛋白质时赖以工作的知识基底。
最大的一块是“评分工具与验证门”(Scoring instrument and validation gates),1,810 词,占整个协议的 11.1%。它详细规定了 Claude 应该用什么分数给候选设计排序——一个由 ESMFold2、ESMFold2-Fast 和 Protenix v2 三个共折叠预测器组成的 z-score 集成,再加上自一致性 DockQ 作为校验。这个评分函数不是 Claude 自己发明的,而是 Anthropic 团队预先在公开基准上验证过、写死在协议里的。
接下来是“设计与预测工具菜单”(980 词),列出了允许使用的开源工具——RFdiffusion、BindCraft、BoltzGen、ProteinMPNN 等等——以及它们的许可证和可安装性。协议要求七种指定的结构生成方法每个靶点至少贡献 50 个骨架,最终 30 个设计必须来自至少三种方法,且单一方法不超过一半。这是一种用配额保证多样性的制度设计。
再往下是“设计策略与多样性”(632 词)、“预评分过滤与来源记录”(562 词)、“靶点档案与表位”(424 词)、“任务、靶点与交付物”(418 词)、“硅内优化”(418 词)和“参考文献与离线语料”(326 词)。
值得注意的是“靶点档案与表位”只有 424 词。协议给每个靶点只提供了名称、UniProt 编号、物种、寡聚状态和必要的辅因子——没有告诉 Claude 应该结合蛋白质的哪个表面。选择哪个区域、追求哪个表位,完全留给 Claude 自己判断。
科学部分的本质是:把一名资深蛋白质设计工程师头脑中的“什么值得做、用什么做、做到什么标准算合格”,写成可执行的文本。但它只占整个协议的三分之一。
第二层:把组织结构编码进去
如果说科学部分回答了“做什么”,编排部分回答的就是“谁来做、怎么协作”。
这一部分有 5,646 词,甚至比科学部分还多一点。最大的块是“验证与排序规则”(Verification and ranking rules),2,205 词,占整个协议的 13.6%——比任何一个单独的科学模块都大。它规定 Claude 在交付前必须做哪些检查:评分是否在已知 binder 上有效、候选是否与已知蛋白相似、序列组成是否有问题、设计之间是否重复。这些检查不是建议,而是交付前必须通过的门。
第二大块是“时间线与时钟纪律”(Timeline and clock discipline),1,253 词。它把 48 小时或 24 小时的 wall clock 切成阶段:第一小时必须完成工具的构建和验证,前若干小时用于大规模筛选,中段用于优化,最后阶段用于最终评分和排序。Claude 必须自己盯着时钟,在每个阶段结束前推进到下一步,而不是在某个环节无限迭代。
然后是“子 Agent 与委派”(Sub-agents and delegation),1,017 词。协议规定了一个两层的 Agent 团队结构:主 Agent 负责整体策略和最终决策,子 Agent 被派去执行具体任务——安装某个工具、跑一批生成、做一次评分。主 Agent 必须监督子 Agent 的输出,检查失败,决定重试还是换方法。这本质上是把一个项目负责人和一组执行者的关系,写成了自然语言的组织章程。
还有“后勤、隔离、自主与安全”(781 词),规定网络域名白名单、凭证管理、容器隔离、哪些操作需要人类批准、哪些可以自主决定。以及“文献触发”(Literature triggers),390 词,规定 Claude 在什么情况下应该去查论文、查什么、查到什么程度就够了。
这一部分的核心洞察是:让一个 Agent 连续跑 48 小时不出轨,靠的不是模型足够聪明,而是组织结构被写得足够清楚。谁负责什么、什么时候检查、失败了怎么办、什么可以自主决定、什么必须上报——这些通常存在于团队默契和项目管理工具中的东西,现在全部进了同一份文本。
第三层:把预算与时间编码进去
运营部分有 5,065 词,其中最大的一块是“计算预算与节奏调节器”(Compute budget and pacing governor),2,890 词,占整个协议的 17.7%——这是 15 个模块中最大的单一块。
它的存在本身就很说明问题。一份蛋白质设计的“提示词”里,篇幅最大的单一模块不是科学方法,而是怎么花钱。
多靶点 campaign 的计算预算是 5 万美元,48 小时;单靶点是 1 万美元,24 小时。这些钱通过 Modal 花在云 GPU 上。协议详细规定了 Claude 应该如何在固定预算内分配算力:筛选阶段用多少、优化阶段用多少、最终评分用多少;什么时候该省着用、什么时候可以放开跑;如果某个工具特别贵,是否应该减少它的使用比例。
这不是简单的“给你一个上限,别超了”。它是一套动态的预算治理机制:Claude 必须持续监控已花费和剩余时间,根据进展调整策略。如果前期筛选消耗超预期,后期就必须压缩优化轮次;如果某个靶点进展顺利,可以把剩余预算转移给更困难的靶点。
第二大块是“交付物与报告”(Deliverables and reporting),2,175 词。它规定 Claude 最终必须交付什么:每个靶点 30 个排名设计,附带完整的决策记录——用了什么工具、什么参数、为什么过滤掉某些候选、为什么这样排序。这些记录不是可选项,而是交付物的一部分。
把预算和交付写进协议的意义在于:Agent 不再是“能跑多久跑多久、能出多少出多少”的黑箱。它在一个有预算、有截止日期、有明确交付标准的制度框架内运行。这和一个真实的研发项目没有本质区别——只是项目经理、财务和 QA 的角色,现在都由同一份文本承担了。
第四层:把验证、失败和责任编码进去
把上面三层合在一起看,你会发现这份协议最核心的设计哲学:它假设 Claude 会犯错,然后为犯错写好了制度。
验证与排序规则(2,205 词)是第一道防线。它要求 Claude 在交付前用已知 binder 校准评分函数,确保自己用的分数在这个靶点上真的有区分度。如果评分在已知样本上失效,Claude 必须调整策略,而不是硬着头皮交付。
预评分过滤(562 词)是第二道防线。在花算力做昂贵的共折叠评分之前,先用便宜的规则筛掉明显不合格的设计:与已知蛋白太相似的、彼此重复的、序列组成有问题的。这一步减少了浪费,也减少了后期被异常值带偏的风险。
时钟纪律和预算调节器是第三道防线。它们防止 Claude 在某个局部最优上无限迭代,确保即使进展不顺利,也能在时间和预算耗尽前拿出一批可交付的结果。
子 Agent 监督机制是第四道防线。主 Agent 必须检查子 Agent 的输出,识别失败,决定重试或换路。基础设施故障——网络断了、容器崩了、GPU 节点没了——由 Claude 自己检测和绕过,只有在会话因基础设施原因死亡时,人类才发一条简短的、非技术性的恢复指令。
但协议也明确划出了人类不可替代的边界。人类选择靶点,编写协议,提供云 GPU 账户和固定预算,下合成订单,解释结合数据。Claude 不能修改已经交付的设计,也不能在看到湿实验结果后补做一轮。所谓“自主”,发生在这套明确搭好的围栏之内。
这不是把责任甩给 Agent。恰恰相反,这是把责任拆解得更清楚:谁定义问题、谁提供资源、谁执行流程、谁验证结果、谁做最终判断,每一环都有明确的归属。
为什么它更像操作系统,而不是 SOP
你可能会说,这不就是一份标准操作流程(SOP)吗?
不完全是。SOP 是给人看的,人读了之后用自己的判断力执行。这份协议是给 Agent 读的,Agent 读了之后直接执行——没有一个人类中层在中间翻译和裁决。
更关键的区别在于,SOP 通常只规定“做什么”,而这份协议还规定了“怎么组织做这件事的系统”。它包含:
- 进程管理:子 Agent 的派生、监督和回收;
- 资源调度:GPU 预算在不同阶段和靶点之间的分配;
- 时间片:wall clock 被切成阶段,每个阶段有明确的进入和退出条件;
- 错误处理:工具失败、基础设施故障、结果异常时的重试和降级策略;
- I/O 规范:交付物的格式、内容和完整性要求;
- 安全边界:网络白名单、凭证管理、自主决策与人类审批的分界线。
这些概念听起来是不是很熟悉?它们就是操作系统的核心功能。只不过传统操作系统管理的是硬件资源和进程,这份协议管理的是算力、工具、Agent 和科研流程。
Anthropic 团队在测试 campaign 中反复迭代了编排和运营部分,直到 Claude 能够可靠地维持 24 到 48 小时的运行、按预期用完整个预算,然后才把协议冻结,用于正式报告中的所有 campaign。这个过程——写规则、跑测试、调规则、再跑——和开发一个操作系统的内核没有本质区别。
这对企业与科研组织意味着什么
如果这份协议的范式成立,它对科研组织和企业研发的影响可能比“Claude 会设计蛋白质”更深。
第一,专家经验的载体变了。过去,一名资深研究员的价值在于他头脑中的隐性知识——知道什么时候该换方法、知道哪个结果可疑、知道怎么在预算内拿到可交付的成果。这些知识很难传承,人走了就带走了。现在,这些知识可以被写成协议,成为组织可复用的制度资产。
第二,研发项目的启动成本变了。过去,启动一个新的计算生物学项目需要凑齐一组专家、搭建环境、磨合流程。现在,如果有一份写好的协议,一个 Agent 就可以在准备好的计算环境中自主运行。这不是说专家不重要了,而是专家的价值从“亲自执行”转向“设计和维护执行系统”。
第三,组织的核心竞争力变了。未来的 AI4S 团队,差距可能不在于谁的模型更大,而在于谁能把领域知识、工具链、预算治理、验证机制和交付标准写成高质量的可执行协议。协议的质量——它是否覆盖了足够多的边界情况、是否有合理的失败处理、是否能在固定资源内稳定产出——可能比模型本身的差异更能决定最终结果。
第四,责任结构变了,但没有消失。Agent 可以自主执行流程,但不能替组织决定一个结果是否值得相信、是否值得投入下一阶段。人类从执行者变成了制度设计者和最终裁决者。这个迁移不是降级,而是责任的聚焦——从“做对每一步”转向“设计一个能让每一步都做对的系统”。
未来稀缺的可能不是 Prompt Engineer,而是任务架构师
这份 16,281 词的协议,不是一个人坐在桌前“想了一个好 prompt”写出来的。它是 Anthropic 团队把蛋白质设计专家的工作知识、项目管理的组织方法、云计算的预算治理和科研验证的质量标准,融合在一起反复迭代的产物。
写这份协议需要的能力,不是“会跟 AI 说话”,而是:
- 理解一个领域的专家究竟在做什么决策、依据什么标准;
- 把隐性的专家判断转化为显性的、可执行的规则;
- 设计 Agent 团队的组织结构和委派机制;
- 建立预算、时间和资源的动态治理;
- 为失败和异常写好降级和重试路径;
- 定义可验证、可审计的交付标准;
- 划定人类和 Agent 之间的责任边界。
这更接近系统架构师和制度设计者的工作,而不是提示词工程师的工作。如果 Agent-first 的科研方式继续发展,能够设计高质量任务协议的人——我们姑且称之为“任务架构师”——可能会成为最稀缺的角色之一。
他们不直接做科研,也不直接写代码。他们设计的是让科研能够被 Agent 可靠执行的制度。
而这,可能才是 Claude 这次蛋白质设计实验最值得带走的东西。14/15 会被下一个数字覆盖,但“把科研项目写成可执行操作系统”这个思路,才刚刚开始。
事实、推断与未知
- 事实:Anthropic 公开的多靶点协议提示词约 16,000 词,作为 campaign 中每个 Agent 的 system prompt 加载;技术报告的 Figure M2 将其分为 15 个主题块,其中科学与工具占 34.2%,编排与验证占 34.7%,运营占 31.1%;最大的单一模块是计算预算与节奏调节器(2,890 词,17.7%);多靶点 campaign 预算 5 万美元/48 小时,单靶点 1 万美元/24 小时;所有协议提示词和 kickoff 消息已公开发布。
- 推断:这份协议的本质不是提示词而是可执行的科研操作系统;它把专家知识、组织结构、预算治理、验证机制和交付标准编码进同一份自然语言文档;Agent-first 科研中,任务协议的质量可能比模型差异更能决定结果。
- 未知:这种协议范式在蛋白质设计之外的领域迁移效果如何;编写高质量协议所需的时间和专业门槛;协议在不同模型上的可移植性;长期运行中协议本身的维护和版本管理成本;以及当 Agent 可以设计具有生物活性的分子时,协议治理能否替代更广泛的安全和伦理审查。