建设者坐标
郭天南是西湖智能蛋白质组中心负责人。中心官方页面把自动化样本处理、质谱检测、多组学数据、算法模型与疾病标志物发现放在同一条路线里。在这组建设者中,他代表的是一种经常被低估的“做”:把患者样本变成可复核的分子测量,再把模型送进跨中心、前瞻性的临床样本验证。
本文以甲状腺结节蛋白分类研究为主要案例。这是对郭天南及团队公开工作的资料画像,不是采访。样本采集、病理金标准、压力循环技术、DIA 质谱、数据分析和多中心协作均由完整作者与临床合作网络完成,不能压缩成个人完成的诊断产品。论文利益披露还说明郭天南与朱怡持有 Westlake Omics 股份,多位作者为公司员工,Pressure Biosciences 提供了仪器支持;这些关系不否定结果,但读者应知情。
从什么算到什么做
甲状腺结节的难点不是缺少影像或穿刺,而是部分样本难以在术前明确良恶性,可能导致重复检查或诊断性手术。2022 年 Cell Discovery 论文建立的路径从真实组织与细针穿刺样本开始:用压力循环技术处理样本,以数据非依赖采集质谱获得蛋白质组,再用 DIA-NN 等软件生成定量数据。
研究团队从回顾性福尔马林固定石蜡包埋组织的蛋白质组数据中训练神经网络分类器,最终使用 19 个蛋白作判断。论文随后设置盲法外部回顾性验证,并把测试推进到前瞻性细针穿刺样本。全研究的数据集涉及 12 家临床中心;其中前瞻性部分来自 9 家中心,包含 284 名患者的 294 份样本。论文报告正确分类 250 份,即 85%,同时给出灵敏度、特异度和 AUC 等指标。
这一步的“做”不是自动给患者下诊断,而是形成一条可落到样本、仪器、预测和病理对照的流程。分类结果仍需放回临床情境,由医生结合病理与其他信息解释;论文也把这项工作定义为概念验证,并指出真实应用还需要把标志物转成更可控的靶向检测。
闭环如何运转
循环从标准化样本开始。压力、温度、处理时间和质谱批次都会影响读数,因此实验流程和质量控制先决定模型看见什么。质谱信号经过定量与清洗后进入分类器,模型输出再与术后组织病理等参考结果比较。错分病例不是一句“准确率下降”,而是下一轮检查样本质量、特征稳定性、中心差异与决策阈值的入口。
多中心和前瞻性设计让评价更接近真实工作流:模型不再只解释训练集里的存档组织,而要面对不同医院取得的穿刺样本。不过,跨中心并不自动等于普遍泛化。样本构成、病种谱、病理判读和实验平台仍可能带来偏差;从研究级 DIA 质谱过渡到常规临床检测,还涉及周转时间、成本、校准、监管和质量体系。
中心页面提出继续建设自动化设备、多模态组学和组学基础模型。这些方向可以让“样本—数据—模型—验证”循环更紧,但目前是机构路线图。不能用未来规划反向证明现有系统已经实现全自动运行或通用疾病基础模型。
证据台账
已确认事实 19 蛋白模型接受外部与前瞻验证
同行评议论文支持从 PCT/DIA 质谱到神经网络分类的完整方法,并报告外部盲法及 294 份前瞻性穿刺样本结果。85% 是该队列中 250/294 的论文报告值,不是所有人群中的固定性能。
来源方主张 自动化和组学基础模型路线
开发自动化设备、构建多模态数据库与训练组学基础模型,来自中心官方页面的建设目标。它说明团队下一步想做什么,尚不能作为这些能力已完成、已部署或已产生临床价值的证据。
分析推断 临床闭环的瓶颈也在测量层
本文把郭天南列为“测量—验证基础设施”建设者,因为可靠样本处理和跨中心质谱是模型成立的前提。对临床 AI4S 来说,持续产生可比的分子数据,可能与更复杂的算法同样关键。
待验证 真实世界效用与诊断资格
模型是否能在更大、更多样的前瞻人群保持性能,靶向 assay 能否复现,是否改善诊疗决策和患者结局,都需要后续研究与监管评价。现有论文不支持把它称为获批诊断。
事实 / 来源方主张 / 分析推断 / 待验证
- 事实:19 蛋白神经网络经过外部盲法和 294 份前瞻性穿刺样本检验,论文报告前瞻部分准确率 85%。
- 来源方主张:自动化平台、组学大数据与基础模型是中心公开路线,不是既成临床产品。
- 分析推断:其代表性在把真实样本、可审查测量和多中心评价接进模型循环。
- 待验证:更大人群中的泛化、靶向检测复现、成本效益、临床净获益与监管状态。
为什么入选及边界
郭天南入选,是因为这项工作没有停在发现一组相关蛋白,而是把模型带到盲法、多中心和前瞻样本中受检,并公开了清晰的样本与性能数字。边界是:论文作者称其为概念验证;85% 不是获批门槛,也不能脱离样本谱解释;从研究质谱到常规临床 assay、从准确率到患者获益,仍隔着多道验证门。