建设者坐标
张林峰是深势科技创始人兼首席科学官,也是 Deep Potential、DeePMD-kit 与 DP-GEN 方法和软件链的重要建设者。同行评议论文、开源仓库和公司官方页面共同支持这条角色脉络:他把机器学习势能模型从研究方法推进为可训练、可部署、可持续维护的分子模拟工具。
这是一篇公开资料画像,不是采访。相关成果来自鄂维南、Roberto Car、韩杰群、王涵等研究者及 DeepModeling 社区众多贡献者,不能被压缩成一人的发明史;公司对产品能力的描述也不等同于独立验证。
从什么算到什么做
原子尺度研究长期面对精度与规模的取舍:第一性原理计算可以产生高精度能量与受力,但直接驱动大体系、长时间分子动力学的成本很高;经验势更快,适用边界却依赖人工假设。2018 年的 Physical Review Letters 论文提出,让深度神经网络从第一性原理数据学习多体势能面,再以模型预测的能量和力运行分子动力学。
DeePMD-kit 把数据、训练、测试和模拟接口做成开源软件;DP-GEN 又把构型探索、高精度标注和模型训练接成并发学习流程。这里的“做”是执行数据生成作业和分子动力学模拟,从而产生可分析的轨迹与候选,不是机器人已经完成合成或表征,更不能直接写成“发现了新材料”。
闭环如何运转
流程先用一批第一性原理结果训练多个势能模型,再让模型探索温度、压力和构型空间。不同模型对同一构型的受力预测若出现明显分歧,系统便把它视为模型可能不可靠的区域,挑选代表性构型交给高精度计算标注;新数据回到训练集,模型更新后继续探索。
DP-GEN 论文把它概括为探索、标注、训练三步迭代,并公开了对 LAMMPS、VASP、Quantum ESPRESSO、CP2K 及集群调度工具的接口。闭环减少的是人工反复挑数据和提交任务的负担,不是取消 Human:研究者仍要定义体系、计算方法、阈值、终止条件,并判断模型能否用于新的化学环境。
开源制品还让循环留下可检查的接口与版本:别人可以审阅输入、训练配置和工作流代码,复用同一方法。不过,代码公开并不保证数据完整,也不自动构成对某次科学结论的独立复现。
证据台账
已确认事实 论文、代码与当前角色
Deep Potential 和 DP-GEN 均有可定位的论文记录,DeePMD-kit 与 DP-GEN 源码公开;深势科技官方页面列张林峰为创始人兼首席科学官。
来源方主张 精度、速度与规模
论文对接近参考数据、线性扩展和减少 Human 介入的描述,成立范围受测试体系与设置约束;公司关于产业提效、领先性和产品效果的数字,也只能按来源方口径转述。
分析推断 关键制品是可复用循环
本文认为,张林峰的代表性不只是一种网络结构,而是把模型、数据选择、科学计算软件和调度工程连成可复用循环。这是基于公开制品的编辑判断。
待验证 分布外可靠性与总成本
换到新元素、反应路径或极端条件时需要多少新标注,异常与失败怎样恢复,以及计算优势能否稳定转化为实验成功率,仍需任务级和独立证据。
事实 / 来源方主张 / 分析推断 / 待验证
- 事实:张林峰是 Deep Potential 与 DP-GEN 论文作者,相关软件有公开仓库;其公司角色可由官网核对。
- 来源方主张:论文或公司发布的性能、数量级提效及“领先”措辞,不外推为普遍结论。
- 分析推断:他的建设价值在于把高成本标注变成可迭代的数据—模型—模拟基础设施。
- 待验证:闭环在陌生体系中的误差发现能力、完整 Human 工时和对真实实验的净贡献。
为什么入选及边界
张林峰入选,是因为他参与建设的链条跨过了“论文模型”与“科研软件”之间的断点:高精度计算教模型,模型扩大探索,风险构型再返回高精度计算。边界是,这仍主要是计算闭环;开源社区与团队拥有共同署名,产业采用也应逐项核验。它让“算”真正可运行,却不替代实验这道门。