训练效率:梯度优化的革命性突破
MatPL-2026.3引入了Adam等梯度优化器的并行训练策略,训练速度进一步提升,能胜任包含数百万结构数据集的训练任务。
我们在多个典型体系上对MatPL(梯度优化)与GPUMD(SNES演化策略)进行了严格对比,所有测试均采用相同的训练数据和NEP超参数。
结果显示:MatPL在保持卓越最终精度的同时,实现了同等或更快的收敛速度。这意味着用户可以用更短的时间获得同等高质量的NEP势函数——对于资源有限的课题组,这尤其友好。
MD性能飞跃:速度与规模的双重突破
如果说训练效率的提升让势函数构建更便捷,那么MD模拟性能的飞跃才是此次升级的重头戏。
在NVIDIA RTX 4090单卡上,我们对液态水体系进行了NVT系综模拟,结果令人振奋:MatPL-2026.3在全体系规模下的模拟速度持续领先。
内存优化:突破单GPU极限
更值得一提的是MatPL在内存效率上的突破。通过优化的近邻表构建算法,MatPL在单张RTX 4090上可模拟的体系规模多出20%。这意味着许多此前需要多卡集群才能完成的任务,如今单卡即可轻松应对。
大规模扩展:100 GPU的极致效能
MatPL打破了NEP力场无法跨节点并行模拟的限制,有着强大的扩展能力。我们进一步在多达100张NVIDIA RTX 3080 Ti GPU上验证了MatPL的扩展性:
弱扩展:每卡负载不变,规模线性扩大
每卡固定处理约265万原子,总原子数从265万扩展至2.65亿(100卡)。结果显示:
通信开销始终低于2.7%,56G IB网络完全胜任
并行效率缓慢下降:64卡时效率84.7%,100卡时71.9%,仍保持较高水准
罪魁祸首是GPU计算效率降低:每个原子的计算时间从单卡的135.8 ns增加到100卡的185.0 ns(+36%)。这是因为12GB显存在265万原子下已近饱和,并行后通信缓冲、临时数组等进一步争抢显存带宽、PCIe总线、GPU内部资源,导致GPU“分心”变慢。
测试数据证明,MatPL已为亿级原子、DFT精度的分子动力学模拟做好了准备。
强扩展:体系固定,GPU越多越快?
固定模拟265万原子,从1卡逐步增加到100卡。结果显示:
前8卡效率保持94%以上,说明软件并行开销极小
随着GPU继续增加,效率逐渐下降,100卡时降至64.4%,并行效率仍然不错。效率下降的主要原因是,每卡处理的原子数从265万锐减至2.6万,GPU“喂不饱”,计算资源闲置,同时通信占比从0.15%升至20%。
测试结果证明了MatPL软件能力的优秀,在硬件受限下仍能实现极高的并行效率。更详细的MatPL介绍与测试结果见文章链接:
/ END /