← 文章 / AI技术
微软研究院 3小时前 · 2026-08-31 12:38:55 · 1 阅读

拓展 Skala 可及性,加速迈向可预测的 DFT

Skala 架构示意图,展示 meta-GGA 电子特征如何经过逐点处理和非局域原子相互作用,预测密度泛函理论能量。
  • Skala 1.1 展现了微软研究院深度学习 DFT 方法持续迭代的演进特性:相比上一版本,训练数据量增加了 2.5 倍,在热化学、反应动力学、分子结构预测等关键分子模拟任务上均取得了显著更高的精度。
  • Skala 现已在 CP2K 中可用,并正在集成至 Psi4FHI-aimsORCAVASP 中,让下一代 DFT 精度惠及日常依赖这些工具的广大用户群体。
  • 微软研究院还推出了一个持续更新的基准测试,用于跟踪 Skala 各版本在持续优化过程中的计算性能,帮助学术界衡量并加速向更高精度与更高效率的迈进。
  • 这些进展共同标志着我们朝着未来又迈近了一步——计算化学模拟将兼具预测能力,并深度融入各类相关的科研与工业工作流。

将密度泛函理论(DFT)提升到可预测的精度水平,是一段持续探索的旅程,而非一蹴而就的突破。推出 Skala——我们基于深度学习的交换关联泛函——以来,我们沿着两条互补的路径持续推进:一方面不断提升精度,另一方面在计算化学生态中拓展其可及性。

图 1:Skala-1.1 与其他密度泛函在 GMTKN55 55 个子集上的误差汇总。Skala-1.1 在 32 个子集上误差最低,表明其在广泛的化学性质和反应类型上都具备广泛且稳定的准确性。
图 1:Skala-1.1 在热化学、动力学和非共价相互作用方面的精度。以 meta-GGA 泛函的计算成本,Skala 1.1 超越了最佳且最昂贵的全局混合泛函,在广泛使用的 GMTKN55 基准测试(涵盖广泛的化学问题)的 55 个类别中有 32 个排名第一(获得金牌)。

在精度方面,Skala-1.1 的发布首次展示了 Skala 背后"持续改进"的设计理念。相较于首个公开版本,Skala-1.1 使用的训练数据量增加了 2.5 倍,在分子模拟的关键挑战(包括主族元素热化学、反应动力学和分子结构预测)上带来了显著提升的性能。

但仅有精度还不够。DFT 是化学、材料科学、催化、能源技术和药物发现等众多科学和工业工作流程的计算引擎。要产生真正的实际影响,先进泛函必须在科学家们已有的计算环境中触手可及。这也是我们与领先电子结构软件开发团队合作、不断扩展 Skala 生态的原因。

今天,我们宣布 Skala 已在 CP2K 中可用,并正在被集成到 Psi4FHI-aimsORCAVASP 中,让下一代 DFT 精度离每天依赖这些代码的研究者们更近一步。与此同时,我们还推出了一个动态基准,用于追踪各个持续优化的 Skala 版本在计算性能上的表现。该资源将为不同软件包和硬件平台上的实现提供透明且持续更新的参考基准,帮助社区衡量并加速向更高精度和效率迈进的进程。

这些进展共同标志着又一个里程碑,让我们离这样的未来更近一步:计算化学模拟不仅具有预测能力,还能覆盖更广泛的科学与工业工作流。

想深入了解 Skala 以及 DFT 在计算机辅助发现中为何如此重要?请阅读我们的第一篇博客文章

Skala:一个持续进化的泛函

与传统"泛函动物园"模式不同——新泛函不断涌现,却并不取代旧泛函——Skala 遵循另一种理念:每个新版本都旨在超越前一版本。随着新数据、模型架构和训练策略的引入,模型在保持相同实际计算成本的前提下持续提升性能。

Skala-1.1 是这一理念的最新体现。它在广泛使用的基准测试集 GMTKN55(涵盖 55 类化学问题,包括热化学、反应能垒和非共价相互作用)上取得了 2.8 kcal/mol 的加权平均误差。这一精度超越了目前主流的全局(range-separated)混合泛函,同时保留了半局域泛函的高效性。除了能量之外,Skala-1.1 还能提供高度精确的电子密度、偶极矩和分子几何结构。

这些进展得益于 Microsoft Research Accurate Chemistry Collection(MSR-ACC) 的大幅扩展——这是我们使用高精度波函数方法构建的大规模量子化学参考数据集。为支持 Skala-1.1,我们新增了电子亲和势和非共价团簇等类别,既扩大了数据规模,也显著提升了数据多样性。这种数据驱动的方法使 Skala 每代都能系统性改进,向真正可扩展且具有预测能力的 DFT 框架不断迈进。

在科学家工作的地方可用

要充分发挥 Skala 这种持续演进式 DFT 方法的潜力,我们需要配套的基础设施,使新版本能够快速、无缝地集成到工业界和学术界科学家使用的主流软件包中。这反过来将建立起快速反馈循环,对加速 Skala 的持续开发至关重要。

我们首先通过开源社区版发布了 Skala,基于 PySCF构建,并与 ASE集成。研究人员可以轻松地评估和应用 Skala,同时享受高度优化的 CPU 和 GPU 性能。

然而,没有任何单一的软件包能够满足所有应用或研究社区的需求。计算化学和材料科学依赖于一个丰富的电子结构代码生态,每个代码都经过数十年的发展,用于应对特定的科学和工业挑战。因此,过去一年我们的工作重点之一就是将 Skala 引入这一更广阔的生态。我们有幸能够依托 DFT 社区打下的坚实基础,也十分感谢众多研究人员和开发者的帮助,让 Skala 能够在科学家们日常使用的软件平台中可用。

从社区版到原生集成

我们与 CASUS(高级系统理解中心) 的 Thomas D. Kühne 教授团队合作,已成功将 Skala 集成到开源 CP2K 软件包中。CP2K 经过 25 年以上的持续发展,已成为 DFT 模拟领域的强大工具,尤其擅长大规模体系和长时间尺度的分子动力学模拟,同时提供丰富的高精度电子结构方法。Skala 让 CP2K 的能力边界进一步拓展,在保持大规模模拟所需计算效率的同时,带来了 DFT 精度上的飞跃。我们期待 CP2K 的规模与多功能性,与 Skala 持续提升的精度相结合,能在未来催生更多新的科学应用与发现。

更多进展即将公布。我们正与 Psi4 充满活力的开发者社区一道,积极将 Skala 集成到开源 Psi4 软件包中,后者是分子电子结构研究的重要平台。结合基于 PySCF 的 Skala 社区版,Skala 将可在三个广泛使用的开源量子化学软件包中使用。

除开源软件外,我们还与 FHI-aimsORCAVASP 的核心开发团队紧密合作,目标是在计算化学与材料科学领域的主要软件平台上广泛提供 Skala。

跨实现验证精度:以 CP2K 为案例

对于任何新实现而言,全面测试都至关重要。我们希望确保 Skala 在不同代码和计算环境下都能保持一致的精度。为此,我们与 CP2K 团队共同开发了一套完善的集成测试套件,用于验证 Skala 所得结果在数值上的正确性与可靠性。特别感谢 CASUS 团队,他们在计算方法数值验证方面的深厚专业知识,对这套测试框架的设计与验证起到了关键作用。

图 2:在 GMTKN55 的代表性子集上比较 Skala-1.1 的 CP2K 与 PySCF 实现的符号误差。两套实现的结果几乎完全一致,偏差在 0.04 kcal/mol 以内,证明 CP2K 集成复现了社区版本的精度。
图 2:在 GMTKN55 的代表性子集上,Skala-1.1 的 CP2K 与 PySCK 实现相对于高精度参考值的符号误差对比,两者在数值设置上尽量保持一致。两种实现在整个子集上的平均绝对偏差(MAD)均在 0.1 kcal/mol 以内。

关于 Skala 在 CP2K 中的实现、验证策略和测试基础设施的详细讨论,请参阅我们与 CASUS 团队联合发表的论文:"通过 GauXC 在 CP2K 中实现机器学习 Skala 交换-相关泛函的分子版本"。

Skala 实时性能报告

精度与广泛的可用性只有在 Skala 同时足够快的情况下才能转化为实际的科学影响力。如今,Skala 在 CPU(对于原子数超过 20–30 的分子,开销可忽略不计)和 GPU 上都能达到与半局域 meta-GGA 相当的性能,我们将致力于在它被集成到整个电子结构软件生态的过程中保持这种效率。

但性能并非一成不变。Skala 的新版本、GauXC 等库的改进以及针对特定硬件的优化会持续提升效率,并带来进一步提升的新机会。要捕捉这些进展,不能只靠一次基准测试快照。

为了提供透明且最新的 Skala 性能视图,我们发布了一个基准测试框架及配套的实时性能报告,后续将随新优化上线持续更新。该报告追踪了 Skala 在多种任务和硬件平台上的性能表现,而基准测试框架则可供各软件包的开发者对其 Skala 实现进行基准测试、验证和改进。

图3(附图):Skala-1.1 与 r2SCAN、B3LYP 和 M06-2X 在 GPU 和 CPU 上的计算成本基准对比。Skala-1.1 在 GPU 上达到与 r2SCAN 相当的性能,在 CPU 上对于较大体系则接近半局域泛函的成本,同时显著低于杂化泛函。
图3:Skala 在 GPU 和 CPU 上的计算成本,与常用的 metaGGA 泛函(r2SCAN)以及两种杂化泛函(B3LYP 和 M06-2X)进行对比。在 GPU 上,Skala 1.1 的成本与 r2SCAN 相同;当体系轨道数超过约 1000 时,杂化泛函的计算成本明显更高。在 CPU 上,对于较小体系,Skala 相对其他泛函存在一定额外开销,但当轨道数超过约 300 时,该开销基本消失。

致谢

Skala 是 AI for Science 团队共同努力的成果,我们感谢工程、项目管理和业务运营团队的鼎力相助,使这项工作得以顺利完成。同时也感谢 MSR Accelerator 在数据生成工作以及加速软件集成方面的合作,帮助 Skala 走向更广泛的科学社区。

原始来源: 微软研究院

评论 (0)