位置:首页 > 进阶教程 > 强化学习引导生成模型发现新型晶体结构

强化学习引导生成模型发现新型晶体结构

时间:2026-07-20  |  作者:318050  |  阅读:0

晶体材料的发现,本质上是一场在巨大组合设计空间里寻找“宝藏”的游戏。

这个空间的复杂性来自多个维度。例如,元素组成、化学计量、晶格参数、原子坐标、空间群和局部配位环境等。其庞大程度远超传统实验探索和高通量计算所能覆盖的范围。

近年来,生成式人工智能已经能采样出化学上合理的晶体组成和结构。但始终面临一个核心矛盾:传统生成模型以似然为目标,天生倾向于复现训练数据中的统计规律。结果就是更容易生成与已知材料相似的结构,而不是主动去探索那些新颖、稀疏、却可能具有真正科学价值的未知区域。

为了解决这个问题,研究人员提出了Chemeleon2——一个通过强化学习引导潜在去噪扩散模型,去发现多样且新颖晶体化合物的新框架。

简单来说,这个方法将组相对策略优化与可验证的多目标奖励结合起来。在生成过程中,它能同时平衡创造性、热力学稳定性和多样性。除了从头生成晶体,研究人员还展示了面向目标带隙的性质引导设计。结果表明,强化学习能显著提升模型生成亚稳、唯一且新颖晶体的能力。在性质优化时,它还能维持化学有效性。这为可控的 AI 驱动材料逆向设计提供了一个模块化的基础。

强化学习引导生成模型发现新型晶体结构_wishdown.com

为什么这件事如此重要?

晶体材料是技术变革的长期推动力。从半导体、电池材料到能源与环境催化剂,几乎每一项关键技术的突破都离不开新材料的发现。然而,晶体材料的组合复杂性来自多个维度:元素组成、化学计量、晶格参数、原子坐标、空间群、局部配位环境……传统实验探索和高通量计算虽然一直在推动材料发现,但面对如此巨大的空间,仍然显得力不从心。

生成式人工智能为材料发现打开了新的大门。VAE、生成对抗网络、自回归模型、扩散模型和 Flow Matching 等方法已经能够生成看似合理的无机晶体结构。但问题在于,这些模型通常通过学习已有材料数据库的分布来生成样本,天然就会偏向“像训练集”的结构。而对于材料发现来说,真正有价值的候选物,恰恰位于数据库中稀疏、少见甚至未被充分探索的区域。这就形成了一个根本性的错位:模型学习的是高概率数据分布,而研究人员需要的是低概率但可能稳定、可合成、具备功能的新区域。

强化学习提供了解决这一错位的思路。与传统的似然训练不同,强化学习可以直接优化明确设定的奖励——比如新颖性、稳定性、多样性或目标性质。因此,Chemeleon2 的核心思路,就是通过强化学习后训练潜在扩散模型,让模型从“复现已知材料分布”转向“根据科学目标主动探索材料空间”。

方法

Chemeleon2 采用潜在去噪扩散模型作为策略网络。晶体结构通常由原子类型、原子坐标和晶格矩阵共同表示,其中既包含离散变量也包含连续变量。如果在真实原子空间中直接应用强化学习,策略概率的计算会非常困难,采样成本也高昂。为了降低优化难度,研究人员先用变分自编码器将晶体结构压缩为连续潜在表示,再在这个潜在空间中进行扩散生成。这样一来,复杂的晶体表示就被转化为更适合策略梯度优化的连续动作空间。

强化学习阶段使用组相对策略优化。模型在同一输入条件下生成多组候选晶体,并根据每个候选的奖励进行组内归一化,从而降低梯度估计方差、提高训练稳定性。奖励函数由多个部分构成:

  • 创造性奖励:鼓励生成唯一且不同于参考数据库的结构。
  • 稳定性奖励:基于能量凸包上方能量,鼓励热力学上可行或亚稳的晶体。
  • 多样性奖励:防止模型坍缩到少数局部模式,并推动它覆盖更广泛的组成和结构空间。
  • 目标性质奖励:用于性质引导设计,例如引导生成带隙接近 3 eV 的晶体。

强化学习引导生成模型发现新型晶体结构_wishdown.com

图1|强化学习引导晶体材料探索框架。

结果

强化学习框架用于材料空间探索

从似然驱动到奖励驱动

先说这个框架是如何改变晶体生成路径的。普通的生成模型主要沿着训练数据分布采样,因此更容易生成已有材料附近的结构。Chemeleon2 则将生成过程放入一个强化学习循环中:扩散模型作为智能体生成晶体,奖励函数作为环境评估其新颖性、稳定性和多样性,模型根据反馈更新策略。通过这个过程,采样从似然驱动转向奖励驱动,模型逐渐学会探索训练数据中低密度、但更有发现价值的区域。

奖励设计的三重目标

在奖励设计中,创造性奖励通过连续结构距离避免简单二元判断带来的不稳定优化。稳定性奖励使用机器学习力场快速估计凸包上方能量,以替代昂贵的第一性原理计算。多样性奖励则确保生成结构既不重复,也不远离合理的材料流形。图1展示了这种奖励引导如何把生成结构推向欠采样区域,同时保持化学和物理上的合理性。

策略优化算法

研究人员比较了组相对策略优化与普通 REINFORCE。结果显示,组相对策略优化通过在同一条件下比较多组候选结构,能够显著降低优势估计的波动,使强化学习训练更加稳定。图2中的训练曲线清晰表明,GRPO 的奖励提升更平滑,梯度方差更低。

消融实验进一步揭示,多样性奖励不可或缺。去掉多样性奖励后,模型很容易出现模式坍缩——反复生成少数相似结构,只通过微小几何扰动来获取奖励。这说明在材料生成中,单纯奖励稳定性和新颖性并不足够,还必须显式鼓励组成和结构上的覆盖范围。

强化学习引导生成模型发现新型晶体结构_wishdown.com

图2|策略优化算法示意图。

从头晶体生成基准

研究人员在 Alex-MP-20 数据集上评估了不同生成模型。每个模型生成 10,000 个晶体,直接对未几何优化的结构进行评估。核心指标是mSUN,即亚稳、唯一且新颖结构的比例。未经过强化学习的 Chemeleon2,mSUN 仅为 15.9%。原因在于,虽然潜在扩散模型采样效率高,但压缩潜在空间会削弱对稀有结构和极端构型的表达能力,也可能在解码时产生局部几何失真。

经过强化学习后,Chemeleon2 的 mSUN 从 15.9% 直接攀升到 61.3%,提升了 45.4 个百分点,相对提升幅度达到 285.5%。具体来看:

  • 新颖性从 62.3% 提升到 97.5%。
  • 亚稳比例从 51.2% 提升到 72.1%。
  • 唯一性从 99.4% 降至 88.7%,提示仍存在轻微的模式坍缩。

整体而言,强化学习显著提高了模型发现有效新晶体的能力。在较小的 MP-20 数据集上也观察到了类似趋势,说明这个方法并非只对单一数据集有效。

强化学习引导生成模型发现新型晶体结构_wishdown.com

图3|不同生成模型的从头晶体生成性能比较。

新颖性—稳定性困境

材料生成中有一个经典的矛盾——新颖性与稳定性之间的困境。越接近已知材料的化学空间,结构越可能稳定;越远离已知材料,结构越新颖,但也越可能热力学不可行。传统生成模型受训练分布限制,往往难以同时提升新颖性和稳定性。

研究人员用新颖性和稳定性二维图展示了不同模型的表现。强化学习后的 Chemeleon2 明显拓展了帕累托前沿,说明它不是简单牺牲稳定性来换取新颖性,而是在两者之间找到了更优的平衡点。t-SNE 结构嵌入显示,未强化学习的模型虽然覆盖较广,但有效候选稀疏;强化学习模型则形成了富含 mSUN 结构的局部簇,表明奖励函数让模型集中探索更有价值的区域。

代表性结构分析显示,模型会先识别热力学较有利的结构原型,再通过多元素、多阴离子替换来引入组成复杂性。这种策略帮助模型在稳定的结构骨架上增加化学新颖性。

强化学习引导生成模型发现新型晶体结构_wishdown.com

图4|生成模型中的新颖性—稳定性权衡。

强化学习改变组成空间探索

研究人员进一步分析了强化学习前后生成晶体的元素组成变化。结果相当有意思:强化学习显著改变了模型的搜索偏好。基线 Chemeleon2 更倾向于生成含氧、硫族元素和卤素的化合物,而强化学习后,过渡金属的比例从 26.2% 增加到 35.6%,非金属比例从 27.2% 降至 16.6%。同时,模型对 Br、I、Se 等更可极化元素的探索增加了,元素分布变得更广。

这种变化和奖励设计是吻合的。稳定性奖励偏好具有多氧化态和可调配位环境的过渡金属,创造性和多样性奖励则推动模型探索更多阳离子组合和欠表示的元素组合。研究人员还发现,强化学习模型生成了较多三元和四元化合物,其中四元体系占比最高,而且相当一部分具有较低的凸包上方能量,提示这些复杂组成中可能存在可合成的候选物。

当然,研究人员也提醒,目前模型生成的是有序周期晶体,还不能很好地区分有序化合物、无序固溶体和位点占据无序。例如,某些多金属体系可能更适合解释为固溶体,而不是确定的有序化合物。

强化学习引导生成模型发现新型晶体结构_wishdown.com

图5|强化学习驱动的组成空间探索统计。

性质引导生成

除了从头生成,研究人员还测试了性质引导设计,以目标带隙 3 eV 为例。这个目标在数据分布中属于较难的外推目标。他们比较了普通 CFG、LoRA CFG 和强化学习三种条件生成方式。

结果很直接:CFG 生成的带隙分布较宽,难以集中到目标值附近,并且会严重破坏 mSUN 指标,使有效结构比例接近零。LoRA CFG 仅略有改善。相比之下,强化学习优化后的 Chemeleon2 表现最佳:生成结构的 DFT 计算带隙明显集中在 3 eV 附近,同时保持 mSUN 为 45.3%。在 512 个初始样本中,有 82 个结构既满足 mSUN,又具有 2.7–3.3 eV 的目标带隙范围。

进一步经过 DFT 几何弛豫后,强化学习模型仍保持较强的静态带隙与弛豫后带隙相关性,说明模型生成的结构已经接近平衡构型。弛豫后,mSUN 和亚稳比例还进一步提升。这表明强化学习不仅能引导性质,还能够在性质优化过程中保持化学有效性和热力学可行性。

强化学习引导生成模型发现新型晶体结构_wishdown.com

图6|强化学习用于性质引导晶体生成。

讨论

这项研究清晰地展示了强化学习在生成式材料发现中的重要价值。传统生成模型主要学习训练数据分布,因此很容易受“像已知材料”这个目标的限制。Chemeleon2 则通过明确的奖励函数,将生成模型转变为一个主动探索工具,使其能够在新颖性、稳定性和多样性之间取得更优的平衡。

这个框架的优势在于它的模块化设计。奖励项可以根据不同的科学目标灵活替换或调整,因此不仅适用于从头发现新晶体,也适用于带隙等功能性质导向的逆向设计。与启发式条件控制方法相比,强化学习提供了一条更直接的目标优化路径,尤其适合那些需要同时满足多种约束的材料发现任务。

当然,这个方法仍存在一些局限:

  • 首先,真正的结构新颖性仍然难以精确定义,特别是对于低对称结构、轻微晶格畸变和复杂局部配位而言。
  • 其次,模型目前主要生成有序周期结构,还不能处理真实材料中常见的固溶体、位点无序、缺陷和非化学计量组成。
  • 第三,高阶多元素体系的稳定性可能由于参考相图稀疏而被高估,因此仍需要更严格的第一性原理验证和实验筛选。

未来,如果能加入更可靠的合成可行性奖励、无序结构建模和更精细的结构新颖性指标,这个框架有望成为 AI 驱动材料发现中的通用策略。

总体来看,Chemeleon2 证明了强化学习可以把晶体生成模型从被动模仿训练集,转向主动探索未知空间。这为多样、新颖且热力学可行的功能晶体发现,提供了一条全新的方法路径。

参考资料

Park, H., Walsh, A. Guiding generative models to uncover diverse and novel crystals via reinforcement learning. Nat Mach Intell (2026). https://doi.org/10.1038/s42256-026-01262-4

强化学习引导生成模型发现新型晶体结构_wishdown.com

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多