Towards a quantum computer that learns from its errors
想象一场交响乐团演奏复杂杰作。如果小提琴每隔几小节就音准偏离,整个乐团就不得不反复停止、重新调音。幸好,这种情况不会发生在乐团里,因为乐器能可靠地保持音准。然而,这正是当前操作量子计算机的现实。
由于量子计算机本质上是易受漂移影响的模拟机器,要保持可靠运行就需持续校准其控制参数——即编排量子比特行为的模拟信号的频率、振幅和相位。如今,这要求完全终止整个量子计算。这种计算与校准的完全脱节是未来的根本瓶颈,因为有用的量子算法必须连续运行数天乃至数月。
为解决这一问题,我们在《Nature》发表的“Reinforcement learning control of quantum error correction”中展示了一种reinforcement learning(RL)框架:一个自主智能体从量子纠错检测中学习,持续引导数千个控制参数,使量子系统在计算过程中稳定抵御漂移。简言之:我们找到了一种在乐曲进行时就为乐器调音的方法。
应对量子错误
在音乐厅里,走音的乐器会立刻被察觉。量子世界却没有这样的奢侈。就好像聆听本身会破坏演出一样,测量量子比特会使其量子叠加态坍缩。为了保存量子信息,我们转而采用Quantum Error Correction(QEC),一种利用冗余将多个物理量子比特组合成“逻辑量子比特”的技术,并通过针对物理量子比特进行的特殊奇偶校验,将模拟噪声数字化为二进制的错误检测事件。
遗憾的是,这些比特只能告诉我们错误发生在量子电路中某个有限时空区域内,却无法指出确切位置——就像听到一个走音的音符,却不知道是哪位乐手弹错的。为了定位可能的错误位置并计算所需的纠正方案,我们需要借助 QEC 解码器,比如基于真实数据训练的神经网络解码器 AlphaQubit 和算法解码器 Tesseract。只要错误足够罕见,这些解码器就能通过分析错误检测数据,成功恢复逻辑量子信息。但解码器留下了一个关键问题没有回答:这些错误究竟为什么会发生?
有些错误源于量子系统与周围环境不可避免的相互作用,也就是所谓的退相干(decoherence)。这个无情的 процесса会摧毁宏观量子叠加态,把量子计算机打回经典计算机。这一基本现象影响如此深远,以至于我们熟悉的经典现实,正是从大自然底层的量子规律中涌现出来的。环境导致的错误固然无法完全避免,但还有许多错误来自不精确的控制校准和硬件漂移——这类缺陷,我们是有能力去改善的。
超越传统物理模型
传统上,量子校准依赖于物理模型。其技术经由数十年量子控制研究不断打磨。然而,跨多个技术领域来看,人工设计的模型不可避免地会遇到性能瓶颈。早期计算机视觉因严格依赖几何规则而停滞不前。传统机器人学仍在苦恼于运动学方程无法捕捉接触动力学与摩擦等复杂现实。同样地,在 AlphaFold 等深度学习系统取得前所未有的准确率之前,预测蛋白质折叠这一古老难题对传统物理模型而言一直难以攻克。这些领域的突破,都发生在研究方法转向直接从数据中学习之后。
近期,AlphaQubit超越了最强算法类量子纠错码(QEC)解码器的准确率。如今量子控制也面临同样的瓶颈。随着制造与硬件进步推动量子处理器性能提升,其误差日益由传统建模与校准难以应对的复杂现象主导。机器学习能否带来新的突破?
不只是纠正错误,而是从中学习!
Google Research 有着利用强化学习(RL)解决传统编程难以应对的复杂问题的深厚积淀。与依赖显式指令的算法不同,RL 通过经验运作:自主智能体尝试不同行为,并直接从由此产生的误差中学习以优化策略。将 RL 应用于实现精确且连续的量子校准似乎顺理成章。由于 QEC 已能持续生成探测事件流,我们只需赋予这些数据互补的角色:除了用于解码和纠错之外,我们还将探测事件作为主动学习信号。随着计算推进,RL 智能体监测这些信号,学习动态调整控制参数,从而抵消漂移并防止新误差的产生。
量子计算通过模拟控制信号在物理层面实现。解码器利用量子纠错事件来推断逻辑修正。在我们的控制框架中,这些事件被重新用作学习信号,训练强化学习智能体在计算过程中持续调整数千个控制参数,从而稳定量子系统。
我们的量子控制实验
我们在旗舰 Willow 超导处理器上验证了这种强化学习量子控制方法。通过故意注入人工漂移的控制参数,我们证明强化学习将纠错码的逻辑稳定性提升了 3.5 倍,延长了处理器作为可靠“量子存储”设备的时间。
通常,将处理器调优至最佳性能高度依赖“人工介入循环”方法,科学家运用物理直觉解决难以自动化的边缘情况。然而,即使在 exhaustive 的专家校准之后,后续的强化学习微调仍将逻辑错误率系统性降低了 20%。
本实验中所有技术的整合,将量子存储中的逻辑错误降低至历史最低水平:在 表面码 中每千次纠错循环不到一次错误,在 颜色码 中每百次纠错循环仅一次错误。
基于表面码(左)和颜色码(右)的量子纠错延长了量子存储中逻辑信息的寿命。强化学习微调我们的控制器,通过规避复杂物理模型和人类直觉的局限,提升了 QEC 的质量。
它能否扩展?
机器学习和量子研究人员的关键问题是:这种强化学习方法能否扩展到未来大型量子计算机。为检验这一点,我们进行了数百个量子比特和数万控制参数的数值模拟。
在模拟中,校准失准的系统起初物理错误率很高。智能体通过学习更优的控制参数,逐步降低错误率,而在 QEC 的作用下,逻辑错误率(LER)随系统规模(即物理量子比特数)呈指数级下降。关键在于,RL 降低物理错误率的速度与系统规模无关,这使该方法可以扩展到规模大得多的系统。
模拟结果验证了我们的预期:由于 QEC 检测事件对错误的敏感性是局部的,RL 训练所需的迭代次数(epoch)与系统规模无关。不过,要充分发挥 RL 框架的潜力,还需要更紧密的集成。我们希望通过加快智能体与量子处理器之间的通信周期,并采用更先进的机器学习方法,实现更大的性能提升。
这项工作由此开启了一种新范式:一台能从错误中学习、计算永不停止的量子计算机。
致谢
感谢共同作者们的贡献,包括硬件、软件、低温系统和电子设备的搭建与维护。这项工作由 Google Research 的 Google Quantum AI 团队与 Google DeepMind 的团队协作完成。