1. 量子计算中的噪声与纠错挑战量子比特Qubit本质上对噪声极为敏感即使是最稳健的量子比特其噪声水平也远低于实际量子应用所需的标准。这种噪声问题需要通过量子纠错Quantum Error Correction, QEC技术来解决。QEC是一系列能够在可控范围内识别和消除错误的技术前提是量子比特的噪声水平低于某个更易实现的阈值。在QEC方法中许多物理量子比特被编码为逻辑量子比特这些逻辑量子比特能够抵抗错误。纠错的过程包括重复测量组成逻辑量子比特的物理量子比特的特定组然后使用测量结果通过传统算法推断错误发生的位置这一过程称为解码Decoding。解码在计算上具有挑战性是QEC技术的主要瓶颈之一。构建快速、准确且可扩展的解码器对于实现实用的量子计算机至关重要。这是一个典型的案例展示了人工智能AI如何通过解决与QEC、编译和算法开发等相关的挑战来推动量子计算的发展。2. NVIDIA与QuEra的合作基于AI的解码器在GTC 25大会上NVIDIA宣布与QuEra合作利用NVIDIA CUDA-Q平台开发了一款基于Transformer的AI解码器。这款解码器不仅超越了当前最先进的解码器还为未来可扩展的解码提供了有希望的路径。这项工作的成果展示了像最近宣布的NVIDIA加速量子研究中心NVAQC这样的AI超级计算机对于量子纠错技术的开发和部署有多么关键。2.1 解码器的工作原理QEC代码通常用[[n,k,d]]命名法来描述其中n物理量子比特的数量k逻辑量子比特的数量d距离。距离越高的代码能够纠正更多的错误但通常需要更复杂的编码方案和更大的物理量子比特开销。纠错的第一步是对一组物理量子比特执行特定的测量这些测量共同产生所谓的错误综合征Error Syndrome。综合征数据随后被传输到经典处理器进行解码。解码器的目标是从错误综合征中推断是否发生了错误以及错误发生的位置。解码器输出对错误位置的最佳猜测这些猜测可以被跟踪并最终用于确定发送回量子处理单元QPU的纠正操作。这一循环在量子算法的整个执行过程中不断重复。2.2 解码器的关键要求解码器必须满足以下关键要求准确性如果解码器出错错误可能被遗漏或通过不适当的纠正引入从而可能破坏编码信息并毁掉整个算法。速度如果解码器无法跟上输入的综合征数据积压会导致错误雪球效应使得纠错变得不可能。可扩展性解码器必须能够处理未来可能需要的数百万物理量子比特。AI在复杂模式识别方面的天赋及其天然的可扩展性使其成为构建快速、准确且可扩展解码器的最有前途的工具之一。3. 魔法态蒸馏与相关解码在量子处理器QPU上实现量子算法需要一个容错的通用门集从中可以编程任何算法。在大多数容错量子计算方法中执行容错操作的策略依赖于能够准备所谓的魔法态Magic State。这些特殊状态是一种资源可以在计算中消耗以执行任意量子计算也称为通用量子计算。实际上容错量子计算机的大部分工作就是生成魔法态。但这里似乎有一个“先有鸡还是先有蛋”的问题如果没有容错操作的支持如何可靠地生成魔法态3.1 魔法态蒸馏MSD魔法态蒸馏Magic State Distillation, MSD协议将多个噪声较大的魔法态作为输入并通过一系列操作将它们“蒸馏”为单个更高保真度的魔法态。这些操作本质上是一个简单的量子纠错代码确保生成高质量的魔法态。然而MSD成本高昂。通常需要多轮MSD才能产生足够保真度的魔法态以用于算法。此外MSD所需的资源随着达到足够无噪声魔法态所需的轮数呈指数增长。这意味着任何提高每轮MSD输出效率和保真度的方法都有可能显著降低容错量子计算的开销。3.2 QuEra的实验演示QuEra最近的论文《逻辑魔法态蒸馏的实验演示》展示了在其中性原子QPU上使用逻辑量子比特进行魔法态蒸馏的实验。他们首先将35个中性原子量子比特编码为五个逻辑魔法态然后使用5-to-1协议图2蒸馏出一个更高保真度的魔法态。QuEra使用[[7,1,3]]颜色代码图2编码每个逻辑量子比特。MSD过程包含两量子比特逻辑门这也会导致逻辑量子比特之间的错误传播。为了提高输出的保真度QuEra使用了一种称为相关解码Correlated Decoding的方法其中综合征是从所有逻辑量子比特同时解释以推断错误而不是单独解码每个逻辑量子比特。这样做的好处是可以解码由逻辑两量子比特门引起的相关错误从而提高解码器的准确性。这需要一个强大的解码器能够解释来自所有35个物理量子比特的综合征。4. NVIDIA解码器的优势与架构QuEra的方法是使用最大似然错误MLE解码器来解决相关解码问题。MLE是一种高精度的解码算法但需要解决一个NP难问题因此其最先进的性能是以算法运行时间随代码大小呈指数增长为代价的。这对MLE解码器来说是一个致命问题。它们无法扩展到最小的代码距离之外。对于使用[[85,1,5]]距离5颜色代码的MSDMLE需要超过100毫秒这远远超出了任何实际使用的时间要求。NVIDIA和QuEra开发了一款基于Transformer的AI解码器使用NVIDIA PhysicsNeMo进行训练以解决这个问题。对于QuEra的距离3 MSD电路NVIDIA解码器的性能优于高性能但扩展性差的MLE解码器。4.1 解码器性能对比图3绘制了MLE和NVIDIA解码器的结果作为接受比Acceptance Ratio的函数。接受比是成功实验运行中综合征置信度高于某个阈值的比例较高的接受比会导致更高的魔法态生成率。图3显示对于给定的魔法态保真度目标NVIDIA解码器在高接受比区域可以比MLE更高效地运行并生成更多的魔法态。一个次优但可扩展的解码器对于实际应用来说仍然是MLE的改进但NVIDIA解码器在超越MLE的同时具备扩展潜力这非常有前途。通过超越MLENVIDIA解码器提供了一个强大的新工具可能还可以扩展到研究人员探索更强大纠错代码所需的代码距离。4.2 解码器架构设计NVIDIA解码器能够超越MLE的原因之一是其精心设计的架构。Transformer的注意力机制有助于动态建模不同输入之间的依赖关系使其非常有效地捕捉复杂的交互。图神经网络GNN可用于从图结构中结合相邻信息表示综合征和逻辑量子比特之间的关系。NVIDIA解码器的另一个主要优势是它主要可以使用合成数据进行训练这些数据通过模拟生成需要从实际量子硬件中获取的实验数据较少。这避免了在有限的QPU资源上执行许多成本高昂的运行。QuEra的硬件团队生成了有价值的数据来验证并在未来微调NVIDIA解码器的性能但除此之外他们可以将机器时间集中在其他工作上而模型的训练数据是使用stim生成的。stim是由Google开发并与CUDA-Q平台集成的稳定器电路模拟器。5. 利用AI超级计算机扩展NVIDIA解码器更高的距离代码对于产生足够低的逻辑错误率是必要的图4。MLE无法扩展到这一点因此NVIDIA和QuEra正在努力通过利用AI超级计算生成更高代码距离所需的训练数据来扩展NVIDIA解码器并为模型训练和推理的并行化提供AI架构。即使对于最小的d3情况MLE解码器也需要几十毫秒而NVIDIA解码器可以在不到一毫秒的时间内解码任务。5.1 数据生成与训练挑战在MLE中解码的负担被替换为训练的挑战。训练NVIDIA解码器所需的数据量随代码距离呈指数增长。团队正在努力使用CUDA-Q的GPU加速、基于轨迹的模拟器生成的数据来改进和扩展解码器。NVIDIA研究人员开发了新颖的采样算法以高效生成包含更真实的非Clifford噪声的大规模高质量数据集比之前使用CUDA-Q可能的速度快100万倍。使用这些算法单个NVIDIA DGX-H100节点可以每小时为35量子比特MSD电路的状态向量模拟生成略超过10亿次射击。数据生成可以推向极限例如使用NVIDIA Eos超级计算机它可以以每小时半万亿次射击数据的惊人速率生成数据。5.2 CUDA-Q的扩展能力CUDA-Q的噪声张量网络后端还可以将电路模拟扩展到生成更大代码距离训练数据所需的量子比特数量。在42个H100 GPU上运行的距离3代码的NVIDIA解码器训练在一小时内完成。更大的距离训练将更具挑战性需要AI超级计算的能力以及来自QuEra QPU的实验数据的微调。NVAQC将成为NVIDIA和QuEra持续努力扩展NVIDIA解码器的不可或缺的资源通过使用最先进的NVIDIA Blackwell GPU实现大规模的数据生成和训练。6. 未来展望与资源NVIDIA正在与QuEra等合作伙伴合作以产生有意义的量子纠错更广泛地说推动AI在量子领域的突破并缩短实现实用量子计算的时间线。对于那些对量子纠错研究感兴趣的研究人员可以参考CUDA-Q QEC获取更多关于NVIDIA工具的信息。要了解NVIDIA在加速量子计算发展方面的其他工作可以访问NVIDIA Quantum Computing。