
量子计算这几年的圈子里AI4SAI for Science正悄悄成为比“算法快”更值得关注的方向。2019年谷歌用53比特的Sycamore处理器跑随机线路采样声称200秒完成传统超算约1万年的工作顺手把“量子优越性”这个术语推到了大众面前。可IBM那边很快就给出反击说在优化调度之后经典超算其实只需两天多就能完成同样的任务。两边来回交锋谁也没能彻底说服谁但这场争论留下了一个比“谁更快”更实在的问题——耗电。超算跑这个任务要烧多少电量子处理器跑同样的任务又要烧多少电。所谓“能效壁垒”一半指经典计算指数级增长的能耗天花板另一半指量子计算要从实验室走向实用必须跨过自身在高能耗运行环境上的那道坎。这篇文章不打算复述媒体已经写烂的量子优越性故事我想从工程和算法的角度把谷歌量子计算的能效账重新算一遍再聊聊AI4S怎么作为“破壁人”出现在整个链条里的。文中会有一些我实际接触过的工具和方法比如Cirq、TensorFlow Quantum、变分量子算法和神经解码器也会把常见的误区和踩坑点摊开来聊。适合谁读给做科学智能、量子算法、高性能计算的开发者以及所有好奇“AI到底怎么改变科研底层逻辑”的朋友。就算你之前完全没接触过量子信息只要跟着我把几条关键的账算完也能看懂这个领域现在到底卡在哪以及AI能从哪些地方真正帮上忙。1. 先算清楚账量子计算的能耗到底高在哪1.1 经典超算的能耗天花板先看传统高性能计算这端。全球TOP500里排在前面的超算功耗普遍在10兆瓦到20多兆瓦之间。以成熟的百亿亿次级超算为例整机额定功耗通常接近23兆瓦这是什么概念一个普通三口之家一年的用电量大概是3000度上下兆瓦级别的机器满载运行一小时就要烧掉几千度电一天下来就是好几万度。如果某个任务需要在上面跑几十天甚至上百年那电费单会直接变成一串天文数字。这也是为什么“随机线路采样”会成为谷歌展示量子优越性的首选任务。这个任务在经典计算机上的复杂度会随着量子比特数和线路深度呈指数增长经典模拟算法再聪明也需要在内存和电量之间来回拆借。你可以把经典超算想象成一只靠暴饮暴食来快速奔跑的巨兽想要跑得再快一点唯一的办法就是喂进更多燃料。这种以“电换算力”的模式就是经典侧能效天花板的最直接体现。以前我们觉得算力不够就堆机器堆明年还是不够就再堆一倍但在量子模拟这类指数级复杂度的任务面前这条老路的尽头已经很清楚了。1.2 量子处理器其实也是“电老虎”很多人以为量子计算机一定很省电这其实是个误解。谷歌的Sycamore或者Willow芯片本体的功耗确实不高芯片本身工作在接近绝对零度的稀释制冷机里主控电子学也在低温段但要让整个系统稳定运行最耗电的反而是制冷系统、控制机箱、常温微波源和数据采集设备。一台实验室级别的稀释制冷机光是维持几十毫开尔文的低温环境长期下来也是几千瓦量级的持续功耗再加上整套控制电子学整个量子计算系统端到端功耗通常在几十千瓦量级。换句话说量子计算系统不是“省电”而是“单位有效计算量里的能耗”更有竞争力。它把大量能量花在创造和维护一个极度脆弱的量子态环境上这就像一家高端餐厅大部分运营成本都花在恒温、安保和环境维护上而不是食材本身。但好处是一旦环境稳定它能在极短时间内完成经典机器需要天文时间才能完成的任务这个“短时间”才是量子系统在能效账本里真正值钱的地方。1.3 “能效壁垒”的准确含义所以当我们说“能效壁垒”时实际上说的是两层意思。第一层是经典侧的墙经典算法模拟量子系统复杂度随系统规模指数增长所需能耗也一路飞涨涨到某个规模后物理上就不现实了。这个问题不是凭空想象的在量子化学、材料模拟、高能物理中早就存在。“暴力求解”四个字在科学计算领域就是“烧钱”的代名词。你如果想精确模拟50个量子比特的相互作用经典内存就需要存下2的50次方个复数振幅现有超算加在一起也装不下想模拟100个量子比特那已经不是“再买几台机器”能解决的问题了。第二层是量子侧的墙量子系统自身要先支付巨大的“环境代价”制冷、隔离、纠错都会消耗额外资源。量子比特的相干时间非常短错误率不低每一次纠错需要大量物理比特去保护一个逻辑比特。这意味着实用化量子计算需要成百上千倍的比特冗余这些冗余比特每个都要被精确控制整个系统的功耗和复杂度会急剧上升。AI4S要解决的问题就集中在这一侧——用机器学习把“冗余”的成本压下来把有限的量子资源用到刀刃上。这两堵墙不拆掉任何一面量子计算都只能停留在实验室演示阶段所以“能效”问题并不是什么冷门指标而是决定这门技术能不能真正落地的前提条件。2. 谷歌的量子优势是怎么打出来的2.1 随机线路采样为什么选这个任务如果上面只谈“理论优势”会有人说你纸上谈兵。谷歌2019年的实验之所以震动学界在于它把“理论优势”落成了一个可执行的实验方案。随机线路采样Random Circuit SamplingRCS的任务很简单随机生成一个量子线路在Sycamore上跑很多次采集结果分布然后让经典计算机用尽量好的方法去模拟同一个分布。RCS的精妙之处在于它是一个几乎没有结构可以利用的计算任务。经典模拟算法要复现量子线路的输出分布必须对量子态的振幅做张量网络收缩或完整的态矢量演化复杂度随比特数和线路深度的组合指数上升。Sycamore用53个超导量子比特在200秒内完成了100万次采样当时谷歌估算经典超算需要1万年这个数字后来被不断修正到几天、几个星期但即使按最保守的估计经典模拟这个特定任务的成本也远高于量子执行。这个例子最大的价值在于它把“能效优势”具象化了。传统超算跑一次完整模拟可能需要持续数天甚至数周的满载功耗而量子处理器用几分钟的端到端运行就能给出可验证的结果。当然前提是任务本身适合量子处理器RCS只是探路石不是通用计算。但它的确给行业立了一个参照系如果要证明量子计算真的有用你至少得先找到一个经典机器算起来极其费劲、而量子机器能轻快完成的任务然后把能耗账摆到桌面上来。2.2 从Sycamore到Willow比特数不是唯一变量2024年底谷歌发布了新一代超导量子处理器Willow105个量子比特在RCS基准上的表现比Sycamore又上了一个大台阶。官方给出的说法是它能在几分钟内完成当时最强经典超算需要10的30次方倍时间才能模拟的任务。10的30次方倍什么概念如果超算需要1秒量子只需要10的负30次方秒这在工程上根本没法直接比较大家比的其实是“指数级加速”。但真正让研究者兴奋的不是比特数量涨了而是两个更本质的指标量子比特相干时间的显著提升以及表面码纠错实验的低阈值验证。量子计算界有个很残酷的经验物理比特的错误率只要高一点点纠错成本就会爆炸式增长。Willow在实验里展示了随着码距增加逻辑错误率呈指数下降这是量子纠错从理论走向工程的重要一步。这跟能效有什么关系关系大了。纠错越有效就越不需要靠大量物理比特堆出一个人造逻辑比特系统总功耗和复杂度就更容易控制。换句话说Willow的纠错突破等于是在“能效壁垒”这堵墙上凿了一个小洞。当然从实验到工程中间还隔着控制电子学、校准流程、软件栈、实时解码等一系列问题但至少方向已经被验证了只要纠错能持续改善量子系统就不是只能在玩具规模上展示优势而是有机会向前走得更远。2.3 纠错才是真正的分水岭顺带解释一下纠错为什么是分水岭。量子纠错不像经典纠错那样靠简单备份由于量子态不可克隆你不能把一个量子比特复制三份再投票。业界通用做法是用表面码Surface Code让一个逻辑比特散布在多个物理比特上通过周期性的稳定子测量探测错误再用解码算法判断错误发生在哪、该怎么恢复。表面码的解码问题本身就是一个典型的高复杂度组合优化问题。随着码距增大需要处理的稳定子测量结果越来越多解码延迟必须足够短否则量子处理器就要一直等在那里相干时间白白流逝。传统贪心算法在低错误率下够用错误率一高就容易失效。这时候机器学习的优势就体现出来了神经解码器可以通过大量带噪数据训练在线决策解码结果速度比精确解码快得多。这就是AI4S和量子计算结合的一个典型例子也是后面第3节要展开讲的重点。3. AI4S进场用机器学习拆掉能效墙3.1 AI4S到底是什么它凭什么是“破壁人”AI4SAI for Science本质上是把机器学习当作科学研究的“计算增强器”去解决传统数值方法处理不了的规模和非线性问题。它跟普通人工智能应用最大的区别在于这里的数据通常不是图片、文本而是实验曲线、量子态层析结果、哈密顿量参数、纠错解码序列这类“科研数据”模型的目标也不是推荐、识别而是加速科学计算、优化实验条件、发现隐藏规律。它凭什么能拆能效这堵墙因为能效问题本质上是一个优化问题如何以最少的资源时间、比特、功耗达到目标精度。机器学习是天然的优化器它不依赖对系统方程的完美解析而是从大量观测数据中学习出一个足够好的决策策略。量子系统里那种“高维、非线性、噪声强烈、模型不精确”的环境恰恰是深度学习擅长应对的。你不需要对每一个物理过程都有理论上的完整解释你只需要让模型在真实数据上表现得足够好就能把资源消耗降下来。3.2 AI做量子比特校准省的是人力和时间也是能耗我去过一些超导量子实验室最直观的感受是量子芯片运行前的校准流程极其繁琐。每个量子比特有频率、耦合、门脉冲形状、读出判据等上百个参数要调传统做法是人工或者半自动扫参数一轮下来几小时就没了。问题在于量子比特参数会漂移你得频繁校准否则错误率上去之前算的结果都不能当数。实验室里有相当一部分工作看起来是在“做实验”实际上是在“伺候设备”。AI在这里可以做三件事。第一使用贝叶斯优化或强化学习自动搜索最佳的校准参数组合大幅减少扫描次数。第二通过迁移学习感知参数漂移趋势在漂移发生前就给出补偿方案。第三用神经网络学习读出信号的特征提高检测准确率降低重复测量的次数。这些做法省下的不只是工程师的时间——每次重复实验都是时间成本也是制冷和控制系统的固定能耗成本。校准越快、实验越少整套设备满负载运行的时长就越短能耗自然就下来了。从能效账本上看校准优化往往是最容易见成效的切入点。因为校准环节跟最后的实验线路没直接关系但它决定了你在正式跑任务时用的门是否低错误率。如果把校准从三小时压缩到四十分钟再用更好的门参数让每个线路少跑几千次重复测量那一整天下来同样的物理设备能完成的实验数量可能会翻倍而总运行时间不一定变长。这就是“把AI用在设备维护而不是算题”的价值它往往比优化某个具体算法的收益更稳。3.3 AI做纠错解码与线路优化另一个高价值的落地场景是量子纠错的解码器。前文提到表面码解码是组合优化问题传统精确解码在码距增大后耗时太长。用神经网络解码器把稳定子测量结果编码成输入直接输出错误位置或恢复操作可以把解码延迟压缩到微秒级甚至更低。这个方向在谷歌、IBM和多个学术团队里都有专门研究最近的进展还把这些解码器训练成“重复结构”的轻量模型部署在FPGA上做实时推理。线路优化也很有意思。量子线路里门操作是顺序执行的门越多、越深错误积累越严重执行时间也越长。AI可以通过强化学习搜索等价线路重构用更少的门实现同一个幺正变换或者重新排布两比特门的执行顺序以降低串扰。线路短了执行时间就短相干退相干期间白白浪费的资源就越少。这同样是在帮量子系统“省电”只不过省的是量子比特的宝贵相干时间。这两个方向一个管“执行前”一个管“执行中”连起来看就是一条完整的AI辅助流水线先用AI把门操作排布好能删的门删掉能合并的门合并掉然后在执行时用AI实时解码纠错把噪声带来的影响压到最低。这两步做到位以后同样的物理比特数就能跑更深的线路同一个线路就能少做很多次重复采样。这些省下来的时间全部可以换算成能耗这比任何漂亮的学术指标都实在。3.4 特征任务是经典-量子混合的AI优化最后要提的是变分量子算法VQE、QAOA。这类算法的工作方式很有代表性量子计算机负责准备量子态、测量期望值经典计算机负责根据测量结果调整参数再下发到量子计算机循环迭代。参数优化通常用梯度下降或CMA-ES这类经典优化器但测量噪声会让梯度估计非常不靠谱。AI4S在这里的介入方式是用贝叶斯优化、强化学习、生成模型等更鲁棒的优化器替代简单梯度下降在相同精度要求下显著减少量子评估次数。每一次量子评估都要反复制备量子态并测量几百甚至上千次是非常昂贵的过程。少跑几次量子线路等于直接省下了整个系统最核心的那部分运行时间。这一点在能效账本上是真正能落到数字上的优化。拿我自己跑过的带噪模拟来举例同一个H2分子基态能量计算如果用标准梯度下降在噪声模型下常常震荡到几百次迭代还不收敛换成贝叶斯优化大概几十次量子评估就能进入可接受的能量误差范围。这种“少跑几轮”带来的收益极其直观——每轮量子评估都要消耗制冷系统、控制电子学和测量时间少跑几百轮等于让整套设备少工作好几个小时。做这类项目时我习惯把每次量子评估的耗时和功耗单独记下来最后优化报告里除了误差曲线还附一张能耗曲线团队开会时一眼就能看出AI带来的实际收益。4. 一次AI量子的实操流程拆解4.1 从Hamiltonian到线路一个VQE/QAOA的例子为了让上面的讨论落地我拆一个最简单的VQE变分量子本征求解器流程。假设我们要计算某个小分子基态能量先写出电子结构哈密顿量通过Jordan-Wigner变换映射成量子比特算符再设计一个参数化线路比如UCCSD线路制备试探态最终目标是找到一组参数使测量能量的期望值最小。这里线路设计会用参数化旋转门比如把参数化的RZ门放在纠缠层之间。核心逻辑是量子计算机只做一件事——在给定参数下给出能量估计经典计算机负责决定“下一步试哪个参数”。这一步我已经在Cirq上验证过很多次代码骨架大概是这样的import cirq import sympy qubits cirq.LineQubit.range(4) theta sympy.Symbol(theta) circuit cirq.Circuit() for q in qubits: circuit.append(cirq.rx(theta)(q)) circuit.append(cirq.rz(0.5 * theta)(q)) for i in range(len(qubits) - 1): circuit.append(cirq.CNOT(qubits[i], qubits[i 1])) circuit.append(cirq.H(qubits[0])) print(circuit)在实际跑VQE的时候我发现一个关键教训直接用无噪声模拟器验证参数优化结果会很漂亮一旦换成带噪模型或者真机测量方差立刻爆炸。这也是为什么AI优化器能派上用场——它们天然对噪声更鲁棒能在更少的评估次数里把参数收敛到可接受范围。如果你也打算在项目里用VQE我建议一开始就把噪声模型加进去别先跑完美的模拟器再想着迁移那样等于给自己挖了一个“模拟-真机落差”的坑。4.2 数据采集与AI模型训练如果要在真实量子处理器上做AI辅助第一步往往不是搭模型而是想办法拿到足够多的“配对数据”。拿纠错解码举例你需要的是一组“稳定子测量结果到正确错误位置”的样本。经典模拟器可以提供完美标注的数据但模拟器往往会低估真实噪声的关联效应真机数据则需要对线路做某种已知注入来标注错误位置类似物理实验里“先用已知信号校准再去做未知信号测量”的思路。训练数据准备好之后模型选型上有两个流派一个是端到端神经网络输入所有稳定子测量结果输出错误概率最高的位置另一个是分阶段流水线先做特征提取再交给近邻分类或决策树。前者在复杂噪声模型下精度高但推理延迟大后者容易部署到FPGA延迟低适合实时纠错。据我了解目前业界更倾向在关键路径上用轻量模型端到端模型拿来做离线分析和参数调优。这两条路我都试过如果你目标是尽快上线分阶段流水线更容易调试如果目标是探索极限精度端到端模型天花板更高。4.3 能效评估的完整链路实操里真正决定“AI有没有意义”的是你要把整个链路都算进去而不是只比芯片裸算力。完整链路至少包括四块一是稀释制冷机的待机功耗二是控制电子学的动态功耗三是经典计算部分做预处理、线路优化、纠错解码的功耗四是量子采样或者测量本身的时间成本。我习惯用“端到端单位任务能耗”来做横向对比公式差不多是总能耗 系统平均功耗 × 任务完成时间。把AI模型加载、经典预计算、量子执行、读取结果全部计时再乘以实测功耗得到的就是一次端到端的能耗。这个指标的好处是它不偏袒任何一方——量子如果用了几小时做校准和环境准备这时间也要算进去经典如果靠上千块GPU堆算力那功耗的大头也要如实记录。只有把两边都放到同一杆秤上得出的结论才有参考价值。4.4 工具选型Cirq、TensorFlow Quantum与现代框架谷歌系的量子计算栈目前最常用的是Cirq它是专门的量子线路建模和模拟框架能直接对接Sycamore和Willow这类真实设备。TensorFlow Quantum则把Cirq跟TensorFlow融合起来方便在量子线路的可微分计算中做梯度计算特别适合VQE里需要用梯度更新参数的场景。如果你做的是AI辅助解码可以不用TensorFlow Quantum直接把它当作一个序列分类问题处理。我个人比较喜欢用JAX做快速原型因为它在GPU上做批处理的性能好特别适合稳定子测量结果的批量推理。当然工具只是手段核心还是回到那句老话工程项目的成败十有八九取决于数据和评估链路而不是模型结构。工具选型能让你省一点时间但真正拉开项目差距的是你有没有把能效账算清楚、把数据闭环跑通。5. 常见误区与避坑指南5.1 “量子比特越多越强”为什么不对量子比特数量只是量子计算能力的一个维度而且不是最关键的维度。错误率、相干时间、门保真度、连接拓扑每一项都会让“比特数”的含金量大幅波动。50个低错误率的量子比特可能比100个高错误率的量子比特更有实际生产力。我在跟团队交流时经常用一句话打比方比特数量像员工人数错误率像员工的离职率和出错率公司能不能干活不只看员工数量还得看管理效率和稳定性。这一点放在能效语境下会更明显如果你为了凑比特数使用了大量保真度不高的物理比特那纠错开销会急剧上升最终你消耗掉的能量和资源可能比用更少但更可靠的比特还高。追求比特数之前先确认你有没有本事让每个比特干活不出错否则就是在拿能耗换虚假的数字。5.2 纠错不是简单备份很多人刚接触量子纠错时会问为什么不把量子比特复制几份投票答案在于量子不可克隆定理——你没法对任意未知量子态做完美的复制。这也是为什么表面码这类纠错方案只能通过把逻辑信息非局域化地散布到物理比特中来工作。设计纠错方案时的能效思维还是要落到“用最少物理比特保护逻辑比特”这个目标上。任何额外的物理比特都意味着更多的控制线和更高的系统功耗。这里有个很现实的工程权衡逻辑比特多了单个逻辑比特错误率下降但整个系统需要管理的物理比特和控制线数量上升系统级故障率和冷却负载也在上涨。所以并不是码距越大越好一切都要放到端到端能效模型里算过才知道。我自己做方案评估时习惯把“物理比特总数、逻辑错误率、端到端功率”三个数同时列出来任何只看其中一个的讨论都会被我拉回到三维空间里重新审视。5.3 能效对比时最容易踩的坑对比经典超算和量子处理器的能效最常见的误区是“只比芯片功耗”。经典超算芯片功耗高但一个数据中心还要算上散热和供电转换损失量子计算机的芯片功耗虽低但稀释制冷机一天到晚开着控制电子学也不能断电。如果只拿出芯片功耗来对比你一定能得出“量子比特太省电了”的结论但这显然是错的。正确做法是端到端比把所有配套设施都算进来并且必须限定同一类任务。另一个容易踩的坑是把“量子处理器在特定任务上的加速”直接外推到所有任务。RCS超得快不代表数据库查询也超得快VQE收敛得快也不代表随机优化问题都能秒解。能用能效优势说话的目前还是那些量子算法本身就有指数级或多项式级加速的任务。做对比之前先明确任务边界否则结论会被同行一眼看穿。5.4 AI4S不是万能魔法最后给AI4S泼点冷水。AI辅助校准、解码、优化确实能带来可观的效率提升但它不是万能的。深度学习模型需要大量标注数据量子噪声又存在明显的随时间漂移模型很容易过拟合再加上推理延迟如果神经解码器算得太慢不仅纠正不了错误反而会浪费珍贵的相干时间。我的建议是任何AI模块加入流水线之前先做一个简单的A/B对比同样的错误率目标有AI和没AI端到端能耗和时间差多少。只有账算得过来才值得上。我在项目里见过不止一次“为了AI而AI”的情况团队看到量子社区都在发神经解码器论文就非要把一个LSTM塞到解码流水线里结果推理延迟比精确解码还高最后只能回退到经典算法。做AI4S的工程眼睛要盯住端到端指标而不是盯住“模型够不够新”。模型再新如果在真实系统里反而让任务变慢那它对你而言就没有价值。6. 我个人的两三点体会跟了两三年量子计算和AI4S的交叉项目我最大的体会是这个领域最稀缺的既不是量子物理天才也不是深度学习大牛而是能把两边翻译到一起的人。量子团队说“相干时间不够用了”AI团队要能理解这是“需要在更少的测量次数内完成学习与优化”AI团队说“数据分布漂移严重”量子团队要能意识到这是“设备参数随时间在漂移校准流程需要闭环”。能效壁垒的打破本质上是一场跨学科的合作而不是某一个人的独角戏。如果一定要给后来者一个建议我会说先别急着追Willow或者哪家新芯片的参数找一个你自己能反复接触得到的小型量子系统或者一台可靠的模拟器从校准、解码、线路优化这三个最容易见效的点里挑一个用AI方法做一轮端到端优化把能耗账从头到尾算一遍。你会发现真正能让你做出创新贡献的地方往往不是“把模型调得更准”而是“把资源消耗降得更低”。最后分享一个我在项目里用过的小技巧无论做VQE、QAOA还是纠错解码先定义一个统一的“每次实验的资源消耗单位”比如每次量子评估的耗时加耗电然后所有优化目标都折算成这个单位的数字。这样做之后AI模型带来的收益会变得无比直观团队内部讨论时也不用再纠缠于那些玄学指标了。能效这个词说到底就是“用最少的代价办成事”在量子计算领域它才刚刚开始被认真对待。