ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

可重构多功能集成光计算芯片:从设计到流片的完整拆解

可重构多功能集成光计算芯片:从设计到流片的完整拆解 老读者都知道我这两年对集成光计算这块盯得比较紧。前几天在eLight上看到北京大学胡小永、杨起帆、龚旗煌团队的“可重构多功能集成光计算芯片”翻来覆去读了几遍觉得这个方向值得好好拆一拆。光计算不是新概念但“可重构”和“多功能”这两个词放到一颗芯片上意味着它不再是实验室里只能跑固定算法的演示品而是开始往通用AI加速硬件方向靠了。这篇文章我就从设计思路、器件实现、流片测试到踩坑排查完整聊一遍这类芯片到底是怎么做的、难点在哪、适合哪些人参考。1. 从“专用”到“可重构”多功能光芯片在算什么账1.1 为什么光计算现在才站到台前先说个大背景。AI算力需求这几年涨得有多凶做硬件的应该都有体感。电芯片不是不能算而是算力密度和功耗密度都快碰到天花板了。传统数字芯片走的是冯·诺依曼架构计算和存储分开数据搬运消耗了大量能量这就是大家常说的“内存墙”和“功耗墙”。晶体管微缩带来的红利也在放缓靠堆工艺节点换性能的路越走越窄。光的优势在于它天然适合做线性代数运算。光波的干涉、衍射、模式叠加本质上就是矩阵乘法的物理实现。一束光通过一个干涉仪网络输出端的光强和相位就完成了权重矩阵和输入向量的乘法而且所有通道并行处理不需要逐时钟搬运数据。打个比方电计算像单车道公路上跑车就算车速再快也会堵光计算是几百条车道同时跑理论上带宽和延迟都占优。但光计算不是一个新故事几十年前就有光学处理器。为什么以前没成核心问题在于体积和精度。分立光学元件搭出来的系统一大桌子镜片、透镜、空间光调制器体积大、稳定性差、没法量产。直到CMOS兼容的硅光工艺成熟能把波导、耦合器、调制器集成到毫米级芯片上光计算才拥有了“芯片化”的现实基础。这也是为什么近五年集成光计算芯片突然变成热门方向背后是工艺平台从实验室走向代工厂的结果。1.2 “可重构”带来的本质变化所谓可重构就是同一颗芯片上的光学网络可以动态改变传输矩阵。早期光计算芯片大多是专用设计版图画好以后能算的功能就固定死了。比如专门做某个固定矩阵乘法或者做固定卷积换了任务就要重新设计流片周期长、成本高、可复用性差。可重构芯片把“硬件写死”变成了“软件可写”。它通过片上集成的移相器比如热光移相器或电光移相器逐个调整干涉仪两臂的相位差从而改变整个网络的传输矩阵。这相当于把光学处理器变成了一个可编程的光学模拟计算单元。换个任务不需要换芯片只需要重新写一套控制电压网络就执行新的矩阵乘法。这个特性对AI推理尤其有价值。AI模型的权重矩阵是训练好之后固定下来的但不同模型、不同层、不同批次矩阵内容完全不同。专用光芯片只能跑一个模型可重构光芯片可以通过配置加载不同权重一个硬件跑多种模型。从商业角度看可重构意味着流片成本被摊销到更多场景里从科研角度看一片芯片可以反复做多种验证实验不用每改一次算法就重新流片一次。不过万事都有代价。可重构引入了额外的控制和校准开销移相器本身有插入损耗加热调相还要消耗电功率。所以“可重构”不是白来的它本质上是在用控制复杂度和功耗换取灵活性。设计者要算的就是这笔账值不值。1.3 多功能集成不是“堆功能”“多功能”这三个字听起来像是往一颗芯片上堆好几个模块其实没那么简单。可重构光芯片的多功能核心在于同一个光学网络中通过改变工作状态执行不同类型计算任务。举个例子。一个由马赫-曾德尔干涉仪MZI级联构成的可编程光网络调节各干涉仪的相位可以让整个网络等效成一个任意复矩阵。做全连接神经网络时这个矩阵就是权重矩阵做卷积神经网络时把输入图像分块展开成向量矩阵就变成了卷积核矩阵做信号处理时它可以是滤波矩阵。同一个硬件加载不同的相位配置就在执行完全不同的算法。所以多功能集成的本质是把“传输矩阵可编程”这一点用足。它依赖的是数学上的矩阵分解一个任意矩阵可以被分解成一系列Givens旋转的乘积而MZI干涉仪恰好就是实现二维旋转变换的光学器件。多级MZI级联起来就能模拟任意矩阵变换。理解了这一层才知道设计芯片时不是看堆了多少功能模块而是看网络拓扑能不能覆盖需要的矩阵自由度、控制精度够不够。2. 核心细节解析控制、材料与工艺上要抠哪些点2.1 片上光学系统的三个层次要理解一颗可重构光计算芯片如何工作可以从三个层次去拆光路调控层、材料响应层、控制接口层。光路调控层负责构建网络拓扑常见结构有MZI网格、微环谐振器阵列、衍射光学单元。MZI网格最经典2×2干涉仪通过级联构成大规模幺正矩阵网络。微环阵列的优势是波长选择性好可以做波分复用不同波长同时执行不同运算相当于把多个计算通道叠加到同一根波导里。衍射光学单元结构紧凑但可调性相对弱一些。材料响应层决定“相位怎么调”。硅基平台利用热光效应通过加热改变波导折射率响应速度在微秒到亚毫秒级功耗通常在几十毫瓦每π相移。电光效应在硅里很弱更多是借助耗尽型PN结做高速调制但相移量有限。相变材料如GST通过晶态-非晶态切换实现非易失的折射率变化掉电不丢权重但插入损耗和写循环寿命是短板。薄膜铌酸锂电光效应强、速度极高缺点是工艺成熟度和与CMOS的兼容性还在爬坡。控制接口层负责把外部数字信号转成片上相位变化。每个移相器都需要一个DAC通道通过电极给加热器或调制器加电压。芯片的引脚数、驱动板的通道数、校准映射表的标定精度都会直接限制可用的矩阵精度。不少可重构光芯片设计完光学部分没问题反倒在控制链路上翻车这是非常常见的工程陷阱。2.2 材料方案怎么选不同材料平台的可重构光计算芯片特性差异极大做选型时要看应用场景偏重哪头。材料平台调制机制速度功耗优势短板硅光SOI热光/电光热光μs级电光GHz级热光功耗高CMOS兼容工艺成熟器件紧凑电光效应弱高速调制难氮化硅热光为主μs级中等损耗低功率承受高调制方式有限器件尺寸大相变材料GST晶态转变ns级切换写脉冲功耗高非易失保持权重插损高循环寿命有限薄膜铌酸锂电光GHz级低高速、低损耗、线性好工艺成熟度低成本高硅光平台还是目前的主流选择原因很现实代工厂PDK成熟MZI、耦合器、移相器都有标准库设计者可以把精力放在网络架构和控制算法上。氮化硅更多用于低损耗无源网络适合做较大规模的光信号分发但调制能力弱经常要和硅光或其它有源材料混合集成。相变材料适合对能效和掉电保存有要求的场景但目前写循环次数和光损耗仍是痛点。薄膜铌酸锂是高速调制的方向适合需要GHz级权重更新的工作但它的成熟度还支撑不了大规模集成。北大团队这类顶刊工作到底选了哪条路线具体平台和工艺细节要以原文为准。但从领域整体趋势看主流思路还是硅基或氮化物基平台上做热光调相再叠加复用维度来扩展功能。原因很直接这类方案和代工厂PDK兼容性最好流片可靠测试链路相对成熟能支撑“可重构”和“多功能”验证所需的片上规模和通道数。2.3 可重构权重在片上是怎么落地的纸上谈兵说“可编程”听起来简单实际往片上落地全是细节。首先每个移相器都要能精确产生0到2π的相位变化。热光移相器靠加热器升温改变波导折射率相位变化量Δφ2π/λ·Δn·L其中L是移相区长度Δn是热光效应引起的折射率变化。要做满2π范围需要根据材料热光系数计算加热功率和相移器长度留一定冗余。但真正麻烦的不只是产生相位而是“写对”和“保持住”。写对权重需要一个标定好的电压-相位映射表。由于工艺波动、温度漂移、串扰影响这个映射不是线性的也不是固定的。实测中通常要先逐通道标定再建查找表运行时通过查找表反查电压。保持权重则需要控温芯片温度变化0.1℃热光移相器的相位就可能偏掉好几度矩阵精度直接崩掉。如果用了相变材料权重写入变成另一种逻辑用光脉冲或电脉冲把材料在晶态和非晶态之间切换不同状态对应不同折射率相位信息就“冻”在里面了。好处是不需要持续供电坏处是每次写循环会造成材料损伤多次擦写后折射率漂移要定期校准补偿。所以可重构光芯片的底层本质上是个精密的标定和控制问题光学设计只占一半另一半是“如何让相位写准、待稳定”。3. 从设计到流片这类芯片的工程实现链路3.1 设计仿真先在虚拟环境里把网络跑通做可重构集成光计算芯片不会有人直接拿版图去流片流程一定是仿真先行。现在主流的光电子设计工具比如Lumerical、Photonic Design Kit配合Ansys Interconnect可以对MZI网络做系统级建模。设计人员先从工艺库调出MZI、定向耦合器、热光移相器的行为模型搭出N×N网络拓扑再做链路仿真验证网络是否具备目标矩阵表达能力。一个很关键的计算过程是理解MZI级联网络的矩阵表达能力。单个MZI的传输矩阵可以写成2×2酉矩阵对应一个二维旋转变换。多个MZI按特定拓扑级联组合起来的传输矩阵就是一系列旋转矩阵的乘积覆盖整个SU(N)群。从线性代数角度任意N×N矩阵都能通过SVD分解成酉矩阵乘以对角矩阵再乘以酉矩阵而酉矩阵正好能被MZI网络分解实现。所以设计MZI级联拓扑时核心目标是保证它能分解出目标矩阵需要的所有自由度。仿真阶段还要做损耗预算。可重构网络里光要经过几十上百个分束器和移相器每个器件都有损耗末端光功率可能只剩百分之几。预算表格通常按每级耦合器0.1-0.5dB插损、每条波导0.5-1dB/cm传输损耗来估算。如果预算下来总插损超过10dB系统信噪比就会恶化矩阵精度很难保证这时要回头优化拓扑或者减少级联级数。3.2 版图和工艺约束面积、功耗、引脚都是钱版图设计阶段现实约束比仿真模型多得多。首先是工艺规则最小线宽、最小弯曲半径、最小波导间距这些决定了网络能塞多少级MZI。硅光平台波导弯曲半径一般要大于5微米太小的弯会造成辐射损耗波导间距太小相邻信道之间的串扰会显著。设计版图时要留出足够的间隔是把网络布局加大的主要原因。热光移相器是功耗大户。典型硅波导热光移相器功耗在20-50mW/π一个64×64的MZI网络有上千个移相器全功率开通就是几十瓦的量级。如果不做功耗管理芯片散热根本扛不住。常见的做法是差分设计、占空比控制或者只在写入权重时短时加电推理时把电压降到保持值。电极和焊盘布局也得避开光波导防止金属吸收造成额外损耗。输入输出耦合也是工程重点。可重构芯片通道多端面耦合器阵列或光栅耦合器阵列几乎是标配。测试时要通过光纤阵列对准芯片端面这个过程比电芯片测试繁琐很多耦合损耗稍微没对准就是几个dB没了。流片时一般会同时做几种耦合器尺寸的测试结构方便后续筛选最优版本。3.3 测试与标定把控制电压映射成相位芯片拿到手第一轮测试是无源表征用宽带光源加光谱仪扫出通道插入损耗、透过率谱线形状、串扰水平。如果无源器件响应和设计仿真偏差大后面可重构验证基本没法做。接下来是逐通道标定。对于每个热光移相器给它加一系列扫描电压记录输出端干涉强度变化从中提取电压-相位曲线。这个曲线不是严格线性尤其在低压段折射率变化受温度非线性影响需要用多项式拟合或样条插值建查找表。标定完单通道才能开始测矩阵精度。通过控制端把网络权重写入输入端送入已知测试向量输出端用相干探测或强度探测读出算实际传输矩阵和理论矩阵的幅度误差、相位误差。经验上MZI网络的相位误差控制在±1度以内矩阵精度才比较好看要是误差到了±5度计算误差就会显著上升。实测过程中还要反复回测因为芯片温度漂移会让校准结果慢慢失效。4. 常见问题与故障排查实录4.1 相位漂移最大的隐性杀器可重构光计算芯片最容易遇到又最难查的问题就是相位漂移。表现为校准好的权重用了几分钟矩阵精度慢慢变差。排查思路从外部到内部先看环境温度有没有变化。热光移相器对温度极其敏感环境温度波动0.5℃就能让相位偏出好几个度。解决方案是给芯片装TEC温控而且要把温控温度设在工作状态的平均发热量附近不能设成无加热时的静态温度否则移相器一开片内温度场就偏了。再看控温精度常规TEC控到±0.01℃是基本要求。排除外部因素后看内部热串扰。大规模网络中相邻通道的加热器会互相传热你调这个移相器隔壁的相位也会变。避免办法是版图上做热隔离槽把加热区四周刻掉一圈硅形成热阻带。但热隔离槽做多了会影响机械稳定性容易碎这个平衡要靠流片迭代慢慢摸。4.2 损耗不均匀导致矩阵崩坏损耗不均匀是一个容易被低估的问题。MZI级联网络中理论上每级输出幅度归一化相同但实际每条路径经过的波导长度、弯曲数量、加热器位置都不同导致通道间幅度差异。这个差异在毫米级芯片上看着不大但级联十几级以后误差会累积矩阵精度明显下降。我做过几次类似的项目最有效的排查方式是设计专门的测试条在流片版图里加入一段无源直波导、一个独立MZI测试单元先单独测它们的损耗和相位响应再对照网络级测试结果。如果测试条损耗正常但级联网络性能异常问题大概率出在布局非对称性上。日后改版图要尽量保证信号路径对称蛇形走线、等长波导虽然面积变大精度回报是值的。4.3 控制端口不够用从每个移相器一根线到行列寻址可重构芯片规模一大控制引脚就成了瓶颈。一个32×32的MZI网络有接近2000个移相器每个移相器引一根电极出来封装根本承受不了。实测中很多团队卡在这一步光学仿真都通过芯片流片也成功但封装的引脚数和驱动板通道数不够只能降级跑小规模验证。解决思路是改成行列寻址结构像驱动显示面板一样共享地线和行列选择大幅减少引脚数量。但行列寻址会带来驱动干扰问题选中行的电压波动会通过共享线影响未选中通道。所以驱动电路要设计好保持电路和复位时序必要时在关键权重上做闭环反馈。另一个思路是把电控也集成到同一衬底比如在光芯片下方堆叠CMOS驱动芯片但混合集成良率目前还是不小挑战。4.4 材料和工艺带来的重复性陷阱如果用到相变材料最典型的问题是用一段时间后权重写不准了。相变材料反复晶化-非晶化切换会在材料内部积累应力或成分偏析导致折射率渐移。碰到这种情况先不要急着怀疑电路查一下写入脉冲的能量和数量是否在规格内再看材料区有没有退化痕迹。更稳妥的做法是设计时就给关键权重单元留出校准冗余以及限制写入循环次数用“写一次、保持长时间”的工作模式来延长寿命。纯热光芯片虽然没有相变材料的疲劳问题但长期高温工作会让波导区域产生应力迁移折射率也会缓慢变化。所以量产性好的可重构光芯片控制器都会内置定期再校准流程跑完一轮大任务自动停几十毫秒重拉一遍权重映射成本很小但对长时间稳定性很关键。5. 一点真实体会这类可重构多功能集成光计算芯片物理原理其实并不新奇干涉、相位、矩阵分解都是几十年的老知识。真正拉开差距的地方在于工程细节控制链路能不能写准权重封装能不能扛住那么多引脚算法能不能补偿温度漂移。北大团队这个工作能发在eLight我更关注的是它把哪几块工程短板补上了而不是又做了一个多漂亮的干涉仪网络。对想进入这个方向的朋友我的建议是先别急着设计大网络先搞清楚你手里的工艺平台损耗是多少、移相器功耗是多少、标定流程能不能闭环。这些基础数据摸清楚了再谈多功能、再谈规模化路才走得稳。后续我大概率还会找时间聊聊光计算芯片的系统集成和异构方案先聊到这儿。
返回列表