ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI服务器电源芯片选型:从VRM拓扑到DrMOS实战清单

AI服务器电源芯片选型:从VRM拓扑到DrMOS实战清单 这两年拆AI服务器电源模块最直观的感受是单板功率从几百瓦一路涨到几千瓦留给电源工程师的容错空间却越来越小。GPU核心电压普遍在1V上下电流却能跑到几百安培48V母线进来经过一两级变换压降只剩0.6V到0.8V电流翻了上百倍。这种场景下电源芯片选型已经不是照着手册选个型号那么简单而是要拓扑、热、瞬态、封装、配套电感电容整体一起考虑。这篇文章就结合我自己拆过的AI服务器电源板和VRM供电电路把电源芯片选型的完整思路、关键参数和踩坑记录捋一遍给正在做服务器电源或GPU供电方案的朋友一份能直接参考的清单。1. 先看需求AI服务器电源系统到底需要什么1.1 功率等级与架构变化传统的机架服务器单台功耗一般也就几百瓦到一两千瓦电源链路边是“AC转12V12V再直接降压给CPU、内存、硬盘”。到了AI服务器尤其是8卡GPU整机整机功耗动辄10kW到30kW以上12V架构已经完全扛不住了——电流太大铜排和连接器的损耗和成本都不可接受。所以现在的AI服务器普遍把中间母线电压提高到48V甚至有往54V、60V走的趋势。母线电压升高之后后级VRM电压调节模块的降压比变得更夸张48V进来GPU核心电压只有0.6V到1.0V电压落差近50倍到80倍。如果还是从48V直接降压开关管占空比太小、导通损耗太大驱动和环路都很难做。于是实际方案普遍拆成两级前级先把48V降到12V左右后级再用12V做多相Buck在GPU旁边完成最后一步降压。也有些激进的设计用48V直接转核心电压这就需要氮化镓或专用于高降压比的多相控制器技术门槛更高但效率确实更有优势。电源芯片选型的第一步不是选哪颗芯片而是先搞清楚功率链路上有几级、每一级分担多少功率、效率点在哪里。我见过不少朋友上来就问“哪颗芯片能拉900A”结果连48V输入侧用什么拓扑都没定这种选型基本都会返工。1.2 主要电源轨的指标差异AI服务器内部不是只有GPU核心一路电。把一块典型的加速卡或服务器主板翻过来电源轨分成好几类每一类的选型侧重点完全不同电源轨典型电压典型电流量级选型侧重点GPU/CPU核心Vcore0.6V~1.0V数百A到上千A瞬态响应、电压精度、效率HBM高带宽内存VDDQ/VPP1.1V~1.35V几十A到上百A纹波、噪声、动态负载SoC/IO/辅助逻辑0.8V~1.8V几A到几十A待机功耗、封装面积NVLink/NVSwitch/SerDes0.8V~1.2V每路几A到十几A板级噪声隔离、PSRR风扇/外设/管理3.3V/5V/12V几A到十几A集成度、成本、MOSFET驱动核心轨是最难做的电流几百安到上千安电压又低效率稍微掉一个点发热就是几百瓦。这里必须用多相Buck把它拆成十几相甚至二十几相并联每相承担三十到六十安培才能把热量和瞬态压力摊开。HBM内存供电轨和核心轨不一样它对纹波极其敏感。存储颗粒的电压窗口很窄一点点噪声就可能触发ECC纠错甚至数据错误。选这种电源芯片时不能只看最大输出电流还要看轻载效率、纹波抑制能力、反馈环路带宽。辅助轨和风扇电源反而简单一般一颗同步Buck芯片带集成MOSFET就够了。1.3 数字电源与PMBus的引入AI服务器里另一个明显变化是数字电源普及。传统模拟电源靠电阻分压设输出电压改一次参数就要换电阻数字电源则可以通过PMBus总线在线配置电压、电流保护门限、开关频率、软启动时间还能实时回读每相电流和温度。选控制器的时候PMBus不是可有可无的功能。大规模GPU集群需要精确的功耗监控电源要能上报“我这一路现在吃了多少电流”供整机管理控制器做功耗封顶和调度。散热策略也要依赖温度回读比如哪一相DrMOS过热系统可以主动降频。至少我在实际项目中都会优先选带PMBus的控制器哪怕初期不配置后续调试也会用得上。2. 电源芯片选型从拓扑到参数表2.1 先定拓扑再谈芯片很多人选型喜欢直接翻厂商选型表先找型号再看参数。我的习惯是先定拓扑再在对应拓扑里去筛芯片。AI服务器里最常见的是这几类拓扑前级48V转12V用的比较多的是LLC谐振半桥或者四开关Buck-Boost。LLC效率高、适合固定电压比但动态响应慢四开关Buck-Boost在输入电压波动大、需要在48V上下调整时更有优势。选型时要先判断输入范围是纯48V还是16V到60V宽压。后级12V转核心电压几乎清一色是多相同步Buck控制器加DrMOS集成驱动和MOSFET的功率级或者控制器加分离式MOSFET驱动器再配外置MOSFET。电流超过300A之后DrMOS几乎是唯一合理选择。3.3V/5V辅助电源同步Buck芯片一般自带MOSFET重点是轻载效率和静态电流。小功率隔离/非隔离辅助源有些板卡管理电路用LDO就可以噪声低、外围简单。拓扑定下来之后芯片的选型范围就缩小了。不要拿着一颗LDO问能不能给GPU核心供电这种问题本质上不是芯片不行是方案方向错了。2.2 五组必须逐项核对的关键参数选一颗电源芯片我会重点看五组参数缺一不可第一输入电压范围和输出电压范围。光这个就能排除掉一半候选。有些多相控制器只支持5V到16V输入硬塞到48V应用里肯定烧。第二开关频率范围和同步能力。AI服务器为了减小电感电容体积开关频率越用越高常见到500kHz甚至1MHz以上。但频率越高开关损耗越大DrMOS的FOM品质因数就越关键。还要看控制器能不能和DrMOS的开关频率匹配最好能通过PMBus调频。第三相数扩展能力和均流精度。控制器最多支持多少相、每相电流采样是电感DCR还是独立sense电阻、均流误差多大直接决定你最终能拉到多少电流。高端控制器常见支持8相到16相更高电流要用两颗控制器并联。第四封装和热阻。这是最容易忽视的坑。一颗DrMOS标称90A但那是理想散热条件下的极限值真实机箱里可能只能跑60A。封装尺寸、RthJA结到环境的热阻、RthJC结到外壳的热阻都影响降额设计。第五保护功能和诊断能力。OCP、OVP、OTP、UVLO这些基本保护各家都有区别在于精度和响应速度。AI服务器里最怕的是OCP误触发训练任务跑到一半掉电压损失的是整个集群的算力时间。这时候过流保护的延时时间和触发精度就非常重要。2.3 配套器件的协同选型电感电容电阻电源芯片选型从来不是孤立的芯片确定了之后电感、电容、电阻才是真正决定性能的部分。以输出电感为例多相Buck的电感值由开关频率、纹波电流和负载瞬态共同决定。电感选大了轻载纹波小但瞬态响应变慢选小了瞬态好但满载纹波和电感发热会变大。电感的核心参数是饱和电流和DCR直流电阻。AI服务器核心供电相电流动不动几十安培电感饱和电流必须留有足够余量同时DCR越低效率越高。还要注意电感在不同温度下的表现有的粉芯电感温度上来后磁导率变化明显可能导致纹波电流漂移。输出电容方面GPU核心供电现在大量使用多层陶瓷电容和POSCAP、SP-CAP这类聚合物电容混合方案。陶瓷电容负责高频去耦聚合物电容负责提供瞬态电荷。电容数量和位置的摆放要考虑电压纹波要求不是随便堆就行。反馈电阻、电流采样电阻、分压电阻的精度也要重视。核心电压越低允许的Vcore误差绝对值就越小比如0.8V电压允许3%误差也就是24mV采样电阻万一温飘了反馈电压跑偏整卡就不稳定。所以这类电阻我通常选0.5%精度、低温度系数的厚膜电阻电流采样电阻则用合金电阻。3. 拆解实录一块电源板上芯片的识别与布局3.1 拆解前先看丝印别急着动烙铁拆解AI服务器电源模块最忌讳的是拿到板子就上热风枪。我自己的流程是先整板拍照尤其是芯片周围的丝印、版本号、位号然后翻面再拍接着用放大镜或微距镜头逐颗读芯片丝印记在纸上或表格里。很多芯片的丝印只有三四个字符比如“A19T”“B2KD”这些其实是marking code不是完整型号需要去芯片厂商官网搜“marking lookup”工具反查。有些丝印反查不到很正常可能是定制料或旧批次这时候就要靠周边电路推断功能。看芯片引脚连着电感还是连着MOSFET驱动电阻大体能猜出是控制器、驱动器、还是负载开关。拆解的目的是学习选型思路不是追求把每一颗料都扒出来所以先建立“功能分区”意识更重要输入侧在哪、功率级在哪、反馈采样在哪、PMBus通信在哪。3.2 主功率链路芯片识别把板子分成几个功能区之后主功率链路就很好认了。输入侧一般有PFC控制器、LLC控制器或者48V转12V的降压控制器。这些芯片的位置通常在电源入口附近紧挨着变压器或大电感驱动信号线走向功率MOSFET。到了GPU核心供电区域看到的是一排排的DrMOS整整齐齐围着GPU插座摆一圈。这是最明显的一类芯片体积比普通逻辑芯片大底下通常有大面积的焊盘散热。旁边会有一颗多相Buck控制器负责接收PMBus指令、产生PWM信号、收集每相电流反馈。控制器和DrMOS之间有一排排很细的走线那是PWM和故障反馈线。从拆解角度看重点关注控制器和DrMOS之间的搭配关系每相用的DrMOS型号是否一致、相位电感是否同规格、采样方式用的是DCR还是采样电阻。这些信息决定了一套方案的均流精度和可靠性。实际产品里有时会出现同一颗控制器搭配不同批次DrMOS的情况这在量产中会增加均流调试难度选型阶段要尽量避免。3.3 板边小芯片与8205的实际角色主功率链路之外板边还散布着大量小封装芯片SOT23、SOT23-6、SC70这类。它们的功能通常是电平转换、逻辑门、负载开关、电池保护、小功率DCDC。热词里经常被问到的“电源芯片8205引脚功能图解”8205就是我说的这一类典型代表。8205内部是两个N沟道MOSFETSOT23-6封装常被用在锂电池保护电路里做充电和放电回路的通断控制。它的典型接法是两颗MOSFET共漏极串联源极分别引出。以常见的8205A为例1脚和2脚分别是第一颗MOS的源极和栅极3脚和4脚是第二颗MOS的源极和栅极5脚和6脚是两颗MOS的漏极公共连接端。不过这里必须提醒一句同一编号不同后缀的芯片引脚定义可能有差异拆板遇到时一定以对应型号的datasheet为准不要只看丝印“8205”就直接套。AI服务器电源板上8205这类双MOSFET更多被用作负载开关或输入保护。如果你在拆解时看到它的栅极连着一颗小电阻和一颗小电容那大概率是RC延时启动用来做缓启动防止热插拔时打火。顺着这个思路拆解时能很快判断芯片的电路角色而不是纠结它型号深层的命名规则。3.4 无源器件选型在拆解中的验证拆解时还有一个容易被忽略的点用实物去验证配套无源器件的选型逻辑。比如看输出电感旁边印的字上面会有感值和尺寸标识封装越大、能过的饱和电流越高。你会看到AI服务器核心供电用的通常是“一体成型电感”或“大电流贴片电感”表面有屏蔽层不裸露磁芯目的就是减少EMI辐射和降低漏磁对附近信号的影响。电容也能看出门道。核心供电附近会有一大片小尺寸MLCC密密麻麻数量上百颗这就是给高频瞬态电流准备的。旁边还有几颗大尺寸聚合物电容那是给低频大电流瞬态准备的。这两类电容的配比决定了瞬态响应能不能扛住GPU“从轻载瞬间切到满载”这种暴力工况。拆解看得多了再回来看选型表你的判断力会提高一个档次。4. 一次完整选型演示从需求到BOM4.1 需求定义与相数估算这里我假设一个典型需求给一颗GPU核心供电电压0.8V满载电流800A输入母线12V要求满载效率不低于90%瞬态电压跌落不超过3%。第一步先估算相数。每相输出电流的选择要考虑DrMOS的连续电流能力和热降额。比如某款DrMOS标称连续60A但实际散热条件下我们最多用到75%也就是45A左右。那么相数就是800A除以45A约18相。多相Buck中相位数经常取偶数或者跟控制器支持的相位配置对齐所以可以取16相或20相再结合控制器的相数上限确认。相数越多稳态电流越均匀、瞬态越快但成本、PCB面积和控制复杂度也越高。16到20相在高端GPU供电里都很常见。如果你发现相数算出来超过控制器上限就得分区供电同一颗GPU核心用两路独立VRM分别供不同电压域。4.2 控制器和功率级的具体选择逻辑控制器选型要看支持多少相、是否支持PMBus、电流采样方式是DCR还是sense电阻、开关频率范围等。常见的多相控制器方案比如TI的TPS536系列、MPS的MP28/MP29系列、安森美的NCP系列都能支持8相以上具体型号按需求筛。如果选了16相就找支持16相的控制器配合两颗相位扩展器或者直接用一颗支持20相的高端控制器看成本和供货情况。功率级选型则要看DrMOS的连续电流能力、开关频率下的效率、FOM值、封装热阻。同样是标称60A的DrMOS不同品牌在轻载和满载效率上差得很大。FOM通常指栅极电荷乘以导通电阻数值越小频率提升后的损耗越低。如果你准备跑1MHz开关频率就要选高频下效率曲线仍然平缓的型号。我还习惯看DrMOS的电流采样方式。有些DrMOS内部带电流镜像输出可以省掉外部采样电阻但精度受温度影响有些需要通过电感DCR采样需要额外做温补网络。采样精度直接影响均流和OCP保护是选型里不能妥协的一项。4.3 电感计算与配套无源器件以单相输出45A、开关频率500kHz、输出0.8V、输入12V来估算电感值。电感值L按公式计算L (Vin - Vout) × Vout / (Vin × fs × ΔI)其中ΔI是纹波电流通常取满载电流的20%到40%这里取30%也就是13.5A。代入公式L (12 - 0.8) × 0.8 / (12 × 500000 × 13.5) ≈ 0.11μH这个量级算出来偏小实际中我们还会结合瞬态响应的需求适当增大或减小。真实产品里GPU核心供电单相电感常见0.15μH到0.2μH就是因为还要兼顾负载突变时的电流上升速率。电感选型时除了感值还要看额定电流是否高于单相峰值电流DCR尽量低饱和电流曲线在高温下不能掉太多。输出电容总量可以先用目标电压跌落估算瞬态电流变化量乘以允许跌落时间和压降要求的关系。粗略估算800A瞬态如果允许跌落小于24mV需要的总输出电容至少在mF级别所以你会看到GPU附近几百颗MLCC再加几十颗聚合物电容。具体数量要靠仿真和实测迭代不是一次能算准的。4.4 评估板选型与实测验证选型做完还不能直接画板我强烈建议先选评估板做一轮实测。评估板选型有技巧优先选和你的应用“同类同构”的板子比如你想做12V转0.8V、16相就找官方评估板上已经接近这个拓扑和相数的而不是找一颗芯片的裸封装评估板。拿到评估板之后先做静态测试上电看输出电压精度、轻载和满载效率曲线、各相电流是否均衡再用电子负载做瞬态测试观察电压跌落和恢复时间。一定要用示波器和电流探头实测DrMOS的开关波形看有没有振铃、过冲、驱动不足的问题。评估板上标注的layout走线、去耦电容位置就是你后续画板时的参考模板。我遇到过很多次“评估板表现很好、自己画板后性能差一截”的情况几乎都是layout寄生电感没控制好。所以评估板选型的意义不只是选芯片而是帮你提前锁定布局参考和环路补偿参数。5. 常见问题与排查技巧实录5.1 热失控与散热设计DrMOS发热是AI服务器电源里最常见的问题。温度上去之后MOSFET导通电阻会变大导通损耗进一步增加形成正反馈。排查时先看散热条件DrMOS底部有没有完整过孔阵列到背板铜箔导热垫是否贴合风道有没有被遮挡。如果散热没问题再查开关频率和驱动电阻频率太高或栅极电阻太大都会导致额外发热。经验值上DrMOS外壳温度超过105到110摄氏度就要警觉即使芯片手册说结温能到125度长期高温也会大幅缩短寿命。选型时应预留足够的温度裕量而不是贴着极限用。5.2 瞬态响应差导致降频GPU在训练任务里会频繁出现功耗跳变从几十瓦瞬间跳到几百瓦。如果供电电压跌落到GPU的最低工作电压以下轻则降频重则触发复位。排查时用示波器钩住Vcore测试点每秒抓一次瞬态波形看最低电压和恢复时间。如果是跌落过深先加输出电容如果是恢复太慢检查环路带宽和补偿参数如果是某一相明显响应慢看PWM时序和相位间同步。多相Buck的均流和瞬态和大信号响应、小信号环路都有关不是单纯调一个参数能解决的。这时候PMBus的动态配置功能就派上用场在线改环路参数比反复换电阻快得多。5.3 电感啸叫与噪声电感啸叫的根源是电感线圈或磁芯在某些频率下发生机械振动频率落在人耳范围内通常是轻载临界连续模式或者动态负载频率耦合导致的。排查思路先确认是不是轻载模式切换引起的如果是PWM跳频模式导致的切换到强制PWM模式看现象是否消失如果和负载频率相关检查负载电流波形里有没有低频纹波成分。还有一种情况是电感本身质量问题磁芯粘接不牢灌胶不充分这种只能换电感批次或品牌。在AI服务器里电感啸叫不只是听感问题还可能导致系统里的震动传感器误报所以要认真对待。5.4 假芯片与丝印识别问题市场上电源芯片翻新和假冒的情况一直存在尤其是热门型号。拿到批量芯片之后我建议先做几项简单检验看丝印是否清晰、引脚是否有二次镀锡痕迹、封装表面是否均匀再用万用表二极管档测关键引脚之间的压降和正品对比有条件就用热成像仪对比满载发热曲线正品的发热分布应该是均匀的。拆机板上的芯片如果丝印模糊、型号位置不对也要多留个心眼。我见过有人买到丝印相同的芯片内部门极电荷特性完全不同装上后开关波形一塌糊涂。电源芯片是系统的核心省几块钱后面赔的是整板稳定性。5.5 8205类MOSFET的使用注意8205这类双N-MOSFET小封装芯片在用作负载开关时最常见的问题是栅极驱动不足。如果控制侧输出高电平不够高MOSFET导通不彻底导通电阻偏大芯片表面明显发热。检查Vgs是否达到数据手册要求的开启电压再看栅极驱动电流够不够。栅极电阻太大也会拖慢开关速度导致交叠损耗变大。另一个问题是热插拔使用时的缓启动设计。如果栅极没有RC延时插拔瞬间冲击电流太大8205容易损坏。这类小芯片看着不起眼但它承担的是整板的“开关门卫”选型和配合电路都不能省。最后再分享一个小技巧我每次选型都会先下载三份文档——控制芯片的数据手册、参考布局、配套DrMOS的FOM表和评估板用户手册对照实测数据再定BOM。别迷信单颗芯片的极限参数AI服务器电源是系统级问题电源芯片选型只是第一步后面还有电感、电容、layout和散热等着你。尤其是拆板看芯片这件事拿热风枪吹下来之前先拍照、查丝印很多时候能少走很多弯路。
返回列表