ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

储能BMS三级架构详解:BMU/BCU/BAU功能分工与硬件设计实战

储能BMS三级架构详解:BMU/BCU/BAU功能分工与硬件设计实战 这是一篇很典型的储能行业认知类题目。很多刚入行或者跟储能项目打交道的朋友看到BMU、BCU、BAU这三个缩写第一反应往往是“这仨是不是一个东西的三种写法”。我以前带过好几个新来的硬件工程师给他们发BMS原理图的时候都得先在图上圈半天告诉他们这块板子负责什么、那块板子归谁管。说实话储能系统的控制单元比大家熟悉的电动汽车BMS要复杂一个量级。电芯数量从几十串变成几百串电压等级从400V提到800V、甚至1500V通信架构从单板管理变成三级分布式管理整个系统的时序逻辑、故障保护、绝缘监测都上了新难度。如果搞不清楚BMU、BCU、BAU各自的硬件边界和功能定位后面联调、排障、验收全是坑。这篇就把储能系统控制单元的底层逻辑拆开讲清楚三级单元怎么分工、硬件上由哪些模块构成、功能上怎么配合、实际部署中有哪些直接从书本上学不到的工程细节。文章会结合我在多个储能电站调试现场的实操经验尽量用“工程师对工程师”的方式讲透不堆术语但该有的参数和逻辑一步都不省。1. 一套储能BMS里BMU/BCU/BAU到底分别扛什么活储能系统的电池堆规模不是动力电池能比的。一个典型的100MW/200MWh独立储能电站会分成几十个电池簇每个电池簇由若干电池模组串联成组。模组、簇、堆这三个层级正好对应了BMU、BCU、BAU这套分布式控制架构。1.1 三级架构的基本分工先记一张总表后面所有硬件和功能分析都围绕这张表展开。控制单元全称管理对象核心职责安装位置BMUBattery Management Unit电池模组通常12~24串电芯单体电压采集、温度采集、被动均衡执行模组内部或模组侧壁BCUBattery Cluster Control Unit电池簇多个模组串联簇级总压/总流采集、绝缘检测、继电器控制、SOC/SOH估算、与BMU通信电池簇高压箱高压盒内BAUBattery Array Unit整个电池堆全部电池簇系统级调度、全站告警汇聚、与PCS/EMS/消防联动、策略下发控制柜/中控室BMU是离电芯最近的一级直接负责“感知”。一块BMU通过线束接到模组内每只电芯的正负极实时采集单体电压和温度同时执行被动均衡也就是把高容量电芯的能量通过电阻放掉一部分。BMU自己不做复杂的系统判断它更像BMS的“手和眼”。BCU是“大脑和小脑”的分界点。它一边通过高压采样电路获取簇端总电压、总电流一边通过通信总线汇总下挂所有BMU上报的数据然后计算整个簇的荷电状态SOC、健康状态SOH判断有没有过压、欠压、过温、过流等情况一旦触发阈值就驱动高压继电器断开把故障隔离在当前簇内。BCU是三级架构里最忙的一级既要管“感知”又要管“动作”。BAU则站在全站视角做“调度”。它不和电芯直接打交道而是通过以太网或CAN把所有BCU的数据汇集上来向电站的PCS储能变流器下发功率调节指令、向EMS能量管理系统上报可充可放电量、向消防系统联动发送告警信号。一个电站在运行中遇到“3号簇BCU报绝缘故障”BAU要做的是判断要不要把3号簇切出去、其余簇还能不能继续充放电、全站功率怎么重新分配。1.2 常见命名差异与对应关系行业里有一点容易让人头疼不同厂家给的命名不一样有的叫BMU/BCU/BAU有的叫CMU/BMU/BCU还有的叫LBMS/MBMS/SBMS。工程上跟不同设备商对接口时务必先确认对方文档里“名义上的”BMU是不是我这边说的BMU否则协议对接阶段会乱成一片。举几个常见对应关系CMUCell Monitor Unit≈ BMU都是模组级采集单元。MBMSModule BMS≈ 一级从控有时集成BMU的功能。BCMSBattery Cluster Management System≈ BCU加高压控制。主控BMS ≈ BAU或更高层级的BAMSBattery Array Management System。只要抓住“谁在采单体电压、谁在控继电器、谁在做全站调度”这三个锚点不管对方叫啥都能快速定位对应的硬件和功能模块。前几年我在一个共享储能项目里碰到合作方把“BAU”写成“BAMS”而他们内部又把“BAMS”当作一个软件平台导致我们把硬件采购清单对错了一个型号后来专门开会对齐了定义才往下走。这种事在储能行业并不少见提前锁定术语边界能省很多返工。2. 硬件构成的取舍从采样芯片到MCU的选型逻辑储能系统控制单元的硬件设计核心原则是“越靠近电芯越要抗干扰、越靠近电网越要强隔离”。模组级BMU以高精度采集为主簇级BCU以高压保护和强驱动力为主系统级BAU以通信冗余和计算资源为主。三者选型思路差别很大。2.1 BMU硬件核心AFE采样芯片与均衡电路BMU的硬件灵魂是模拟前端芯片AFE。目前储能领域主流方案包括ADI的LTC6811系列、TI的BQ76952、NXP的MC33771、MAXIM现ADI的MAX17852等。选型时最关键的四个指标是采样通道数常见的AFE支持6串、12串、14串、16串、18串不等模组串数决定通道数。一个储能模组如果做成1P16S1并16串用一颗LTC6811-1就够了如果是1P24S就得用两颗芯片级联或者选通道数更多的型号。单体电压采样精度储能系统一般要求单体电压采样误差在±5mV以内部分严苛的招标文件要求±2mV。LTC6811在正常条件下能做到±1.8mVBQ76952约为±5mV预算允许就优先选更高精度的方案。均衡电流能力被动均衡电流从100mA到300mA不等均衡电流越大完成一次模组内压差均衡的时间越短但PCB散热压力越大。我在实际项目中用200mA均衡电流时MOS管和限流电阻的发热明显后面靠加大铜箔面积才压住温度。菊花链通信可靠性多数AFE支持通过isoSPI或电容隔离的菊花链方式级联通信模组越多菊花链越长抗干扰设计越要仔细。均衡电路方面被动均衡是当前绝对主流结构简单、成本低、控制逻辑清晰。主动均衡虽然理论效率高、能量不浪费但在储能这种大容量应用场景里成本和复杂度上升明显单体容量一致性又通常有筛选环节兜底所以工程上很少大规模启用主动均衡。设计均衡电路时除了选限流电阻阻值和功率还要注意PCB布线尽量把均衡发热区单独铺开避免热源离采样芯片太近导致温漂。2.2 BCU硬件核心高压采样、继电器驱动与控制MCUBCU是硬件设计里最容易出问题的一级。它要直接面对几百伏甚至上千伏的电池簇总压隔离间距、爬电距离、浪涌防护一个都不能少。高压采样部分通常包括总电压采样、总电流采样和绝缘检测三块总电压采样用高精度电阻分压网络隔离放大器把簇端电压按比例降到ADC能接受的范围。衡量指标主要是分压电阻的温度漂移选低温漂电阻±25ppm/℃以下是关键否则温度一变总压读数就跟着飘。总电流采样目前主流用霍尔传感器或分流器。霍尔方案隔离方便、无插入损耗但零点温漂比较明显分流器精度高、成本低但要通过隔离放大器把微小信号送进MCU。大电流场景下分流器散热也要考虑1500V系统一个簇电流做到250A以上很常见分流器的铜条得足够粗。绝缘检测电芯正负极对地的绝缘电阻监测很多设计用不平衡电桥法通过切入已知电阻网络观察电压变化来推算绝缘阻值。这块在实际工程里特别容易误报原因后面单开一节讲。继电器驱动电路也很关键。BCU要驱动直流高压继电器断开故障簇同时还要检测继电器触点有没有正常吸合/断开也就是“粘连检测”。电路上通常用辅助触点加回采光耦的方式实现MCU通过对比“驱动指令”和“触点状态反馈”判断继电器是否正常。这个功能看起来不起眼但对系统安全至关重要——如果继电器已经粘连还继续充放电故障就会从簇级蔓延到全站。控制MCU选型上BCU常用的有NXP S32K、英飞凌TC2xx/TC3xx、瑞萨RH850、ST的STM32H7等。储能对功能安全等级ISO 26262或IEC 61508有越来越高的要求建议选带锁步核、支持SIL2以上的车规级或工业级MCU。我手头一个1500V储能项目最初用一款工业级普通MCU做BCU后来过安全认证时被要求换型整个底层驱动重写了一遍教训深刻。2.3 BAU硬件核心主控板、通信网关与冗余电源BAU更像是“一台加固型工业服务器”。它不直接面对高压但对算力、通信接口、可靠性要求更高。核心硬件包括主控SoC常用NXP i.MX8系列、瑞萨RZ/G系列、或者低功耗x86平台。需要在上面跑本地数据库、协议转换、策略调度内存建议至少1GB DDR4eMMC或SSD做本地历史数据存储。多路通信接口至少双路冗余CAN接各簇BCU、双路以太网接EMS/PCS/后台监控、RS485接电表或环境监测。部分场景还需要支持4G/5G无线模块做远程运维。冗余电源模块BAU是控制中枢断电影响面大。输入电源建议双路供电其中一路来自站用变另一路来自电池堆DC/DC输出两路自动切换。BAU在设计上还有一个容易被忽视的点本地时钟同步。储能电站的告警要进行全站时序回溯如果各簇BCU的时钟不一致发生故障时先后顺序都理不清。比较稳的做法是BAU通过NTP或IEEE 1588给各BCU校时并在关键事件打上统一时标。我自己处理过一次“多簇同时告警”的现场问题最后靠BAU侧的统一时标才还原出真正的故障源是PCS电压突变而不是某簇电池自身问题。2.4 硬件测试与制造要点三层控制单元的硬件测试建议重点抓四件事高低温循环下的采样精度复测常温下精度OK不代表-20℃或55℃下还OK我见过不少板子在常温标定后高温漂移超标的案例。浪涌和静电测试针对BCU进线端要做±2kV以上的浪涌测试通信口做±4kV接触静电和±8kV空气静电尤其是CAN接口部分。绝缘耐压测试BCU高压侧与低压侧之间按2500V AC部分要求3500V DC打耐压要求漏电流不超过限值。整机老化与振动测试储能电站现场环境复杂尤其集装箱式的散热风扇振动会很直观地传导到板卡接插件上老化加振动能提前暴露虚焊和端子松动隐患。生产制造端还有一个经验之谈PCBA加工时AFE采样相关电路尽量减少手工补焊的环节。因为采样线束连接器的焊点不良会导致单体电压间歇性跳变这种问题在实验室很难复现上了现场就很头疼。3. 功能实战采集、均衡、保护这些逻辑是怎么落地到板子上的硬件只是载体储能控制单元真正跑起来要靠固件逻辑。这一节从功能实现的角度把采集策略、SOC估算、均衡策略、保护和告警处理分别拆开讲。3.1 数据采集策略与温度点布置BMU的单体电压采集是周期性循环进行的。AFE芯片会按顺序扫描所有通道一轮扫完拿到所有单体电压数据后再做一次一阶低通滤波滤掉电化学动态波动带来的噪声。采样周期一般设计在100ms左右有些场景要求更快的响应可以缩短到20ms但会带来功耗和AFE发热的上升需要权衡。温度采集中典型的储能模组是12~24串电芯配2~4个NTC温度点分布在模组两端和中间位置。NTC选型上常采用10kΩ/3950B的负温度系数热敏电阻采集精度要求±1℃。这里有个设计细节值得说NTC的位置不是随便放的优先布置在模组最靠中间、散热最差的位置因为整个模组最热的地方通常在几何中心。另外电池的正负极柱附近温度往往比侧面高有条件的话建议靠近极柱布置一两个点。3.2 SOC估算从安时积分到动态校正SOC荷电状态是BMS对外输出的核心数据PCS和EMS都靠它来调度充放电功率。储能系统的SOC估算比动力电池要简单一些因为储能电池通常不会像电动车那样频繁深充深放运行工况相对规律但估算精度依然不能放松。主流做法是“安时积分OCV校正动态修正”的组合策略安时积分通过电流采样在时间轴上积分SOC变化量电流积分值/额定容量这个算法快但会累积漂移。OCV校正在电池静置足够长时间后利用开路电压与SOC的对应关系做一次性校准。储能系统在非充放时段如夜间待机经常能获得静置窗口这是做OCV校正的好机会。动态修正利用充放电末端电压平台的偏移结合电池温度和老化状态对SOC做平滑修正。工程上常用的精度目标是把SOC估算误差控制在5%以内配合定期静置校正能做到3%以内。如果项目要求更高可以引入卡尔曼滤波或扩展卡尔曼滤波但需要相应的计算资源BAU侧的算力规划时要预留余量。3.3 均衡策略什么时候均衡、均衡到多少BMU被动均衡的逻辑本身很简单发现模组内最高单体电压与最低单体电压的差值超过启动阈值常见的配置是50mV就打开高电压单体的均衡MOS通过电阻放电。但工程实现里有两个关键决策点第一个是均衡时机。储能系统在充电末端时适合均衡因为此时单体电压差异最明显、均衡效率最高。如果BCU判断当前处于大功率充电状态可以暂缓均衡防止均衡带来的额外热量叠加到电池上。实际项目中我们常配置为“静置或小电流充电时启动均衡”。第二个是均衡截止条件。有些方案会把目标压差设为10mV以下才停但一味追求极限均衡会显著增加均衡时间和对电芯的“折腾”反而未必好。考虑到电芯本身的自放电差异压差小于15~20mV已经算是很健康的状态。个人经验是不要把均衡搞成“强迫症式均衡”否则浪费能量还影响系统可用率。3.4 保护逻辑的分级与联动储能系统的保护逻辑讲究“分级联动”BMU发现单体过压上报BCUBCU判断达到硬保护阈值立即断开簇级继电器BCU同时在毫秒级内把故障状态通过硬线或高速总线报文推到BAUBAU根据预定策略决定要不要降功率运行或直接停机。保护阈值通常分两级保护对象预警阈值软保护硬保护阈值动作单体过压3.45V磷酸铁锂3.65V降功率/停充单体欠压2.80V2.50V停放/断开簇端过温55℃65℃降功率/断开簇端过流1.2倍额定1.5倍额定限流/断开绝缘电阻100Ω/V50Ω/V告警/断开动作时间上BCU的硬保护断开要求在100ms以内配以硬件比较器直接驱动继电器而不依赖MCU软件判断才能保证速度和安全。软件保护若依赖通信链路从BMU到BCU这中间会有几十毫秒的延迟所以真正要命的故障必须靠BCU本地硬件电路兜底。这就像家里配电箱的漏电保护器跳闸靠的是电磁机构直接动作不是等物业来看过再说。3.5 生命周期管理SOH评估与故障记录除了实时保护BAU还承担SOH评估和故障记录职责。SOH健康状态主要反映电池容量衰减和内阻上升程度。工程上常用容量法计算SOH当前实际可用容量/出厂额定容量×100%。实际可用容量的获取办法是在一次完整的充放电循环里通过积分电量得到。故障记录也不只是保存一个“某某代码”而是要保存故障发生时刻的关键工况快照包括单体电压分布数组、簇端总压、电流、温度、均衡状态、通信报文计数等。一旦出了事抱着BAU导出的故障记录文件到实验室就能完整复现当时场景。设计这一块时日志存储要循环覆盖、掉电不丢失至少保留最近90天的数据。4. 通信架构与数据流三层单元之间怎么说话、说什么三级控制单元之间的通信架构决定了整个系统的实时性、可靠性和可扩展性。储能BMS通信设计有几个成熟的套路BMU到BCU走菊花链或CANBCU到BAU走CAN或以太网BAU再到上层走以太网或IEC 61850等规约。4.1 BMU到BCU菊花链为主CAN为备模组级到簇级的主流通信方案是菊花链特别是有AFE芯片支持isoSPI的时候。菊花链的好处是每个模组之间只需要一根双绞线无需单独给每个模组拉一条CAN总线显著节约连接器和线束成本。数据从远端AFE一节一节往BCU方向传末端加上看门狗和CRC校验保证安全性。菊花链的主要缺点是“一荣俱荣一损俱损”链条中间任何一节通信异常远端所有AFE的数据都可能收不到。为了缓解这个问题新一代方案往往支持菊花链双向环形或双通道冗余一旦某处断链数据可以从另一端绕回来。我在现场调过一组64串的模组菊花链出现过中间模组连接器接触不良的情况整簇通信时断时续排查起来很费劲。后来把方案改成了双通道菊花链可靠性好了很多。也有不少项目在BMU和BCU之间用CAN总线每个BMU作为CAN节点独立上报。CAN方案的优势是故障隔离性好一个节点坏了不影响其他节点劣势是成本高一点、布线更多同时通信帧数多总线的波特率上限决定了BMU数量不能太多。一般情况下一簇挂超过12个BMU时CAN总线负载率会偏高菊花链更有优势。4.2 BCU到BAUCAN FD与以太网双通道BCU上报BAU的数据目前主流是CAN FD因为数据量比传统CAN翻了几倍速度和实时性都更好。但如果一簇下挂20多个BMU每100ms上报一次全量数据CAN FD的负载率也会逼近危险值。因此在大型储能项目中不少系统已切换为BCU和BAU之间通过工业以太网通信用私有或标准应用层协议封装数据。我个人更推荐“以太网为主CAN为冗余备用”的架构。上面板的实时性能好还方便整站做时间同步CAN作为故障切换手段保留关键时刻兜底。冗余也不光是通信链路冗余还包括数据内容冗余——BAU既接收BCU周期性上报的汇总数据也接收BCU主动上报的事故报文两者配合才能避免丢包导致信息缺失。4.3 与外部系统的接口PCS、EMS、消防联动的通信关系再往上走BAU要与三个外部系统通信与PCS通信常用Modbus TCP或CANBAU把可充电功率、可放电功率、最高允许充电电压等运行边界下发给PCSPCS执行功率闭环。与EMS通信常用IEC 104或Modbus TCPBAU上报全站SOC、各簇状态、故障告警、日充放电量等数据接收EMS下发的充放电计划。与消防系统联动多为干接点信号或工业总线BAU检测到热失控预警时向消防系统发出告警同时接收消防系统反馈的灭火剂喷洒状态。与PCS通信的实时性要求最严格一般要求100ms内完成一轮参数交互。因为储能变流器的功率调节依赖SOC和允许功率边界如果这条路径延迟大PCS可能按过时的功率上限运行导致电池过充或过放。4.4 通信可靠性的工程验证方法通信架构设计完成后不要急着到现场跑先在实验室做一套完整的通信可靠性验证流程长线测试模拟现场几十米长的CAN总线和以太网线用线缆卷盘把设备拉远距离观察误码率。干扰注入对通信线缆施加共模干扰和脉冲群干扰观察系统有没有丢帧或假告警。节点热插拔模拟运行中拔插一个BMU或BCU节点确认总线和主站能自动恢复不导致全系统通信锁死。长时间压力测试以满帧速率跑72小时以上记录丢帧率和最大通信延迟。这些测试看着耗时但相比现场出了问题再排查成本低太多。通信类故障在储能电站里占了不小的比例而且大多是间歇式的现场复现难度极高。与其到现场做“福尔摩斯”不如在出厂前把通信打扎实。5. 实测现场踩过的坑与排查思路最后聊一些实际现场跑出来的经验。这些坑不会写在产品规格书里但几乎每个大型储能项目的调试现场多少都会碰到几件。5.1 采样线束压降对精度的影响模组内BMU采集单体电压电压采样线是直接从电芯正负极柱引出的细线。线束连接器接触电阻一般在毫欧级看起来影响不大但采样电流为纳安级时接触电阻的压降微乎其微一旦均衡电流到200mA采样回路和均衡回路共地接触电阻悬空压降就能到几十毫伏。后果是你看到某只单体的电压比其他单体高一截其实是均衡回路把它“顶”高了并不是电芯本身有问题。解决办法是尽量保证均衡电流回路和采样回路分开布线或者至少让均衡接入点在靠近电芯极柱的地方减小公共路径阻抗。若在现场遇到某个单体压差异常但温度正常先查线束端子和均衡回路是不是新换过、有没有紧固好。5.2 菊花链长距离通信的可靠性一个储能模组放一个BMU几十个BMU串联在同一根菊花链上通信线穿越整个电池架。电池架内部空间狭小动力线大多与通信线并行走线如果屏蔽层接地不良大电流充放电时磁场耦合会在双绞线上感应出差模电压导致通信帧偶发CRC错误。排查这类问题时首先在BCU侧看CRC错误统计如果错误频率和充放电电流大小有相关性基本可以判定为干扰耦合。处理方式主要有几个方向把通信线从动力线束中分离出去通信线选用带屏蔽层并单端接地的双绞线AFE菊花链配置里适当增加滤波和重试机制。有些控制器还支持降低通信速率换取稳定性从2Mbps降到1Mbps往往能解决大部分偶发丢帧问题。5.3 绝缘检测误报的常见原因绝缘检测误报在1500V储能系统里极其常见尤其每晚充放电转换的瞬间。解决思路要从现场排查的逻辑走。误报原因大致有三类系统正负极对地分布电容充电电流导致瞬时测量偏差切换电桥电阻网络后电压建立需要时间软件若过早采数就会误判。站用变或PCS带来的共模干扰叠加在检测回路上导致ADC读数漂移。检测电阻网络本身的温漂和老化导致测量基准变化。处理手段在绝缘检测电路前端增加适当的滤波电容、延长每次切换后的稳定延时时间、对连续多次采样做中值滤波再配合温度补偿系数。如果误报仍无法消除就要考虑在软件里对“绝缘告警出口增加延时确认”和“根据运行状态分档判断”的策略避免把瞬时扰动当成永久故障。5.4 高压继电器粘连检测与冗余断开簇级继电器在储能系统里频繁动作。触头在分断直流大电流时形成的电弧会造成触头烧蚀严重时触头熔焊导致继电器无法真正断开。BCU必须在每次断开指令发出后通过辅助触点回采判断继电器是否真的断开如果检测到粘连就要在簇级无法隔离的前提下上报BAU请求整站停机。另一个安全工作习惯是对关键故障的断开动作采用“正极继电器负极继电器”串联双断开设计或者至少做一组主继电器加一组预充/隔离继电器。这样即使有一个继电器粘连另一个还能断开回路。硬件上要确保两个继电器的断开时序存在合理间隔不要同时动作后互相拉弧更不能只靠一个继电器承担全部断开任务。5.5 通信隔离与电源地线的干扰最后讲一个比较隐蔽的坑。BCU与BMU通信、BCU与BAU通信都要做电气隔离设计。CAN收发器必须用带隔离的模块以太网变压器也必须有隔离绕组。实际项目里遇到过一种情况BCU和BAU各自内部电源都是隔离的但隔离电源的初级和次级之间存在耦合电容高频干扰通过这个电容形成地环路导致通信波形畸变。排查这类问题时用示波器测CAN收发器的共模电压可能看到很大的高频毛刺。处理办法是加强隔离电源的Y电容设计、在通信屏蔽层做单端接地并且让整个电池簇控制柜的接地点保持单一避免多点接地形成地环路。这类问题确认慢但一旦定位了后续很多“莫名其妙”的通信故障都能解释通。写在最后储能系统控制单元的设计和调试本质上是在“电芯感知、高压保护、系统调度”这三个维度之间找平衡。BMU管细、BCU管簇、BAU管站三层各司其职又紧密联动。硬件上把隔离间距、采样精度、通信冗余做扎实软件上把采集、均衡、保护逻辑分好级再通过严格的实测验证脚本和现场经验积累一套BMS才能真正扛住储能电站十年以上的运行生命周期。这些内容看起来是基础知识点但每一个坑背后都是真金白银的教训。如果正在规划储能产品的朋友建议把这套三级架构和实际工程经验当成一个checklist从选型阶段就对照着规避风险能少走很多弯路。
返回列表