☰
储能BMS三级架构解析:BMU、BCU、BAU究竟有何区别?
2026/9/28 1:19:36 网站建设 项目流程

1. 从一块电芯到一座电站:先搞懂BMU/BCU/BAU到底站在哪一层

做储能系统的人,基本都绕不开这三个缩写:BMU、BCU、BAU。刚入行的时候我也被绕晕过,网上搜"储能系统控制单元",结果出来一堆BMS资料,越看越糊涂。后来跟项目多了才摸清楚,这三兄弟其实是电池管理系统(BMS)的"三级组织架构",只是很多人一开始就被这个命名搞蒙了。

先回答那个大家搜得最多的问题:BMS和BMU到底啥关系?

一句话就能说明白——BMS是整套电池管理系统的总称,BMU是BMS最底层的硬件执行单元。就像一家公司,BMS是"公司",BMU是"基层员工",BCU是"部门经理",BAU是"总经理"。你们公司叫某某科技,但真正干活的还是底下那些人。

具体的层级关系是这样的:

  • 最底层:BMU(Battery Monitor Unit,电池监控单元),负责采集每个电芯的电压、温度,做均衡控制
  • 中间层:BCU(Battery Cluster Unit,电池簇控制单元),管理一个电池簇,负责簇级的总压、总流采集,执行保护逻辑,与PCS通信
  • 顶层:BAU(Battery Array Unit,电池阵列单元),整个储能电站(或大型系统)的电池管理大脑,负责功率调度、状态估算、与EMS交互

从物理位置上看,BMU长在电池模组上,一个模组一块板子;BCU装在每个电池簇的高压箱里,一簇一个;BAU则放在整个储能电站的汇流柜或者中控柜里,整个站可能就一两个。

我在项目里见过一个5MWh的储能单元,一共配了8个电池簇,每个簇里有14个模组。算下来就是8个BCU加112个BMU,再加上1个BAU。这个比例你感受一下,越往上数量越少,但每个单元管的范围越大、逻辑越复杂。

所以,这篇文章我准备按"硬件构成—功能职责—通信机制—实战经验"这条线,把这三个控制单元讲透。不管你是做电气设计的、搞调试的,还是做运维的,看完都能对这套系统有个清晰的底。

2. 硬件构成拆解:每块板子上面到底焊了些什么

2.1 BMU——贴着电芯安装的"数据采集器"

BMU板子一般直接装在电池模组的端板上,或者模组内部,离电芯越近越好。了一圈项目,BMU的硬件核心基本都跑不出这几块:

采集前端(AFE,Analog Front End):这是BMU真正的"心脏"。主流方案有ADI的LTC6811系列、TI的BQ79616,国产的也有不少,比如杰华特、圣邦微的方案。这些AFE芯片通常支持串联12到16串电芯的电压采集,精度能做到±1mV以内。以LTC6811-1为例,它能同时采集12串电芯电压,每颗芯片的数据通过隔离式SPI菊花链往下传。

我实际测过一款基于LTC6811的BMU板子,在-20℃到60℃范围里电压采样误差能稳定在±2mV以内,对于SOC估算来说这个精度基本够用了。顺便说一句,AFE芯片的温度系数是选型时最容易忽略的指标,有的便宜芯片低温飘得厉害,冬天电压测出来偏高,SOC跟着跑偏,后期会很麻烦。

温度采集通道:主流方案是NTC热敏电阻,BMU板上一般会留4到8路NTC接口。这里有个细节,不是所有NTC都直采进AFE的,很多设计会再加一颗MCU,用MCU的ADC去读NTC,因为AFE的通用IO不够用。温度点的布放很关键——每片模组至少要在正负极耳、模组中部布测温点,如果模组长,尽量保一头一尾各一个,防止"两头凉中间热"的隐蔽温升。

均衡电路:被动均衡最常见,每个电芯并一个放电电阻加一个MOS开关。常见电阻值33Ω到100Ω,均衡电流一般在60mA到120mA。比如100Ω电阻配4.2V电芯电压,均衡电流就是42mA左右,一个满电的100Ah电芯要放到和其他电芯齐平,理论上得均衡很久,所以被动均衡本质上就是个"慢工出细活"的活。

主控MCU:负责把AFE读回来的数据打包、做简单的故障判断(比如单体过压、欠压)、跑均衡策略。常用的有NXP的S32K系列、ST的STM32F1/F4、国产的GD32等。MCU选型主要看通信接口数量和算力——它身上至少要引出一路SPI连AFE,一路隔离CAN连BCU,有些设计还留一路UART做调试。

上面这几块凑起来,再加一个DC-DC电源模块(一般输入电压范围8V到60V,从电池包总压取电),一块BMU板子的BOM成本大概几十到一百多块人民币。设计紧凑的可以做到信用卡大小,固定方式就是模组端板上的四个铜柱。

2.2 BCU——高压箱里的"微型主机"

到了BCU这一级,板子就复杂多了,因为它要管的不是一个模组,而是整个电池簇。BCU的硬件一般分成两部分:一部分是主控板,一部分是外围采样与驱动板,或者集成在一起做成一块大板子,装在高压箱里。

主控板上核心芯片需要的算力比BMU高一档,因为要做SOC估算、绝缘检测、热管理策略这些活。常见的选择有NXP的S32K1系列、瑞萨的RH850,或者带MPU的方案(比如IMX6ULL),国产的也见了不少,芯驰、全志、瑞芯微都在储能主控上有布局。稍微大点的系统,主控板上甚至会加一颗独立的加密芯片,用于通信数据的签名校验。

BCU的高压采样部分很有意思,它不像BMU用AFE——BCU直接采的是母线电压和电流,电压几百伏,电流上千安,AFE根本扛不住。电压采样用电阻分压加隔离运放,电流采样用霍尔传感器或者分流器。分流器方案精度高但发热大,霍尔方案不发热但小电流精度差一截。个人经验,直流侧电流超过500A的簇,用霍尔更稳妥;小电流系统想省成本可以上分流器。

BCU板子上还有一个容易被忽略但极其关键的器件——高压互锁(HVIL)检测电路。高压连接器如果没插到位,接触电阻会变大,大电流一过就发热起火。HVIL回路就是把所有高压连接器的辅助触点串成一个闭环,只要任何一个连接器没插好,BCU立刻就能检测到,然后禁止闭合高压继电器。这个功能别省,我见过不止一起因为高压连接器松动打火的事件,最后查下来HVIL回路被某家厂商省了,教训很深刻。

2.3 BAU——机柜里的"服务器"

BAU的形态差别比较大。小型的储能系统(比如一个单一柜子的工商业储能),BAU可能就是一块扩展坞加一个显示屏;大型储能电站的BAU,经常是一台机架式工控机加上专用IO板卡。

BAU的硬件核心有这么几块:

  • 高性能处理器:运行的算法多,而且要考虑之后可能跑一些预测性维护模型,一般至少得是Cortex-A系列的MPU。常见的平台有TI的AM62x、NXP的i.MX 8M Plus,算力要求再高就上FPGA或者带NPU的芯片,但价格就上去了
  • 多路CAN/以太网接口:BAU要跟几十台上百台BCU通信,CAN口的数量必须够多。如果BCU数量超过一二十台,就得分CAN网段,一般一个网段挂不超过30个节点,否则总线负载率太高
  • DI/DO和继电器驱动:控制风扇、加热器、空调、接触器的启停,还要采集烟感、水浸、门磁这些环境量
  • 存储单元:eMMC或者SD卡,用来存历史故障记录和运行日志。故障日志真的很重要,出了问题要回溯原因,全靠它

另外BAU一般都会配一块触摸屏或者至少留一个调试口。现场调试的时候,工程师得能快速看到所有簇的状态,最好能在触摸屏上直接下发分合闸指令,省得搬着电脑到处跑。

3. 功能实战解析:这三层控制单元是怎么各司其职的

3.1 功能划分的灵魂:三级控制 "分工不分工果"

三级架构为什么这么设计?一个核心原因是——物理上天然分层,控制上必须分层。

电芯在模组里,模组在电池包里,电池包组成簇,簇并联成阵列。你不可能用一个中央处理器把每个电芯的电压采集都做完——线束的物理长度就不允许,通信时延更不允许。电芯级的电压采样必须就近完成,这就是BMU存在的最根本原因。

BMU干的是"手脚"的活:采集、执行、上报。它最靠近电芯,电压、温度数据采集完,做一层初级判断,比如某一串电芯电压突然跌破2.5V,BMU立刻标志一个过压/欠压事件,往BCU上报的同时,也可能触发电芯级的主动保护(如果硬件设计支持的话)。

BCU干的是"关节"的活:它手里攥着这个簇的接触器,收到BMU上来的故障信号等级足够高时,会直接执行簇级保护——断高压、闭合预充、报故障给BAU。同时BCU还要跟PCS通信,告诉PCS当前这个簇能充多大电流、能放多大电流。这些电流限制值的计算,本质上就是BMS的核心算法。

BAU干的是"大脑"的活:它不做电芯级的精细控制,它专注全局。所有BCU上报的数据汇聚到BAU,BAU根据整个阵列的SOC不均衡度、温度分布、历史数据,给每个簇下发不同的功率调度指令。比如3号簇温度偏高,那就少充点;7号簇SOC偏低,放电时优先让它多放一点。这就是"簇级均衡"的核心逻辑,也是BAU和BCU最大的区别——BCU管单簇,BAU管全局。

举个例子,有个项目里出现过这种情况:某个储能单元里8个簇,因为投产时电芯批次不同,1号和2号簇的内阻比其它簇高不少。系统装好以后没有做簇级均衡,结果1号簇在放电时电压跌落特别快,总是最先触底,整站被迫降功率。后来靠BAU的上层调度,给1、2号簇在充电时提前减少充电电流,放电时反之,相当于"细水长流",这个站的整体可放容量硬是提升了8%。这就是BAU的价值——管好"木桶最短板"。

3.2 协议交互:CAN总线是分层架构的"神经系统"

这三层控制单元之间靠什么交流?目前行业里主流还是CAN总线,部分新系统开始用工业以太网(比如EtherCAT)做主干了。但CAN总线的地位在未来五年内依然稳固,主要原因就是成本低、可靠性高、布线简单,在电芯级这么小的空间里,以太网物理层那套东西根本塞不下。

通信架构上,一个典型储能单元的布局是这样:

[BMU×14]---CAN---[BCU×1]---CAN---[BAU×1]---以太网---[EMS/PCS]

这里有一个特别容易踩的技术坑:BMU和BCU之间的CAN波特率、BCU和BAU之间的CAN波特率,很多系统是不一致的。BMU到BCU这一段,一般用的是250kbps,因为这段距离短、节点多,数据量不大但实时性要求高;BCU到BAU这一段,根据距离长短和数据量,常用500kbps或者1Mbps。波特率不一致怎么桥接?BCU就是天然的网关——它一边收250kbps的CAN,一边发500kbps的CAN,数据在两个网段之间转发。

协议栈方面,行业里最常用的是基于J1939改的私有协议,或者直接用CANopen。J1939的好处是报文ID结构清晰,适合点对点+广播混合的通信模式。至于应用层的报文格式,各家有各家的私货,但核心几类报文是共通的:电压/温度上报帧、状态帧(充放电状态、SOC/SOH)、故障帧、均衡控制帧、心跳帧。

心跳帧特别重要——这是分层系统里判断"下面那个设备死了没有"的关键机制。一般BCU每100ms发一次心跳给BAU,BAU如果连续3个心跳周期没收到,就判定这个BCU失联,执行相应的保护逻辑。有的系统里心跳超时判定是200ms,有的设计更保守,判定为500ms以上。判定值不能太激进,否则CAN总线上偶发干扰导致丢帧就会误判,误判后全场跳闸,动静太大。但如果太保守,又失去了快速保护的意义。我给个经验值:心跳周期100ms,连续丢失5帧判离线,也就是500ms,既不会太敏感,也不会太慢。

3.3 保护策略的三级联动:从电芯到电站的"层层设防"

储能系统的安全性靠什么兜底?就是这套三级联动的保护策略。

第一级,电芯级保护(BMU做的):单体电压超过3.65V(磷酸铁锂)立刻报过压,低于2.5V报欠压,温度超过60℃报过温。这一步的动作要求是"快"——从采样到标志位置位,BMU的响应时间一般在毫秒级。

第二级,簇级保护(BCU做的):当BCU收到BMU上报的过压/欠压/过温事件,并且判断达到"严重"等级,BCU直接分断簇内主正、主负继电器,隔离故障簇。这一级动作的核心诉求是"独立"——簇内故障不能殃及整个系统,其它簇还能正常工作。

第三级,阵列级保护(BAU做的):BAU收到多个BCU的故障上报,或者检测到通讯丢失、绝缘故障、消防联动信号,会执行整站级的分闸和急停。这一级的动作原则是"全局"——要么整站隔离,要么降功率运行,视故障严重程度而定。

这三级的差异用一个场景说清楚:某簇一个电芯电压偏高,BMU上报;BCU判断是轻微偏高,不动作,但标记了该簇限流;BAU收到所有簇的限流请求以后,统一给PCS下发一个降低充电功率的指令。如果这个电芯继续恶化,电压超过了硬压保护阈值,BCU才会直接断开这个簇。

辅助继电器序列这里必须得补一个关键细节。BCU断高压的时候,要严格按照"先分主正、再分主负、最后断预充回路"的顺序来。不能同时断开,因为直流母线有储能电容,瞬间的通断会产生电弧,严重了会烧蚀继电器触点。

4. 实操中的关键环节:从选型、联调到运维,我踩过的那些坑

4.1 选型把关:三个必须较真的参数

硬件选型阶段,大家最容易被宣传册上的参数唬住。我建议碰到这三个参数的时候,多问几句:

电压采集精度。很多供应商标称"±1mV",但那是在恒温条件下的表现。实际工况下温度范围拉大、电压输入有共模干扰,能稳定在±3mV以内就算不错了。合同上签归签,到货后按GB/T 34131标准抽检一下才靠谱。

均衡电流。真正的均衡电流不只看标称值,还得实测。有的板子标称100mA均衡电流,但实际均衡电阻底下铺铜面积不够,工作不到十分钟热保护了。均衡电流上去了,热设计必须跟着走,不然就是纸上谈兵。

CAN通信波特率误差。CAN总线对位定时要求挺严格,要求波特率误差不超过±0.5%。碰到过一批BMU,标称250kbps,实测波特率误差到了1.3%,结果在高温条件下大量丢帧。后来排查发现是晶振选的劣质货,温度一高频率就飘。

4.2 联调阶段的痛点:多簇并联的“基线对齐”

储能项目联调阶段,最让我头疼的问题之一是多簇之间的SOC基线不一致。

为什么会出现这个问题?因为每簇的BMU都独立在算自己的SOC,初始上电时如果没有一个统一的基准,每个簇的SOC都会有一点点差异。数量少还好,数量一多差异就放大了。系统运行一段时间后,可能出现1号簇40% SOC,2号簇45% SOC的情况。

解决办法有两种:

第一种是上电静态对齐。系统断电状态下,通过CAN下发指令让所有BCU读取本簇的OCV(开路电压),根据OCV-SOC曲线做一次初值标定。但这种办法要求电芯已经静置足够长时间,电压回稳了才准。

第二种是运行中对齐,这也是BAU的核心算法之一。BAU实时汇总所有簇的SOC、电压、电流,通过卡尔曼滤波或者安时积分修正,把各簇的SOC往平均值上靠拢,配合簇级均衡,逐步把差异拉平。

实操中的建议:新项目联调时,先在静态工况下做一遍基线对齐,再进入动态联调。别指望单个供应商帮你搞定所有兼容问题,自己需要懂这套逻辑,现场才调得动。

4.3 运维阶段的实用技巧:故障排查不给力的“三大要因”

系统运行以后出问题,怎么排查?我总结下来,90%的BMS类故障都逃不开这三个原因:

通信故障。表现形式是BCU一直报"BMU通信超时"。常见原因有这么几个:CAN总线终端电阻没接对(CAN网络两端各需要120Ω,中间绝对不能加)、连接器端子松动、布线时CAN线跟动力线走了一个线槽导致干扰。排查手法是用示波器抓CAN_H和CAN_L的差分波形,看电平是否正常,再看眼图是否干净。

采样偏差。表现形式是某个BMU上报的电压跟万用表实测值差很多。先查采集线束的接插件是不是氧化或者松了,再用一个标准电压源从BMU采集端子注入已知电压,验证板卡的采样链路是否正常。这里的坑是——很多现场的"采样偏差"其实不是BMU板子的锅,而是电芯本身已经出了问题,内阻变大导致实际端电压就是低的。换个思路去排查,能少走很多弯路。

继电器粘连。表现形式是BCU下发分闸命令后,母线依然有电压。原因基本是继电器触点在多次大电流开断后烧蚀粘连。排查方法是在分闸状态下看母线电压传感器读数,如果还有电压基本就能确认。预防思路是加强分闸前的电流判断——电流小于一定阈值再分闸,能最大程度减小电弧损伤。

5. 当前行业趋势与进阶方向:控制器到底会不会被“融合”掉?

聊到这里,有个趋势必须提:三级架构正在被"融合"。

原来的分层设计是物理原因决定的——信号线太长、算力不够、接口不统一。但现在芯片算力暴涨,MCU越来越多,以太网通信逐渐下放,很多设备厂商开始在做一个事情:把BCU和BAU融合,甚至在某些中小型系统里把三级直接合并成一级。

比如工商业储能柜,有时候一套系统就一个柜子,几簇电池,那还要BAU吗?有的厂商就把BAU做成了BCU的一个逻辑功能模块。这种融合降低了BOM成本,也减少了一级通信故障点。但代价是灵活性下降——柜子扩容时,原来的"一台BAU管20个BCU"就变成单机模式,扩展得加设备。

我的建议是:做项目时想清楚系统规模和发展预期。如果是想做标准化的小产品,比如家用储能,三级改两级甚至一级都行,降本显著。如果是大型电站,未来有分期扩容的打算,老老实实保留三级架构,别为省一两个控制器的钱把系统灵活性丢掉了。

还有一个比较新的技术方向是AI辅助的故障预测。现在BMU采集的数据越来越全,BCU和BAU完全可以利用这些数据做趋势分析,提前预判电芯热失控。我见过一个实验性项目,用BCU采集到的电芯内阻变化曲线,结合温度上升速率,成功提前了20分钟预警了一次电芯内部异常。这个方向后期应该会越来越多地落到工程里。

6. 最后再分享一个真实的故障排查案例

去年年底,一个投运半年的储能站报了一个比较隐蔽的故障:2号簇经常在凌晨两三点钟无征兆跳闸。白天运行一切正常,一到夜间低负荷时段就跳。

现场排查了很久,一开始怀疑是消防联动误动作,把烟感探头换了三遍,没用;又怀疑是PCS通信干扰,隔离了一整晚,还是跳。后来翻BCU的故障记录日志,发现每一次跳闸前几十秒,都会报一条"BMU电压采样异常",但只是一闪而过,没有保持。

顺着这个线索,我们把2号簇的14个BMU的CAN报文全部抓下来做了离线比对,发现出问题的BMU在跳闸前会有连续几次报文的电压值明显跳变,从正常值跳到零,再跳回来。这一看就是典型的接触不良——BMU采集线束的端子在某温度段下热胀冷缩,间歇性断开。

处理办法其实很简单:把问题BMU的采集端子重新压接了一遍,更换了端子母头,问题彻底消失。但这个案例最值得反思的是,从最初出问题到最终定位,用了整整两周。如果当初在BCU里多设计一个逻辑——"同一电芯电压异常跳变连续出现3次即记录为疑似接线问题并报警",这个故障应该一天内就能被发现。

所以做储能系统控制单元的研发或调试时,日志记录和逻辑诊断功能真的值得多做一点。这比多堆一些硬件参数来得更实在。你永远不知道现场会出什么样的奇葩问题,而多留一条诊断信息,就多了一分快速找到问题的把握。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询