简介:面向SDH传输网运维人员、通信专业学生及光网络初学者,这份文档系统讲解SDH网络结构与保护机理。内容从核心层、汇聚层、接入层的三层网络入手,逐一介绍链形网、自愈环以及T型网、环带链、相切环、相交环、枢纽网等复杂拓扑,重点剖析二纤单向与双向通道保护环、二纤与四纤双向复用段保护环的工作原理、容量差异和适用场景,并整理了自愈概念、两类自愈环对比以及PDH向SDH过渡的策略,便于按章学习、考前复习或工程查阅。包体为1个doc格式文档,约199KB,正文含目录、小结和习题,可快速定位网络保护设计要点,也能为自愈环选型、拓扑规划提供清晰参考。已有174人学习下载,是通信专业学生和传输工程师理解SDH组网可靠性与自愈机制的有益参考资料。
1. SDH网络结构和网络保护机理到底在讲什么:从一段断缆不断业务的现场说起
凌晨两点接到传输网管告警:某环路两根纤一个报LOS、一个报RDI,对应光缆被施工队挖断。但天亮前查询业务,所有用户业务一条没丢。这就是SDH网络结构加网络保护机理在兜底:网络结构决定了业务“从哪里绕”,保护机理决定了“怎么绕、多快绕”。这篇笔记把这些内容放一起讲清楚,覆盖网络规划时怎么选拓扑、开局时怎么配保护参数、故障时怎么排查倒换异常,适合传输运维工程师、网络规划人员,以及刚接手SDH网管、想把保护配置真正吃透的人。不打官腔,按我实际开局的习惯一步步来。
2. 先看清SDH网络结构:分层模型、拓扑形态和设备角色
SDH网络结构可以从两个维度理解:纵向是分层的传送体系,横向是链、环、网组成的连接关系。多数人一开始只背“环网有保护”这句话,实际上大量故障和配置问题都出在分层概念不清、拓扑选型不当上。网络结构如果不先立住,后面所有保护机理都是空中楼阁。
2.1 分层模型:通道层、复用段层、再生段层各自管什么
SDH的架构对应ITU-T G.803描述的分层模型,从上到下依次是通道层、复用段层、再生段层。通道层又分高阶通道(VC-4)和低阶通道(VC-3、VC-12、VC-11等),负责端到端的业务承载;复用段层负责多个通道在一个物理段上的复用传输;再生段层处理光口之间的信号放大和再生。业务信号从用户侧进入,先映射进低阶通道,再复用到高阶通道,最终装载进STM-N帧结构,沿物理光缆传输。
为什么要关心分层?因为每一层有自己独立的告警和倒换机制。通道层的保护范围是端到端,比如A站到Z站的业务,沿途任何一段出问题都能触发保护;复用段层的保护范围只在相邻两个站点之间,超过这段距离,保护信息由K字节逐站传递。分层的另一个价值在排障:故障信号会逐层向上传递,光口LOS会引发再生段LOF,进而上报MS-AIS,最终在通道层表现为AU-AIS或TU-AIS。判断告警来自哪一层,直接决定你是查光口还是查业务路径。
| 层次 | 承载单位 | 典型故障信号 | 保护范围 |
|---|---|---|---|
| 再生段层 | 光信号、STM-N帧定位 | LOS、LOF | 单段光缆 |
| 复用段层 | STM-N复用段开销 | MS-AIS、MS-RDI | 相邻站点之间 |
| 高阶通道层 | VC-4 | AU-AIS、HP-RDI | 端到端 |
| 低阶通道层 | VC-12、VC-3 | TU-AIS、LP-RDI | 端到端 |
这张表值得贴在工位上。实际运维中,MS-AIS和AU-AIS的区别经常被混淆:前者是复用段层故障,后者是通道层故障。看到AU-AIS时,保护倒换往往已经发生或正在发生,业务感知不到;看到LOS和LOF时,说明物理层已经断开,重点转向光口和光缆。分层的概念理顺后,保护机理的配置才能对号入座。
2.2 拓扑形态:从链到环,再到环带链和相切环
拓扑是网络结构里最实在的部分。SDH常见拓扑包括点对点、线形链、环形、环带链、相切环、相交环和网状网。点对点是最原始的形态,只有两根纤、两个站点,谈不上自愈;线形链在点对点基础上串入多个站点,业务可以在中间节点上下,但链上任何一处断纤,下游业务全部中断,只能靠1+1线性复用段保护挽救一下;环形拓扑把链两端闭合,业务有了第二条路由,这才谈到自愈。
| 拓扑形态 | 保护能力 | 典型场景 | 成本与可靠性 |
|---|---|---|---|
| 点对点 | 无自愈,可做1+1 | 两支局间大颗粒 | 成本最低,可靠性差 |
| 线形链 | 1+1线性复用段 | 末端接入 | 成本低,单点断链全断 |
| 环 | 通道保护/MSP环 | 汇聚层、骨干层 | 成本适中,可靠 |
| 环带链 | 环内保护,链上无保护 | 接入层挂汇聚环 | 成本低,链端是短板 |
| 相切/相交环 | 切点站可做SNCP | 大型城域核心 | 交叉复杂,需严格规划 |
| 网状网 | 多路由交叉 | 核心机房 | 成本最高,冗余最强 |
我的开局习惯是:核心层用相切环或双平面环做冗余,汇聚层用环,接入层允许链,但链上业务必须明确标注“无保护”。链不是不能用,而是必须提前让业务侧知道:链上任何一处掉电或断纤,整条链上的业务会全部受影响,这不是保护机理能解决的,是网络结构决定的天花板。环带链最常见的翻车点是链端站掉电,下文第5章会专门讲。
2.3 设备角色:TM、ADM、DXC和REG怎么摆
设备形态决定网络结构怎么落地。SDH设备主要有四类:TM(终端复用器)放在链的两端,只能收发改端业务,不支持中间穿通;ADM(分插复用器)是环上最核心的设备,可以在任意站点上下业务,也能让业务穿通;DXC/SDH交叉设备负责大节点的交叉连接,相当于一个可编程配线的交叉矩阵;REG再生中继只做3R再生放大,不上下任何业务。
环上所有站点都要用ADM,因为业务在哪里上下、哪里穿通,都由ADM的交叉连接决定。TM放在环里会非常尴尬:它没有穿通能力,只能自己一个站点上下业务,等于在环上制造了一个不可绕行的单点。DXC一般出现在核心节点的机房,用于多个环或网状网的交叉汇聚。REG只解决传输距离问题,不参与保护,两个ADM之间光功率预算不够时加REG,但REG掉电同样会造成光路中断,所以有REG的段落要做冗余设计。
设备摆位时还要留意光功率预算。环上相邻站点光纤过长时,不能只靠调大发光功率解决,超预算必须加光放或REG。很多工程师开局时不查发光功率,等业务开通后出现零星误码才回头查,那时候定位成本反而更高。网络结构最终要落到站点的物理连接上,设备角色选错,拓扑再标准也白搭。
3. 保护机理拆解:通道保护、复用段保护和SNCP怎么工作
保护机理是SDH最有价值的核心。理解它,不只是知道“双发选收”四个字,而是要清楚每类保护在什么网络结构下可用、用什么开销字节通信、倒换由谁发起、业务在倒换瞬间经历了什么。这一章拆开讲三类最常见的保护方式。
3.1 通道保护:双发选收和额外业务
通道保护是SDH最简单的自愈方式,核心是“双发选收”。业务在源端同时发向工作通道和保护通道,宿端同时收两个方向的信号,正常时选收工作通道,工作通道故障时自动选收保护通道。因为是并发优收,倒换速度极快,整条端到端路径的倒换通常能控制在几十毫秒内。
通道保护分1+1和1:1两种。1+1是永久双发,保护通道不传额外业务,收端仅做选收,不需要节点间协议通信,天然适合跨多段光缆的端到端业务;1:1则只在故障时才把业务桥接到保护通道,保护通道空闲时可以传额外业务,但需要两端通过APS协议协调,倒换前要完成协议握手,逻辑比1+1复杂。
选1+1还是1:1,取决于业务重要程度和带宽利用率。我一般给政企专线、重要汇聚业务用1+1,给可容忍短时中断的普通业务用1:1传额外业务。需要特别注意:1+1通道保护在环上的容量成本是双倍的,一个2.5G环,1+1业务实际只给业务侧留1.25G可用容量。规划的同事听到“环容量减半”不要惊讶,这是通道保护的固有代价。
3.2 复用段保护环:二纤单向、二纤双向MS-SPRing和四纤环
复用段保护发生在复用段层,保护单位是整个STM-N帧内的全部VC-4时隙,而不是单条业务路径。它比通道保护节约容量,但倒换逻辑复杂很多,依赖K1/K2字节的APS协议。常见形态有三种:二纤单向复用段专用保护环、二纤双向复用段共享保护环(MS-SPRing)、四纤双向复用段共享保护环。
二纤单向复用段环基于1+1原理,业务双向传输,但保护方向是反方向的,不需要APS协议,倒换速度快,代价是环上总带宽固定,不能像MS-SPRing那样让时隙在不同节点间复用。二纤双向MS-SPRing把每根纤的时隙分两半:一半做主用,一半做保护,主用时隙可以在环上各段重复使用,保护时隙则被环上所有节点共享。故障时相邻节点通过K字节握手,把故障段两侧的业务桥接到保护时隙的相反方向。
四纤MS-SPRing更复杂,用两根工作纤加两根保护纤,每个节点有四个光口。它的容量和可靠性最高,但光纤资源要求翻倍,一般只在核心层或超长距骨干上使用。选型时不要盲目迷信MS-SPRing,如果环上业务量不大且以点对点大颗粒为主,通道保护环更简单可靠。K字节协议一旦出问题,排查复杂度远超通道保护。这是一个“性价比”选择,不是“技术先进度”选择。
3.3 子网连接保护SNCP:跨环、相切环场景的首选
SNCP(子网连接保护)可以理解为把通道保护的思想用在子网连接上。它在交叉连接矩阵里把一条业务路径配置成两个路由,一个工作一个保护,宿端选收。SNCP最大的价值在于跨环:环带链业务、相切环间业务、跨网元业务,只要保护路径能拓扑走通,就能配置SNCP,不需要环上所有节点都参与复用段协议。
配置SNCP的关键是“路由分离”。工作路由和保护路由必须在物理上不重合,否则断了一根光缆,两个路由同时中断,保护形同虚设。实际开局里最常见的问题是:工作通道走A环,保护通道也在A环,只是换了方向,结果A环某一段光缆断裂,业务还是中断。SNCP虽然灵活,但保护质量完全取决于路由规划,规划阶段必须逐段核对光纤路由,不能只看网管拓扑上有两个不同颜色。
SNCP倒换同样是双发选收,倒换时间可以做到50毫秒以内。它不像MS-SPRing那样需要全网时隙统一规划,所以跨厂商互通和后期业务调整更灵活。我遇到跨厂商对接、跨环业务时,第一选择永远是SNCP而非MS-SPRing,不是为了先进,是为了少碰协议兼容性的“玄学”问题。
3.4 保护倒换的基本流程:检测、协议、桥接、恢复
无论哪类保护,倒换流程大致分五步:故障检测、信号失效判定、协议通信、桥接与选收、恢复回切。故障检测靠光模块上报LOS、帧同步丢失上报LOF或误码超限上报SD/SF;信号失效判定依据是LOS/LOF/MS-AIS或误码率超过阈值;协议通信由K1/K2字节完成,节点间交换请求类型和桥接指令;桥接与选收发生在交叉连接矩阵,业务从工作通道切换到保护通道;恢复回切则在故障消失后,经过WTR等待计时后自动回切。
| 步骤 | 触发条件 | 涉及机制 | 典型时延 |
|---|---|---|---|
| 检测 | LOS、LOF、MS-AIS | 光模块、帧同步 | 亚毫秒级 |
| 判定 | 误码阈值、信号失效 | 性能监视 | 10毫秒级 |
| 协议通信 | K1/K2字节握手 | APS协议 | 数毫秒 |
| 桥接与选收 | 交叉矩阵切换 | 硬件交叉 | 亚毫秒级 |
| 回切 | WTR计时结束 | 协议与交叉 | 5-12分钟 |
这张表有助于理解为什么倒换时间能压到50毫秒以内:检测和切换都是硬件动作,协议通信只在一个环的相邻节点间进行,不经过上层网管。网管在整个倒换过程中只“看戏”,不“导演”。所以网管脱管、网管服务器宕机,都不影响保护动作发生。理解这一点,就不会在故障时傻等网管刷新状态,而是直接去查光口和K字节。
4. 保护参数怎么设:从网管配置到50ms倒换
理论清楚了,最终要落到网管配置上。这一章按开局顺序讲:创建网元、连纤、配保护、设参数。不同厂商网管界面不同,但逻辑一致,参数名也基本对齐ITU-T标准,照着这个顺序做,换厂商也能举一反三。
4.1 开局配置步骤:从创建网元到保护类型下发
第一步:在网管上创建网元,录入站点名称、设备类型、槽位和光口信息。注意光口要区分收发方向,并确认光模块类型和速率一致。第二步:创建光纤连接,把相邻站点的光口一一对应。连纤错误是开局最常见的低级失误,两根纤收发接反会导致远端LOS,业务不通。第三步:规划业务时隙。通道类业务要明确VC-4或VC-12时隙位置,复用段环要区分主用时隙和保护时隙。第四步:配置保护类型,选中参与保护的网元和光口,选择通道保护、复用段保护或SNCP。第五步:下发全部配置,等待网元告警清除,确认保护状态从“未配置”变为“正常”。
配置保护类型时,网管会让你选择保护子类型。常见的字眼有“1+1保护”“1:1保护”“二纤双向复用段共享保护环”“SNCP”。选之前一定先确认网络结构:链上只能配线性复用段保护或1+1通道保护,环上才能配复用段共享保护环,跨环业务才考虑SNCP。选错保护类型,轻则无法下发,重则下发后业务不通。
4.2 六个必调参数:恢复模式、WTR、误码阈值、倒换模式
配置下发后,必须人工检查以下参数,默认值不一定适合你的网络。
| 参数 | 常见默认值 | 建议值 | 不调整的后果 |
|---|---|---|---|
| 恢复模式 | 恢复 | 重要业务用非恢复 | 故障反复倒换导致瞬断 |
| WTR等待时间 | 5分钟 | 5-12分钟 | 设0会震荡倒换 |
| 误码倒换阈值 | 1E-6 | 重要业务1E-6 | 误码不触发保护 |
| 倒换模式 | 双端 | 默认为双端 | 单/双端逻辑不一致 |
| 额外业务 | 关闭 | 1:1保护可开启 | 保护带宽闲置 |
| 协议监视 | 开启 | 开启 | 无法定位协议异常 |
恢复模式是最容易踩坑的参数。它决定故障消除后业务是否自动回切到工作通道。非恢复模式下,业务会一直留在保护通道,直到人工干预。我一般给重要政企业务配非恢复,因为回切动作本身会带来一次极短瞬断,如果工作通道还不稳定,回切反而制造事故。WTR则负责“防止震颤”:故障消除后不立即回切,等待5到12分钟让工作通道稳定。设成0是典型的“手贱”行为,故障恢复瞬间工作通道未必稳定,回切失败又会再次倒换,形成震荡。
误码倒换阈值需要结合业务容忍度设置。阈值设得太灵敏,比如1E-3,环境劣化也触发倒换;设得太迟钝,比如1E-9,误码积累到业务受损才倒换。我通常按业务等级区分:重要业务1E-6,普通业务1E-3。这个参数在网管上有时候叫“SD/SF阈值”,本质一样。倒换模式一般要求全网统一,混用单端和双端会导致部分节点认为倒换未完成。
4.3 50ms倒换时间是怎么来的
ITU-T G.841对SDH环网保护倒换时间的要求是小于50毫秒。这个50毫秒并非拍脑袋定的,而是为了满足传统语音和TDM业务的传输要求:超过50毫秒的中断,电话交换机会判定呼叫失败。50毫秒的构成大致是:故障检测10毫秒以内,信号失效判定10毫秒以内,APS协议握手10到20毫秒,交叉矩阵切换几毫秒,总计控制在50毫秒以内。
实际开局时,新设备的通道保护倒换经常能到20-30毫秒,复用段保护环在30-50毫秒之间。如果倒换时间超过50毫秒,优先怀疑三个地方:交叉矩阵负荷过高导致切换延迟、APS协议配置错误、光模块的告警检测被性能监视策略延迟。网管上如果有“倒换时间统计”,开局验收时务必记录,这个指标是保护体系的体检报告。
5. 五个翻车现场:SDH保护配置与运维的排查记录
保护机理写得再漂亮,配置阶段的细节做错一样白搭。这一章把我在开局和运维里真实遇到过的翻车场景整理成排查记录,每一条都是先现象、再原因、后解决。
5.1 故障恢复后业务长期留在保护通道
现象:某环光缆修复后,一部分业务仍然占用保护通道,没有回到工作通道,导致保护通道长期失去备用能力。原因:恢复模式参数在各站点配置不一致。有的站点配了恢复模式,有的站点配了非恢复模式,回切请求被非恢复节点拦下。解决:全网统一恢复策略,重要业务统一非恢复后,由网管人工发起回切,不要依赖自动回切。排查时先看网管上各站点的恢复模式字段,再核对WTR计时是否已结束。
5.2 WTR设成0导致反复倒换震荡
现象:光缆故障修复后,业务在几分钟内频繁瞬断,网管告警反复出现倒换和回切记录。原因:开局时为了“故障恢复立即回切”,把WTR设成了0。工作通道刚恢复时误码和抖动尚未稳定,回切后再次触发倒换,形成死循环。解决:把WTR设回5分钟以上,观察倒换次数明显下降。这个参数不是给运维人员“图快”用的,它是系统稳定性的组成部分。
5.3 环带链的链端站掉电,整链业务全断
现象:环带链拓扑中,链的末端站点掉电,链上所有业务中断,环上其他业务正常。原因:环带链结构的链段本身是线形链,没有形成闭合回路,链端站掉电后,下游业务没有第二条物理路由可供倒换。解决:这类业务必须在业务侧明确标注“无保护”,重要业务要么在链段增加物理环路,要么把链上业务配置成SNCP,保护路径绕到另一个环上。排查时不要指望任何保护参数能补救,这是网络结构问题。
5.4 二纤MS-SPRing时隙模板不统一,倒换时保护通道错接
现象:MS-SPRing环上光缆中断后,部分业务倒换成功,部分业务倒换后不通,告警显示保护通道接入异常。原因:各站点的时隙模板不统一,A站的保护时隙指向VC-4的第3时隙,B站却指向第5时隙;正常时业务走的都是各自工作时隙,感觉不到问题,倒换时保护时隙一对接就错位。解决:开局时统一全网时隙模板,逐站点核查主用时隙和保护时隙的编号;倒换测试后,查看网管上的保护通道占用记录,确认所有站点映射一致。
5.5 SNCP主备路由走了同一根光缆
现象:两个站点之间的SNCP业务,在一次断纤后同时失效,保护完全没有起作用。原因:主用通道和保护通道的物理光缆路由都在同一根缆井里,虽然是两个方向,但被同一根光缆承载。断纤恰好发生在共用段,双路由同时中断。解决:规划SNCP主备路由时,逐段核对配纤表,不只对比拓扑方向,还要对比物理路由的杆路、管道、光缆编号。这是我在项目里最强调的一步,也是运维里最容易被忽视的一步。路由分离核查要落到“物理管道”,不是落到“网管颜色”。
6. 让保护真正可靠:倒换演练的三个动作和验证方法
保护系统不是配置完就“一劳永逸”的,它像灭火器,平时没感觉,关键时刻必须能用。我不建议等故障去检验保护,相反,开局验收和维护窗口里,我会主动做倒换演练,而且坚持做三个动作:网管手动倒换、拔纤实测、K字节监视。
第一个动作是网管手动倒换。在网管上对业务路径发起“强制倒换”或“锁定倒换”,观察业务是否按预期切换到保护通道。强制倒换用于测试正常状态下的切换能力,锁定倒换则用于验证保护通道是否可用。操作前要通知业务侧,因为强制倒换会造成业务瞬断。手动倒换的意义在于:它能验证交叉矩阵、协议状态、时隙映射全链路是否正常,而且可以重复执行,不受物理条件限制。
第二个动作是拔纤实测。找一根光纤跳纤,在ODF架侧模拟断纤,同时用SDH测试仪或误码仪监测业务。掐表记录从断开到业务恢复的时间,对比是否小于50毫秒。拔纤前先在网管上挂“维护锁定”,防止倒换动作与维护操作互相干扰;拔纤时要只拔一侧,观察单向倒换行为,再恢复,观察回切是否正常。如果条件允许,把光口和收端的仪表同时监视,能清晰看到LOS产生、K字节握手、交叉切换三个时间点。
第三个动作是监视K字节。网管上的协议监视页面能看到K1/K2字节的实时内容。正常状态K2显示“空闲”,倒换请求时K1会显示请求类型和源节点ID,K2显示目的节点ID。学会读K字节,等于拿到了保护协议的黑匣子,排障时不用再瞎猜。我的习惯是每次演练后导出一份倒换日志,记录倒换原因、时间、恢复方式,归档备查。
这三件事坚持下来,保护系统的可靠性基本心里有数。多年开局的教训是:最不可靠的环节往往不是设备,而是没验证过的配置。倒换演练发现的每一个小异常,都是提前排掉一个雷。希望帮到你。
本文还有配套的精品资源,点击获取