1. 一个电容,拖垮一张十几万的卡
很多人以为 GPU 坏一定是"大故障"。其实,很多核心烧毁的悲剧,起点只是一个不起眼的滤波电容失效。
一张 GPU 核心烧毁 = 十几万直接损失AI 训练中断 = 业务停摆数十万到上百万级损失起因可能只是一个滤波电容失效
2. 电容失效的连锁反应链
滤波电容失效
→ GPU 降频
→ ECC 纠错报警
→ 供电短路
→ GPU 核心烧毁(十几万损失)
→ AI 训练中断
→ 业务停摆(数十万~百万级损失)
3. 技术原理拆解
- 滤波电容的作用:平滑供电纹波,稳定 GPU 核心电压
- 电容失效后:纹波增大 → GPU 供电不稳定 → ECC 纠错率飙升
- 高频纹波持续冲击:MOS 管过热击穿 → 供电回路短路
- 供电短路持续:GPU 核心烧毁
4. 常见诱因
诱因 | 机制 |
长期高温运行 | 数据中心 7×24h,电容加速老化 |
硅脂干透/散热老化 | GPU 过热 → 电容连带过热 |
静电损伤 | 操作不规范,击穿电容 |
灰尘短路 | 未定期清洁,灰尘导电桥接 |
5. 自查信号(出现任意一项请警惕)
- ✅ GPU 温度异常升高(>85°C)
- ✅ nvidia-smi 显示供电降频
- ✅ DCGM 出现 ECC 报错
- ✅ 训练任务偶发性崩溃(非代码原因)
6. 预防与维护建议
- 定期nvidia-smi -q -d ECC检查 ECC 计数
- 关注 GPU 温度趋势,及时发现散热异常
- 定期清洁散热器,更换导热硅脂
- 出现供电异常立即停机检测
7. 结尾
主动维保 = 低成本修复。"早发现"是避免蝴蝶效应的唯一解。维核智算提供免费 GPU 健康检测。