gpu-burn 使用指南:多 GPU 压力测试与显卡验机完整教程
2026/8/27 8:26:09 网站建设 项目流程

gpu-burn 使用指南:多 GPU 压力测试与显卡验机完整教程

【免费下载链接】gpu-burnMulti-GPU CUDA stress test项目地址: https://gitcode.com/gh_mirrors/gp/gpu-burn

刚组好一台装 8 张显卡的服务器,部署训练任务前总担心某张卡在高负载下悄悄出错。gpu-burn 是一款多 GPU CUDA 压力测试工具,让所有显卡同时跑满浮点运算,并自动校验计算结果、逐卡输出 OK/FAULTY。

🔍 适合谁用

如果你维护带多张 NVIDIA GPU 的机器——新机器验收、上架前烤机、或者想排查某张卡是不是坏了——它都能派上用场。不用搭深度学习环境,一条命令就能让所有卡同时满载,省去了逐张卡测试的时间。

🚀 快速上手

三步跑通,每步都很短:

1️⃣ 克隆源码到本地:

git clone https://gitcode.com/gh_mirrors/gp/gpu-burn cd gpu-burn

2️⃣ 编译,Makefile 会自动探测 CUDA 安装位置:

make

3️⃣ 先列出全部显卡,再做一次 5 分钟冒烟测试:

./gpu_burn -l ./gpu_burn 300

结束时每张卡都会打印 OK 或 FAULTY,全绿就可以放心继续。

🧰 核心特性

🔥 燃烧时长直接写进命令

不需要任何配置文件,命令行最后一个参数就是秒数,到点自动停。

./gpu_burn 600

📦 显存占用精确可控

-m决定吃多少显存,可以给固定 MB 数,也可以给可用显存的百分比,默认 90%。机器上还有别的进程时用百分比更稳:

./gpu_burn -m 4096 1200 # 固定 4GB,跑 20 分钟 ./gpu_burn -m 50% 60 # 半块显存,跑 1 分钟

🎯 单卡定点测试

-i N只压编号为 N 的那张卡,用来隔离嫌疑对象非常顺手。

./gpu_burn -i 2 1800

🧪 双精度与 Tensor 核心模式

-d切换成双精度浮点运算(精度更高、更吃算力),-tc尝试调用 Tensor 核心(GPU 里专门加速矩阵运算的硬件单元)。

./gpu_burn -d 3600 ./gpu_burn -tc 600

✅ 自带结果校验

它不是单纯把风扇吹热:内核在持续比较运算结果的差值,错误数会实时累计。任何一张卡被判 FAULTY,把该卡下线检修就行,不用整台机器陪跑。

🧗 进阶玩法

🐳 Docker 一键部署

服务器环境脏、不想动系统里的 CUDA 版本时,直接打容器镜像:

docker build -t gpu-burn . docker run --rm --gpus all gpu-burn

镜像默认跑 60 秒,构建时可用--build-arg COMPUTE=75 --build-arg CUDA_VERSION=13.0.0指定计算能力和 CUDA 版本。

⚙️ 构建时指定计算能力

计算能力是 NVIDIA 给每代 GPU 架构的编号,编译参数要和你的卡匹配:默认 7.5(Turing),30 系用 86,40 系用 89,H100 用 90。

make COMPUTE=89

CUDA 装在非默认路径时加make CUDAPATH=/usr/local/cuda-12.0

🪟 Windows 版本

win/ 目录是官方 Windows 移植版,需要 CMake 和 Visual Studio 的 C++ 工具链:

build.bat -c 86

编译出的 gpu_burn.exe 参数和 Linux 版完全一致,共享同一套内核。

💼 实战案例

场景一:新服务器 24 小时验收

./gpu_burn -d 86400

双精度全卡燃烧一整天,另开终端watch -n 5 nvidia-smi盯温度和功耗,整夜无 FAULTY 再交付。

场景二:定位"偶发卡死"的嫌疑卡

./gpu_burn -l确认编号,再只压那张可疑的卡:

./gpu_burn -i 1 -m 80% 3600

单卡 80% 显存压 1 小时,复现 FAULTY 基本可以断定是硬件问题,直接走售后。

❓ 常见问题

Q:make 提示找不到 nvcc?A:CUDA 工具链没装或不在默认路径,装上后执行make CUDAPATH=/usr/local/cuda-12.0

Q:新架构的卡该填多少 COMPUTE?A:对照架构查:20 系 75、30 系 86、40 系 89、H100 为 90。

Q:提示显存不足,但 nvidia-smi 明明还有空余?A:先确认没有别的进程占卡,再把-m降到 50% 留出余量重试。

写在最后

压力测试是确认 GPU 可靠性的最硬核方式,建议长夜挂机后再复测一轮。现在就可以克隆仓库、编译,然后跑一次./gpu_burn 300的 5 分钟冒烟测试。

【免费下载链接】gpu-burnMulti-GPU CUDA stress test项目地址: https://gitcode.com/gh_mirrors/gp/gpu-burn

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询