17个AI术语扫盲(终章):GPU、分布式训练、推理优化——AI从「跑得动」到「跑得快」
约 3,400 字 | 预计阅读 12 分钟 | 系列第 5/5 篇
基础设施工程师阿哲把团队训练半年的模型部署上线。第一天,用户量暴增——然后用户开始投诉:「你们的 AI 回复要等 20 秒,我喝完咖啡它还没说完。」
阿哲查了半天,发现 GPU 利用率只有 23%。问题不在算力不够——在 Batch Size 设错了,GPU 大部分时间在空等。
从「模型跑通了」到「用户可以接受」,中间隔着一整套工程体系。这是系列终章——不讲算法,不讲 Prompt,专讲让 AI 真正跑起来的硬件和系统工程。
读这篇文章你会得到:
- GPU 为什么是 AI 的唯一选择——不是因为它「强」,是因为一种巧合让它刚好对了
- 分布式训练的本质是「分而治之」——四种并行策略其实在解决四个不同的问题
- 推理优化的终极目标不是让模型更快,是让用户感觉不到模型在思考
目录
- GPU、CUDA、TPU:为什么这些名词统治了 AI
- 训练 vs 推理:同一个模型,两种完全不同的工作负载
- 分布式训练:当一张 GPU 不够用
- MoE:一个反直觉的架构——「大模型,小算力」
- 推理优化:从 20 秒到 2 秒的秘密
- vLLM、KV Cache、Speculative Decoding:推理优化的工具箱
- 术语速查表
- FAQ
- 结语
1. GPU、CUDA、TPU:为什么这些名词统治了 AI {#1}
GPU(Graphics Processing Unit,图形处理器)最初为游戏而生——每秒渲染数百万个三角形需要大量并行计算。这种「并行做简单运算」的能力,恰好也是深度学习的核心需求。
为什么 GPU 而非 CPU?CPU 是为「串行复杂逻辑」优化的——几个强大的核心,擅长分支预测和乱序执行。GPU 是为「并行简单运算」优化的——几千个轻量核心,同时做矩阵乘法。
巧合中的必然:神经网络的核心运算是矩阵乘法。一个 4096×4096 的矩阵乘法需要做 687 亿次乘加运算。CPU 用 16 个核心串行做——慢。GPU 用几千个核心同时做——快。同样的计算量,GPU 比 CPU 快 10-100 倍。这不是「GPU 比 CPU 强」——是矩阵乘法刚好适合 GPU 的并行架构。
CUDA(Compute Unified Device Architecture,统一计算设备架构)是 NVIDIA 的 GPU 编程平台。它让你不用写 GPU 汇编,用类似 C++ 的代码就能调用 GPU 计算。CUDA 是 NVIDIA 的护城河——过去 15 年,AI 生态的每一座大楼都建立在 CUDA 的地基上。PyTorch、TensorFlow——底层全是 CUDA。
GPU 不是一张更快的显卡——它是目前人类大规模制造的最精巧的并行计算机器。NVIDIA 的市值超越全球所有半导体公司,不是因为游戏玩家多——是因为全世界的 AI 都在 CUDA 上跑。
TPU(Tensor Processing Unit,张量处理器)是 Google 自研的 AI 专用芯片。它为 TensorFlow 和矩阵乘法做了深度定制——比 GPU 更快更省电,但只能跑在 Google Cloud 上,只能用 Google 的软件栈。TPU 做不到的事:通用计算。TPU 做得到的事:矩阵乘法比 GPU 还快。
NPU(Neural Processing Unit,神经网络处理器)是 AI 加速芯片的统称。苹果的 Neural Engine、高通的 Hexagon、华为的昇腾都属于 NPU。和 GPU 的区别:NPU 为推理优化(省电优先),GPU 为训练 + 推理优化(通用优先)。
2. 训练 vs 推理:同一个模型,两种完全不同的工作负载 {#2}
Training(训练)和Inference(推理)是 AI 生命周期的两个阶段——它们对硬件的要求截然不同。
| 维度 | Training | Inference |
|---|---|---|
| 目标 | 学习参数 | 用学好的参数做预测 |
| 计算量 | 极大(数周-数月) | 较小(毫秒-秒) |
| 方向 | 前向 + 反向传播 | 仅前向传播 |
| 精度要求 | 高(BF16/FP16) | 可压缩(INT8/INT4) |
| 显存需求 | 极大(存梯度 + 优化器状态) | 较小(只存参数 + KV Cache) |
| 延迟要求 | 不敏感 | 极敏感(<2 秒是底线) |
| 硬件偏好 | H100、A100 | T4、L4、消费级 GPU |
为什么训练需要这么多显存?一个 70B 参数模型用 FP16 训练时显存占用:
- 模型参数:140 GB
- 梯度:140 GB
- 优化器状态(Adam):280 GB(动量 + 方差各一份)
- 合计:≈ 560 GB——正好需要 8 张 H100(80GB 显存/张)
Backpropagation(反向传播)是训练独有的环节。推理只需要前向传播——输入 → 模型 → 输出。训练还需要反向传播——把输出误差从最后一层传回第一层,计算每个参数对误差的「贡献度」(梯度),然后更新参数。
Latency(延迟)是用户感受到的响应时间——从发送请求到收到第一个 Token 的时间 + 生成完整回复的时间。Throughput(吞吐量)是系统每秒能处理的请求数。这两个指标天然互斥——优化 Latency 通常会牺牲 Throughput,反之亦然。
3. 分布式训练:当一张 GPU 不够用 {#3}
Distributed Training(分布式训练)是把训练任务拆分到多张 GPU(甚至多台机器)上并行执行。GPT-4 级别的模型需要上万张 GPU 同时训练数周。
四种并行策略,解决四个不同的问题:
Data Parallelism(数据并行)
最直观的策略——每张 GPU 有完整模型的一份拷贝,但处理不同的数据批次。计算完梯度后,所有 GPU 同步梯度,更新参数。
问题:每张 GPU 都要存完整的模型 + 优化器状态。70B 模型单卡装不下——DP 直接不可用。
Model Parallelism / Tensor Parallelism(张量并行)
把模型的一层「切开」——矩阵乘法的一个大矩阵,切分成多个小矩阵,分到不同 GPU 上并行计算。Megatron-LM(NVIDIA)是这一领域的标杆。
问题:GPU 之间需要频繁通信——通信量极大,对 GPU 之间的带宽要求极高(需要 NVLink/NVSwitch)。
Pipeline Parallelism(流水线并行)
把模型按层切开——GPU 0 处理前 10 层,GPU 1 处理中间 10 层,GPU 2 处理后 10 层。数据像流水线一样流过。
问题:GPU 有「气泡时间」——GPU 0 处理完第一个批次后要等 GPU 1 处理完才能送第二个批次。GPipe 和 PipeDream 用微批次(Micro-batch)减少气泡。
ZeRO(Zero Redundancy Optimizer)
DeepSpeed(微软)提出的优化策略——不是把模型切开,而是把优化器状态「分布」到多张 GPU 上。ZeRO-1 分优化器状态,ZeRO-2 分梯度,ZeRO-3 连参数都分。
ZeRO 的意义:让原本需要 8 张 GPU 才能训练的模型,在同样的硬件上降到 2 张就能跑。它是分布式训练的「民主化」技术。
实践中的组合:大模型训练通常是 DP + TP + PP + ZeRO 的组合。GPT-4 就用了所有这些策略。
4. MoE:一个反直觉的架构——「大模型,小算力」 {#4}
MoE(Mixture of Experts,混合专家)是当前最热门的模型架构创新。核心思想:模型很大,但每次推理只激活一小部分。
一个 MoE 模型由多个「专家」(Expert,即独立的子网络)和一个「路由器」(Router/Gate)组成。输入 Token 进入后,路由器决定把它发给哪几个专家处理(通常是 Top-2,即两个专家)。其他专家不参与计算。
结果:MoE 模型的总参数可能极大(如 Mixtral 8×7B = 总参数 46.7B),但每次推理只激活约 12.9B 参数。激活参数 ≈ 总参数的 25%——用 25% 的算力感受 100% 的规模。
为什么出现?继续堆 Dense 模型的参数——算力需求线性增长,性价比越来越低。MoE 打破了「参数越多 = 推理越贵」的铁律。
MoE 的代价:① 显存占用按总参数算——所有专家都要加载,路由器决策也有开销;② 负载均衡——如果某些专家总是被选中而另一些闲置(「专家坍塌」),训练就废了;③ 微调更复杂——专家之间的路由行为在微调时容易漂移。
| 模型 | 总参数 | 激活参数 | 激活比例 |
|---|---|---|---|
| Mixtral 8×7B | 46.7B | 12.9B | 28% |
| GPT-4(传闻) | 1.76T | ~280B | ~16% |
| DeepSeek-V2 | 236B | 21B | 9% |
5. 推理优化:从 20 秒到 2 秒的秘密 {#5}
推理优化(Inference Optimization)的目标:在不显著牺牲模型质量的前提下,让推理更快、更省资源。
为什么推理优化这么重要?因为用户不耐烦。一项 Google 研究显示:移动端页面加载超过 3 秒,53% 的用户会放弃。AI 回复的容忍度稍高——但超过 5 秒,用户就开始焦虑;超过 15 秒,大部分用户会切去做别的事。
Streaming(流式输出)是用户体验的第一道防线——不等到完整回复生成完毕,生成一个 Token 就显示一个 Token。用户感觉「有东西在出来」——心理等待时间大幅缩短。ChatGPT 和 Claude 都用了流式输出。
推理优化的本质不是让模型更快——是让用户感觉不到模型在思考。2 秒流式输出 + 心理等待管理,有时比 0.5 秒的批量返回更让人满意。
6. vLLM、KV Cache、Speculative Decoding:推理优化的工具箱 {#6}
KV Cache(键值缓存)
第一篇讲过 Attention:每个 Token 会和所有之前的 Token 做注意力计算。生成第 1000 个 Token 时,要对前 999 个 Token 重新计算 Attention。浪费。KV Cache 的做法很简单:把之前计算过的 Key 和 Value 向量缓存起来——生成下一个 Token 时,只计算新 Token 的 Q/K/V,旧的直接复用。
效果:推理速度提升数倍。代价:显存占用增加。KV Cache 是目前所有 LLM 推理框架的标配。
vLLM
vLLM是 UC Berkeley 开源的高性能推理引擎。它的核心创新是PagedAttention——像操作系统管理内存一样管理 KV Cache,用「分页」机制避免显存碎片。结果:显存利用率大幅提升,同样硬件可以处理更多并发请求。
2025 年,vLLM 和 TensorRT-LLM(NVIDIA)是生产环境的两个主流推理引擎。一般规律——NVIDIA GPU 用户首选 TensorRT-LLM,追求开源灵活性的团队选 vLLM。
Speculative Decoding(推测解码)
核心思路很有意思——用小模型「草稿」,让大模型「审批」。
大模型逐个生成 Token 很慢。Speculative Decoding 让一个极小的「草稿模型」快速生成一批候选 Token(比如 5 个),然后大模型一次性验证这 5 个——通过就全部采用,不通过就退回到第一个错误的 Token。
效果:在保证输出质量完全不变的前提下,推理速度提升 2-3 倍。大模型的输出没有变化——只是验证比生成快得多。
Batch Processing(批处理)
把多个推理请求合并成一批,GPU 同时处理。批处理提升 Throughput——并发用户越多,批处理优势越大。代价:单次请求的 Latency(延迟)可能增加——因为要等同一批的其他请求算完。
Continuous Batching(连续批处理)是 vLLM 的重要创新——不等一批请求全部完成,完成一个就换下一个进队列。相比传统「等整批完成再换新批」的做法,吞吐量提升了数倍。
7. 术语速查表 {#7}
| 缩写/术语 | 英文全称 | 中文 | 本质一句话 |
|---|---|---|---|
| GPU | Graphics Processing Unit | 图形处理器 | 大规模并行计算芯片,深度学习的硬件支柱 |
| CUDA | Compute Unified Device Architecture | 统一计算设备架构 | NVIDIA 的 GPU 编程平台,AI 生态的软件地基 |
| TPU | Tensor Processing Unit | 张量处理器 | Google 的 AI 专用芯片,矩阵乘法加速 |
| NPU | Neural Processing Unit | 神经网络处理器 | AI 加速芯片统称,手机端推理为主 |
| — | Training | 训练 | 用数据学习模型参数,需要前向+反向传播 |
| — | Inference | 推理 | 用学好的参数做预测,只需前向传播 |
| — | Distributed Training | 分布式训练 | 多 GPU 甚至多台机器协同完成训练 |
| — | Data Parallelism | 数据并行 | 每张 GPU 一个完整模型,切分数据 |
| — | Tensor Parallelism | 张量并行 | 将矩阵运算切分到多张 GPU 并行计算 |
| — | Pipeline Parallelism | 流水线并行 | 按层切分模型,数据流水线式传递 |
| — | ZeRO | 零冗余优化器 | DeepSpeed 的优化策略,分片存储优化器状态 |
| MoE | Mixture of Experts | 混合专家 | 大模型但每次只激活部分参数 |
| — | Inference Optimization | 推理优化 | 在不牺牲质量的前提下加速推理 |
| — | Streaming | 流式输出 | 逐 Token 返回,减少用户心理等待时间 |
| — | KV Cache | 键值缓存 | 缓存 Attention 的 Key/Value 避免重复计算 |
| — | vLLM | (项目名) | 高性能开源 LLM 推理引擎,PagedAttention 发明者 |
| — | Speculative Decoding | 推测解码 | 小模型草稿 + 大模型审批,2-3× 推理加速 |
| — | Latency | 延迟 | 用户感知的响应时间 |
| — | Throughput | 吞吐量 | 系统每秒可处理的请求数 |
| — | Batch Processing | 批处理 | 合并多个推理请求并行处理 |
8. FAQ {#8}
GPU 为什么会成为 AI 的唯一选择?
不是「唯一」——是「最优」。CPU 也能跑 AI(llama.cpp 让 MacBook 跑 7B 模型成为可能),但在训练和大规模推理场景下,GPU 的并行架构 + CUDA 生态 + 几十年积累的矩阵乘法优化让它在性价比上遥遥领先。过去十年没有任何硬件能真正挑战 GPU 在 AI 训练中的统治地位。
我需要多少显存来跑一个 7B 模型?
量化到 4-bit:约 4-6 GB 显存。一张 RTX 3060(12GB)就很从容。量化到 8-bit:约 8-10 GB。FP16(不量化):约 14-16 GB——RTX 3090/4090(24GB)可以。经验法则:参数数量(B)× 2 = FP16 显存占用(GB);× 0.5-0.7 = 4-bit 量化后的显存占用。
分布式训练我应该用哪种并行策略?
从小到大的推荐路径:单卡能跑 → 不折腾。单卡装不下模型 → ZeRO-3(DeepSpeed)。ZeRO 不够 → ZeRO-3 + Tensor Parallelism。还不行(千卡级别)→ 四种并行全都上。99% 的团队不需要超过 ZeRO-3。
MoE 模型未来会取代 Dense 模型吗?
不会完全取代,但会成为主流架构之一。MoE 在「参数规模 / 推理成本」这个指标上碾压 Dense 模型。但 Dense 模型在特定场景仍有优势——微调更简单、推理延迟更可预测。趋势:旗舰模型走向 MoE(GPT-4、Gemini、DeepSeek),小型模型保持 Dense。
推理延迟多慢算「不可接受」?
TTFT(Time to First Token,首 Token 延迟)< 500ms,总生成速度 > 30 Token/秒是目前的生产基准。超过 2 秒 TTFT,用户体验显著下降。超过 10 Token/秒的生成速度,用户开始察觉到「打字感」。你的目标不是理论最优——是用户不觉得它在「加载」。
vLLM 和 TensorRT-LLM 怎么选?
NVIDIA GPU + 追求极致性能 → TensorRT-LLM。多硬件兼容 + 快速迭代 + 开源社区 → vLLM。两个引擎在 2025 年差距已缩小到 10-20% 的性能区间。更重要的决策不是你选哪个引擎——是你投入多少精力去调参数。
9. 结语 {#9}
五篇文章,80 个术语,从 LLM 的概率本质,到 Prompt 的采样空间约束,到 Agent 的多步决策,到 GPU 的并行矩阵——我们走完了从「AI 是什么」到「AI 怎么跑起来」的完整旅程。
阿哲调整了 Batch Size,优化了 KV Cache,换上了 vLLM。推理延迟从 20 秒降到了 1.8 秒——用户投诉消失了。没人注意到推理速度变快——这正是成功:当基础设施做得对,它是隐形的。
AI 术语永远在增长。明年会有新的架构、新的框架、新的名词。但这五篇文章建立了一个坐标系——以后每遇到一个新术语,你都能把它放进这个系统里:
- 它是关于「模型怎么思考」的?(第一篇)
- 它是关于「人怎么和模型对话」的?(第二篇)
- 它是关于「怎么让模型听话」的?(第三篇)
- 它是关于「模型能做什么」的?(第四篇)
- 它是关于「怎么让模型跑起来」的?(第五篇)
坐标系比单个名词更重要。因为名词会变,但问题不变。
🎯 系列回顾
| 篇序 | 标题 | 核心术语数 |
|---|---|---|
| 1 | 大模型核心概念 | 18 |
| 2 | 提示词与检索增强 | 14 |
| 3 | 微调、对齐与优化 | 15 |
| 4 | Agent 与多模态 | 16 |
| 5 | 训练与部署基础设施(本篇) | 17 |
| 合计 | 80 |
如果你一口气读完了五篇——请收下我的敬意。知识只有被使用才有价值。去找一个问题,用一个你新理解的概念去解决它。
哪个术语的解释让你对 AI 的某个困惑豁然开朗?评论区告诉我,这是写这个系列最大的回报。