大模型训练三步:预训练、微调、对齐到底有什么区别
2026/8/31 2:41:37 网站建设 项目流程

如果把一个大模型(LLM)从“什么都不会”训练成 ChatGPT、DeepSeek、Qwen 这类可以和人正常交流、完成复杂任务的模型,完整的训练流程可以概括成:

  1. 预训练(Pre-training)

  2. 微调(Fine-tuning / SFT)

  3. 对齐(Alignment)

这三个步骤在目标定位、解决的问题和底层技术实现上均有不同的分工。那么这三个步骤分别是做什么,又分别解决了什么问题呢?我们是如何得到现在强大好用的大模型的呢?本文针对这些问题进行解答。

  1. 完整的大模型训练流程

完整的大模型训练流程可以理解为一条流水线,如下图所示:

其中:

  • 预训练解决“能力从哪里来”,
  • 微调解决“模型会不会按任务要求做”,
  • 对齐解决“模型做得是否符合人类期望”。

不过需要先说明一点:严格来说,“微调”和“对齐”存在一定重叠。很多资料会把 SFT 也归入 Alignment 的广义范畴。为了方便理解,下面采用工程上最常见的“三阶段”划分。

  1. 预训练、微调、对齐以及他们的区别

2.1 预训练(Pre-training)

  • 预训练是什么:拿海量未标注数据,让模型通过自监督学习建立通用的语言、知识和推理能力。
  • 预训练解决什么问题: 在预训练之前,模型权重为随机初始化,没有任何语言和常识能力。通过预训练,让模型掌握自然语言语法、常识事实、代码逻辑和推理先验。使模型具备了理解上下文并预测后续词元(Token)的统计规律。
  • 预训练使用什么数据: 预训练数据通常是海量、广泛、通用的数据,数据量通常非常大。核心思想是:不用人工给每条数据标注答案,让数据本身提供监督信号。这是预训练和后面的微调、对齐最大的区别之一。
  • 预训练使用什么技术:
  • Transformer架构:目前主流 LLM 基本都建立在 Transformer 架构之上。
  • Self-Supervised Learning:预训练使用的数据不需要人工给每条数据打标签。核心就是利用文本本身,构造监督信号,然后预测下一个Token。
  • 大规模分布式训练:模型可能有几十亿、几百亿甚至更多参数,数据也达到极大规模,因此需要:Data Parallel、Tensor Parallel、ZeRO、混合精度、FlashAttention等技术。

2.2 微调 (Fine-tuning / SFT)

  • 微调是什么: 在已经完成预训练的 Base Model 上,用规模相对较小但质量更高、更有针对性的标注数据继续进行有监督训练,让模型从“通用能力”变成“更擅长某类任务、领域或交互方式”的模型。
  • 微调解决什么问题:预训练之后基座模型(Base Model)只能进行续写,而不能给出回答。通过微调解决预训练模型只会漫无边际“续写”而非“回答”的问题。 通过微调,可以让模型学会“按照指令做事”,或者让模型适应特定领域,或者让模型完成特定任务,或者让模型学会特定的输出格式
  • 微调使用什么数据:微调数据通常不是越多越好,而是越“高质量、针对性强”越好。常见的SFT数据为(Prompt-Response Pairs)。
  • 微调使用什么技术:
  • 全量微调 (Full Parameter Fine-Tuning):更新所有模型权重,但在计算损失时通常只对 Response 部分计算 Cross-Entropy。直接 Full Fine-tuning 的成本非常高。
  • 参数高效微调 (PEFT - Parameter-Efficient Fine-Tuning): 核心思想是不要把整个大模型都训练一遍,只训练很少一部分参数。 例如:LoRA / QLoRA 通过冻结预训练骨干网络,利用低秩矩阵分解更新权重;Prefix Tuning / Prompt Tuning 通过在输入层或各层 Attention 前拼接可学习的虚拟 Token 向量。

2.3 对齐 (Alignment)

  • 对齐是什么:同样的问题大模型可能会有多种回答,但大模型并不知道人类更喜欢什么样的回答。通过大模型对齐,可以让模型的行为、回答方式和价值偏好更符合人类需求。
  • 对齐解决什么问题:SFT 后的模型虽然能遵循指令,但有时候可能会输出有害的回答。 通过大模型对齐,进行 HHH 原则落地:让回答符合 Helpful(有用)、Honest(诚实/减少幻觉)、Harmless(无害/拒绝恶意指令)。解决模型不听话、“多个答案到底哪个更好”、减少有害和不安全行为、减少大模型的幻觉(Hallucination)。
  • 对齐使用什么数据:与预训练和 SFT 不同,Alignment 最重要的数据通常不是普通文本,也不是问题-答案对,而是人类偏好数据 / Reward 数据 / 可验证反馈数据。
  • 对齐使用什么技术:首先是最经典的 Alignment 方法
  • 基于强化学习的对齐 (RLHF - Reinforcement Learning from Human Feedback)。使用人类标注的偏好排序数据训练一个打分网络,得到奖励模型 (Reward Model, RM)。在输入为 (Prompt, Response)时,能够输出标量评分; 然后使用 PPO (Proximal Policy Optimization) 或 REINFORCE++ 算法,以 RM 得分为优化目标,同时引入 KL 散度惩罚项(防止模型输出偏离 SFT 基线太远导致模式坍塌)。
  • 免强化学习的直接偏好对齐:DPO (Direct Preference Optimization),即绕过显式训练 Reward Model 的步骤,通过将 RL 目标解析推导为直接在成对数据上的隐式对比损失。
  • 规则与安全干预:Constitutional AI(基于宪法原则的自对齐与 RLAIF)、安全护栏过滤(Guardrails)。

2.4 核心区别对比

维度预训练 (Pre-training)微调 (Fine-tuning / SFT)对齐 (Alignment)
主要功能学习世界知识与语言建模学习交互格式与指令遵循约束价值导向与行为边界
数据形态海量无标注纯文本(Raw Text)结构化问答对(Instruction-Response)偏好成对数据(Prompt + 胜出项/失败项)
数据量级Trillions of Tokens(TB/PB 级)数千到数百万条高质量样本数万到数十万条偏好比较对
算力开销占总算力 90% - 99%占总算力 1% - 5%占总算力 < 1%(但工程稳定性要求极高)
对知识的影响注入知识:模型的知识上限由该阶段决定激活知识:调整表达,通常不注入大量新事实约束行为:权衡偏好,可能引入轻微“对齐税”

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询