一、什么是多模态:先建立直觉
模态(Modality)= 信息的 "种类或渠道":文字、图片、声音、视频、3D 模型、传感器数据…… 都是不同的模态。
- 单模态 AI:只能处理一种信号(如纯文本聊天、纯语音识别)。
- 多模态 AI:能同时 "看 + 听 + 读 + 说",还能让这些信息互相印证。
示例:你拍了一张电饭煲面板的照片,问 "这个 ' 预约 ' 键怎么用"—— 模型需要同时理解图片里的按钮布局(视觉)、面板上的字(OCR)、你的问题(文本),再给出带语音的回答。这就是典型的多模态任务。
为什么多模态是必然趋势:人类理解世界本来就是多模态的 —— 我们同时用眼睛、耳朵、语言。一个只能读字的 AI,永远理解不了 "这张照片里的笑容";只有多模态,AI 才能处理真实世界的任务。
| 维度 | 单模态模型 | 多模态模型 |
|---|---|---|
| 输入 | 一种(多为文本) | 文本 + 图像 + 音频 + 视频…… |
| 理解深度 | 只能 "读" | 能 "看、听、读、说" 并互证 |
| 典型例子 | GPT-3(纯文本) | GPT-4V、Gemini、豆包多模态版、Qwen-VL |
二、核心思想:万物皆可 "向量化"
多模态最难的问题:图像是像素矩阵、语音是波形、文字是符号 —— 它们 "长相" 完全不同,怎么放进同一个模型?
答案是:把每一种模态都 "翻译" 成模型共同的语言 ——token 向量。下面这张图展示多模态大模型的统一架构:
各模态怎么 "翻译" 成向量(这是关键):
| 模态 | 翻译方式 | 产物 |
|---|---|---|
| 文本 | BPE 分词 → 查表得向量 | 文本 token 序列 |
| 图像 | 切成 16×16 小块(patch)→ 每个 patch 经 ViT 变向量 + 位置信息 | 视觉 token 序列 |
| 音频 | 波形 → 梅尔频谱 → 声学编码器;或用码本量化成 "声音 token" | 声学 token 序列 |
| 视频 | 抽帧 → 每帧按图像处理 + 时间位置编码 | 时空 token 序列 |
两种主流架构路线(图里是通用示意,实际实现分两派):
- 编码器 - LLM 型(如 LLaVA、早期 GPT-4V 方案):用现成视觉编码器提取图像向量,过一层投影层(Projector)映射进文本向量空间,然后拼接进 LLM—— 优点是复用成熟 LLM,训练轻。
- 原生多模态型(如 Gemini、Qwen-VL、豆包多模态):把图像、音频也离散化成 token,和文本 token 一起从零统一预训练 —— 模态融合更彻底,但训练成本高。
三、核心机制一:跨模态注意力(Cross-Attention)
多模态模型最关键的机制,就是让一种模态的 token 去 "注意" 另一种模态的 token。
示例(图文问答深化):你上传一张 "草地上三只猫" 的照片,问 "图里有几只猫?"
- 图像被切成 patch,变成一串视觉 token;
- 问题文本变成几个文本 token;
- 两者拼接成一条长序列进入 Transformer;
- 跨模态注意力让问题里的 "猫" 这个 token,主动去 "关注" 图像里所有 "像猫的区域" 的视觉 token—— 模型实际上是在 "数" 那些被高亮关注的区域,然后回答 "三只"。
机理解释:这和上一讲 Transformer 的自注意力是同一个机制,只是 "参与投票的 token" 来自不同模态。正因为图像 token 和文本 token 在同一个注意力空间里,模型才能做 "图文互证"—— 比如你问 "这个按钮是什么颜色",它能定位到图中按钮区域再回答。
实际价值:细节问答(数物体、认颜色、读 OCR)、图表理解("这个季度增长了多少")、医疗影像初筛("这里有没有结节")。
四、核心机制二:对比学习(CLIP)—— 多模态的 "对齐训练"
有了架构还不够 ——模型怎么知道 "图像里的猫" 和 "文字里的猫" 是同一个概念?答案是一种叫对比学习(Contrastive Learning)的训练方式,最经典的实现是 OpenAI 的CLIP:
机制逐条解释:
- 双编码器:图像进图像编码器得到向量(i₁、i₂),文本进文本编码器得到向量(t₁、t₂)。
- 相似度计算:把每个图像向量和每个文本向量算余弦相似度,得到矩阵。训练开始时数值是随机的。
- 对比损失:训练目标非常巧妙 ——把对角线(配对的图 - 文)分数拉高,把非对角线(不配对的图 - 文)分数压低。模型为了 "完成作业",被迫学会:把 "猫的照片的向量" 和 "猫的文字的向量" 在空间里挪到相近位置。
- 规模:CLIP 用 4 亿个图文对做这件事。当 "猫" 这个词对应的向量,和所有 "猫" 的图片对应的向量在空间里聚成一团,模型就有了跨模态理解。
示例:零样本图像分类—— 给 CLIP 一张猫的照片,再给它候选文字 "猫 / 狗 / 汽车",它分别算相似度,选最高的 "猫"。它没见过任何一张带 "猫" 标签的训练图,全靠图文对齐就完成了分类。
实际价值:以图搜图 / 以文搜图、训练数据清洗(筛掉图文不匹配的样本)、文生图模型的前置(Stable Diffusion 就用 CLIP 的文本编码器把文字 "翻译" 成条件向量)。
五、任务谱系:多模态能做什么
| 任务 | 输入 → 输出 | 一句话机理 |
|---|---|---|
| 图像描述 | 图 → 文 | 视觉 token 作前缀,LLM 续写描述(图 1 的架构) |
| 图文问答 VQA | 图 + 问 → 答 | 跨模态注意力让问题定位图中区域 |
| 文生图 | 文 → 图 | 扩散模型:从噪声逐步 "去噪" 出图 |
| 图生视频 | 文 / 图 → 视频 | 时空 patch + 时序扩散 |
| 语音对话 | 语音 / 文本 ↔ 语音 | 声音 token 化后进 LLM,输出再合成语音 |
| 视频理解 | 视频 + 问 → 答 | 抽帧 + 时间位置编码,逐帧理解 |
| 多模态 Agent | 拍照 / 说话 → 操作 | 感知层(多模态输入)→ 工具调用(前几讲的完整链路) |
| 图文检索 | 图 ↔ 文 | CLIP 向量相似度 |
下面挑四个最有代表性的展开讲。
示例 1:文生图(扩散模型)——"画一只戴帽子的柴犬"
机理(扩散模型):分两个方向 ——
- 训练阶段(加噪):拿真实图片,一步步往里面加随机噪声,直到变成纯雪花点。模型学习的是逆向过程:给一张 "更糊" 的图,预测 "刚才的噪声是什么",从而还原一步。
- 生成阶段(去噪):从一张纯噪声图出发,模型结合文字条件("戴帽子的柴犬"),一步一步把噪声 "擦掉",几十步后得到清晰图片。
- 文字怎么控制画面:文字经编码器变成条件向量,在每一步去噪时通过交叉注意力注入 —— 模型 "看着文字决定往哪个方向擦噪声",于是画出了符合描述的构图和元素。
实际价值:设计稿、电商图、插画、配图,几秒出一张,是内容创作的效率革命。
示例 2:图生视频(Sora 类模型)
机理:把视频看成 "随时间变化的图像序列"—— 抽帧后每帧切成 patch,加上时间位置编码(第 1 帧、第 2 帧……),变成 "时空 token",再用扩散模型逐帧去噪,并保证相邻帧的连续性(一致性由时间维度的注意力保证)。模型学的是 "一个画面如何合理地动起来"。
示例 3:语音多模态(语音对话助手)
机理:传统 ASR 是把语音转文字再交给 LLM;新一代语音模型更进一步 —— 用码本量化把声音直接离散化成 "声音 token"(类似文字的 token),和文本 token 一起进 LLM。这样模型能直接 "听" 语调、语气、情绪,回答时再通过声码器合成语音。示例:你对语音助手说一句带情绪的 "我太累了",它能听出疲惫并给出安慰式的语气回复 —— 纯文本管道做不到这一点。
示例 4:多模态 Agent(拍照办事)
机理:把前三讲串起来 ——Agent 的 "感知层" 就是多模态组件:拍照(图像 token)→ OCR 认字(视觉理解)→ 理解意图(LLM)→ 调用工具(如 "搜索这款产品价格")→ 执行反馈。示例:你拍一张路由器故障灯照片,Agent 认出红灯闪烁,检索说明书,告诉你 "重置方法",甚至直接打开设置页教你操作。
六、训练范式:多模态大模型是怎么炼成的
和上一讲 LLM 的三阶段类似,多模态模型通常走四步:
- 模态对齐:用海量 "图文对 / 音文对" 做对比学习(CLIP 式)—— 让不同模态 "对上暗号"。也可以在这一步训练投影层(LLaVA 式:冻结视觉编码器和 LLM,只训投影层,成本极低)。
- 统一生成式预训练:把文本 + 图像 + 音频都当作 "下一个 token 预测" 来做(图像被离散化成 token),模型学会 "看图续写、听声续写"。
- 指令微调:用多模态对话数据训练("看这张图,回答:……"),学会按要求完成任务。
- 人类反馈对齐:多模态 RLHF—— 人类对 "回答是否符合图片内容 / 是否安全" 排序,让模型更准确、更安全。
数据与成本(示意):多模态数据(图文对、视频)获取比纯文本贵,标注成本高;训练一个多模态大模型通常比同规模纯文本模型需要更多算力(视觉 token 数量大)。
七、挑战与局限(新手必看)
- 视觉幻觉:模型会 "看到" 图里没有的东西,或数错物体 —— 示例:问 "图里有几只鸟",模型可能一本正经说 "三只" 其实是两只。原因和文本幻觉一样:模型在 "编最像样的答案",没有真正的视觉校验。
- 细节与 OCR 错误:小字识别、密集图表、遮挡物容易出错。
- 视频的时空一致性:长视频中物体容易 "变形、消失又出现",动作物理不真实。
- 对齐不完美:CLIP 式的对齐是 "粗粒度" 的(知道 "猫" 对应猫,但分不清 "左边那只还是右边那只");跨语言、跨文化语义也可能错位。
- 数据、算力与安全:多模态数据采集成本高;深度伪造(换脸、合成语音)带来滥用风险;隐私(照片、录音)保护压力更大。
一句话总结:多模态大模型 =各模态的 "翻译官"(编码器)+ 一个 "联合大脑"(Transformer);靠投影层 / 离散 token统一表示,靠跨模态注意力互相参考,靠对比学习让不同模态 "对上暗号";它让 AI 真正 "会看、会听、会说",也是 AI Agent 感知层和文生图 / 文生视频等一切多模态应用的技术底座。