三月第一周论文阅读:大模型、多模态与扩散模型的新进展
又到了整理每周读论文笔记的时候。这周的阅读清单挑了三个方向:大语言模型的高效训练、多模态理解模型的架构改、扩散模型做图像编辑的边界探索。三个方向看似独立,但脑子里过一遍会发现有个共同的主题:大家都在琢磨怎么用更少的资源做更大的事——更大的模型、更大的图像、更大的上下文,但算力就那么多,只能从架构和训练策略里抠空间。
如果你也想跟踪前沿进展、或者正准备入坑这几个方向,这一篇笔记应该可以帮你省下不少检索的时间。我会按照论文的核心思路、技术细节、以及我自己读完之后的体会来展开,尽量用说人话的方式把每一篇论文讲清楚,也会附上一些实验数据和我的理解,方便你判断哪几篇值得精读。
1. 大语言模型方向:训练效率与注意力机制的结构性改良
先聊大模型。这周读了两篇很有嚼头的论文,它们分别从训练效率和注意力机制的隐性结构两个角度出发,提供了新的视角。两篇论文的思路都有点“反常识”,但读完后会觉得设计得很巧妙,值得反复琢磨。
1.1 Baichuan-7B:开源剧本的重演与数据的执念
第一眼看到Baichuan-7B,大多数人想到的是“又一个开源LLM”,但读完技术报告之后,我觉得不能只用“又”字来评价它。论文从数据处理、模型架构到训练细节全盘托出,完整度非常高,适合用来作为训练中等规模LLM的参考样板。
模型架构是标准的Decoder-only,7B参数,支持中英双语。技术上最值得一提的,是它完全放弃 Positional Encoding 中的绝对位置信息,只保留了 Rotary Positional Embedding (RoPE)。RoPE通过旋转矩阵将相对位置信息编码进注意力计算当中,这让外推能力变得更好。实际使用中最明显的好处是,你在推理阶段稍微拉长一点输入长度,模型不容易乱掉。
另外一个细节是它在Attention计算中使用了Flash Attention。这个可能是老生常谈了,但Baichuan团队的实验数据很扎实:结合了Flash Attention和xEntropy优化之后,训练吞吐量显著提升,而且显存占用也被压得很低。我在自己的机器上试过普通Attention和Flash Attention的速度差距,当序列长度超过2000的时候,两者的训练耗时有直观可见的差距,Flash大概能快上近四成。
在分词器上,Baichuan-7B采用了一个词表大小76157的分词器,专门针对中英文做了BPE合并。数据侧,他们从2021年到2023年中的互联网数据里做了大量清洗和去重,最终构建了1.4万亿tokens的高质量数据集。这个数据量放在7B模型上其实是“管饱”了,足够模型学到高质量的知识和语言能力。
读这篇论文,我最大的收获不是具体参数,而是一种取舍观:
- 模型不是越大越好,要在固定算力预算下,把数据质量、模型规模和训练技巧三者均衡起来。
- Positional Encoding不是越花哨越好,RoPE目前来看性价比最高。
- 对中小团队来说,与其在模型架构上“魔改”,不如把精力花在数据和训练稳定性上。
提示:如果你准备跑这种规模的模型,建议先在小规模(1B左右)上把训练稳定性调好,再用同样的配置去缩放。直接上7B调参,迭代一次的成本太高,容易浪费时间。
1.2 多头注意力中的隐性“多头”:头部退化的实证分析
这一篇的标题比较学术,但内容很有意思,它揭示了一个被很多人忽略的现象:多头注意力(MHA)在训练完成后,很多注意力头实际上退化成了几乎相同的模式,并没有真正实现“多头分工”。
论文做了大量的统计分析,对不同的Transformer模型在各类任务上的注意力头进行相似度计算。结果显示,不少模型超过一半的注意力头之间存在很高的相似度(>0.8),这意味着它们的学习结果冗余。如果能在训练过程中有意识地鼓励“头部差异化”,模型理论上可以用更少的参数量表达更强的能力。
这个发现直接指向了两个工程上的潜在优化方向:
- 结构化剪枝:既然很多头是冗余的,那就可以在保持性能的前提下,剪掉一部分重复的头,换去更快的推理速度。
- 头部分化正则:在训练loss中加一项鼓励头部多样性的正则项,既能提升模型容量利用率,也可能让注意力分布更加合理。
但实操里得留个心眼:那个相似度指标的计算方式会影响聚类结果,不同的相似度度量方法(比如CKA、余弦相似度、互信息)得到结论可能有出入。想在自己模型上复现实验,建议先固定指标,再做网格式的分析,不要一次看太多变量。
我的判断是,这片论文的“后劲”会很大。现在大家都在卷参数规模和训练数据,反而忽略了模型内部表征的利用效率。如果能把这套发现转化成一个可插拔的训练插件,那对开源社区来说,会是不小的贡献。
2. 多模态理解模型:打破模态壁垒与毫米波雷达的表征学习
这周另外一个重要板块是多模态模型。两篇论文里,一篇关注如何利用大语言模型去连接“视觉”之外的模态(比如医疗影像的语义理解),另一篇专注于毫米波雷达信号在人体动作识别中的表征学习。你们别看这两个领域跨度大,但它在“如何为不同物理信号设计统一的语义空间”这件事上是相通的。
2.1 医学视觉语言模型:把诊断报告变成训练语料
医疗影像一直被认为是AI落地最难啃的骨头之一,其中一个痛点就在于标注数据极度稀缺。这一篇的工作不是去“抠标注”,而是直接利用现有的医学影像报告文本作为监督信号做视觉语言预训练。整体思路是:
- 用现成的医学影像编码器(比如基于CNN或者ViT的模型)抽取图像特征;
- 文本侧使用预训练语言模型,将报告中的句子编码;
- 通过对比学习或者生成式目标将图像区域和文本描述对齐。
这样做的好处和难点都很明显:
好处是数据成本低——医院每天都在产生海量的影像和报告文本,不需要额外标注。 难点是医学文本噪声大——报告中很多句子是模板化的正常结论,也有大量否定性描述(比如“未见明显异常”),如果模型把这些也当成强信号学进去,很容易产生偏见。
我在读这篇的时候随手记下了几个自己做类似任务时常用的前置步骤,帮你有针对性地避开坑:
- 清洗报告:去写模板化的表述,保留有判别性的句子。尤其要留意“无”“未见”“不排除”这类否定词,对语义影响巨大。
- 图像-报告对齐粒度:小块区域对应整段文本,会让模型学得很粗糙;如果算力允许,尝试用检测框把局部区域抠出来单独做一次对齐,效果会有明显提升。
- 评估指标:不要光看BLEU或ROUGE这类文本生成指标,更要关注临床相关的检索指标(如Recall@K),因为这类模型的核心价值是“辅助医生找到相似病例”,而不是取代医生写报告。
坦白说,这个方向离通用大模型比较远,但对于医疗AI领域的同行来说,这篇值得好好精读。它提供了一个很现实的落地路径:不用依赖昂贵的专家标注,也能构建出有临床价值的视觉语言模型。
2.2 毫米波雷达动作识别:当“点云”变成“图”
如果说医学影像还有天然的视觉结构,那么毫米波雷达信号就完全不跟“人眼可读”沾边。这篇论文做的事情,概括起来就是把雷达点云转成图结构,用图神经网络来做人体动作识别。
具体做法并不复杂:
- 将雷达获取的点云映射成图节点,节点属性是距离、多普勒频移、角度等;
- 按照物理近邻关系连边,构建K近邻图;
- 用EdgeConv这类动态图卷积逐层提取局部特征,最后做动作分类。
他们把这种结构称为EdgeGCN。论文里对比了传统的点云方法(如PointNet++)纯Transformer的方法,结果显示EdgeGCN在精度和参数量平衡上表现更好,尤其对遮挡和噪声鲁棒性更强。这个结果的直觉也很简单:雷达点云的本质是实体表面的离散采样,图结构比起规则网格更贴合这类非欧数据的真实拓扑关系。
不过雷达数据的预处理是真正的脏活累活,论文里没有细说,但实操中值得注意:
- 不同雷达设备的点云密度差异很大,使用K近邻时K 的选取需要按设备标定,不能一套参数打天下。
- 距离-多普勒图热力图可能比纯点云更稳定,可以先做一版热力图+CNN作为基线,再去验证GCN带来的增益到底有多少。
- 边缘设备部署时,图神经网络的动态构图模块比较耗时,建议在预处理阶段提前构图,别在推理过程中现算。
多模态这边读下来的整体感受是:“语义对齐”是核心工程问题。不管是图像和文本,还是雷达和动作标签,本质上都是想办法把不同物理空间里的信号投影到同一个语义空间里,再通过距离度量完成理解或生成。谁能把这一层的成本降下来,谁的落地速度就会快一截。
3. 扩散模型用于图像编辑:原理边界与可控性探索
最后这个方向是扩散模型,但看的不是文生图,而是图像编辑。扩散模型用于生成已经不算新鲜了,但“怎么改图像”才是当前更兴奋的命题。两篇论文分别探索了不同的技术路线:一篇基于注意力机制注入,另一篇基于物理世界的信号引导。两条路线各有优劣,结合起来看能得出一个“可控编辑”的完整视图。
3.1 注意力注入:让“谁是谁”变得可替换
基于注意力注入的编辑方法,核心思路个人理解是:结构信息不是靠卷积层去学,而是藏在扩散模型UNet的注意力图里。论文的方法,是将生成扩散过程里的空间特征和注意力特征都纳入一个“可编辑”的中间表示。
通俗解释版本:你把一张图编码进扩散模型的前向过程,然后获取每一步的注意力图(哪个像素在关注哪些其他像素)。在反向去噪时,把原图的结构特征(空间布局和注意力关系)注入到新图的生成过程中,就能在保持结构不变的情况下,替换“内容”和“风格”。
这套做法最大的优势在于不需要额外训练,只需要在推理时多保存一些中间特征。对于想快速给产品加入“局部调整”功能的小团队来说,实用系数很高。但它也有一个非常明显的短板——对全局编辑支持不佳。如果你只想改一只猫的眼睛,拉高左边的亮度,效果会很棒;但如果你想把整张图从白天改成日落,它多数情况下会失败,因为全局光照信息的改动会破坏结构一致性。
一般提醒要留意的是:
- 注入权重的设置很敏感,权重太大容易导致图像结构僵硬,失去多样性;权重太小又改不动内容,要实测着来。
- 做视频编辑时,逐帧独立注入会导致闪烁,要么做时序平滑,要么只看关键帧再光流传播。
3.2 引导编辑:用物理信号给扩散模型“画边界”
另一篇论文的思路则完全换了一个维度——它不再依赖图像自身特征,而是引入外部信号作为编辑的引导条件。原理上,它是在扩散模型的采样过程中,额外引入一个可微的损失函数,通过梯度信号来“引导”去噪方向的每次移动。例如引入边缘图、深度图,甚至音频特征,让模型在去噪过程中去满足这些额外约束。
这样的方法逻辑更直白,控制也更刚性:你说要有一个人物轮廓,模型就往有轮廓的方向解。不过也正因为引导太硬,模型经常处在一种“生成质量”和“约束满足”相互拉扯的状态里。论文里他们提出了一个动态权重调节策略,用置信度来调节引导强度,算是一定程度缓解了这个问题。
但从我自己的实测经验来看,这类方法的计算开销比注意力注入还高,应用最多的地方还是在工业设计、游戏原画这些场景,因为它们的编辑要求“硬约束优先”,质量可以适当妥协。
3.3 两条路线的取舍建议
我把两篇论文放在一起整理了一个小表格,帮你们按需求快速选型:
| 维度 | 注意力注入方案 | 信号引导方案 |
|---|---|---|
| 训练成本 | 无需训练,纯推理 | 需要场景微调,成本中等 |
| 编辑粒度 | 局部编辑强,全局弱 | 全局可控性强,能跟随外部约束 |
| 推理速度 | 快(只增加少量特征保存) | 慢(需要迭代优化采样路径) |
| 落地难度 | 低,适合产品化 | 高,适合专业内容生产工具 |
| 典型场景 | 人像微调、商品图局部替换 | 游戏原画、建筑设计、影视分镜 |
跟我在真实项目里的感受对应一下:如果你做的是C端工具,优先考虑注意力注入这类轻量方案;如果你做的是B端设计工具,引导编辑的“硬约束”才是核心卖点。两个方向未来大概率会走向融合,最终形态很可能是“注入保结构、引导保约束”的混合体,目前已经能看到一些试验性的工作在做这件事。
4. 一周阅读总结与个人筛选建议
每周读论文最纠结的问题不是“读哪篇”,而是“读完怎么记住”。我做了一个简单的筛选和记录体系,把每篇论文按四个维度打分:创新性、工程可落地性、表达清晰度、以及对自己当前项目启发性。三维度综合下来,这周排在最高优先级值得精读的是Baichuan-7B的技术报告和扩散模型的注意力注入方案,因为它们一个给了完整的中文LLM训练细节,另一个可以直接改改就用到现有生成链路里。
如果你也想保留一套自己的阅读记录体系,推荐一个最简单的模型:
- 每篇论文读完只写三句话:这篇解决了什么问题?用了什么手法?我能抄什么?
- 遇到能抄的idea,立刻记到“代执行列表”里,标上复杂度评估,方便后面安排时间试验。
- 每周末做一次反刍,把三句话翻出来,清掉那些过时的问题,留下真正值得深挖的信号。
用这套方法坚持一个月,你对领域的理解深度很难没有变化。科研和工程都怕的不是没有输入,而是输入太杂、没有沉淀。
这周先读到这,下周我会重点关注多模态大模型的统一训练框架和轻量化的部署技术,到时候有新发现再来同步。