CALR:高效大语言模型层压缩方法研究总结与关键部分翻译
一、文章主要内容总结
(一)研究背景与问题
大语言模型(LLMs)因参数规模庞大(数十亿至万亿级)和计算需求高,在资源受限环境(如笔记本电脑、智能手机)中的部署面临巨大挑战,且高能耗带来经济成本与环境问题。现有模型压缩技术中,基于奇异值分解(SVD)的低秩分解是主流方法之一,能通过近似权重矩阵减少参数,但标准SVD仅优化矩阵重构误差,常导致模型功能性能(如推理、任务执行能力)大幅下降,核心原因是未充分修正压缩过程中丢失的功能信息。
(二)核心方法:CALR(Corrective Adaptive Low-Rank Decomposition)
CALR是一种双组件压缩框架,针对LLM的前馈网络(FFN)模块(参数占比高)设计,分为两大核心路径:
- 主路径:SVD压缩层
对选定的FFN模块中各线性层,通过截断SVD生成低秩近似矩阵(初始化方式为将权重矩阵分解为顶部r个奇异向量与奇异值的组合),替换原权重矩阵,形成压缩主路径,保证基础的参数缩减。 - 并行路径:可学习低秩修正模块
引入独立的可学习低秩模块,与主路径接收相同输入,其输出与主路径输出相加,专门用于建模并补偿SVD压缩导致的“功能残差”(原模块与压缩模块输出的差异),修正功能信息损失。
此外