☰
CARD: Cache-Assisted Parallel Speculative Decoding for Efficient Large Language Model Inference
2026/10/2 13:42:05 网站建设 项目流程

文章主要内容和创新点

主要内容

本文针对大型语言模型(LLM)推理过程中的延迟问题,提出了一种基于缓存的并行推测解码框架CARD(Cache-Assisted Parallel Speculative Decoding)。传统的推测解码(SD)采用“先草稿生成再验证”(draft-then-verify)的串行范式,存在硬件资源利用率低、草稿序列易因单个token被拒而整体丢弃等问题。CARD通过引入“查询-修正”(query-and-correct)范式,构建缓存机制实现草稿模型(draft model)与目标模型(target model)的并行推理,解决了传统方法的串行依赖和资源浪费问题,在不微调模型的情况下实现了最高4.83倍的推理加速。

创新点
  1. 并行执行框架:打破传统推测解码中草稿生成与验证的串行依赖,通过缓存支持让草稿模型与目标模型同时进行推理,实现“查询-修正”新范式(查询缓存、选择高置信度路径、修正草稿模型生成方向)。
  2. 自适应缓存机制:动态缓存结构可自适应确定有效草稿长度,通过保留历史状态最大化token接受率。
  3. 计算卸载:将目标模型的部分计算任务转移到草稿模型,在保持目标模型链状验证效率的同时,实现接近树形验证的性能。

翻译部分

摘要

推测解码(SD)中,额外的草稿模型先生成多个草稿token,然后由原

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询