Maple-Preview基准测试解读:515 tokens/s预填充速度如何实现?
2026/8/17 23:11:10 网站建设 项目流程

Maple-Preview基准测试解读:515 tokens/s预填充速度如何实现?

【免费下载链接】maple-preview-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/deepgrove/maple-preview-GGUF

Maple-Preview基准测试近日在本地推理圈引发热议:一个20B参数的推理模型,在纯CPU环境下跑出了515 tokens/s 的预填充(Prefill)速度,解码速度最高也能达到 252 tokens/s。这份数据来自 HuggingFace 镜像项目 deepgrove/maple-preview-GGUF 提供的官方基准测试,本文就来解读这份 Maple-Preview 基准测试,拆解 515 tokens/s 预填充速度的实现原理,并帮你选对适合自己的 GGUF 量化版本。

先认识一下:Maple-Preview 是什么?

Maple-Preview 是一款专为端侧设备高效推理设计的 20B-A1B 推理模型,其架构要点如下:

  • 24 层 Transformer,采用 3:1 的 SWA-512 与 GA 注意力混合
  • 256 个专家(Mixture-of-Experts),每次推理只激活其中 8 个
  • 总参数 20B,但每个 Token 实际只动用约 1B 参数(A1B 的含义)

正因为"全量参数少、激活参数更少",它才能在普通 CPU 上获得惊人的速度。而 Maple-Preview-GGUF 项目则把这些权重打包成了 4 个 GGUF 量化版本,方便直接用 llama.cpp 生态加载运行。

读懂基准测试:515 tokens/s 预填充速度从哪来?

先看官方测试条件:M5 Pro 芯片、纯 CPU 推理、16 线程、512 个提示词 Token、生成 128 个 Token、重复 3 次取均值。结果如下:

矩阵权重LM 头精度GGUF 体积预填充 Prefill (pp512)解码 Decode (tg128)
TQ1_0FP165.06 GiB515.41 ± 0.28 tokens/s161.06 ± 0.57 tokens/s
TQ1_0Q4_K4.64 GiB513.33 ± 3.62 tokens/s231.13 ± 0.13 tokens/s
TQ2_0FP165.91 GiB618.57 ± 2.12 tokens/s169.81 ± 2.94 tokens/s
TQ2_0Q4_K5.50 GiB610.48 ± 3.76 tokens/s252.74 ± 0.37 tokens/s

预填充(Prefill)与解码(Decode)分别代表什么?

  • 预填充 Prefill:一次性并行处理你输入的整段提示词,决定"首个 Token 多久出现",对应首 Token 延迟
  • 解码 Decode:逐 Token 串行生成回复,决定"每个 Token 的生成速度"

以 515 tokens/s 的预填充速度计算,一段 512 Token 的提示词只需约 1 秒即可处理完毕,几乎感觉不到等待。这也是推理模型落地本地应用时最关键的体验指标之一。

515 tokens/s 预填充速度的三大技术支柱

1. 三元量化(Ternary Quantization):TQ1_0 与 TQ2_0

这是速度的核心来源。三元量化把矩阵权重压缩到{-1, 0, +1} 三个值,每个权重仅占约 1~2 比特,模型体积和内存带宽需求都大幅下降。而 CPU 推理的速度瓶颈恰恰是内存带宽——权重越小,单位时间能"喂"给计算单元的数据越多,tokens/s 自然飙升。

TQ1_0 与 TQ2_0 是两种不同的三元打包方案:官方建议优先使用 TQ2_0,通常速度更快,但内存占用略高。

2. MoE 稀疏激活:256 个专家只用 8 个

尽管模型总参数高达 20B,但每个 Token 只激活 8/256 个专家(约 1B 参数)。稀疏激活让单次前向计算量大幅缩减,配合三元量化,才实现了 CPU 上 500+ tokens/s 的预填充速度。

3. 高精度 LM 头:质量与速度的平衡术

输出层(LM head)不参与三元量化,而是保留Q4_K 或 FP16 高精度,避免量化损伤输出质量。从测试数据能明显看到:同样的矩阵权重下,换用 Q4_K 头后解码速度从约 161 提升到 231 tokens/s(TQ1_0 版本),性价比极高。

四款 GGUF 变体怎么选?一份选型指南

  • 追求综合性能:选maple-preview-TQ2_0-head-Q4_K.gguf(5.50 GiB),预填充 610 tokens/s、解码 252 tokens/s,两项均为最佳
  • 最省内存:选maple-preview-TQ1_0-head-Q4_K.gguf(4.64 GiB),体积最小,解码速度依然有 231 tokens/s
  • 看重首 Token 速度:选maple-preview-TQ2_0-head-F16.gguf,预填充 618 tokens/s 全场最快
  • 需要最高输出精度:选 TQ1_0/TQ2_0 + FP16 头的组合,代价是解码速度有所下降

快速上手:如何运行 Maple-Preview GGUF

运行前请先克隆仓库(包含 4 个 GGUF 文件):

git clone https://gitcode.com/hf_mirrors/deepgrove/maple-preview-GGUF

由于该模型使用了自定义的三元量化内核,需要配合官方的 llama.cpp 定制分支编译运行(详见仓库 README 中的说明),然后即可像普通 GGUF 模型一样加载推理。建议在至少 8GB 内存的设备上运行,16 线程的 CPU 环境能复现出接近基准测试的表现。

这份 Maple-Preview 基准测试告诉我们什么?

515 tokens/s 预填充速度的意义,不只是"跑得快"——它标志着推理模型在本地 CPU 设备上落地成为可能:无需昂贵 GPU,一台普通笔记本就能流畅运行 20B 级推理模型。官方也指出,Maple-Preview 目前的预览版侧重原始推理能力,在智能体(Agent)类任务上表现还有提升空间,完整版 Maple 发布前会继续强化综合能力。

如果你正在寻找一款体积小、速度快的本地推理模型,不妨按本文的选型指南下载对应 GGUF 文件亲自测一测,用你自己的提示词验证这份 515 tokens/s 的预填充速度。🚀

【免费下载链接】maple-preview-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/deepgrove/maple-preview-GGUF

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询