Maple-Preview基准测试解读:515 tokens/s预填充速度如何实现?
【免费下载链接】maple-preview-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/deepgrove/maple-preview-GGUF
Maple-Preview基准测试近日在本地推理圈引发热议:一个20B参数的推理模型,在纯CPU环境下跑出了515 tokens/s 的预填充(Prefill)速度,解码速度最高也能达到 252 tokens/s。这份数据来自 HuggingFace 镜像项目 deepgrove/maple-preview-GGUF 提供的官方基准测试,本文就来解读这份 Maple-Preview 基准测试,拆解 515 tokens/s 预填充速度的实现原理,并帮你选对适合自己的 GGUF 量化版本。
先认识一下:Maple-Preview 是什么?
Maple-Preview 是一款专为端侧设备高效推理设计的 20B-A1B 推理模型,其架构要点如下:
- 24 层 Transformer,采用 3:1 的 SWA-512 与 GA 注意力混合
- 256 个专家(Mixture-of-Experts),每次推理只激活其中 8 个
- 总参数 20B,但每个 Token 实际只动用约 1B 参数(A1B 的含义)
正因为"全量参数少、激活参数更少",它才能在普通 CPU 上获得惊人的速度。而 Maple-Preview-GGUF 项目则把这些权重打包成了 4 个 GGUF 量化版本,方便直接用 llama.cpp 生态加载运行。
读懂基准测试:515 tokens/s 预填充速度从哪来?
先看官方测试条件:M5 Pro 芯片、纯 CPU 推理、16 线程、512 个提示词 Token、生成 128 个 Token、重复 3 次取均值。结果如下:
| 矩阵权重 | LM 头精度 | GGUF 体积 | 预填充 Prefill (pp512) | 解码 Decode (tg128) |
|---|---|---|---|---|
| TQ1_0 | FP16 | 5.06 GiB | 515.41 ± 0.28 tokens/s | 161.06 ± 0.57 tokens/s |
| TQ1_0 | Q4_K | 4.64 GiB | 513.33 ± 3.62 tokens/s | 231.13 ± 0.13 tokens/s |
| TQ2_0 | FP16 | 5.91 GiB | 618.57 ± 2.12 tokens/s | 169.81 ± 2.94 tokens/s |
| TQ2_0 | Q4_K | 5.50 GiB | 610.48 ± 3.76 tokens/s | 252.74 ± 0.37 tokens/s |
预填充(Prefill)与解码(Decode)分别代表什么?
- 预填充 Prefill:一次性并行处理你输入的整段提示词,决定"首个 Token 多久出现",对应首 Token 延迟
- 解码 Decode:逐 Token 串行生成回复,决定"每个 Token 的生成速度"
以 515 tokens/s 的预填充速度计算,一段 512 Token 的提示词只需约 1 秒即可处理完毕,几乎感觉不到等待。这也是推理模型落地本地应用时最关键的体验指标之一。
515 tokens/s 预填充速度的三大技术支柱
1. 三元量化(Ternary Quantization):TQ1_0 与 TQ2_0
这是速度的核心来源。三元量化把矩阵权重压缩到{-1, 0, +1} 三个值,每个权重仅占约 1~2 比特,模型体积和内存带宽需求都大幅下降。而 CPU 推理的速度瓶颈恰恰是内存带宽——权重越小,单位时间能"喂"给计算单元的数据越多,tokens/s 自然飙升。
TQ1_0 与 TQ2_0 是两种不同的三元打包方案:官方建议优先使用 TQ2_0,通常速度更快,但内存占用略高。
2. MoE 稀疏激活:256 个专家只用 8 个
尽管模型总参数高达 20B,但每个 Token 只激活 8/256 个专家(约 1B 参数)。稀疏激活让单次前向计算量大幅缩减,配合三元量化,才实现了 CPU 上 500+ tokens/s 的预填充速度。
3. 高精度 LM 头:质量与速度的平衡术
输出层(LM head)不参与三元量化,而是保留Q4_K 或 FP16 高精度,避免量化损伤输出质量。从测试数据能明显看到:同样的矩阵权重下,换用 Q4_K 头后解码速度从约 161 提升到 231 tokens/s(TQ1_0 版本),性价比极高。
四款 GGUF 变体怎么选?一份选型指南
- 追求综合性能:选
maple-preview-TQ2_0-head-Q4_K.gguf(5.50 GiB),预填充 610 tokens/s、解码 252 tokens/s,两项均为最佳 - 最省内存:选
maple-preview-TQ1_0-head-Q4_K.gguf(4.64 GiB),体积最小,解码速度依然有 231 tokens/s - 看重首 Token 速度:选
maple-preview-TQ2_0-head-F16.gguf,预填充 618 tokens/s 全场最快 - 需要最高输出精度:选 TQ1_0/TQ2_0 + FP16 头的组合,代价是解码速度有所下降
快速上手:如何运行 Maple-Preview GGUF
运行前请先克隆仓库(包含 4 个 GGUF 文件):
git clone https://gitcode.com/hf_mirrors/deepgrove/maple-preview-GGUF由于该模型使用了自定义的三元量化内核,需要配合官方的 llama.cpp 定制分支编译运行(详见仓库 README 中的说明),然后即可像普通 GGUF 模型一样加载推理。建议在至少 8GB 内存的设备上运行,16 线程的 CPU 环境能复现出接近基准测试的表现。
这份 Maple-Preview 基准测试告诉我们什么?
515 tokens/s 预填充速度的意义,不只是"跑得快"——它标志着推理模型在本地 CPU 设备上落地成为可能:无需昂贵 GPU,一台普通笔记本就能流畅运行 20B 级推理模型。官方也指出,Maple-Preview 目前的预览版侧重原始推理能力,在智能体(Agent)类任务上表现还有提升空间,完整版 Maple 发布前会继续强化综合能力。
如果你正在寻找一款体积小、速度快的本地推理模型,不妨按本文的选型指南下载对应 GGUF 文件亲自测一测,用你自己的提示词验证这份 515 tokens/s 的预填充速度。🚀
【免费下载链接】maple-preview-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/deepgrove/maple-preview-GGUF
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考