☰
16GB 到 256GB 内存该选哪个模型?MTPLX 模型推荐策略与量化档位完整清单
2026/10/4 5:39:07 网站建设 项目流程

16GB 到 256GB 内存该选哪个模型?MTPLX 模型推荐策略与量化档位完整清单

【免费下载链接】MTPLXThe fastest way to run Qwen 3.8 Flash Next, Qwen 3.8 27B and Ternary Bonsai 2 27B on a Mac: 125 tok/s in OpenCode on an M5 Max, and a 27B model on 16 GB Macs. Native MTP speculative decoding on Apple Silicon, exact at any temperature. OpenAI and Anthropic compatible local server.项目地址: https://gitcode.com/gh_mirrors/mt/MTPLX

在 Mac 上跑本地大模型,内存大小几乎直接决定了你能跑什么。MTPLX 是一个专为 Apple Silicon 设计的本地大模型运行工具,它用模型自带的 MTP(多词元预测)头做投机解码,解码速度可达普通解码的 1.6~2.24 倍,并提供 OpenAI / Anthropic 兼容的本地 API 服务。最关键的是,它内置了一套"按内存自动推荐模型"的策略:从 16 GB 到 256 GB 的 Mac,打开应用或运行mtplx start,它都会直接告诉你该下载哪一个包,不用自己猜。

MTPLX 的推荐策略:一套规则,所有界面共用

MTPLX 的应用与 CLI 共用同一份官方模型目录,推荐逻辑写在 mtplx/model_catalog.py 中。核心规则只有一条:推荐模型的实测内存峰值不能超过你的统一内存,且推荐顺序按内存分档:

Mac 统一内存M3 / M4 / M5 推荐说明
16 GB 以下Qwen 3.5 4B Optimized Speed4-bit,峰值仅 2.9 GiB
16 ~ 31 GBTernary Bonsai 2 27B三值(ternary)27B,峰值 11.8 GiB,16 GB 上可用 8K 上下文
32 GB 起Qwen 3.8 27B Optimized Speed4-bit 动态量化,官方推荐的编程默认模型
96 GB 起Qwen 3.8 Flash Next(Bare Speed)125B MoE,32 GB n-gram 表走 SSD 流式读取
128 GB 起Flash Next Optimized Speed125.8 tok/s(OpenCode 请求, M5 Max 实测)
256 GB 起Flash Next Optimized Speed(首选)+ Optimized Quality(次选)8-bit 最高保真构建

M1 / M2 走 FP16 分支:优先 9B FP16,然后才是 27B 三兄弟的 FP16 版本;8 GB 的 M1/M2 没有合适的 FP16 精选模型。这些阈值定义在 mtplx/default_models.py 的select_default_model()中,完整策略文档见 docs/install.md 与 docs/quickstart.md。

💡 注意:16 GB 的 Mac 跑 Bonsai 2 27B 时上下文窗口是 8,192 token;如果要接 OpenCode、Hermes 这类 agent 客户端,建议 18 GB 以上。

量化档位完整清单:速度档、均衡档、质量档

同一个模型,MTPLX 会发布多个"档位"(量化配方),命名规律很直观:

  • Bare Speed:统一 4-bit,速度最快、体积最小,但质量低、长任务偏慢
  • Optimized Speed:4-bit 动态量化(敏感部分保留更高精度),速度与质量平衡,大多数模型的默认推荐
  • Optimized Quality:8-bit 动态量化,保真度最高,体积和内存占用最大
  • FP16:同权重、16-bit 张量转 FP16,专为 M1/M2 准备

下面是完整清单(峰值内存为 MTPLX 在目录中的实测值,来源 mtplx/model_catalog.py):

模型包量化下载体积内存峰值最低内存定位
Qwen 3.5 4B Optimized Speed4-bit2.6 GB2.9 GiB8 GB小内存 Mac 的最快选择
Qwen 3.5 4B Optimized Quality8-bit4.6 GB4.8 GiB8 GB4B 中保真度最高
Qwen 3.5 9B Optimized Speed6-bit8.7 GB10.0 GiB16 GB小内存高速之选
MiMo V2.6 Qwen 9B Optimized Speed6-bit8.7 GB10.0 GiB16 GB小米的 agentic 编程蒸馏版
Ternary Bonsai 2 27B Optimized Speed三值8.9 GB11.8 GiB16 GB半部 4-bit 27B 的内存,带视觉
Qwen 3.8 27B Bare Speed4-bit 统一16.0 GB20.0 GiB32 GB突发聊天最快
Qwen 3.8 27B Optimized Speed4-bit 动态20.4 GB25.0 GiB32 GB编程默认推荐
Qwen 3.8 27B Optimized Quality8-bit 动态29.4 GB33.0 GiB36 GB与 bf16 99.3% top-1 一致
Qwen 3.6 27B Optimized Speed V24-bit 混合19.9 GB21.5 GiB32 GB上一代,仍在目录中
Qwen 3.6 35B-A3B Optimized Speed / Balance4-bit / 6-bit21.0 / 29.7 GB28.0 / 32.0 GiB32 GBMoE,快且聪明
Gemma 4 Optimized Speed4-bit17.7 GB18.0 GiB32 GB高质量、中等速度
Flash Next Bare Speed4-bit 统一106.3 GB78 GiB96 GB125B MoE 最快构建
Flash Next Optimized Speed4-bit 动态 + 8-bit 注意力115.1 GB87 GiB128 GB256 GB 机器的首选
Flash Next Optimized Quality8-bit 主体170.0 GB136.4 GiB256 GB最高保真,速度未测

M1/M2 对应的 FP16 兄弟包(如Qwen3.8-27B-MTPLX-Optimized-Speed-FP16)峰值与 bf16 版相同,由 MTPLX 自动按芯片代际选择,你不需要手动挑精度。

"Recommended"徽章怎么来的:1.5 倍安全系数

目录里的内存峰值只是"能跑"的下限,MTPLX 判断"推荐"时更保守。在 mtplx/model_catalog.py 的evaluate_feasibility()中:

  • 内存 ≥ 峰值 ×1.5→ 打上Recommended徽章
  • 峰值 ≤ 内存 < 1.5 × 峰值 →tight fit(能跑但吃紧)
  • 内存 < 峰值 → 直接不推荐、不加载
  • 磁盘:下载还需"剩余字节 + 5 GiB"空闲空间

举例:32 GB 的 Mac 跑 Bonsai 2 27B(峰值 11.8 GiB,1.5 倍即 17.7 GiB),徽章是 Recommended;跑 Qwen 3.8 27B Optimized Speed(峰值 25 GiB,1.5 倍即 37.5 GiB)则是 tight fit。16 GB 上跑 Bonsai 的完整内存测量方法,见 docs/BONSAI-2-MEMORY.md。

装好之后:两条命令搞定

brew install youssofal/mtplx/mtplx # 或 python3 -m pip install mtplx mtplx start # 交互式选模型,自动按内存推荐

装好模型后还有两个值得知道的命令:

  • mtplx tune --model <模型> --retune:在你的机器上实测不同 MTP 深度,自动保存更快的深度。例如 16 GB M4 Mac mini 上调 9B,基线 14.4 tok/s 会变成 23.0 tok/s
  • mtplx doctor:体检安装与集成健康状况,不需要 MLX 也能跑

常见疑问

Q:16 GB 的 Mac 为什么推荐 27B 的 Bonsai 而不是 9B?因为 Bonsai 2 是三值量化:权重只有 3 个取值,8.9 GB 的包里塞下了 27B 的参数 + 视觉塔 + MTP 头,实测 64.4 tok/s(M5 Max,4K 上下文),只有 4-bit 27B 一半的内存。它需要 MTPLX 2.12.0 以上。

Q:96 GB 和 128 GB 差在哪?96 GB 只能跑 Flash Next Bare Speed(峰值 78 GiB);128 GB 起才推荐质量更高的 Optimized Speed(峰值 87 GiB)。

Q:我能自己指定模型吗?可以,任何显式选择都优先于自动推荐:mtplx serve --model Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed。模型兼容性分级(verified / unverified / AR-only 等)见 docs/model-compatibility.md,MTPLX 不会静默降级——跑不好会直接告诉你,而不是偷偷换策略。

Q:为什么 M1/M2 单独一套 FP16?M1/M2 没有原生 bf16 支持,MTPLX 为同一批权重做了 FP16 变体,保证老芯片也能全速运行同一套模型,目录与推荐逻辑见 mtplx/default_models.py。

小结

你的内存一句话建议
< 16 GBQwen 3.5 4B Optimized Speed,先跑起来再说
16 ~ 31 GBBonsai 2 27B,16 GB 也能跑 27B
32 ~ 47 GBQwen 3.8 27B Optimized Speed,编程主力
48 ~ 127 GB27B Quality + 可试 Flash Next(128 GB 起)
≥ 256 GBFlash Next Optimized Speed 打头,Quality 殿后

不用纠结量化参数:下载体积、内存峰值、档位差异都在 README.md 的模型目录表和 mtplx/model_catalog.py 里写得明明白白,MTPLX 会把适合你的那一个直接摆到第一行。

【免费下载链接】MTPLXThe fastest way to run Qwen 3.8 Flash Next, Qwen 3.8 27B and Ternary Bonsai 2 27B on a Mac: 125 tok/s in OpenCode on an M5 Max, and a 27B model on 16 GB Macs. Native MTP speculative decoding on Apple Silicon, exact at any temperature. OpenAI and Anthropic compatible local server.项目地址: https://gitcode.com/gh_mirrors/mt/MTPLX

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询