16GB 到 256GB 内存该选哪个模型?MTPLX 模型推荐策略与量化档位完整清单
【免费下载链接】MTPLXThe fastest way to run Qwen 3.8 Flash Next, Qwen 3.8 27B and Ternary Bonsai 2 27B on a Mac: 125 tok/s in OpenCode on an M5 Max, and a 27B model on 16 GB Macs. Native MTP speculative decoding on Apple Silicon, exact at any temperature. OpenAI and Anthropic compatible local server.项目地址: https://gitcode.com/gh_mirrors/mt/MTPLX
在 Mac 上跑本地大模型,内存大小几乎直接决定了你能跑什么。MTPLX 是一个专为 Apple Silicon 设计的本地大模型运行工具,它用模型自带的 MTP(多词元预测)头做投机解码,解码速度可达普通解码的 1.6~2.24 倍,并提供 OpenAI / Anthropic 兼容的本地 API 服务。最关键的是,它内置了一套"按内存自动推荐模型"的策略:从 16 GB 到 256 GB 的 Mac,打开应用或运行mtplx start,它都会直接告诉你该下载哪一个包,不用自己猜。
MTPLX 的推荐策略:一套规则,所有界面共用
MTPLX 的应用与 CLI 共用同一份官方模型目录,推荐逻辑写在 mtplx/model_catalog.py 中。核心规则只有一条:推荐模型的实测内存峰值不能超过你的统一内存,且推荐顺序按内存分档:
| Mac 统一内存 | M3 / M4 / M5 推荐 | 说明 |
|---|---|---|
| 16 GB 以下 | Qwen 3.5 4B Optimized Speed | 4-bit,峰值仅 2.9 GiB |
| 16 ~ 31 GB | Ternary Bonsai 2 27B | 三值(ternary)27B,峰值 11.8 GiB,16 GB 上可用 8K 上下文 |
| 32 GB 起 | Qwen 3.8 27B Optimized Speed | 4-bit 动态量化,官方推荐的编程默认模型 |
| 96 GB 起 | Qwen 3.8 Flash Next(Bare Speed) | 125B MoE,32 GB n-gram 表走 SSD 流式读取 |
| 128 GB 起 | Flash Next Optimized Speed | 125.8 tok/s(OpenCode 请求, M5 Max 实测) |
| 256 GB 起 | Flash Next Optimized Speed(首选)+ Optimized Quality(次选) | 8-bit 最高保真构建 |
M1 / M2 走 FP16 分支:优先 9B FP16,然后才是 27B 三兄弟的 FP16 版本;8 GB 的 M1/M2 没有合适的 FP16 精选模型。这些阈值定义在 mtplx/default_models.py 的select_default_model()中,完整策略文档见 docs/install.md 与 docs/quickstart.md。
💡 注意:16 GB 的 Mac 跑 Bonsai 2 27B 时上下文窗口是 8,192 token;如果要接 OpenCode、Hermes 这类 agent 客户端,建议 18 GB 以上。
量化档位完整清单:速度档、均衡档、质量档
同一个模型,MTPLX 会发布多个"档位"(量化配方),命名规律很直观:
- Bare Speed:统一 4-bit,速度最快、体积最小,但质量低、长任务偏慢
- Optimized Speed:4-bit 动态量化(敏感部分保留更高精度),速度与质量平衡,大多数模型的默认推荐
- Optimized Quality:8-bit 动态量化,保真度最高,体积和内存占用最大
- FP16:同权重、16-bit 张量转 FP16,专为 M1/M2 准备
下面是完整清单(峰值内存为 MTPLX 在目录中的实测值,来源 mtplx/model_catalog.py):
| 模型包 | 量化 | 下载体积 | 内存峰值 | 最低内存 | 定位 |
|---|---|---|---|---|---|
| Qwen 3.5 4B Optimized Speed | 4-bit | 2.6 GB | 2.9 GiB | 8 GB | 小内存 Mac 的最快选择 |
| Qwen 3.5 4B Optimized Quality | 8-bit | 4.6 GB | 4.8 GiB | 8 GB | 4B 中保真度最高 |
| Qwen 3.5 9B Optimized Speed | 6-bit | 8.7 GB | 10.0 GiB | 16 GB | 小内存高速之选 |
| MiMo V2.6 Qwen 9B Optimized Speed | 6-bit | 8.7 GB | 10.0 GiB | 16 GB | 小米的 agentic 编程蒸馏版 |
| Ternary Bonsai 2 27B Optimized Speed | 三值 | 8.9 GB | 11.8 GiB | 16 GB | 半部 4-bit 27B 的内存,带视觉 |
| Qwen 3.8 27B Bare Speed | 4-bit 统一 | 16.0 GB | 20.0 GiB | 32 GB | 突发聊天最快 |
| Qwen 3.8 27B Optimized Speed | 4-bit 动态 | 20.4 GB | 25.0 GiB | 32 GB | 编程默认推荐 |
| Qwen 3.8 27B Optimized Quality | 8-bit 动态 | 29.4 GB | 33.0 GiB | 36 GB | 与 bf16 99.3% top-1 一致 |
| Qwen 3.6 27B Optimized Speed V2 | 4-bit 混合 | 19.9 GB | 21.5 GiB | 32 GB | 上一代,仍在目录中 |
| Qwen 3.6 35B-A3B Optimized Speed / Balance | 4-bit / 6-bit | 21.0 / 29.7 GB | 28.0 / 32.0 GiB | 32 GB | MoE,快且聪明 |
| Gemma 4 Optimized Speed | 4-bit | 17.7 GB | 18.0 GiB | 32 GB | 高质量、中等速度 |
| Flash Next Bare Speed | 4-bit 统一 | 106.3 GB | 78 GiB | 96 GB | 125B MoE 最快构建 |
| Flash Next Optimized Speed | 4-bit 动态 + 8-bit 注意力 | 115.1 GB | 87 GiB | 128 GB | 256 GB 机器的首选 |
| Flash Next Optimized Quality | 8-bit 主体 | 170.0 GB | 136.4 GiB | 256 GB | 最高保真,速度未测 |
M1/M2 对应的 FP16 兄弟包(如Qwen3.8-27B-MTPLX-Optimized-Speed-FP16)峰值与 bf16 版相同,由 MTPLX 自动按芯片代际选择,你不需要手动挑精度。
"Recommended"徽章怎么来的:1.5 倍安全系数
目录里的内存峰值只是"能跑"的下限,MTPLX 判断"推荐"时更保守。在 mtplx/model_catalog.py 的evaluate_feasibility()中:
- 内存 ≥ 峰值 ×1.5→ 打上Recommended徽章
- 峰值 ≤ 内存 < 1.5 × 峰值 →tight fit(能跑但吃紧)
- 内存 < 峰值 → 直接不推荐、不加载
- 磁盘:下载还需"剩余字节 + 5 GiB"空闲空间
举例:32 GB 的 Mac 跑 Bonsai 2 27B(峰值 11.8 GiB,1.5 倍即 17.7 GiB),徽章是 Recommended;跑 Qwen 3.8 27B Optimized Speed(峰值 25 GiB,1.5 倍即 37.5 GiB)则是 tight fit。16 GB 上跑 Bonsai 的完整内存测量方法,见 docs/BONSAI-2-MEMORY.md。
装好之后:两条命令搞定
brew install youssofal/mtplx/mtplx # 或 python3 -m pip install mtplx mtplx start # 交互式选模型,自动按内存推荐装好模型后还有两个值得知道的命令:
mtplx tune --model <模型> --retune:在你的机器上实测不同 MTP 深度,自动保存更快的深度。例如 16 GB M4 Mac mini 上调 9B,基线 14.4 tok/s 会变成 23.0 tok/smtplx doctor:体检安装与集成健康状况,不需要 MLX 也能跑
常见疑问
Q:16 GB 的 Mac 为什么推荐 27B 的 Bonsai 而不是 9B?因为 Bonsai 2 是三值量化:权重只有 3 个取值,8.9 GB 的包里塞下了 27B 的参数 + 视觉塔 + MTP 头,实测 64.4 tok/s(M5 Max,4K 上下文),只有 4-bit 27B 一半的内存。它需要 MTPLX 2.12.0 以上。
Q:96 GB 和 128 GB 差在哪?96 GB 只能跑 Flash Next Bare Speed(峰值 78 GiB);128 GB 起才推荐质量更高的 Optimized Speed(峰值 87 GiB)。
Q:我能自己指定模型吗?可以,任何显式选择都优先于自动推荐:mtplx serve --model Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed。模型兼容性分级(verified / unverified / AR-only 等)见 docs/model-compatibility.md,MTPLX 不会静默降级——跑不好会直接告诉你,而不是偷偷换策略。
Q:为什么 M1/M2 单独一套 FP16?M1/M2 没有原生 bf16 支持,MTPLX 为同一批权重做了 FP16 变体,保证老芯片也能全速运行同一套模型,目录与推荐逻辑见 mtplx/default_models.py。
小结
| 你的内存 | 一句话建议 |
|---|---|
| < 16 GB | Qwen 3.5 4B Optimized Speed,先跑起来再说 |
| 16 ~ 31 GB | Bonsai 2 27B,16 GB 也能跑 27B |
| 32 ~ 47 GB | Qwen 3.8 27B Optimized Speed,编程主力 |
| 48 ~ 127 GB | 27B Quality + 可试 Flash Next(128 GB 起) |
| ≥ 256 GB | Flash Next Optimized Speed 打头,Quality 殿后 |
不用纠结量化参数:下载体积、内存峰值、档位差异都在 README.md 的模型目录表和 mtplx/model_catalog.py 里写得明明白白,MTPLX 会把适合你的那一个直接摆到第一行。
【免费下载链接】MTPLXThe fastest way to run Qwen 3.8 Flash Next, Qwen 3.8 27B and Ternary Bonsai 2 27B on a Mac: 125 tok/s in OpenCode on an M5 Max, and a 27B model on 16 GB Macs. Native MTP speculative decoding on Apple Silicon, exact at any temperature. OpenAI and Anthropic compatible local server.项目地址: https://gitcode.com/gh_mirrors/mt/MTPLX
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考