【免费下载链接】mlx-serve
Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Zig backend, Swift frontend macOS app with chat, music, voice, video generation.
如果你想在 Apple Silicon Mac 上做本地 LLM 推理,大概率会在这三个方案之间纠结:mlx-serve、LM Studio和Ollama。本文用同一台 M4 Max、同一份权重文件,把三者的解码速度、Prefill 速度、API 能力和开箱成本摊开对比,并解释 mlx-serve 官方宣称「比 LM Studio 快 26%」这个数字到底是怎么来的、在什么场景下你真正能拿到。
测试口径(来自 docs/performance.md):Apple M4 Max 128GB,四个引擎加载完全相同的 MLX 权重文件,全部使用各自出厂默认配置(默认 vs 默认,不做逐模型调参),由 llmprobe 统一测量,每点取 3 次中位数。原始数据见 benchmarks.md。
三大本地 LLM 引擎能力速览
先不看速度,看「能干什么」。这张表决定了你的迁移成本:
| 能力 | mlx-serve | LM Studio | Ollama |
|---|---|---|---|
| MLX 原生模型 | ✅ | ✅ | 🟡(几乎只支持 GGUF) |
| GGUF 模型 | ✅(内嵌 llama.cpp) | ✅ | ✅ |
| OpenAI 兼容 API | ✅ | ✅ | 部分 |
| Anthropic Messages API(Claude Code 直连) | ✅ | 🟡 部分 | ❌ |
| Ollama API(老工具无缝迁移) | ✅ | ❌ | ✅ 原生 |
| 投机解码(MTP / drafter / PLD) | ✅ 四种 | ❌ | 部分 |
| KV-Cache 量化(4/8-bit) | ✅ | ❌ | 部分 |
| 连续批处理 | ✅ | ❌ | ✅ |
| 图片 / 视频 / 音乐 / 语音 / 3D 生成 | ✅ | ❌ | ❌ |
| 运行时依赖 Python | ❌(约 7MB 单二进制) | ❌ | ❌ |
| 许可证 | MIT | 闭源 | MIT |
一个关键差异:mlx-serve 同时说三种「协议」——OpenAI Chat/Responses、Anthropic Messages 和 Ollama API 都跑在同一个端口(默认11234)。这意味着你现有的 Raycast、Obsidian、Open WebUI 等 Ollama 工具改个地址就能用,Claude Code 也能直连。完整端点清单在 docs/api.md。
v26.8.3 在 M4 Max 上的默认配置对比:mlx-serve 几何平均解码 +26%、Prefill +36%(相对 LM Studio)。注意 Qwen 3.6 27B 一行——差距主要来自 MTP 投机解码。
解码速度实测:+26% 是平均数,形状比平均数更重要
上面这张图是「默认 vs 默认」的完整矩阵。单看平均数会漏掉两个重要事实(详细解读见 docs/faq.md):
- 稠密模型的纯解码已经追平。在 Gemma 4 E4B 上,LM Studio 与 mlx-serve 的差距只有 -0.5%~-0.8%,基本打平——LM Studio 在这块跟上了。
- 拉开差距的是 Prefill 和投机解码。Gemma 4 E4B 的 Prefill 快了 117%;而在 Qwen 3.6 27B 上,mlx-serve 会自动加载 checkpoint 自带的 MTP(多 token 预测)头,LM Studio 则不加载,同文件解码直接+145%。
如果开启各引擎可选的投机加速组件(mlx-serve 的 drafter / MTP),差距进一步放大:
蓝色为 mlx-serve 最佳可用配置:Gemma 4 E4B 开 drafter 后 118→178 tok/s(+98%),Qwen 3.6 27B 开 MTP 后 66→157 tok/s(+278% vs 自身基线)。
相对 oMLX 与 MTPLX:在自己的主场也不落下风
公平起见,mlx-serve 也在对手「最擅长的检查点」上打过:
- vs oMLX(oQ4e 构建):解码+23%,Prefill 打平;
- vs MTPLX(MTPLX-Optimized 构建):解码+10%、Prefill+17%,首 token 时间 494ms vs 1528ms——快了 3 倍。
MTPLX 是目前 Qwen MTP 模型的标杆运行时,这张图展示了长上下文下各家的 Prefill/解码爬坡:
26% 解码提速的真相:四种投机解码
「26%」不是玄学,主要来自默认开启的投机解码。mlx-serve 内置四种,全部与贪心解码等价(temp=0 时逐字节一致):
- Native MTP(Qwen 3.5/3.6/3.8):模型自带的多头预测头直接起草,控制器按请求自适应调整深度,零配置;
- DFlash 伴生 drafter:模型目录可自带
drafter/,随模型自动加载; - PLD(提示词查找解码):与模型无关的 n-gram 匹配,在 Agent 循环、RAG、代码编辑等「答案会复述提示词」的场景收益最大,默认开启;
- Gemma 4 交叉注意力 drafter:官方小起草模型,可选加载。
关键设计是自适应门控:遇到全新内容(创意写作、一次性问答)时自动关闭投机,不付验证开销;接受率跌破盈亏平衡时中途停用。所以「26%」是真实拿到的默认收益,而不是某个最佳配置的天花板——反过来,在 Agent 编程场景,实测收益能到 +98%~+278%(见上图)。
Qwen 3.8 移植 MTP 验证器时的全上下文扫描(1K→1M)也显示解码增益在长上下文下持续扩大:
Ollama 用户:3 步无缝迁移到更快的引擎
mlx-serve原生实现 Ollama API(/api/chat、/api/generate、/api/pull等),CLI 也是熟悉的 Ollama 风格。对 Apple Silicon 用户,它可以直接替换 Ollama:GGUF 模型跑在相同的内嵌 llama.cpp 上,但额外获得 MLX 原生路径、Metal 定制内核和投机解码——在 GGUF 对比中 mlx-serve 也比 Ollama 快约 15%(估算值,因为 Ollama 无法跑 MLX)。
brew install mlx-serve # 或 brew install --cask mlx-serve 安装 App mlx-serve run gemma4 # 自动下载、起服务、终端直接开聊一条命令完成下载 + 起服务 + REPL 对话,模型落在共享目录~/.mlx-serve/models,所有参数见 docs/cli.md:
不只是聊天:Agent 与多模态生成是独家项
mlx-serve 附带原生 macOS 菜单栏 App(MLX Core,非 Electron):多会话聊天、Agent 模式 + MCP 工具调用、模型浏览器,以及 LM Studio / Ollama 都没有的图片、视频、音乐、语音克隆、3D 生成——全部本地 MLX 完成:
Agent 模式内置 10 个工具(shell、文件读写、搜索、网页浏览等),并支持一键拉起 Claude Code 等编程 Agent:
结论:选哪个本地 LLM 推理引擎?
- 要速度、要 Agent 工作流、要多模态生成→mlx-serve。默认配置就比 LM Studio 快 26%,开启投机解码后 Agent 场景翻倍;OpenAI/Anthropic/Ollama 三协议同端口,迁移成本最低;
- 只想点鼠标聊天、不写脚本→ LM Studio 依然是最省心的选择,稠密模型速度与 mlx-serve 打平,只是没有投机解码、KV 量化和 API 深度;
- 多平台/非 Apple 硬件、轻量需求→ Ollama 生态最成熟;但在 Mac 上,把地址改成
http://localhost:11234指向 mlx-serve 后,同样的工具链直接提速。
想自己复现基准或继续调优,完整方法学与调参指南见 docs/performance.md,中文性能文档在 docs/zh-CN/performance.md,常见问题(含「是否比 LM Studio 快」的逐模型拆解)见 docs/faq.md。
【免费下载链接】mlx-serve
Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Zig backend, Swift frontend macOS app with chat, music, voice, video generation.
相关推荐
终极指南:三大LLM推理引擎性能对比 - Ollama vs vLLM vs TensorRT-LLM
终极指南:三大LLM推理引擎性能对比 Ollama vs vLLM vs TensorRT LLM 在大语言模型快速发展的今天,选择合适的 LLM推理引擎 对于
教程人工智能大模型Nxtscape本地LLM完整配置指南:Ollama与LM Studio终极教程
Nxtscape本地LLM完整配置指南:Ollama与LM Studio终极教程 想要在Nxtscape智能浏览器中体验本地AI的强大功能吗?本教程将手把手教你
大模型AI Agent浏览器控制MCP 服务代码智能体GUI 自动化前端后端桌面应用Qwen1.5量化推理速度:llama.cpp vs mlx-lm性能对比
Qwen1.5量化推理速度:llama.cpp vs mlx lm性能对比 你是否在寻找本地运行大语言模型(LLM)的最佳方案?面对众多量化工具和部署框架,如何
人工智能大模型Qwen模型评测示例工程本地部署教程
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考