☰
mlx-serve vs LM Studio vs Ollama 终极横评:本地 LLM 推理谁最快?26% 解码提速的真相
2026/10/11 8:34:04 网站建设 项目流程

【免费下载链接】mlx-serve

Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Zig backend, Swift frontend macOS app with chat, music, voice, video generation.

项目地址:https://gitcode.com/gh_mirrors/ml/mlx-serve
点击查看免费下载

如果你想在 Apple Silicon Mac 上做本地 LLM 推理,大概率会在这三个方案之间纠结:mlx-serve、LM Studio和Ollama。本文用同一台 M4 Max、同一份权重文件,把三者的解码速度、Prefill 速度、API 能力和开箱成本摊开对比,并解释 mlx-serve 官方宣称「比 LM Studio 快 26%」这个数字到底是怎么来的、在什么场景下你真正能拿到。

测试口径(来自 docs/performance.md):Apple M4 Max 128GB,四个引擎加载完全相同的 MLX 权重文件,全部使用各自出厂默认配置(默认 vs 默认,不做逐模型调参),由 llmprobe 统一测量,每点取 3 次中位数。原始数据见 benchmarks.md。

三大本地 LLM 引擎能力速览

先不看速度,看「能干什么」。这张表决定了你的迁移成本:

能力mlx-serveLM StudioOllama
MLX 原生模型✅✅🟡(几乎只支持 GGUF)
GGUF 模型✅(内嵌 llama.cpp)✅✅
OpenAI 兼容 API✅✅部分
Anthropic Messages API(Claude Code 直连)✅🟡 部分❌
Ollama API(老工具无缝迁移)✅❌✅ 原生
投机解码(MTP / drafter / PLD)✅ 四种❌部分
KV-Cache 量化(4/8-bit)✅❌部分
连续批处理✅❌✅
图片 / 视频 / 音乐 / 语音 / 3D 生成✅❌❌
运行时依赖 Python❌(约 7MB 单二进制)❌❌
许可证MIT闭源MIT

一个关键差异:mlx-serve 同时说三种「协议」——OpenAI Chat/Responses、Anthropic Messages 和 Ollama API 都跑在同一个端口(默认11234)。这意味着你现有的 Raycast、Obsidian、Open WebUI 等 Ollama 工具改个地址就能用,Claude Code 也能直连。完整端点清单在 docs/api.md。

v26.8.3 在 M4 Max 上的默认配置对比:mlx-serve 几何平均解码 +26%、Prefill +36%(相对 LM Studio)。注意 Qwen 3.6 27B 一行——差距主要来自 MTP 投机解码。

解码速度实测:+26% 是平均数,形状比平均数更重要

上面这张图是「默认 vs 默认」的完整矩阵。单看平均数会漏掉两个重要事实(详细解读见 docs/faq.md):

  1. 稠密模型的纯解码已经追平。在 Gemma 4 E4B 上,LM Studio 与 mlx-serve 的差距只有 -0.5%~-0.8%,基本打平——LM Studio 在这块跟上了。
  2. 拉开差距的是 Prefill 和投机解码。Gemma 4 E4B 的 Prefill 快了 117%;而在 Qwen 3.6 27B 上,mlx-serve 会自动加载 checkpoint 自带的 MTP(多 token 预测)头,LM Studio 则不加载,同文件解码直接+145%。

如果开启各引擎可选的投机加速组件(mlx-serve 的 drafter / MTP),差距进一步放大:

蓝色为 mlx-serve 最佳可用配置:Gemma 4 E4B 开 drafter 后 118→178 tok/s(+98%),Qwen 3.6 27B 开 MTP 后 66→157 tok/s(+278% vs 自身基线)。

相对 oMLX 与 MTPLX:在自己的主场也不落下风

公平起见,mlx-serve 也在对手「最擅长的检查点」上打过:

  • vs oMLX(oQ4e 构建):解码+23%,Prefill 打平;
  • vs MTPLX(MTPLX-Optimized 构建):解码+10%、Prefill+17%,首 token 时间 494ms vs 1528ms——快了 3 倍。

MTPLX 是目前 Qwen MTP 模型的标杆运行时,这张图展示了长上下文下各家的 Prefill/解码爬坡:

26% 解码提速的真相:四种投机解码

「26%」不是玄学,主要来自默认开启的投机解码。mlx-serve 内置四种,全部与贪心解码等价(temp=0 时逐字节一致):

  1. Native MTP(Qwen 3.5/3.6/3.8):模型自带的多头预测头直接起草,控制器按请求自适应调整深度,零配置;
  2. DFlash 伴生 drafter:模型目录可自带drafter/,随模型自动加载;
  3. PLD(提示词查找解码):与模型无关的 n-gram 匹配,在 Agent 循环、RAG、代码编辑等「答案会复述提示词」的场景收益最大,默认开启;
  4. Gemma 4 交叉注意力 drafter:官方小起草模型,可选加载。

关键设计是自适应门控:遇到全新内容(创意写作、一次性问答)时自动关闭投机,不付验证开销;接受率跌破盈亏平衡时中途停用。所以「26%」是真实拿到的默认收益,而不是某个最佳配置的天花板——反过来,在 Agent 编程场景,实测收益能到 +98%~+278%(见上图)。

Qwen 3.8 移植 MTP 验证器时的全上下文扫描(1K→1M)也显示解码增益在长上下文下持续扩大:

Ollama 用户:3 步无缝迁移到更快的引擎

mlx-serve原生实现 Ollama API(/api/chat、/api/generate、/api/pull等),CLI 也是熟悉的 Ollama 风格。对 Apple Silicon 用户,它可以直接替换 Ollama:GGUF 模型跑在相同的内嵌 llama.cpp 上,但额外获得 MLX 原生路径、Metal 定制内核和投机解码——在 GGUF 对比中 mlx-serve 也比 Ollama 快约 15%(估算值,因为 Ollama 无法跑 MLX)。

brew install mlx-serve # 或 brew install --cask mlx-serve 安装 App mlx-serve run gemma4 # 自动下载、起服务、终端直接开聊

一条命令完成下载 + 起服务 + REPL 对话,模型落在共享目录~/.mlx-serve/models,所有参数见 docs/cli.md:

不只是聊天:Agent 与多模态生成是独家项

mlx-serve 附带原生 macOS 菜单栏 App(MLX Core,非 Electron):多会话聊天、Agent 模式 + MCP 工具调用、模型浏览器,以及 LM Studio / Ollama 都没有的图片、视频、音乐、语音克隆、3D 生成——全部本地 MLX 完成:

Agent 模式内置 10 个工具(shell、文件读写、搜索、网页浏览等),并支持一键拉起 Claude Code 等编程 Agent:

结论:选哪个本地 LLM 推理引擎?

  • 要速度、要 Agent 工作流、要多模态生成→mlx-serve。默认配置就比 LM Studio 快 26%,开启投机解码后 Agent 场景翻倍;OpenAI/Anthropic/Ollama 三协议同端口,迁移成本最低;
  • 只想点鼠标聊天、不写脚本→ LM Studio 依然是最省心的选择,稠密模型速度与 mlx-serve 打平,只是没有投机解码、KV 量化和 API 深度;
  • 多平台/非 Apple 硬件、轻量需求→ Ollama 生态最成熟;但在 Mac 上,把地址改成http://localhost:11234指向 mlx-serve 后,同样的工具链直接提速。

想自己复现基准或继续调优,完整方法学与调参指南见 docs/performance.md,中文性能文档在 docs/zh-CN/performance.md,常见问题(含「是否比 LM Studio 快」的逐模型拆解)见 docs/faq.md。

【免费下载链接】mlx-serve

Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Zig backend, Swift frontend macOS app with chat, music, voice, video generation.

项目地址:https://gitcode.com/gh_mirrors/ml/mlx-serve
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询