4台家用Mac能跑671B大模型?exo多设备AI集群本地部署完整指南
【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo
家里那台内存不够的大模型跑不起来?别急着买显卡,exo 是一个把你所有设备连成 AI 集群的开源框架:装完自动组网、自动分片,让大模型跑到单台设备根本装不下的大模型上。读完这篇你能拿到:
- ✅ 120+ 个模型卡的真实支持清单,附硬件门槛
- ✅ 从 clone 到跑通的最小 6 步路径
- ✅ RDMA 组网、量化、离线模式等 5 条直接能用的调优建议
一句话看懂 exo:把闲置设备拼成你的本地推理集群
exo 的核心机制就一句话:每台设备各装一份 exo,它们自动互相发现,然后把模型按拓扑智能切分——哪台内存大就多放点,哪台连得近就少传数据。它的默认推理后端是苹果的 MLX,所以 Mac 是最佳搭档;Linux 也能跑,只是目前走 CPU。
官方展示效果:4 × 512GB M3 Ultra Mac Studio 同时跑 DeepSeek v3.1(8-bit)和 Kimi-K2-Thinking(4-bit),集群视图就长这样。
能跑哪些模型?120+ 模型卡清单和硬件门槛
exo 用 TOML「模型卡」描述每个模型(层数、显存占用、是否支持张量并行),内置的推理模型卡都在 resources/inference_model_cards/ 目录里,目前 123 个。挑几个有代表性的:
| 类别 | 代表模型 | 模型卡路径 | 硬件门槛 | 典型用途 |
|---|---|---|---|---|
| 超大 MoE LLM | DeepSeek-V3.1(671B,8bit) | mlx-community--DeepSeek-V3.1-8bit.toml | 约 712GB,需 4×512GB Mac | 超长上下文推理 |
| 超大 MoE LLM | Qwen3-235B-A22B(8bit) | mlx-community--Qwen3-235B-A22B-Instruct-2507-8bit.toml | 数百 GB,建议 4 台 Mac | 智能对话、Agent |
| 旗舰思考模型 | Kimi-K2-Thinking(4bit) | mlx-community--Kimi-K2-Thinking.toml | 多台设备分摊 | 深度思考、代码 |
| 70B 级 LLM | Llama-3.3-70B-Instruct(4bit) | mlx-community--Llama-3.3-70B-Instruct-4bit.toml | 约 40GB,2 台 32GB 设备即可 | 日常对话、写作 |
| 单台可跑 LLM | Qwen3-30B-A3B(4bit) | mlx-community--Qwen3-30B-A3B-4bit.toml | 16~32GB 单台 Mac | 轻量问答 |
| 视觉多模态 | Qwen3-VL-4B-Instruct(4bit) | mlx-community--Qwen3-VL-4B-Instruct-4bit.toml | 单台 16GB 即可 | 图文理解 |
| 图像生成 | FLUX.1-dev / Qwen-Image | resources/image_model_cards/ | 需开启EXO_ENABLE_IMAGE_MODELS | 文生图、图生图 |
除了内置清单,你还能从 HuggingFace 拉任意 mlx 格式模型,exo 会自动读 config.json 生成模型卡,逻辑在 src/exo/shared/models/model_cards.py。
重点拆解:三个决定体验的功能
自动发现与拓扑感知分片:模型怎么被切到多台设备
这是 exo 最核心的「大脑」。启动后设备自动互相发现,无需手动配 IP;随后 master 节点根据实时拓扑(各设备剩余内存 + 每根链路的延迟/带宽)算出最优切分方案,实现入口在 src/exo/master/placement.py。
- 你不用指定哪台放哪层,
/instance/previews接口会列出所有合法摆放方案让你挑 - 内存不均也没关系,它按「实时视图」分配,大内存设备自动多扛
- 常见坑:设备时间/OS 版本不一致时可能发现失败,RDMA 集群尤其要求系统版本完全一致
张量并行 + 雷电 RDMA:加机器反而更快
传统管线切分加机器只是「装得下」,exo 支持张量并行(Tensor Parallelism),2 台设备提速约 1.8 倍、4 台约 3.2 倍,而且 macOS 26.2 起支持 Thunderbolt 5 上的 RDMA,设备间延迟降低 99%。
实测截图来自 Jeff Geerling 的评测:Qwen3-235B(8-bit)在 4 × M3 Ultra Mac Studio 上跑张量并行 RDMA。
- 支持设备:M4 Pro Mac Mini、M4 Max Mac Studio / MacBook Pro、M3 Ultra Mac Studio
- 开机前长按电源进恢复模式,终端执行
rdma_ctl enable再重启即可 - 坑点:设备间必须用 TB5 线全互联;Mac Studio 上以太网口旁边那个 TB5 口不可用
四种主流 API 全兼容:你现有的工具直接能用
exo 的 API 同时实现了OpenAI Chat Completions、Claude Messages、OpenAI Responses、Ollama四种格式,接口都在http://localhost:52415。也就是说 ChatGPT 客户端、Claude 客户端、OpenWebUI 这类现成工具,把 base URL 指过去就能用,一行代码不用改。端点细节见 docs/api.md。
从零到跑通:6 步搭起你的第一个多设备 AI 集群
- 装环境:
git clone https://gitcode.com/GitHub_Trending/exo8/exo,macOS 上建议装好 Xcode 后用 brew 装uv、node,rust 用 rustup 装 nightly;装了 Nix 的话nix run .#exo一条命令跳过大部分步骤 - 构仪表盘:
cd dashboard && npm install && npm run build - 启动节点:每台设备都跑
uv run exo,API 和仪表盘起在http://localhost:52415 - 自动组网:同一网络内的节点互相发现,无需手动配置;懒人直接
brew install --cask exo装 macOS 菜单栏版 - 选模型:仪表盘里搜索(可搜 HuggingFace),点选后按推荐的摆放方案创建实例,等它返回 ready
- 开始用:网页里直接聊,或用 curl 打
/v1/chat/completions,格式和 OpenAI 完全一样
性能调优:普通用户马上能做的 5 件事
- 全互联 + 开 RDMA → 加机器真的变快:TB5 线把所有设备两两连上并启用 RDMA,张量并行才能在 4 台设备上拿到 3.2 倍提速,否则只能退化为普通组网
- 优先选 4bit 量化版本 → 省一半内存:同一模型 8bit 和 4bit 的模型卡通常并存,设备内存吃紧时直接换 4bit,DeepSeek 671B 从 712GB 直接砍半
- 把模型盘指到外接 SSD → 下载和加载都快:设
EXO_MODELS_DIRS=/Volumes/ExternalSSD/exo-models,默认盘满了会自动落到第一个空间够的目录 - 低配机器用
--no-worker加入 → 没显卡也能入伙:只跑协调和组网不跑推理,让家里老设备当「指挥员」 - 用 exo-bench 跑一轮基准 → 数据说话:
uv run bench/exo_bench.py --model <模型> --pp 128,512 --tg 128,对比不同摆放的 prompt/生成 tps 和峰值内存,工具在 bench/exo_bench.py
💡 离线环境记得EXO_OFFLINE=true,只加载本地已下载模型,避免每次启动去访问 HuggingFace。
写在最后
exo 把「多设备跑大模型」从折腾组网、手动切分的事,变成了装完即用的事:自动发现、自动分片、兼容你手里所有 API 客户端。家里几台 Mac 凑一凑,671B 级模型也不是只能仰望的玩具。下一篇我们聊聊「只用 2 台 32GB 的 MacBook,怎么跑满 70B 模型还不发烫」,想看的先点个收藏。
📌 收藏本文备用,关注 exo 仓库获取模型卡更新和 RDMA 支持进展——新模型支持基本是 day-0 跟进的。
【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考