4台家用Mac能跑671B大模型?exo多设备AI集群本地部署完整指南
2026/8/31 10:37:41 网站建设 项目流程

4台家用Mac能跑671B大模型?exo多设备AI集群本地部署完整指南

【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo

家里那台内存不够的大模型跑不起来?别急着买显卡,exo 是一个把你所有设备连成 AI 集群的开源框架:装完自动组网、自动分片,让大模型跑到单台设备根本装不下的大模型上。读完这篇你能拿到:

  • ✅ 120+ 个模型卡的真实支持清单,附硬件门槛
  • ✅ 从 clone 到跑通的最小 6 步路径
  • ✅ RDMA 组网、量化、离线模式等 5 条直接能用的调优建议

一句话看懂 exo:把闲置设备拼成你的本地推理集群

exo 的核心机制就一句话:每台设备各装一份 exo,它们自动互相发现,然后把模型按拓扑智能切分——哪台内存大就多放点,哪台连得近就少传数据。它的默认推理后端是苹果的 MLX,所以 Mac 是最佳搭档;Linux 也能跑,只是目前走 CPU。

官方展示效果:4 × 512GB M3 Ultra Mac Studio 同时跑 DeepSeek v3.1(8-bit)和 Kimi-K2-Thinking(4-bit),集群视图就长这样。

能跑哪些模型?120+ 模型卡清单和硬件门槛

exo 用 TOML「模型卡」描述每个模型(层数、显存占用、是否支持张量并行),内置的推理模型卡都在 resources/inference_model_cards/ 目录里,目前 123 个。挑几个有代表性的:

类别代表模型模型卡路径硬件门槛典型用途
超大 MoE LLMDeepSeek-V3.1(671B,8bit)mlx-community--DeepSeek-V3.1-8bit.toml约 712GB,需 4×512GB Mac超长上下文推理
超大 MoE LLMQwen3-235B-A22B(8bit)mlx-community--Qwen3-235B-A22B-Instruct-2507-8bit.toml数百 GB,建议 4 台 Mac智能对话、Agent
旗舰思考模型Kimi-K2-Thinking(4bit)mlx-community--Kimi-K2-Thinking.toml多台设备分摊深度思考、代码
70B 级 LLMLlama-3.3-70B-Instruct(4bit)mlx-community--Llama-3.3-70B-Instruct-4bit.toml约 40GB,2 台 32GB 设备即可日常对话、写作
单台可跑 LLMQwen3-30B-A3B(4bit)mlx-community--Qwen3-30B-A3B-4bit.toml16~32GB 单台 Mac轻量问答
视觉多模态Qwen3-VL-4B-Instruct(4bit)mlx-community--Qwen3-VL-4B-Instruct-4bit.toml单台 16GB 即可图文理解
图像生成FLUX.1-dev / Qwen-Imageresources/image_model_cards/需开启EXO_ENABLE_IMAGE_MODELS文生图、图生图

除了内置清单,你还能从 HuggingFace 拉任意 mlx 格式模型,exo 会自动读 config.json 生成模型卡,逻辑在 src/exo/shared/models/model_cards.py。

重点拆解:三个决定体验的功能

自动发现与拓扑感知分片:模型怎么被切到多台设备

这是 exo 最核心的「大脑」。启动后设备自动互相发现,无需手动配 IP;随后 master 节点根据实时拓扑(各设备剩余内存 + 每根链路的延迟/带宽)算出最优切分方案,实现入口在 src/exo/master/placement.py。

  • 你不用指定哪台放哪层,/instance/previews接口会列出所有合法摆放方案让你挑
  • 内存不均也没关系,它按「实时视图」分配,大内存设备自动多扛
  • 常见坑:设备时间/OS 版本不一致时可能发现失败,RDMA 集群尤其要求系统版本完全一致

张量并行 + 雷电 RDMA:加机器反而更快

传统管线切分加机器只是「装得下」,exo 支持张量并行(Tensor Parallelism),2 台设备提速约 1.8 倍、4 台约 3.2 倍,而且 macOS 26.2 起支持 Thunderbolt 5 上的 RDMA,设备间延迟降低 99%。

实测截图来自 Jeff Geerling 的评测:Qwen3-235B(8-bit)在 4 × M3 Ultra Mac Studio 上跑张量并行 RDMA。

  • 支持设备:M4 Pro Mac Mini、M4 Max Mac Studio / MacBook Pro、M3 Ultra Mac Studio
  • 开机前长按电源进恢复模式,终端执行rdma_ctl enable再重启即可
  • 坑点:设备间必须用 TB5 线全互联;Mac Studio 上以太网口旁边那个 TB5 口不可用

四种主流 API 全兼容:你现有的工具直接能用

exo 的 API 同时实现了OpenAI Chat Completions、Claude Messages、OpenAI Responses、Ollama四种格式,接口都在http://localhost:52415。也就是说 ChatGPT 客户端、Claude 客户端、OpenWebUI 这类现成工具,把 base URL 指过去就能用,一行代码不用改。端点细节见 docs/api.md。

从零到跑通:6 步搭起你的第一个多设备 AI 集群

  1. 装环境git clone https://gitcode.com/GitHub_Trending/exo8/exo,macOS 上建议装好 Xcode 后用 brew 装uvnode,rust 用 rustup 装 nightly;装了 Nix 的话nix run .#exo一条命令跳过大部分步骤
  2. 构仪表盘cd dashboard && npm install && npm run build
  3. 启动节点:每台设备都跑uv run exo,API 和仪表盘起在http://localhost:52415
  4. 自动组网:同一网络内的节点互相发现,无需手动配置;懒人直接brew install --cask exo装 macOS 菜单栏版
  5. 选模型:仪表盘里搜索(可搜 HuggingFace),点选后按推荐的摆放方案创建实例,等它返回 ready
  6. 开始用:网页里直接聊,或用 curl 打/v1/chat/completions,格式和 OpenAI 完全一样

性能调优:普通用户马上能做的 5 件事

  • 全互联 + 开 RDMA → 加机器真的变快:TB5 线把所有设备两两连上并启用 RDMA,张量并行才能在 4 台设备上拿到 3.2 倍提速,否则只能退化为普通组网
  • 优先选 4bit 量化版本 → 省一半内存:同一模型 8bit 和 4bit 的模型卡通常并存,设备内存吃紧时直接换 4bit,DeepSeek 671B 从 712GB 直接砍半
  • 把模型盘指到外接 SSD → 下载和加载都快:设EXO_MODELS_DIRS=/Volumes/ExternalSSD/exo-models,默认盘满了会自动落到第一个空间够的目录
  • 低配机器用--no-worker加入 → 没显卡也能入伙:只跑协调和组网不跑推理,让家里老设备当「指挥员」
  • 用 exo-bench 跑一轮基准 → 数据说话uv run bench/exo_bench.py --model <模型> --pp 128,512 --tg 128,对比不同摆放的 prompt/生成 tps 和峰值内存,工具在 bench/exo_bench.py

💡 离线环境记得EXO_OFFLINE=true,只加载本地已下载模型,避免每次启动去访问 HuggingFace。

写在最后

exo 把「多设备跑大模型」从折腾组网、手动切分的事,变成了装完即用的事:自动发现、自动分片、兼容你手里所有 API 客户端。家里几台 Mac 凑一凑,671B 级模型也不是只能仰望的玩具。下一篇我们聊聊「只用 2 台 32GB 的 MacBook,怎么跑满 70B 模型还不发烫」,想看的先点个收藏。

📌 收藏本文备用,关注 exo 仓库获取模型卡更新和 RDMA 支持进展——新模型支持基本是 day-0 跟进的。

【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询