3 条命令组成本地 AI 集群:exo 免费跑动 671B 大模型完整指南
2026/8/31 13:30:48 网站建设 项目流程

3 条命令组成本地 AI 集群:exo 免费跑动 671B 大模型完整指南

【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo

exo 将多台 Mac mini、Mac Studio 乃至 Linux 机器连成 本地 AI 集群:节点自动互相发现,模型按设备内存与链路带宽自动切分,671B 参数的前沿大模型得以在本机运行,数据不出门。内置仪表盘与 OpenAI 兼容 API 运行在 http://localhost:52415,现有客户端可原样接入。

把闲置设备的内存拼成 671B 大模型的推理池

当前 本地跑大模型 的第一瓶颈是内存:一个 671B 的模型用 8-bit 精度加载就需要约 700 GB 内存,超出任何单机的 128–512 GB 上限。转向云端 API 意味着按 token 付费且数据外发;自己堆 GPU 则显卡内存价格昂贵。把家里几台闲置设备的内存拼起来做 多设备大模型推理,是成本最低的出路,边际成本几乎只有一根网线或一根雷雳线。

exo 的定位:免配置节点发现加按拓扑切分模型

exo 是一款 Apache-2.0 开源的 本地 AI 集群 工具,核心差异在于"零手动配置":设备上启动 exo 后通过局域网自动发现彼此,系统再根据每台设备的可用内存、链路类型(Thunderbolt 5 RDMA 或以太网)与实测带宽,自动计算模型的最优部署方式,并通过/instance/previews接口列出所有可行切分方案供选择。开启 Thunderbolt 5 上的 RDMA 后,设备间延迟可降低 99%(官方 README 数据)——加设备让模型跑得更快,而不是被网络拖慢。

拓扑感知自动并行:模型先"看房"再落位

把 exo 的调度器想象成一位物业经理:安放每台设备前,先逐层勘察电力容量与线缆负载,再决定机器装在哪一层。其准确定义是Topology-Aware Auto Parallel:系统实时获取设备拓扑视图(节点内存、每条链路的延迟与带宽),据此计算管线切分或张量并行的最优方案。

除了按层顺序切分的管线并行,exo 还支持张量并行:每台设备持有同一层权重的一片,所有设备同时参与每个 token 的计算。官方给出的加速上限是 2 台设备 1.8 倍、4 台设备 3.2 倍,这意味着 张量并行 是"加机器变快"的来源。

⚡ 最快完成首次部署的 3 条命令

从源码构建并启动节点

macOS 需先装好 Xcode 与 uv,Linux 需 node 18 以上与 rust(安装方式见 README)。随后:

git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard && npm install && npm run build

执行后终端打印 SvelteKit 构建日志,完成后在dashboard/build生成静态仪表盘产物。

uv run exo

执行后当前节点加入集群并自动发现其他节点,日志打印节点 ID,仪表盘与 API 出现在 http://localhost:52415。macOS 用户也可用brew install --cask exo直接安装后台应用。

用兼容 API 发起第一次对话

curl -N -X POST http://localhost:52415/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{"model":"mlx-community/Llama-3.2-1B-Instruct-4bit","messages":[{"role":"user","content":"Hello"}],"stream":true}'

终端会流式打印 OpenAI Chat Completions 格式的回复;同一端口同时兼容 Claude Messages、OpenAI Responses 与 Ollama 接口。

📊 看实测数据:4 台 Mac Studio 的张量并行集群

下图来自项目文档中的真实集群视图:4 台 512 GB M3 Ultra Mac Studio 同时加载 DeepSeek v3.1(8-bit)与 Kimi K2 Thinking(4-bit),每个节点的内存占用、模型实例与任务状态一览可见。

同一集群上 DeepSeek v3.1 671B(8-bit)的基准测试画面如下,展示了 张量并行 加 RDMA 链路下的吞吐表现。

排查 RDMA 卡点并判断 exo 的适用边界

设备发现不到彼此时的检查清单

  • Thunderbolt RDMA 需要 macOS 26.2(Tahoe)以上,且机型必须是 Thunderbolt 5 设备(M4 Pro Mac mini、M4 Max Mac Studio / MacBook Pro、M3 Ultra Mac Studio),并在恢复模式终端执行rdma_ctl enable后重启。
  • 集群内每台设备须用支持 TB5 的线缆直连成环;Mac Studio 上紧邻以太网口的那个 TB5 口不可用。
  • 所有节点的 macOS 版本必须完全一致(连 beta 号都要相同),否则 RDMA 端口互相发现失败。
  • exo 目前在 Linux 上仅跑 CPU,GPU 支持仍在开发,别在 Linux 节点上预期 GPU 加速。

哪些场景不建议上集群

单请求延迟优先于模型规模时,小模型(8B 以下)放单机更快——跨设备链路会引入额外往返;设备之间只有 2.4 GHz WiFi 或严重拥塞的无线网络时,跨设备推理对延迟敏感,建议先换成有线或 Thunderbolt 5;同一网络要跑多个互不干扰的集群时,记得用--namespace参数隔离发现域,避免节点误加入别人的集群。

接口细节与环境变量可查 API 文档 docs/api.md,不同切分方案的实测工具在 bench/exo_bench.py。当闲置设备白天吃灰时,它们随时可以拼成一座只属于你自己的推理集群:模型放在自家内存里,数据不出门,唯一消耗是电费。

【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询