【大模型部署实战】turbo-fieldfare 中文版:2GB 内存跑 Gemma 4 26B 的 Mac 端推理上手指南
2026/8/31 4:01:06 网站建设 项目流程

项目简介

turbo-fieldfare 是一个 Swift + Metal 写成的自定义推理运行时,能在约 2GB 内存里跑 Gemma 4 26B-A4B 模型,专为 Apple Silicon Mac 打造。Apache-2.0 许可,GitHub 6483 star。

指标
模型Gemma 4 26B-A4B(260 亿参数,每 token 激活 38.8 亿)
权重MLX 仿射 4-bit,组大小 64
内存约 2GB 权重 + 4K KV 缓存
存储文本模型约 14.3GB
硬件Apple Silicon Mac,8GB 起步
平台macOS 26+、Metal 4、Swift 6.2

环境要求

  • Apple Silicon Mac(M 系列芯片)
  • macOS 26 或更高版本
  • 约 15GB 磁盘空间

快速开始

gitclone https://github.com/drumih/turbo-fieldfare.gitcdturbo-fieldfare swift build-crelease .build/release/TurboFieldfareMac

首次运行 Swift Package Manager 会下载分词器依赖。构建完成后打开 Mac 应用:

  1. 选「下载」,自动拉取并重新打包约 15GB 模型;
  2. 选「加载模型」;
  3. 输入提示词,点「生成」。

工作原理

核心是 MoE 稀疏性的利用:

  • 常驻核心:1.35GB 共享权重 + FP16 KV 缓存常驻内存;
  • 流式专家:每次生成 token,只从 SSD 读入「路由命中的专家」,用完释放;
  • 4-bit 量化:权重本身以 MLX 仿射 4-bit 存储,路由 8-bit。

因为 Gemma 4 26B-A4B 每个 token 只激活 38.8 亿参数(总量 260 亿),大部分参数在每一步是「睡着的」,可以留在 SSD 里。

实测解码速度

机型内存解码速度
M2 MacBook Air8 GB5.1 - 6.3 tok/s
M5 Pro24 GB31 - 35 tok/s

中文版

我已将 README 完整中文化:https://github.com/yangshun2005/turbo-fieldfare-cn

中文版保留了快速开始、指标表、工作原理、基准测试、103 项实验记录等完整内容,适合想系统了解「Mac 端大模型极限推理优化」的读者。

如果这个项目对你有帮助,也欢迎动动小手去原仓库点个 Star,支持作者持续维护。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询