项目简介
turbo-fieldfare 是一个 Swift + Metal 写成的自定义推理运行时,能在约 2GB 内存里跑 Gemma 4 26B-A4B 模型,专为 Apple Silicon Mac 打造。Apache-2.0 许可,GitHub 6483 star。
| 指标 | 值 |
|---|---|
| 模型 | Gemma 4 26B-A4B(260 亿参数,每 token 激活 38.8 亿) |
| 权重 | MLX 仿射 4-bit,组大小 64 |
| 内存 | 约 2GB 权重 + 4K KV 缓存 |
| 存储 | 文本模型约 14.3GB |
| 硬件 | Apple Silicon Mac,8GB 起步 |
| 平台 | macOS 26+、Metal 4、Swift 6.2 |
环境要求
- Apple Silicon Mac(M 系列芯片)
- macOS 26 或更高版本
- 约 15GB 磁盘空间
快速开始
gitclone https://github.com/drumih/turbo-fieldfare.gitcdturbo-fieldfare swift build-crelease .build/release/TurboFieldfareMac首次运行 Swift Package Manager 会下载分词器依赖。构建完成后打开 Mac 应用:
- 选「下载」,自动拉取并重新打包约 15GB 模型;
- 选「加载模型」;
- 输入提示词,点「生成」。
工作原理
核心是 MoE 稀疏性的利用:
- 常驻核心:1.35GB 共享权重 + FP16 KV 缓存常驻内存;
- 流式专家:每次生成 token,只从 SSD 读入「路由命中的专家」,用完释放;
- 4-bit 量化:权重本身以 MLX 仿射 4-bit 存储,路由 8-bit。
因为 Gemma 4 26B-A4B 每个 token 只激活 38.8 亿参数(总量 260 亿),大部分参数在每一步是「睡着的」,可以留在 SSD 里。
实测解码速度
| 机型 | 内存 | 解码速度 |
|---|---|---|
| M2 MacBook Air | 8 GB | 5.1 - 6.3 tok/s |
| M5 Pro | 24 GB | 31 - 35 tok/s |
中文版
我已将 README 完整中文化:https://github.com/yangshun2005/turbo-fieldfare-cn
中文版保留了快速开始、指标表、工作原理、基准测试、103 项实验记录等完整内容,适合想系统了解「Mac 端大模型极限推理优化」的读者。
如果这个项目对你有帮助,也欢迎动动小手去原仓库点个 Star,支持作者持续维护。