☰
在 32GB 内存电脑上本地搭建 Qwen3.6-35B-A3B 大模型踩坑实录
2026/10/2 17:23:33 网站建设 项目流程

在 32GB 内存电脑上本地搭建 Qwen3.6-35B-A3B 大模型踩坑实录

本文记录我在 红米RedBook 16 pro 2026 Intel core UltraX 7 358H, 32GB 内存电脑上,从零下载、配置、运行 Qwen3.6-35B-A3B-GGUF 本地大模型的完整过程。重点标注每一步容易踩的坑,适合想在自己电脑上跑开源大模型的朋友参考。


一、为什么选 Qwen3.6-35B-A3B

Qwen3.6-35B-A3B 是一个 MoE 架构的开源大模型,虽然总参数量达到 35B,但每次推理时实际激活的参数只有约 3B,所以对硬件的要求比同规模的稠密模型低不少。

对于只有32GB 内存、没有高端独显的普通电脑来说,这是一个比较友好的选择。

但"友好"不代表随便下载就能跑。模型文件版本多、量化方式多、工具链配置也多,稍不注意就会走弯路。


二、第一步:选对模型文件

在 ModelScope 或 Hugging Face 上搜索Qwen3.6-35B-A3B-GGUF,会看到很多文件。

常见文件大致有:

文件是否建议下载说明
Qwen3.6-35B-A3B-Q4_K_M.gguf✅ 推荐约 21GB,32GB 内存首选
Qwen3.6-35B-A3B-Q5_K_M.gguf⚠️ 可尝试效果更好,但内存压力更大
Qwen3.6-35B-A3B-F16 / BF16❌ 不建议文件过大,普通 32GB 内存基本跑不动
mmproj-*.gguf按需只有需要图片理解时才下载

我最终选择的是:

Qwen3.6-35B-A3B-Q4_K_M.gguf

这个版本大约21.17GB,对 32GB 内存比较合适。


🚩 坑 1:不要下载 F16 / BF16 全精度版本

一开始很容易看到文件列表里有F16、BF16这类版本,觉得"精度越高效果越好",就直接下载。

但这类文件通常有60GB 以上,不仅下载时间极长,而且 32GB 内存根本装不下。

建议:

普通本地部署优先选:

Q4_K_M

这是精度、体积、速度之间比较平衡的版本。


🚩 坑 2:下载一天没下完,不一定是网络问题

大模型文件动辄十几 GB、二十几 GB,如果用浏览器直接下载,很容易出现:

  • 下载速度越来越慢
  • 进度条不动
  • 中断后无法续传
  • 下载完发现文件大小不对

这时候不要一直等,先检查文件状态。

判断方法:

右键文件 → 属性,看文件大小。

如果目标文件应该是21.17GB,但本地只有几个 GB,说明没有下载完整。

如果文件名带有:

.incomplete .part .tmp

说明下载还没结束,不能直接拿来运行。

建议:

大模型文件不要用浏览器下载,优先使用支持断点续传的工具,例如:

  • huggingface-cli
  • aria2
  • IDM
  • ModelScope 官方下载工具

🚩 坑 3:模型文件路径不要带中文、空格、特殊符号

模型加载时,路径越干净越稳。

推荐放在类似这样的目录:

D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf

不要放在:

D:\我的模型\Qwen 3.6\模型文件\

中文、空格、特殊符号都可能在某些工具中引发路径解析问题。


三、准备推理工具:llama.cpp

我选择使用llama.cpp来加载 GGUF 模型。

基本流程是:

  1. 克隆仓库
  2. 使用 CMake 配置项目
  3. 编译生成可执行文件
  4. 使用llama-cli加载模型

示例流程:

git clone https://github.com/ggerganov/llama.cppcd llama.cppcmake-B build cmake--build build--config Release

编译成功后,可执行文件一般在:

build\bin\Release\llama-cli

🚩 坑 4:cmake不是系统自带命令

第一次执行:

cmake-B build

很多人会遇到:

无法将“cmake”项识别为 cmdlet、函数、脚本文件或可运行程序的名称。

这不是 llama.cpp 的问题,而是电脑上没有安装 CMake,或者安装了但没有加入系统 PATH。

解决方法:

  1. 去 CMake 官网下载 Windows 安装包
  2. 安装时勾选:
Add CMake to the system PATH
  1. 安装完成后,关闭当前 PowerShell
  2. 重新打开一个新的 PowerShell
  3. 再执行:
cmake--version

能输出版本号,才说明配置成功。


🚩 坑 5:安装完 CMake 后,当前窗口不会立刻生效

很多人安装完 CMake 后,直接在原来的 PowerShell 里继续执行:

cmake-B build

结果还是报错。

这是因为环境变量更新后,已经打开的终端不会自动刷新。

解决方法很简单:

关闭当前 PowerShell,重新打开一个新的窗口。


🚩 坑 6:编译可能还需要 Visual Studio Build Tools

llama.cpp在 Windows 上编译,通常依赖 C++ 编译工具链。

如果执行编译命令时报错,常见原因之一是缺少:

Visual Studio Build Tools

安装时需要勾选:

使用 C++ 的桌面开发

如果没有这个环境,cmake --build很容易失败。


四、第一次运行模型

编译完成后,可以用下面这条命令测试模型是否能正常加载:

.\build\bin\Release\llama-cli-m D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf-p"你好,请简单介绍一下你自己"-n 256

这条命令的含义是:

参数含义
-m指定模型文件路径
-p输入提示词
-n 256最多生成 256 个 Token

如果模型能正常输出中文回答,说明本地环境基本跑通。


🚩 坑 7:-n 256不是 256 个汉字

很多人看到-n 256,会以为模型会输出 256 个字。

其实不是。

-n 256表示最多生成256 个 Token。

Token 是模型处理文本时的最小单位,不等于汉字,也不等于单词。

粗略估算:

中文:1 个汉字 ≈ 1~1.5 个 Token 英文:1 个 Token ≈ 4 个英文字符

所以:

256 个 Token ≈ 170~250 个汉字

这只是粗略估算,实际数量会受标点、英文、数字、代码、特殊符号影响。


五、常用参数整理

日常测试时,可以加上这些参数:

.\build\bin\Release\llama-cli^-m D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf ^-p"你好,请简单介绍一下你自己"^-n 256 ^-c 4096 ^-t 8 ^-b 512 ^--temp 0.7 ^--repeat-penalty 1.1

常用参数含义如下:

参数含义建议
-m模型路径必填
-p提示词单次问答使用
-n最大生成 Token 数测试时可用 256
-c上下文长度32GB 内存先试 4096
-tCPU 线程数根据 CPU 调整,如 8 或 12
-b批处理大小可先试 512
--temp温度0.7 左右较常用
--repeat-penalty重复惩罚减少复读,常用 1.1
-i交互模式支持连续多轮对话
--color彩色输出方便区分输入和输出

如果想进入连续对话模式,可以加-i:

.\build\bin\Release\llama-cli-m D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf-p"你好"-n 256-c 4096-t 8-i--color

🚩 坑 8:上下文-c不要一上来开太大

很多人觉得上下文越大越好,一上来就设置:

-c 8192 -c 16384 -c 32768

但上下文越大,内存占用越高。

32GB 内存跑 21GB 左右的 Q4_K_M 模型时,建议先保守一点:

-c 4096

如果运行稳定,再尝试:

-c 8192

如果电脑明显变卡、内存占用接近满载,就降回来。


🚩 坑 9:生成速度特别慢,可能不是模型问题

如果模型能跑,但速度很慢,常见原因有几个:

  1. 没有调用 GPU
  2. CPU 线程数设置不合理
  3. 上下文太长
  4. 后台程序占用内存过高
  5. llama.cpp 版本太旧,没有适配当前模型架构

可以先做这几件事:

  • 更新显卡驱动
  • 降低上下文长度
  • 减少后台程序
  • 使用最新 llama.cpp
  • 检查是否启用了 GPU 加速

如果有独立显卡或支持加速的核显,可以尝试加:

-ngl 99

表示尽量把模型层交给 GPU 处理。


🚩 坑 10:加载失败不一定是模型坏了

如果运行时报格式错误、版本错误、架构不支持,不要急着怀疑模型文件损坏。

更常见的原因是:

llama.cpp 版本太旧

开源模型更新很快,新模型架构可能需要较新的 llama.cpp 才能支持。

解决方法:

拉取最新代码,重新编译:

git pull cmake-B build cmake--build build--config Release

六、完整踩坑清单

下面是整个过程中最值得注意的坑:

  1. 不要下载 F16 / BF16 大文件版本
  2. 浏览器下载大模型容易中断,建议用断点续传工具
  3. 模型路径不要包含中文、空格、特殊符号
  4. cmake需要单独安装,并加入系统 PATH
  5. 安装完 CMake 后必须重新打开 PowerShell
  6. Windows 编译 llama.cpp 通常需要 Visual Studio Build Tools
  7. -n 256是 256 个 Token,不是 256 个汉字
  8. 32GB 内存不要一上来把上下文开太大
  9. 生成速度慢时,优先检查 GPU 加速和上下文长度
  10. 加载失败时,优先更新 llama.cpp 版本

七、最后总结

在本地搭建大模型,真正难的不是"下载一个模型",而是把下面几件事串起来:

  • 选对模型量化版本
  • 保证文件下载完整
  • 配置好编译环境
  • 使用正确的推理工具
  • 根据内存和硬件调整参数

对于 32GB 内存电脑来说,Qwen3.6-35B-A3B-Q4_K_M.gguf是一个比较合适的起点。

只要避开上面这些坑,本地跑通一个开源大模型并没有想象中那么复杂。

下一步可以继续尝试:

  • 接入图形聊天界面
  • 配置 API 服务
  • 测试长文本总结
  • 测试代码生成
  • 尝试图片理解能力

本地大模型的乐趣就在于:所有数据都在自己电脑上,可以自由调试、自由使用。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询