Qwen3.6-35B无审查模型本地部署指南:11个GGUF量化版本怎么选、怎么跑
【免费下载链接】Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive项目地址: https://ai.gitcode.com/hf_mirrors/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
如果你是第一次接触 Qwen3.6-35B 无审查模型(即Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive),克隆仓库后十有八九会愣在文件列表前:11 个从 11GB 到 44GB 不等的 GGUF 文件并排躺着,旁边还有个 899MB 的 mmproj。😅 全下?硬盘告急。乱挑一个?又怕显存爆掉。这篇文章就围绕"怎么选、怎么跑、怎么调"讲透,照着操作,跑通验证流程只需几条命令。
它凭什么敢叫"无审查"
先回答最基础的问题:这个模型到底"解除"了什么?官方测试数据是0/465 次拒绝,也就是连续 465 个请求里没有一个被安全策略拦下来。而且它没有改动原模型的任何能力——35B 总参数、262K 原生上下文、多模态理解全部保留,只是移除了"拒绝生成"的机制。
Aggressive 后缀值得多说一句:它是更强的解锁变体,理论上完全不拒绝提示词,但偶尔会附带一句简短免责声明。这不是拒绝,而是基础模型训练时刻进去的习惯性输出,正文内容照样完整给出。
一句话理解 MoE 架构:这个 35B 参数的模型有 256 个专家,每个 token 只激活 8 个,单次计算实际只动用约 3B 参数。所以 21GB 的 Q4_K_M 跑起来并不慢,这正是"大模型也能本地跑"的核心原因。
11 个版本,其实是同一个模型的"画质档位"
这些文件本质是同一模型的不同压缩率:压得越狠(如 IQ2_M),文件越小、显存门槛越低,但输出质量打折扣;压得越轻(如 Q8_K_P),越接近原始精度,代价是 44GB 的体积。
这里要认识 HauhauCS 的招牌技术K_P 量化。普通量化一刀切压缩所有权重,K_P 先对每个模型做特化分析,把保真预算花在质量最敏感的权重上,效果相当于白捡 1~2 个量化档位,文件只比基础量化大 5%~15%,且完全兼容 llama.cpp、LM Studio 等任何 GGUF 运行时。🎁
| 量化文件 | 体积 | 内存参考 | 适合谁 |
|---|---|---|---|
| Q8_K_P | 44GB | 48GB+ | 专业研究、极限质量 |
| Q6_K_P | 31GB | 32GB | 高质量应用开发 |
| Q5_K_P | 28GB | 24GB+ | 质量与体积均衡 |
| Q4_K_P | 23GB | 16GB+ | 主流显卡推荐档位 |
| Q4_K_M | 21GB | 16GB+ | 性价比之选 |
| IQ4_NL / IQ4_XS | 20GB / 19GB | 12~16GB | 资源有限的机器 |
| IQ3_M / Q2_K_P | 15GB | 12GB 左右 | 入门级 GPU |
| IQ2_M | 11GB | 8~12GB | 老显卡兜底、CPU 尝鲜 |
给个不走弯路的建议:拿不准就选 Q4_K_P,质量、体积、速度三者最均衡;显存紧张退到 IQ4_XS;如果只是先跑通流程,用 IQ3_M 也够,跑通后再换大档位。
把模型跑起来,就三步
第一步,拉取仓库(所有量化版本和 mmproj 都在里面):
git clone https://gitcode.com/hf_mirrors/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive第二步,确认本机装好 llama.cpp(或 LM Studio、koboldcpp 等 GGUF 兼容运行时)。
第三步,执行这条命令:
llama-cli -m Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf \ --mmproj mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \ --jinja -c 131072 -ngl 99别稀里糊涂复制,先看懂几个关键参数:
--mmproj:挂载视觉投影文件。模型原生支持图像/视频理解,主 GGUF 和 mmproj 必须一起加载,否则视觉能力会静默失效;--jinja:让 llama.cpp 正确套用聊天模板,缺失时对话格式会错乱;-c 131072:保持 128K 上下文,官方明确提示低于 128K 会削弱思考能力;-ngl 99:尽可能把层搬进 GPU,显存不够时调小即可。
跑通后随手验证一下:让它写一段小故事,你会看到它直接给出完整正文,而不是一句"抱歉,我无法生成此类内容"——这正是无审查模型和普通模型最直观的区别。
参数调优:两套模式,两套参数
这个模型支持"思考"与"非思考"两种模式,官方推荐的参数差异不小,用错组合输出风格会明显跑偏:
| 场景 | temperature | top_p | top_k | presence_penalty |
|---|---|---|---|---|
| 思考·通用对话 | 1.0 | 0.95 | 20 | 1.5 |
| 思考·编程/精确任务 | 0.6 | 0.95 | 20 | 0 |
| 非思考·创意写作 | 0.7 | 0.8 | 20 | 1.5 |
| 非思考·逻辑推理 | 1.0 | 1.0 | 40 | 2.0 |
实用技巧:写代码、做数学题把 temperature 压到 0.6 左右,输出更"稳";创意写作时把 presence_penalty 提到 1.5,模型会少些自我重复,长篇内容更耐看。
三个新手必踩的坑,提前避雷
坑 1:LM Studio 里量化列显示"?"。这是 K_P 的显示识别问题,不是文件损坏,模型照常加载运行,不用管。
坑 2:Hugging Face 页面显示的文件比实际少。官方硬件兼容组件不识别 K_P 命名,会隐藏部分文件,去 "Files and versions" 才能看到全部 12 个文件。
坑 3:视觉功能毫无反应。十有八九是没加载 mmproj 或漏了--jinja,回查命令行即可。
最后提醒一句:模型不设限,不代表使用可以不设限。生成内容前请自行把关,遵守所在地的法律法规和基本伦理。
下一步
动手顺序建议:先看显卡显存和系统内存 → 对照表格挑一个档位 → 下载对应文件 → 用上面的命令跑通 → 再按场景微调参数。跑顺之后,可以试试 262K 超长上下文的文档处理,或给--image参数丢一张图,体验多模态的完整形态。
选择困难不丢人,丢人的是硬盘塞满 11 个模型却不知道哪个能跑。现在,从 Q4_K_P 开始吧。🎯
【免费下载链接】Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive项目地址: https://ai.gitcode.com/hf_mirrors/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考