Qwen3.6-35B无审查模型本地部署指南:11个GGUF量化版本怎么选、怎么跑
2026/8/15 16:06:02 网站建设 项目流程

Qwen3.6-35B无审查模型本地部署指南:11个GGUF量化版本怎么选、怎么跑

【免费下载链接】Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive项目地址: https://ai.gitcode.com/hf_mirrors/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive

如果你是第一次接触 Qwen3.6-35B 无审查模型(即Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive),克隆仓库后十有八九会愣在文件列表前:11 个从 11GB 到 44GB 不等的 GGUF 文件并排躺着,旁边还有个 899MB 的 mmproj。😅 全下?硬盘告急。乱挑一个?又怕显存爆掉。这篇文章就围绕"怎么选、怎么跑、怎么调"讲透,照着操作,跑通验证流程只需几条命令。

它凭什么敢叫"无审查"

先回答最基础的问题:这个模型到底"解除"了什么?官方测试数据是0/465 次拒绝,也就是连续 465 个请求里没有一个被安全策略拦下来。而且它没有改动原模型的任何能力——35B 总参数、262K 原生上下文、多模态理解全部保留,只是移除了"拒绝生成"的机制。

Aggressive 后缀值得多说一句:它是更强的解锁变体,理论上完全不拒绝提示词,但偶尔会附带一句简短免责声明。这不是拒绝,而是基础模型训练时刻进去的习惯性输出,正文内容照样完整给出。

一句话理解 MoE 架构:这个 35B 参数的模型有 256 个专家,每个 token 只激活 8 个,单次计算实际只动用约 3B 参数。所以 21GB 的 Q4_K_M 跑起来并不慢,这正是"大模型也能本地跑"的核心原因。

11 个版本,其实是同一个模型的"画质档位"

这些文件本质是同一模型的不同压缩率:压得越狠(如 IQ2_M),文件越小、显存门槛越低,但输出质量打折扣;压得越轻(如 Q8_K_P),越接近原始精度,代价是 44GB 的体积。

这里要认识 HauhauCS 的招牌技术K_P 量化。普通量化一刀切压缩所有权重,K_P 先对每个模型做特化分析,把保真预算花在质量最敏感的权重上,效果相当于白捡 1~2 个量化档位,文件只比基础量化大 5%~15%,且完全兼容 llama.cpp、LM Studio 等任何 GGUF 运行时。🎁

量化文件体积内存参考适合谁
Q8_K_P44GB48GB+专业研究、极限质量
Q6_K_P31GB32GB高质量应用开发
Q5_K_P28GB24GB+质量与体积均衡
Q4_K_P23GB16GB+主流显卡推荐档位
Q4_K_M21GB16GB+性价比之选
IQ4_NL / IQ4_XS20GB / 19GB12~16GB资源有限的机器
IQ3_M / Q2_K_P15GB12GB 左右入门级 GPU
IQ2_M11GB8~12GB老显卡兜底、CPU 尝鲜

给个不走弯路的建议:拿不准就选 Q4_K_P,质量、体积、速度三者最均衡;显存紧张退到 IQ4_XS;如果只是先跑通流程,用 IQ3_M 也够,跑通后再换大档位。

把模型跑起来,就三步

第一步,拉取仓库(所有量化版本和 mmproj 都在里面):

git clone https://gitcode.com/hf_mirrors/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive

第二步,确认本机装好 llama.cpp(或 LM Studio、koboldcpp 等 GGUF 兼容运行时)。

第三步,执行这条命令:

llama-cli -m Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf \ --mmproj mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \ --jinja -c 131072 -ngl 99

别稀里糊涂复制,先看懂几个关键参数:

  • --mmproj:挂载视觉投影文件。模型原生支持图像/视频理解,主 GGUF 和 mmproj 必须一起加载,否则视觉能力会静默失效;
  • --jinja:让 llama.cpp 正确套用聊天模板,缺失时对话格式会错乱;
  • -c 131072:保持 128K 上下文,官方明确提示低于 128K 会削弱思考能力;
  • -ngl 99:尽可能把层搬进 GPU,显存不够时调小即可。

跑通后随手验证一下:让它写一段小故事,你会看到它直接给出完整正文,而不是一句"抱歉,我无法生成此类内容"——这正是无审查模型和普通模型最直观的区别。

参数调优:两套模式,两套参数

这个模型支持"思考"与"非思考"两种模式,官方推荐的参数差异不小,用错组合输出风格会明显跑偏:

场景temperaturetop_ptop_kpresence_penalty
思考·通用对话1.00.95201.5
思考·编程/精确任务0.60.95200
非思考·创意写作0.70.8201.5
非思考·逻辑推理1.01.0402.0

实用技巧:写代码、做数学题把 temperature 压到 0.6 左右,输出更"稳";创意写作时把 presence_penalty 提到 1.5,模型会少些自我重复,长篇内容更耐看。

三个新手必踩的坑,提前避雷

坑 1:LM Studio 里量化列显示"?"。这是 K_P 的显示识别问题,不是文件损坏,模型照常加载运行,不用管。

坑 2:Hugging Face 页面显示的文件比实际少。官方硬件兼容组件不识别 K_P 命名,会隐藏部分文件,去 "Files and versions" 才能看到全部 12 个文件。

坑 3:视觉功能毫无反应。十有八九是没加载 mmproj 或漏了--jinja,回查命令行即可。

最后提醒一句:模型不设限,不代表使用可以不设限。生成内容前请自行把关,遵守所在地的法律法规和基本伦理。

下一步

动手顺序建议:先看显卡显存和系统内存 → 对照表格挑一个档位 → 下载对应文件 → 用上面的命令跑通 → 再按场景微调参数。跑顺之后,可以试试 262K 超长上下文的文档处理,或给--image参数丢一张图,体验多模态的完整形态。

选择困难不丢人,丢人的是硬盘塞满 11 个模型却不知道哪个能跑。现在,从 Q4_K_P 开始吧。🎯

【免费下载链接】Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive项目地址: https://ai.gitcode.com/hf_mirrors/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询