Qwen3.8-27B-Uncensored-GGUF 小白完整指南:选文件、部署、提速一篇讲完
2026/8/27 16:51:47 网站建设 项目流程

Qwen3.8-27B-Uncensored-GGUF 小白完整指南:选文件、部署、提速一篇讲完

【免费下载链接】Qwen3.8-27B-Uncensored-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/JonathanColetti/Qwen3.8-27B-Uncensored-GGUF

Qwen3.8-27B-Uncensored-GGUF 是社区基于 Qwen3.8-27B 做「去审查」后量化成 GGUF 格式的模型,保留 MTP 头、支持投机解码提速。读完这篇,你能选对文件、一次跑通。

去审查改了 Qwen3.8-27B 什么

  • 底模 Qwen3.8-27B(64 层,上下文 262144),用 Heretic 从权重里擦掉「拒绝方向」:不微调、不加训练数据,bf16 处理完再量化。
  • 拒绝率:100 条有害提示里,从拒 98 条降到12条。
  • KL 散度——可以理解成「和原版差多远」的代理指标——只有0.1191;200 次搜索里选的是帕累托前沿上的一个点,完整数据在 heretic-study 目录。
  • 能力几乎无损:4 项基准均分只掉 0.5 分、都在误差内;4bit 量化 PPL(困惑度,越低生成越自然)约 7.18,与同级正常水平相当,其余细节见仓库。
指标原版 Qwen3.8-27B本仓库版本
拒绝率(100 条有害提示)98/10012/100
首 token KL 散度00.1191

⚠️ 拒绝行为是「大幅减少」而非消除,更不是没有护栏;靠近原拒绝边界的行为比底模更不稳定,请遵守当地法律使用。

按你的显存选 Qwen3.8-27B-Uncensored-GGUF 文件

场景一:单文件一键跑(多数人)

Fused 文件把 MTP(多 token 预测头,模型自带的「草稿猜测器」)内置,一个文件就是主模型加草稿。默认选 Q4_K_M(16.8 GB),速度、体积、PPL 三者最均衡;24G 显存以上可以直接上 Q6_K(22.4 GB)或 Q8_0(29.0 GB)追质量。

场景二:两文件分离(运行时要显式挂草稿)

如果你的 llama.cpp 只认--model-draft显式指定,就用 noMTP-Q4_K_M(16.5 GB)加 draft-Q8_0(3.2 GB),合计约 19.7 GB。

场景三:要喂图片

主模型之外再加载 vision-f16(0.9 GB)即可;f16 与 bf16 两个视觉文件是同一套 334 个投影张量,任选一个。

主文件体积(文件名规则:融合版Qwen3.8-27B-Uncensored-<档位>.gguf,分离版加noMTP-前缀):

档位单文件版体积(内置 MTP)分离版体积(noMTP)
IQ2_M10.6 GB10.2 GB
IQ4_XS15.3 GB15.1 GB
Q4_K_M16.8 GB16.5 GB
Q5_K_M19.5 GB19.2 GB
Q6_K22.4 GB22.1 GB
Q8_029.0 GB28.6 GB

草稿与视觉文件:

用途文件体积
投机解码草稿(默认,已实测)draft-Q8_03.2 GB
投机解码草稿(省 1.5 GB,接受率未测)draft-Q4_01.7 GB
视觉投影(图片输入)vision-f16 / vision-bf160.9 GB

草稿默认保持 Q8_0:它本来就小,压狠了省不了多少磁盘,却会明显拉低草稿接受率。

llama.cpp 部署命令:一分钟跑起来,白拿提速

先说一句人话:投机解码 = 草稿先猜、主模型验证,猜对的直接收下,所以更快且不损质量。克隆仓库后:

git clone https://gitcode.com/hf_mirrors/JonathanColetti/Qwen3.8-27B-Uncensored-GGUF

融合版一键启动:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf \ --spec-type draft-mtp --spec-draft-n-max 1 \ -ngl 99 -c 8192

-ngl 99是全部层放显卡,-c 8192开 8k 上下文;--spec-draft-n-max 1是实测表里提速最高的取值,默认的 3 反而更慢。

分离版把草稿文件显式挂上即可:

llama-server -m Qwen3.8-27B-Uncensored-noMTP-Q4_K_M.gguf \ --spec-type draft-mtp \ --model-draft Qwen3.8-27B-Uncensored-draft-Q8_0.gguf \ -ngl 99 -c 8192

实测提速(相对无草稿基线,tok/s):

场景无草稿 tok/sn_max=1 tok/s相对基线
prose74.889.01.19x
code74.795.41.28x
chat74.790.61.21x

结论:直接写--spec-draft-n-max 1,最高1.28x提速;n_max 加大只会更慢(n_max=5 时全部跌破 1x)。

避坑清单与三档速查

  • MTP 投机解码需要 llama.cpp PR #22673 之后的构建;旧版本能加载模型但会静默忽略 MTP 张量,只是没加速。
  • 评估行为(拒绝率、稳定性)请用 Q6_K 或 Q8_0;IQ2_M/IQ4_XS 行为更不稳定,且 IQ2_M 的 PPL(7.86)明显高于其余档位的 7.15~7.18。
  • 12/100 的拒绝率是在非思考模式下测的,开思考模式表现可能不同;100 条提示也只覆盖那一种有害请求分布。
  • 本模型定位本地推理实验;若要对外提供服务,请自行叠加安全层。

三档速查:默认选融合版 Q4_K_M(16.8 GB);质量选融合版 Q8_0(29.0 GB);显存紧选融合版 IQ4_XS(15.3 GB),极限还有 IQ2_M(10.6 GB)。

【免费下载链接】Qwen3.8-27B-Uncensored-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/JonathanColetti/Qwen3.8-27B-Uncensored-GGUF

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询