Qwen3.8-27B-Uncensored-GGUF 小白完整指南:选文件、部署、提速一篇讲完
【免费下载链接】Qwen3.8-27B-Uncensored-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/JonathanColetti/Qwen3.8-27B-Uncensored-GGUF
Qwen3.8-27B-Uncensored-GGUF 是社区基于 Qwen3.8-27B 做「去审查」后量化成 GGUF 格式的模型,保留 MTP 头、支持投机解码提速。读完这篇,你能选对文件、一次跑通。
去审查改了 Qwen3.8-27B 什么
- 底模 Qwen3.8-27B(64 层,上下文 262144),用 Heretic 从权重里擦掉「拒绝方向」:不微调、不加训练数据,bf16 处理完再量化。
- 拒绝率:100 条有害提示里,从拒 98 条降到12条。
- KL 散度——可以理解成「和原版差多远」的代理指标——只有0.1191;200 次搜索里选的是帕累托前沿上的一个点,完整数据在 heretic-study 目录。
- 能力几乎无损:4 项基准均分只掉 0.5 分、都在误差内;4bit 量化 PPL(困惑度,越低生成越自然)约 7.18,与同级正常水平相当,其余细节见仓库。
| 指标 | 原版 Qwen3.8-27B | 本仓库版本 |
|---|---|---|
| 拒绝率(100 条有害提示) | 98/100 | 12/100 |
| 首 token KL 散度 | 0 | 0.1191 |
⚠️ 拒绝行为是「大幅减少」而非消除,更不是没有护栏;靠近原拒绝边界的行为比底模更不稳定,请遵守当地法律使用。
按你的显存选 Qwen3.8-27B-Uncensored-GGUF 文件
场景一:单文件一键跑(多数人)
Fused 文件把 MTP(多 token 预测头,模型自带的「草稿猜测器」)内置,一个文件就是主模型加草稿。默认选 Q4_K_M(16.8 GB),速度、体积、PPL 三者最均衡;24G 显存以上可以直接上 Q6_K(22.4 GB)或 Q8_0(29.0 GB)追质量。
场景二:两文件分离(运行时要显式挂草稿)
如果你的 llama.cpp 只认--model-draft显式指定,就用 noMTP-Q4_K_M(16.5 GB)加 draft-Q8_0(3.2 GB),合计约 19.7 GB。
场景三:要喂图片
主模型之外再加载 vision-f16(0.9 GB)即可;f16 与 bf16 两个视觉文件是同一套 334 个投影张量,任选一个。
主文件体积(文件名规则:融合版Qwen3.8-27B-Uncensored-<档位>.gguf,分离版加noMTP-前缀):
| 档位 | 单文件版体积(内置 MTP) | 分离版体积(noMTP) |
|---|---|---|
| IQ2_M | 10.6 GB | 10.2 GB |
| IQ4_XS | 15.3 GB | 15.1 GB |
| Q4_K_M | 16.8 GB | 16.5 GB |
| Q5_K_M | 19.5 GB | 19.2 GB |
| Q6_K | 22.4 GB | 22.1 GB |
| Q8_0 | 29.0 GB | 28.6 GB |
草稿与视觉文件:
| 用途 | 文件 | 体积 |
|---|---|---|
| 投机解码草稿(默认,已实测) | draft-Q8_0 | 3.2 GB |
| 投机解码草稿(省 1.5 GB,接受率未测) | draft-Q4_0 | 1.7 GB |
| 视觉投影(图片输入) | vision-f16 / vision-bf16 | 0.9 GB |
草稿默认保持 Q8_0:它本来就小,压狠了省不了多少磁盘,却会明显拉低草稿接受率。
llama.cpp 部署命令:一分钟跑起来,白拿提速
先说一句人话:投机解码 = 草稿先猜、主模型验证,猜对的直接收下,所以更快且不损质量。克隆仓库后:
git clone https://gitcode.com/hf_mirrors/JonathanColetti/Qwen3.8-27B-Uncensored-GGUF融合版一键启动:
llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf \ --spec-type draft-mtp --spec-draft-n-max 1 \ -ngl 99 -c 8192-ngl 99是全部层放显卡,-c 8192开 8k 上下文;--spec-draft-n-max 1是实测表里提速最高的取值,默认的 3 反而更慢。
分离版把草稿文件显式挂上即可:
llama-server -m Qwen3.8-27B-Uncensored-noMTP-Q4_K_M.gguf \ --spec-type draft-mtp \ --model-draft Qwen3.8-27B-Uncensored-draft-Q8_0.gguf \ -ngl 99 -c 8192实测提速(相对无草稿基线,tok/s):
| 场景 | 无草稿 tok/s | n_max=1 tok/s | 相对基线 |
|---|---|---|---|
| prose | 74.8 | 89.0 | 1.19x |
| code | 74.7 | 95.4 | 1.28x |
| chat | 74.7 | 90.6 | 1.21x |
结论:直接写--spec-draft-n-max 1,最高1.28x提速;n_max 加大只会更慢(n_max=5 时全部跌破 1x)。
避坑清单与三档速查
- MTP 投机解码需要 llama.cpp PR #22673 之后的构建;旧版本能加载模型但会静默忽略 MTP 张量,只是没加速。
- 评估行为(拒绝率、稳定性)请用 Q6_K 或 Q8_0;IQ2_M/IQ4_XS 行为更不稳定,且 IQ2_M 的 PPL(7.86)明显高于其余档位的 7.15~7.18。
- 12/100 的拒绝率是在非思考模式下测的,开思考模式表现可能不同;100 条提示也只覆盖那一种有害请求分布。
- 本模型定位本地推理实验;若要对外提供服务,请自行叠加安全层。
三档速查:默认选融合版 Q4_K_M(16.8 GB);质量选融合版 Q8_0(29.0 GB);显存紧选融合版 IQ4_XS(15.3 GB),极限还有 IQ2_M(10.6 GB)。
【免费下载链接】Qwen3.8-27B-Uncensored-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/JonathanColetti/Qwen3.8-27B-Uncensored-GGUF
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考