一、本周概览:开源一周发生了什么
2026 年 8 月第 4 周的开源圈只能用"狂暴"形容。如果只看下载量与基准分数,本周有三个标志性事件:
- Qwen3.8-27B(8/14):27B 稠密 + 多模态 + 262K 上下文,Apache 2.0,发布 48 小时内 HF 下载量破 100 万,社区衍生量化版本超 500 个,被誉为"本地 Opus 4.6"。
- DeepSeek-V4-Pro-0813(8/13 GA,权重 8/12):1.7T MoE + DSpark 推测解码 + 1M 上下文 + MIT 许可证,Artificial Analysis 智能指数从 45 跃升至 53,首次在 Terminal-Bench 上以 87.9 反超 Opus 4.8 的 85.0。
- MiniMax-H3(8/3 但热度延续至今):33B 单流 omni-transformer,原生视频 + 立体声联合生成,ComfyUI 发布当天原生集成,squeeze profile 跑通 8GB 显存。
与此同时,Qwen3.8-Max(2.4T MoE)、Kimi K3(2.8T MoE)、GLM-5.2(智能指数 52.6)和 Meta Muse Glimmer(Apache 2.0 的本地 Agent 30B)也持续在 Trending 榜厮杀。本文按"消费级可跑 → 数据中心旗舰"分层梳理本周值得关注的 6 款模型。
二、六大模型速览
| 模型 | 发布方 | 参数 / 激活 | 许可证 | 上下文 | 智能指数 | 本周关注点 |
|---|---|---|---|---|---|---|
| Qwen3.8-27B | 阿里千问 | 27B Dense | Apache 2.0 | 262K | 52.0 | 消费级显卡本地 Agent |
| DeepSeek-V4-Pro-0813 | DeepSeek | 1.7T / 49B MoE | MIT | 1M | 53.2 | MIT + 反超 Opus 4.8 |
| Qwen3.8-Max | 阿里千问 | 2.4T / 95B MoE | Modified MIT | 1M | 57.7 | 史上最大开源权重 |
| MiniMax-H3 | MiniMax | 33B Dense | 开放权重 | 视频 15s | — | 原生音视频联合生成 |
| GLM-5.2 | 智谱 Z.ai | 745B / 400B MoE | MIT | 1M | 52.6 | 智能指数/价格比最高 |
| Kimi-K3 | 月之暗面 | 2.8T / 104B MoE | 自定义* | 1M | 59.7 | 智能指数周榜冠军 |
*(Kimi K3 许可证非 MIT,采用自定义协议。月活 > 1 亿或年营收 > 2000 万美元的产品需在 UI 展示模型名。)
数据来源:Artificial Analysis 智能指数(2026-08 实时),Hugging Face 模型卡,modelgrep.com 周榜。Qwen3.8-27B 与 DeepSeek-V4-Pro-0813 已在本专栏前几日文章中详细测评,本文聚焦横向决策。
三、横向测评:六维能力雷达
为统一对比口径,下表数据均来自第三方独立评测与厂商官方发布的统一 Harness 复跑结果:
| 评测维度 | Qwen3.8-27B | DeepSeek-V4-Pro | Qwen3.8-Max | MiniMax-H3 | GLM-5.2 | Kimi-K3 |
|---|---|---|---|---|---|---|
| SWE-bench Pro | 61.7% | 53.4% | 67.7% | — | 60.2% | 64.5% |
| Terminal-Bench 2.1 | 73.0 | 87.9 | 80.0 | — | 81.0 | 88.3 |
| DeepSWE 1.1 | 42.2 | 62.7 | 51.0 | — | 46.2 | 67.5 |
| LiveCodeBench | 90.3% | 89.6% | — | — | 93.5% | — |
| HLE(带工具) | — | 60.0% | — | — | 54.7% | 56.0% |
| 本地 24GB 可跑 | ✅ | ❌(需数据中心) | ❌ | ✅(量化) | ❌ | ❌ |
关键解读:
- 代码 Agent:DeepSeek-V4-Pro 以 Terminal-Bench 87.9 / DeepSWE 62.7 首次在"开源可下载"前提下追平甚至反超 Opus 4.8(85.0 / 58.0)。27B 的 Qwen3.8 在 SWE-bench Pro 上反而更优(61.7 vs 53.4)——再一次印证 27B 紧凑尺寸在 Agent 任务上的"性价比拐点"。
- 多模态:Qwen3.8-27B 是 6 款中唯一原生支持图像+视频输入且可在 24GB 显卡运行的模型;MiniMax-H3 独占视频输出赛道。
- 价格 / 智能比:DeepSeek-V4-Pro 输入 $1.32/M 输出 $3.96/M,对比 Opus 4.8($5/$25)约为 1/6 成本。GLM-5.2 的 $0.966/M 输入价 + 52.6 智能指数,是"独立验证"维度的性价比之王。
- 本地部署友好度:本周末档仅 Qwen3.8-27B 与 MiniMax-H3 可在消费级硬件运行。其余 4 款均需 8×H100 / 4×H200 起步。
数据来源:Artificial Analysis、DeepSeek 官方 Harness、阿里千问官方发布、Z.ai 博客、Kimi 官方发布(2026-08 截至)。
四、部署实战:本周两款最值得部署的模型
4.1 Qwen3.8-27B(24GB 显卡首选)
完整的部署细节见 2026-08-22 期《Qwen3.8-27B 量化部署实测》,下方给出最常用的 vLLM 启动 + 调用片段:
bash
# 环境准备 conda create -n qwen38 python=3.10 -y conda activate qwen38 pip install vllm transformers accelerate huggingface-cli download Qwen/Qwen3.8-27B-FP8python
# vLLM 启动(FP8 版本,48GB 显卡可全速跑) # 命令行: # vllm serve Qwen/Qwen3.8-27B-FP8 \ # --served-model-name qwen3.8-27b \ # --tensor-parallel-size 1 \ # --max-model-len 32768 \ # --enable-auto-tool-choice \ # --reasoning-parser qwen3 \ # --port 8000 # 24GB 显卡改用 INT4 GPTQ 版本: # huggingface-cli download Qwen/Qwen3.8-27B-GPTQ-Int4 from openai import OpenAI client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY") resp = client.chat.completions.create( model="qwen3.8-27b", messages=[{"role": "user", "content": "解释 Transformer 中 GQA 与 MQA 的区别"}], extra_body={"reasoning_effort": "medium"}, max_tokens=2048, ) print(resp.choices[0].message.content) print(f"输出 {resp.usage.completion_tokens} tokens")4.2 DeepSeek-V4-Pro-0813(数据中心旗舰 + 推测解码)
DeepSeek-V4-Pro 的部署关键是启用 DSpark 推测解码,吞吐量提升约 2.3–2.7 倍:
bash
# 数据中心部署(4×GB300 节点为官方推荐配置) pip install vllm==0.20.0 # 或更新版本,需支持 DSpark huggingface-cli download deepseek-ai/DeepSeek-V4-Pro-0813 # vLLM 启动(4×GB300 FP4 + DSpark 推测解码) vllm serve deepseek-ai/DeepSeek-V4-Pro-0813 \ --tensor-parallel-size 4 \ --quantization mxfp4 \ --speculative-model deepseek-ai/DeepSeek-V4-Pro-0813 \ --speculative-method dspark \ --num-speculative-tokens 5 \ --max-model-len 1048576 \ --port 8000python
# 三档推理深度控制(low / high / max) from openai import OpenAI client = OpenAI( api_key="sk-xxx", base_url="https://api.deepseek.com/v1" ) # 日常 agent 任务用 high(DeepSeek 推荐档位) resp = client.chat.completions.create( model="deepseek-v4-pro", messages=[{"role": "user", "content": "重构这个 Python 类:..."}], reasoning_effort="high", max_tokens=4096, ) print(resp.choices[0].message.content)关键提醒:DeepSeek-V4-Pro-0813 自 8 月 16 日 16:00 UTC 起执行新价格(peak $1.32/$3.96,off-peak $0.66/$1.98)。如用旧 SDK,注意 cache-hit 价格提升 6 倍以上。
4.3 消费级显存快查表
| 显存 | 可流畅运行的模型 | 推荐部署栈 |
|---|---|---|
| 8–12GB | MiniMax-H3 squeeze profile、Qwen3.8-27B IQ2_XXS | ComfyUI / llama.cpp |
| 16GB | Qwen3.8-27B Q3_K_M | Ollama / llama.cpp |
| 24GB | Qwen3.8-27B Q4_K_M / Q5_K_M、MiniMax-H3 balanced | vLLM / llama.cpp |
| 48GB | Qwen3.8-27B FP8、DeepSeek-V4-Flash-0731 INT4 | vLLM |
| 80GB × 8 | DeepSeek-V4-Pro-0813、Qwen3.8-Max | vLLM + 张量并行 |
| 140GB × 4 | MiniMax-H3 lossless 全常驻 | SGLang + Ulysses |
五、选型决策:一张表选对你的开源模型
按"用得上 + 跑得起"两条硬约束,把读者最常见的 5 类场景压缩成决策表:
| 你的场景 | 首选 | 次选 | 关键参数 |
|---|---|---|---|
| 本地编程助手 / Claude Code 替代 | Qwen3.8-27B(Apache 2.0) | DeepSeek V4-Flash-0731(MIT,48GB) | INT4 + 24GB + vLLM |
| 长周期 Agent / 自主研发 | DeepSeek-V4-Pro-0813(MIT) | Qwen3.8-Max(Modified MIT) | DSpark + data center |
| 消费级本地视频/音视频生成 | MiniMax-H3 | — | ComfyUI + INT8 |
| 中文长文档分析 / 100 万字上下文 | Qwen3.8-Max / Kimi K3 | DeepSeek-V4-Pro | 1M context + 32K 显存/层 |
| 隐私敏感企业内部 Agent | Qwen3.8-27B(Apache 2.0) | GLM-5.2(MIT,国产合规) | 私有化部署 + 微调 |
策略建议:
- 预算无上限、要 frontier:DSpark 启用的 DeepSeek-V4-Pro-0813,MIT 协议商用零障碍。
- 单张 4090 / 5090 起步:Qwen3.8-27B INT4/Squeeze profile 是唯一甜点。
- 要视频 + 音轨联合输出:MiniMax-H3 是当前唯一开源方案,ComfyUI 路线最稳。
- 要 Apache 2.0 + 长上下文:Qwen 家族独占,仅 Qwen3.8-27B 与 Qwen3.6-35B-A3B 满足。
- 要中文 + 价格敏感:GLM-5.2 输入 $0.966/M + 52.6 智能指数,独立验证维度的中国版"性价比之王"。
六、本周趋势观察与下周展望
6.1 三个值得留意的趋势
- MIT 许可证成新默认:本周发布的 DeepSeek-V4-Pro-0813、Muse Glimmer、GLM-5.2 全部采用 MIT 或 Apache 2.0,仅 Kimi K3 保留自定义许可。宽松协议从"差异化卖点"变成"准入门槛"。
- 推测解码下沉到旗舰:DSpark 内置到模型权重中,意味着无需训练 draft model 即可启用推测解码,吞吐量提升 2–3 倍。
- Agent Harness 开源化:DeepSeek V4-Pro Harness v0.1 同 MIT 开源,宣告"模型 + 运行环境 + 评测框架"三位一体的开源策略进入主流。
6.2 下周展望
| 日期 | 计划主题 | 预期看点 |
|---|---|---|
| 8/24(周一) | 通用大模型:GLM-5.3 深度评测 | 智谱 Z.ai 8 月新版本预测 |
| 8/25(周二) | 多模态:Muse Spark 1.2 开源版 | Meta 旗舰 LLM 首次开源 |
| 8/26(周三) | 推理优化工具:DSpark 工程实践 | DeepSeek 推测解码全链路 |
| 8/27(周四) | 领域专用:Code专用模型横评 | Qwen3.8-Coder / DeepSeek-Coder |
| 8/28(周五) | 新发布:周末前 24h 速报 | Trending Top 10 |
| 8/29(周六) | 量化方案:NVFP4 实战 | RTX 5090 / Blackwell 路径 |
七、互动话题
本周你下载了哪款开源大模型?Qwen3.8-27B、DeepSeek-V4-Pro 还是 MiniMax-H3?欢迎在评论区聊聊你的硬件配置 + 跑分结果,我们一起拼一张"消费级显卡大模型跑分图"!
下篇预告:明日(周一)将发布《GLM-5.3 通用大模型深度评测》,敬请关注。
数据声明:本文性能数据来源标注如下——智能指数来自 Artificial Analysis(2026-08 实时榜);DeepSeek-V4-Pro 基准来自 DeepSeek Harness v0.1 官方统一评测;Qwen3.8-27B 基准来自千问官方发布(Claude Code Harness);MiniMax-H3 部署数据来自 ComfyUI 社区实测(已多源交叉验证)。价格数据来自各厂商官方价目表(截至 2026-08-23)。未经标注"实测"的数据均为引用,仅供参考。