一、模型速览
Hy4 preview 是腾讯混元团队(首席 AI 科学家姚顺雨带队)2026 年 8 月 28 日开源的新一代 MoE 旗舰,距 Hy3 GA 仅约八周,也是首个官方称"参与了自身训练与推理基础设施优化"的混元模型。
项目 | 规格 |
发布方 | 腾讯混元(首席 AI 科学家姚顺雨团队) |
总 / 激活参数 | 770B / 49B(每 token 激活约 6.4%) |
上下文 | 1,048,576 tokens(原生 1M) |
许可证 | Apache 2.0(可商用,无营收门槛) |
模态 | 纯文本(开源权重 text-only,未见官方视觉/音频变体,待验证) |
架构 | MoE,78 层;256 路由专家 + 1 共享专家,top-8 激活 |
定位 | 数据中心级生产力旗舰,面向长上下文 coding / 办公 / 科研 |
一句话定位:一款需要 8 卡数据中心才能自部署、但 API 价格却比 GLM/Kimi 便宜的 1M 上下文开源 MoE 旗舰。
二、核心亮点
1. Gated DSA + IndexCache,1M 上下文的稀疏注意力
注意力采用 Gated DeepSeek Sparse Attention(Gated DSA),配跨层稀疏索引复用(IndexCache)与 4 条 iHC 残差流。这让 1M 上下文在显存与计算上可控,而非简单堆全注意力。
2. 原生 MTP 草稿层,投机解码提速
模型自带 10B 总参 / 0.7B 激活的 MTP 层,用于投机解码。配合 vLLM / SGLang 的 MTP 配置,可在不损分布的前提下提升吞吐。
3. "帮自己优化"的递归自改进闭环
Tencent 称 Hy4 参与了自身训练方法、数据策略、评估与底层算子优化,并自主分析推理瓶颈、做算子融合与通信优化,端到端吞吐较基线提升31.8%(内部结果)。这是官方重点强调的差异化故事。
4. 内部盲测小胜 GLM-5.3 与 Kimi K3
163 名专家对 203 个工程任务的盲测:Hy4 preview2.99/4,GLM-5.3 2.92(46.8% 胜 / 12.8% 平 / 40.4% 负),Kimi K3 2.94(51.2% 胜 / 7.9% 平 / 40.9% 负)。注意差距不到 0.1 分,胜率接近抛硬币——官方自述"略胜"。
三、部署
3.1 硬件现实:这不是消费级模型
版本 | 权重体积 | 最低硬件 |
BF16 | ~1,848 GB | 16×B200 或 8×B300 |
MXFP8 | ~924 GB | 8×B200/B300(tensor-parallel 8) |
Q4(社区) | ~450–512 GB | 512GB+ 内存,性能受限 |
⚠️ 避坑提醒:单张 8×H100 节点(640GB)装不下FP8 版。官方 recipe 最低 16×B200 或 8×B300。对绝大多数团队,用云 API 比自建 GPU 集群划算得多。
3.2 自部署:vLLM / SGLang(官方镜像)
官方提供预构建镜像,8 卡 FP8 启动:
```bash # vLLM(官方镜像 vllm/vllm-openai:hy4-preview) docker run --gpus all -p 8000:8000 --ipc=host \ -v ~/.cache/huggingface:/root/.cache/huggingface \ vllm/vllm-openai:hy4-preview \ tencent/Hy4-preview-FP8 \ --tensor-parallel-size 8 \ --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' \ --attention-backend FLASHMLA_SPARSE \ --tool-call-parser hy_v4 --reasoning-parser hy_v4 \ --enable-auto-tool-choice --port 8000 \ --served-model-name hy4-preview ```# SGLang(官方镜像 lmsysorg/sglang:hy4-preview,支持 x86 / Arm) docker run --gpus all --ipc=host -p 8000:8000 \ lmsysorg/sglang:hy4-preview \ python3 -m sglang.launch_server \ --model tencent/Hy4-preview-FP8 --tp-size 8 \ --reasoning-parser auto --tool-call-parser auto \ --speculative-algorithm NEXTN --speculative-num-steps 3 \ --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 \ --port 8000 --served-model-name hy4-preview3.3 调用服务(OpenAI 兼容)
from openai import OpenAI client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="EMPTY") resp = client.chat.completions.create( model="hy4-preview", messages=[{"role": "user", "content": "用 FastAPI 写一个带鉴权的文件上传接口。"}], temperature=0.9, top_p=1.0, ) print(resp.choices[0].message.content)默认开启深度推理(high)。简单任务想直接拿答案,在extra_body加{"chat_template_kwargs": {"reasoning_effort": "no_think"}}。
3.4 没 8 卡?走 API(大多数团队的路径)
通过腾讯云 TokenHub 或 OpenRouter 调用,模型 IDhy4-preview(OpenRouter:tencent/hy4-preview)。OpenRouter 带零数据留存策略。WorkBuddy / CodeBuddy 发布后两周限时免费。
# OpenRouter 调用示例(curl) curl https://openrouter.ai/api/v1/chat/completions \ -H "Authorization: Bearer $OPENROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"tencent/hy4-preview","messages":[{"role":"user","content":"Hello"}],"max_tokens":512}'四、性能测评
4.1 速度与成本(官方 / 社区)
指标 | 数值 | 来源 |
自部署吞吐提升 | +31.8%(端到端,vs 基线) | 腾讯内部(非独立复测) |
OpenRouter P50 延迟 | 2.75s;约 38 tok/s | OpenRouter 实测(freeai.help) |
API 输入价 | $0.834 / 百万 token | 腾讯云 / OpenRouter |
API 输出价 | $2.501 / 百万 token | 腾讯云 / OpenRouter |
缓存命中价 | $0.042 / 百万 token | 腾讯云 / OpenRouter |
国内价 | ¥6 输入 / ¥18 输出 / ¥0.3 缓存命中 | 腾讯云 |
注:自部署吞吐与延迟均为官方/平台数据,未在本文独立复测。
4.2 生成质量(引用官方 model card,最高推理档)
工程 / Agent(主战场):SWE-bench Pro65.7(Hy3 57.9)、Terminal-Bench 2.185.4(Hy3 70.8)、DeepSWE64.3、Toolathlon-Verified74.1、MCP-Atlas83.7、SWE-bench Multilingual82.9。
推理 / 通用:GPQA Diamond92.3、HLE(no-tools)43.4、MathArena Apex 202574.2。
局限:在 SWE-Marathon(31.9 vs Opus 5 的 50.0)、ProgramBench(17.5 vs 39.5)上明显落后于 Claude Opus 5。
4.3 同档模型对比表
维度 | Hy4 preview | GLM-5.3 | Kimi K3 | DeepSeek V4 Flash |
总参/激活 | 770B/49B | 未披露 | 2.8T/104B | 284B/13B |
上下文 | 1M | N/A | 1M | 1M |
专家盲测 | 2.99 | 2.92 | 2.94 | — |
SWE-bench Pro | 65.7 | 未披露 | 未披露 | 未披露 |
Terminal-Bench 2.1 | 85.4 | — | — | — |
API 输出价 $/M | 2.501 | 4.40 | 15.00 | 0.66 |
自部署门槛 | 8×B300 | 待验证 | 数据中心级 | 待验证 |
结论:Hy4 preview 在旗舰开源里 API 价格相对便宜(缓存命中0.042/M 极低),工程类基准与 GLM-5.3、Kimi K3 大致持平;但相比 DeepSeek V4 Flash(输出0.66/M)贵约 4 倍,且自部署硬件门槛远超消费级。预算敏感的高频简单任务,Flash 更经济。
五、使用建议
适用场景
- 企业级长上下文代码库分析、跨文件重构、多文件综合;
- 长周期 Agent 任务,需要强规划与工具调用;
- 办公分析:跨文档协作、金融建模、报表生成;
- 科研:分子动力学、凝聚态物理、基础数学(见官方几何/量子输运案例);
- 需 Apache 2.0 无限制条款的商用项目。
不适用场景
- 需要多模态/视觉输入(当前开源权重为纯文本)——待验证是否有视觉变体;
- 个人本地部署(硬件门槛远超消费级);
- 对延迟极敏感(默认深度推理 + 过度验证,交付偏慢);
- 预算有限的高频简单任务 → 选 DeepSeek V4 Flash / GLM-5.3-Flash。
调优提示
- 关深度推理:简单任务传
reasoning_effort: no_think,交付时长明显下降;
- 吃缓存红利:反复读同一长上下文(代码库/长文档)的工作负载,缓存命中 $0.042/M 是真省钱点;
- 自部署用 FP8 + MTP:tensor-parallel 8,开投机解码;用 AngelSlim 做进一步压缩;
- 成本预期:Hy4 比 Hy3 贵约 5–6 倍,老 Hy3 用户需重新算账。
你会为了 1M 上下文和工程能力,接受 Hy4 preview 比 Hy3 贵 5–6 倍、且基本只能走 API 的现实吗?还是更倾向本地能跑的小模型?
数据来源说明:本文数据来自腾讯混元官方发布、Hugging Face model card(tencent/Hy4-preview)、vLLM/SGLang 官方 recipe、OpenRouter 定价页,以及 miraflow / letsdatascience / brocker / labindex / eesel.ai / freeai.help 等第三方分析。基准多为厂商发布值,自部署吞吐为内部结果未独立复测;以独立第三方评测为准。关于"多模态":部分早期报道称 Hy4 多模态,但官方 model card 与 recipe 均为 text-only,本文以官方为准并标注待验证。
往期回顾:
- Apodex-1.1-mini 部署实测:Int4 量化 18GB 单卡跑通 Agent Team,35B 开源逼近 1T Kimi
- Qwen3.8-27B GSQ-RCO 量化部署实测:9.3GB 跑出超 BF16 精度,消费级显卡落地 27B 多模态
- SenseNova U1.5 Lite 部署实测:8B 单卡跑通 4K 生图,Apache 2.0 免费商用