腾讯混元 Hy4 preview 实测:770B MoE 扛 1M 上下文,盲测 2.99 压过 GLM/Kimi,自部署却要 8×B300
2026/9/3 10:54:28 网站建设 项目流程

一、模型速览

Hy4 preview 是腾讯混元团队(首席 AI 科学家姚顺雨带队)2026 年 8 月 28 日开源的新一代 MoE 旗舰,距 Hy3 GA 仅约八周,也是首个官方称"参与了自身训练与推理基础设施优化"的混元模型。

项目

规格

发布方

腾讯混元(首席 AI 科学家姚顺雨团队)

总 / 激活参数

770B / 49B(每 token 激活约 6.4%)

上下文

1,048,576 tokens(原生 1M)

许可证

Apache 2.0(可商用,无营收门槛)

模态

纯文本(开源权重 text-only,未见官方视觉/音频变体,待验证)

架构

MoE,78 层;256 路由专家 + 1 共享专家,top-8 激活

定位

数据中心级生产力旗舰,面向长上下文 coding / 办公 / 科研

一句话定位:一款需要 8 卡数据中心才能自部署、但 API 价格却比 GLM/Kimi 便宜的 1M 上下文开源 MoE 旗舰。


二、核心亮点

1. Gated DSA + IndexCache,1M 上下文的稀疏注意力

注意力采用 Gated DeepSeek Sparse Attention(Gated DSA),配跨层稀疏索引复用(IndexCache)与 4 条 iHC 残差流。这让 1M 上下文在显存与计算上可控,而非简单堆全注意力。

2. 原生 MTP 草稿层,投机解码提速

模型自带 10B 总参 / 0.7B 激活的 MTP 层,用于投机解码。配合 vLLM / SGLang 的 MTP 配置,可在不损分布的前提下提升吞吐。

3. "帮自己优化"的递归自改进闭环

Tencent 称 Hy4 参与了自身训练方法、数据策略、评估与底层算子优化,并自主分析推理瓶颈、做算子融合与通信优化,端到端吞吐较基线提升31.8%(内部结果)。这是官方重点强调的差异化故事。

4. 内部盲测小胜 GLM-5.3 与 Kimi K3

163 名专家对 203 个工程任务的盲测:Hy4 preview2.99/4,GLM-5.3 2.92(46.8% 胜 / 12.8% 平 / 40.4% 负),Kimi K3 2.94(51.2% 胜 / 7.9% 平 / 40.9% 负)。注意差距不到 0.1 分,胜率接近抛硬币——官方自述"略胜"。


三、部署

3.1 硬件现实:这不是消费级模型

版本

权重体积

最低硬件

BF16

~1,848 GB

16×B200 或 8×B300

MXFP8

~924 GB

8×B200/B300(tensor-parallel 8)

Q4(社区)

~450–512 GB

512GB+ 内存,性能受限

⚠️ 避坑提醒:单张 8×H100 节点(640GB)装不下FP8 版。官方 recipe 最低 16×B200 或 8×B300。对绝大多数团队,用云 API 比自建 GPU 集群划算得多。

3.2 自部署:vLLM / SGLang(官方镜像)

官方提供预构建镜像,8 卡 FP8 启动:

```bash # vLLM(官方镜像 vllm/vllm-openai:hy4-preview) docker run --gpus all -p 8000:8000 --ipc=host \ -v ~/.cache/huggingface:/root/.cache/huggingface \ vllm/vllm-openai:hy4-preview \ tencent/Hy4-preview-FP8 \ --tensor-parallel-size 8 \ --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' \ --attention-backend FLASHMLA_SPARSE \ --tool-call-parser hy_v4 --reasoning-parser hy_v4 \ --enable-auto-tool-choice --port 8000 \ --served-model-name hy4-preview ```
# SGLang(官方镜像 lmsysorg/sglang:hy4-preview,支持 x86 / Arm) docker run --gpus all --ipc=host -p 8000:8000 \ lmsysorg/sglang:hy4-preview \ python3 -m sglang.launch_server \ --model tencent/Hy4-preview-FP8 --tp-size 8 \ --reasoning-parser auto --tool-call-parser auto \ --speculative-algorithm NEXTN --speculative-num-steps 3 \ --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 \ --port 8000 --served-model-name hy4-preview

3.3 调用服务(OpenAI 兼容)

from openai import OpenAI client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="EMPTY") resp = client.chat.completions.create( model="hy4-preview", messages=[{"role": "user", "content": "用 FastAPI 写一个带鉴权的文件上传接口。"}], temperature=0.9, top_p=1.0, ) print(resp.choices[0].message.content)

默认开启深度推理(high)。简单任务想直接拿答案,在extra_body{"chat_template_kwargs": {"reasoning_effort": "no_think"}}

3.4 没 8 卡?走 API(大多数团队的路径)

通过腾讯云 TokenHub 或 OpenRouter 调用,模型 IDhy4-preview(OpenRouter:tencent/hy4-preview)。OpenRouter 带零数据留存策略。WorkBuddy / CodeBuddy 发布后两周限时免费。

# OpenRouter 调用示例(curl) curl https://openrouter.ai/api/v1/chat/completions \ -H "Authorization: Bearer $OPENROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"tencent/hy4-preview","messages":[{"role":"user","content":"Hello"}],"max_tokens":512}'

四、性能测评

4.1 速度与成本(官方 / 社区)

指标

数值

来源

自部署吞吐提升

+31.8%(端到端,vs 基线)

腾讯内部(非独立复测)

OpenRouter P50 延迟

2.75s;约 38 tok/s

OpenRouter 实测(freeai.help)

API 输入价

$0.834 / 百万 token

腾讯云 / OpenRouter

API 输出价

$2.501 / 百万 token

腾讯云 / OpenRouter

缓存命中价

$0.042 / 百万 token

腾讯云 / OpenRouter

国内价

¥6 输入 / ¥18 输出 / ¥0.3 缓存命中

腾讯云

注:自部署吞吐与延迟均为官方/平台数据,未在本文独立复测。

4.2 生成质量(引用官方 model card,最高推理档)

工程 / Agent(主战场):SWE-bench Pro65.7(Hy3 57.9)、Terminal-Bench 2.185.4(Hy3 70.8)、DeepSWE64.3、Toolathlon-Verified74.1、MCP-Atlas83.7、SWE-bench Multilingual82.9

推理 / 通用:GPQA Diamond92.3、HLE(no-tools)43.4、MathArena Apex 202574.2

局限:在 SWE-Marathon(31.9 vs Opus 5 的 50.0)、ProgramBench(17.5 vs 39.5)上明显落后于 Claude Opus 5。

4.3 同档模型对比表

维度

Hy4 preview

GLM-5.3

Kimi K3

DeepSeek V4 Flash

总参/激活

770B/49B

未披露

2.8T/104B

284B/13B

上下文

1M

N/A

1M

1M

专家盲测

2.99

2.92

2.94

SWE-bench Pro

65.7

未披露

未披露

未披露

Terminal-Bench 2.1

85.4

API 输出价 $/M

2.501

4.40

15.00

0.66

自部署门槛

8×B300

待验证

数据中心级

待验证

结论:Hy4 preview 在旗舰开源里 API 价格相对便宜(缓存命中0.042/M 极低),工程类基准与 GLM-5.3、Kimi K3 大致持平;但相比 DeepSeek V4 Flash(输出0.66/M)贵约 4 倍,且自部署硬件门槛远超消费级。预算敏感的高频简单任务,Flash 更经济。


五、使用建议

适用场景

  • 企业级长上下文代码库分析、跨文件重构、多文件综合;
  • 长周期 Agent 任务,需要强规划与工具调用;
  • 办公分析:跨文档协作、金融建模、报表生成;
  • 科研:分子动力学、凝聚态物理、基础数学(见官方几何/量子输运案例);
  • 需 Apache 2.0 无限制条款的商用项目。

不适用场景

  • 需要多模态/视觉输入(当前开源权重为纯文本)——待验证是否有视觉变体;
  • 个人本地部署(硬件门槛远超消费级);
  • 对延迟极敏感(默认深度推理 + 过度验证,交付偏慢);
  • 预算有限的高频简单任务 → 选 DeepSeek V4 Flash / GLM-5.3-Flash。

调优提示

  1. 关深度推理:简单任务传reasoning_effort: no_think,交付时长明显下降;
  1. 吃缓存红利:反复读同一长上下文(代码库/长文档)的工作负载,缓存命中 $0.042/M 是真省钱点;
  1. 自部署用 FP8 + MTP:tensor-parallel 8,开投机解码;用 AngelSlim 做进一步压缩;
  1. 成本预期:Hy4 比 Hy3 贵约 5–6 倍,老 Hy3 用户需重新算账。

你会为了 1M 上下文和工程能力,接受 Hy4 preview 比 Hy3 贵 5–6 倍、且基本只能走 API 的现实吗?还是更倾向本地能跑的小模型?


数据来源说明:本文数据来自腾讯混元官方发布、Hugging Face model card(tencent/Hy4-preview)、vLLM/SGLang 官方 recipe、OpenRouter 定价页,以及 miraflow / letsdatascience / brocker / labindex / eesel.ai / freeai.help 等第三方分析。基准多为厂商发布值,自部署吞吐为内部结果未独立复测;以独立第三方评测为准。关于"多模态":部分早期报道称 Hy4 多模态,但官方 model card 与 recipe 均为 text-only,本文以官方为准并标注待验证。

往期回顾:

  • Apodex-1.1-mini 部署实测:Int4 量化 18GB 单卡跑通 Agent Team,35B 开源逼近 1T Kimi
  • Qwen3.8-27B GSQ-RCO 量化部署实测:9.3GB 跑出超 BF16 精度,消费级显卡落地 27B 多模态
  • SenseNova U1.5 Lite 部署实测:8B 单卡跑通 4K 生图,Apache 2.0 免费商用

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询