一、MoE架构:10万亿参数的业务真相
当前,前沿大模型普遍采用MoE(Mixture-of-Experts)架构。其核心设计是:总参数量巨大,但每次前向传播只激活其中一小部分专家网络。
- DeepSeek V4-Pro:总参数1.6T,激活参数49B,激活率约3%。
- Kimi K3:总参数2.8T,激活参数104B,激活率约3.7%。
- Anthropic Mythos 5(业内估计):总参数约8T,激活参数未公开。
字节跳动被爆正在预训练的模型目标为10万亿总参数,但激活参数、专家数量、路由策略都没披露。缺了这几个数,10万亿只能描述存储和训练规模,推不出推理成本,也推不出能力上限。
看发布会别只盯着总参数,得追问供应商:单次推理激活多少参数?专家路由能不能动态调整?这俩数直接决定你的API账单和响应延迟。
二、训练成本:一张3-6个月的算力支票
据Financial Times报道,该模型尚处于预训练早期,周期通常为3-6个月。按Chinchilla最优训练比例估算,10万亿参数模型需要约200万亿token的训练数据。
字节2026年AI资本开支已上调到2000亿元人民币(约280亿美元),大量投进算力基础设施。按业界粗略估算,单次10万亿参数的预训练成本可能达到数亿美元级别。这还没算后训练、RLHF、安全评估和多轮迭代的隐性支出。
这笔钱不是一般玩家能跟的。中小企业或中型云厂商与其追 frontier 规模,不如盯住垂直场景的小模型,或者用蒸馏压出来的中等规模模型,性价比更高。
三、蒸馏 vs 自训:不是技术对错,是商业权衡
蒸馏说穿了就是让自家模型学习更强模型的输出,成本低、见效快,但能力天花板被教师模型锁住,还容易惹上知识产权和合规麻烦。
字节要求Seed团队"不蒸馏",可以从三层理解:
- 技术层:相信原生预训练能带来真正的能力上限突破,而非复制他人输出。
- 合规层:在中美AI竞争加剧背景下,避免被指控窃取闭源模型输出,降低未来出海和IPO的法律风险。
- 商业主权层:掌握从预训练到RLHF的完整链路,让模型奖励函数对齐字节系产品逻辑(完播率、转化率、内容节奏)。
但自训的代价是时间。LatePost报道称,Seed 2.0反响有限,豆包Coding能力落后于Claude Code。张一鸣表态"可以接受短期落后",意味着字节愿意为长期控制权牺牲短期榜单表现。
四、落地避坑清单
| 检查项 | 为什么重要 |
|---|---|
| 激活参数比例 | 决定真实推理成本和能力密度 |
| 训练数据来源与合规性 | 避免未来版权与合规风险 |
| API定价与上下文长度 | 决定实际部署成本 |
| 业务场景基准测试 | 榜单分数不等于业务表现 |
| 私有化部署能力 | 金融、医疗等行业需要本地部署 |
| 供应商长期存续能力 | 大模型是长周期投资,不是一次性采购 |
参数竞赛越来越像资本和算力的军备竞赛。对大家来说,真正该关心的重点并不是谁家模型参数多,而是:在我具体业务里,这个模型能不能用、用得起、用得久。