一、introduction
1.1 Non-/ Thinking Mode
将思考模式(Thinking Mode)与非思考模式(Non-Thinking Mode)整合到同一个模型中:
- 思考模式:用于复杂、多步推理任务(如数学证明、代码生成),启动深度推理模块
- 非思考模式:用于快速、基于上下文的响应(如日常对话)
这一设计消除了在不同模型(如对话优化模型与专用推理模型)之间切换的需要,用户可根据查询或对话模板动态切换模式。
1.2 Thinking Budget机制
Qwen3引入了思考预算(Thinking Budget)机制,允许用户在推理过程中自适应分配计算资源:
- 支持高达38K token的动态思考预算
- 用户可通过指定token预算控制思考深度
- 简单问题分配较少预算,模型快速响应;复杂问题分配较高预算,模型深入思考
- 日常对话场景下,“快思考”模式仅激活20%参数,响应速度提升60%,算力消耗降低40%
1.3 多语言能力大幅扩展
相比前代 Qwen2.5(支持29种语言),Qwen3将多语言支持扩展至119种语言和方言,覆盖全球90%以上人口。
二、模型系列
Qwen3系列包含6个密集模型(Dense)和2个混合专家模型(MoE),参数规模覆盖 0.6B 至 235B:
| 类型 | 模型名称 | 总参数量 | 激活参数量 |
|---|---|---|---|
| 密集模型 | Qwen3-0.6B | 6亿 | 6亿 |
| 密集模型 | Qwen3-1.7B | 17亿 | 17亿 |
| 密集模型 | Qwen3-4B | 40亿 | 40亿 |
| 密集模型 | Qwen3-8B | 80亿 | 80亿 |
| 密集模型 | Qwen3-14B | 140亿 | 140亿 |
| 密集 |