Qwen3 technical report解读
2026/8/8 7:34:56 网站建设 项目流程

一、introduction

1.1 Non-/ Thinking Mode

思考模式(Thinking Mode)非思考模式(Non-Thinking Mode)整合到同一个模型中:

  • 思考模式:用于复杂、多步推理任务(如数学证明、代码生成),启动深度推理模块
  • 非思考模式:用于快速、基于上下文的响应(如日常对话)

这一设计消除了在不同模型(如对话优化模型与专用推理模型)之间切换的需要,用户可根据查询或对话模板动态切换模式。

1.2 Thinking Budget机制

Qwen3引入了思考预算(Thinking Budget)机制,允许用户在推理过程中自适应分配计算资源:

  • 支持高达38K token的动态思考预算
  • 用户可通过指定token预算控制思考深度
  • 简单问题分配较少预算,模型快速响应;复杂问题分配较高预算,模型深入思考
  • 日常对话场景下,“快思考”模式仅激活20%参数,响应速度提升60%,算力消耗降低40%

1.3 多语言能力大幅扩展

相比前代 Qwen2.5(支持29种语言),Qwen3将多语言支持扩展至119种语言和方言,覆盖全球90%以上人口。

二、模型系列

Qwen3系列包含6个密集模型(Dense)2个混合专家模型(MoE),参数规模覆盖 0.6B 至 235B:

类型模型名称总参数量激活参数量
密集模型Qwen3-0.6B6亿6亿
密集模型Qwen3-1.7B17亿17亿
密集模型Qwen3-4B40亿40亿
密集模型Qwen3-8B80亿80亿
密集模型Qwen3-14B140亿140亿
密集

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询