重磅发布!Qwen3:思深行速,全面开源,开启大模型新纪元
字数 1160,阅读大约需 6 分钟
2025年4月29日凌晨,Qwen 官方团队正式发布了最新一代大语言模型 —— Qwen3!这一次,Qwen3不仅在规模、性能和推理灵活性上实现了全方位突破,更以开放的姿态,将多个重量级模型悉数开源,标志着大模型生态迈入一个全新阶段。
全面升级,性能遥遥领先
Qwen3 系列包含多个密集(Dense)模型与稀疏专家(MoE)模型:
-
• 旗舰模型:Qwen3-235B-A22B
-
• 高效 MoE 模型:Qwen3-30B-A3B
-
• 轻量小模型:Qwen3-0.6B、Qwen3-1.7B、Qwen3-4B、Qwen3-8B、Qwen3-14B、Qwen3-32B
在多个权威基准测试中,Qwen3-235B-A22B在代码、数学推理、通用能力等方面,表现出色,直面挑战 DeepSeek-R1、o1、o3-mini、Grok-3、Gemini-2.5-Pro 等顶级大模型。而小到 Qwen3-4B,也能在部分场景中匹敌前代大模型 Qwen2.5-72B-Instruct,体现出极高的参数效率与实用价值。
思考模式,掌控推理预算
Qwen3 创新引入了“双模式思考”机制:
-
• 思考模式:逐步推理,深思熟虑后输出,适合复杂问题。
-
• 非思考模式:极速响应,适合日常对话、简单问题。
用户可以根据任务需求,灵活选择推理方式,在推理质量与响应速度之间,精准平衡成本与效果。这种灵活的“思考预算控制”,大幅拓展了模型在实际应用场景中的适用性。
技术解析:架构 × 训练
预训练数据规模 & 三阶段策略
|
阶段 |
语料规模 |
关键特点 |
| S1 基础训练 | > 30 万亿
token |
4 K 上下文,获取通用语言与知识能力 |
| S2 强化知识 | ≈ 5 万亿
token |
提升 STEM / 代码 / 推理占比 |
| S3 长上下文扩展 | 高质量长文档 |
上下文长度扩展至 32 K,奠定长文处理能力 |
-
• 总计近 36 万亿 token,覆盖 119 种语言与方言;相比 Qwen2.5(18T)翻倍。
-
• PDF 等非网页资料通过 Qwen2.5-VL 抽取、Qwen2.5 清洗。
-
• 数学 & 代码语料大量合成:使用 Qwen2.5-Math/Coder 生成教材、题目、代码片段。
模型架构亮点
-
• Transformer++ 内核:相对位置编码 + 动态 RoPE 缩放,最高 128 K 上下文(大型模型)。
-
• MoE 设计:128 专家 → 8 活跃专家(Qwen3-235B-A22B / 30B-A3B),仅 10 % 激活参数即达 Dense 同级性能,推理成本显著下降。
-
• Embedding 共享:小模型 Tie Embedding 以节省参数,大模型独立词嵌入获得更强表达力。
-
• 多语言 Tokenizer:统一词表,UTF-8 友好,进一步降低跨语种开销。
后训练四阶段:思考与闪答兼得
-
1. 长链式推理冷启动:海量 CoT(Chain-of-Thought)微调,奠定推理基础。
-
2. 基于推理的强化学习(RL):规则奖励,扩大“思考深度”搜索空间。
-
3. 思考模式融合:将非思考场景微调融入思考模型,平滑切换。
-
4. 通用 RL:覆盖 20 + 领域指令任务,纠正不良行为、强化工具调用能力。
通过 prompt 中
/think与/no_think标记即可软切换模式;SGLang/vLLM 推理框架已支持。
效能对比
-
• Dense:Qwen3-14B-Base ≈ Qwen2.5-32B-Base;Qwen3-32B-Base ≈ Qwen2.5-72B-Base。
-
• MoE:Qwen3-30B-A3B-Base ≈ Qwen2.5-Dense-32B-Base,但激活参数仅 1/10。
全面多语言,拥抱全球用户
Qwen3 支持高达 119种语言与方言,涵盖:
-
• 英语、法语、德语、西班牙语、阿拉伯语、中文(简体、繁体、粤语)、印地语、乌克兰语、印尼语、泰米尔语、土耳其语……
-
• 涵盖印欧语系、汉藏语系、亚非语系、南岛语系、德拉威语系、突厥语系等主流语言家族。
无论是全球化应用开发,还是本地化内容生成,Qwen3 都能轻松胜任。
完整开源,社区蓄势爆发
本次发布,Qwen 官方不仅开源了所有密集模型,还开放了重量级 MoE 模型的权重,且统一遵循 Apache 2.0 开源协议,极大地降低了科研与应用的门槛。模型现已同步上线:
-
• Hugging Face[1]
-
• ModelScope[2]
-
• Kaggle[3]
同时,Qwen 团队推荐了多种推理与部署工具,包括 SGLang、vLLM、本地 Ollama、LMStudio、llama.cpp、MLX、KTransformers 等,方便开发者在不同环境下快速集成。
结语
Qwen3 的诞生,不仅是一次技术革新,更是一次对全球 AI 社区的深情回馈。更强的推理能力,更灵活的应用模式,更广泛的多语言覆盖,再加上彻底开放的生态布局,让我们看到了大模型民主化未来的真正可能。
未来已来,马上体验全新 Qwen3 吧!
👉 Qwen Chat 在线体验[4]
引用链接
[1] Hugging Face: https://huggingface.co/Qwen[2] ModelScope: https://modelscope.cn/models?page=1&name=Qwen3[3] Kaggle: https://www.kaggle.com/models/qwen[4] Qwen Chat 在线体验: https://chat.qwen.ai/
更多推荐


所有评论(0)