字数 1160,阅读大约需 6 分钟

2025年4月29日凌晨,Qwen 官方团队正式发布了最新一代大语言模型 —— Qwen3!这一次,Qwen3不仅在规模、性能和推理灵活性上实现了全方位突破,更以开放的姿态,将多个重量级模型悉数开源,标志着大模型生态迈入一个全新阶段。


全面升级,性能遥遥领先

Qwen3 系列包含多个密集(Dense)模型与稀疏专家(MoE)模型:

  • • 旗舰模型:Qwen3-235B-A22B

  • • 高效 MoE 模型:Qwen3-30B-A3B

  • • 轻量小模型:Qwen3-0.6B、Qwen3-1.7B、Qwen3-4B、Qwen3-8B、Qwen3-14B、Qwen3-32B

在多个权威基准测试中,Qwen3-235B-A22B在代码、数学推理、通用能力等方面,表现出色,直面挑战 DeepSeek-R1、o1、o3-mini、Grok-3、Gemini-2.5-Pro 等顶级大模型。而小到 Qwen3-4B,也能在部分场景中匹敌前代大模型 Qwen2.5-72B-Instruct,体现出极高的参数效率与实用价值。


思考模式,掌控推理预算

Qwen3 创新引入了“双模式思考”机制:

  • • 思考模式:逐步推理,深思熟虑后输出,适合复杂问题。

  • • 非思考模式:极速响应,适合日常对话、简单问题。

用户可以根据任务需求,灵活选择推理方式,在推理质量响应速度之间,精准平衡成本与效果。这种灵活的“思考预算控制”,大幅拓展了模型在实际应用场景中的适用性。


技术解析:架构 × 训练

预训练数据规模 & 三阶段策略

阶段

语料规模

关键特点

S1 基础训练 > 30 万亿

 token

4 K 上下文,获取通用语言与知识能力

S2 强化知识 ≈ 5 万亿

 token

提升 STEM / 代码 / 推理占比

S3 长上下文扩展 高质量长文档

上下文长度扩展至 32 K,奠定长文处理能力

  • • 总计近 36 万亿 token,覆盖 119 种语言与方言;相比 Qwen2.5(18T)翻倍。

  • • PDF 等非网页资料通过 Qwen2.5-VL 抽取、Qwen2.5 清洗。

  • • 数学 & 代码语料大量合成:使用 Qwen2.5-Math/Coder 生成教材、题目、代码片段。

模型架构亮点

  • • Transformer++ 内核:相对位置编码 + 动态 RoPE 缩放,最高 128 K 上下文(大型模型)。

  • • MoE 设计:128 专家 → 8 活跃专家(Qwen3-235B-A22B / 30B-A3B),仅 10 % 激活参数即达 Dense 同级性能,推理成本显著下降。

  • • Embedding 共享:小模型 Tie Embedding 以节省参数,大模型独立词嵌入获得更强表达力。

  • • 多语言 Tokenizer:统一词表,UTF-8 友好,进一步降低跨语种开销。

后训练四阶段:思考与闪答兼得

  1. 1. 长链式推理冷启动:海量 CoT(Chain-of-Thought)微调,奠定推理基础。

  2. 2. 基于推理的强化学习(RL):规则奖励,扩大“思考深度”搜索空间。

  3. 3. 思考模式融合:将非思考场景微调融入思考模型,平滑切换。

  4. 4. 通用 RL:覆盖 20 + 领域指令任务,纠正不良行为、强化工具调用能力。

    通过 prompt 中 /think 与 /no_think 标记即可软切换模式;SGLang/vLLM 推理框架已支持。

效能对比

  • • Dense:Qwen3-14B-Base ≈ Qwen2.5-32B-Base;Qwen3-32B-Base ≈ Qwen2.5-72B-Base。

  • • MoE:Qwen3-30B-A3B-Base ≈ Qwen2.5-Dense-32B-Base,但激活参数仅 1/10


全面多语言,拥抱全球用户

Qwen3 支持高达 119种语言与方言,涵盖:

  • • 英语、法语、德语、西班牙语、阿拉伯语、中文(简体、繁体、粤语)、印地语、乌克兰语、印尼语、泰米尔语、土耳其语……

  • • 涵盖印欧语系汉藏语系亚非语系南岛语系德拉威语系突厥语系等主流语言家族。

无论是全球化应用开发,还是本地化内容生成,Qwen3 都能轻松胜任。


完整开源,社区蓄势爆发

本次发布,Qwen 官方不仅开源了所有密集模型,还开放了重量级 MoE 模型的权重,且统一遵循 Apache 2.0 开源协议,极大地降低了科研与应用的门槛。模型现已同步上线:

  • • Hugging Face[1]

  • • ModelScope[2]

  • • Kaggle[3]

同时,Qwen 团队推荐了多种推理与部署工具,包括 SGLang、vLLM、本地 Ollama、LMStudio、llama.cpp、MLX、KTransformers 等,方便开发者在不同环境下快速集成。


结语

Qwen3 的诞生,不仅是一次技术革新,更是一次对全球 AI 社区的深情回馈。更强的推理能力,更灵活的应用模式,更广泛的多语言覆盖,再加上彻底开放的生态布局,让我们看到了大模型民主化未来的真正可能。

未来已来,马上体验全新 Qwen3 吧!
👉 Qwen Chat 在线体验[4]

引用链接

[1] Hugging Face: https://huggingface.co/Qwen
[2] ModelScope: https://modelscope.cn/models?page=1&name=Qwen3
[3] Kaggle: https://www.kaggle.com/models/qwen
[4] Qwen Chat 在线体验: https://chat.qwen.ai/

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐