MiniMax M3开源:前沿 Coding 能力、1M 上下文、原生多模态,现已上线AtomGit AI
6月13日,MiniMax 正式开源 MiniMax M3。作为一款原生多模态模型,M3 不仅支持图片、视频输入,还具备电脑桌面操作能力,进一步拓展了模型在智能体(Agent)与复杂任务场景中的应用边界。
从当前开源生态来看,MiniMax M3 是国内首个同时具备“原生多模态 + 视频理解 + 桌面操作”能力的开源模型,也是目前唯一在这些能力上形成完整体系的开源方案。在编程、智能体协作等专业任务上,M3 已达到行业前沿水平。
相关模型权重、量化权重及国产算力部署教程已上线 AtomGit AI 社区,欢迎开发者快速部署与体验。
🔗 模型权重链接:
https://atomgit.com/MiniMax-AI/MiniMax-M3
🔗 量化权重链接(NPU适配):
https://atomgit.com/Eco-Tech/MiniMax-M3-w8a8
🔗基于vLLM_Ascend的部署教程:
https://atomgit.com/vLLM_Ascend/Minimax-m3

在 Coding 能力方面,MiniMax M3 相比 M2 显著增强,在 bugfix、前后端、性能优化等均接近海外闭源模型。
在 Agentic 能力方面,MiniMax M3 在办公搜索、Office 能力上表现突出,在金融领域已初步可用。
MSA:结构创新带来 Context Scaling
在设计 MiniMax M3 模型时,解决更复杂的 Agent 任务是它最重要的目标之一,而其中最大挑战就包括 context scaling。要实现真正的改变,必须从最底层的注意力机制入手,避开全注意力机制计算复杂度平方级增长的“先天缺陷”。
MSA 是一个简洁且易于扩展的全新稀疏注意力架构,它给 M3 带来了 1M 的上下文窗口,并让 context 真正成为又一个可被 scale 的维度。
稀疏注意力机制普遍通过增加一个初筛阶段来避免复杂度爆炸问题。与 DSA 和 MoBA 等方案相比,MSA 可以更精确为 KV 分块,实现更高的有效上下文覆盖。
同时,MiniMax M3 还在算子层直接优化,采用以 KV 块为外层来聚合命中 query 的 KV outer gather Q。每块只读一次、访存连续,在 M3 的 head 配比下计算访存比显著优于通行方法,比开源的 Flash-Sparse-Attention、FlashMoBA 快 4 倍以上。

简洁可扩展、易于实现且硬件友好的特点,使它的理论收益能真正落地:在 100 万上下文下,M3 每 token 计算量仅为上代模型的 1/20。在 prefilling 阶段,我们实现了超过 9 倍的加速倍率,在 decoding 阶段有超过 15 倍的加速优势。而且在多个对照实验中,MSA 的绝大部分能力与全注意力打平。
前沿的Coding和Agentic能力
Coding 与 Agent 能力是 M3 重点提升之处,在涵盖软件工程、终端执行等多个维度的国际权威评测中,M3 均达到国际领先水平:
-
SWE-Bench Pro: 59.0%
-
Terminal Bench 2.1: 66.0%
-
SWE-fficiency: 34.8%
-
KernelBench Hard: 28.8%
-
MCP Atlas: 74.2%
今天的 Coding 能力越发取决于能否用真实世界的用户逻辑来训练模型。这意味着仅靠现有 Coding Benchmark 难以完整刻画真实用户体验。
当前大多数代码 Agent 的训练与评测,都建立在单轮任务(single-turn task)的假设之上。但真实使用场景并非如此。用户往往会在同一个 Session 中持续协作:不断澄清需求、调整方案、交叉派发任务,并根据中间结果进行多轮迭代优化。
为了缩小 Benchmark 与真实使用体验之间的差距,我们构建了交互式用户模拟器框架。
它通过模拟真实开发者在协作过程中的行为模式,让模型在训练和评测阶段就接触到更加接近生产环境的交互场景。该框架能够模拟需求补充、方案讨论、反馈修正、连续任务切换以及复杂项目迭代等行为,使 Agent 不再只是被动执行指令,而是能够主动与用户协同完成任务。
下一代 Agent Coding 比的不仅是代码生成,更要比拼长期协作能力、规划能力以及人与 Agent 的协同效率。M3 把真正对 Coding 和 Agent 至关重要的数据 Scale up,目标不仅是在 Benchmark 上取得领先,更是在真实研发流程中成为开发者可靠的协作伙伴。
多模态:原生训练,继续 Scale
M3 是一个从 Step 0 开始进行多模态混合训练的模型。这种原生多模态的路线能让不同模态数据的语义空间更天然、更高度的融合。
同时,在数据配比和构成上,我们的大量实验显示,Interleaved data(交错数据)对模型性能带来的提升,比一般认为的更加关键。
这些文本和图像或其他模态在序列中交替自然排列的数据,对于整体训练数据的规模扩展也很重要,我们重构整套数据管线。
基于vLLM Ascend部署MiniMax M3
如何手把手如何基于vLLM Ascend在昇腾上部署MiniMax M3。
模型权重👇
https://ai.atomgit.com/MiniMax-AI/MiniMax-M3
https://ai.atomgit.com/MiniMax-AI/MiniMax-M3-MXFP8
可使用 msmodelslim 对模型进行基础量化。
Minimax-m3-w8a8(W8A8量化版本)👇
https://atomgit.com/Eco-Tech/MiniMax-M3-w8a8
1)使用 v0.20.2rc1 官方 Docker 镜像
您可以通过如下指令下载镜像来进行部署,具体流程如下:
docker pull quay.io/ascend/vllm-ascend:v0.20.2rc1-a3
2)补丁
补丁获取链接:https://ai.atomgit.com/Ascend-SACT/MiniMax-M3
准备变量:
PATCH_DIR=/path/to/patches
应用 vllm-ascend 补丁:
cd "$VLLM_ASCEND_REPO"
确认补丁状态:
cd "$VLLM_ASCEND_REPO"
如需回退已应用补丁:
cd "$VLLM_ASCEND_REPO"
部署
以下以A3系列的部署为例,量化模型 Minimax-m3 可部署于单台 Atlas 800 A3(64G × 16)。
执行以下脚本进行在线推理。
cd /workspace
服务就绪检查
curl -sS http://127.0.0.1:8000/v1/models
执行以下脚本向模型发送一条请求:
curl -sS http://127.0.0.1:8000/v1/chat/completions \
预期输出包含:
396
也可执行以下脚本向模型发送一条多模态请求:
图片能力只在启动时设置 --limit-mm-per-prompt ‘{“image”:1}’ 时可用。
curl -sS http://127.0.0.1:8000/v1/chat/completions \
预期返回为 HTTP 200,内容应能识别图片中的红色方块和蓝色圆形。
精度评估
这里提供两种精度评估方法。
- 使用 AISBench
详细步骤可参阅以下链接进行精度评估。执行后即可获得评估结果。
https://docs.vllm.ai/projects/ascend/en/latest/developer_guide/evaluation/using_ais_bench.html
- 使用语言模型评估工具(Language Model Evaluation Harness)
尚未测试。
性能评估
可使用以下两种评估方法。
使用 AISBench
详细步骤请参阅 使用 AISBench 进行性能评估: https://docs.vllm.ai/projects/ascend/en/latest/developer_guide/evaluation/using_ais_bench.html#execute-performance-evaluation
使用 vLLM 基准测试工具
更多信息请参考 vLLM 基准测试:
https://docs.vllm.ai/en/latest/contributing/
该教程中的模型当前仅为尝鲜体验,性能优化中。该补丁仅用于功能体验,多模态功能未充分验证,不建议直接用于生产环境。如您在使用过程中发现任何问题(包括但不限于功能问题、合规问题),请在模型的代码仓提交issue,开发者将及时审视并解答。
更多推荐



所有评论(0)