MiniMax M3:前沿 Coding、1M 上下文、原生多模态 —— 一个模型全给你
引言
2026 年 6 月 1 日,MiniMax 正式发布新一代旗舰大语言模型 MiniMax M3。这是一款被官方定位为"前沿 Coding & Agentic 能力·百万上下文·原生多模态"的全能型模型。在海外闭源前沿模型早已将这三项能力作为标配的当下,M3 是国内第一个将 Coding、1M 长上下文与原生多模态三项要素齐备的旗舰模型,同时也是目前唯一同时具备这三项能力的开源模型。本文从架构、能力、评测与产品四个维度,深度解读 M3 为何被称为"一个模型全给你"。
一、三大前沿能力首次齐备于开源模型
很长一段时间里,开源大模型与闭源前沿模型之间存在一道隐形的能力鸿沟:闭源模型在 Coding、智能体(Agentic)和长上下文三个维度上持续领跑,而开源模型往往只能追赶其中一到两项。M3 的发布打破了这一格局:
- 前沿 Coding 能力:M3 相比上一代 M2 在 bug 修复、前后端开发、性能优化等任务上显著增强,整体接近海外闭源领先模型的水平。
- 1M 超长上下文:API 最高支持 1M tokens 的上下文窗口,并保障至少 512K tokens 可用,是长程 Agent、长程 Coding、长视频理解的基础设施。
- 原生多模态:支持图片和视频的输入,并能操作电脑桌面(Computer Use),是真正意义上的"看图、看视频、动电脑"全栈模型。
这三项能力是当前闭源前沿模型的入场券,而 M3 第一次把这套组合带进了开源世界。
二、MSA 架构:稀疏注意力让 Context 成为可 Scale 的维度
要让 M3 真正具备 1M 上下文的能力,必须从最底层的注意力机制入手,避开全注意力机制计算复杂度平方级增长的"先天缺陷"。M3 的答案是MSA(MiniMax Sparse Attention)——一套简洁、易扩展且硬件友好的稀疏注意力架构。
2.1 设计思路
稀疏注意力机制普遍通过增加一个初筛阶段来避免复杂度爆炸问题。与 DSA、MoBA 等方案相比,MSA 可以更精确地为 KV(Key-Value)分块,实现更高的有效上下文覆盖。MSA 不是一个临时拼凑的工程技巧,而是从结构上重新设计注意力流程。
2.2 算子层优化
MSA 在算子层直接优化,采用"以 KV 块为外层、聚合命中 query 的 KV outer gather Q"的方式:每块只读一次、访存连续。在 M3 的 head 配比下,其计算访存比显著优于通行方法,比开源的 Flash-Sparse-Attention 和 flash-moba 快 4 倍以上。
2.3 真正的落地收益
简洁可扩展、易于实现且硬件友好的特点,使 MSA 的理论收益能在生产环境中真正落地:
- 在 100 万 token 上下文下,M3 每 token 的计算量仅为上代模型的 1/20;
- Prefilling 阶段实现超过 9 倍加速倍率;
- Decoding 阶段实现超过 15 倍加速优势;
- 多个对照实验显示,MSA 在绝大部分能力上与全注意力打平,没有显著能力损失。
换言之,MSA 用 1/20 的算力换来了同等能力的 1M 上下文——这是真正意义上的"Context Scaling"。
三、评测数据:M3 在多项 Coding & Agent 榜单达到国际领先
Coding 与 Agent 能力是 M3 重点提升的方向。在涵盖软件工程、终端执行、协议调用等多个维度的国际权威评测中,M3 均达到国际领先水平:
| 评测基准 | 评测方向 | M3 成绩 |
|---|---|---|
| SWE-Bench Pro | 真实 GitHub Issue 修复 | 59.0% |
| Terminal-Bench 2.1 | 终端命令执行 | 66.0% |
| SWE-fficiency | 软件工程效率 | 34.8% |
| KernelBench Hard | 算子/系统级代码 | 28.8% |
| MCP Atlas | MCP 协议调用 | 74.2% |
可以看到,M3 在 MCP Atlas 上的 74.2% 表现尤为亮眼——这意味着它已经能够在复杂的工具协议调用场景下稳定工作。SWE-Bench Pro 59.0% 的成绩,也让 M3 成为国内首个在该榜单上进入第一梯队的开源模型。
四、交互式用户模拟器:让 Agent 从"被动执行"走向"主动协作"
M3 团队提出了一个被长期忽视的问题:当前大多数代码 Agent 的训练与评测,都建立在**单轮任务(single-turn task)**的假设之上。但真实使用场景并非如此——用户往往会在同一个 Session 中持续协作:澄清需求、调整方案、交叉派发任务,并根据中间结果进行多轮迭代。
为了缩小 Benchmark 与真实使用体验之间的差距,MiniMax 构建了交互式用户模拟器框架。它通过模拟真实开发者在协作过程中的行为模式,让模型在训练和评测阶段就接触到更接近生产环境的交互场景,能够模拟需求补充、方案讨论、反馈修正、连续任务切换以及复杂项目迭代等行为。
下一代 Agent Coding 比赛的核心,已经从"代码生成"转向长期协作能力、规划能力以及人与 Agent 的协同效率。M3 把真正对 Coding 和 Agent 至关重要的数据 Scale up,目标是不仅在 Benchmark 上取得领先,更要成为日常开发协作中真正好用的搭档。
五、产品接入与生态布局
M3 已经通过三个入口向开发者和企业用户开放:
- MiniMax Code(code.minimaxi.com):官方 AI 编程产品,可第一时间体验 M3 的 Coding 与 Agent 能力;
- Token Plan:面向个人开发者的订阅制套餐,按量调用 M3 API;
- API 服务:通过 platform.minimaxi.com 接入,按 token 计费,可用于构建第三方应用。
M3 的开源意味着国内开发者和企业第一次能够在自有基础设施上部署一个具备"前沿 Coding + 1M 上下文 + 原生多模态"能力的旗舰模型,而不再需要完全依赖闭源 API。
结语
MiniMax M3 的发布,标志着一个新阶段的到来:开源模型在 Coding、长上下文、多模态三个最关键维度上第一次完整地站到了与闭源前沿模型同台的位置。MSA 架构用 1/20 的算力打开了 1M 上下文的大门,交互式用户模拟器让 Agent 真正学会"协作",而多项国际权威榜单的成绩,则让"国内首个三项能力齐备的开源旗舰"成为 M3 身上最准确的标签。接下来的 12 个月,长上下文 + Coding Agent 的组合,将成为大模型应用落地的核心战场。