Mistral Large 4 开放权重预览上线:1 万亿参数"欧洲旗舰",编码、Agent、网络安全三开花
10 月 6 日,法国 AI 公司 Mistral 在官方博客宣布推出 Mistral Large 4(内部代号 le Chonk)的公开预览版:一个 1 万亿总参数(520 亿激活)、原生支持"文本 + 图像"输入的多模态大模型,512K 上下文、256K 输出,支持工具调用和结构化输出。现在就能在 Mistral Studio 上试用预览 API,开放权重本月底放出。
这是 Mistral 迄今最大、能力最强的模型,官方定位很直白:在编码、Agent 工作流和多模态理解上,它已经追平全球最强开源模型,并且"显著超过欧美所有其他开放权重模型"。
规格一览
| 项目 | 参数 |
|---|---|
| 总参数 / 激活参数 | 1T / 52B(MoE 结构) |
| 输入模态 | 文本 + 图像(多模态) |
| 上下文 / 最大输出 | 512K / 256K |
| 功能支持 | 工具调用、结构化输出 |
| 预览 API 价格 | 约 $0.68 / $2.09 每百万 token(OpenRouter 显示 5 折预览价) |
| 开放权重 | 本月底放出 |
编码与 Agent:官方基准里最硬的一块
基于多家媒体转述整理(核心数据来自 Mistral 官方博客,经 OpenRouter、pricepertoken 时间线交叉印证):
- **DeepSWE v1.1 得分 61.7%**、Terminal-Bench 4.0 得分 28.3%,综合 Coding Agent Index 达 49.8%,**超过 DeepSeek V4 Pro(0813)和 Qwen3.8 Max**。
- Surge AI 的盲测(标注员不知道模型身份,1–5 分):ML4 预览版拿到 **3.74 分,五强中排第二**,只输给 Claude Opus 5(4.22),超过 Kimi K3(3.59)和 GLM-5.3(3.60)。
- Agent 工作流上,AutomationBench(覆盖 Gmail、Sheets、Slack、Salesforce 等 657 个业务流程)得分 59.9%,超过 Kimi K3 和 DeepSeek V4 Pro;长任务知识工作(AA-Briefcase)Elo 1393,同样领先 DeepSeek V4 Pro。
独特点:网络安全,闭源旗舰反而"不敢答"
ML4 是全世界最强的网络安全大模型之一。在 Artificial Analysis Cyber Index(独立评测 AI 发现和修复真实软件漏洞的能力)上,它排全球前五、非中国开放权重模型第一:
- "复现真实漏洞并打补丁"测试得分 **82%,为所有被测模型最高**;
- Cybench(40 道安全竞赛题)解出 **93%**,是开放权重模型里少有的高分。
多模态视觉:工程图纸、卫星图都能"看明白"
ML4 的图像理解是"代差级"提升:官方演示中它能扫描千兆像素级卫星图(灾难响应场景)、在工程图纸里放大检查机械零件、从 PDF 里定位证据。视觉接地上,Dense 200 测试得 42%,略超 GPT-6 Astra(41%)。
怎么用
1. 马上能试:Mistral Studio 的预览 API(开放注册即可),或 OpenRouter 上 mistralai/mistral-large-4-0,$0.68 进 / $2.09 出(每百万 token,5 折预览价)。
2. 等权重:本月底开放权重放出后,可以在自己的服务器或私有云上部署——这是它和闭源旗舰最大的差异。
3. 适用场景:代码 Agent、长文档/图表分析、安全运营、对数据主权有要求的政企场景。
避坑提醒
- 这是**预览版**:权重还没放出,最终开源版本可能有调整,基准数据均来自官方自测,独立复现还有限。
- 上下文 512K 看着大,长任务成本要按 $0.68/$2.09 自己算账。
- 网络安全"超越闭源"的说法,前提是任务闭源模型会拒答;常规对话场景它和 Claude/GPT 旗舰仍有差距。
参考来源
- [Mistral 官方博客:Introducing Mistral Large 4(2026-10-06)](https://mistral.ai/news/mistral-large-4/)
- [OpenRouter 模型页:mistralai/mistral-large-4-0](https://openrouter.ai/mistralai/mistral-large-4-0)
- [pricepertoken 模型发布时间线](https://pricepertoken.com/news/model-releases)