阿里 Qwen3.8-Max 正式发布:2.4万亿参数旗舰模型,下周开源权重
8月3日,阿里巴巴正式向全球开放 Qwen3.8-Max——Qwen 家族迄今最大的语言模型。2.4万亿总参数、95亿活跃参数的 MoE 架构,100万 token 上下文窗口,API 当日上线,开源权重下周放送。这是阿里 Max 级旗舰首次开源,也是中国 AI 竞赛进入"2T 俱乐部"的又一记重拳。
规格一览
Qwen3.8-Max 采用稀疏 MoE(混合专家)架构,总参数 2.4万亿,每次推理仅激活约 95B 参数——仅占总量的 4%,这让它的推理成本与参数量小十倍的模型相当。其他关键参数:
- 上下文窗口:100万 token(输入上限 991K,开启推理后 983K)
- 最大输出:131,072 token
- 推理预算:最高 262K token
- 输入模态:文本 + 图像 + 视频;输出:文本
同批发布的还有 Qwen3.8-27B,一个 270亿参数的稠密模型,适合实验室和小公司本地部署。
Benchmark:文档理解领先,纯编程仍有差距
阿里公布的对比数据(对手包括 GPT-5.6 Sol、Claude Fable 5、Claude Opus 4.8):
| Benchmark | Qwen3.8-Max | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| PaperBench(论文复现) | 93.0 | 90.5 | 88.8 |
| OmniDocBench 1.5(文档理解) | 92.1 | — | — |
| GPQA Diamond(科学推理) | 92.6 | — | — |
| Terminal-Bench 2.1 | 86.6 | 88.8 | 84.6 |
| SWE-bench Pro | 67.7 | — | 80.0 |
| FrontierSWE | 73.5 | — | 88.8 |
文档理解、科研复现、科学推理方面 Qwen3.8-Max 领先;但纯编程场景(SWE-bench Pro、FrontierSWE)与 Claude Fable 5 差距明显。值得注意的是,从 Qwen3.7 到 3.8,DeepSWE 从 21.6 跳到 56.6,FrontierSWE 从 40.7 到 73.5——一代之内完成了通常两代的进步,阿里称这源于训练目标从"回答问题"转向"完成长任务"。
重要提醒:以上所有分数均为阿里自测,目前尚无任何独立公开评测。 自测 benchmark 不等于虚假宣传,但也不等于独立验证,在第三方排行榜出分之前,这些数字应视为厂商声明。
两个标志性 Demo
16天自主编程:Qwen 团队让模型自由开发 oh-my-cli(一个 TypeScript 命令行编程 Agent),从收集需求、开 GitHub Issue、写代码、跑测试到提 PR 全自动。截至 7 月 30 日:265 commits、127 PR、151 Issue。GitHub 仓库公开可查(qwen-code-dev-bot/oh-my-cli),目前实际已超过 457 commits。但需注意:模型自己开 Issue、自己合 PR,缺少真实软件开发中"需求变更、代码审查被拒、隐性兼容约束"等核心难点——commit 量衡量的是循环效率,不是产品质量。
虚拟电商运营:在 E-Commerce-Bench 模拟环境中,模型从 10万元本金运营虚拟网店一整年,最终结余 41.6万元,是本金的 4 倍多,比第二名 GLM-5.2 高 38%,还需识别 152 个欺诈供应商。
怎么用
- API:已通过阿里云 Model Studio 开放,支持 function calling、结构化输出、批量请求、微调,内置代码解释器、网页搜索等 5 个服务端工具
- 协议兼容:同时支持 OpenAI Chat Completions 格式和 Anthropic 协议,多数情况下只需改 base URL、key 和模型名即可切换
- 开源权重:约 8月10日发布 Qwen3.8-Max 和 Qwen3.8-27B 的权重到 Hugging Face 和 ModelScope,将是 Max 级首次开源。许可证待仓库上线后确认(此前 Qwen 开源模型均用 Apache 2.0)
小结
Qwen3.8-Max 是阿里在语言模型赛道的一次全力出击:参数规模、上下文长度、开源策略都拉到了新高度。文档理解和科研复现的自测分数亮眼,但编程能力与顶尖对手仍有差距,且所有 benchmark 待独立验证。下周开源权重落地后,社区实测将给出更真实的答案。
---
基于 Bloomberg、Indian Express、pasqualepillitteri.it 等多家媒体转述整理。