微软发布 MAI-Image-2.5-Pro:最高保真自研图像模型,文字渲染突破,GPU 成本降 84%
7 月 23 日,微软 AI 超级智能团队发布 MAI-Image-2.5-Pro,这是微软迄今最高保真的自研图像生成模型。它主打两个长期痛点:图像内精确文字渲染,以及高保真细节编辑。同日发布的还有语音模型 MAI-Voice-2-Flash,但图像模型才是这次的主角。
文字渲染:图像模型的老大难问题
AI 生图模型一直有个尴尬——画面再精美,一遇到文字就"鬼画符"。无论是海报标题、信息图标签还是幻灯片文字,过去模型生成的文字常常歪歪扭扭、缺笔少画。MAI-Image-2.5-Pro 把精确文字渲染作为核心卖点,WPP 全球首席创意官 Rob Reilly 在微软公告中称其"文字渲染精度的突破是真正的飞跃"。
如果实际效果如宣传所说,这对设计工作流意义重大——你终于可以信任 AI 直接生成带文字的海报、信息图和幻灯片,而不必事后手动替换文字层。
产品线全面切换:从 OpenAI 到自研
这次发布最值得关注的不是模型本身,而是微软产品线的切换动作:
- Bing Image Creator 已完全切换到 MAI-Image-2.5,这是该工具首次完全由微软自研模型驱动
- PowerPoint 中 MAI-Image-2.5 相比 OpenAI 的 GPT-Image-2,GPU 成本降低 84%
- OneDrive 图像编辑场景切换后,保存率提升 26%,P95 延迟降低约 25%,中等负载下效率提升 2.5 倍
这些数字来自微软自评,并非独立基准测试,但产品级部署的规模本身就说明模型已达到可用水平。基础版 MAI-Image-2.5 此前已登上 AI Arena 图像编辑排行榜第二名。
定价与定位
MAI-Image-2.5-Pro 定价:
- 文本输入:$5 / 百万 token
- 图像输入:$8 / 百万 token
- 图像输出:$106 / 百万 token
Pro 版定位高端场景——主视觉图、精细编辑、文字密集型图像。基础版 MAI-Image-2.5 则覆盖日常生成需求,成本更低。微软的策略是构建模型家族而非单一旗舰,让不同场景用不同档位的模型。
Nadella 的"前沿扩散"宣言
微软 CEO Satya Nadella 在 X 上发了一篇题为"Frontier Diffusion & Control"的长文,核心观点:一年前的最先进能力现在是基本盘,微软可以用优化过的自研模型以更低成本复制这些能力,同时只在真正需要前沿能力时才调用 OpenAI/Anthropic 的模型。
他明确表示:"当我们的模型匹配或超越前沿替代时,开始将流量路由到 MAI。"同时强调"前沿模型来自 OpenAI 和 Anthropic 仍是编排系统的一部分"——但关键原则是"即使移除任何特定模型,评估体系仍应持续爬坡"。
这番话的背景:路透社 4 月报道微软与 OpenAI 的独家许可已改为非独家;The Information 去年 9 月报道微软已开始在部分产品中引入 Anthropic 模型。微软正在从"OpenAI 独家依赖"转向"多模型编排 + 自研优先"。
需要注意的
- 成本和性能数据均为微软自评,非独立基准
- Pro 版目前为 public preview,非正式 GA
- 文字渲染的实际效果还需社区大规模验证
- $106/M image output 的定价在图像模型中属于高端,适合企业场景,个人用户可能更倾向基础版
基于多家媒体转述整理。