生图平面类

xAI 发布 Imagine Image 2.0:精确编辑、5图参考、9比例缩放,Arena 双榜第二

2026年8月9日5 次阅读
xAI 发布 Imagine Image 2.0:精确编辑、5图参考、9比例缩放,Arena 双榜第二

8月7日,xAI 发布了新一代图像生成与编辑模型 Imagine Image 2.0,作为 Grok Imagine 的 Quality Mode 引擎上线。注意,这不是 Grok 的聊天升级,也不是视频模型——它专门做静态图像的生成和编辑。

从"出一张图"到"可控编辑+批量适配"

之前的图像模型大多擅长"给我画一张",但一旦需要改局部、换背景、适配不同尺寸,就得重新来。Imagine Image 2.0 的核心变化是:把图像生成从一次性操作变成了可重复的创意生产流程。

六大核心功能

1. 精确编辑

支持四种编辑方式:魔棒选区(点哪改哪)、分割选择(精确圈定对象)、背景移除(导出透明底素材)、提示词编辑(改选中内容但保留其余画面)。关键是"改产品颜色但不动包装、灯光和桌面"这种局部控制,而不是整张图重新生成。

2. 5张参考图组合

一次生成最多输入5张参考图,每张可以指定不同角色:一张定人物身份、一张定产品形状和颜色、一张定环境、一张定光照、一张定整体风格。比"把这几张图合在一起"更可控。

3. 9种比例智能缩放

从竖版1:2到横版2:1共9种比例,不是拉伸或裁切,而是生成式外扩——模型会补全新暴露的画面区域。一张主图可以快速适配社交媒体封面(9:16)、视频封面(16:9)、横幅(2:1)等场景。但每次缩放都是一次新的生成,仍需人工检查。

4. 任务模板

预置了照片编辑、产品换色、电商图、头像、吉祥物、图标、表情包、UI Kit等模板,降低提示词门槛,也暴露了目标市场:可重复的创意任务,而非开放式艺术创作。

5. 文字与排版

针对海报、信息图、菜单、包装等密集布局场景,模型会同时规划排版和内容,而不是只把字拼上去。

6. 静态世界构建

xAI 展示了一个工作流:分别生成角色、场景、道具,保持统一的视觉语言,为后续视频制作提供一致性的素材基础。

性能表现

根据 xAI 的发布文章,Imagine Image 2.0 在 Arena Image Edit 和 Text-to-Image 两个盲测偏好排行榜上均排名第二。盲测偏好意味着用户在不知道模型身份的情况下选择了它的输出,是有参考价值的信号。不过 xAI 未公布具体 Elo 分、置信区间和分类别成绩,所以"第二"是整体排名,不代表每个具体任务都最优。

当前限制

  • API 尚未开放:目前只能在 Grok.com 和 Grok 移动端的 Quality Mode 使用,API 访问"即将推出"
  • 无公开定价:API 价格、每张图成本均未公布
  • 无技术报告:分辨率、延迟、失败率等关键指标未披露
  • 无法自动化生产流程:没有 API 意味着暂时无法集成到批量工作流中

对谁有用

如果你需要的是"生成一张好看的图",很多模型都能做到。Imagine Image 2.0 的差异化在于:需要反复编辑同一张图、需要多参考图组合、需要一张图适配多种尺寸、需要可重复的创意产出——这些场景它比纯生成模型更合适。电商运营、游戏美术、品牌设计团队是主要受众。

基于多家媒体转述整理。

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...