Runway 发布 Solaris:用视频模型逐帧「画」出操作系统,点击即生成界面
🎬 Runway 发布 Solaris:用视频模型逐帧「画」出操作系统,点击即生成界面
不写代码、不做设计稿——界面本身由模型实时渲染,你的每次点击都在"生成"下一个画面
Runway 发布了一个新模型 Solaris,它提出的问题很简单:如果操作系统在你使用它的过程中"现场生成"App 和网站,会是什么样?Solaris 是 Runway 新模型家族「接口世界模型」(Interface World Models)的第一个作品——它不靠代码搭界面,而是像视频模型一样逐帧把界面"渲染"出来,你的每次点击和拖拽都会实时改变画面。
- 界面不是"开发"出来的,是逐帧实时"渲染"出来的:每一帧都随着你的操作实时合成
- 点击、拖拽就是输入信号:模型把交互当条件,直接生成下一帧画面
- 推理 + 渲染双引擎:语言模型决定界面如何演化,视频模型逐帧画出来
- 零编程门槛:普通人也能"画"出能用的交互界面
⚙️ 工作原理:界面是"活"的
传统软件的界面是提前写好的:设计师出图、工程师写代码,界面在被使用之前就已经固定。Solaris 反过来——它直接渲染界面本身,每一帧都随着你的操作实时合成。
当你点击一个按钮或拖动一个元素,这些动作会被当作"条件信号"喂给模型,模型据此生成接下来的画面。Runway 的做法是把两个系统拼在一起:
🧠 语言模型 = 大脑
负责"决定界面如何演化":你做了什么操作、接下来界面应该变成什么样。
🎞️ Solaris 本体 = 画笔
逐帧把界面实时"画"出来,像视频生成一样合成每一帧,保持视觉上的连续与精细。
用 Runway 官方的话说:"Solaris starts with a question: what happens when an operating system generates apps and websites as you use them?"(当操作系统在你使用它的同时生成 App 和网站,会发生什么?)
🛍️ 能干什么:试试"拖一件衬衫上身"
Runway 给了一个直观例子:把一张自己的照片作为参考,进入一个虚拟服装店,你只需要点击衣架上的衬衫、拖到自己身上,就能看到上身效果——全程不需要任何代码,界面本身是模型实时生成的。
你也可以直接输入文字指令,比如"把这个物体的颜色换掉""把照片里的某个元素移到别处"。CNET 的形容很贴切:Solaris 用起来像一场"随你操作不断变化的直播视频"。
🔄 和现有方式差在哪
| 维度 | 传统开发 / AI 生成图片 | Solaris |
|---|---|---|
| 界面来源 | 代码实现,或生成静态设计图 | 模型逐帧实时渲染 |
| 能否交互 | 图片不能"跑";代码要提前写死行为 | 交互即生成:点击/拖拽直接驱动下一帧 |
| 中间环节 | 设计稿 → 代码(有损翻译) | 跳过中间层,直接渲染界面层 |
| 修改成本 | 改需求 = 改代码 / 重新生成 | 一句话或一次拖拽即可改变界面 |
现在的 AI 图像模型已经能生成几乎以假乱真的界面截图,但图片"跑"不起来——要变成真正能用的网站或 App,必须经过一道翻译:把视觉设计转换成中间表示(通常是代码)。Runway 认为这道翻译工序既是瓶颈也是损失:每种行为都要提前定义和实现,软件上线时就已经是"可能交互空间的有损压缩"。Solaris 的思路是干脆跳过中间层。
📋 为什么"世界模型"是下一个方向?
世界模型(World Models)指的不只是生成一段视频,而是让模型学习并模拟一个可以持续交互的环境的运行规律——物理、空间、因果。业界普遍认为这是 AI 的下一个重要方向。此前世界模型多用于游戏环境和 3D 场景模拟,Solaris 是这一方向上第一个明确落在"界面/操作系统"上的产品级尝试。
本文由加装AI助手整理发布 | 数据来源:Runway 官方博客、CNET