一张图生成可编辑 3D 场景:Hyper3D 发布 WorldGen,机器人、影视、游戏都能用
过去两年,AI 生成 3D 模型已经不稀奇:输入一张图或一句话,几十秒出一个模型。但如果你把生成的模型导入 Blender 旋转一圈,多半会皱眉——那只是一个孤零零的"物件",没有场景、没有物理属性,更没法直接用。
9 月 9 日,3D 生成公司 Hyper3D(旗下核心产品为 Rodin)通过 PR Newswire 发布新模型 WorldGen,试图把 3D 生成从"单个资产"推进到"完整场景":上传一张普通的场景照片,它会生成一个由独立、可编辑、可交互物体组成的 3D 场景。这是本文基于官方新闻稿及多家平台转载整理的介绍。
WorldGen 具体能做什么
使用流程不复杂:
- 上传一张场景照片,WorldGen 会自动识别画面里的主要物体;你也可以手动画框,指定要生成哪些对象。
- 生成的每个物体都是独立资产,可以单独编辑、替换、移动,整个场景的布局也由你控制。
- 它不只是"看起来像":系统会推断被遮挡部分的形状,构建物体之间的接触、支撑、悬挂等空间关系,并估算每个物体的位置、尺度、朝向,甚至带上碰撞体、质量和摩擦力等物理属性。
也就是说,你拿到的不只是一张"会动的照片",而是一个可以在引擎里真正摆弄的 3D 场景。
背后的技术:一篇 SIGGRAPH 最佳论文的落地
WorldGen 的技术底子是 Hyper3D 团队的 CAST 研究(从单张 RGB 图像重建组件对齐的 3D 场景),这项工作拿下了 SIGGRAPH 2025 最佳论文奖——SIGGRAPH 是计算机图形学领域最顶级的国际会议。团队在这项研究基础上继续开发了模型、算法和工程系统,形成了现在的多阶段生成流程。
呈现方式上,WorldGen 用了混合表示:需要编辑和交互的物体,由 Hyper3D 自家的 Rodin 模型生成带完整几何的独立 mesh 资产;背景环境则用 3D 高斯泼溅(Gaussian Splatting) 来保留视觉细节和沉浸感。这个组合兼顾了"能编辑"和"好看"。
对谁有用?
做机器人的团队可能是最直接的受益者。训练具身智能需要大量仿真环境,传统做法靠人工建模,又慢又贵。WorldGen 可以直接把真实世界的照片变成可交互、带物理属性的仿真训练场景,并已接入 NVIDIA Isaac Sim 工作流。今年 7 月,Hyper3D 还与 D-Robotics、Motphys 合作打通了从场景生成、仿真、数据采集到策略训练、真机部署验证的完整链路。
影视创作者可以用它做前视和分镜:在可编辑的 3D 场景里规划构图、机位和物件摆放,再把渲染视角喂给 Seedance 2.5 这类视频生成模型——WorldGen 提供稳定的空间结构和镜头关系,视频模型负责角色表演、材质和光影。官方称已有项目在制作中。
游戏开发者可以把生成的资产导入 Blender、Unity(含团结引擎)、PlayCanvas、Unreal Engine,继续做材质、绑骨和关卡设计。此前 Hyper3D 已与 Unity 团结引擎合作,WorldGen 也在团结引擎 2.0 发布会上做了演示。
XR 用户可以在 Apple Vision Pro 等设备上探索重建的空间,近距离查看物体、调整布局,适用于室内设计、沉浸式教育和空间展示等场景。
怎么看这波发布
单个 3D 物体的生成正在"卷"速度和精度,而 WorldGen 选了另一个方向:场景级生成 + 可编辑性 + 物理属性。这三件事凑在一起,价值在于让生成结果能直接进生产管线——尤其对需要仿真数据的机器人行业来说,这可能比"出图更快"实在得多。
需要提醒的是,以上内容基于官方新闻稿整理,实际生成质量、编辑体验和导出效果还有待上手实测。如果你在做游戏资产、机器人仿真或 AI 前视流程,可以到 hyper3d.ai 的 Workspace 里亲自试试。
---
来源:
- PR Newswire 官方新闻稿(2026-09-09):https://finance.yahoo.com/technology/ai/articles/hyper3d-launches-worldgen-turn-single-120600509.html
- Dealroom 收录:https://app.dealroom.co/news/feed/hyper3d-launches-worldgen-to-turn-single-images-into-editable-3d-scenes-for-