生图3D类

4DHumanDiff:跳过视频中间步骤,文本1分钟直出360°动态人体4D模型

2026年8月2日4 次阅读
4DHumanDiff:跳过视频中间步骤,文本1分钟直出360°动态人体4D模型

做3D动态人体,过去AI的套路是"先生成视频,再从视频重建4D模型"——两步走,又慢又容易翻车。哈尔滨工业大学团队刚发布的4DHumanDiff换了个思路:直接从文本生成4D Gaussian Splatting表示的动态人体,跳过视频这个中间步骤,1分钟出结果,推理速度比现有方法快10倍以上。

旧方法的问题在哪

生成360°可旋转的动态人体资产,是虚拟试穿、沉浸式通信、游戏角色制作等场景的刚需。传统手工流程需要建模、绑骨、动画,耗时耗力。

AI方法出现后,主流做法分两步:先用视频生成模型合成一段人体视频(单视角或多视角),再用4D重建算法从视频里拟合出4D表示。这个流程有三个硬伤:

  1. :视频生成和逐场景4D拟合都很吃算力,整体成本高
  2. 缺几何:单视角视频看不到背面,重建出来的3D几何不完整
  3. 不一致:多视角视频各视角之间常有矛盾,重建质量被拖累

4DHumanDiff 的核心思路

4DHumanDiff的关键决策是:不生成视频,直接在4DGS表示空间里做生成

具体来说,模型接收一段文本提示,输出一组4D Gaussian Splatting参数——每个高斯椭球有位置、大小、旋转、颜色、不透明度,加上时间维度的变形,直接构成一个可以从任意角度、任意时刻渲染的动态人体。

技术架构上:

  • 3D U-Net扩散骨干:在3D空间做去噪生成,天然适配4DGS的空间结构
  • 时序自注意力:让模型理解"同一帧身体各部分的运动是关联的",保证动作连贯
  • 60,000对训练数据:基于MVHumanNet多视角人体数据集构建的text-4DGS配对数据集,规模足够从头训练
  • 2D正则化:约束渲染出的2D图像质量,防止4DGS参数跑偏
  • 免训练4D插值:在生成的时间帧之间做插值,让运动更平滑,不需要额外训练

效果如何

论文实验显示:

  • 速度:1分钟内生成完整360°动态人体,比"视频→4D重建"的两阶段方法快10倍以上
  • 一致性:时间维度(动作连贯)和多视角维度(360°旋转不穿帮)均优于对比方法
  • 质量:2D正则化和4D插值的加入,让渲染画面和运动流畅度都有明显提升

对谁有用

  • 游戏和影视:快速生成NPC或背景角色的动态3D资产,省去手工建模动画
  • 虚拟试穿:从文字描述直接出可旋转的穿衣动态效果
  • 数字人制作:降低动态数字人的制作门槛和成本

局限

  • 目前聚焦人体生成,不是通用的3D/4D场景生成方案
  • 论文阶段,代码和数据集尚未开源
  • 训练数据基于MVHumanNet,人体姿态和外观的多样性有边界
  • 生成质量的上限受扩散模型能力约束,复杂动作和精细服饰仍有挑战

---

基于arXiv论文(arXiv:2607.27634,2026年7月30日提交)及多家媒体转述整理。

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...