LiveAnimate:让数字人实时跳舞——近20FPS流式全身动画,3分钟不崩
LiveAnimate:让数字人实时"跳舞"——近20FPS流式全身动画,3分钟不崩
给一张照片,再给一段动作信号,AI就能让照片里的人"动起来"——这就是姿态驱动的人体动画技术。听起来不新鲜,但一直有个老大难问题:要么慢,要么崩。离线方法能出好效果,但渲染一段3分钟视频要等2到5个小时;实时方法倒是快,可生成到后半段人脸就糊了、衣服就变了、背景就漂了。
8月12日,来自香港中文大学、阿里通义千问应用团队和Liblib AI的研究者发布了LiveAnimate,首次在14B参数的视频扩散模型上实现了近20FPS的实时流式全身动画,而且3分钟连续生成下来,画面质量和人物身份几乎不衰减。
它做了什么
LiveAnimate的核心思路是:不再等整段视频算完再输出,而是一块一块地"流式"生成。每生成12帧(约0.6秒),就立刻输出,同时把关键信息存下来给下一块用。
输入只需要两样东西:
- 一张参考图(你要驱动的那个人的照片)
- 连续的姿态流(身体骨骼+手部+面部表情的控制信号)
输出就是一段实时流式视频,人物身份、服装、背景在整个过程中保持一致。
三个关键突破
1. Pose-Retrieval Sink Attention——"记住你之前长什么样"
这是LiveAnimate最核心的创新。长视频生成最大的敌人是"遗忘":模型生成到后面,忘了前面人物长什么样。LiveAnimate设计了一套姿态检索记忆系统:
- Static Sink:永远保留第一块生成结果作为锚点,不管生成多长,始终能"看到"最初的样子
- Dynamic Sink:从前20块中选出5个最具代表性的姿态存入记忆库,当相似姿态再次出现时自动回溯
- 滚动窗口:始终保留当前块和前两块作为即时上下文
这套机制让模型的记忆开销固定不变——不管视频生成多长,占用的计算资源不会增长。
2. 三步蒸馏——从50步压到3步
原始的Wan2.2-Animate需要50步去噪才能生成一帧,这显然没法实时。LiveAnimate通过两阶段训练把推理压缩到3步:
- 第一阶段:用干净的历史块训练模型学会"续写"
- 第二阶段:用模型自己生成的(有瑕疵的)历史来训练,同时把步数从50压到3
结果?3步推理的视觉质量评分(ASE 2.823,IQA 4.047)在30秒片段上反而是所有对比方法中最高的。
3. 双GPU并行优化
推理部署在两块H100上(共160GB显存),通过注意力计算分片、通信与计算重叠、缓存复用等优化,达到19.63FPS。加到4块H100只提升到22.13FPS,收益递减明显,所以双卡是性价比最优配置。
效果对比
研究团队把LiveAnimate和5个现有方法做了对比:EverAnimate、One-to-All、SCAIL、UniAnimate-DiT和Wan2.2-Animate原版。
在3分钟长视频测试中:
- LiveAnimate:质量和身份一致性几乎全程稳定
- One-to-All:视觉质量和身份一致性明显退化
- UniAnimate-DiT和SCAIL:出现闪烁
- Wan2.2-Animate和EverAnimate:后期出现颜色偏移和背景漂移
时间对比更悬殊:同样生成3分钟视频,竞品需要2到5小时离线渲染,LiveAnimate大约4分钟完成。
局限性
LiveAnimate目前也有明显的短板:
- 硬件门槛高:双H100(160GB显存)不是普通用户能拿到的,消费级显卡暂时跑不动
- 代码和权重未开放:GitHub标注"coming soon",权重更是没有时间表
- 分辨率有限:目前支持480×480、384×672、672×384,离高清还有距离
- 部分场景身份保持略弱:论文自己也承认,在特定情况下,两个离线方法在身份保持上略优于LiveAnimate
对行业意味着什么
LiveAnimate的意义不在于它现在就能部署到每个人的电脑上,而在于它证明了一件事:十亿参数级的视频扩散模型,是可以做到实时流式驱动的。
在此之前,姿态驱动人体动画基本只有两条路——要么用轻量模型实时但质量差,要么用大模型离线但等不起。LiveAnimate打通了第三条路:大模型+流式生成+记忆机制=实时且质量稳定。
对于虚拟主播、直播数字人、远程会议替身、AI编舞实时预览这些场景,这意味着从"预录制"走向"真直播"的可能性。当后续优化把硬件需求降下来、分辨率提上去,实时数字人驱动可能成为标配而非奢侈品。
---
来源:
- 论文:[LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time](https://arxiv.org/abs/2608.11745)(arXiv, 2026年8月12日提交)
- 项目页:[liveanimate.github.io](https://liveanimate.github.io/)
- 媒体报道:[Unite.AI](https://www.unite.ai/toward-perpetual-full-body-deepfake-video-generation/)(2026年8月13日)