AI编舞

iFlytek 2026 实时生成数字人首发:全链路驱动表情动作,移动数字人走进现实

2026年7月31日2 次阅读
科大讯飞首发实时生成数字人:表情动作实时刷新,从屏幕里走到现实场景

科大讯飞首发实时生成数字人:表情动作实时刷新,从屏幕里走到现实场景

数字人直播时能自然撩头发、起身热舞、随手拿杯子喝水,遇到弹幕提问还能临场接话——这不是提前录好的动画,而是科大讯飞刚刚发布的实时生成超拟人数字人。7月30日,科大讯飞推出数字人全系列产品升级,核心突破是从"提前生成动作库+实时驱动"的传统模式,跨越到"全链路实时生成":数字人的台词、表情、肢体动作全部由语义实时驱动,不再受固定动作库限制。

这次升级到底新在哪?

过去数字人直播的常见做法是:提前录制一批动作片段,播放时根据触发条件拼接调用。问题很明显——动作有限、衔接生硬、遇到意外提问就卡壳。

科大讯飞这次的方案彻底换了个思路:全链路实时生成。数字人听到什么、想说什么,语义直接驱动表情和肢体变化,不需要提前准备动作库。单张照片就能生成数字人形象,动作可以无限自由生成,不再受预设片段约束。

实际效果如何?以讯飞展示的旅游主播"寻笙"为例:她聊天时会配上自然手势、脑袋跟着语气晃动,低头刷手机、撩头发、拿杯子喝水这些下意识小细节都有,起身热舞时画面也不会穿帮。她还能主动弹幕互动、答谢粉丝礼物、察觉冷场时主动抛话题——这些都需要实时语义理解和动作规划能力。

三大核心技术拆解

双时域记忆驱动的长时视频生成

数字人长时间在线最大的敌人是"形象漂移"——跑着跑着五官歪了、背景糊了。讯飞的方案是构建双层记忆体系:短期记忆守住相邻帧之间表情、肢体、画面纹理的连贯性;长期记忆锁定人物样貌特征、外观风格和固定场景基底。再搭配动态状态压缩、关键特征回溯、跨片段一致性约束三重手段,抑制长时间推演中的误差累积。

数据引导式低步数流式蒸馏

实时生成要快,但视频扩散模型直接做少步推理会出现画面失真、畸变、闪烁、动作僵硬。讯飞的解法是:用教师模型基于真实视频样本打分校准,引导学生模型的生成结果贴合真实画面分布。同时叠加跨视频历史条件与时序一致性约束,推理时复用历史时序信息,降低延迟的同时兼顾画质、动态多样性和前后衔接稳定性。整套推理链路搭建异构流水线,优先输出首帧画面,后续帧在播放间隙异步运算。

多模感知评价体系+强化学习

让数字人摆脱机械播报的关键一步:基于多模感知评价体系做强化学习训练,让数字人做到应答准确、神态动作逼真、指令即时响应。不再是"听到关键词→播放对应动作",而是真正理解对话语境后生成合适的表情和肢体反应。

移动数字人:从屏幕走进现实场景

这次升级还有一个亮点:移动数字人。不只是屏幕里的虚拟形象,而是自带自动引路、躲障避行、声源追踪、多模态感知的实体设备,配合透明屏实现虚实同步的沉浸式视觉观感。

一台设备就能包揽展厅、门店、展馆、展会里的带路、讲解、一对一接待任务,还能无缝切换多国语言、按需更换外形和声音。数字人终于从"屏幕里的花瓶"变成了"能走能说能带路"的交互入口。

产品矩阵全线更新

这次升级不只是单一产品,而是讯飞智作、AI虚拟人交互平台、讯飞绘文全线更新,加上超拟人语音合成技术加持,形成从建模、调试到上线运维的完整工具链。

对谁有用?什么场景?

  • 电商直播:7×24小时在线主播,弹幕互动、主动抛话题盘活气氛,长期折算成本远低于真人主播
  • 企业客服/培训:标准化话术输出不会参差不齐,同时保持自然交互体验
  • 文旅/展厅:移动导览+多语言切换,一台设备替代多名讲解员
  • 金融/零售:数字品鉴师、理财顾问等角色,一对一接待

限制也要看清:高品质数字人形象定制门槛仍然不低,全息硬件、线下大屏终端部署与长期运维的投入对中小体量企业仍是负担。讯飞这次在降低部署门槛上做了努力,但距离"开箱即用"还有距离。

---

基于多家媒体转述整理。来源:凤凰网科技、网易。

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...