Vidu Q4 预览版上线:15 张参考图配 3 段音频,4K 输出每秒 1.4 美分起
2026年10月8日0 次阅读
生数科技 10 月 7 日发布 Vidu Q4 Preview:这是其下一代旗舰视频模型的第一个公开预览版,角色表演、运镜、特效全面升级,支持最多 15 张参考图和 3 段参考音频,输出最高 4K,促销定价低至每秒 0.014 美元,网页端和 API 已可用。
这是什么?
Vidu(生数科技旗下的 AI 视频生成平台)把下一代旗舰模型以"Q4 Preview"的形式先发出来:不是等正式版憋个大招,而是先放一个能用的预览版,让创作者在真实项目里边用边提意见,官方再根据反馈打磨正式版。这次升级集中在三件事上:角色演得像不像、镜头跟不跟得上动作、特效融不融得进画面。
为什么重要?
两件事值得单独拎出来:
- 价格被打下来了:预览期定价每秒 0.014 美元起(约合人民币 1 毛钱)。官方口径是,在同等输出规格和计费条件下,同样预算大约能多出 5 倍的产出量。对"一条成片要试很多遍"的视频创作来说,多试一条的成本直接降了一个量级。
- 控制方式更"剧组"了:AI 视频最难的不是生成一两条好看的 demo,而是让同一个角色、同一套审美在多条镜头里保持一致。这次 Vidu 的解法是"多参考"——最多 15 张参考图 + 3 段参考音频,一次把人物、服装、道具、产品、环境和音色都钉住。
具体能做什么?
- 角色表演:表情、情绪、肢体动作和声音协同调度,从"平静一个眼神"到"大场面动作戏",目标是表演更自然、情绪更有层次。
- 声音不串戏:最多 3 段参考音频,用来锁定音色一致性和情绪表达——角色从头到尾是"同一个声音"。
- 多图参考:最多 15 张参考图,在同一套创作设定里定义人物、服装、道具、产品项和环境。做连续短剧或者电商多 SKU 内容时,这套东西基本是刚需。
- 运镜与特效:追逐、打斗这类复杂动作戏里,运镜与剪辑点跟动作的衔接更连贯;爆炸、烟花、粒子等特效和周围场景融合得更自然。
- 画质档位:输出横跨 540p、720p、1080p、2K 到 4K,2K 和 4K 档还支持 10bit 色深——前期低成本试戏,交付时再上高分辨率。
适合谁用?
官方定位是独立创作者、小工作室和制作团队。落到实际场景:
- 广告团队:一条片子多比几版创意方向和开头方案,不再是烧钱行为;
- 电商团队:同一套视觉设定批量做不同产品、不同受众的变体;
- 影视前期:正式进制作前,先试角色表演、故事板和节奏,验证通过再投入实拍和后期。
价格和怎么用?
Vidu Q4 Preview 已经在 vidu.com 网页端和 API 平台上线,促销定价每秒 0.014 美元起,完整的价格档位和促销条款可以在官网查到。有一点要提醒:既然是"预览版",正式版(完整 Q4 模型)的最终定价、支持分辨率、功能范围和用量条款都可能按套餐和地区调整——如果你的生产管线对输出规格要求严格,建议先小规模验证再铺量。
背景补充
生数科技(Shengshu Technology)给自己的定位是"世界模型公司",研究覆盖视频生成和具身智能。CEO 罗宇航在通稿里的表态挺直接:"高级视频模型应该经得起真实创作的检验,而不是只靠精选 demo。效率上的每一点提升,最终都应该变成创作者多试一条、多做一个版本的自由。"
一句话总结
角色一致性、多参考控制和降到底的试错成本,是这波预览版最实在的三个卖点——核心就是把"多来一条"的成本打下来。