阿里万相2.7上线:一句话改视频剧情,5人同框+音色参考,视频编辑进入自然语言时代
阿里视频生成模型"万相"(Wan)系列迎来2.7版本。这次升级不只是画质变好——Wan2.7最大的变化是把"视频编辑"做成了核心能力:你可以用自然语言直接修改已有视频的画面和剧情,把复杂的后期工作简化成一句话操作。
五大任务类型,从生成到编辑全覆盖
Wan2.7在阿里云百炼平台和ComfyUI上同时上线,支持五种任务模式:
文生视频(T2V):输入文字描述生成视频,支持2-15秒时长,720P或1080P输出。亮点是"多镜头叙事"——你可以在提示词里用时间戳写分镜,比如"第1个镜头[0-3秒] 全景:雨夜街头,第2个镜头[3-6秒] 中景:侦探进入建筑",模型自动理解镜头结构。还能传入音频URL让视频跟着音频节奏走,或者不开音频让模型自动配背景音乐和音效。
图生视频(I2V):支持首帧、首帧+末帧两种模式,也可以用音频驱动。给一张起始图和一张结束图,模型补出中间的过渡动画。
参考图生视频(R2V):这是2.7的新能力。你可以同时传入最多5张真人参考图,让不同角色出现在同一个视频里互动。更特别的是支持"音色参考"——传入一段音频,模型不仅参考人物外观,还会参考声音特征,保持音画身份一致。这对短剧、广告里需要固定角色形象的场景非常实用。
视频续写:给一段已有视频,用文字描述后续内容,模型接着往下生成。
视频编辑:2.7版本的重头戏。你可以用自然语言指令修改视频画面和剧情,也可以用参考图做风格迁移,或者复刻某个视频的动态创意。阿里云产品页的描述很直白:"将复杂后期简化为一句话操作"。
相比2.6升级了什么
根据ComfyUI官方文档,Wan2.7在画质、动态表现、风格化和一致性四个维度都有"显著提升"。具体来说:
- 分辨率控制从旧的
size字段改为resolution+ratio组合,更灵活 - 支持反向提示词(negative_prompt),可以明确排除不想要的元素
- 提示词长度上限提升到5000字符,比之前版本能描述更复杂的场景
- 新增3×3网格图像生成模式
ComfyUI集成:5种工作流模板即开即用
Wan2.7已通过ComfyUI Partner Nodes上线,提供了5种预设工作流模板:文生视频、图生视频、参考图生视频、视频续写、视频编辑。本地用户需要更新到最新版ComfyUI,也可以直接在Comfy Cloud上在线体验。
定价与可用性
Wan2.7通过阿里云百炼平台提供API调用,按秒计费,支持720P和1080P两档分辨率,视频时长2-15秒。新用户开通百炼可免费获得50秒视频生成额度。目前支持华北2(北京)和新加坡两个地域。
需要注意的是,Wan2.7目前是API闭源模型。如果你需要本地部署,Wan2.2(Apache 2.0开源)仍是开源版本的选择。
谁该关注
- 短视频创作者:多镜头叙事+角色参考,适合批量生产短剧内容
- 广告制作团队:视频编辑能力让修改创意不再需要重新生成
- 电商运营:产品视频快速生成,音频驱动让商品展示更生动
- ComfyUI用户:5种工作流模板直接可用,无需自己搭节点
Wan2.7的"视频编辑"能力是目前国产视频模型中少见的——大多数模型还停留在"生成一次定终身"的阶段,能直接修改已有视频的还不多。这个方向如果成熟,视频生成的实用价值会上一个台阶。
*基于阿里云百炼API文档、ComfyUI官方文档及阿里云产品页信息整理。*