阿里发布 Qwen3.8-Omni-Flash:能听会说还会剪视频,价格直接砍掉九成
2026年9月19日0 次阅读
阿里发布 Qwen3.8-Omni-Flash:能听会说还会剪视频,价格直接砍掉九成
导语
9月18日,阿里发布新一代全模态大模型 Qwen3.8-Omni-Flash。它能统一处理文本、图像、音频和视频,还带着一套 Agent 能力:你给它一段会议录像或一部剧,它自己找重点、调工具、交结果。更重要的是,音视频输入价格比上一代降了九成多。(注:本文基于多家媒体转述整理)
这是什么
- 一个"全模态"模型:文字、图片、声音、视频一起吃进去,不用再分开调用不同模型。
- 在累计 30 项评测上,相比上一代 Qwen3.5-Omni-Plus 平均提升超过 26%;音视频理解、长音频理解等单项提升明显。
- 支持 113 种语言及方言识别、36 种语言生成,上下文长度到百万级——几个小时的长视频、多人会议都能整段处理。
- 阿里称其音频能力整体超过最新的 Gemini 3.8-Flash,多项表现逼近 Gemini 3.8 Flash。
为什么重要
- Agent 真能干活了:你描述需求,它配合工具完成 MV 制作、影视剪辑、会议整理。面对数小时长音视频,它会"带着问题找答案",自主定位关键片段再分析,Token 消耗降了 45.7%——又准又省钱。
- 价格打下来了:相比上代,音视频平均输入价格降幅超过 93%。百万 Token 的图文音视频混合输入约 0.8 元。以前因为贵不敢往模型里塞长视频的团队,现在可以重新算账了。
- 配套开源:阿里同时开源了实时交互运行框架 Qwen-Live Harness,扩展了 Qwen-MM-Plugins 插件,还开源了 Video2Note(视频转图文笔记)和 Omni Skill Creator(从操作演示自动提炼 Agent 技能)。开发者可以直接上手复现。
一个有意思的细节
训练过程中,这个模型涌现出了"自我迭代"能力:它像一名 AI 算法工程师,在 12 小时内自主选定评测集、做基线测试、听语音样本、构建训练数据,连续 4 轮实验累计构建 3413 条训练数据,最终把 Qwen2.5-Omni-3B 的四川话识别字符错误率降了约 10%。模型自己训练模型,这在公开演示里还比较少见。
对谁有用
- 内容创作者:一句话让模型根据音乐生成 MV、翻译短剧、解说影视剧,素材理解和成片质检一条龙。
- 企业用户:会议整理、音视频知识沉淀,配合 Video2Note 直接产出图文 PDF 笔记。
- 开发者:Qwen3.8-Omni-Flash 已上架千问 AI 平台,Qwen Studio 可免费体验;Qwen-Live Harness 开源,实时交互场景有现成运行环境。
相关发布
阿里同时推出实时交互模型 Qwen3.8-Omni-Flash-Realtime,面向语音助手、实时字幕等低延迟场景。
来源
- DOIT传媒:阿里发布全模态模型 Qwen3.8-Omni-Flash(2026-09-18)
- 凤凰网科技:阿里发布 Qwen3.8-Omni-Flash,音视频 API 降价超 90%
- 七牛云社区:Qwen3.8-Omni-Flash 发布全解(2026-09-18)