Cloudflare 开源 Clef-omni:决策模型学会「听」音频了,一次前向直接出结构化判断
先说清楚这是什么:上周刚开源决策模型 Clef 和 Clef-flash 的 Cloudflare,10 月 9 日又发新品 Clef-omni。这一次,决策模型补上了音频和视频两块拼图——它能直接「听」wav/mp3 音频、「看」mp4/webm 视频,然后在一个模型里输出结构化的判断结果,权重已以 Apache-2.0 协议在 Hugging Face 开源。
- 全模态输入:文字、图片、音频(wav/mp3)、视频(mp4/webm)一网打尽,不用再搭「转文字→分类」级联管线
- 只出决策、不跑题:一次前向计算直接输出每个预定义选项的概率,没有自由文本生成
- 发布即降价:Clef-omni 定价 $0.15/百万输入 tokens,Clef-flash 降价超一半至 $0.038
- 权重开源:Apache-2.0 协议,SGLang 0.5.22 将原生支持,可自部署
「决策模型」是个什么物种?
它和 ChatGPT 这类聊天模型完全是两种东西:不做自由文本生成。你给它一份输入(现在可以是文字、图片、音频或视频)和一组预定义的问题选项,它一次前向计算就直接输出每个选项的概率——不需要解析生成文本,也不存在模型「跑题」的问题。
比如给一段客服录音和一份质检问题清单(「用户情绪是否负面?是否提到竞品?」),它一口气把所有问题的概率都算出来。官方给它的定位是把「检测和分类」这件事搬进模型层,让普通开发者调用一个 API 就能完成过去需要专门机器学习团队训练零样本分类器才能做的活。
技术底细:Qwen3-Omni 底座 + 联合打分头
Clef-omni 基于 Qwen 的 Qwen3-Omni-30B-A3B-Instruct(30B 参数、每次激活 3B 的 MoE 架构)做后训练,保留了底座的视觉和音频编码器。模型里加了一个「联合 schema 头」——一个小型 transformer,负责把输入内容路由给每个问题、给所有问题的所有选项一次性打分。
值得一提的是,底座自带的语音输出权重(talker 和 code2wav)原封不动保留在权重文件里,但托管版不会加载——这是个「只听不说」的判断模型。
价格:发布即降价,老模型也提速
| 模型 | 价格(每百万输入 tokens) | 上下文窗口 | 备注 |
|---|---|---|---|
| Clef-omni | $0.15(今日上线) | — | 新增音频/视频输入 |
| Clef-flash | $0.09 → $0.038 | 64k → 24k | 比同类 Jev 更便宜 |
| Clef | $0.24(不变) | 64k | 托管端提速约 1.7-2× |
Clef-flash 缩窗口的代价换来更低的门槛价,官方数据显示只有 0.24% 的请求输入超过 24k tokens。Clef 本体的提速来自切换到 SGLang 推理框架(3400 tokens 输入的延迟中位数从 616ms 降到 305ms),模型权重没变。
开源信息:怎么自己跑
- Hugging Face:搜
Cloudflare/clef-omni拿权重,同日还有 Clef / Clef-flash 权重页更新(SGLang 启动命令已加进 README) - 协议:Apache-2.0,商用无障碍
- SGLang:相关 PR 已合入,0.5.22 版本将原生支持;官方还提供了 cookbook
- 托管版:已在 Workers AI 上线,开发者文档可直接调用
📋 它能读什么、输出什么(官方口径)
输入:状态信息可以是文本、JSON、图片、音频或视频;外加一份带类型的「问题 schema」。输出:单次前向,为每个问题的每个允许选项输出一个 logit,逐问题做 softmax 得到概率。API 与 Jev、SystemOne 完全兼容。
谁该关注
- 做通话/音频质检的团队:不用再搭「ASR→文本分类」流水线,一个模型直接出结构化结果,也少了转写出错连带下游全错的环节
- 内容审核/合规场景:音视频直接进模型,按预设问题出概率,方便接进自动化流程
- 想省成本的评审者:Clef-flash 降到 $0.038/M tokens,轻量分类场景值得比一比
一句话总结:决策模型这个新物种从「只能看字」进化到「能听能看」,而且开源、便宜、不跑题——如果你的业务要从音视频里出结构化判断,它值得进候选清单。
本文由加装AI助手整理发布 | 数据来源:Cloudflare 官方博客、Hugging Face 模型页