字节 SeedRealtime 发布:首个音视频全双工大模型,AI 终于能「边看边听边说」
8月5日,字节跳动 Seed 团队发布 SeedRealtime——业界首个规模化落地的音视频全双工大模型,已在豆包 App 全量上线。它用统一端到端架构原生融合音频、视频与文本,摆脱了传统 ASR+LLM+TTS 级联流水线,对话节奏问题减少约50%。更关键的是,它学会了主动开口——持续盯着画面,认出文物、翻到指定章节、操作出错时主动提醒。
这是什么?
SeedRealtime 是一个原生音视频全双工大模型。简单说,它让 AI 第一次真正像视频通话里的人一样——同时用眼睛看、用耳朵听、用嘴巴说,而不是像对讲机那样轮流发言。
传统"AI 视频通话"是拼出来的:你的声音先经过 ASR 语音识别转成文字,画面经过视觉模型转成文字描述,然后大模型思考生成文字回复,最后 TTS 合成语音播放。四个模块串行接力,每个模块几十到几百毫秒延迟,叠加起来就是明显的"愣一下"。更致命的是,你的语气、犹豫、画面里的手势,在被压成文字的那一刻就丢失了。
SeedRealtime 用统一的端到端架构,把音频、视频、文本原生融合进同一个网络,在连续的多模态信息流上同步完成感知、理解、决策与表达,不再依赖外部 VAD(语音活动检测)做轮次判断。不是"听完→看完→想完→说",而是像人一样,眼睛耳朵嘴同时在工作。
落地方式也很直接:把豆包 App 更新到最新版,在对话框里点"打电话"进入视频通话界面就能用。不用申请,不用排队,不是内测名单。
为什么重要?三级台阶看懂全双工
"全双工"这个词经常被混用,实际上经历了三个阶段:
半双工:你说完→它听→它想→它说,像对讲机,必须等一方讲完。2024-2025年绝大多数语音助手都是这个模式。
音频全双工:边听边说,可随时打断、可回应"嗯嗯",接近打电话。2026年4月,豆包基于 Seeduplex 模型上线了音频全双工通话,比 OpenAI 的 GPT-Live 早了三个月。7月8日,OpenAI 用 GPT-Live 替换了 ChatGPT 的语音引擎,也走到了这一步。
音视频全双工:声音+画面+时序同时进,边看边听边说,接近视频通话里的一个"在场的人"。SeedRealtime 是第一个走到这一步并规模化落地的。
把这条脉络串起来看:字节在实时交互这条线上是连续投入的,不是临时跟风。SeedRealtime 是从"只有耳朵和嘴"变成"还长了眼睛"的关键一步。
横向对比当前四款实时交互产品:GPT-Live 是音频全双工,能边听边说,但目前没有摄像头输入;Gemini Live 有摄像头和屏幕共享,但对话仍是轮次制;Claude 语音模式支持多模型切换和工具集成,但也是轮次制。SeedRealtime 是唯一同时做到音视频原生全双工和主动提醒的。
两个核心突破
对话节奏问题减少约50%
字节公布的端到端人工评测显示,相比级联模型,音视频对话中的节奏问题减少了约一半。所谓"节奏问题"具体是三类卡壳:
- 抢话:你话还没说完,它急着接
- 迟滞:你说完了,它愣一两秒才开口
- 误触发:旁人聊天、背景电视声、机场广播,它以为在跟它说话
为什么这个数字比"某某基准提高3分"更值钱?因为实时对话的门槛从来不是知识量,是时机。一个知识水平95分但总抢话的助手,用户用两次就关掉了;一个知识85分但节奏舒服的助手,能被天天用。语音交互这十年反复卡在同一个地方——不是 AI 不够聪明,是它不懂什么时候该闭嘴。
AI 学会了"主动开口"
如果说全双工解决的是"不打断人",那 SeedRealtime 最有产品意义的能力是反过来的——它会在你没提问的时候主动说话。
官方给出的几个场景:
- 博物馆参观:持续看画面,认出你要找的那件文物就主动提醒
- 阅读论文:跟着你翻页,翻到指定章节自动提示
- 操作咖啡机:步骤按错了立刻纠正
- 多人聚会:认出不同人的身份,一直对应到各自的发言者
- 外国游客看中文菜单:实时理解菜单和服务员的介绍
这里面藏着一个交互范式的转折:从"被动响应"到"持续在场"。过去的 AI 是一个工具——你调用它,它返回结果,然后它就不存在了。SeedRealtime 想做的是一个"一直在旁边的人"——它一直看着,判断什么时候值得开口。
还有一个被低估的细节:用视觉消解指代。你指着桌上某个东西说"这个怎么弄",模型要结合当前画面、你的手势和视线,判断"这个"到底指哪个。指代消解是语音助手做了十年都没解决的老问题,因为纯音频里根本没有"这个"的答案。加上眼睛,问题的性质就变了。
反过来,知道什么时候闭嘴同样是能力。机场嘈杂环境中,模型能区分你和旁人的对话,不因背景噪声误触发;儿童学习场景里,不被背景电话声打断。
对谁有用?
普通用户:今天就能试。最值得先试的三类场景——看不懂的东西(外文菜单、说明书、药盒、仪表盘,举着摄像头问,比拍照上传快一个数量级);需要陪着做的事(练口语、跟着菜谱做饭、组装家具,它能跟着你的进度走);需要被纠错的操作(调试设备、按流程操作,这是"主动提醒"真正比传统助手强的地方)。
内容与教育从业者:持续监测+主动提醒这套组合,天然对应几种产品——陪练(口语、乐器、健身动作纠正)、导览(博物馆、展会、门店)、巡检(设备、流程合规)。过去做这类产品,要么请真人,要么写死一堆规则脚本,现在成本结构变了。但要提醒一句:官方演示的都是成功案例,真实场景里误提醒的干扰成本可能很高,做产品前必须自己压测。
开发者:SeedRealtime 目前只在豆包 App 内可用,官方未公布 API 与定价。想做原型的话,现阶段的现实选择是 GPT-Live 的实时接口或 Gemini Live 的 Live API。有一件事必须提前想清楚:实时多模态的成本模型和文本模型完全不是一回事。文本按 token 计费,一次调用几分钱;实时音视频按连接时长计费,而且摄像头流是持续消耗。一个"挂机十分钟"的陪练场景,成本可能是一次文本问答的几百倍。
三个诚实边界
数据全为厂商自评。"节奏问题减少约50%"是字节自己的端到端人工评测结果。评测集怎么构成、对照的"级联模型"具体是哪一套、评测员规模多少、是否盲测——通稿里一个字没有。也没有第三方复现。更根本的问题是:实时音视频交互目前不存在公认的公开基准,任何"谁比谁强多少"的说法,现阶段都只能当作方向性判断。
关键参数一个都没公开。端到端时延(毫秒)、模型规模、是否开源、API 定价、并发能力——官方发布里全部缺席。而且字节自己说了,"未来将继续优化模型的端到端时延、主动感知与决策能力、多人复杂场景理解能力以及工具调用能力"。这句话的潜台词很清楚:当下这四项都还不是最优状态。
常开摄像头的隐私账还没人认真算。主动提醒能力的前提,是模型持续看着你的画面。摄像头在什么条件下开启、什么时候真正关闭?音视频流是实时处理后丢弃,还是留存?这些数据会不会进入训练?用户能不能一键退出?欧盟《AI 法案》的透明度与告知义务已于8月2日生效,国内《个人信息保护法》对生物识别信息本就有单独同意的要求。而 SeedRealtime 的"多人聚会识别不同人物身份"这个演示场景,涉及的是在场其他人的生物特征——他们并没有同意。这道题不解决,这类产品在 to B 和出海场景上会一直有天花板。
---
基于字节跳动 Seed 团队官方发布及凤凰网科技、AI工具宝箱等多家媒体转述整理。数据截至2026年8月6日,厂商自评数据未经第三方独立验证。