字节跳动被曝筹备实时空间视频模型:张一鸣亲自督导,下场"世界模型"竞赛
发布时间:2026年9月8日 | 分类:视频模型
一句话先说结论:据彭博社 9 月 7 日报道,字节跳动正在筹备一个能"实时生成空间视频"的 AI 模型,也就是圈内常说的"世界模型"方向,而且这次是创始人张一鸣亲自督导——目前项目还在筹备阶段,官方尚未正式发布。
这是个什么消息?
9 月 7 日,彭博社率先报道:字节跳动正在打造一个新的 AI 视频模型,它和你现在常见的"输入一段提示词、等几十秒生成一条视频"的工具不太一样——这个模型的目标是实时生成空间视频,也就是一边交互、一边生成,你能"走进"视频里的世界。
简单类比:现在的 AI 视频像看一段提前拍好的片子,而这个方向想做的是"你往哪看、模型就实时渲染哪",更接近电影《头号玩家》里的体验。这类技术业内统称为"世界模型"(World Model)。
需要提醒:这条消息基于多家媒体转述整理,字节跳动官方目前没有发布任何正式公告,具体参数、上线时间都还是未知数。
张一鸣亲自督导,意味着什么?
据彭博社及后续多家媒体(联合早报、36 氪、The Next Web 等)报道,这次项目由字节跳动创始人张一鸣亲自负责督导。在字节内部,创始人亲自下场盯一个 AI 项目并不多见——上一个类似待遇的是大模型团队 Seed。
多家媒体的报道口径一致:这是字节在"世界模型"赛道上的重要落子,也意味着这家公司认为视频生成的下一站不是"更清晰的短视频",而是"可实时交互的三维世界"。
为什么"实时空间视频"值得关注?
现在的 AI 视频生成(比如可灵、即梦、Sora 这类工具)有三个共同瓶颈:
- 慢:生成几秒的视频往往要等待几十秒甚至几分钟
- 被动:视频生成完就固定了,你只能看,不能改视角、不能互动
- 不连续:每次生成都是一个独立片段,没法构成一个持续存在的"世界"
- 数据和场景:抖音 + TikTok 是全球最大的短视频平台,对视频生成有天然的需求和训练数据积累
- 算力:字节是国内算力储备最激进的公司之一
- 硬件:旗下有 PICO VR 设备,空间视频和 VR 硬件是天然搭档
- 人才和钱:张一鸣个人在 AI 上的投入近年来持续加码
- 这条消息是媒体转述,不是官方公告,后续细节可能有出入
- 网上如果出现自称"字节世界模型"的演示视频或下载链接,谨慎对待——项目尚未发布,大概率是蹭热度的仿冒内容
- "实时生成"≠"立刻商用",即使模型存在,从曝光到面向公众开放通常还有很长一段路
- 彭博社(2026-09-07):ByteDance Joins AI Elite in Race to Perfect World Models
- 联合早报(2026-09-08):字节跳动据报拟推世界模型 张一鸣亲自督导
- The Next Web(2026-09-07):ByteDance is preparing a real-time spatial video model under Zhang Yiming
- cnBeta / 36 氪(2026-09-07~08)相关转述报道
- Bloomberg(2026-09-07):ByteDance Joins AI Elite in Race to Perfect World Models
- 联合早报(2026-09-08):字节跳动据报拟推世界模型 张一鸣亲自督导
- The Next Web(2026-09-07):ByteDance is preparing a real-time spatial video model under Zhang Yiming
- cnBeta / 36氪(2026-09-07~08)相关转述报道
实时空间视频模型想解决的就是这三点:生成速度快到可以即时响应,画面随你的操作变化,而且所有画面都属于同一个连续的 3D 世界。一旦做成,影响的不只是短视频创作,还包括游戏、VR/AR、虚拟拍摄甚至线上教育。
字节凭什么入场?
虽然细节尚未公布,但字节的筹码不难理解:
竞争格局:这条赛道不止字节一家
"世界模型"目前是全球 AI 大厂公认的下一站,Apple、Meta、Google、Nvidia 都有相关布局。海外方面,Runway 上月底发布的 Solaris 也在探索"实时生成的交互界面"。字节的加入,让这条赛道第一次有了来自中国短视频巨头的重量级玩家。
什么时候能用上?
现在还早。目前所有信息都来自媒体曝光,项目处于筹备阶段,没有官方确认的发布时间。如果你是内容创作者或 VR 从业者,值得保持关注,但不用急着调整自己的工具链——等官方正式发布、能看到实际演示效果之后再评估也不迟。
注意事项(避坑)
参考来源
本文基于多家媒体转述整理,非官方公告;信息截至 2026 年 9 月 8 日。