AI开始造世界:张一鸣、奥特曼、李飞飞,同时盯上了同一个方向
2026-09-16 16:14:34  腾讯   [查看原文]

这个 9 月,AI 圈最热闹的不是又一个新模型刷榜,而是一个更安静、也更值钱的转向:AI 不再满足于在屏幕里给你放一段视频,它开始造一个你能走进去的世界。

9 月 7 日,彭博社独家报道:字节跳动正在基于 Seedance 视频模型开发一款实时空间视频生成模型,创始人张一鸣亲自跨部门督导,调集模型、云、Pico 硬件和内容业务线的资源,最快 10 月推出。9 月 3 日,OpenAI 发布 GPT-6 Astra,开发者惊讶地发现它能直接操作 Blender 和虚幻引擎,从建模到渲染一条龙做出可漫游的 3D 场景。再往前一天,9 月 1 日,李飞飞的 World Labs 发布了原生世界模型 Atlas。

三条完全不同的技术路线,同一个终点。这件事值得每一个做内容、做产品的人认真看一眼。

一、字节:把"看视频"变成"走进视频"

先看字节的打法。按彭博社披露的测试指标:模型在云端实时渲染,端到端延迟约 50 毫秒,每秒生成 20 帧画面。

这两个数字是关键。50 毫秒已经逼近人类感知阈值,转头、伸手,眼前的虚拟环境立刻跟着变——不是播放一段提前渲染好的视频,而是真的"身处其中"。而云端渲染意味着:用户不需要买昂贵的显卡,重计算全部在字节自己的服务器上完成,画面串流到 Pico 头显。这一手直接砍掉了 VR 普及最大的门槛——硬件成本。

应用场景也全是字节的熟地:直播、互动短剧、游戏。过去抖音的算法是让人一条接一条刷下去,现在字节想换一种讲法——让用户不再隔着屏幕看,而是进到画面里。

字节为什么这么急?看看它身处的池塘。Counterpoint Research 数据显示,2025 年上半年全球 VR 头显出货量同比下降 14%,三季度继续下滑 17%。Pico 在 2024 年的全球市场份额只剩 5% 左右,2023 年以来经历多轮调整,今年 7 月创始人周宏伟离任。硬件这条路越走越窄,字节把宝押在"内容形态升级"上:不是卖更好的头显,而是造只有头显里才有的体验。

硬件救不了的池子,就让内容重新把水烧开。二、三条路线,同一个拐点

有意思的是,盯上 3D 世界的不止字节一家,而且三家走的是完全不同的路。

OpenAI 的 GPT-6 Astra 走的是"大语言模型操作专业软件"的路线:官方演示里,给它一段文字,它先在 Blender 里完成建筑建模、材质贴图与光影渲染,再自动写导出脚本,把成品导入虚幻引擎 5,生成一个可以自由漫游的交互场景,全程不需要人工分步介入。开放测试后,开发者社区甚至跑出了组合玩法:Astra 负责写脚本、搭 3D 白模、规划镜头,再调用 Seedance 2.5 渲染成片——影视级的前期预演,一句话搞定。

李飞飞的 World Labs 走的是"原生世界模型"路线:不借助任何外部软件,模型直接理解和生成三维空间本身。英伟达则把 Cosmos 3 世界模型平台开源,统一建模文本、图像、视频、音频和动作序列,既能生成带同步音效的视频,也能预测机器人下一步动作,提供 16B 和 64B 两个规格。

路线

代表玩家

核心打法

指向的场景

视频模型向上

字节 Seedance

云端实时渲染空间视频,串流到头显

直播、互动短剧、游戏

LLM 操作专业软件

OpenAI GPT-6 Astra

直接操控 Blender、虚幻引擎全流程

影视预演、3D 内容生产

原生世界模型

World Labs Atlas、英伟达 Cosmos 3

直接生成/理解三维空间本身

仿真、机器人、科研

三条路,起点不同,却指向同一个产业判断:内容产业的形态,正在从"可观看的视频"转向"可进入、可交互的空间"。

三、中国力量:不只有字节在冲

视线拉回国内,这一波空间智能的浪潮里,中国公司不止字节一张牌。

9 月 15 日,智象未来(HiDream.ai)发布原生全模态视频生成模型 HD-V1:一键直出 5 至 20 秒 1080p 视频,把重力、碰撞、惯性这些物理规律直接写进生成逻辑,声音与画面同步生成而非后期拼接。发布同期,它在 Artificial Analysis 图生视频(带音频)榜单拿下全球第四,在 Arena.ai 盲测榜单位列全球第八。同一天,公司宣布完成 C+ 轮融资,投资方新微资本、交子资本、工银资本清一色国资背景——今年 4 月到 7 月,它已连续完成三轮融资,累计超 21 亿元,估值突破 10 亿美元。

9 月 9 日,MiniMax H3 全模态视频生成模型在赣江新区首发:开源、可本地化部署、最高 2K 分辨率、自带音频,明确定位 AI 短剧和漫剧的创作引擎。

把 9 月这一桌牌摆在一起看:

模型/项目

公司

时间

关键看点

实时空间视频模型

字节跳动

最快 10 月

50ms 延迟、20fps,张一鸣亲自督导

HD-V1

智象未来

9 月 15 日

物理规律建模,AA 榜单全球第四

MiniMax H3

MiniMax

9 月 9 日

开源、2K、自带音频,瞄准短剧

Cosmos 3

英伟达

本月开源

文本/视频/音频/动作统一建模

字节在 36 氪披露的 2026 年四项 AI 重点任务里,"加大世界模型投入、年底前至少推出一款世界模型"赫然在列。这不是一家公司的临时起意,而是一群头部玩家的集体下注。

四、为什么偏偏是现在?

三个条件,恰好在这个时间点凑齐了。

第一,算得动了。 实时交互的世界模型,卡脖子的一直是延迟。云端渲染加视频串流的方案,把 50 毫秒的端到端延迟做到了可用水准——工程上第一次"能玩",而不只是"能演示"。国家数据局的数据也印证了算力侧的厚度:我国日均词元调用量从 2024 年初的约 1000 亿次,涨到 2026 年 6 月底的 500 万亿次,两年增长约 5000 倍。

第二,看得懂了。 HD-V1 们的突破不在"动得顺",而在"听得懂":先对模糊、口语化的输入做结构化规划——镜头时长、构图、运镜、音效——再把物理规律写进底层逻辑。生成的东西开始遵守现实世界的规则,人进入其中才不会觉得假。

第三,等的起。 VR 硬件市场连续两年下滑,行业急需一个"非头显不可"的理由。AI 实时生成的交互世界,恰好是传统 3D 建模做不起、预渲染视频给不了的东西。写在最后

回头看,每一次内容形态的迁移,都重塑了一批公司:图文时代成就了门户,短视频时代成就了抖音。如果内容的下一站真是"可进入的空间",那么现在各家抢的不是某一款产品的胜负,而是下一代内容平台的入场券。

给三句话建议:做内容的

:开始熟悉 3D 工作流。Astra 加 Blender 这类"一句话出预演"的组合已经能跑通,先人一步掌握工具的人,会在空间内容爆发时拿到定价权。做产品的

:关注"云端渲染 + 轻终端"的组合。它降低的不只是用户成本,更是你产品的获客成本。做技术的

:盯紧开源世界模型。Cosmos 3、MiniMax H3 都已开源,现在的空白处,就是半年后的竞争壁垒。

屏幕正在变成一扇门。门后是什么样,未来十二个月就会见分晓。

本栏目中的所有页面均系自动生成,自动分类排列,采用联索网络信息采集、网页信息提取、语义计算等智能搜索技术。内容源于公开的媒体报道,包括但不限于新闻网站、电子报刊、行业门户、客户网站等。使用本栏目前必读