五年前,扎克伯格也曾兴冲冲地描绘过一个可以进去的数字世界。人们戴上Quest,在里面见朋友、开会、看演出,甚至购物。Facebook为此改名Meta,Reality Labs随后烧掉数百亿美元,Horizon Worlds却始终没有成为大众产品。

那一轮“元宇宙”后来多少成了科技行业的笑话。可五年之后,张一鸣正在靠另一套技术,重新靠近一个很相似的未来。

在最新的传闻中,字节正在开发一款由张一鸣亲自督导的“世界模型”。

Meta当年从VR头显和3D世界起步,字节现在的起点是视频生成。Seedance先把画面做出来,世界模型再让环境随着人的行动继续变化。更关键的是,抖音里本来就有直播,红果已经有几亿短剧用户,字节手里甚至还留着Pico。

难道“元宇宙”并非痴人说梦,只是其缔造者注定另有其人?

试图想象一个可以直播购物、看短剧(甚至沉浸式进入短剧)的世界的时候,脑袋里总想起多年前小扎在“元宇宙”里漂浮的诡异半身。

那几年扎克伯格对元宇宙是真的很认真。

2021年10月,Facebook干脆把公司名字改成了Meta。改名当天的Connect大会开了一个多小时,扎克伯格几乎是带着观众在未来世界里逛了一圈。

戴上Quest,最先出现的是Horizon Home。这里相当于虚拟世界里的家,朋友可以直接过来串门,一起看视频或者打游戏。上班则有Horizon Workrooms,开会的人围着一张虚拟会议桌坐下,现实中的电脑屏幕也能搬进来。想看演唱会和NBA,还有Horizon Venues。

Meta自己当时说元宇宙包括娱乐,但也要能工作、社交和学习,甚至连健身都算在里面。公司野心颇大,想把VR变成像手机、电脑一样的通用计算平台。

2021年底Horizon Worlds向美国和加拿大18岁以上用户开放时,里面已经有数千个由创作者制作的世界。为了让更多人进来搞建设,Meta专门拿出1000万美元成立Creator Fund,还办创作比赛、提供现成模板,希望普通人也能跟着做。

第二年,商业变现的尝试陆续落地。Meta允许一部分创作者在Horizon Worlds里出售虚拟物品和付费体验,逻辑其实和今天的内容平台差不多。

可惜,人和钱砸进去不少,元宇宙一直没有等来当年预想中的爆发。

Reality Labs负责Meta的VR、AR硬件和相关软件,当然不能把它的亏损全部算在Horizon Worlds头上,但数字还是很吓人。2025年,这个部门全年只收入22.07亿美元,营业亏损却达到191.93亿美元;今年上半年又亏掉86.47亿美元。

Meta自己也慢慢没那么执着了。去年底,有媒体曝出公司准备在2026年砍掉最高30%的元宇宙预算。从2020年算起,Reality Labs已经烧掉超过600亿美元。与此同时,Meta现在更愿意谈AI和智能眼镜,元宇宙在公司里的位置明显往后退了。

这件事后来有很多解释。比如VR头显始终没有真正普及,戴久了也谈不上舒服。更现实的问题是,大多数人根本没有强烈到非要戴个头显去开会、逛街。

再比如这个“元宇宙”世界本身也太难造了。

TikTok能有源源不断的新内容,一个重要原因就是拍视频的门槛足够低。手机掏出来,普通人当天就能发第一条。

Horizon Worlds也一直号称普通人可以创作,简单的东西确实能靠现成组件拼出来。可稍微复杂一点,事情立刻变得专业。Meta后来推出的桌面编辑器支持导入Blender、Maya做出来的3D模型,想给世界加上更复杂的互动,还要写TypeScript。

这就很尴尬了。

Meta费了很大劲把Quest卖给更多人,可这些人买回家以后,大部分还是消费者。让一个普通人拍条短视频不难,让他顺手给Horizon造个能玩的3D世界,完全是另一回事。

所以Meta后来一直没停过给开发者发钱、升级工具。到了2025年,公司甚至又拿出5000万美元扶持Horizon创作者。想让虚拟世界像短视频一样自己涌现海量内容,远没有当年想得那么容易。

如今情况已经发生变化。

去年8月,谷歌DeepMind发布Genie 3的时候,演示过一个很有意思的场景:给模型一句文字描述,它就能直接生成一个可以走进去的环境。

比如让它生成“古代雅典”,屏幕里会出现大理石建筑和街道。用户往前走,画面跟着向前生成。转个弯再回来,刚才看到的树和建筑还大致留在原来的位置。谷歌还演示过火山、威尼斯水道、暴风雨中的佛罗里达海岸,这些地方都没有提前做成一张完整的3D地图,而是随着用户移动一帧一帧生成出来。

Genie 3目前能做到720P、每秒24帧,一个场景可以维持几分钟的一致性。离可以长期待在里面的虚拟世界当然还很远,但光看这套工作方式,已经和Meta当年很不一样了。

当年Horizon Worlds里的场景得先有人搭好。Genie 3试着省掉这道工序,让模型随着用户的行动继续生成环境。

对用户来说,这个差别其实很好理解。

今天让AI生成一段“我骑着摩托车穿过东京街头”的视频,几十秒以后视频结束,东京也跟着没了。世界模型想做的事情麻烦得多——你骑到路口突然左转,模型得知道左边还有一条街。你停下来进一家店,它还得继续把店里面生成出来。过一会儿再走回原来的地方,最好别发现刚才那栋楼突然换了位置。

所以世界模型要解决的问题,已经不只是“画面像不像真的”,它还得让这个虚构空间经得起人的折腾。

字节现在也在往这个方向摸索。

今年2月发布的Seedance 2.0已经把视频生成推进到了更复杂的运动和多人互动。字节自己特别强调了物理规律还原,比如人物之间发生接触、物体运动以后,画面尽量别出现以前AI视频里常见的穿模和乱飞。

8月发布的SeedRealtime也很值得关注。

这个模型本身并不负责生成世界,它做的是持续看着眼前发生的事情,同时和人交流。镜头里出现新东西,模型可以主动发现。人在说话时指着某个物体,它也能结合画面理解你到底在说什么。换句话说,AI开始能一直“待在现场”,而不是等用户截一张图,再问一句“这是什么”。

当下的最新报道,则看起来像是几条路线的一次交汇。

按照报道,张一鸣亲自督导的“世界模型”建立在Seedance之上,目标是让画面能够跟着用户的声音和动作实时变化,应用直接指向直播、短剧和游戏。生成主要放在云端进行,目标速度大约每秒20帧,延迟约50毫秒。字节目前并未公开回应该消息,也还没有公开展示这个模型,发布时间也可能变化,所以它到底能做到什么程度目前不得而知。

但这条路线已经很好理解了。

Seedance擅长把东西生成出来,到了世界模型这里,生成出来的环境还得继续“活着”。用户往哪走、做了什么,场景都要跟着变化。

而这恰好是五年前Meta造Horizon时最费劲的一部分。

更有意思的是,Meta自己现在也绕回来“找补”了。

2025年,Meta给Horizon Worlds的桌面编辑器塞进了一批生成式AI工具。创作者可以让AI生成3D模型和纹理,也可以让它帮忙写TypeScript、做天空背景和声音。Meta当时给出的说法是,这些工具可以把一些原本需要几周的开发工作缩短到几小时。后来又继续加入环境生成,希望创作者最终只需要写几句提示词,就能搭出一个完整世界。

这个变化多少有点微妙。

这其实也说明,Meta当年遇到的那个问题,到今天仍然存在,只是解决办法变了。

当虚拟空间的生产开始越来越像生成图片、生成视频,元宇宙当年那道最麻烦的门槛,才第一次有可能真正往下降。

造世界的门槛如果真的降下来,里面放什么?这一点字节倒不太缺答案。

最容易想到的就是直播。最新报道里,直播本来就是这款空间视频模型计划探索的场景之一。抖音的直播生意生猛,今年618期间,超过12万商家的直播成交额同比翻倍,带货成交额翻倍的达人超过57万。

直播放入“元宇宙”里的情形不难想象。比如一个旅行主播不用一直举着手机带观众逛,直播间本身就可以生成一个能活动的目的地,观众可以自己四处看看。卖家具也可以直接生成一套房子,让用户看看沙发放进自己喜欢的装修风格是什么效果。

短剧也有类似的想象空间。

字节现在手里已经有相当庞大的短剧规模。QuestMobile数据显示,今年5月,红果免费短剧月活达到3.56亿。今年2月,用户日均使用时长已经达到125分钟。

这些内容目前还是标准的视频逻辑。可一旦生成模型能够稳定维持一个空间,短剧就不一定非得把所有东西提前框定死。一个悬疑故事里,观众也许可以自己走进案发现场,甚至想跟着另一个人物离开,模型就继续生成那条支线。

我们距离这样自由的虚拟空间还有一些距离。目前世界模型首先得解决人物和场景的一致性,还得把成本和延迟降下来。

不过字节已经开始发力。根据36氪在6月的报道,今年世界模型被列为字节AI的四个重点方向之一,内部同时在探索3D模拟路线。游戏业务也重新出现AI项目,5月公布的《不问凡尘》就把AI驱动的影视化叙事当成卖点。

字节内部还有另一条大众更熟悉的AI产品路线,豆包就是最典型的例子。

豆包已经是字节最重要的AI产品之一。QuestMobile数据显示,今年6月它的月活达到3.82亿;6月24日,豆包又正式上线专业版,最低连续包月68元,开始认真探索付费。此前还有报道称,豆包准备进一步接入抖音电商。

但一个AI助手怎么和字节原来的生意结合,多少还是得重新琢磨。收费是一种办法,接入电商也是一种办法,可用户在豆包里问问题,和他在抖音里刷视频、看直播,本来就是两套不同的使用习惯。

世界模型如果真的改变了视频这种内容本身,很多连接甚至不用专门设计出来。直播间可以继续卖货,短剧仍然是内容消费,只是原来隔着屏幕看的东西慢慢有了更多交互。

再加上Pico,这个想象就更完整一点。

字节并没有因为VR行业降温把Pico扔掉。今年PICO Space Pro原本计划9月发布,后来宣布推迟到第四季度,官方给出的原因是还要做一次较大的软件体验升级。

所以最新报道里的那个空间,短期完全可以先存在于普通屏幕里。技术真的发展到需要更强的沉浸感,字节手里至少还有一套自己的VR硬件。

这也是世界模型对字节很诱人的地方。

它到底是不是通往AGI的重要路线,现在没人能下定论。可字节并不一定非得等这个问题有答案。哪怕最后只做成一种更复杂、更实时的视频形态,抖音、红果这些产品也已经提供了足够大的试验场。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8wHVl0u1NSj