
模型吃掉应用的故事反了,可以玩的抖音开源视频世界模型。
过去几个月,实时视频世界模型突然成为一张拥挤的牌桌。
PixVerse、LingBot、阿里快乐生蚝、智象未来等团队,先后发布实时视频世界模型、Demo,并不约而同地把第一站指向互动内容/互动娱乐/ AI游戏。
它们讲述的故事高度相似:当视频能够持续生成、实时响应,人就不再只是观看一段内容,而是可以进入一个由模型生成的世界。
一个强烈的行业预期正在形成:视频模型正在越过AI短剧的边界,向互动娱乐腹地推进。
熟悉的味道,像是又一次模型吃掉应用的前奏。
不过,新智元了解到一个特别的玩家打破了这个局面:
Loopit发布了实时互动世界模型Zing-0.5,在美团LongCat与复旦大学联合推出的可交互视频世界模型评测WBench中拿到第一。目前已经开源,并计划在2周内在Loopit APP(海外版)上线对应产品功能。

没有看错,就是那个以可以玩的抖音被外界熟知的Loopit,其产品上线后曾获马斯克点赞,两个月登顶欧美娱乐榜,累计融资1亿美元。
这家擅长做C端产品和全球增长的应用公司,反过来做出了自己的实时互动世界模型,并在公开评测中拿下第一。
模型吃掉应用的故事,似乎被反了过来。
但这次发布真正值得关注的,还不只是一个应用公司下场做模型拿到第一。
Loopit还提出了三个颇具争议的判断:
第一,空间探索与实时语义生成的联合控制,只是实时视频世界模型进入互动内容的入门门槛。
第二,纯实时视频流无法直接走到世界模型终局。多人、持续、可互动的数字世界,需要先由Code维护状态、规则和因果,再由 Pixel 完成开放的生成式渲染。这也是本次模型命名为Zing-0.5的原因。
第三,模应一体不是商业模式选择,而是走向端到端互动世界模型和构建互动内容产品的必经阶段,只有先把模型放进真实产品,积累“意图—行动—世界变化—用户反馈的”完整轨迹,未来才可能进一步把状态、规则和渲染统一进一个模型。
Loopit一边开源实时视频世界模型,一边戳破实时视频模型的世界梦。
它并不否认端到端的终局,而是提出了另一条抵达终局的路径:
先用Coding × Pixel把世界运行起来,再让端到端模型从这个世界里长出来。
开源github地址:https://file.tonglife.net/images/e7/5ba97ea411af8e66620757509cd67b.jpg modelscope
模型下载地址: https://file.tonglife.net/images/94/5b05c989a1f7081d6578d230ccb5ab.jpg huggingface
模型下载地址:
以下是新智元了解和实测的详细内容。
Zing-0.5在公开评测WBench中拿到第一
一个可互动的世界,既要允许用户控制去哪里,也要允许用户决定发生什么。
Zing-0.5通过两条同时运行的控制链路,让用户一边用键盘或手柄探索空间,一边用自然语言改写接下来发生的事情。
Loopit将这项能力概括为联合控制:
空间操作决定用户去哪里;
语义输入决定世界发生什么;
两种控制共同作用于同一段持续生成;
新指令进入当前世界,而不是用一段新视频替换当前世界。
围绕这条控制链路,新智元体验了五个逐步加深的 Case。
Case 1:飞行没有中断,巨龙开始喷火
在骑龙飞行约43秒后,输入龙嘴巴喷火。
火焰与烟雾随即出现,但巨龙仍沿原方向飞行,洞穴、瀑布和远处光源没有被重置。喷火结束后,飞行继续,前后仍是一段完整的世界演化。
本文转自:凤凰网科技
原文地址: https://tech.ifeng.com/c/8vtqVjdp58j

小同爱分享3 个月前
命没了还有轮回,钱没了,死都不甘心。 - 小同爱分享
小同爱分享6 个月前
疫情,就是让人抑郁,又没了感情。 - 小同爱分享