前脚友商还在为你追我赶生成几秒钟的「电子榨菜」视频卷到头秃;后脚李飞飞创办的 World Labs 微微一笑,把桌子掀了——
就在刚刚,全球首个多模态世界模型 Atlas 正式登场!

官方博客🔗 https://file.tonglife.net/images/1b/34383ab32b95fa8f046cf4d52250f1.jpg
按照官方定义,Atlas 是一款面向空间智能的 omni world model,从零开始完成预训练,可以原生处理文本、图像、视频、相机位姿与 3D 深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。

先来看最直观的炸场操作:
Camera Controlled Generation(相机控制生成)。
以前大家玩视频生成模型,多少有点玄学抽奖。我们在 Prompt 框里卑微敲下:「镜头缓慢向左拉升、绕着人物微仰角旋转」,回车之后全凭老天保佑。

对比之下,Atlas 的做法是:直接把「相机位姿参数」当作底层原生输入。
你要什么角度、什么轨迹、走多快?
直接给坐标!
只要丢进去 1 到 6 张普通照片,定好运镜轨迹,Atlas 就能生成最长达 1 分钟、1440p 分辨率 的大片。
本文转自:凤凰网科技
原文地址: https://tech.ifeng.com/c/8w474ezPaL1

小同爱分享4 个月前
命没了还有轮回,钱没了,死都不甘心。 - 小同爱分享
小同爱分享7 个月前
疫情,就是让人抑郁,又没了感情。 - 小同爱分享