腾讯混元多模态团队又发生了一起人事变动。据媒体报道,曾负责xAI多模态理解负责人蔺旭东,已经离开xAI,加入腾讯混元,担任多模态内容生成算法负责人。

这则人事消息之所以值得关注,是因为它发生在混元多模态团队持续调整的背景下。

过去一段时间,混元内部陆续传出负责人离职、研究人员转岗和新成员加入的消息。

原多模态理解负责人胡瀚离职创业,田永龙等人加入腾讯,原有多模态团队的汇报关系也随着大语言模型部门和多模态模型部门的整合而发生变化。

但这是否意味着腾讯多模态团队正在“改朝换代”,目前还不能直接下结论。

公开信息能够确认的是,混元确实出现了人员流动和组织重组。蔺旭东的加入传闻,更像是这场调整中的一个新信号:腾讯正在重新组合多模态理解和内容生成这两条路线。

那么问题来了,蔺旭东究竟是什么来头,他能为腾讯补上什么能力?以及腾讯的多模态路线是否正在从“生成内容”转向了姚顺雨更偏向的“理解上下文并在世界中行动”?

蔺旭东是什么来头,

他加入腾讯后能做什么?

公开资料显示,蔺旭东2018年毕业于清华大学,随后赴哥伦比亚大学攻读博士。

在读博期间,他的研究方向包括嵌入学习、视频分析和生成模型,也曾参与哥伦比亚大学与Facebook AI合作的Vx2Text项目。

V指的是视频,x指的是未知数,可以是声音、语音甚至是环境音,2代表to,Text则代表字幕。它的逻辑是,先把视频、声音等不同模态转换成类似“语言token”的向量,再统一送入语言模型进行融合,最后由自回归解码器生成开放式文本。

Transformer只能理解token,所以AI本质上是不理解视频和音频这两种文件形式的,也就更不可能将其转换成文字。

举个例子,一只狗在游泳池旁边跳进水里,那么Vx2Text的视频识别器看(V)就会输出关键词:狗、跳跃、游泳池;声音识别器(x)就会输出:水声、扑通。

虽然Vx2Text的产品功能是“生成”,但产品的核心难点在于“理解”。

当然,Vx2Text并不是简单地把画面“翻译”成几句话而已。模型需要从视频里识别人物、物体、动作和事件,还要理解这些东西在时间上的变化,最后再把视觉信息组织成语言。

博士毕业后,蔺旭东进入DeepMind,参与Gemini相关的多模态预训练和后训练工作。2025年,他又加入xAI,公开资料称其负责多模态理解方向,并参与多模态内容理解与生成模型的训练。

如今他加入腾讯混元,将负责混元多模态内容生成算法。

蔺旭东的加入与其说是提升混元多模态生成的性能,倒不如说是为了解决一个困扰所有多模态的问题——理解。

以前的生成模型更像一个画面制造器。给它一句提示词,它可以生成一张图片、一段视频。但只要用户提出更复杂的要求,模型就有点跟不上了。比如人物在长视频里变了,物体的形状前后不一致,摄像机运动不符合空间关系等等。

这不是因为模型不会生成,而是因为它没有稳定地记住和理解世界。

所以,把蔺旭东放到多模态内容生成的位置上,可能正是因为他把多模态,“翻译”成AI能理解的东西。

蔺旭东的加入要放在一个更大的背景下才能看得清楚,那就是如今腾讯混元正在重新整理自己的多模态路线。

2025年1月,腾讯杰出科学家(Tencent Distinguished Scientist)胡瀚接替此前离职的刘威,全面负责混元多模态大模型的研发,同时担任腾讯混元大模型Tech Lead。

2025年下半年腾讯内部组织调整,他从多模态模型部,调入了大语言模型部旗下的“Frontier”前沿技术研究组,头衔变成了多模态理解方向负责人,汇报线也改为向姚顺雨汇报。

实际地位从“一个独立部门的领导”变成了“大语言模型部下面一个研究组里某个方向的负责人”,管的范围从整个多模态大模型收缩到只剩多模态理解这一块,多模态生成等方向被划出去了。

2026年3月腾讯已经撤销了成立近十年的AI Lab,部分人员并入混元大语言模型部转向姚顺雨汇报。在这次调整后,此前混元实际掌舵人、腾讯公司副总裁蒋杰,正式与姚顺雨完成工作交接,不再兼管AI Lab和混元。

2026年7月初,前OpenAI研究员、姚顺雨清华本科校友田永龙加入腾讯,负责视觉语言模型方向。

紧接着没过几天,腾讯TEG正式发文,撤销大语言模型部和多模态模型部,合并成立“基础模型部”,姚顺雨任负责人,向TEG总裁卢山汇报。腾讯称,此举旨在提升模型研发与协同效率,探索全模态模型的智能上限。

随后,胡瀚被曝离职创业。

前亚马逊首席科学家、京东数科首席科学家、阿里通义实验室应用视觉团队负责人、原腾讯多模态模型部负责人Linus在这次调整之后,从原本和姚顺雨平行的地位,改为了向姚顺雨汇报。

还没完,腾讯混元多模态基础模型负责人钟钊,负责HunyuanVideo和HunyuanImage两条生成线,是混元多模态生成方向的实际掌舵人。

他在8月14日发了一条朋友圈,称“即将发布的版本或将是我在HunyuanVideo与HunyuanImage项目中的最终版本”,字里行间充满了告别。

蔺旭东或许只是混元多模态换血中的一员,但是他的加入释放出了一个明显的信号,整个腾讯对于多模态的研发方向,已经发生了改变。

在此之前,腾讯是怎么做多模态的?

此前腾讯的语言模型和多模态是根本的两条线,而混元多模态最核心的两个产品,正是前文提到的HunyuanVideo和HunyuanImage。

HunyuanVideo是文生视频模型,2024年12月首发即以130亿参数成为当时全球最大的开源视频生成模型,支持5秒720p输出。2025年密集扩展能力,3月上线图生视频,5月推出定制化生成HunyuanCustom和数字人驱动Avatar,11月发布1.5版本,将参数压缩至83亿,支持原生生成5至10秒的480p或720p视频,并可通过超分辨率得到1080p输出。

HunyuanImage起步更早,这是2024年5月,混元推出的首个中文原生DiT架构图像模型,2025年迭代出业界首个工业级实时生图的2.0版本,同年9月发布了2.1版本(170 亿参数、原生 2K 分辨率)和3.0版本(800 亿参数、首个工业级开源原生多模态生图模型),2026年1月进一步推出带推理能力的Instruct版本,支持提示词自改写和图生图编辑。

还有一条线是Hy 3D,这是一个专门生成单体3D模型的模型,2024年11月随Hunyuan-Large一同开源1.0版本,2025年1月升级到了2.0,拆分为DiT形状生成加Paint纹理合成的两阶段流水线,6月2.1完整开源训练代码,9月发布3.0将建模精度提升3倍、几何分辨率达1536³,目前已迭代至 3.1,广泛用于电商建模、产品设计和3D打印。

在这三座大山之后,或许是李飞飞的空间智能理论影响了腾讯,亦或者是多年以前,腾讯在数字孪生中掌握的相关知识,在AI的加持下得以再次利用。

就如同刘关张之后有赵云一样,混元多模态在2025年7月下旬也迎来了四弟,Hy World 1.0。

所谓空间智能,根据李飞飞旗下World Labs的表述,它是指让AI感知、生成、推理并与三维空间中的世界互动。

语言模型学习的是文本的统计结构,而世界模型需要学习空间和时间的结构,例如光线如何落到物体表面、从没有拍摄过的角度看花园会是什么样,以及物体受到外力后会如何运动。

腾讯称,Hy World 1.0是全球首个开源、支持仿真的沉浸式3D世界生成模型,技术路线是先生成一张360度全景图作为“世界代理”,再分解成语义层做分层3D重建,最后输出可导入游戏引擎的分层Mesh。

由于腾讯本身就很擅长开发游戏引擎和游戏内容,Hy World虽然表现力非常惊人,却也被网友调侃成了“腾讯不愿离开舒适圈”。

在Hy World 1.0发布的一个多月后,腾讯又发布了Hy World-Voyager,定位是基于相机轨迹控制的超长漫游世界模型。

Hy World-Voyager解决的是1.0留下的一个痛点。虽然1.0生成的3D世界质量不错,但漫游范围是相当有限的,走不了多远就会出现几何漂移和穿模。

Voyager的思路是换一条技术路线,不直接生成3D资产,而是先做RGB-D双模态视频生成,每一帧画面在输出色彩的同时同步输出一张深度图,然后用深度图即时重建3D点云。

总而言之,Hy World几乎可以说是藉由腾讯在引擎和美术上的优势,完美还原了李飞飞空间智能的设想。

要知道,Hy World 2.0它的技术报告全称就是《HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds》,其中的“Reconstructing, Generating, and Simulating 3D Worlds”(重建、生成、模拟3D世界),也就是前文所提到的,World Labs对空间智能的阐述。

然而并不是所有人都认同李飞飞,就包括姚顺雨。在多模态这件事上,姚顺雨似乎更认同梁文锋的观点。

姚顺雨认同梁文锋

李飞飞的观点是,世界模型作为空间智能的一部分,是AGI重要的一条线,梁文锋则持反对意见。

曾有投资者在多模态这个问题上向梁文锋提问,梁文锋回答说:“我们只做AGI主线——GPT、CoT、Agent。AI领域很广泛,但3D、视频生成、世界模型,跟智能的主线没有太大关系。”

DeepSeek有个产品,叫做DeepSeek OCR,几乎就是梁文锋多模态观的技术具象化。把视觉模态当成服务于语言模型的工具,而不是独立的智能方向。

DeepSeek OCR的核心叫做“上下文光学压缩”(Contexts Optical Compression),核心思路是把长文本渲染成图像,用视觉编码器把文本压缩成紧凑的视觉token,再交给语言模型解码。

是不是有点眼熟?翻回前面看看蔺旭东的Vx2Text,姚顺雨或许正是想学梁文锋,把混元现有的多模态基础,转换成为这样一种理解方式,进而更好地融合进Hy模型主线。

包括OpenAI在内,很多AI大厂其实都是类似的做法。姚顺雨曾就职于OpenAI,很可能就是在那时,确立了这个方向。

姚顺雨加入腾讯后的第一款旗舰产品是Hy3,他把重点放在推理、智能体、长上下文和生产力任务上。

官方称,Hy3在软件开发、办公生产、金融建模、前端设计和游戏制作等任务上进行了优化,并且在工具调用稳定性、复杂上下文承接和多轮意图保持方面继续改进。

Hy3的目标并非“屠榜”,而是让模型在真实产品里少出错、能理解上下文、能够把任务持续做下去。

这个产品本身就非常的“姚顺雨”。

2026年6月5日,在腾讯云AI产业应用大会与汤道生的对谈中,姚顺雨是这么判断的,AI下半场的竞争壁垒不在模型参数量,而在Context(上下文)。

“我们现在就像是拥有了一个万能的锤子,它可以去砸任何钉子。方法论已经变得非常成熟,相反,寻找真正有价值的问题,变得越来越困难。”姚顺雨如此说到。

同样在那场会上,公布了腾讯长期AGI建设的三层架构:基础底座(预训练+后训练+基建)、产品落地、前沿探索。推理能力属于基础底座要解决的问题,上下文能力属于产品落地和前沿探索的交叉点。

此前,为了测试模型脱离原有知识,只从上下文中寻找答案,姚顺雨还特地制作了测试上下文的基准CL-bench以及CL-bench life。

可见,姚顺雨其实也跟梁文锋一样,觉得主线是Agent相关的内容,而非多模态生成。

至于Hy3到底怎么样,那就要看WorkBuddy了。WorkBuddy是Hy3的首发平台之一,这哥俩属于是“产品+模型”双螺旋关系,互相成就。

接入Hy3后WorkBuddy的表现提升非常显著。基于办公场景内部测评,任务解决率从72%跃升至 90%,平均耗时缩短34%,可多处理约五分之一的复杂需求。

Hy3上线后,WorkBuddy上主动选择Hy3的用户数增长了 6 倍,日均文字处理量较预览版增长20倍,7月8日算力消耗一度达到峰值,排队率超过50%,腾讯为此紧急扩容。

一个猜想,Hy提升多模态理解后,它的GUI Agent场景下的体验会更上一层楼。GUI Agent的核心链路是“感知屏幕 — 理解界面 — 决策操作 — 执行验证”,其中多模态理解是连接视觉感知与语言决策的关键瓶颈。

但这并不足以证明李飞飞是错的,只能说姚顺雨认同梁文锋罢了。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8viLguVW6jL