咨询服务热线:400-099-8848
姚顺雨重整腾讯多模态道路:靠拢梁文锋,远离李飞飞 |
| 发布时间:2026-08-19 文章来源:本站 浏览次数:12 |
腾讯混元多模态团队又发生了一同人事变动。据媒体报道,曾担任xAI多模态了解担任人蔺旭东,现已脱离xAI,参加腾讯混元,担任多模态内容生成算法担任人。 这则人事消息之所以值得关注,是由于它发生在混元多模态团队持续调整的布景下。 过去一段时间,混元内部陆续传出担任人离任、研讨人员转岗和新成员参加的消息。 原多模态了解担任人胡瀚离任创业,田永龙等人参加腾讯,原有多模态团队的报告联系也随着大言语模型部分和多模态模型部分的整合而发生改动。 但这是否意味着腾讯多模态团队正在“改朝换代”,现在还不能直接下结论。 揭露信息能够承认的是,混元的确呈现了人员流动和安排重组。蔺旭东的参加风闻,更像是这场调整中的一个新信号:腾讯正在重新组合多模态了解和内容生成这两条道路。 那么问题来了,蔺旭东究竟是什么来头,他能为腾讯补上什么才能?以及腾讯的多模态道路是否正在从“生成内容”转向了姚顺雨更倾向的“了解上下文并在国际中行动”? 蔺旭东是什么来头,他参加腾讯后能做什么? 揭露材料显示,蔺旭东2018年结业于清华大学,随后赴哥伦比亚大学攻读博士。 在读博期间,他的研讨方向包含嵌入学习、视频剖析和生成模型,也曾参与哥伦比亚大学与Facebook AI协作的Vx2Text项目。 V指的是视频,x指的是未知数,可所以声响、语音甚至是环境音,2代表to,Text则代表字幕。它的逻辑是,先把视频、声响等不同模态转换成相似“言语token”的向量,再一致送入言语模型进行交融,终究由自回归解码器生成开放式文本。 Transformer只能了解token,所以AI本质上是不了解视频和音频这两种文件方法的,也就更不或许将其转换成文字。 举个比方,一只狗在游泳池旁边跳进水里,那么Vx2Text的视频辨认器看(V)就会输出要害词:狗、跳动、游泳池;声响辨认器(x)就会输出:水声、扑通。 尽管Vx2Text的产品功用是“生成”,但产品的中心难点在于“了解”。 当然,Vx2Text并不是简单地把画面“翻译”成几句话而已。模型需要从视频里辨认人物、物体、动作和事情,还要了解这些东西在时间上的改动,终究再把视觉信息安排成言语。 博士结业后,蔺旭东进入DeepMind,参与Gemini相关的多模态预训练和后训练工作。2025年,他又参加xAI,揭露材料称其担任多模态了解方向,并参与多模态内容了解与生成模型的训练。 现在他参加腾讯混元,将担任混元多模态内容生成算法。 蔺旭东的参加与其说是提高混元多模态生成的功能,倒不如说是为了处理一个困扰所有多模态的问题——了解。 曾经的生成模型更像一个画面制造器。给它一句提示词,它能够生成一张图片、一段视频。但只要用户提出更杂乱的要求,模型就有点跟不上了。比方人物在长视频里变了,物体的形状前后不一致,摄像机运动不符合空间联系等等。 这不是由于模型不会生成,而是由于它没有稳定地记住和了解国际。 所以,把蔺旭东放到多模态内容生成的位置上,或许正是由于他把多模态,“翻译”成AI能了解的东西。 蔺旭东的参加要放在一个更大的布景下才能看得清楚,那便是现在腾讯混元正在重新整理自己的多模态道路。 2025年1月,腾讯杰出科学家(Tencent Distinguished Scientist)胡瀚接替此前离任的刘威,全面担任混元多模态大模型的研制,一起担任腾讯混元大模型Tech Lead。 2025年下半年腾讯内部安排调整,他从多模态模型部,调入了大言语模型部旗下的“Frontier”前沿技能研讨组,头衔变成了多模态了解方向担任人,报告线也改为向姚顺雨报告。 实际位置从“一个独立部分的领导”变成了“大言语模型部下面一个研讨组里某个方向的担任人”,管的规模从整个多模态大模型收缩到只剩多模态了解这一块,多模态生成等方向被划出去了。 2026年3月腾讯现已吊销了建立近十年的AI Lab,部分人员并入混元大言语模型部转向姚顺雨报告。在这次调整后,此前混元实际掌舵人、腾讯公司副总裁蒋杰,正式与姚顺雨完结工作交接,不再兼管AI Lab和混元。 2026年7月初,前OpenAI研讨员、姚顺雨清华本科校友田永龙参加腾讯,担任视觉言语模型方向。 紧接着没过几天,腾讯TEG正式发文,吊销大言语模型部和多模态模型部,合并建立“根底模型部”,姚顺雨任担任人,向TEG总裁卢山报告。腾讯称,此举旨在提高模型研制与协同效率,探究全模态模型的智能上限。 随后,胡瀚被曝离任创业。 前亚马逊首席科学家、京东数科首席科学家、阿里通义实验室使用视觉团队担任人、原腾讯多模态模型部担任人Linus在这次调整之后,从原本和姚顺雨平行的位置,改为了向姚顺雨报告。 还没完,腾讯混元多模态根底模型担任人钟钊,担任HunyuanVideo和HunyuanImage两条生成线,是混元多模态生成方向的实际掌舵人。 他在8月14日发了一条朋友圈,称“即将发布的版别或将是我在HunyuanVideo与HunyuanImage项目中的终究版别”,字里行间充满了告别。 蔺旭东或许仅仅混元多模态换血中的一员,可是他的参加释放出了一个明显的信号,整个腾讯对于多模态的研制方向,现已发生了改动。 在此之前,腾讯是怎么做多模态的? 此前腾讯的言语模型和多模态是底子的两条线,而混元多模态中心的两个产品,正是前文提到的HunyuanVideo和HunyuanImage。 HunyuanVideo是文生视频模型,2024年12月首发即以130亿参数成为其时全球大的开源视频生成模型,支撑5秒720p输出。2025年密布扩展才能,3月上线图生视频,5月推出定制化生成HunyuanCustom和数字人驱动Avatar,11月发布1.5版别,将参数紧缩至83亿,支撑原生生成5至10秒的480p或720p视频,并可经过超分辨率得到1080p输出。 HunyuanImage起步更早,这是2024年5月,混元推出的首个中文原生DiT架构图像模型,2025年迭代出业界首个工业级实时生图的2.0版别,同年9月发布了2.1版别(170 亿参数、原生 2K 分辨率)和3.0版别(800 亿参数、首个工业级开源原生多模态生图模型),2026年1月进一步推出带推理才能的Instruct版别,支撑提示词自改写和图生图修改。 还有一条线是Hy 3D,这是一个专门生成单体3D模型的模型,2024年11月随Hunyuan-Large一同开源1.0版别,2025年1月晋级到了2.0,拆分为DiT形状生成加Paint纹理组成的两阶段流水线,6月2.1完整开源训练代码,9月发布3.0将建模精度提高3倍、几许分辨率达1536³,现在已迭代至 3.1,广泛用于电商建模、产品规划和3D打印。 在这三座大山之后,或许是李飞飞的空间智能理论影响了腾讯,亦或者是多年曾经,腾讯在数字孪生中掌握的相关常识,在AI的加持下得以再次利用。 就如同刘关张之后有赵云相同,混元多模态在2025年7月下旬也迎来了四弟,Hy World 1.0。 所谓空间智能,根据李飞飞旗下World Labs的表述,它是指让AI感知、生成、推理并与三维空间中的国际互动。 言语模型学习的是文本的计算结构,而国际模型需要学习空间和时间的结构,例如光线怎么落到物体表面、从没有拍照过的角度看花园会是什么样,以及物体受到外力后会怎么运动。 腾讯称,Hy World 1.0是全球首个开源、支撑仿真的沉浸式3D国际生成模型,技能道路是先生成一张360度全景图作为“国际代理”,再分解成语义层做分层3D重建,终究输出可导入游戏引擎的分层Mesh。 由于腾讯本身就很擅长开发游戏引擎和游戏内容,Hy World尽管表现力十分惊人,却也被网友调侃成了“腾讯不肯脱离舒适圈”。 在Hy World 1.0发布的一个多月后,腾讯又发布了Hy World-Voyager,定位是根据相机轨迹控制的超长周游国际模型。 Hy World-Voyager处理的是1.0留下的一个痛点。尽管1.0生成的3D国际质量不错,但周游规模是相当有限的,走不了多远就会呈现几许漂移和穿模。 Voyager的思路是换一条技能道路,不直接生成3D资产,而是先做RGB-D双模态视频生成,每一帧画面在输出颜色的一起同步输出一张深度图,然后用深度图即时重建3D点云。 总而言之,Hy World简直能够说是藉由腾讯在引擎和美术上的优势,完美复原了李飞飞空间智能的设想。 要知道,Hy World 2.0它的技能报告全称便是《HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds》,其间的“Reconstructing, Generating, and Simulating 3D Worlds”(重建、生成、模拟3D国际),也便是前文所提到的,World Labs对空间智能的论述。 但是并不是所有人都认同李飞飞,就包含姚顺雨。在多模态这件事上,姚顺雨好像更认同梁文锋的观念。 姚顺雨认同梁文锋 李飞飞的观念是,国际模型作为空间智能的一部分,是AGI重要的一条线,梁文锋则持反对意见。 曾有投资者在多模态这个问题上向梁文锋发问,梁文锋回答说:“咱们只做AGI主线——GPT、CoT、Agent。AI范畴很广泛,但3D、视频生成、国际模型,跟智能的主线没有太大联系。” DeepSeek有个产品,叫做DeepSeek OCR,简直便是梁文锋多模态观的技能具象化。把视觉模态当成服务于言语模型的东西,而不是独立的智能方向。 DeepSeek OCR的中心叫做“上下文光学紧缩”(Contexts Optical Compression),中心思路是把长文本渲染成图像,用视觉编码器把文本紧缩成紧凑的视觉token,再交给言语模型解码。 是不是有点眼熟?翻回前面看看蔺旭东的Vx2Text,姚顺雨或许正是想学梁文锋,把混元现有的多模态根底,转换成为这样一种了解方法,从而更好地交融进Hy模型主线。 包含OpenAI在内,许多AI大厂其实都是相似的做法。姚顺雨曾上任于OpenAI,很或许便是在那时,确立了这个方向。 姚顺雨参加腾讯后的第一款旗舰产品是Hy3,他把重点放在推理、智能体、长上下文和出产力使命上。 官方称,Hy3在软件开发、工作出产、金融建模、前端规划和游戏制造等使命上进行了优化,并且在东西调用稳定性、杂乱上下文承接和多轮目的坚持方面持续改进。 Hy3的方针并非“屠榜”,而是让模型在实在产品里少犯错、能了解上下文、能够把使命持续做下去。 这个产品本身就十分的“姚顺雨”。 2026年6月5日,在腾讯云AI工业使用大会与汤道生的对谈中,姚顺雨是这么判断的,AI下半场的竞赛壁垒不在模型参数量,而在Context(上下文)。 “咱们现在就像是拥有了一个全能的锤子,它能够去砸任何钉子。方法论现已变得十分老练,相反,寻觅真实有价值的问题,变得越来越困难。”姚顺雨如此提到。 同样在那场会上,公布了腾讯长期AGI建设的三层架构:根底底座(预训练+后训练+基建)、产品落地、前沿探究。推理才能属于根底底座要处理的问题,上下文才能属于产品落地和前沿探究的交叉点。 此前,为了测验模型脱离原有常识,只从上下文中寻觅答案,姚顺雨还特地制造了测验上下文的基准CL-bench以及CL-bench life。 可见,姚顺雨其实也跟梁文锋相同,觉得主线是Agent相关的内容,而非多模态生成。 至于Hy3到底怎么样,那就要看WorkBuddy了。WorkBuddy是Hy3的首发渠道之一,这哥俩属于是“产品+模型”双螺旋联系,互相成就。 接入Hy3后WorkBuddy的表现提高十分明显。根据工作场景内部测评,使命处理率从72%跃升至 90%,平均耗时缩短34%,可多处理约五分之一的杂乱需求。 Hy3上线后,WorkBuddy上主动选择Hy3的用户数增加了 6 倍,日均文字处理量较预览版增加20倍,7月8日算力消耗一度到达峰值,排队率超越50%,腾讯为此紧迫扩容。 一个猜测,Hy提高多模态了解后,它的GUI Agent场景下的体会会更上一层楼。GUI Agent的中心链路是“感知屏幕 — 了解界面 — 决议计划操作 — 履行验证”,其间多模态了解是连接视觉感知与言语决议计划的要害瓶颈。 但这并不足以证明李飞飞是错的,只能说姚顺雨认同梁文锋算了。 |