电话:
关闭
您当前的位置:首页 > 职场资讯 > 社保

机器人学会想象了!北大联手摩尔线程发布5D世界模型

来源:网络整理 时间:2026-06-07 作者:佚名 浏览量:

于2026年6月5日这天, 北大EvoPhys团队跟摩尔线程共同发布了EvoPhys-World, 一个力求让机器人去学会“想象”之意的5D世界模型, 就在这一日正式登场亮相了。

四天之前, 英伟达方才公布了其拥有的世界模型Cosmos 3;在这之前的一天, 斯坦福大学教授李飞飞发布论文, 为遭受严重滥用状况的“世界模型”这一概念描绘出具有权威性的“三分法”地图。于同一时段范围内, 学术领域、产业领域以及算力方面的巨头纷纷亮出自身的相关情况, 这表明当下人工智能新主流路线上的竞争, 已然步入了到炽热化状态的阶段。

这场竞争的核心,可以用一个极为简单的动作来检验:

你让机器人把桌上杯子移到左边。

第一种做法, 它瞅见杯子, 辨认指令, 伸出手去抓取, 平移后放下。整个过程仿若条件反射, 不会去思考。这是VLA时代, 即视觉语言动作模型,眼睛与手脚直接相连, 中间不存在脑子。

这是第二种做法, 它瞅见杯子, 于是在脑子之中展开了几张图, 图一, 是轻轻推杯子, 使得杯子滑向左边, 图二, 是用力推杯子, 这样杯子翻倒, 水洒了出来, 图三, 是没有碰到杯子, 杯子保持不动, 它把图二与图三给剪掉, 选择了图一, 这便是世界模型, 是4D版的, 包含三维空间再加上时间, 它能够预测下一秒会出现什么情况, 就如同是一个可以观看物理规则电影的观众, 然而它依旧仅仅只是一个观众。

采取的第三种做法, 仍是那几张图, 然而它作了更深入的思考。要是桌面存在水渍, 图一的滑动距离是否会产生变化。要是杯子为空与满的状态, 翻倒的阈值会有怎样的差异。要是推杯子的时候手指碰到了杯沿, 杯子是否会转动。它同步推演多条世界线, 并且在分叉处进行抉择。这即是世界模型, 属于5D版本, 是在时间与空间的基础之上, 额外增添了一维动作与因果关系。它并非在预测电影, 而是在导演剧目演——它于行动之前, 迅速完成了一场有关“后果”的短暂梦境。

并非是去提升机器人的眼睛, 而是为其打造一个脑子。一个是要让机器人学会“看”, 另一个是要促使机器人学会“想”。

一、EvoPhys所持有之底牌是, 存在着5D世界模型, 还有“一个基模, 两种形态”。

EvoPhys-World并非那种, 由好多各自独立的模块, 东拼西凑而成的所谓“缝合怪”, 它是一个具备统一特性的基础模型, 这个模型把感知这一行为, 以及记忆这一功能, 还有预测这一能力、决策这一行为、行动这一表现, 通通都压缩进了同一个隐空间里。

EvoPhys-World模型架构的示意图片, 它呈现出Latent Memory Pool, 还有Unified State-Action Token, 以及World Engine与World Policy的双模式螺旋结构, 并且有着Next-State Prediction与Next-Action Prediction的并行推演路径。

在这个隐空间里,它呈现出两种形态。

有一种被称作World Engine的, 也就是“世界引擎”。你给予它一个动作, 像是“推”, 它能够在脑海里模拟出此后这个世界会变成何种样子, 杯子会滑动多远, 是否会倾倒, 水会不会洒出。这便是它具备的“想象”能力, 也就是所谓的“万物可孪生, 物理可交互”。

第二种称作World Policy, 也就是“世界策略”。给它设定一个目标, 像“使杯子停在这儿” , 它能逆向推导出达成这个目标所需的一连串动作, 手伸展的速度要多快, 用力的程度要多大, 角度需怎样调整。这是它具备的“行动”能力, 即是“世界可预演, 万物可操控”。

World Policy执行后所导致的结果, 并非是彼此相割裂的, 而是会反馈给World Engine, 进而让它自身所具备的那种“想象”变得更为精准, 更为精准的“想象”能够由此生成更好的“行动”行为表现。这实际上就是“自进化”的核心所在, 也就好似并非是让机器人单纯地停留在学会“做动作”层面, 而是要使得它学会“做实验”这种行为方式。要先在大脑当中去做一万次实验, 之后再从中挑选出最为优质的那个方案, 而后再去执行该方案, 便是如此这般。

这种设计存在一种深层的哲学依据, 那是关乎动作空间的设计。英伟达Cosmos 3秉持机器人中心主义, 其动作具体被明确为机械臂的关节角度, 以及夹爪的位置。EvoPhys运用人本主义路径, 它并非教导机器人“二指夹爪如何行动”, 而是率先指导模型去学习“人的五指怎样捏杯子, 怎样拧开瓶盖”。

可是人本主义并非单纯只是路线方面的那种选择, 它延伸出了一套更为完整的并且叫做“三位一体”的工程项目标准。这套标准持有这样的观点, 那就是人类的数据采集相关设备、机器人自身的本体、以及人类用于远程操控机器人的交互设备, 这三者必须共同分享同一个数据接口。当人类戴着设备去推动杯子的时候, 其中眼睛所看到的画面、头部进行转动的姿态、手指那个位置的骨骼点以及用力的大小程度, 这些全都遵循同一套格式。而这套格式既被机器人直接进行读取, 同时也被远程操控的人类按照原本的样子接收下来了。如此这般, 人类所采集的交互数据能够径直用以训练, 所学到的行为能够径直转移至机器人之上, 并且人类于远程操控之际亦不会存有任何感知方面的错位。

这意味着, 所理解的乃任务本身, 并非被特定硬件形态予以绑定。于机器人形态尚未收敛的当下, 人, 方为那具最为通用的本体。

提及“知”跟“行”的关联, World Engine所担当的乃是“知”的作用, 即它清楚推杯子之后世界会产生怎样的变化, World Policy所承担的是“行”的作用, 也就是它明白为达成目标应当怎样采取行动。依据接近该团队的人员透露, 他们把两者的闭环归纳为“知行合一”, 并非先进行仿真而后决策的“先知后行”, 而是知行相互训练、呈螺旋式上升。

这个螺旋具备能够实现高效运转的情况, 存在一个作为关键的硬件方面的前提条件, EvoPhys团队所进行的模型训练借助摩尔线程的MTT S5000千卡集群来达成, 这款芯片最为特殊的要点之处位于: 它并非如同英伟达H100那样属于“纯训练卡”的类型, 而是留存有所谓完整的图形渲染管线, World Engine需要实时把杯子被推倒的画面“绘制”出来, World Policy要针对这幅画面开展关于下一步动作的计算工作——与此同时渲染与训练这两项任务必须在同一颗芯片上完成, 不能够划分到两台机器上去周折倒腾数据。还有它也同时需要另一个关键的硬件前提!英伟达用于数据中心的卡, 为了达成极致算力, 对渲染模块进行了阉割, 摩尔线程所推出的“全功能GPU”, 恰恰满足了世界模型的这种迫切需求。

二、它为什么特别?——英伟达和李飞飞提供的地图

EvoPhys这一底牌, 于此刻显得这般锋利, 其因在于, 它同两件重大之事建起对照。

英伟达的“主流”路线。

在EvoPhys发布的三天之前的时候, 英伟达推出了世界模型Cosmos 3。黄仁勋把它定位成“Physical AI的GPT时刻”, 打出了三张牌: 存在数万亿级别的多模态token , 具备开放的开发者生态 , 还有与宇树科技等本体厂商的硬件协同。

但要是去剖析它的数据构成情况, 就会察觉到一些饶有趣味的细节。依据英伟达所公然的技术报告, 在Cosmos 3 Reasoner的预训练阶段里, 大概2200万样本当中, OCR文字识别所占比例为42.9%, 2D空间定位所占比例是16.5%, 视觉问答所占比例为11.3%, 然而视频理解和推理所占比例仅仅只有0.05%。

换个说法来讲, 英伟达所拥有的模型, 是那种极为渊博的“通才”, 可是呢, 若在“怎样推一个杯子”这门物理课程当中, 它没准依旧属于初学者范畴。在它的“教材”里面, 掺和了数量过多的“语言”以及“合成画面”。它有可能学到的更多是“推”与“动”在统计层面老是一同出现的那种语言方面的关联, 并非“当所施加的力大于最大静摩擦力的时候, 物体才会产生位移”这样的物理因果关系。它固然强大, 然而它所解决的是规模化方面的问题, 并非“理解”方面的问题。

与此同时, 源于产业前线地方的真实需求数字, 看起来更为冷静。智元机器人合伙人姚卯青曾做过估算, GPT - 5训练语料折合起来大约是100亿小时, 然而全行业汇集起来的高质量具身数据仅仅差不多是50万小时, 二者差距是以万倍来计算的。黄仁勋所讲的“GPT时刻”, 更确切地说, 也许是“基础设施的归因时刻”, 而不是“模型能力的落地时刻”。算力是能够买到的, 可是真实世界数据, 必定得是一天一天积攒出来的。

李飞飞的“地图”。

这段时间窗口相同之际, 学界给出了自身框架, 6月4日, 斯坦福教授李飞飞发表论文, 将遭严重滥用的“世界模型”划分出三大功能类别: 渲染器, 即生成逼真像素的;仿真器, 即生成符合物理规律世界状态的;规划器, 即生成动作序列的, 她格外强调, 这三者里最被低估但价值最深远的是仿真器, 她做出预言, 最终这三类模型的边界会持续消融, 迈向一个“大一统世界模型”。

在这张地图上,英伟达和北大的位置被照见了。

一款名为Cosmos 3的产品, 它侧重于进行渲染以及仿真, 有着试图将所有内容都包含在此的想法, 不过其核心要点是致力于“制造出极为逼真的未来世界”。与之不同的是, EvoPhys这款产品, 精准无误地把赌注下在了李飞飞所提及的那片“无人涉足之区域”——意味着价值最为深厚、同时也是最难攻克的“仿真器”之上。然而更为关键之处在于, EvoPhys暗中规划出在了超脱常规地图范畴的行进路线。在李飞飞所构建起的框架体系之内, 上述三者在各自朝着不同方向发展之后是需要进行“整合对接”处理的。然而, EvoPhys却以“一个基模, 两种形态”给予了更为追求完美的解答: 这三个功能向来都绝对没必要进行缝合动作, 它们打从最开始之际就共同享用同一个隐空间, 依靠“螺旋自进化”彼此相互提供滋养。

意思就是, 在李飞飞还在为行业描绘出“怎样走到终点”的路线图之际、之时, EvoPhys已然已经拿出了“走到终点以后”的引擎。

三、从“是什么”到“为什么”

此刻, 所要阐释的是这样一个问题: 究竟为何, EvoPhys的这条“5D”路线, 相较于Cosmos 3的“4D”路线, 会更贴近于对物理世界的“理解”呢?

我们可以借用围棋的变化图来理解所谓5D。

棋手于思考下一步之际, 其脑海之中并非仅计算单一要点, 而是会同时摆出好几张变化图谱。其中图一, 若我落子于此处, 对手便会应于彼处的;图二则是, 我若进行打入操作, 对手展开反击, 那我是否能够成功做活。棋手需在零点几秒的短暂时长内, 减掉那些明显呈现低胜率的分支, 而后落子。世界模型对物理后果予以推演, 本质上其实是在做同样性质的事情——然而棋盘已然从三百六十一个交叉点转变为无限的连续空间。进行一个动作之后, 可能产生的后果存在无穷多种。模型得在零点几秒的时限内减掉那些违背物理规律的分支现象, 仅仅保留符合重力、摩擦力以及碰撞体积等条件的路径, 接着再从这些路径里挑选出最优的路径来。

这就是模式匹配与因果推断的区别。

被称作模式匹配的情况, 是模型于数据当中看到了“推”这般的动作跟“杯子动”这样类似画面的呈现, 在统计层面总是一同出现的状况, 所以它学会了这个规律, 而最终, 当它被要求去推一个铁块的时候, 它依然会运用同样的力气, 原因在于它并不理解“为什么”推铁块就需要更用力, 它仅仅是记住了类似于“推”与“杯子动”那样的一对表象而已。

因果推断, 是模型于无数真实交互里, 学会了一条底层物理规律, 即“当施加的力大于最大静摩擦力时, 物体才会发生位移”, 它并非在匹配“推”与“动”的画面, 而是在学习那个通用的物理方程, 所以, 不管是推杯子还是推铁块, 它都能够依据物体的质量和材质, 计算出所需多大的力, 它明白了原因和结果之间的必然联系。

进至更深层次。反事实推理所询问的是: “倘若适才我并没有推, 杯子是否会因桌面的震动而自行滑落? ”这乃是于脑海之中构建一个与现实相异的平行世界来展开推演。EvoPhys的5D引擎, 其本质实际上就是在对这种“反事实”能力进行工程化处理。

对一个模型进行“为什么”方面的教导, 跟去教导它“是什么”, 这二者绝对堪称是处于截然不同的两个范畴中的事件。将前者导向真正的智能化, 而后者仅仅是属于更为高级的鹦鹉学舌行为。

结尾:两种出牌,定义权博弈

走“主流”道路——有着20万亿token、开放生态以及硬件协同等特点的英伟达Cosmos 3, 它所解决的是规模化问题, 即“如何让更多机器人快速学会一个动作”, 这是算力帝国的一次标准出牌。

EvoPhys的激进之处在于, 它就连李飞飞刚刚画出来的地图都不满足, 而李飞飞表示世界模型应当融合渲染器、仿真器、规划器这三类功能, EvoPhys对此的回应是, 这三者从来都不需要被融合, 它们从最开始就应当长在一起, “一个基模, 两种形态”, 并非是一个愿景, 而是已经运行成功的架构, 李飞飞还在指明“前方应该会有一座桥”, 可EvoPhys已然站在了桥的对岸, 回过头去看地图说道: “我们的引擎已经过了河。”。

李飞飞绘出了“渲染器 - 仿真器 - 规划器”呈三分状态的地图, 这是以“大一统”作为最终静态终点,呈现出承认三者慢慢消退终究将融入、却同时主张一定要经历“先分散呈现后融合”阶段的学术正统渐进主义论调体现, 然而EvoPhys的架构表现得更为激进。它径直取消“三分法”的中间状态, 把仿真器(World Engine)与规划器(World Policy)挤压进同一隐空间, 致使二者并非“边界消融”后的并列选项, 而是彼此相互喂养的动态闭环, 即Policy执行后的真实结果反馈至Engine, Engine生成更精准的状态预测进而驱动Policy, 这并非“先分后合”的渐进融合, 而是知行合一的螺旋上升。

团队曾经把AI的三层进阶归纳成: LLM读万卷书, 具身智能行万里路, 世界模型知行合一, 前两者要么知要么行, 各有侧重, 而世界模型的终点, 恰好是知行相互训练的即时融合。

这场竞赛里, 最具深长意味的一幕, 大概出现在硬件层面。摩尔线程给EvoPhys提供了一颗有着“会渲染”能力的GPU, 且这能力恰好是英伟达数据中心卡被阉割掉的。这是一个信号, 在中国芯片企业的发展进程中, 硬件层面的能力演进反映出其在世界模型战场上的布局。摩尔线程的这一举措,展现了中国芯片公司正借助“渲染 + 训练”的融合架构, 尝试去定义全新标准。若世界模型最后证实需要一张具备“会画、会创造”功能的芯片, 那么英伟达极有可能要在下一代产品里恢复此项功能。

这不再是追逐,我们在一起做的,是路线定义权的博弈。

分享到:
客服服务热线
24小时服务
微信公众号
手机浏览

Copyright C 2025 All Rights Reserved 皖ICP备2024052706号-7

地址: EMAIL:1210524564@qq.com

Powered by PHPYun.

用微信扫一扫