米兰·(milantiyu)中国官方网站-WRC 2026|生数科技发布最新研究成果,提出通用世界模型五级发展路线
2026-08-26 16:06:02

8 月 19 日下战书,世界呆板人年夜会分论坛“具身智能年夜模子的进化之路:从技能分级到财产落地”于北人亦创国际会展中央进行。生数科技开创人兼首席科学家、ACM/IEEE/AAAI Fellow 朱军发表大旨演讲,发布团队最新研究结果,并体系论述通用世界模子的五级成长线路。

朱军暗示:“从年夜模子成长的视角来看,咱们但愿构建的,不只是办事在某个使命或者场景的专用模子,而是一个可以或许理解世界、猜测将来并采纳步履的通用基座模子。”

WRC 2026|生数科技发布最新研究成果,提出通用世界模型五级发展路线

从第一性道理出发,界说通用世界模子

世界模子已经经延长到视频天生、情况模仿、呆板人决议计划及动作节制等标的目的,但行业对于“甚么样的世界模子才称患上上通用”仍缺乏共鸣。

人于进修骑自行车或者开车时,会从最初的不协调逐渐变患上不变、正确。其主要缘故原由,是年夜脑于与外部世界连续互动的历程中,形成为了一个关在世界怎样运行的“内部模子”。

通用世界模子一样需要三项相互联系关系的能力:

“通用世界模子不是单一的天生器、模仿器、呆板人动作模子或者计谋模子,也不是这些能力的割裂片断或者简朴线性串联,而是三种能力耦合于一路的闭环反馈体系。”朱军夸大,步履不仅是模子的输出,还有会转变情况、孕育发生新信息,并进入下一轮理解、猜测及决议计划。

WRC 2026|生数科技发布最新研究成果,提出通用世界模型五级发展路线

数据、架构与算力:构建通用世界模子的三大体素

要想构建通用世界模子,仍旧离不开年夜模子的三个基本要素:数据、架构与算力。

于数据方面,通用世界模子需要一个由不雅察慢慢走向步履的多层数据金字塔:从海量收集视频最先,慢慢扩大到特定范畴视频、第一视角人类视频、动员作记载的人类树模,以和真实呆板人交互数据。

越接近底层,数据范围越年夜、笼罩面越广;越接近顶层,数据虽然更稀缺、成本更高,却能更直接地成立使命、动作与物理成果之间的接洽。合成数据可以贯串金字塔的每一一层。同时,“不完善数据”一样具备主要价值:掉败测验考试、改正动作及恢复历程都包罗有用的进修旌旗灯号,可以或许帮忙呆板人进修怎样从掉败中恢复。

WRC 2026|生数科技发布最新研究成果,提出通用世界模型五级发展路线

于架构层面,通用世界模子需要同一处置惩罚图象、视频、语言及呆板人动作等差别模态信息。MoT(Mixture-of-Transformers)经由过程为差别模态配置专属参数,并以同享留意力实现跨模态信息交互,使情况理解、世界状况猜测与动作天生可以或许于统一模子中协同完成。生数科技的世界动作模子 Motubrain 恰是基在这一架构,将理解、猜测与步履同一建模,打破传统分模块方案的能力割裂,同时晋升异构数据的使用效率及跨使命迁徙能力。

算力则同时影响年夜范围预练习及及时部署。离线视频天生可以容忍必然等候时间,但及时交互及呆板人节制必需于情况发生变化以前完成猜测及决议计划。是以,练习基础举措措施、推理加快、模子蒸馏及高效留意力机制,都是通用世界模子走向现实运用的主要支撑。

通用世界模子怎样进化?五级线路图明确进阶标的目的

从通用基座模子的方针出发,通用世界模子可以划分为五个逐级演进的层级。它们其实不是相互割裂的产物标的目的,而是跟着对于世界的理解不停加深、与世界的交互不停加强,模子自立性连续晋升的历程。已往几年,生数科技的研发与落地实践已经经笼罩此中前三个层级。

WRC 2026|生数科技发布最新研究成果,提出通用世界模型五级发展路线

L1:世界天生(World Generation)

第一步,是让模子学会天生联贯的世界演化历程。视频恰是这一阶段最典型的载体,它帮忙模子进修对于象、运动、空间瓜葛及时序变化,为进一步理解及猜测世界奠基基础。

2024 年,生数科技推出视频天生年夜模子 Vidu,经由过程连续晋升视频质量、时序一致性及世界动态建模能力,完成为了 L1 阶段的开端实践。

L2:与世界交互(Interactive World)

于天生能力之上,模子最先吸收及时输入,并按照语言、语音或者节制旌旗灯号连续转变后续内容,从“一次天生”走向“连续互动”。

2026 年 7 月发布的 Vidu S1 将这一能力推进到及时交互阶段。用户可以经由过程语音及时参与天生历程,连续影响接下来发生的内容,让模子可以或许按照外部输入动态演化世界。

L3:于世界中步履(Actionable World)

再往前一步,模子最先从数字世界进入物理世界。此时,情况理解、将来猜测及动作天生需要真正同一起来,让模子不仅能判定世界发生了甚么,还有能直接天生呆板人可履行的动作,并按照真实反馈连续批改。

Motus 及 Motubrain 标记着生数科技从视频天生进一步走向物理步履。Motus 在 2025 年 12 月发布并周全开源;2026 年 4 月发布的 Motubrain,则进一步将情况理解、世界状况猜测及动作轨迹天生同一到统一个模子中,鞭策通用世界模子从“视觉推演”迈向“物理决议计划”。

相较 Motus,Motubrain 的推理速率晋升约 10 倍,适配新的呆板人本体时,仅需 50 至 100 条人类树模数据。于 RoboTwin 2.0 基准测试中,其成就到达 96.1 分,位居榜首。今朝,Motubrain 已经于包括星河通用、星尘智能、千寻智能等近十种本体上完成验证,揭示出于长程使命、多使命场景及差别呆板人形态之间的泛化能力。

L4:自立世界智能体(Autonomous World Agent)

具有真实施动能力以后,模子还有需要进一步走向自立决议计划,可以或许缭绕持久方针自动感知情况、拆解使命、摸索未知状况并连续计划步履。

L5:世界构造者(World Orchestrator)

于更高层级上,模子再也不只节制单个智能体,而是可以或许兼顾呆板人、数字智能体、人类、东西和其他资源,完成更繁杂的使命分配与多智能体协作。

从 L1 到 L5,能力层层递进。没有对于世界演化纪律的进修及猜测,就难以形成不变、持续的交互;没有真实施动带来的情况反馈,也很难进一步成长出自立进修、持久计划及繁杂协同能力。

面向 L四、L5,还有需冲破六项要害挑战

今朝,L1 至 L3 已经经形成较为详细的技能实践,但间隔更高阶的世界智能仍有差距。视频模子仍需连续晋升天生质量、可控性与时空一致性;世界动作模子则需要于更繁杂、更开放的真实情况中,进一步晋升不变性、泛化能力与履行效率。

继承迈向 L4 及 L5,还有需要冲破六项要害挑战:

缭绕这一标的目的,生数科技将连续强化世界天生、与世界交互、于世界中步履三个层级,并进一步补齐方针形成、自动摸索、连续进修及持久影象等能力,为更高阶的自立世界智能体奠基基础。更久远的方针,是构建一个可以或许连续理解世界、猜测差别步履的后果、于明确约束下自立步履,并从真实反馈中不停进修及进化的通用基座。

当理解、猜测与步履真正形成闭环,世界模子也将再也不只是天生内容的模子,或者履行使命的呆板人计谋,而会成为毗连数字世界与物理世界、迈向通器具身智能的主要基础。

博客链接:https://www.shengshu.com/zh/general-world-model/

-米兰·(milantiyu)中国官方网站

26
08
400-8517-666

米兰·(milan)中国官方网站中国•杭州西湖区 西溪路588号米兰大楼版权所有浙ICP备09024834号-1浙公网安备 33010602001940号