欢迎登陆中企经济网
   

新人限时福利

世界模型赛道新解法:深度解析星源智具身大脑的预演‑验证‑行动闭环
2026-09-15 10:27:13 来源: 浏览:20

具身智能产业正在告别实验室内的演示时代,大步迈入真实工业场景的试炼阶段。机器人不再只需要在理想环境中完成预设动作,而是要面对环境动态变化、物体位置偏移、突发干扰等现实问题。传统机器人系统沿用 “感知#x2011;规划#x2011;执行” 的线性范式,机器人只能对已经发生的环境变化做出被动响应,一旦外部条件出现扰动,就极易出现任务中断、动作失效等情况。在此背景之下,世界模型技术被行业寄予厚望:它让机器人不再只是 “看见之后再行动”,而是能够对物理世界进行内部推演,预判环境变化、预演动作后果,由此完成预测式决策。

放眼全球,多家科研机构与企业都在布局世界模型方向,但各家的技术实现思路存在明显分野。一部分方案把世界模型当做训练阶段的辅助工具,用来生成仿真数据、增强表征学习;另一部分尝试将世界模型介入推理流程,但难以实现轻量化的端侧部署,高度依赖云端算力,无法满足工业现场低时延、高可靠的硬性要求。由北京智源人工智能研究院深度孵化的星源智,走出一条差异化路径:将自研的ω#x2011;EVA具身交互世界模型深度嵌入具身大脑整体架构,把世界模型从离线训练工具改造为机器人实时决策的核心组件,打通从仿真训练到真机端到端执行的完整链路。

需要明确的是,星源智本身是大脑平台型企业,并不生产机器人本体。它的整套技术,是作为基础设施与各类机器人本体协同适配,这也决定 ω#x2011;EVA 从设计之初,就需要适配异构机器人硬件,服务跨本体的通用智能能力输出,而不是绑定单一机器人形态。

世界模型四大技术路线,交互式动作反馈范式实现创新突破

行业当前的世界模型大致可以划分为四类技术路线,不同路线的目标、边界、落地能力各有侧重。 第一类是 Future Generation for Learning,未来生成增强策略学习。该路线的核心是生成未来视频或者未来状态序列,将生成结果作为额外监督信号,服务模型预训练、联合训练与策略蒸馏。代表项目包括 Motus、DreamZero 等。这类方案价值集中在训练环节,用来扩充数据集,提升策略的泛化能力,但世界模型本身不会介入机器人运行时的实时决策。

第二类为 Latent Prediction for Representation,隐空间预测塑造表征。它在隐特征空间预测未来状态,通过学习未来时刻的表征,打磨模型对环境动态、物理一致性的理解,以此优化感知能力。代表工作有 VLA#x2011;JEPA、DINO#x2011;World 等。该路线重在提升环境理解,但是缺少把推演结果转化为可执行动作的完整链路。

第三类是 Rollout、Simulator、Data Engine,仿真与数据引擎路线。将世界模型当做仿真器与数据生产引擎,大量生成虚拟轨迹,降低真机采集数据的压力。代表项目 GigaWorld、PlayWorld。它的核心价值是数据供给,世界模型充当模拟器,而不是机器人运行时的 “思考伙伴”。

前三类路线,无论侧重点是生成数据还是优化表征,共性在于:世界模型主要作用于训练阶段,机器人实际运行推理时,世界模型并不会深度参与控制闭环。而星源智提出的第四类Interactive Action Feedback(交互式动作反馈)范式,实现了范式层面的迭代:世界模型走出训练环节,直接参与机器人每一步的实时决策。

ω#x2011;EVA具身交互世界模型正是该范式的落地载体,并且它不能脱离具身大脑单独工作,是 RoboBrain Pro 具身大模型体系当中重要组成模块。ω#x2011;EVA 的核心判断:未来不是生成给人类观察的画面,而是要反馈给动作生成过程。传统流程是 “观测输入→直接输出动作”;而在 ω#x2011;EVA 加持的具身大脑链路中,流程更新为:观测输入→提出候选动作提案→内部推演该动作带来的环境与状态后果→根据推演后果修正动作→输出优化之后的动作给到执行机构,形成完整 “预演#x2011;验证#x2011;行动” 闭环。

ω#x2011;EVA 深度融入具身大脑,打造可反馈、可重写、可部署能力

ω#x2011;EVA 依托 RoboBrain Pro 具身大脑底座运行,底座基于 VLA(Vision#x2011;Language#x2011;Action)基座搭建,原本就具备空间理解、3D 语义地图构建、任务解析、基础运动控制能力。ω#x2011;EVA 补齐预测推演、动作校验短板,让整套具身大脑系统的动态交互能力得到质的提升,同时形成可反馈、可重写、可部署三大核心特质。

第一,可反馈。ω#x2011;EVA 会把动作提案对应的隐空间推演后果,显式交给内部优化模块,让世界模型的推演输出,成为单次机器人控制决策的内置反馈源。区别于外部事后评估,反馈发生在动作下发执行之前,在内部就完成风险校验,规避一部分到真实物理世界才暴露的错误。

第二,可重写。优化模块不仅仅打分评估候选动作好坏,而是基于推演出来的后果,直接生成修正后的动作片段。不再是 “评估完再重新走一遍规划流程”,而是直接改写动作输出,压缩决策链路耗时,这对于高速动态场景尤为关键。

第三,可部署。整套推演运算全部在隐特征空间内部完成,不需要生成完整高清未来仿真视频,极大压缩计算开销,实现端侧实时运行。整套逻辑依托端侧算力平台完成运算,不用依赖云端大模型,规避网络抖动带来的时延、断连风险,满足工业现场的稳定性要求。

从模型参数与训练配置来看,ω#x2011;EVA 仅 1.2B 参数量,训练阶段使用 16 块 NVIDIA H100 GPU(80GB),总 batch size 设置 1024,采用 AdamW 优化器、bfloat16 混合精度,三阶段分别训练 50/30/20 个 epochs。在公开基准数据集上,LIBERO 达到 98.6% 成功率,LIBERO#x2011;PLUS 达到 83.4%,RoboTwin 达到 90.3%,在同量级参数规模下表现出优秀性能。

仿真在整套体系中承担双重角色:一方面在训练阶段,依托仿真环境开展大量强化学习迭代,不仅利用成功样本,也充分吸收失败轨迹。对比纯模仿学习只能使用高质量成功数据,ω#x2011;EVA 的训练链路 8 小时工作时长内,可以有效利用 6-7 小时各类轨迹,显著降低真机数据采集成本;另一方面仿真也用于做边缘工况的预验证,模拟障碍物遮挡、物体偏移、光照变化等现实中少见但会严重影响作业的场景,提前打磨具身大脑的鲁棒性,减少真机测试损耗。同时,依托智源阶段积累的 20 余个品牌机器人、约 20 万条真机真实数据,建立统一语义与数据标准,实现仿真数据和真机现实世界之间的对齐,为跨本体泛化打下数据底座。

从仿真走向真机:2026 WRC 大会,实机 Demo 验证世界模型能力

技术最终价值,需要真实硬件、真实交互场景完成检验。2026 世界机器人大会(WRC)8 月 19#x2011;23 日在北京亦创国际会展中心举办,星源智以 “具身大脑・交互世界” 为主题,在 C 馆 C122 展台完整展示 RoboBrain Pro、ω#x2011;EVA、RoboBrain Xross 三大技术,多组实机 Demo 直观展现 ω#x2011;EVA 嵌入具身大脑之后的能力表现。

其中人机乒乓球对打 Demo 极具代表性:搭载集成 ω#x2011;EVA 的具身大脑的机器人,和人类选手开展乒乓球对打。乒乓球属于高速动态目标,位置、轨迹时刻发生变化。具身大脑借助 ω#x2011;EVA 持续做轨迹推演,预演球的落点,再根据真实世界反馈动态修正挥拍动作。这个演示直观证明,世界模型不再只是论文与仿真环境中的效果,已经介入高速动态交互的端到端闭环,能够在极短时间窗口内处理现实世界的变化。

除单机动态交互之外,多主体协同同样是具身智能的重大难题。在会客厅具身花园 “灵机腾跃” 展位,星源智联合南京大学 LAMDA 团队完成全球首次人形机器人 + 机器狗异构多机协同跳长绳实机验证:两台人形机器人协同摇绳,四台机器狗跟随绳体节律连续跳跃。不同本体硬件参数、运动特性完全不一样,依靠 RoboBrain Pro 具身大脑,ω#x2011;EVA 对各方的动作时序、交互后果做内部推演,完成跨形态的动作同步和策略协同,把多主体协同从理论概念变成肉眼可见的机器人行为。

 

而全新展出 RoboBrain Xross 跨本体协同平台,则进一步把 ω#x2011;EVA 和具身大脑的能力,从单台机器人拓展至多机集群。过去行业更多追求 “一脑多形”,同一个大脑适配不同机器人硬件;而 Xross 面向下一阶段难题,实现 “一脑多机”。异构本体之间最大难点并不是单机智能,而是感知对齐、任务分配、动态响应。平台依靠全局感知、任务编排、动态调度三大能力打通多台本体的信息通路与决策链路,ω#x2011;EVA 对多机交互带来的连锁后果做推演预判,支撑整套多机器人协同体系稳定运行。

工业方向,星源智与中力股份合作的具身装卸方案同样经过真实工况打磨。集成 ω#x2011;EVA 的 RoboBrain Pro 具身大脑部署在叉车本体之上,ω#x2011;EVA 持续仿真货车、托盘、货叉之间的空间关系,预判扰动偏差;叠加路端感知、自研规控、末端闭环整套体系,标定误差由 0.77m 压缩至 0.10m,减少运动停顿,末端货叉实时微调。最终实现单车作业平均 90 秒,双车协同装卸进入 1 分钟区间,效率追平人工,这套方案已经完成全球发售。同期 WRC 首秀的 “擎天柱” 10 米高位作业机器人,同样搭载整套具身大脑,在高空复杂环境下依靠 ω#x2011;EVA 推演环境变化,完成双臂协同高危作业。

8 月 20 日 WRC 配套 “智造现场・具身智能的工业试炼论坛”,创始人刘东发表主题演讲,探讨具身智能走向产业深水区命题,也再次阐述世界模型 + 具身大脑组合,对于工业规模化落地的现实意义。

平台化定位:世界模型赋能 70% 以上本体企业的产业实践

星源智作为智源孵化的平台企业,成立 10 个月完成三轮融资,累计融资突破 10 亿元人民币。资本的认可,来自技术路线同时兼顾前沿创新与产业落地。公司不制造机器人本体,输出的是具身大脑的软硬一体(具身大脑模型 + 高算力端侧算力平台)整套基础设施,目前已经被国内 70% 以上机器人本体企业采用。

很多本体厂商,拥有优秀机械硬件能力,但是面临 “有身体没有大脑” 困境:换一款机器人本体,就要重新训练、调优整套智能算法,研发周期长、成本高昂。RoboBrain Pro 具身大脑搭配 ω#x2011;EVA 世界模型,实现跨本体泛化,一套智能底座可以赋能人形、机器狗、机械臂、叉车、轮式机器人等多元硬件。同时依托 NVIDIA Jetson 生态,提供不同档位端侧算力平台,适配从高端人形到中小型机器人、存量改造算力背包等各类需求。

为适配不同厂商研发实力,星源智开放三类合作模式:全底层交付,提供硬件 + 驱动 + 中间件 + 上层算法,厂商仅开发上层业务应用;软硬分离定制,客户自研部分底层驱动;纯硬件供货,只交付硬件与内核驱动,算法由客户自主开发。灵活模式降低各类本体厂商接入门槛,让 ω#x2011;EVA 为代表的世界模型能力,可以大规模输送到产业端。

技术层面,星源智牵头建设具身交互世界模型北京市重点实验室,联合北京智源等机构开展长期攻关,围绕世界模型、多模态交互感知、长时序任务推演、异构协同持续迭代。值得一提的是,ω#x2011;EVA 的 Stage3 模块具备通用性,其他世界模型方案,例如 DreamZero,如果希望增加交互式自修正能力,也可以复用该模块,代表这套范式具备向外赋能的潜力。

当然也需要客观看待行业现状,世界模型赛道整体尚处于快速演进阶段,不同技术路线各有所长:生成式路线擅长扩充训练数据,表征预测路线擅长环境理解,仿真引擎路线擅长虚拟场景构建。而星源智的差异化价值,是把世界模型真正嵌入具身大脑实时控制闭环,完成从仿真推演到真机端到端执行,并且已经在 2026 WRC、工业装卸、高位作业、异构多机协同多个场景交出实机答卷。未来随着真机数据持续积累,仿真#x2011;真机双向迭代闭环持续优化,ω#x2011;EVA 与具身大脑结合的技术路径,会持续为机器人本体厂商输出预测式决策的通用智能能力。

Tags:世界 模型 赛道 解法 深度 解析 星源 大脑 预演 验证 行动 发布者:Anita
打印繁体】【投稿】【收藏】 【推荐】【举报】【评论】 【关闭】 【返回顶部
上一篇良心揭露柿饼市场惊天骗局!亲赴产地,发现富平柿饼真相! 下一篇国内具身机器人代表性企业盘点:..
热门推荐

推荐文章

图片主题

热门文章

最新文章

相关文章