天极大咖秀

登录 | 申请注册

世界模型“六小龙”齐聚WAIC,技术路线未收敛,落地标尺正在收敛

智能进化论 2026-07-21 阅读: 79 次

世界模型正在成为AI由数字世界走向物理世界的重要技术底座。

“颠覆性技术突破往往诞生于某个标志性的瞬间,但它对社会的渗透永远是润物细无声。世界模型作为机器人大脑将成为贯穿未来10年人工智能产业的核心主线之一,让人工智能真正走进物理世界。”

7月19日,在由大晓机器人承办的2026世界人工智能大会“世界模型六小龙”巅峰论坛上,商汤科技董事长兼CEO徐立作出上述判断。

这场论坛汇聚了诺贝尔经济学奖得主、全球顶尖学者、科技企业掌舵者以及具身智能领域的技术领军者。论坛直面产业核心问题:世界模型如何跨过从技术演示到真实应用的鸿沟?

论坛现场,大晓机器人发布了开悟世界模型3.1(Kairos 3.1)、环境式数据采集方案2.0,以及面向三大垂直场景的成套解决方案。

诺贝尔经济学奖得主Thomas J. Sargent出席论坛并提醒行业:面对罕见事件和从未出现过的环境,现有智能系统仍存在明显的认知边界。世界模型真正的考验,不是能否复现已经见过的世界,而是能否在不确定性中作出可靠判断。

大晓:提出具身世界模型第一性原理,

发布开悟世界模型 3.1

数字世界里的AI犯错,可能只是多生成一根手指;物理世界里的机器人判断失误,却可能摔坏商品、撞停设备,甚至带来安全风险。

基于这一判断,大晓机器人董事长王晓刚在论坛上提出“具身世界模型第一性原理”:

“依托多模态高密度信息萃取、控制充分状态锚定,在复杂不确定环境中最大限度降低机器人行动试错成本,加速物理 AI 的‘开悟’时刻到来。”

大晓机器人董事长 王晓刚

因此,大晓此次发布的并非一个孤立的模型,而是试图打通“高密度数据—世界模型—真实场景”的完整链路。

模型层,大晓发布了原生行动一体化开悟世界模型3.1(Kairos 3.1)并向全行业开源。Kairos 3.1将视觉观测、语言指令、力触状态和策略轨迹压缩到统一隐空间,从底层实现世界理解、物理生成、动作预测三大能力的深度融合。

据大晓公布,在NVIDIA Jetson Thor平台、BF16精度下,Kairos 3.1的8B模型平均推理延迟为125毫秒。这一点直接关系到世界模型能否从实验室走向真机。

数据层,大晓提出“信息密度定律”并发布环境式数据采集方案2.0。环境式数据采集方案2.0打通感知采集、自动标注与异构本体映射,尝试将人在真实环境中的视觉、动作和力触信息,转化为可供不同机器人学习的标准化数据。

在模型与数据底座之上,大晓还发布了三套行业解决方案。

“晓满”面向即时零售,在多SKU、高密度货架、狭窄通道和订单波峰等条件下完成商品拣选与履约。

“晓新”切入酒店夜间洗衣,将收、放、洗、叠等环节串联成连续流程。

“晓途”则面向园区巡检、城市治理等开放空间,让同一套智能大脑适配不同四足机器人,完成自主导航、动态避障与多机协同。

这也体现出一种更现实的世界模型产业化路径:不是等待一个无所不能的通用机器人突然出现,而是先进入有明确价值的复杂场景,把一项完整工作稳定做完;再利用真实运营产生的数据,推动模型不断降低接管率、扩大任务边界。

物理智能还需要统一标尺

当前,具身智能领域并不缺演示和指标,真正缺少的是一套能够跨场景、跨本体、跨任务验证能力的公共标准。

针对这一痛点,大晓联合产业各方推出了物理智能评测基准平台PHYSICAL IQ“物智”。据介绍,这是首个具身原生、面向多场景、多本体、多任务的物理智能评测平台。

PHYSICAL IQ由上海人工智能行业协会、河套学院、中国信通院华东分院联合发起,参与方还包括上海交通大学、南洋理工大学、香港中文大学、香港大学等高校,以及宇树、汇川技术、傅利叶、国地中心、钛虎、灵心巧手、大晓、自变量、极佳、无界动力、影溯、百度智能云、辉羲等产业伙伴。

短期内,世界模型未必会收敛到同一条技术路线,但有可能先收敛到同一套评价标准。正如ImageNet没有规定所有模型采用同一种架构,却让不同路线可以在同一考场竞争,统一标尺也可能成为世界模型技术融合的起点。

同时,大晓还发起“世界模型云生态共建”,联合百度智能云、阿里云、华为云、腾讯云以及商汤大装置等算力伙伴,尝试打通从云端训练、模型推理到真实场景验证的基础设施链路。

两项生态布局分别回答了世界模型产业化中的两个基础问题:PHYSICAL IQ解决“能力如何衡量”,云生态解决“模型如何规模化训练和部署”。

六小龙圆桌:

路线仍在分化,产业答案开始收敛

论坛现场的“六小龙”圆桌更大的价值,是把世界模型产业化面临的三个核心问题摆到了台面上:世界模型究竟应该学习什么,什么样的世界模型才算真正“理解”了世界,以及如何从Demo跨越到Deployment。

针对世界模型究竟应该学习什么,自变量机器人联合创始人兼CTO王昊给出了一个颇为尖锐的判断:如果没有更多物理信息输入,仅靠纯视频理解物理世界,这条路线有很大问题。

智元机器人AI算法总监任广辉指出,目前大量互联网视频包含运镜、剪辑和超现实表达,服务的是内容创作,并不是天然符合物理规律的“原生数据”。机器人需要学习的,不只是一个动作看起来像不像,而是夹爪是否真正接触物体、物体为什么移动,以及动作发生后会带来什么结果。

无界动力联合创始人兼CTO夏中谱认为,真正造成世界变化的力觉、触觉等信息,反而是现有数据中最缺失的部分。世界模型的核心,不是复刻已经见过的画面,而是学习物理状态如何变化,并将这种因果理解用于未来推演和行动决策。

极佳视界联合创始人兼首席科学家朱政表示,世界模型现阶段难以落地,本质上还是模型能力不够。与其过早围绕场景做大量适配,不如先把精力收回来,提升模型能力的上限。

什么样的世界模型,才算真正“理解”了世界?

嘉宾给出的指标并不完全一致。无界动力联合创始人兼CTO夏中谱看重跨场景、跨任务、跨物体的泛化能力,以及未来预测对最终决策的提升;蚂蚁灵波首席科学家沈宇军强调反事实推演、恒常性记忆与推理时效性;智元机器人AI算法总监任广辉更关注少样本、多任务条件下的真机成功率。

从Demo到Deployment,嘉宾的判断高度一致:Demo验证的是能力上限,部署考验的却是稳定交付的下限。世界模型真正要跨过的是稳定性、异常处理、交付效率、复制成本与商业回报组成的系统门槛。

正如大晓机器人首席科学家陶大程所说:“产业不会为聪明买单,但产业会为稳定的聪明买单。”

虽然技术还未收敛,但世界模型的竞争,正在从“谁生成的未来更逼真”,转向“谁能让机器人在真实世界里少犯错、做成事,并且算得过经济账”。

END

本文为「智能进化论」原创作品,

欢迎关注。

智能进化论
专注云计算、AI、数字化转型领域深度报道。

特别声明:文章版权归原作者所有,文章内容为作者个人观点,不代表大咖秀专栏的立场,转载请联系原作者获取授权。(有任何疑问都请联系wemedia@yesky.com)