adtop
当前位置: 汽车报价网 -> 焦点

热点对话:具身智能的胜负手:不是模型,是闭环

时间:2026-09-16 05:02   栏目:焦点    来源:盖世汽车   阅读量:13768   

9月15日,盖世汽车具身感知融合与多模态大模型创新研讨会在上海举行,在热点对话环节,极佳科技合伙人、副总裁毛继明与福莱新材AI算法总监廖永兴、光象实验室首席科学家吕尧、墨甲机器人多传感器融合负责人卓伟丰、睿尔曼智能科技股份有限公司解决方案总监计海锋一起,围绕“从看懂到会做:具身智能迈向通用智能的关键突破在哪里”主题,讨论了具身智能从实验室走向真实场景时最难绕开的问题,模型路线如何选择?多模态感知如何进入物理交互?真机数据、仿真数据与人类数据如何组合?规模化瓶颈究竟出在模型、数据、感知还是本体?

专家观点虽然不完全一致,但对行业后续的发展,形成了一个共性的基本判断,具身智能的突破不是单点技术的胜利,而是系统能力的成型。VLA、世界模型、物理原生模型等技术路线的快速演进,让机器人从看懂世界逐步迈向理解世界、决策并行动,但一旦进入真实场景,感知融合、数据获取、模型泛化、本体应用落地就会同时形成约束。

模型路线不是单选题

热点对话的第一个话题,就直指具身智能的核心争议:VLA、世界模型和物理原生模型,谁才是具身智能的大脑?

这个问题在行业里很容易被简化为路线之争,但廖永兴给出的判断是,现在更多不是取决于哪一类模型为主,而是分层模型形式,可以有一个主决策大脑做更高维度的语义理解、空间认知、物体位置认知,把收到的任务提示理解成对物理世界和环境的认知,再输出运动轨迹反馈;接下来更重要的是把运动轨迹实现出来,这涉及大脑的一部分或者小脑角色,把运动轨迹或任务拆解成真实物理世界中的互动。

这一判断实际上点出了具身智能与纯语言模型的关键差异。语言模型可以在相对封闭的符号空间里完成推理,但机器人必须面对接触、摩擦、惯性、形变和实时控制。单一端到端模型即便在Demo中表现惊艳,也很难同时兼顾高层语义理解和低层高频控制。

分层融合不是折中,而是物理世界约束下的工程必然。

吕尧则从另一个角度消解了范式之争。现在很多争论集中在VLA或者世界模型的范式上,但范式本身不应该是争的点,而应该面向通用智能真正的开发需求,去找到真正的开发方案。吕尧进一步指出,怎样更好看清世界、理解任务,然后把这个任务真正做出来,才是模型开发的最终目标.

至于训练出来的模型长得像VLA还是像世界模型,那是结果,不应该一开始用范式限制模型的开发能力。更好的开发路线是借助大模型能力,同时借助传统工业部门的积累,集成起来,真正做出一套成熟的泛化方案。

这一观点在当下尤其重要。行业容易陷入标签化讨论,但具身智能的落地场景高度分散,工业装配、家庭服务、零售补货、汽车总装等对模型的要求并不相同,如果过早用范式站队,反而会压缩技术探索的空间。

卓伟丰也表达了类似的观点,具身智能的大脑不一定是一个统一的大模型,而可能是由任务规划、轨迹生成、运动控制等多个模块组成的系统。

模型的价值最终要在具体场景中以节拍、精度、稳定性和成本来衡量。

计海锋同样明确支持融合路线。“机器人要在家庭和各种场景下应用,可能不是单一模型解决问题。VLA有动作序列,但缺乏物理约束,也缺乏对下一时刻的预测,而世界模型和物理模型刚好有先天优势”,计海锋如是说,几个大脑最后融合在一起,共同决定机器人的超级大脑,而最终机器人还是会朝着更像人的大脑方向迈进。

慢思考负责任务理解和长期规划,快反应负责接触控制和异常调整,两者缺一不可。很明显,具身行业已经过了单纯比拼模型概念的阶段,开始进入架构设计和工程实现的深水区。

模型路线之争仍会继续,但真正决定成败的,是能否把不同模型的优势组织成一个可落地、可迭代、可规模化的系统。

多模态感知必须进入物理交互闭环

当模型架构从路线之争回到分层融合,一个更贴近物理世界的门槛随之出现。行业过去更多依赖视觉,因为视觉信息在人类感知中占比高,技术也最成熟,但具身智能不只是看懂世界,它还要用手、用末端执行器去改变世界。

一旦进入精密装配、柔性抓取、表面处理等任务,视觉只能提供事前判断,无法替代接触过程中的力觉和触觉反馈。多模态感知能否进入控制闭环,而不是停留在展示层面,成为从看懂走向会做时,必须要回答的问题。

廖永兴从触觉数据的实践出发,指出一个普遍困境:如何把触觉或力学融入现有机器人模型。很多时候,行业对触觉的理解还停留在开关角色,即只有有和无,而不是真实接触时的弹力变化、方向变化以及对接触物体特征的反应。

随着传感技术迭代和发展,数据融合最大的应用点也转变为数据可靠性、一致性和同步性,需要确保提供数据的传感器或数据足够一致、足够准确,并且在同步方面与其他模块做到很好配合,廖永兴表示,如果能达到这两个目的,接下来把数据和具身智能融合,就会走得更顺畅。

视觉数据可以以图像或视频形式大规模采集,但触觉数据是分布式、连续、高频且与接触状态强相关的。如果传感器一致性不足,或者时间同步存在偏差,触觉信息就很难进入控制闭环,只能作为事后判断的辅助信号。

吕尧从学习机制角度补充了触觉和力觉的必要性。具身智能面临的是物理世界,真正需要用动作系统与世界交互,数据非常必要,它是对物理世界真实状态的反映,无论是视频数据,还是物体真正做接触式操作所需要的数据形态。吕尧类比了人类婴幼儿时期,还没有长期思维能力时,就是通过探索去摸、去抓、去感受,逐渐通过交互方式收集信号并总结规律。

具身智能也应该把模型放到交互环境里,收集足够充分的物理信号,让模型进行学习。

目前大部分具身数据以图像、动作和本体状态为标准,力觉数据数量还比较少。在数据匮乏环境下,吕尧提出了显式状态和隐式结果的思想:显式状态偏向真实机械臂关节、速度以及接触力,希望通过人类经验已经压缩出来的知识、动力学方程和系统模型,直接建立到模型学习过程中,用更少数据站在人类肩膀上,再往上学习;图像等数据通过神经网络方式推演,并与大数据经验知识对齐。

这一思路实际上是在数据驱动和物理模型之间寻找结合点,纯数据驱动需要海量样本,纯物理模型难以覆盖复杂开放场景,把动力学先验嵌入学习过程,可能是降低数据依赖、提升泛化能力的重要路径。

但要真正进入模型,还必须经过控制闭环的检验。触觉和力觉之所以难以被替代,正是因为它们直接参与接触过程中的实时反馈。在控制层面,触觉不是附加模态,而是决定动作能否稳定完成的关键环节。卓伟丰指出,机器人通过传感器数据做感知,感知之后通过预测信息做出决策,再进行行为规划和控制,最终末端要对真实世界和交互做反馈。

没有触觉,机器人只能依赖视觉预测接触状态,一旦出现偏差就无法及时调整;有了触觉和力觉,机器人才能在接触瞬间感知到是否抓稳、是否打滑、是否过度用力。

控制闭环中的触觉价值,在精密操作场景中体现得最为集中。计海锋用精密装配的例子把问题讲得更具体。计海锋表示,做机器人其实就是在做人类造自己的过程,人类主要通过眼睛观察世界,视觉信息可能占到80%,所以VLA里的V就是视觉,视觉用得最多、最成熟。但在精密装配场景中,没有触觉、没有力觉,精密装配是完成不了的。比如螺纹孔只有5毫米,螺钉放进去时差1毫米甚至0.1毫米都可能放不进去,这时候用到阻抗控制,就需要力觉和触觉感知来辅助完成操作。

多模态感知要真正进入控制闭环,前提是数据能够被稳定采集、同步、标注并用于训练。触觉和力觉之所以难以融入现有模型,不只是传感器和算法问题,更是数据供给问题。真机数据、仿真数据、人类数据如何分工?如何在不同训练阶段配比?如何形成从场景到模型再回到场景的循环?决定了感知融合能否从局部功能变成系统能力。

没有数据闭环,触觉数据只能停留在单点验证;有了数据闭环,模型分层和感知融合才有持续迭代的基础。

数据不是单选题

当多模态感知试图进入物理交互闭环,数据问题就无法再被绕开。视觉、触觉、力觉的融合需要大量高质量样本,而具身智能当前最缺的恰恰是真实世界交互数据。

仿真数据可以以更低成本涵盖更广范围;真机数据成本较高,但它是还原最真实机器人在物理世界交互的数据,也是最可靠的数据;以人为本的数据则用人的方式补足缺陷,以较低成本、较容易的方式涵盖更大范围。

人类从小到大已经积累了很多操作经验,拿起麦克风、折叠衣服、操作工具,都是真实技能。廖永兴给出的判断是,在仿真数据已经趋向成熟阶段的情况下,接下来可能起到更大作用的是以人为本,采集更多真实人类操作技能的数据,再通过少量真机数据做验证和调整,完成从人到机器人技能的转换。

仿真本身是动力学支架,通过这种方式可以真实学到世界底层转移规律,只需要压缩出这样的规律系统,再通过真机方式对齐到真机上的特定动力学参数和特性,就能让模型有比较好的通用泛化能力。

仿真不是廉价替代品,而是规律生成器。仿真的真正价值不是模仿真机,而是生成大量可控变化,让模型学到物理世界底层的转移规律,再用真机数据对齐特定参数。

不过,数据分类的清晰并不等于落地路径的清晰。当行业把真机、仿真、人类数据各自的职能摆清楚之后,一个更棘手的问题随之浮现:为什么有了这些数据,具身智能仍然难以从demo走向规模化?瓶颈显然不在数据一个环节。

廖永兴认为,不是单一某个环节出问题,而是一种组合,可能都有阻力。

如果一定要排顺序,第一是数据量,真实世界交互数据量确实不足,比起语言模型所用数据量或视觉数据量,具身智能与物理世界交互的数据量不在一个层级,所以数据量缺失是第一个瓶颈。

接下来是算法层面,如何更好把多模态数据,比如触觉或力学知识,融入具身智能决策层面或运动规划层面,让它更好理解世界,做出快和慢的思考与反应,这是算法层面的另一个瓶颈。

同时,需要有一个系统性闭环:怎么把数据用到本体上,通过模型让机器人先有一定智能,然后在场景上干活,干活完采集更多数据,让智能不断提升。

没有闭环,数据是孤岛,模型是展品,本体是样机;有了闭环,机器人才能在真实场景中持续积累能力。

小结:具身智能从看懂到会做的关键突破,不在某一个单点技术,而在系统能力。

模型层面,行业正在从路线之争走向分层融合,慢思考与快反应结合,语义理解、物理预测、运动控制和实时反馈形成稳定接口。

感知层面,视觉仍然是成熟度最高的模态,但精密操作和物理交互要求触觉、力觉进入控制闭环,多模态融合必须解决可靠性、一致性、同步性和物理先验嵌入问题。

数据层面,真机数据、仿真数据、人类数据各有不可替代的价值,仿真提供规律生成和大规模变化,人类数据提供技能先验和接触交互,真机数据提供最终验证和真实场景闭环,而数据的关键,在于训练配比和阶段化使用。

规模化层面,数据量、算法、本体、算力、人才都存在瓶颈,但最大的短板是系统性闭环缺失。只有让本体、数据、模型和场景形成自主迭代闭环,具身智能才可能真正从Demo走向规模化。

具身智能下一阶段的竞争,不会只是模型参数的竞争,也不会只是本体形态的竞争,而是系统迭代效率的竞争。谁能更快把真实场景数据转化为模型能力,再把模型能力放回场景中验证和优化,谁就更可能率先跨越从看懂到会做的门槛。

郑重声明:此文内容为本网站转载企业宣传资讯,目的在于传播更多信息,与本站立场无关。仅供读者参考,并请自行核实相关内容。

编辑:李陈默