李智强:未来补足大模型的短板,要通过触觉
“2025世界大会”于8月8日至12日在北京经济技术开发区开幕。“AI 大模型赋能机器人与具身智能产业新范式交流活动”作为2025世界机器人大会的专题活动于8月8日同期召开。深圳一目科技有限公司创始人兼CEO李智强出席并演讲。

以下为演讲实录:
大家好!我今天给大家带来的题目是“触觉增强的世界模型”。
今天看到很多在具身智能发展还是非常疯狂的,作为一个AI科技老兵看到这些发展也是非常期待,我2011年从CMU毕业,当时AI还在发展的初期,带大家回顾一下AI发展的早期,从2000年初开始有了ImageNet,然后逐渐催生了视觉智能向前发展。那时候非常不够先进,从2010年开始尝试识别视觉里的各种物体。到了今天过去15年已经发展到了OpenAI的ChatGPT这种多模态模型完全能够进行语义的理解以及重建。我们已经走到了今天纯视觉重建的过程。
我觉得具身智能的未来应该是过去15年视觉智能过去发展历史的起点,未来其实还有一些缺失的部分,我们到底应该做哪些事情来补足这些,来推动人工智能在具身智能方向发展。我们看到了这样一些缺失点。比如说我们对于整个世界物理模型的一些参数还是有缺失的,其实有很多在VLA模型跑的非常先进了,我觉得也是非常好的开始。
比如说对于一些材质、物理结构更高维度的参数还是缺失的,如果想构建这样一个世界大模型的话,其实还是要补足这样一个过程的,因此我们认为靠什么来补足还不能获取的数据。可以参考过去的发展,通过camera的演进,通过视觉模型的演进获得更好的视觉辨认能力和语义理解能力以及对于听觉的理解能力。
未来在更多的维度对于物体的理解上需要补足触觉的理解力的。特别有意思的一点,触觉的感知和执行其实是一个物体,都是我们的手。这个跟视觉和听觉不太一样的地方,视觉和听觉对于非接触性的物体的感知非常好,但一旦有了接触,我们的执行器和感知器是完全统一的,这也是它最美妙的地方之一。
因此我们觉得未来补足大模型的短板,是要通过触觉。能不能通过触觉来增强VLA模型?真正的推动具身智能的发展。
具体怎么做?我们想做一个思想实验,每个人可以尝试一下从口袋里摸一下物体,人是可以非常轻松的辨别出口袋里到底是一把钥匙还是一个耳机,还是一枚硬币。这个过程怎么做到的,不是一个非常严谨的推理和计算的逻辑,其实是人对这个物质和世界逐渐的触碰、探索、3D构建以及物理世界映射的关系。我可以很容易的知道这把是钥匙,这个是耳机,我认为其实机器人也应该能够重构人对于物理世界感知的能力。
如果有一天机器人能够不停的通过触碰,通过探索来重建类人的感知能力,那我觉得才是世界模型到达终极目标的那天。具体怎么做到?我们也不是先行者,我们应该从PIXELS到VOXELS,我们从一个真实的物理世界通过数字化的PIXELS化获得更多维度的触觉感知的信息,最终通过物理世界的三维构建形成VOXELS信息,导入到我们的物理大模型里面去,然后形成更多维度的感知。
如果想实现这件事情,这样的触觉感知系统需要满足三个条件。
第一个条件,一定是绝对类人的感知能力,而且是始于所有的对于类人触觉能力的反算,要基于从原理上、从架构上、性能上、形态上要有绝对的类人性。
第二个条件,在系统工程的优化能力上要做到高保真的鲁棒系统。我们看视觉和听觉的演进,都是从最早的低像素、低分辨率到逐渐类人化的演进。我们认为触觉也应该有相似的过程,逐渐逼近人类的触觉能力,所以应该从空间一致性、时序稳定性、信号完整性以及生物贴合性完全类人。
第三个条件,既然要成为具身智能,一定要跟具身的大模型打通,必须形成一种高效鲁棒的算法体系,能够从端到端结合大现有的VLA或者VTLA模型里面去,能够形成类人的感知能力。
这三点都是需要满足的才是最终极的触觉感知能力。
我们也不是这个世界上第一个提出的,我们也致敬前辈,视触觉和光触觉的方案应该是目前看到的最好的一类触觉解决方案,一目也发布了视触觉的解决方案,在它的高保真、高像素以及鲁棒性分析做到了最优化。
我们可以像人一样通过反复的触碰这个物理世界演进,然后重构对于物理世界三维坐标体系以及三维形态的理解,形成更多维度的能力体现,最终输入到大模型里进行具身智能的演进。这是第一个问题就是硬件问题,能够通过触觉传感器来解决。
具身智能在Locomotion、Navigation方面已经做的非常好了,但在Manipulation尤其是精细化操作方面还是有欠缺的,这个欠缺主要还是在数据上的欠缺。数据集是我们最缺乏的东西,我们怎么去解决第二个问题就是数据问题,一目也想通过触觉传感器以及触觉解决方案能够加速海量的高质量数据的收集这样一个过程。如何去做?我们也比较相信英伟达提出的逻辑。如果仅仅靠人力来收集数据的话永远是线性的,永远不可能像OpenAI,像ChatGPT一样赶上海量的数据,这个线性的路径完全不能让我们走向具身智能终点的,我们的想法是一定要用现实作为锚点,通过仿真作为数据放大的过程,放大10倍、100倍甚至1000倍的能力来加速整个的采集。但这里有一点,一定是有真实数据作为你的锚点去增加你的数据量。
这样的话才能赶上具身智能数据的需求。如果具身智能没有海量数据,其实很难推动它的发展。我们做了很多尝试和实验,在物理模型里通过英伟达的物理模型先去尝试触碰了世界上上百万种物体,比如说有胶水、螺丝刀和各种钢笔等等,已经在仿真世界通过不同的环境、不同的光照、不同的物理形态做过了这样的模拟和触碰。很快就可以把这样的算法迭代到实际应用当中去了。
这段时间就是先通过仿真获得基础模型,然后在现实中对这个模型做一些现实真实数据的恢复。最终可能通过一两次的抓握,就能够完全重构原来需要做很多次尝试的场景。比如已经可以辨认各种各样的物体,甚至对于物体的位姿和形态进行判断。
另外这个过程中鲁棒性要有实时的校准,如果对它进行干扰,也能够重新回到最正式的姿势中去。我们不仅仅关注成功案例,也会关注失败案例,比如说做一些易碎东西的夹取,人都是通过很多次的尝试去学习。我们知道那些失败的案例,也知道成功的案例,才能更快的达到最稳定的状态。
因此我觉得通过硬件能力以及对于算法和数据的加成的发展,才能进入到一个快车道,最终如何满足用户的需求,如何提供这些服务,英伟达提出了一套通用机器人的架构,我们非常认同。这套架构未来应该是更容易接入的,通过对于原始材料的调度和处理,可以调用不同的physical intelligence的engine,最终给用户交付的是我们的文明、我们的结果、我们的用户价值。通过这样的通用架构来实现通用价值的落地。
通用性到底是如何完成的,到底有多么的通用,我们分析了一下,世界上80%都是通用case,但是会发现人也很不一样,比如说专业运动员,专业的手术大夫,他们的手其实跟人是不一样的,他们的intelligence也是更专业化的,所以我们提出必须能够从等体与软件上共同来打通这样一个解决方案。
日常任务可以分为下肢强度型以及上肢精度型。我们主要关注的是精细化的操作,偏上肢的运动能力,也会发现也符合二八原则。80%的日常任务,可以通过较为通用的模块来实现。还有20%的特殊任务可以提供更专业化的更多的训练案例来解决。为大家提供了manipulation as a service,我们认为精细化即服务这是一项更好的实现路径,通过服务包括硬件、软件、算法能够为所有需要做精细化操作的场景提供通用服务。今年年底会带来这样的服务,敬请大家期待。
最后介绍一下我们公司,我们一目科技,2015年成立于美国的硅谷。我们这个名字的来源其实有点意思,在五亿两千五百万年前,其实是三叶虫发展出了第一个能够感光的眼睛,带来了整个生物的大爆发,带来了所有智能生物的发展,我们一目就相信自己希望成为那个人工智能里的第一只眼,能够推动整个人工智能向未来具身智能向更高更快的Scaling law发展,而做出自己的贡献,希望跟大家进行一个合作。
谢谢大家!
新浪声明:所有会议实录均为现场速记整理,未经演讲者审阅,新浪网登载此文出于传递更多信息之目的,并不意味着赞同其观点或证实其描述。
- • 美国得克萨斯州“灾难性”洪水已致13人死亡,约23人失踪
- • 强者归来?“国防军工+航天航空”双热点叠加,通用航空ETF华宝(159231)盘中涨逾1%
- • 【独家】爱美客回应与江苏吴中“童颜针”争夺战来龙去脉
- • IQ过河:一场跨越思维边界的智力探险
- • 越南插头:揭秘东南亚国家独特的电力接口
- • 探索科技前沿,三星手表官网带你领略智能生活新篇章
- • 罗崇敏被开除党籍:揭开腐败案件背后的真相
- • 多地取消查验核酸证明,疫情防控新常态下的便捷之举
- • 空调制热时室外机滴水正常,这是为何?
- • 俄外长:愿在换俘完成后提交和平条约备忘录草案
- • 高考档案自由可投:揭秘其含义与影响
- • 3月中国减持189亿美元美债、持仓规模降至第三,英国升至第二
- • 换手率同类第一!信创ETF基金(562030)成交额1.4亿元创历史新高,资金为什么偏爱信创?
- • 《全职高手》第二季开播时间揭秘:玩家们翘首以盼的回归!
- • 全面从严治党迈向新阶段:更大战略成果的取得与展望
- • 淘宝女装“四大家族”决战线下渠道
- • 腾讯安全中心游戏安全知识答题:守护你的游戏世界
- • 探索科研前沿:JACS期刊主页深度解析
- • 探秘300985:揭秘A股市场的潜力股
- • 中国忠旺集团最新动态:稳健发展,砥砺前行
- • 美团优选退出部分亏损区域,公司资源向美团闪购和小象超市倾斜
- • 《法国夺命蜂巢:惊悚悬疑,在线观看不容错过!》
- • 中国创新药企破纪录!三生制药与辉瑞百亿BD引爆全球双抗赛道
- • 上海新闻发布东方网:传递城市脉搏,构建网络新生态
- • 延时门诊、周末不停诊、增加放号量,上海多家儿科专科医院优化服务
- • 欧美性爱大片:探讨成人电影的伦理与艺术价值
- • 000573,重组“失利”前,有人获利了结
- • 1N4148二极管:电子世界的守护者
- • Word文件格式解析:常见类型及其应用场景
- • 西渝高铁重庆段一在建隧道一氧化碳泄漏致7人被困,有4人获救
- • 银行“反内卷”,反的是什么?
- • 穆迪下调美国评级后 投资者等待又一个 "周一震荡"
- • 武当“洋教头”杰克·平尼克:“这里的文化,完全改变了我的人生”(我在中国·行耕记)
- • 《《色戒》演员阵容:一场视觉与情感的盛宴》
- • 《欢乐斗牛游戏:趣味横生的休闲娱乐新宠儿》
- • 一建学习心得:从挑战到收获的蜕变之旅
- • 男篮四强争霸赛:激情燃烧的篮球盛宴
- • 张全蛋:网络时代的另类“网红”
- • 《同桌的你》:青春回忆的视听盛宴,电影下载攻略一览无余
- • 三亚回应游客质疑“接驳车十元”:停车场到景区1.5公里以上,游客可自行前往
- • 转院手续:顺利完成患者医疗旅程的关键步骤
- • 中创新航遭宁德时代申请强执致歉,此前因诋毁案被执行222万
- • 光大期货0514热点追踪:恒力石化突发检修,乙二醇大涨4%
- • 军官工资标准:公平与激励并重的现实考量
- • 虹口区北外滩动迁范围:城市更新与居民安置的和谐交响
- • 2018相声小品大赛:欢笑盛宴,传承经典
- • 淘宝618销售额再创新高,电商狂欢节背后的经济力量
- • “晔”字的读音及其文化内涵探析
- • 上市1小时大定过1000辆,尊界S800的最终售价偏向务实
- • 宝塔实业最新动态:转型升级,迈向高质量发展新篇章
- • 暴走团回应阻碍消防救护车通行:车辆属于备勤状态,就一分钟
- • 宋丹丹的儿子:阳光少年成长记
- • 上海周边两日游:探寻长三角地区的历史与现代交融之美
- • 《天之炽》小说笔趣阁:探寻热血青春的奇幻之旅
- • “股神”巴菲特为何怒批特朗普关税战
- • Aesop伊索关闭中国首店
- • 深入解读财税2012年39号文件附件4:税收优惠政策新动向
- • 5名疑似智障人员从砖厂被解救,临湘警方:暂未发现其他智障者
- • 森金村猎人训练师的传奇故事
- • 兴业钱大掌柜:传承与创新,打造金融服务的典范
- • 王国强今日股市分析:把握市场脉搏,洞察投资机会
- • 如何应对短视频冲击? 导演申奥:电影社交属性无法取代
- • 江南事件:揭开历史的神秘面纱
- • 年收入创三年新高后,阅文增长更依赖影视爆款
- • 《延安,我把你追寻——教学反思与启示》
- • 教学评一致性心得体会:探索与实践中的感悟与收获
- • 乡镇党委书记述法报告:法治引领乡村振兴新篇章
- • 美国分析师:今年中美集装箱海运旺季或提前到来
- • 朝阳外国语学校:培养国际化人才的摇篮
- • 特斯拉获批德州网约车牌照 为Robotaxi运营铺平道路
- • 直通部委|上半年电气故障引发火灾14万起 邮政局回应快递收费计重“向上取整”
- • 直击WAIC丨炫酷!Rokid CEO开幕式现场“带货”,大秀Rokid Glasses实时翻译
- • 中国女农场主在非洲失踪近30天,已确认遇害,遗体在机场附近被发现!嫌犯为其聘用的经理,在警方追捕下逃进山林,目前仍在逃
- • Excel中如何使用公式计算出生日期对应的年龄
- • “萌宠来袭:揭秘宠物刺猬的独特魅力”
- • 超9000万元!“人形机器人第一股”中标最大金额采购订单
- • 深入解析3D走势图和值表:揭示彩票中奖的秘密武器
- • 北汽蓝谷:规模经济未充分体现,预计上半年净亏至少22亿元
- • 兰州铝业:铸就辉煌的铝业传奇
- • 华师在线网络教育:开启终身学习的新篇章
- • 尾盘:标普指数基本持平 道指小幅下跌
- • 《建筑起重机械备案登记办法:保障施工安全,规范行业管理》
- • 上海市政府党组会议传达学习习近平总书记重要讲话精神,部署抓好学习贯彻落实
- • A股新机遇!外资公募瞄准这些赛道
本文 快租网 原创,转载保留链接!网址:https://wap.kuaizu.me/post/25304.html