首页 > 人工智能 >大语言模型助力机器人理解模糊指令,聚焦关键细节

大语言模型助力机器人理解模糊指令,聚焦关键细节

来源:互联网 2026-07-04 06:11:13

麻省理工学院研究团队提出掩码逆强化学习方法,利用两个大语言模型分别解析模糊指令和筛选关键环境细节,将机器人所需演示数据量减少近五倍,正确识别用户隐含偏好的准确率最高提升15%,使机器人能在家庭、办公室和工厂安全执行复杂任务。

想象一下这个场景:你在仓库或办公室里手头一堆事,突然需要帮助一位“新员工”熟悉基本操作。只不过这位新员工不是人类,而是一台机器人。要教会它,最简单的方式大概是“我做你看,边说边练”——亲自演示几种不同的做法,同时口头解释你在做什么。

大语言模型助力机器人理解模糊指令,聚焦关键细节

长期稳定更新的攒劲资源: >>>点此立即查看<<<

举个例子,你让机器人把咖啡放到桌上,但前提是不能打扰你正在进行的视频会议。你希望它离你和笔记本电脑远一点,以免影响会议。要实现这个行为,机器人需要的是能清晰展示完整任务的数据来训练。此前,计算机科学家尝试过两条路:要么录制大量实物演示,要么撰写一份超详细的操作说明。然而问题在于,这两样东西但凡缺一样,机器人很可能就搞不清自己到底该干什么。

让人类同时完成“示范”和“讲解”,既耗时又费力。针对这一痛点,麻省理工学院计算机科学与人工智能实验室(CSAIL)的研究团队直接将机器人教学流程自动化——不仅能自动理清操作指令,还能将所需的演示数据量减少约五倍。他们提出的方法称为“掩码逆强化学习”(Masked IRL),核心思路是:首先利用一个大语言模型,根据用户的演示数据将模糊的提示翻译成更具体的指令;再让第二个大语言模型从中筛选出真正关键的环境细节,供算法在制定运动计划时参考。这样一来,机器人就能安全地在家庭、办公室和工厂中完成任务。

“人跟机器人交互时,肯定不想把每个步骤的细节都掰扯清楚,这时我们的方法就派上用场了,”麻省理工博士生、CSAIL研究员、论文第一作者黄敏英(Minyoung Hwang)表示,“目标是让机器人真正弄懂用户的意图,将人类的操作负担降到最低。”
黄敏英指出,Masked IRL能帮助机器人应对复杂环境下的安全移动——这种环境中总有一些人类在操作提示里不会主动提及、但至关重要的细节。例如,机器人去厨房拿零食,可能不知道要避开你的笔记本电脑;工厂机器人在往不同箱子中放置物品时,也必须小心绕开货架。

学习新任务时,Masked IRL会通过机器人的传感器采集周围环境信息,同时记录运动示教过程中每一个动作。所谓运动示教,就是由人类亲手引导机器人执行动作,类似于给机器人做物理治疗——弯折关节,示范如何抓取、拿取、放置。

随后,麻省理工的系统会调用一个大语言模型,将这一连串动作(即运动轨迹)与最短路径进行对比,同时对提示中模糊的地方进行解读。像“保持靠近”这种笼统请求,会被翻译成更明确的表述,比如“保持靠近桌面”。借助轨迹对比和明确后的指令,大语言模型开始理解哪些训练动作对完成任务具有实际意义。

第二个大语言模型则负责评估环境细节——例如障碍物的位置、目标物体的形状。在此过程中,它会判定哪些元素与当前任务无关,然后进行“掩码”处理(直接忽略),并为每个元素打分:“1”代表重要,“0”代表不重要。例如,用户在演示时是否靠在桌子上,这类信息会被标记为“0”;而所有被评为“1”的细节,都会被算法纳入最终的行动计划。

这一掩码机制使Masked IRL在三维仿真和真实场景演示中,表现均优于同类基线方法——因为它教会了机器人什么值得关注,什么可以忽略。借助这套系统,虚拟和真实的机器人都能灵活地绕过障碍物移动物体,比如绕过笔记本电脑,将咖啡杯放到桌上的不同位置。在这些任务中,Masked IRL正确识别用户未在提示中明确表达的偏好的准确率,比同类基线方法最高提升了15%。

仿真实验中,CSAIL的研究人员还发现Masked IRL的学习效率更高。与基线方法相比,它只需更少的演示次数就能学会如何移动马克杯。而且,当大语言模型负责厘清指令时,机器人的表现比直接跟着模糊指令行动要好得多。

这种更聚焦的方法同样适用于真实的机械臂——能够执行系统在训练阶段从未见过的指令。经过50次运动示教训练之后,机器人可以小心地端着杯子递向人类,同时避免碰到用户的电脑。这个需要回避的障碍,正是系统通过解析“保持距离”这一笼统请求学到的。此外,机器人还能在“保持贴近”桌面的前提下完成擦桌任务,以及在同时“远离”人类和桌子的条件下,将一袋薯片递给用户。

Masked IRL能够感知并解读用户没有说出口的意图。不久的将来,它还会拥有“视觉感知”能力。CSAIL的研究团队计划为系统加装摄像头,让机器人拍摄周围环境的图像,进而识别并聚焦于附近的特定元素。例如,当你说“捡起那个玩具”,它可能会先看到旁边的香蕉,但在抓取目标之前,会自动将香蕉忽略掉。

这篇论文由黄敏英与三位CSAIL同事共同撰写,包括博士生亚历山德拉·福西-斯梅雷克(Alexandra Forsey-Smerek,学士2020届、硕士2022届)、博士后纳撒尼尔·丹勒(Nathaniel Dennler),以及麻省理工学院助理教授、航空航天系暨CSAIL成员安德烈亚·博布(Andreea Bobu)。该研究得到了塔塔集团通过麻省理工学院生成式AI影响力联盟奖及美国国防部的部分资助。研究团队将于今年6月在2026年IEEE国际机器人与自动化大会上正式发表这一成果。

Q&A

Q1:Masked IRL技术是什么?它如何帮助机器人理解指令?

A:Masked IRL(掩码逆强化学习)是麻省理工学院CSAIL研究团队开发的一套机器人教学方法。它利用大语言模型对用户模糊的操作提示进行扩展解读,同时通过第二个大语言模型对环境细节进行重要性评分,忽略无关信息,聚焦关键要素,从而帮助机器人准确理解用户真实意图,并生成合理的运动计划。

Q2:Masked IRL相比传统机器人训练方法有哪些优势?

A:相比传统方法,Masked IRL主要有两大优势:一是大幅减少了所需的演示数据量,训练效率提升近五倍;二是通过大语言模型自动厘清模糊指令,避免了机器人因指令不清而产生误解。此外,该方法正确识别用户隐含偏好的准确率比同类基线方法最高提升15%。

Q3:Masked IRL目前能在真实场景中应用吗?

A:可以。研究人员已在真实机械臂上验证了Masked IRL的实际效果。经过50次运动示教训练后,机器人能够完成多项现实任务,例如绕开笔记本电脑递送杯子、贴近桌面擦拭,以及在远离人类和桌子的前提下递送物品。未来研究团队还计划为系统配备摄像头,进一步增强其对真实环境的感知与理解能力。

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述

热游推荐

更多
湘ICP备14008430号-1 湘公网安备 43070302000280号
All Rights Reserved
本站为非盈利网站,不接受任何广告。本站所有软件,都由网友
上传,如有侵犯你的版权,请发邮件给xiayx666@163.com
抵制不良色情、反动、暴力游戏。注意自我保护,谨防受骗上当。
适度游戏益脑,沉迷游戏伤身。合理安排时间,享受健康生活。