最新研究:嵌入大模型的AI扫地机器人多项任务翻车,成功率仅40%

AI实验室Andon Labs最近进行的一项评估显示,搭载顶级大模型的扫地机器人在简单家务任务中表现糟糕,成功率远低于人类。实验要求机器人执行“把黄油递给人”的多步骤指令,包括跨房间定位、区分包装、寻找移动位置的人类、完成交付并返回充电。结果显示,Gemini 2.5 Pro 的成功率仅 40%,Claude Opus 4.1 为 37%,GPT-5 为 30%,明显落后于人类的表现。
研究指出,大模型在空间推理、环境理解、长期任务规划等方面依然存在明显短板。
研究团队强调,娱乐之外也有严肃隐患:某些机器人可被诱导泄露机密文件,部分机型无法识别楼梯风险而从高处跌落,暴露当前大型语言模型(LLM)与机器结合的安全漏洞。
在资本大举押注机器人时代的当下,这项研究提醒人们:强大的文本生成能力不代表能稳定、安全地在物理世界执行任务,AI机器人距离真正进入家庭仍有大量工程与安全问题需要解决。
猜你喜欢
- 2026-09-16美官员:伊朗企图抢夺美军在霍尔木兹海峡巡逻的一艘海军无人机
- 2026-09-16雄韬股份:公司将于2026年10月9日召开2026年第四次临时股东会
- 2026-09-15奋达科技:关于召开2026年第二次临时股东会通知的提示公告
- 2026-09-15比亚迪辅助驾驶车型保有量超372万辆
- 2026-09-15法国罢工将敦刻尔克LNG终端外输能力降至每日4吉瓦时
- 2026-09-14比特币升破78000美元
- 2026-09-14海希通讯(920405)被立案,股民索赔可期
- 2026-09-14600929“急打补丁”,重组标的公司董事被查
- 2026-09-14今夜,突发公告!两只大牛股,紧急发声:不属实!
- 2026-09-132只PCB大牛股澄清供货英伟达传闻

网友评论