我们知道,在掌握了网络中的语言和图像之后,大模型终究要走进现实世界,「具身智能」应该是下一步发展的方向。把大模型接入机器人,用简单的自然语言代替复杂指令形成具体行动规划,且无需额外数据和训练,这个愿景看起来很美好,但似乎也有些遥远。毕竟机器人领域,难是出了名的。然而 AI 的进化速度比我们想象得还要快。
上周五,谷歌 DeepMind 宣布推出 RT-2:全球第一个控制机器人的视觉 - 语言 - 动作(VLA)模型。现在不再用复杂指令,机器人也能直接像 ChatGPT 一样操纵了。给机器人发命令,从没这么简单过。
RT-2 到达了怎样的智能化程度?
加载了RT-2多任务模型的机械臂可以直接听从人类的语言指令做出反应。比如命令它“捡起已灭绝的动物”,机械臂就能从狮子、鲸鱼、恐龙这三个塑料玩具中准确选择恐龙; 在此之前,机器人无法可靠地理解它们从未见过的物体,更无法做把「灭绝动物」到「塑料恐龙玩偶」联系起来这种有关推理的事。
命令它将香蕉放到2 1的总和的位置,机械臂就能准确将香蕉放置在数字3的位置;
RT-2 保留了机器人在原始任务上的性能,并提高了机器人在以前未见过场景中的性能,从 RT-1 的 32% 提高到 62%。
一系列结果表明,视觉 - 语言模型(VLM)是可以转化为强大的视觉 - 语言 - 动作(VLA)模型的,通过将 VLM 预训练与机器人数据相结合,可以直接控制机器人。
和 ChatGPT 类似,这样的能力如果大规模应用起来,世界会发生重大改变。它可能真正开启了在有人环境下使用机器人的大门,所有需要体力劳动的岗位都会被替代。或许,机器人总动员中,那个聪明的瓦力离我们不远了。
相关文章
猜你喜欢