自变量机器人发布 HOST 框架并开源,让机器人看视频学会新技能
It之家17小时前

IT之家 8 月 3 日消息,自变量机器人今日发布 HOST 框架(Human-to-robot One-Shot Skill AcquisiTion,人类到机器人单样本技能获取)并开源,号称“能让机器人仅观察一段数十秒的人类视频就学会新技能,同时保留已掌握的技能。”IT之家从官方介绍获悉,HOST 采用了一种开创性的方法:不去将人类动作翻译为机器人动作并试图模仿,而是让机器人先想象执行动作后的结果,再从结果拆分出需要执行的动作。这种全新方法的效果令人欣喜:机器人从一段 29 秒人类视频中学习技能的成功率高达 62%,超越零样本基线 45%。相比 Pi-0.5 + 微调方案,HOST 所需数据量减少 50 倍,学习技能速度提升 500 倍。HOST 的思路来自认知科学中的“观察学习”理论:人类面对不熟悉的任务时,不需要通过长期练习或者穷举来学习,而是以先验能力在大脑中模拟动作的预期效果,然后执行相应动作。自变量研究人员受此启发,将 HOST 的学习方案从“训练时微调循环”变为“推理时技能获取”,让机器人通过观察人类执行任务来学习新技能。机器人首先要解决的问题是:如何对齐自己执行任务的进度和视频中的进度?举例来说:同样工作 10 秒,视频中的人可能已经切完菜、开始炒菜了,机器人还在切菜。如果只仅按时间对齐,机器人就会丢失任务进度。对此,HOST 的做法是“按任务进度对齐”。HOST 会将视频每一帧和机器人操作每一步都转化为同一向量空间里的向量;然后利用“动态时间规整”算法,自动对齐“人类视频的第 X 帧和机器人操作的第 Y 步”。如此一来,机器人执行到每一步时,看到的永远都是和任务进度对齐的那一帧。凭借这种方法,HOST 将对齐任务进度的时间误差降低了一个数量级,能够做到机器人执行与视频示范的精准同步。HOST 的核心部分是一个带有视觉预测功能的级联策略模型。它采用双专家 MoT 架构,如同两个分工明确的大脑:“视觉大脑”(视频专家)专门处理视频画面、定位任务进度、预测未来图景;“动作大脑”(动作专家)负责将预测图景转化为需要执行的动作,并控制执行。在训练模型时,自变量团队将训练过程拆分为“同体预训练”和“人机视频训练”两个阶段。在同体预训练阶段,机器人通过学习机器人自身执行任务的视频,学会预测完成任务后的状态,并生成对应动作。在人机视频训练阶段,机器人进一步学习人类演示视频,将人类执行任务的过程转化为机器人视角下的任务结果,再根据目标结果推理完成任务所需的动作,实现从人类示范到机器人技能的迁移。目前,HOST 的研究论文和代码已经全部开源。未来机器人在家庭劳动时,有望摆脱专业化的数据采集和训练过程,通过直观的人类演示就学会新技能。参考项目主页论文链接Github 链接Huggingface 链接