自变量机器人发布HOST框架并开源:机器人看29秒视频即可学会新技能
8月3日,自变量机器人正式发布并开源HOST框架(Human-to-robot One-Shot Skill Acquisition,人类到机器人单样本技能获取),让机器人仅需观察一段数十秒的人类视频就能学会新技能,同时保留已掌握的技能。
HOST的思路来自认知科学中的“观察学习”理论:人类面对不熟悉的任务时,不需要通过长期练习或穷举来学习,而是以先验能力在大脑中模拟动作的预期效果,再执行相应动作。自变量研究人员受此启发,将HOST的学习方案从“训练时微调循环”变为“推理时技能获取”,让机器人通过观察人类执行任务来学习新技能。
与传统方法不同,HOST并非将人类动作翻译为机器人动作并试图模仿,而是让机器人先想象执行动作后的结果,再从结果倒推出需要执行的动作。这种全新方法的效果显著:机器人从一段29秒的人类视频中学习技能的成功率高达62%,超越零样本基线45%。相比Pi-0.5+微调方案,HOST所需数据量减少50倍,学习速度提升500倍。
机器人学习人类视频时面临的核心挑战是任务进度对齐问题。举例来说:同样工作10秒,视频中的人可能已经切完菜、开始炒菜了,机器人却还在切菜。如果仅按时间对齐,机器人就会丢失任务进度。
对此,HOST采用“按任务进度对齐”的方法:将视频每一帧和机器人操作每一步都转化为同一向量空间里的向量,然后利用“动态时间规整”算法,自动对齐人类视频的第X帧和机器人操作的第Y步。凭借这一方法,HOST将对齐任务进度的时间误差降低了一个数量级,能够实现机器人执行与视频示范的精准同步。
HOST的核心部分是一个带有视觉预测功能的级联策略模型,采用双专家MoT架构,如同两个分工明确的大脑:
- “视觉大脑”(视频专家):专门处理视频画面、定位任务进度、预测未来图景
- “动作大脑”(动作专家):负责将预测图景转化为需要执行的动作,并控制执行
在训练阶段,自变量团队将过程拆分为“同体预训练”和“人机视频训练”两个阶段。同体预训练中,机器人通过观看自身执行任务的视频,学会预测完成任务后的状态并生成对应动作;人机视频训练阶段,机器人进一步学习人类演示视频,将人类执行任务的过程转化为机器人视角下的任务结果,再根据目标结果推理完成任务所需的动作。
目前,HOST的研究论文和代码已经全部开源。未来机器人在家庭劳动时,有望摆脱专业化的数据采集和训练过程,通过直观的人类演示就学会新技能。自变量机器人是国内唯一同时获得字节跳动、美团、阿里巴巴、小米四家互联网巨头投资的具身智能企业,此前已在家庭场景中率先实现商业化落地。HOST框架的开源,有望推动具身智能从“实验室演示”走向“真实场景部署”,让机器人真正走进日常生活。