机器人AI模型DYNA-2登场:超100万小时人类视频训练,任务成功率可达90%
8月13日,具身智能公司Dyna Robotics近日发布新一代机器人基础模型DYNA-2,该模型基于超过100万小时的第一人称人类视频完成预训练,在高精度制造任务中成功率可达90%,被视为突破通用机器人数据瓶颈的重要尝试。
DYNA-2的核心定位是世界动作模型(World Action Model),而非市面上常见的视觉-语言-动作(VLA)架构。两者的区别在于:VLA主要解决“机器人下一步该怎么动”,而WAM还要求机器人理解“这样动了以后,世界会发生什么”——通过同时预测下一帧视频内容和下一步动作,DYNA-2能够获取空间关系、运动方式以及物体受力后的响应规律。
Dyna Robotics联合创始人兼首席科学家Jason Ma解释,通用机器人长期受困于数据瓶颈:人工遥操作采集数据成本高、耗时长,难以规模化扩展。“动作数据稀缺,但视频无处不在。物理直觉不需要在机械臂上训练数百万小时——它可以直接从人类视频中学习。”
Dyna Robotics还首次验证了“人类→机器人跨本体缩放规律”:预训练数据从1,000小时扩展到100万小时,机器人在15项基准任务中的表现持续提升,且未出现平台期。Dyna-2的早期版本与Dyna-1(VLA架构)在相同条件对比测试中,WAM在7项基准任务上的成功率达到VLA的1.55倍。
Dyna Robotics由三位华人联合创立——Lindon Gao(CEO)、York Yang和曾任职Google DeepMind的Jason Ma(首席科学家),公司总部位于美国硅谷,在中国上海设有硬件研发中心,已获英伟达、三星、LG、亚马逊等投资。下一阶段,公司计划将人类视频训练规模从100万小时扩大至1,000万小时,进一步验证视频数据作为物理AI新缩放轴的潜力。