美国机器人公司 Dyna Robotics 于本周一发布了新一代机器人基础模型 DYNA-2。该公司称,该模型完全基于超过一百万小时的人类视频进行训练,未使用任何机器人数据。Dyna Robotics 认为,这一路径有望解决制约通用机器人发展的成本问题。
机器人制造商为何总缺训练数据?
构建通用机器人面临的一个普遍难题是数据获取。大多数机器人依赖遥操作学习,即人工远程引导机器人数小时完成特定任务。这种方式缓慢、昂贵且难以规模化,限制了系统的能力上限。Dyna 的解决方案是在训练阶段完全绕开机器人。DYNA-2 仅使用第一视角人类视频——即从人眼角度记录与物体互动的画面——进行训练。公司表示,这些视频累计相当于约 170 年的持续经验。联合创始人 Jason Ma 解释说:“动作数据稀缺,但视频无处不在。”他认为物理直觉可以直接从人类视频中学习,而无需让机械臂耗费数百万小时。
效果方面,在高精度制造任务中,DYNA-2 的成功率从 20% 提升至 80% 至 90%。Dyna 将这一提升归功于大规模预训练。在 15 项基准测试中,使用更多人类视频训练的模型始终优于使用较少视频的模型。
世界-行动模型有何不同?
Dyna 的特殊之处在于其独特的架构。DYNA-2 并非采用视觉语言模型,而是基于视频生成的世界-行动模型。预训练时,它同时预测下一帧视频和下一个动作。Dyna 表示,这种双重目标让模型内在地理解接触物理和空间推理。公司希望人类视频中习得的知识能迁移到不同类型的机器人上,例如固定机械臂、人形原型和灵巧手,尽管这些设备并未参与预训练。适应新平台只需数小时微调,而非数周数据收集。例如,Dyna 报告称,仅用 13 分钟数据,机器手就学会了拧开瓶盖。
计划扩展至 1000 万小时
Dyna 已有机器人在真实场景中运行,这使其区别于其他机器人公司。DYNA-1 机器人已应用于酒店、餐厅、洗衣房和健身房等场所。公司由 Lindon Gao、York Yang 和 Jason Ma 联合创立,三人此前曾在 DeepMind 任职。Dyna 的公开计划是将同样的方法扩展至 1000 万小时的视频数据,并将其定义为一个“数据收集问题”而非“机器人制造问题”。
免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。