Axis Robotics 发布了 Axis Sim Dataset V1,这是目前规模最大的开源 Franka 机械臂操作仿真数据集之一。完整数据集、训练代码和基准测试现已公开。V1 基于超过 50,000 条人工远程操作仿真轨迹构建,涵盖 207 个操作任务和 60,000 多种场景变化,全部在仿真 Franka Research 3 机械臂上完成。该数据集已吸引超过 160,000 次下载,成为 Hugging Face 上下载量最大的开源 Franka 操作仿真数据集。在基准测试中,基于 V1 的持续预训练提升了 π0.5 的性能,并超越了同等数据量的 RoboCasa 基线,所有结果均公开且可验证。
Axis Robotics 正在构建一个面向 Physical AI 的复合数据引擎——一个集大规模仿真、第一人称真实世界采集、人形机器人移动操作和人机协同 DAgger 后训练于一体的全集成系统。该公司已筹集 1200 万美元种子资金,由 Hack VC 领投,Nomad Capital、Pi Network Ventures、10K Ventures 及多位天使投资人参与。
一场对“仅限干净数据”的挑战
机器人领域的一个常见假设是,示范数据必须从一开始就接近最优——在模仿学习生效之前,需要筛选出专家轨迹、标准化设置并移除所有噪声数据。Axis 持相反观点:数据质量由分布层面决定,而非单条轨迹。当大量多样化的群体产生噪声、次优轨迹,且其错误互不相关时,噪声会相互抵消,训练过程中便会涌现出有效的策略。Axis Sim Dataset V1 将这一理念付诸公开检验。其轨迹涵盖抓取放置、堆叠、倒水、铰接物体操作和工具使用,全部通过 Axis 的浏览器远程操作平台 Axis Hub 由分布式群体而非单一专家团队采集。该数据集与加州大学伯克利分校、约翰霍普金斯大学、密歇根大学及其他机构的研究人员共同开发。
可扩展的结果
在 LIBERO-Plus 上,基于 V1 的持续预训练将 π0.5 的成功率从 83.9% 提升至 88.8%,比同等数据量的 RoboCasa365 基线高出 37.3%。随着预训练数据从数据集的 25% 扩展到 100%,性能稳步提升,且未出现饱和迹象——这证明增益来自多样性和覆盖度,而非一次性提升。最大改进出现在相机、传感器噪声和布局扰动条件下,而这些正是 Axis 在生成过程中随机化的变化因素。团队表示 V2 已在推进中,将扩展到 1,200 个任务中的 120 万条轨迹,并涵盖跨具身泛化及多种 VLA 模型的结果,证明次优仿真数据也能训练出稳健的策略。
数据集背后的引擎
该数据集是一个更大规模、持续复合的数据引擎的产出之一。传统数据供应商按固定规格采集后即停止,而 Axis 根据模型性能和失败案例决定下一步采集内容,使每一轮训练都为下一轮提供信息。该引擎采用混合策略,运行在四条数据线上,目前均已规模化运营:
- 仿真:Axis Hub 上超过 200,000 名分布式贡献者(Base 上排名前三的 dApp)已生成超过 470 万条轨迹,覆盖 13 种具身形态。
- 第一人称视角:由 1,000 多名全职、经过质量控制培训的采集者组成的管理网络,在 14 个行业的真实家庭和商业场所采集第一人称活动数据。已积累超过 200,000 小时,并以每天 4,000 多小时的速度增长,手部姿态经 Vicon 验证。
- 移动操作:通过硬件无关的远程操作系统,在真实人形机器人(Unitree G1、Booster T2)上积累了 500 多小时结合移动性和灵巧性的数据。
- 人机协同 DAgger 后训练:500 多小时的人机协同纠错数据,专注于部署边缘案例。
每个任务和轨迹均在 Base 链上链记录以确保来源可追溯,贡献者根据验证的工作质量获得奖励。
从开放数据到商业部署
除开源仿真数据外,Axis 还直接与机器人具身公司合作,为其特定需求构建定制数据集。Axis 为每种机器人具身形态构建定制数据管道和模型先验。作为 Booster Robotics 的首个仿真数据合作伙伴,Axis 将 Booster 的真实工作空间重建为面向任务的数字孪生。分布式贡献者在其上运行了超过 42,000 次仿真回合,Axis 将其提炼为针对 Booster 需求的模型先验。仅使用 30 条真实机器人示范,该先验即达到 87.5% 的成功率,而标准 π0.5 模型仅为 37.5%——在真实示范数量减半的情况下匹配了 π0.5 的性能。
Axis 的其他合作伙伴包括 Feagine Robotics 等具身公司、Manycore Tech 和 Dexmal 等模型公司,以及路特斯汽车和吉利汽车等工业自动化企业。Axis 还为 Solana 上的 BitRobot 和 Bittensor 上的 OpenRoboto 等链上机器人网络提供支持。
重新定义 Physical AI 的数据基础
“Physical AI 的未来不是一次性下载的静态数据集,”Axis Robotics 创始人 Chris Feng 表示,“而是一个持续产出模型下一步所需数据的引擎。规模带来广泛覆盖,多样性保持噪声无偏,闭环将每次失败转化为进步。这就是复利效应。”
Axis 由来自加州大学伯克利分校、卡内基梅隆大学、佐治亚理工学院和上海交通大学的研究人员,以及曾将消费平台扩展至超过 3000 万用户的连续创业者共同创立。其研究由佐治亚理工学院助理教授 Jiachen Li 提供指导。
论文链接:https://arxiv.org/abs/2607.21588
项目页面:https://axisaiorg.github.io/AXIS-V1/
数据集链接:https://huggingface.co/datasets/axisrobotics/Franka-Dataset
GitHub 代码库:https://github.com/AxisAIOrg/Axis-V1-Training
常见问题解答
以下是关于 Axis Robotics 开源 Franka 机械臂仿真数据集的常见问题列表,旨在为新手和经验丰富的机器人专家提供清晰、实用且有价值的信息。
通用与入门问题
问:Axis Robotics 究竟发布了什么?
答:他们发布了一个面向 Franka 机械臂的大规模开源仿真数据集,包含数百万条机器人在仿真环境中执行任务的示例,以及配套的传感器数据。
问:为什么这对 Physical AI 意义重大?
答:Physical AI 需要理解如何与真实世界交互。训练这些 AI 模型通常需要大量真实世界数据,采集过程缓慢且昂贵。该数据集提供了一条大规模、高质量的捷径,使 AI 模型能够先在仿真中练习数十亿次。
问:什么是仿真数据集?
答:它是在计算机程序中生成的数据集合,而非来自物理机器人。可以将其理解为机器人的“电子游戏”,其中每个动作和观测都被记录下来,用于创建 AI 训练数据。
问:我是机器人新手,可以使用这个数据集吗?
答:当然可以。由于它是开源的,你可以下载并使用它来学习。可以从探索数据开始,了解机器人传感器数据的形式。如需实际操作,具备一些基础的 Python 和机器学习知识会有所帮助,但入门门槛远低于需要拥有自己的物理机器人。
问:这个数据集只适用于特定的 Franka 机器人,还是可以用于其他机器人?
答:数据针对 Franka 机械臂的运动和传感器。不过,你学到的技术和训练的 AI 模型通常可以适配或迁移到其他类似的机械臂,尤其是在使用支持模型迁移的框架时。
技术与进阶问题
问:数据集具体采用什么格式?
答:数据集通常以标准格式提供,如 HDF5 或类似的结构化格式,通常与 RLBench 或 Robosuite 等常见机器人学习框架对齐。通常包含 RGBD 相机图像、深度图、机器人关节状态和动作轨迹。