Axis Robotics a publié l'un des plus grands ensembles de données de simulation pour les bras robotiques Franka, le rendant open-source pour soutenir les avancées en IA physique.

Axis Robotics a publié Axis Sim Dataset V1, l'un des plus grands ensembles de données de simulation open source pour la manipulation du bras Franka. L'ensemble complet de données, le code d'entraînement et les benchmarks sont désormais disponibles publiquement. V1 est construit à partir de plus de 50 000 trajectoires de simulation téléopérées par des humains à travers 207 tâches de manipulation et plus de 60 000 variations de scènes, le tout sur un bras simulé Franka Research 3. L'ensemble de données a attiré plus de 160 000 téléchargements, ce qui en fait l'ensemble de données de simulation Franka open source le plus téléchargé sur Hugging Face. Dans les benchmarks, le pré-entraînement continu sur V1 a amélioré les performances de π0.5 et battu une référence RoboCasa appariée en volume, avec tous les résultats ouverts et vérifiables.

Axis Robotics construit un moteur de données composé pour l'IA Physique—un système entièrement intégré qui combine la simulation à grande échelle, la capture égocentrique du monde réel, la loco-manipulation humanoïde, et le post-entraînement DAgger validé par des humains. L'entreprise a levé 12 millions de dollars en financement de démarrage, mené par Hack VC, avec la participation de Nomad Capital, Pi Network Ventures, 10K Ventures, et des investisseurs providentiels.

Un Pari Contre le "Données Propres Uniquement"

Une hypothèse courante en robotique est que les démonstrations doivent être quasi optimales dès le départ—filtrer pour ne garder que les trajectoires d'experts, standardiser la configuration, et supprimer toute donnée bruitée avant que l'apprentissage par imitation puisse fonctionner. Axis adopte le point de vue opposé : la qualité des données est déterminée au niveau de la distribution, pas par les trajectoires individuelles. Lorsqu'une foule large et diversifiée produit des trajectoires bruitées et sous-optimales et que leurs erreurs ne sont pas corrélées, le bruit s'annule, et une politique fonctionnelle émerge pendant l'entraînement. Axis Sim Dataset V1 met cette idée à l'épreuve publique. Ses trajectoires couvrent la prise et le dépôt, l'empilement, le versement, la manipulation d'objets articulés, et l'utilisation d'outils, toutes collectées via la plateforme de téléopération basée sur navigateur d'Axis, Axis Hub, par une foule distribuée plutôt qu'une seule équipe d'experts. L'ensemble de données a été développé avec des chercheurs de UC Berkeley, Johns Hopkins, l'Université du Michigan, et d'autres institutions.

Des Résultats Qui Passent à l'Échelle

Sur LIBERO-Plus, le pré-entraînement continu sur V1 élève le succès de π0.5 de 83,9% à 88,8%, surpassant une référence RoboCasa365 appariée en volume de 37,3%. Les performances s'améliorent régulièrement à mesure que les données de pré-entraînement passent de 25% à 100% de l'ensemble de données, sans signes de saturation—preuve que les gains proviennent de la diversité et de la couverture, pas d'un boost ponctuel. Les plus grandes améliorations apparaissent sous les perturbations de caméra, de bruit de capteur, et de disposition, qui sont exactement les variations qu'Axis randomise pendant la génération. L'équipe dit que V2 est déjà en cours, passant à 1,2 million de trajectoires à travers 1 200 tâches, avec une généralisation inter-embodiments et des résultats sur plusieurs modèles VLA montrant que des données de simulation sous-optimales peuvent entraîner des politiques robustes.

Le Moteur Derrière l'Ensemble de Données

L'ensemble de données est une sortie d'un moteur de données plus grand, en composition continue. Alors qu'un fournisseur de données traditionnel collecte selon une spécification fixe et s'arrête, Axis utilise les performances du modèle et les cas d'échec pour décider quoi collecter ensuite, de sorte que chaque cycle d'entraînement informe le suivant. Ce moteur fonctionne sur une stratégie hybride à travers quatre lignes de données, toutes maintenant opérationnelles à grande échelle :

- Simulation : Plus de 200 000 contributeurs distribués sur Axis Hub, une dApp top-3 sur Base, ont produit plus de 4,7 millions de trajectoires à travers 13 embodiments.
- Égocentrique : Un réseau géré de plus de 1 000 collecteurs à temps plein, formés au contrôle qualité, capture l'activité à la première personne dans des foyers et entreprises réels à travers 14 industries. Plus de 200 000 heures sont déjà en banque, augmentant de plus de 4 000 heures par jour, avec une pose de main vérifiée par Vicon.
- Loco-manipulation : Plus de 500 heures combinant mobilité et dextérité sur des humanoïdes réels (Unitree G1, Booster T2) via une téléopération indépendante du matériel.
- Post-entraînement DAgger validé par des humains : Plus de 500 heures de correction avec humain dans la boucle, axées sur les cas limites de déploiement.

Chaque tâche et trajectoire est enregistrée sur la chaîne sur Base pour la provenance, et les contributeurs sont récompensés pour la qualité vérifiée du travail.

Des Données Ouvertes au Déploiement Commercial

Au-delà de l'open source des données de simulation, Axis travaille directement avec des entreprises d'embodiment robotique pour construire des ensembles de données personnalisés pour leurs besoins spécifiques. Axis construit des pipelines de données personnalisés et des priors de modèle adaptés à chaque embodiment robotique. En tant que premier partenaire de données de simulation de Booster Robotics, Axis a recréé l'espace de travail réel de Booster comme un jumeau numérique axé sur les tâches. Des contributeurs distribués ont ensuite exécuté plus de 42 000 épisodes de simulation dessus, qu'Axis a distillés en un prior de modèle spécifique aux besoins de Booster. En utilisant seulement 30 démonstrations de robot réel, ce prior a atteint un taux de succès de 87,5%, comparé à 37,5% pour un modèle π0.5 standard—égalant les performances de π0.5 avec seulement la moitié des démos du monde réel.

Les autres partenaires d'Axis incluent des entreprises d'embodiment comme Feagine Robotics, des entreprises de modèles telles que Manycore Tech et Dexmal, et des entreprises d'automatisation industrielle comme Lotus Cars et Geely Auto. Axis alimente également des réseaux robotiques sur chaîne, y compris BitRobot sur Solana et OpenRoboto sur Bittensor.

Redéfinir la Fondation de Données de l'IA Physique

"Le futur de l'IA Physique n'est pas un ensemble de données statique que vous téléchargez une fois," a déclaré Chris Feng, fondateur d'Axis Robotics. "C'est un moteur qui continue de produire les données dont le modèle a besoin ensuite. L'échelle vous donne une large couverture. La diversité maintient le bruit non biaisé. La boucle fermée transforme chaque échec en progrès. C'est ce qui compose."

Axis a été fondé par des chercheurs de UC Berkeley, CMU, Georgia Tech, et SJTU, ainsi que des fondateurs en série qui ont fait passer des plateformes grand public à plus de 30 millions d'utilisateurs. Sa recherche est conseillée par Jiachen Li, professeur adjoint à Georgia Tech.

Lien du papier : https://arxiv.org/abs/2607.21588
Page du projet : https://axisaiorg.github.io/AXIS-V1/
Lien de l'ensemble de données : https://huggingface.co/datasets/axisrobotics/Franka-Dataset
Codebase GitHub : https://github.com/AxisAIOrg/Axis-V1-Training

Questions Fréquemment Posées
Voici une liste de FAQ sur l'ensemble de données de simulation open source du bras Franka d'Axis Robotics, conçue pour être claire, pratique et utile pour les nouveaux venus comme pour les roboticistes expérimentés



Questions Générales pour Débutants



Q Qu'est-ce qu'Axis Robotics a exactement publié

A Ils ont publié un ensemble massif de données open source de simulation spécifiquement pour les bras robotiques Franka Il contient des millions d'exemples du robot effectuant des tâches dans un environnement simulé, ainsi que les données de capteurs qui vont avec



Q Pourquoi est-ce un gros problème pour l'IA Physique

A L'IA Physique a besoin de comprendre comment interagir avec le monde réel Entraîner ces modèles d'IA nécessite généralement une énorme quantité de données du monde réel, ce qui est lent et coûteux à collecter Cet ensemble de données fournit un raccourci massif et de haute qualité, permettant aux modèles d'IA de s'entraîner des milliards de fois en simulation d'abord



Q Qu'est-ce qu'un ensemble de données de simulation

A C'est une collection de données générées à l'intérieur d'un programme informatique plutôt que par un robot physique Pensez-y comme à un jeu vidéo pour robots, où chaque action et observation est enregistrée pour créer des données d'entraînement pour l'IA



Q Je suis nouveau en robotique Puis-je utiliser cet ensemble de données

A Absolument Parce qu'il est open source, vous pouvez le télécharger et l'utiliser pour apprendre Vous pouvez commencer par explorer les données pour comprendre à quoi ressemblent les données de capteurs robotiques Pour une utilisation pratique, quelques connaissances de base en Python et en apprentissage automatique sont utiles, mais la barrière à l'entrée est bien plus basse que d'avoir besoin de votre propre robot physique



Q Cet ensemble de données est-il uniquement pour le robot spécifique Franka ou puis-je l'utiliser pour d'autres robots

A Les données sont spécifiques aux mouvements et capteurs du bras Franka Cependant, les techniques que vous apprenez et les modèles d'IA que vous entraînez peuvent souvent être adaptés ou transférés à d'autres bras robotiques similaires, surtout si vous utilisez un cadre qui prend en charge le transfert de modèle



Questions Techniques et Avancées



Q Quel format spécifique l'ensemble de données utilise-t-il

A L'ensemble de données est généralement fourni dans un format standard comme HDF5 ou un format structuré similaire, souvent aligné avec des cadres courants d'apprentissage robotique comme RLBench ou Robosuite Il inclut généralement des flux de caméra RVB-D, des cartes de profondeur, des états articulaires du robot et des trajectoires d'actions

Scroll to Top