Axis Robotics ha rilasciato Axis Sim Dataset V1, uno dei più grandi dataset di simulazione open-source per la manipolazione del braccio Franka. Il dataset completo, il codice di addestramento e i benchmark sono ora pubblicamente disponibili. V1 è costruito da oltre 50.000 traiettorie di simulazione teleoperate da umani attraverso 207 compiti di manipolazione e più di 60.000 variazioni di scena, tutto su un braccio simulato Franka Research 3. Il dataset ha attirato oltre 160.000 download, rendendolo il dataset di simulazione Franka open-source più scaricato su Hugging Face. Nei benchmark, il pre-addestramento continuo su V1 ha migliorato le prestazioni di π0.5 e ha superato una baseline RoboCasa con volume corrispondente, con tutti i risultati aperti e verificabili.
Axis Robotics sta costruendo un motore di dati in continua crescita per l'IA Fisica—un sistema completamente integrato che combina simulazione su larga scala, acquisizione egocentrica nel mondo reale, loco-manipolazione umanoide e post-addestramento DAgger con supervisione umana. L'azienda ha raccolto 12 milioni di dollari in finanziamento seed, guidato da Hack VC, con la partecipazione di Nomad Capital, Pi Network Ventures, 10K Ventures e investitori angel.
Una Scommessa Contro il "Solo Dati Puliti"
Un'ipotesi comune nella robotica è che le dimostrazioni debbano essere quasi ottimali fin dall'inizio—filtrare fino alle traiettorie esperte, standardizzare la configurazione e rimuovere qualsiasi dato rumoroso prima che l'apprendimento per imitazione possa funzionare. Axis adotta il punto di vista opposto: la qualità dei dati è determinata a livello di distribuzione, non dalle singole traiettorie. Quando una folla ampia e diversificata produce traiettorie rumorose e subottimali e i loro errori non sono correlati, il rumore si annulla e una politica funzionante emerge durante l'addestramento. Axis Sim Dataset V1 mette questa idea a una prova pubblica. Le sue traiettorie coprono pick-and-place, impilamento, versamento, manipolazione di oggetti articolati e uso di strumenti, tutte raccolte tramite la piattaforma di teleoperazione basata su browser di Axis, Axis Hub, da una folla distribuita piuttosto che da un singolo team esperto. Il dataset è stato sviluppato con ricercatori di UC Berkeley, Johns Hopkins, Università del Michigan e altre istituzioni.
Risultati che Scalano
Su LIBERO-Plus, il pre-addestramento continuo su V1 aumenta il successo di π0.5 dall'83,9% all'88,8%, superando una baseline RoboCasa365 con volume corrispondente del 37,3%. Le prestazioni migliorano costantemente man mano che i dati di pre-addestramento scalano dal 25% al 100% del dataset, senza segni di saturazione—prova che i guadagni derivano da diversità e copertura, non da un miglioramento una tantum. I miglioramenti più grandi appaiono sotto perturbazioni di camera, rumore dei sensori e layout, che sono esattamente le variazioni che Axis randomizza durante la generazione. Il team afferma che V2 è già in corso, scalando a 1,2 milioni di traiettorie attraverso 1.200 compiti, con generalizzazione cross-embodiment e risultati su più modelli VLA che mostrano che dati di simulazione subottimali possono addestrare politiche robuste.
Il Motore Dietro il Dataset
Il dataset è un output di un motore di dati più grande e in continua crescita. Mentre un fornitore di dati tradizionale raccoglie secondo una specifica fissa e si ferma, Axis usa le prestazioni del modello e i casi di fallimento per decidere cosa raccogliere successivamente, così ogni round di addestramento informa il successivo. Questo motore funziona su una strategia ibrida attraverso quattro linee di dati, tutte ora operative su larga scala:
- Simulazione: Oltre 200.000 contributori distribuiti su Axis Hub, una dApp top-3 su Base, hanno prodotto più di 4,7 milioni di traiettorie attraverso 13 embodiment.
- Egocentrico: Una rete gestita di oltre 1.000 collezionisti a tempo pieno addestrati al controllo qualità cattura attività in prima persona in case e aziende reali in 14 settori. Oltre 200.000 ore sono già accumulate, crescendo di oltre 4.000 ore al giorno, con posa della mano verificata da Vicon.
- Loco-manipolazione: Oltre 500 ore che combinano mobilità e destrezza su umanoidi reali (Unitree G1, Booster T2) tramite teleoperazione agnostica all'hardware.
- Post-addestramento DAgger con supervisione umana: Oltre 500 ore di correzione con umano nel ciclo focalizzate su casi limite di distribuzione.
Ogni compito e traiettoria è registrato on-chain su Base per la provenienza, e i contributori sono ricompensati per la qualità verificata del lavoro.
Da Dati Aperti a Distribuzione Commerciale
Oltre all'open-source dei dati di simulazione, Axis lavora direttamente con aziende di embodiment robotici per costruire dataset personalizzati per le loro esigenze specifiche. Axis costruisce pipeline di dati personalizzate e prior di modello su misura per ogni embodiment robotico. Come primo partner di dati di simulazione di Booster Robotics, Axis ha ricreato lo spazio di lavoro reale di Booster come gemello digitale focalizzato sul compito. I contributori distribuiti hanno poi eseguito oltre 42.000 episodi di simulazione su di esso, che Axis ha distillato in un prior di modello specifico per le esigenze di Booster. Usando solo 30 dimostrazioni robot reali, quel prior ha raggiunto un tasso di successo dell'87,5%, rispetto al 37,5% di un modello π0.5 standard—eguagliando le prestazioni di π0.5 con solo la metà delle demo nel mondo reale.
Gli altri partner di Axis includono aziende di embodiment come Feagine Robotics, aziende di modelli come Manycore Tech e Dexmal, e aziende di automazione industriale come Lotus Cars e Geely Auto. Axis alimenta anche reti robotiche on-chain, inclusi BitRobot su Solana e OpenRoboto su Bittensor.
Ridefinire la Fondazione Dati dell'IA Fisica
"Il futuro dell'IA Fisica non è un dataset statico che scarichi una volta," ha detto Chris Feng, fondatore di Axis Robotics. "È un motore che continua a produrre i dati di cui il modello ha bisogno successivamente. La scala ti dà una copertura ampia. La diversità mantiene il rumore imparziale. Il ciclo chiuso trasforma ogni fallimento in progresso. È questo che si accumula."
Axis è stata fondata da ricercatori di UC Berkeley, CMU, Georgia Tech e SJTU, insieme a fondatori seriali che hanno scalato piattaforme consumer a oltre 30 milioni di utenti. La sua ricerca è consigliata da Jiachen Li, Professore Assistente alla Georgia Tech.
Link al Paper: https://arxiv.org/abs/2607.21588
Pagina del Progetto: https://axisaiorg.github.io/AXIS-V1/
Link al Dataset: https://huggingface.co/datasets/axisrobotics/Franka-Dataset
Codice GitHub: https://github.com/AxisAIOrg/Axis-V1-Training
Domande Frequenti
Ecco un elenco di FAQ sul dataset di simulazione open-source del braccio Franka di Axis Robotics, progettato per essere chiaro, pratico e utile sia per i nuovi arrivati che per i robotici esperti.
Domande Generali per Principianti
D: Cosa ha rilasciato esattamente Axis Robotics?
R: Hanno rilasciato un enorme dataset open-source di dati simulati specificamente per bracci robotici Franka. Contiene milioni di esempi del robot che esegue compiti in un ambiente simulato, insieme ai dati dei sensori che li accompagnano.
D: Perché è importante per l'IA Fisica?
R: L'IA Fisica deve capire come interagire con il mondo reale. Addestrare questi modelli di IA richiede solitamente una grande quantità di dati del mondo reale, che è lenta e costosa da raccogliere. Questo dataset fornisce una scorciatoia massiccia e di alta qualità, permettendo ai modelli di IA di esercitarsi miliardi di volte prima in simulazione.
D: Cos'è un dataset di simulazione?
R: È una raccolta di dati generati all'interno di un programma informatico piuttosto che da un robot fisico. Pensalo come un videogioco per robot, dove ogni azione e osservazione viene registrata per creare dati di addestramento per l'IA.
D: Sono nuovo nella robotica. Posso usare questo dataset?
R: Assolutamente. Poiché è open-source, puoi scaricarlo e usarlo per imparare. Puoi iniziare esplorando i dati per capire come appaiono i dati dei sensori robotici. Per un uso pratico, è utile una conoscenza di base di Python e machine learning, ma la barriera d'ingresso è molto più bassa rispetto alla necessità di avere il tuo robot fisico.
D: Questo dataset è solo per il robot specifico Franka o posso usarlo per altri robot?
R: I dati sono specifici per i movimenti e i sensori del braccio Franka. Tuttavia, le tecniche che impari e i modelli di IA che addestri possono spesso essere adattati o trasferiti ad altri bracci robotici simili, specialmente se usi un framework che supporta il trasferimento del modello.
Domande Tecniche e Avanzate
D: In quale formato specifico è il dataset?
R: Il dataset è tipicamente fornito in un formato standard come HDF5 o un formato strutturato simile, spesso allineato con framework comuni di apprendimento robotico come RLBench o Robosuite. Di solito include feed di telecamere RGBD, mappe di profondità, stati dei giunti del robot e traiettorie delle azioni.