Axis Robotics har utgitt Axis Sim Dataset V1, et av de største åpen kildekode-simuleringsdatasettene for Franka-armmanipulasjon. Hele datasettet, treningskoden og benchmarks er nå offentlig tilgjengelige. V1 er bygget fra over 50 000 menneskelige teleopererte simuleringsbaner på tvers av 207 manipulasjonsoppgaver og mer enn 60 000 scenevarianter, alt på en simulert Franka Research 3-arm. Datasettet har tiltrukket seg over 160 000 nedlastinger, noe som gjør det til det mest nedlastede åpne kildekode-simuleringsdatasettet for Franka-manipulasjon på Hugging Face. I benchmarks forbedret kontinuerlig forhåndstrening på V1 π0.5-ytelsen og slo en volum-matchende RoboCasa-baseline, med alle resultater åpne og verifiserbare.
Axis Robotics bygger en sammensatt data-motor for Physical AI—et fullt integrert system som kombinerer storskala simulering, egosentrisk virkelighetsfangst, humanoide lokomanipulasjon og menneske-gated DAgger-ettertrening. Selskapet har samlet inn 12 millioner dollar i såkornfinansiering, ledet av Hack VC, med deltakelse fra Nomad Capital, Pi Network Ventures, 10K Ventures og engelinvestorer.
Et veddemål mot "kun rene data"
En vanlig antakelse innen robotikk er at demonstrasjoner må være nær-optimale fra starten av—filtrer ned til ekspertbaner, standardiser oppsettet og fjern all støyende data før imitasjonslæring kan fungere. Axis tar det motsatte synspunktet: datakvalitet bestemmes på distribusjonsnivå, ikke av individuelle baner. Når en stor og mangfoldig folkemengde produserer støyende, suboptimale baner og feilene deres er ukorrelerte, kansellerer støyen seg selv ut, og en fungerende policy oppstår under trening. Axis Sim Dataset V1 setter denne ideen på en offentlig prøve. Banene dekker plukk-og-plasser, stabling, helling, manipulering av leddede objekter og verktøybruk, alt samlet gjennom Axis sin nettleserbaserte teleoperasjonsplattform, Axis Hub, av en distribuert folkemengde snarere enn et enkelt ekspertteam. Datasettet ble utviklet med forskere fra UC Berkeley, Johns Hopkins, University of Michigan og andre institusjoner.
Resultater som skalerer
På LIBERO-Plus løfter kontinuerlig forhåndstrening på V1 π0.5-suksessen fra 83,9% til 88,8%, og overgår en volum-matchende RoboCasa365-baseline med 37,3%. Ytelsen forbedres jevnt etter hvert som forhåndstreningsdataene skaleres fra 25% til 100% av datasettet, uten tegn til metning—bevis på at gevinstene kommer fra mangfold og dekning, ikke en engangsforbedring. De største forbedringene vises under kamera-, sensorstøy- og layoutforstyrrelser, som er nøyaktig variantene Axis randomiserer under generering. Teamet sier V2 allerede er under arbeid, og skalerer til 1,2 millioner baner på tvers av 1 200 oppgaver, med tverr-embodiment-generalisering og resultater på tvers av flere VLA-modeller som viser at suboptimale simuleringsdata kan trene robuste policyer.
Motoren bak datasettet
Datasettet er ett resultat av en større, kontinuerlig sammensatt data-motor. Mens en tradisjonell dataleverandør samler inn til en fast spesifikasjon og stopper, bruker Axis modellens ytelse og feiltilfeller til å bestemme hva som skal samles inn neste, slik at hver treningsrunde informerer den neste. Denne motoren kjører på en hybridstrategi på tvers av fire datalinjer, som alle nå opererer i skala:
- Simulering: Over 200 000 distribuerte bidragsytere på Axis Hub, en topp-3 dApp på Base, har produsert over 4,7 millioner baner på tvers av 13 embodiments.
- Egosentrisk: Et administrert nettverk av over 1 000 heltids-, QC-trente samlere fanger førstepersonsaktivitet i ekte hjem og bedrifter på tvers av 14 bransjer. Over 200 000 timer er allerede banket, og vokser med over 4 000 timer daglig, med Vicon-verifisert håndposering.
- Lokomanipulasjon: Over 500 timer som kombinerer mobilitet og fingerferdighet på ekte humanoider (Unitree G1, Booster T2) gjennom maskinvare-agnostisk teleoperasjon.
- Menneske-gated DAgger-ettertrening: Over 500 timer med menneske-i-løkken-korreksjon fokusert på utplasseringskanttilfeller.
Hver oppgave og bane registreres på kjeden på Base for sporbarhet, og bidragsytere belønnes for verifisert arbeidskvalitet.
Fra åpne data til kommersiell utplassering
Utover å åpne kildekoden for simuleringsdata, jobber Axis direkte med robot-embodiment-selskaper for å bygge tilpassede datasett for deres spesifikke behov. Axis bygger tilpassede datapipelines og modell-priors skreddersydd for hver robot-embodiment. Som Booster Robotics' første simuleringsdatapartner gjenskapte Axis Boosters virkelige arbeidsområde som en oppgavefokusert digital tvilling. Distribuerte bidragsytere kjørte deretter over 42 000 simuleringsepisoder på den, som Axis destillerte til en modell-prior spesifikk for Boosters behov. Ved å bruke bare 30 ekte robotdemonstrasjoner oppnådde den en suksessrate på 87,5%, sammenlignet med 37,5% for en standard π0.5-modell—og matchet π0.5-ytelsen med bare halvparten av de virkelige demoene.
Axis sine andre partnere inkluderer embodiment-selskaper som Feagine Robotics, modellselskaper som Manycore Tech og Dexmal, og industrielle automasjonsfirmaer som Lotus Cars og Geely Auto. Axis driver også robotikknettverk på kjeden, inkludert BitRobot på Solana og OpenRoboto på Bittensor.
Omdefinering av Physical AIs datafundament
"Fremtiden for Physical AI er ikke et statisk datasett du laster ned én gang," sa Chris Feng, grunnlegger av Axis Robotics. "Det er en motor som fortsetter å produsere dataene modellen trenger neste. Skala gir deg bred dekning. Mangfold holder støyen objektiv. Den lukkede sløyfen gjør hver feil til fremgang. Det er det som sammensetter seg."
Axis ble grunnlagt av forskere fra UC Berkeley, CMU, Georgia Tech og SJTU, sammen med seriegründere som har skalert forbrukerplattformer til over 30 millioner brukere. Forskningen deres er rådgitt av Jiachen Li, førsteamanuensis ved Georgia Tech.
Papirlenke: https://arxiv.org/abs/2607.21588
Prosjektside: https://axisaiorg.github.io/AXIS-V1/
Datasettlenke: https://huggingface.co/datasets/axisrobotics/Franka-Dataset
GitHub-kodebase: https://github.com/AxisAIOrg/Axis-V1-Training
Ofte stilte spørsmål
Her er en liste over ofte stilte spørsmål om Axis Robotics' åpne kildekode-simuleringsdatasett for Franka-armen, designet for å være klare, praktiske og nyttige for både nybegynnere og erfarne robotikere
Generelle Nybegynnerspørsmål
Q Hva ga Axis Robotics nøyaktig ut
A De ga ut et massivt åpent kildekode-datasett med simulerte data spesifikt for Franka-robotarmer. Det inneholder millioner av eksempler på roboten som utfører oppgaver i et simulert miljø, sammen med sensordataene som følger med
Q Hvorfor er dette en stor sak for Physical AI
A Physical AI trenger å forstå hvordan man samhandler med den virkelige verden. Å trene disse AI-modellene krever vanligvis en enorm mengde virkelige data, som er tregt og dyrt å samle inn. Dette datasettet gir en massiv høykvalitets snarvei, som lar AI-modeller øve milliarder av ganger i simulering først
Q Hva er et simuleringsdatasett
A Det er en samling data generert inne i et dataprogram snarere enn fra en fysisk robot. Tenk på det som et videospill for roboter, hvor hver handling og observasjon registreres for å lage treningsdata for AI
Q Jeg er ny i robotikk. Kan jeg bruke dette datasettet
A Absolutt. Fordi det er åpen kildekode, kan du laste det ned og bruke det til å lære. Du kan starte med å utforske dataene for å forstå hvordan robotsensordata ser ut. For praktisk bruk er noe grunnleggende Python- og maskinlæringskunnskap nyttig, men inngangsbarrieren er mye lavere enn å trenge din egen fysiske robot
Q Er dette datasettet kun for den spesifikke Franka-roboten, eller kan jeg bruke det for andre roboter
A Dataene er spesifikke for Franka-armens bevegelser og sensorer. Imidlertid kan teknikkene du lærer og AI-modellene du trener ofte tilpasses eller overføres til andre lignende robotarmer, spesielt hvis du bruker et rammeverk som støtter modelloverføring
Tekniske Avanserte spørsmål
Q I hvilket spesifikt format er datasettet
A Datasettet leveres vanligvis i et standardformat som HDF5 eller et lignende strukturert format, ofte tilpasset vanlige robotlæringsrammeverk som RLBench eller Robosuite. Det inkluderer vanligvis RGBD-kamerafeed, dybdekart, robotleddtilstander og handlingsbaner