Axis Robotics har udgivet Axis Sim Dataset V1, et af de største open source-simuleringsdatasæt til Franka-armmanipulation. Hele datasættet, træningskoden og benchmarks er nu offentligt tilgængelige. V1 er bygget på over 50.000 menneskeligt teleopererede simuleringsbaner på tværs af 207 manipulationopgaver og mere end 60.000 scenevariationer, alt sammen på en simuleret Franka Research 3-arm. Datasættet har tiltrukket over 160.000 downloads, hvilket gør det til det mest downloadede open source-simuleringsdatasæt for Franka-manipulation på Hugging Face. I benchmarks forbedrede kontinuerlig prætræning på V1 π0.5-ydeevnen og slog en volumenmatchet RoboCasa-baseline, med alle resultater åbne og verificerbare.
Axis Robotics bygger en sammensættende data-motor til Physical AI—et fuldt integreret system, der kombinerer storstilet simulering, egocentrisk optagelse fra den virkelige verden, humanoide lokomobilmanipulation og menneskegodkendt DAgger-posttræning. Virksomheden har rejst 12 millioner dollars i seed-finansiering, ledet af Hack VC, med deltagelse fra Nomad Capital, Pi Network Ventures, 10K Ventures og engleinvestorer.
Et væddemål mod "kun rene data"
En almindelig antagelse inden for robotteknologi er, at demonstrationer skal være næsten optimale fra starten—filtrer ned til ekspertbaner, standardiser opsætningen og fjern alt støjende data, før imiteringslæring kan fungere. Axis tager den modsatte tilgang: datakvalitet bestemmes på distributionsniveau, ikke af individuelle baner. Når en stor og mangfoldig gruppe producerer støjende, suboptimale baner, og deres fejl er ukorrelerede, udligner støjen sig selv, og en fungerende politik opstår under træning. Axis Sim Dataset V1 sætter denne idé på en offentlig prøve. Dets baner dækker pick-and-place, stabling, hældning, manipulation af leddelte objekter og værktøjsbrug, alt sammen indsamlet gennem Axis' browserbaserede teleoperationsplatform, Axis Hub, af en distribueret gruppe snarere end et enkelt ekspertteam. Datasættet blev udviklet med forskere fra UC Berkeley, Johns Hopkins, University of Michigan og andre institutioner.
Resultater, der skalerer
På LIBERO-Plus løfter kontinuerlig prætræning på V1 π0.5-succesraten fra 83,9% til 88,8%, hvilket overgår en volumenmatchet RoboCasa365-baseline med 37,3%. Ydeevnen forbedres støt, når prætræningsdata skaleres fra 25% til 100% af datasættet, uden tegn på mætning—bevis på, at gevinsterne kommer fra mangfoldighed og dækning, ikke en engangsforbedring. De største forbedringer ses under kamera-, sensorstøj- og layoutforstyrrelser, hvilket er præcis de variationer, Axis randomiserer under generering. Teamet siger, at V2 allerede er i gang, og skalerer til 1,2 millioner baner på tværs af 1.200 opgaver, med tværlegemsgeneralering og resultater på tværs af flere VLA-modeller, der viser, at suboptimale simuleringsdata kan træne robuste politikker.
Motoren bag datasættet
Datasættet er ét output fra en større, kontinuerligt sammensættende data-motor. Mens en traditionel dataleverandør indsamler til en fast specifikation og stopper, bruger Axis modelydeevne og fejltilfælde til at beslutte, hvad der skal indsamles næste gang, så hver træningsrunde informerer den næste. Denne motor kører på en hybridstrategi på tværs af fire datalinjer, som alle nu opererer i skala:
- Simulering: Over 200.000 distribuerede bidragydere på Axis Hub, en top-3 dApp på Base, har produceret 4,7 millioner+ baner på tværs af 13 legemsformer.
- Egocentrisk: Et administreret netværk af 1.000+ fuldtids-, QC-trænede indsamlere fanger førstepersonsaktivitet i rigtige hjem og virksomheder på tværs af 14 industrier. Over 200.000 timer er allerede banket, voksende med 4.000+ timer dagligt, med Vicon-verificeret håndposition.
- Lokomomanipulation: 500+ timer, der kombinerer mobilitet og fingerfærdighed på rigtige humanoider (Unitree G1, Booster T2) gennem hardwareagnostisk teleoperation.
- Menneskegodkendt DAgger-posttræning: 500+ timer med menneske-i-løkken-korrektion fokuseret på implementeringskanttilfælde.
Hver opgave og bane registreres on-chain på Base for sporbarhed, og bidragydere belønnes for verificeret arbejdskvalitet.
Fra åbne data til kommerciel implementering
Ud over at udgive simuleringsdata som open source arbejder Axis direkte med robotlegemsvirksomheder for at bygge skræddersyede datasæt til deres specifikke behov. Axis bygger skræddersyede datapipelines og modelpriorer tilpasset hver robotlegemsform. Som Booster Robotics' første simuleringsdatapartner genskabte Axis Boosters rigtige arbejdsområde som en opgavefokuseret digital tvilling. Distribuerede bidragydere kørte derefter over 42.000 simulerings-episoder på den, som Axis destillerede til en modelprior specifik for Boosters behov. Ved at bruge kun 30 rigtige robotdemonstrationer opnåede den en succesrate på 87,5%, sammenlignet med 37,5% for en standard π0.5-model—hvilket matcher π0.5's ydeevne med kun halvdelen af de virkelige demoer.
Axis' andre partnere inkluderer legemsvirksomheder som Feagine Robotics, modelselskaber som Manycore Tech og Dexmal samt industrielle automatiseringsfirmaer som Lotus Cars og Geely Auto. Axis driver også on-chain robotnetværk, herunder BitRobot på Solana og OpenRoboto på Bittensor.
Omdefinering af Physical AIs datafundament
"Fremtiden for Physical AI er ikke et statisk datasæt, du downloader én gang," sagde Chris Feng, grundlægger af Axis Robotics. "Det er en motor, der fortsat producerer de data, modellen har brug for næste gang. Skala giver dig bred dækning. Mangfoldighed holder støjen upartisk. Den lukkede sløjfe forvandler hver fejl til fremskridt. Det er det, der sammensætter."
Axis blev grundlagt af forskere fra UC Berkeley, CMU, Georgia Tech og SJTU sammen med seriegrundlæggere, der har skaleret forbrugerplatforme til over 30 millioner brugere. Dets forskning rådgives af Jiachen Li, adjunkt ved Georgia Tech.
Paper-link: https://arxiv.org/abs/2607.21588
Projektside: https://axisaiorg.github.io/AXIS-V1/
Datasæt-link: https://huggingface.co/datasets/axisrobotics/Franka-Dataset
GitHub-kodebase: https://github.com/AxisAIOrg/Axis-V1-Training
Ofte stillede spørgsmål
Her er en liste over ofte stillede spørgsmål om Axis Robotics' open source Franka-arm-simuleringsdatasæt, designet til at være klare, praktiske og nyttige for både nybegyndere og erfarne robotikere
Generelle begynderspørgsmål
Q Hvad udgav Axis Robotics præcis
A De udgav et massivt open source-datasæt af simulerede data specifikt til Franka-robotarme Det indeholder millioner af eksempler på robotter, der udfører opgaver i et simuleret miljø, sammen med de tilhørende sensordata
Q Hvorfor er dette en stor ting for Physical AI
A Physical AI har brug for at forstå, hvordan man interagerer med den virkelige verden At træne disse AI-modeller kræver normalt en enorm mængde virkelige data, hvilket er langsomt og dyrt at indsamle Dette datasæt giver en massiv højkvalitets-genvej, der tillader AI-modeller at øve sig milliarder af gange i simulering først
Q Hvad er et simuleringsdatasæt
A Det er en samling af data genereret inde i et computerprogram snarere end fra en fysisk robot Tænk på det som et videospil til robotter, hvor hver handling og observation optages for at skabe træningsdata til AI
Q Jeg er ny til robotteknologi Kan jeg bruge dette datasæt
A Absolut Fordi det er open source, kan du downloade det og bruge det til at lære Du kan starte med at udforske dataene for at forstå, hvordan robotsensordata ser ud For praktisk brug er noget grundlæggende Python- og maskinlæringsviden nyttigt, men adgangsbarrieren er meget lavere end at have din egen fysiske robot
Q Er dette datasæt kun for den specifikke Franka-robot, eller kan jeg bruge det til andre robotter
A Dataene er specifikke for Frankas armbevægelser og sensorer Dog kan de teknikker, du lærer, og de AI-modeller, du træner, ofte tilpasses eller overføres til andre lignende robotarme, især hvis du bruger en ramme, der understøtter modeloverførsel
Tekniske avancerede spørgsmål
Q Hvilket specifikt format er datasættet i
A Datasættet leveres typisk i et standardformat som HDF5 eller et lignende struktureret format, ofte tilpasset almindelige robotlæringsrammer som RLBench eller Robosuite Det inkluderer normalt RGBD-kamerafeed, dybdemaps, robotledtilstande og handlingsbaner