Én model, hvor der før skulle fire til

World Labs offentliggjorde Atlas den 1. september og beskrev den som en omni-verdensmodel, fortrænet fra bunden til at arbejde direkte med tekst, billeder, video og 3D. Selskabet oplyser, at systemet er en multimodal autoregressiv diffusionstransformer, og at hvert input væves ind i én fælles rumlig kontekst i stedet for at blive håndteret af en separat komponent.

Den beskrivelse er hele pointen med udgivelsen. At rekonstruere en scene, at generere video langs en valgt kamerabane og at simulere, hvad en robot ville se, har som regel været tre forskellige systemer. World Labs hævder, at det er ét og samme problem.

Hvad den tager ind, og hvad den giver fra sig

Atlas modtager tekst, billeder, kamerapositioner og 3D-dybdekort. Video behandles som en sekvens af billeder, hver med udtrykkelig kameraposition. På outputsiden anfører selskabet video på op til ét minut i op til 1440p, punktskyer og 3D-gaussiske splats samt 360-graders panoramaer genereret ud fra en tekst eller et billede.

En robotarm på en arbejdsbænk i et forskningslaboratorium.
Modellen gengiver farve- og dybdeobservationer fra simulerede robotsynsvinkler. Diego Martinez · pexels · Pexels License

Rekonstruktionen er der, hvor tallene er mest konkrete. World Labs oplyser, at Atlas laver tro rekonstruktioner af en scene typisk ud fra så få som to eller tre billeder, og at modellen også kan udnytte over hundrede inputbilleder, når de findes.

Fire evner i ét system

Selskabet inddeler modellens arbejde i fire funktioner: kamerastyret generering, som beskrives som pikselpræcis; rumlig rekonstruktion ud fra sparsomme input; rum-tid-simulering, der bruges til at beskære video og til robotteknologi; og billedgenerering ud fra tekst med evne til at følge sammensatte instruktioner.

Robottilfældet er det mest praktiske af de fire. Fordi modellen repræsenterer rum og tid samlet, kan den rekonstruere et virkeligt miljø og derefter gengive RGB- og dybdeobservationer fra simulerede robotsynsvinkler, altså det Real-to-Sim-trin, der ellers kræver, at scenen bygges i hånden.

Sammenligningerne er selskabets egne

World Labs oplyser, at Atlas klarer sig bedre end førende modeller specialiseret i 3D-rekonstruktion og slår nyere videomodeller på kamerastyret generering. Ingen af påstandene ledsages af en offentliggjort placering i en sammenligningstabel, en navngiven konkurrent eller en uafhængig evaluering, og vægtene er ikke frigivet.

En person, der fotograferer et rums indre med et kamera.
Atlas er i tidlig adgang hos udvalgte partnere og uden dato for almindelig lancering. Engin Akyurt · pexels · Pexels License

Adgangen er begrænset. Modellen er i tidlig adgang hos udvalgte partnere, og interesserede skal gå gennem en ansøgningsformular. World Labs har ikke oplyst, hvornår den bliver almindeligt tilgængelig, eller hvad den vil koste.

Hvor det her hører hjemme

World Labs blev grundlagt af Fei-Fei Li, tidligere leder af Stanfords AI-laboratorium, og har hentet omkring 1,2 milliarder dollar fra investorer som Nvidia, AMD og Autodesk i en runde, der blev annonceret i februar 2026, ifølge SiliconANGLE. Atlas følger efter Marble, selskabets kommercielle verdensmodelprodukt.

Hvad man bør holde øje med

Tre ting vil vise, om omni-beskrivelsen holder. Om eksterne forskere kan gentage resultatet med få billeder på deres egne scener, når andre end partnerne kan køre modellen. Om robotteams rent faktisk vælger Real-to-Sim-vejen frem for håndbygget simulering. Og om World Labs sætter en dato og en pris på almindelig tilgængelighed, hvilket selskabet indtil videre ikke har gjort.