Én modell der det før trengtes fire

World Labs publiserte Atlas 1. september og beskrev den som en omni-verdensmodell, forhåndstrent fra bunnen av for å arbeide direkte med tekst, bilder, video og 3D. Selskapet opplyser at systemet er en multimodal autoregressiv diffusjonstransformator, og at hver inndata veves inn i én felles romlig kontekst i stedet for å håndteres av en egen komponent.

Den beskrivelsen er hele poenget med lanseringen. Å rekonstruere en scene, å generere video langs en valgt kamerabane og å simulere hva en robot ville se, har som regel vært tre ulike systemer. World Labs hevder at det er ett og samme problem.

Hva den tar inn og hva den gir ut

Atlas tar imot tekst, bilder, kameraposisjoner og 3D-dybdekart. Video behandles som en sekvens av bilder, hver med uttrykkelig kameraposisjon. På utdatasiden lister selskapet video på inntil ett minutt i opptil 1440p, punktskyer og 3D-gaussiske splats, samt 360-graders panoramaer generert fra en tekst eller et bilde.

En robotarm på en arbeidsbenk i et forskningslaboratorium.
Modellen gjengir farge- og dybdeobservasjoner fra simulerte robotperspektiver. Diego Martinez · pexels · Pexels License

Rekonstruksjonen er der tallene er mest konkrete. World Labs opplyser at Atlas lager trofaste rekonstruksjoner av en scene vanligvis ut fra så få som to eller tre bilder, og at modellen også kan utnytte over hundre inndatabilder når de finnes.

Fire evner i ett system

Selskapet deler modellens arbeid i fire funksjoner: kamerastyrt generering, som beskrives som pikselpresis; romlig rekonstruksjon fra sparsomme inndata; rom-tid-simulering, brukt til å ramme om video og til robotikk; og bildegenerering fra tekst med evne til å følge sammensatte instruksjoner.

Robotikktilfellet er det mest praktiske av de fire. Fordi modellen representerer rom og tid samlet, kan den rekonstruere et virkelig miljø og deretter gjengi RGB- og dybdeobservasjoner fra simulerte robotperspektiver, altså det Real-to-Sim-steget som ellers krever at scenen bygges for hånd.

Sammenligningene er selskapets egne

World Labs opplyser at Atlas gjør det bedre enn ledende modeller spesialisert på 3D-rekonstruksjon og slår nyere videomodeller på kamerastyrt generering. Ingen av påstandene følges av en publisert plassering i en sammenligningstabell, en navngitt konkurrent eller en uavhengig evaluering, og vektene er ikke sluppet.

En person som fotograferer et roms interiør med et kamera.
Atlas er i tidlig tilgang hos utvalgte partnere, uten dato for allmenn lansering. Engin Akyurt · pexels · Pexels License

Tilgangen er begrenset. Modellen er i tidlig tilgang hos utvalgte partnere, og interesserte må gå via et søknadsskjema. World Labs har ikke sagt når den blir allment tilgjengelig, eller hva den vil koste.

Hvor dette hører hjemme

World Labs ble grunnlagt av Fei-Fei Li, tidligere leder for Stanfords KI-laboratorium, og har hentet rundt 1,2 milliarder dollar fra investorer som Nvidia, AMD og Autodesk i en runde som ble kunngjort i februar 2026, ifølge SiliconANGLE. Atlas kommer etter Marble, selskapets kommersielle verdensmodellprodukt.

Hva man bør følge med på

Tre ting vil vise om omni-beskrivelsen holder. Om eksterne forskere kan gjenskape resultatet med få bilder på sine egne scener, når noen utenfor partnerlisten får kjøre modellen. Om robotikkmiljøer faktisk velger Real-to-Sim-veien framfor håndbygd simulering. Og om World Labs setter en dato og en pris på allmenn tilgjengelighet, noe selskapet så langt ikke har gjort.