Un modelo donde antes hacían falta cuatro

World Labs publicó Atlas el 1 de septiembre y lo describió como un modelo del mundo omni, preentrenado desde cero para operar de forma nativa con texto, imágenes, vídeo y 3D. La compañía indicó que el sistema es un transformador de difusión autorregresivo multimodal y que cada entrada se integra en un único contexto espacial compartido en lugar de pasar por un componente separado.

Ese planteamiento es el sentido del lanzamiento. Reconstruir una escena, generar vídeo siguiendo una trayectoria de cámara elegida y simular lo que vería un robot han sido por lo general tres sistemas distintos. World Labs sostiene que son un solo problema.

Qué acepta y qué produce

Atlas admite texto, imágenes, posiciones de cámara y mapas de profundidad 3D. El vídeo se trata como una secuencia de imágenes, cada una con su posición de cámara explícita. En la salida, la compañía enumera vídeo de hasta un minuto a un máximo de 1440p, nubes de puntos y splats gaussianos 3D, y panorámicas de 360 grados generadas a partir de un texto o una imagen.

Un brazo robótico sobre una mesa de trabajo en un laboratorio de investigación.
El modelo genera observaciones de color y profundidad desde puntos de vista robóticos simulados. Diego Martinez · pexels · Pexels License

La reconstrucción es donde las cifras son más concretas. World Labs afirmó que Atlas genera reconstrucciones fieles de una escena normalmente a partir de sólo dos o tres imágenes, y que también puede aprovechar más de un centenar de imágenes de entrada cuando están disponibles.

Cuatro capacidades en un solo sistema

La empresa agrupa el trabajo del modelo en cuatro funciones: generación controlada por cámara, que califica de precisa al píxel; reconstrucción espacial a partir de entradas escasas; simulación espacio-temporal, empleada para reencuadrar vídeo y para robótica; y generación de imágenes a partir de texto con seguimiento de instrucciones complejas.

El caso robótico es el más práctico de los cuatro. Como el modelo representa a la vez el espacio y el tiempo, puede reconstruir un entorno real y después renderizar observaciones RGB y de profundidad desde puntos de vista simulados de un robot: el paso Real-to-Sim que de otro modo obliga a construir la escena a mano.

Las comparaciones son de la propia compañía

World Labs sostuvo que Atlas supera a los modelos punteros especializados en reconstrucción 3D y que aventaja a los modelos de vídeo recientes en generación controlada por cámara. Ninguna de las dos afirmaciones viene acompañada de una posición publicada en una tabla comparativa, de un competidor con nombre ni de una evaluación independiente, y los pesos no se han publicado.

Una persona fotografiando el interior de una habitación con una cámara.
Atlas está en acceso anticipado con socios seleccionados y sin fecha de disponibilidad general. Engin Akyurt · pexels · Pexels License

El acceso es limitado. El modelo está en acceso anticipado con socios seleccionados y los interesados deben pasar por un formulario de solicitud; World Labs no ha dicho cuándo estará disponible de forma general ni cuánto costará.

Dónde se sitúa

World Labs fue fundada por Fei-Fei Li, antigua directora del laboratorio de IA de Stanford, y ha captado alrededor de 1.200 millones de dólares de inversores entre los que figuran Nvidia, AMD y Autodesk en una ronda anunciada en febrero de 2026, según SiliconANGLE. Atlas llega después de Marble, el producto comercial de modelo del mundo de la compañía.

Qué vigilar

Tres cosas mostrarán si el planteamiento omni se sostiene. Si investigadores externos logran reproducir el resultado de reconstrucción con pocas imágenes en sus propias escenas, una vez que alguien fuera de la lista de socios pueda ejecutarlo. Si los equipos de robótica adoptan realmente la vía Real-to-Sim en lugar de la simulación construida a mano. Y si World Labs pone fecha y precio a la disponibilidad general, algo que hasta ahora no ha hecho.