World Labs Atlas fue presentado como un modelo multimodal capaz de generar video con trayectorias de cámara definidas por el usuario, reconstruir escenas a partir de pocas imágenes y entregar salidas 3D como mapas de profundidad, nubes de puntos y Gaussian splats. La empresa abrió un acceso anticipado para socios seleccionados, pero no publicó precio, API pública ni una fecha de disponibilidad general.
La diferencia frente a un generador de video convencional está en que Atlas no se limita a recibir texto o imágenes para producir una secuencia. Según World Labs, el sistema combina texto, imágenes, video, poses de cámara y profundidad dentro de un mismo contexto espacial, con la meta de mantener coherencia entre los puntos de vista y permitir nuevas vistas de una escena.
En la demostración principal, la compañía mostró videos de hasta un minuto a 1440p generados desde una a seis imágenes de referencia y una ruta de cámara diseñada manualmente. Esa capacidad aparece en la página oficial como una demostración del modelo; no está descrita como una función ya abierta al público.
World Labs también presentó Atlas como una base para futuros productos propios, incluidas nuevas versiones de Marble. El anuncio se suma a la carrera por sistemas que mezclan generación visual y representación espacial, un terreno que interesa a estudios creativos, herramientas de edición, robótica y flujos de simulación.
Qué hace World Labs Atlas con imágenes, video y geometría de cámara
El blog oficial describe a Atlas como un transformador de difusión autorregresivo multimodal preentrenado desde cero. En lugar de depender solo de instrucciones escritas para mover una cámara, el modelo acepta geometría de cámara como entrada nativa. Con eso, World Labs dice que puede generar vistas nuevas desde ángulos precisos y sostener la consistencia de una escena mientras cambia la trayectoria.
La empresa mostró varios usos concretos. Uno de ellos parte de una sola imagen y genera vistas desde distintos ángulos. Otro une dos imágenes no relacionadas dentro de un mismo contexto espacial para producir transiciones entre ambas. En un frente parecido al de herramientas de edición visual como el editor de Qwen, Atlas se enfoca en cambiar el punto de vista, pero añade reconstrucción espacial y control explícito de cámara.

World Labs afirma además que Atlas puede reconstruir espacios reales desde una o decenas de imágenes y producir tanto vistas nuevas como salidas 3D explícitas. Entre esas salidas figuran nubes de puntos y Gaussian splats, dos formatos útiles para representar geometría y apariencia, aunque no equivalen necesariamente a una malla 3D lista para cualquier programa.
Otra demostración apunta al video multivista. La empresa mostró reencuadres desde nuevos ángulos usando grabaciones hechas con pocas cámaras comunes, incluidos teléfonos. En ese flujo, Atlas reconstruye la escena y luego genera nuevas vistas del mismo momento, una capacidad que World Labs vincula con efectos visuales y con simulación para robótica.
Acceso anticipado, comparaciones publicadas y límites confirmados
World Labs publicó comparaciones cuantitativas en generación condicionada por cámara y reconstrucción 3D. Según su propio material, Atlas supera a modelos más especializados en esos conjuntos de pruebas.
Aun así, las evaluaciones fueron preparadas y presentadas por la misma empresa, por lo que no conviene tratarlas como una validación independiente de toda la categoría.
La información confirmada deja varias incógnitas abiertas. World Labs no informó cuántos parámetros tiene Atlas, cuál es su latencia, qué hardware requiere, quiénes son sus socios iniciales ni cuándo llegará un acceso más amplio.
Tampoco anunció una API pública identificable para desarrolladores, algo relevante para medir qué tan cerca está de un uso comercial general.
Fuentes
World Labs: Atlas: A World Model for Spatial Intelligence
SiliconANGLE: Fei-Fei Li’s World Labs debuts Atlas
AI Weekly: World Labs debuts Atlas, an omni world model, in early access


