Atlas создает 3D-миры по одному фото
Пространственный интеллект и модель atlas
Atlas — это мультимодальная модель мира, которая учит AI понимать 3D-объекты и законы физики. Это важный этап на пути к AGI, так как нейросеть начинает осознавать, как предметы реально взаимодействуют в пространстве.
Технологии и возможности
В основе модели лежит архитектура multimodal autoregressive diffusion transformer. В отличие от Sora, Atlas управляется не текстом, а траекториями камеры, что обеспечивает точный контроль над ракурсом.
- Работа с данными: создает детальное 3D-окружение всего по одной фотографии.
- Видео: генерирует ролики в 1440p длительностью до одной минуты с четкой геометрией.
- 3D-активы: создает point clouds и 3D Gaussian splats, которые можно использовать в разработке.
Применение в робототехнике и бизнесе
Atlas открывает новые возможности для обучения роботов. Теперь достаточно снять помещение на смартфон, чтобы получить точную цифровую копию. В такой симуляции можно безопасно тестировать алгоритмы, исключая риск поломки дорогого оборудования.
В геймдеве и VFX модель радикально упрощает создание сложных миров: для построения полноценной сцены теперь достаточно нескольких базовых снимков.
Рынок и результаты тестов
Компания World Labs привлекла инвестиции в размере $1.2 млрд от Nvidia, AMD и Autodesk. В слепых тестах Atlas продемонстрировал превосходство над конкурентами:
- Точность: модель лучше следует пути камеры, чем Gemini Omni Flash и FLUX.
- Геометрия: Atlas точнее воссоздает 3D-объекты, чем открытые аналоги.
В отличие от Odyssey или Niantic Spatial, Atlas объединяет все эти функции в единой базе. На данный момент доступ к модели открыт только для ограниченного числа компаний.
Ранее по теме
Hi3D V3.0 — сверхточные 3D-модели для промышленности
Больше новостей в нашем Телеграм. Подпишись!
Ссылка на источник тык.