ИИ-агенты уже превращают одно фото в редактируемую 3D-сцену через код Blender, но не умеют надежно оценивать, стала ли очередная версия лучше. Проект LEGO-Anything от University of Maryland и AWS сочетает такой цикл Image-to-Code с бенчмарком LEGO-Bench из 208 изображений для 104 сцен внутри и снаружи помещений. Лучшая протестированная модель, GPT-6 Astra, показала точность 53,4% в интерьерах и 39,6% на улице. Для бизнеса важен формат: исполняемую программу можно проверять, править и опрашивать.

ИИ-агенты собирают 3D-сцены по фото, но не видят своих ошибок

Как LEGO-Bench проверяет реконструкцию по фото

LEGO-Bench использует 443 зарегистрированных ассета и рендерит входные изображения из профессионально собранных сцен симулятора: картинка выглядит естественно, а точная геометрия, глубина и привязка объектов скрыты как эталон для автоматической оценки. Сложность можно повышать без смены света и камер, обходя ограничения реальных фото без эталона и слишком условной синтетики. Оценка идет по трем осям: validity проверяет сам факт рабочего артефакта, reconstruction измеряет точность видимой геометрии, appearance сравнивает повторный рендер с эталоном попиксельно. Все шесть конфигураций GPT почти всегда выдавали рабочую сцену, а слабые набирали около 15%.

Агент работает итеративно, а не за один проход: пишет код, запускает его, смотрит на результат и правит сцену под исходное фото. Поскольку программа явно фиксирует объекты, геометрию, компоновку и положение камеры, сцена ведет себя как обычный код, который можно запускать, проверять и менять. Увеличение бюджета на рассуждения заметно помогло вариантам GPT-6: результат Astra на офисной подвыборке вырос с 32,3 до 61,8%. Уличные сцены оказались сложнее интерьеров, а точность падала с ростом сложности. Такая схема меняет разовую скорость на циклы последовательных исправлений.

Контекст — поиск внешней меры качества вместо мнения самого агента. Разбор шагов показал слабые первые попытки, правки, отменявшие прежний прогресс, и ненадежную самооценку. Когда моделям предлагали выбрать лучшую из двух версий, геометрические суждения оказывались на уровне случайности или ниже. Поэтому авторы предлагают опираться на конкретные измерения, а не на суждение агента. Так появился LEGO-Plugin без дополнительного обучения: он привязывает стартовую сцену к эталонному фото, заменяет самооценку измерениями и защищает удачный прогресс от регрессивных правок.

Что photo-to-code меняет для бизнеса

Для компаний с каталогами, интерьерами, объектами и выездными площадками кодовые сцены обещают ассеты, которые можно править напрямую, а не принимать как готовый меш или картинку. Детекцию объектов, сегментацию и оценку глубины можно получать прямо из программы без дополнительного обучения, что упрощает повторное использование в задачах зрения. Детекция по реконструированным сценам достигла примерно половины уровня специализированной модели DINO. Малый бизнес получает быстрый черновик по одному фото, а крупная компания — структурированный артефакт под ревью, версионность и смежные инструменты.

Ограничение — геометрическая точность и контроль качества. Сегментация и оценка глубины сильнее отстали от специализированных моделей SAM 3 и Depth Anything 3, а авторы называют текущие результаты рабочими, но заурядными. LEGO-Plugin улучшил все шесть моделей: слабые агенты прибавили до 62,7%, а лидер — лишь около двух процентных пунктов, поэтому эффект зависит от стартовой точки. Новость сама по себе не означает готовности реконструкции по одному фото для измерений и ответственных задач. У поставщика стоит спросить, как отдельно считаются validity, reconstruction и appearance, как обрабатываются улица и сложные сцены и какие внешние проверки блокируют регресс.

Практический маркер — станет ли уточнение по измерениям стандартом в демо поставщиков и бенчмарках, а оценки начнут регулярно делить на помещения, улицу и уровни сложности. Стоит следить за плагинами Unity для Claude Code и Codex, прямой реконструкцией вроде Atlas от World Labs и видеомодельным подходом GenCeption от Google DeepMind. Если исполняемые сцены сократят отставание от специализированных моделей зрения и сохранят редактируемость, photo-to-code перейдет от быстрых черновиков к надежным операционным данным.