GPT-6 Astra от OpenAI полностью выполнила 7 задач из 100 в новом робототехническом тесте StationeryBench, тогда как MolmoAct2 от Ai2 не завершила ни одной. Медианный балл прогресса составил 46 из 100 у Astra против 12 у MolmoAct2 — результаты опубликованы на GitHub. Разрыв важен потому, что пространственное мышление, то есть способность оценивать положение объектов и планировать работу с ними, отставало от языковых возможностей сильнее всего, и именно оно определяет, сможет ли модель управлять машиной в реальном помещении.

GPT-6 Astra показывает скачок в пространственном мышлении по первым тестам

Что именно измерял тест

StationeryBench построен вокруг пяти задач с предметами на столе: снять колпачок с маркера, высыпать скрепки, передать линейку между двумя роботизированными руками и других. Обе модели управляли одними и теми же двухрукими роботами YAM в 200 испытаниях, поэтому аппаратная часть и набор задач были идентичны, а сравнение опирается на модели, а не на конфигурацию стенда. Оценка намеренно дробная: модель получает частичный балл за приближение к цели, поэтому медианный прогресс 46 у Astra и 12 у MolmoAct2 приводится вместе с числом полностью выполненных задач. Все результаты, видео и код доступны на GitHub, так что испытания можно изучить, а не принимать на веру.

Различие между прогрессом и завершением и есть суть результата. Astra в типичном испытании проходила примерно половину пути к цели, но довела до конца лишь 7 запусков из 100: модель часто верно начинает манипуляцию и не доводит её. MolmoAct2 с медианой 12 в большинстве случаев не проходила и начального этапа. Для того, кто оценивает роботизированную систему, этот раскол — практический сигнал: частичный прогресс говорит о работоспособности слоёв восприятия и планирования, а низкое число завершений указывает на слой исполнения — захват, усилие, тайминг — как на оставшееся узкое место.

Результат появился на фоне долгосрочных планов OpenAI выпускать собственных потребительских роботов, и это переводит тест из академического упражнения в раннюю проверку технологии, которую компания может однажды вывести на рынок. Робототехника остаётся самым трудным местом для применения больших моделей: ошибки здесь физические, а неудачный захват нельзя повторить за долю секунды. Тест, разделяющий планирование и исполнение, даёт OpenAI и её конкурентам способ измерять прогресс в задаче манипуляции ещё до появления потребительского продукта.

Что это значит для бизнеса

Для компаний, которые решают, где применять ИИ, ближайшее следствие в том, что пространственное мышление становится измеримой строкой, а не общим обещанием. Покупатель автоматизации для склада, лаборатории или мелкой сборки теперь может запросить у поставщика долю завершённых задач и медианный прогресс на заданном наборе вместо демонстрационного видео. Разница между небольшой компанией и крупной в основном в том, что она может сделать с этой цифрой: малая может запустить одну двухрукую ячейку и судить о ней по завершённым задачам, крупной же нужен тот же показатель по множеству постов, прежде чем вкладывать капитал.

Ограничения результата заслуживают такого же внимания. Семь выполненных задач из 100 — низкая абсолютная величина, а тест охватывает пять задач с предметами на столе на одной роботизированной платформе, поэтому он пока ничего не говорит о надёжности на тысячах циклов, о незнакомых объектах или о безопасности рядом с людьми. Тест REMAP, на который ссылается исследователь Корнеллского университета и Google DeepMind Йоав Арци, не опубликован, поэтому его показатели точности нельзя проверить независимо. Арци также отмечает, что даже Astra не достигает того, что делают люди в других сценариях. Прежде чем считать пространственное мышление решённой задачей, покупателю стоит спросить, какие задачи тестировались, как оценивалось завершение и настраивалась ли модель на тех же объектах, на которых её проверяли.

Арци называет Astra скачком в пространственном мышлении и предполагает, что OpenAI обучала модель на больших объёмах 3D-данных, например на сценах Blender, что совпадает с особым улучшением Astra на 3D-задачах. Следить стоит за тем, подтвердится ли это предположение и сдвинется ли на следующем публичном прогоне теста доля завершённых задач, а не балл прогресса. Если число доведённых до конца задач вырастет при неизменном наборе, пространственное мышление превращается в компонент, который можно прописать в договоре; если же растёт только прогресс, технология остаётся перспективным слоем планирования, всё ещё ждущим надёжной руки.