ИИ-агенты выполняли до 28,5 действий на каждый ввод человека при создании модели с 744 млрд параметров, однако почти все финальные решения остались за людьми. Команда с участием исследователей Fudan University из Китая разобрала более 700 журналов задач 56 участников, которые разрабатывали Atria Dawn Preview, при этом ИИ использовался в 96,5% задач. Люди определяли цели и рамки в 93,4% случаев, и это показывает, что рост объема работы агентов пока не означает независимую разработку.
Как агенты и исследователи разделили работу
За четыре недели медианное соотношение действий агентов и вводов человека выросло с 11 до 28,5, поскольку участники передавали агентам все больше шагов. Авторы предостерегают от трактовки этого роста как автономности: каждое решение человека запускало более длинные цепочки работы агентов без передачи права решать. Из 455 завершенных задач с участием ИИ 151 признана невыполнимой без ИИ при том же объеме и качестве, то есть примерно треть. Эти задачи распределились между 27 из 56 участников, поэтому эффект не свелся к узкой группе опытных пользователей.
Atria Dawn Preview построена на архитектуре mixture-of-experts и предназначена для исследовательских и инженерных задач. Обучение идет через конвейер, который связывает каждую задачу с реальной средой исполнения: модель вызывает инструменты, формирует промежуточные результаты и проверяется по внешним сигналам, таким как тесты, метрики или исходные данные. Команда сообщает о лидерстве в пяти из 16 бенчмарков, включая веб-поиск и кибербезопасность, без общего преимущества над конкурентами. Для методов и параметров преобладала схема «ИИ предлагает, человек выбирает» в 55,4% случаев, при этом люди приняли 85,5% таких решений, а ИИ — 9,2%.
В исследовании выделены три этапа участия ИИ: от объекта изучения до инструмента для отдельных задач и партнера по проекту, который готовит и корректирует планы в рамках целей, заданных людьми. Гипотетический четвертый этап предполагает рекурсивное самоулучшение, когда более сильные модели создают более сильных преемников, однако высокие результаты в учебных задачах не означают умения разрабатывать преемника. Работа вышла на фоне противоречивых сигналов отрасли: Anthropic сообщает о доле людей в решениях о направлении исследований на уровне единиц процентов, а OpenAI применяет GPT-5.6 Sol на всем цикле разработки. Google и DeepMind тестируют Dream-RSI для улучшения стратегии поиска, а не самой модели, при этом более тысячи сотрудников предупреждают о близкой автоматизации исследований ИИ.
Что это значит для компаний, использующих ИИ
Для компаний агенты выглядят не столько способом ускорить текущую работу, сколько способом начать работу, которая иначе осталась бы нетронутой. В этом проекте к такой категории относилась треть завершенных задач, и это важно для инженерных, исследовательских и аналитических команд с запасом сложных, но четко очерченных проблем. Небольшие компании могут закрывать агентами нехватку узких специалистов, а крупные — распределять исполнение между командами и сосредоточить опытных сотрудников на целях, методах и проверке. Даже среди 151 задачи, признанной невыполнимой без ИИ, цель выбрали люди в 95,4% случаев, поэтому умение ставить задачу сохраняет центральное место.
Ограничение связано с контролем и восстановлением работы, когда запуски агентов становятся длинными. Из 588 задач с зафиксированной сложностью 76% продвинулись только после вмешательства человека, а 23% агент решил сам. Помощь людей чаще всего состояла в добавлении контекста или уточнении требований в 35,2% случаев и в диагностике проблем со сменой метода в 34,7%, тогда как частичные правки составили 3,2%, а полный перехват — 0,7%. Когда выводы ИИ требовали доработки, в 75,4% случаев изменения после обратной связи вносил сам ИИ. Поэтому заказчикам следует проверять, как передается контекст, как разбираются сбои и где проходят границы согласования, ведь участники часто запускали агентов автономно, чтобы не прерывать длинные прогоны.
Показателем сдвига станет рост доли финальных решений агентов о целях и направлениях исследований, а не только числа шагов исполнения. Глава Anthropic Dario Amodei уже призвал к ограничению скорости, поскольку эта доля внутри его компании сокращается. Если независимые оценки покажут, что агенты предлагают разные направления и оценивают их до появления результатов, движение к самосовершенствующимся системам станет более конкретным для планирования бизнеса.
