Исследователи Nvidia создали SoL-Pi — систему автоматической оптимизации управляющего слоя coding-агентов, которая снижает расход токенов до 49% при сохранении результата почти на базовом уровне. Работа нацелена на harness — слой, который определяет, как агенты в системах вроде Codex, Claude Code или OpenClaw видят состояние, вызывают инструменты и обрабатывают обратную связь. Для бизнеса с длительными автономными сессиями агентов это важно, поскольку счета за токены растут с каждым шагом рассуждений и циклом вызовов.
Как SoL-Pi ищет более экономную логику
SoL-Pi работает как исследовательский агент, который наблюдает за трассами исполнения другого агента, предлагает изменения harness и проверяет их в подготовленных средах. Поиск охватил 535 исполняемых сред, включая 495 задач на основе пар issue-pull-request из GitHub и 40 синтетических тестов. Всего было выполнено более 3 000 запусков и свыше 60 000 взаимодействий агента со средой. Чтобы снизить переобучение, команда строго разделила поиск и оценку: EdgeBench был изолирован от поиска, 11 из 51 публичной задачи использовали для разовой проверки кандидатов, а остальные 40 оставили для финальной оценки.
Поиск дал четыре механизма, которые можно применять вместе или по отдельности. Action Fusion объединяет два последовательных шага, например правку кода и запуск тестов, в один и убирает целый вызов языковой модели. Online Context Compact срабатывает после каждого шага планирования и сокращает накопленный контекст, если важная информация не теряется. ObservationPack архивирует длинные выводы инструментов и подставляет краткое резюме на следующих шагах вместо повторной отправки полного текста. Evidence-Preserving Reducer передает крупные логи ошибок и тестов более дешевой модели для сжатия до ключевых выводов с автоматической проверкой пропущенных деталей.
На публичных задачах EdgeBench полная комбинация израсходовала на 49% меньше токенов и достигла 93,7% результата исходного harness Pi, а сильнейший одиночный механизм превзошел Pi на 5,3% и тоже сэкономил токены. Авторы пересчитали это в экономию от 8,75 до 13,50 доллара в час против штатных harness Codex и Claude Code и от 4,36 до 5,71 доллара в час против Pi при текущих ценах API. Давление в пользу такой работы видно и по другим данным: по оценке аналитика OpenRouter Питера Уокера, расход агентных токенов вырос в 14 раз с февраля 2026 года, а в августовском тесте Composio стоимость решенной задачи различалась почти в 3 раза на четырех фреймворках с одной моделью Deepseek V4 Flash.
Что это меняет для компаний с агентами
Для компаний с масштабным использованием coding-агентов результат показывает, что harness — это прямой рычаг влияния на операционные расходы. Экономия возникает в длинных сессиях с повторяющимися правками, запусками тестов и разбором логов ошибок, где объединение действий и сжатие контекста убирают лишние вызовы модели и повторную передачу выводов инструментов. Крупное внедрение с большим числом параллельных часов первым заметит разницу в долларах за час, а небольшая команда — меньшую стоимость решенной задачи при рутинных исправлениях. В одном тесте авторов общие затраты снизились с 1 339 до 894 долларов несмотря на weaker повторное использование кэша подсказок, а рой из 20 работников SoL-Pi сократил затраты на оптимизацию ядра на 26,8% против сопоставимого роя Pi.
Те же результаты показывают ограничения, которые покупателям следует проверять до внедрения похожей логики. На 63 процессорных задачах Terminal-Bench 4 система SoL-Pi решила 15 задач против 18 у Codex и Pi, хотя общие затраты были примерно на четверть ниже. Перенос на другую модель оказался частичным: система, построенная только на GPT-5.6 Sol и без изменений примененная к Opus 5, сохранила 94,3% результата Pi при похожей экономии, но срабатывала реже и менее агрессивно. Отдельное исследование из отчета предупреждает, что сжатие сохраняет в среднем лишь 17% инструкций пользователя, а разработчик Codex Эрик Провенчер отмечает, что более двух субагентов часто тратят токены на взаимную проверку без роста качества.
Конкретный маркер для наблюдения — перейдет ли оптимизация harness от разового поиска к предобучению на многих задачах. Авторы описывают предобучение harness и использование уже экономного harness для поиска его преемника, называя это recursive efficiency improvement. Если будущие статьи или продукты покажут предобученный harness с экономией токенов на незнакомых бенчмарках без потери результата, бизнес сможет считать эффективность harness устойчивым критерием выбора, а не разовым экспериментом.
