Агенты с самооптимизацией часто повышают баллы на тренировочных задачах и теряют качество на новых. Исследователи Google Cloud AI Research и нескольких университетов предложили метод RRSI, который ограничивает правки и отфильтровывает предложения, чтобы сохранить обобщаемость harness. В тестах на восьми бенчмарках с замороженной моделью Claude Opus 4.8 метод дал до 14,1 пункта на обучающих задачах и до 4,7 пункта на незнакомых при экономии около 30% токенов. Результат важен, поскольку автоматическая настройка harness становится практичной формой рекурсивного самоулучшения.
Как RRSI ограничивает оптимизацию harness
Современные агенты сочетают фиксированную языковую модель с harness из промптов, рабочих процессов, инструментов, памяти и логики, который управляет каждым шагом. По данным статьи, недавний прогресс связан в основном с улучшением именно harness, а не с выпуском новых моделей. Раньше настройка шла вручную: разбор неудачных запусков и точечные исправления. Новые подходы позволяют языковой модели многократно переписывать harness на основе обратной связи от тестовых задач, создавая обратную связь, которая затем управляет ее собственным поведением.
RRSI, или Regularized Recursive Self-Improvement of Agent Harnesses, вмешивается в двух точках и сохраняет harness полностью редактируемым. При предложении изменений бюджет ограничивает число независимых правок в одном кандидате, причем со временем бюджет сокращается. Ранние раунды допускают крупные переписывания, поздние — только небольшие изменения с прослеживаемым эффектом. Система помнит прошлые попытки, чтобы не повторять неудачные идеи, а при остановке прогресса исследует нетронутые части harness.
Отбор изменений проходит второй уровень контроля. Критик отклоняет предложения, которые жестко прописывают названия задач, решения или другие приемы под конкретный бенчмарк. Рост вычислительных затрат допускается только при измеримом приросте качества, а компоненты без пользы удаляются. Исследователи выделяют три механизма заучивания: шаблоны под один бенчмарк, отбор кандидатов со случайным высоким баллом и лишняя сложность, которая поднимает оценку без улучшения агента.
Что это значит для внедрения агентов в компаниях
Для компаний, которые настраивают агентов на внутренних заявках, кодовых репозиториях или офисных процессах, описанный компромисс имеет прямое значение. RRSI показал наименьший прирост на обучении среди проверенных методов, но оказался единственным заметно выше базового harness на незнакомых задачах. Два конкурирующих метода на новых бенчмарках опустились даже ниже немодифицированной базы. В целом RRSI ни на одном из пяти незнакомых бенчмарков не упал ниже базы, а максимальный прирост в 4,7 пункта получен на JobBench из сфер кода, офисной работы и инженерного проектирования.
Второй практический эффект — операционные затраты. Среди оптимизированных harness вариант RRSI потребовал меньше всего токенов и шагов в работе, примерно на 30% меньше токенов, чем нерегуляризованная версия, хотя немодифицированная база осталась еще легче. Кодовый harness, найденный с помощью Gemini 3.5 Flash, перенесли на более слабую Gemini 3.1 Flash Lite без доработок, и точность выросла с 11,2 до 14,6 пункта. Для заказчиков это означает, что качественно регуляризованный harness может переноситься между моделями, а не привязывать команду к одной дорогой модели.
Удобным маркером станет воспроизводимость кода RRSI на GitHub за пределами восьми изученных бенчмарков на корпоративных наборах задач. Смежные сигналы — метод Nvidia SoL-Pi с сокращением расхода токенов до 49% и кейс ARC-AGI-3, где Opus 4.6 показал 97,1% в знакомой среде и 0% в незнакомой. Если регуляризованные harness удержат прирост на новых рабочих процессах без роста затрат токенов, самонастройка перейдет от погони за баллами к устойчивому внедрению.
