Google выпустил Android Bench 2.0 — крупное обновление фреймворка для оценки ИИ-моделей и агентов в задачах Android-разработки. В релиз вошли long-horizon tasks, на которые у инженера уходят несколько дней или даже неделя, агентская оценка и непрерывный скоринг. На момент публикации первое место в рейтинге занимал Claude Opus 5.5 с результатом 32% на длинных задачах, за ним следовал GPT 6 Astra с 28%. Для компаний, покупающих coding-агентов, это важно, поскольку бенчмарк теперь измеряет длительную работу, а не мелкие правки.
Длинные задачи и новые правила оценки
Исходный Android Bench, запущенный несколько месяцев назад, проверял модели на типовых задачах с учетом лучших практик Android в разрешениях, навигации и подключении. Тогда речь шла о точечных изменениях в существующих репозиториях. Версия 2.0 расширяет охват первым набором long-horizon tasks: обновление зависимостей, добавление новых функций, создание приложений с нуля и перенос кроссплатформенного приложения на Android. Оценка теперь начинается с агентов от соответствующих поставщиков моделей.
Модель оценки уходит от бинарного принципа «пройдено или провалено» к показателю completion rate. Раньше задача могла считаться проваленной из-за одного краевого теста, даже если десятки других требований были выполнены. По данным Google, новый показатель учитывает функциональность, визуальное соответствие и отсутствие регрессий. За отклонения от инструкций по оценке или структурных ограничений применяются объективные штрафные баллы.
Изменение отвечает на ограничения коротких тестов для агентских инструментов разработки. Проверки одного файла или одного коммита не показывают, сохраняет ли модель архитектуру, зависимости и интерфейс согласованными на протяжении многих шагов. Взвешивая частичный прогресс и штрафуя за нарушение инструкций, Android Bench 2.0 отделяет модели с правдоподобными фрагментами от моделей с рабочими сборками. Обновленная панель включает Gemini 3.8 Flash, Gemini 3.7 Flash, OpenAI GPT-6, Anthropic Fable 5.1, Kimi K3 и Qwen 3.8 Max наряду с лидерами.
Что это меняет для покупателей coding-агентов
Для продуктовых и инженерных команд первые результаты показывают, где агенты уже экономят труд. Google сообщает, что ИИ лучше пишет новый код, чем рефакторит существующий, поскольку рефакторинг требует понимания архитектурной сложности кодовой базы. Детерминированные преобразования тоже даются хорошо даже в крупных кодовых базах: конвертация Java в Kotlin, замена Retrofit на Ktor или внедрение слоя ViewModel. Небольшие компании могут поручать агентам новые экраны и стандартные миграции, а крупные — типовое расширение кода, оставляя архитектуру на контроле старших специалистов.
В то же время для закупок важны сохраняющиеся слабые места. Модели по-прежнему испытывают трудности с задачами, требующими проверки во время выполнения, например с отсутствующими графами dependency injection, с ломающими изменениями фреймворков и пробелами в знаниях о невыпущенных библиотеках. Перенос кроссплатформенного приложения на Android остается открытой задачей: лучшая модель достигает лишь 80% полноты. Этот разрыв означает, что в бюджет нужно закладывать время на исправление сборок, ручное тестирование и аудит зависимостей.
Практическим маркером станет рост проходного балла на длинных задачах выше нынешних 32% и полноты переноса приложений. Если новые релизы агентов поднимут результат при низких штрафах за регрессии, широкое делегирование многодневной Android-работы станет реалистичным. До этого рейтинг стоит использовать как фильтр для пилотов, а не как доказательство готовности.
