Anthropic сообщила, что её модели Claude выполняют 26% работ компании в области AI research and development по состоянию на август 2026 года, тогда как в феврале этот показатель был ниже 1%. Цифра взята из прототипа R&D Automation Index, опубликованного в посте Anthropic Institute 17 сентября 2026 года, — первой попытки лаборатории передового фронта измерить, какая доля её собственных AI-работ делается с помощью AI. Для бизнеса, следящего за тем, куда движется разработка моделей, индекс даёт редкую возможность увидеть внутреннюю механику лаборатории, а не очередной результат бенчмарка.

Anthropic: Claude выполняет 26% внутренних работ по AI R&D

Что измеряет индекс

Индекс охватывает весь спектр работ по AI R&D в компании, оценивает степень автоматизации каждой задачи и сводит оценки в агрегированный показатель. Для оценки используется шкала Automation Level, разработанная Epoch AI, от AL0, то есть без участия AI, до AL5, когда AI работает полностью автономно без человека в контуре. На уровне AL3 AI сотрудничает, выполняя большую часть задачи под плотным руководством человека; на AL4 AI лидирует, проводя задачу от высокоуровневой подсказки до завершения под наблюдением человека. Anthropic сообщила, что доля работ на уровне сотрудничества и выше превышает 90%, а полностью автономно Claude не работает ни на одном измеренном участке AI R&D.

Каталог задач собирался снизу вверх по рабочим записям, таким как Slack и внутренняя документация. За каждую неделю июля 2026 года исследовательский агент Claude просматривал неделю каждого случайно выбранного сотрудника — 20% персонала из всех подразделений, образующих цикл разработки моделей, — и перечислял задачи, над которыми они работали, что дало плоский список примерно из 15 000 детальных задач. Затем Claude организовал их в иерархическое дерево из 542 узлов, 378 из которых — листья, например диагностика и исправление дефектов eval-платформы. Это дерево заморожено, чтобы каждое измерение шло по одной и той же корзине работ.

Для каждого узла агент Claude исследует, как такая работа выполняется в компании, а независимый судья Claude присваивает один из шести уровней автоматизации, опираясь только на свидетельства за оцениваемый месяц или более ранние. Задачи взвешиваются по человеко-времени, поэтому категории с большими затратами усилий персонала получают больший вес. Anthropic сверила оценки судьи с сотрудниками, отвечающими за соответствующие участки, которые оценивали работу, не видя доказательств и суждений моделей, и сообщила о точном совпадении модели с человеком в 59% случаев против 35% при совпадении людей между собой, а расхождение в пределах одного уровня составило 97%. Среди заявленных ограничений — замороженная корзина, которая фиксирует автоматизацию существующих работ, но не регистрирует новые их виды; сравнение задач, появившихся с февраля по июль 2026 года, с корзиной января 2026 года не выявило роста новых задач, и Anthropic планирует периодически пересобирать корзину и пересматривать версии опубликованных цифр.

Что это значит для бизнеса

Для компаний, внедряющих AI-агентов, индекс — это шаблон измерения автоматизации, не опирающийся на заявления поставщиков. Метод взвешивает задачи по человеко-времени, то есть отслеживает, куда реально уходят усилия сотрудников, а не считает развёрнутые инструменты. Небольшая компания может провести упрощённую версию того же упражнения: перечислить повторяющиеся задачи, оценить каждую по шкале от AL0 до AL5 и сверить оценки с людьми, отвечающими за эту работу. Точное совпадение модели с человеком в 59% случаев говорит о том, что такая самооценка полезна для ориентира, но недостаточно точна, чтобы принимать кадровые решения по одному кварталу.

Цифры надзора, опубликованные вместе с индексом, важны для всех, кто запускает агентов в продакшене. По состоянию на август 2026 года около 30 000 агентов одновременно выполняли исследовательскую и инженерную работу на самой используемой внутренней платформе Anthropic. Онлайн-мониторы проверяют 100% действий этих агентов до выполнения, обычно за секунды; из более чем миллиарда решений агентов, проанализированных за август 2026 года, 0,002%, то есть примерно 1 из 47 000, были заблокированы, а люди рассматривают любые заблокированные действия в течение недели. Офлайн-мониторы принимают 100% действий постфактум и отмечают примерно 100 000 транскриптов в неделю, из которых около 50 наиболее приоритетных сигналов в неделю передаются на рассмотрение человеку. Покупателям агентных платформ стоит спрашивать поставщиков, какой из этих двух уровней они используют, какая доля действий проверяется до выполнения и как разбираются заблокированные действия.

Anthropic также измерила распределение вычислений с 13 по 20 июля 2026 года, разложив все нагрузки по категориям: около 6% вычислений, идущих на AI R&D, было выделено на безопасность, и около 12% вычислений, идущих на AI-driven AI R&D, — на безопасность. Компания называет обе оценки намеренно консервативными: токены, которые развивали возможности не меньше, чем безопасность, засчитывались как AI R&D, а классификаторы-предохранители, сопоставимый по объёму отдельный пул вычислений, исключены. Классификатор на базе Claude разобрал почти 10 000 исследовательских обучающих и оценочных запусков за неделю, используя выборку около 14% со смещением в сторону крупнейших потребителей вычислений, и, по сообщению Anthropic, совпал с оценками людей в пределах одного-двух процентных пунктов. Заявленные ограничения: одна неделя показывает выполнимость измерения, но не устанавливает тренд; метки рабочих нагрузок приблизительны и не проверены; доля вычислений измеряет затраты, а не объём выполненной работы по безопасности. Ориентир для наблюдения — пересоберёт ли Anthropic корзину и опубликует ли второй индекс; если доля работ под руководством Claude продолжит расти, а доля вычислений на безопасность останется около 6%, разрыв между автоматизацией возможностей и вложениями в надзор станет той цифрой, которая важна и для регуляторов, и для корпоративных покупателей.