Anthropic опубликовала методологию трёх метрик, которые уже отслеживает внутри компании: исследования и разработки силами AI, надзор за автономными AI-агентами и распределение вычислений. Раскрытие последовало за призывом генерального директора Дарио Амодеи к ведущим разработчикам моделей координировать замедление темпов развития frontier-моделей, и оно нужно, чтобы другие передовые лаборатории могли измерять то же самое. Компания заявляет, что разрыв между тем, что знают передовые лаборатории, и тем, что знает публика, должен быть как можно меньше.
Что измеряют три метрики
Первая метрика — индекс того, какая доля собственных R&D-задач Anthropic выполняется силами Claude. Компания сообщает, что модель не работает полностью автономно ни в одном подмножестве этой работы. Вторая метрика касается надзора за AI-агентами: Anthropic построила систему, которая может контролировать агентов и вмешиваться в их действия внутри внутренних систем. Эта система показывает, что сейчас компания запускает около 30 000 автономных агентов в своих вычислительных средах, большинство из них заняты R&D. Третья метрика — регулярный снимок распределения вычислений, ресурса, который Anthropic называет основным топливом для AI.
Первый такой снимок охватывает период с 13 по 20 июля и показывает, что около 6% общей вычислительной мощности было направлено на AI safety, ещё 12% — на R&D силами AI с фокусом на безопасность. Anthropic утверждает, что вычисления — один из самых проверяемых входов в процесс AI R&D, а значит, возможный рычаг в будущих усилиях по сдерживанию темпов. Компания говорит, что совокупность этих измерений даёт сторонним оценщикам отправную точку для суждения о том, насколько быстро AI действительно ускоряется и на что он способен, и что публиковать их она намерена и дальше.
Раскрытие дополняет трёхшаговый план, опубликованный Амодеей в выходные: измерять развитие AI, публично отчитываться о нём и дать обществу возможность решить, как использовать эту информацию. Цель Амодея сформулировал как сдерживание быстрых темпов разработки frontier-моделей без потери коммерческого преимущества США в AI. План уже поддержали коллеги по отрасли, среди них генеральный директор OpenAI Сэм Альтман, генеральный директор SpaceX Илон Маск и председатель Google DeepMind Демис Хассабис.
Что это значит для бизнеса
Для компаний, которые покупают frontier-модели или строят на них свои продукты, практическое изменение — появление сопоставимых цифр. До сих пор оценки того, как быстро растут возможности AI, исходили в основном из заявлений поставщиков и результатов бенчмарков. Индекс R&D силами AI, число работающих агентов и разбивка распределения вычислений дают командам по закупкам и управлению рисками то, о чём можно спрашивать поставщиков напрямую. Небольшая компания, выбирающая одного поставщика моделей, может использовать число агентов как грубый сигнал о том, сколько автономии уже применяется в рабочей эксплуатации; крупное предприятие с собственным парком агентов может сравнить свои практики надзора с системой вмешательства, которую описывает Anthropic.
Ограничения здесь не менее важны, чем сами цифры. Это измерения Anthropic собственных систем, а не отраслевой стандарт, и компания не сообщила, как рассчитывается индекс R&D и что означало бы высокое или низкое его значение. Показатели 6% и 12% по вычислениям взяты из одной недели июля и относятся к одной лаборатории. Ничто здесь не говорит о том, что другие передовые лаборатории примут те же определения, и ничто не обязывает их публиковать данные. Бизнесу, выбирающему AI-поставщика, стоит спросить, какие из трёх метрик он отслеживает, за какой период и проверяются ли эти цифры независимо или сообщаются им самим.
Следить стоит за тем, опубликуют ли другие передовые лаборатории те же три метрики с теми же определениями. Если да, у покупателей появится общая мерка для сравнения скорости развития моделей и объёма надзора за ними; если раскрытие останется у одной компании, цифры так и будут её собственным отчётом о собственном прогрессе.
