Внешние оценщики получат доступ уровня сотрудников внутри Anthropic в рамках обязательства из эссе Дарио Амодеи We Must Pace the Frontier. Первым партнером стала Accenture, причем Anthropic и Accenture планируют вложить не менее $1 млрд каждая в развитие оценки моделей за пять лет. Такая схема переводит независимый надзор за передовыми моделями из идеи в рабочую практику, за которой корпоративным пользователям ИИ придется следить.

Anthropic открывает Accenture внутренний доступ к своим моделям

Партнерство с Accenture и переговоры с METR

Работу возглавит Faculty, специализированное подразделение Accenture в области ИИ. В задачи входят оценка и red-teaming моделей, анализ alignment и проверка защитных механизмов. Anthropic ссылается на опыт Accenture по внедрению ИИ для бизнеса и госструктур в разных отраслях как на практический взгляд на корпоративное применение. Работу Accenture напрямую оплатит Anthropic. Параллельно компания ведет диалог с METR и другими некоммерческими оценщиками о пилотах встроенной оценки за их собственное финансирование. Соглашение неэксклюзивное, новые оценщики ожидаются в ближайшие недели.

Встроенная оценка означает, что внешние специалисты работают внутри лаборатории с доступом уровня наиболее привилегированных сотрудников, за исключением защиты данных, сохраняя внешний взгляд и сообщая о замеченном. Минимальные стандарты из открытого письма под руководством Geoffrey Hinton, Stuart Russell и Arvind Narayanan требуют значимой независимости таких оценщиков. Оплата не может зависеть от выводов, не должно быть владения, управленческих или иных коммерческих связей и редакционного контроля. Конфликты нужно раскрывать, разные взгляды учитывать, а самих оценщиков защищать от преследования.

OpenAI последовала за Anthropic, взяв обязательство по таким оценщикам, и призвала к международной координации. Главный спор — кто выбирает и оплачивает работу, поскольку опытные люди обычно получили опыт внутри ведущих лабораторий. Устоявшиеся модели аудита по-прежнему сталкиваются с проблемой перехода кадров и источника финансирования. Gabriel Weil в июле argued, что разработчики не должны сами нанимать себе арбитров, и предложил обязательное страхование ответственности. В источнике обсуждаются покрытие $100 млрд или $1 трлн, публикация его стоимости и раскрытие факторов риска, а также упоминаются оценка $2,2 трлн и недавние инциденты со взломом ИИ.

Что это значит для покупателей ИИ

Для компаний, которые покупают передовые модели или строят на них продукты, постоянный слой оценки может упростить сравнение заявлений о безопасности разных поставщиков. Оценщик с корпоративным профилем знает, как модели реально внедряют в регулируемых процессах, закупочных проверках и операционном контроле. Сочетание корпоративных и некоммерческих оценщиков расширит спектр выводов — от удобства safeguards до рисков alignment. Крупные организации смогут использовать такие отчеты в due diligence поставщиков, а небольшие фирмы скорее будут опираться на краткие итоги и закупочные чек-листы.

Схема оставляет открытые вопросы, важные для доверия к отчетам. Anthropic ранее сотрудничала с Accenture и напрямую оплатит эту работу, что создает конфликт интересов даже при формальных правилах независимости. Несколько источников надзора помогают, но лаборатория может подчеркивать наиболее благоприятный отзыв и отводить более резкую критику. Мнения в источнике разделились: с одной стороны скепсис по поводу консалтинговой экспертизы, с другой — прежний опыт Faculty в оценке, а также просьба к Accenture показать пример отчета по передовой модели.

Сигналом станет то, подключит ли Anthropic в ближайшие недели METR и другие некоммерческие организации и опубликует ли методы и выводы обоих направлений. Параллельные пилоты с независимым финансированием, а также проекты Accenture с другими разработчиками покажут экосистему, а не одну двустороннюю сделку. Без этих шагов модель останется зависимой от одних оплаченных отношений.