Snorkel AI привлекла $350 млн в рамках Series E при оценке $3.5 млрд. Раунд возглавили Insight и S32, к ним присоединились более полудюжины других инвесторов, включая венчурный фонд Alphabet Inc. — GV. Компания также сообщила, что на этой неделе её годовой темп выручки достиг $375 млн. Это важно, потому что цифра показывает реальный размер формирующегося рынка готовых наборов данных для обучения AI.

Snorkel AI привлекает $350 млн при оценке $3.5 млрд: выручка data-as-a-service достигла $375 млн

От спин-оффа Stanford до вендора данных на $3.5 млрд

Snorkel AI основана в 2019 году исследователями Stanford AI Lab. Первый продукт, Snorkel Flow, — программная платформа, сокращавшая трудозатраты на проекты supervised learning, метода обучения нейросетей на размеченных наборах данных из промптов и правильных ответов, созданных человеком. В прошлом году компания сменила бизнес-модель: вместо продажи ПО для создания обучающих данных она перешла к поставке готовых наборов и расширила фокус с supervised learning на reinforcement learning. Сооснователь и CEO Алекс Ратнер написал в блоге, что с запуском нового формата data-as-a-service почти год назад выручка выросла более чем в 18 раз.

Механика услуги строится на трёх компонентах, поставляемых вместе: наборы данных, критерии оценки (rubrics) и обучающие песочницы. Ручная разметка данных — крайне трудоёмкий процесс, и Snorkel Flow изначально автоматизировал его с помощью статистических методов, разработанных основателями в Stanford; по словам компании, эти методы устранили проблемы точности, из-за которых прежние схемы автоматизации были неэффективны. Для reinforcement learning Snorkel AI опирается на десятки тысяч профильных экспертов, создающих обучающие задачи. Когда модель решает задачу, рецензенты-люди проверяют результат по заранее заданным критериям, которые могут занимать несколько страниц: для программной задачи в них должны быть отражены все требования кибербезопасности и производительности к сгенерированному коду. Модели часто обучаются в специализированных виртуальных средах — например, в симулированной рабочей станции разработчика для модели генерации кода, — и Snorkel AI предоставляет такие песочницы наряду с наборами данных и rubrics.

Смена модели отражает сдвиг в том, куда индустрия направляет бюджет на обучение. Наборы для supervised learning содержат промпты и правильные ответы, тогда как наборы для reinforcement learning содержат невыполненные вопросы, которые модель должна решить без помощи человека; затем рецензент или автоматическая система проверяет ответ и передаёт модели обратную связь для улучшения рассуждений. Snorkel AI разрабатывает критерии оценки под заказ и улучшает их со временем по обратной связи от рецензентов — часть такой обратной связи возникает, когда два рецензента ставят разные оценки одному и тому же ответу, что обычно указывает на противоречие в самих критериях. Привлечённые средства компания планирует направить на найм инженеров, инвестиции в инициативы по безопасности AI и поддержку разработки открытых бенчмарков для оценки моделей.

Что это меняет для компаний, покупающих обучающие данные

Для тех, кто строит или дообучает собственные модели, раунд сигнал о том, что вендор может поставить весь пакет для обучения — данные, критерии и песочницу, — а не только инструмент, которым придётся управлять силами своей команды. Это снижает порог входа для компаний среднего размера, у которых нет объёмов разметки крупных платформенных вендоров: вместо найма аннотаторов можно купить готовый набор для reinforcement learning с уже написанными критериями оценки. Темп выручки $375 млн и рост в 18 раз, о которых сообщает Snorkel AI, показывают, что спрос на такой формат реален, а не предположителен, — это упрощает обоснование покупки данных в рамках бюджетного цикла.

Вместе с тем ряд моментов требует проверки, прежде чем считать модель устоявшейся. Оценка $3.5 млрд — отметка на частном рынке, а не публичная цена, а показатель $375 млн — это объявленный самой компанией годовой темп выручки, а не прошедший аудит итог. Покупателям стоит уточнять, как документируются и версионируются критерии оценки, как разрешаются расхождения между рецензентами и что происходит, когда требования заказчика — особенно стандарты кибербезопасности и производительности к сгенерированному коду — выходят за рамки существующих rubrics вендора. Планы инвестировать в безопасность AI и открытые бенчмарки заявлены как намерения без привязки к срокам.

Наиболее очевидный маркер — превратится ли заявленный найм инженеров и работа над бенчмарками в опубликованные переиспользуемые стандарты оценки в течение ближайшего года. Если Snorkel AI выпустит открытые бенчмарки, которые подхватят другие вендоры, компания перейдёт от продажи данных к формированию того, как рынок измеряет качество моделей, — и этот сдвиг станет виден в клиентских контрактах раньше, чем любое изменение оценки.