CoreWeave перешла от простого наращивания GPU-мощностей к комплексной оптимизации инференса ИИ, представив платформу Forge и функцию RL Rollouts на мероприятии Fully Connected. Тестирование RL Rollouts показало ускорение перезагрузки моделей в 15 раз по сравнению с базовой конфигурацией. Этот шаг важен, поскольку скорость и стоимость обслуживания моделей становятся фактором, определяющим экономику внедрений ИИ.
Платформа Forge и функция RL Rollouts
Вице-президент по продуктам и ИИ-сервисам Урваши Чоудхари описала стратегию в интервью Дейву Велланте и Джону Ферриеру из theCUBE Research. По ее словам, разработчики хотят быстрее решить задачу с высокой производительностью и управляемой стоимостью масштабирования. Поэтому CoreWeave надстраивает над инфраструктурой управляемые сервисы для обучения, постобучения и инференса. Интервью состоялось в прямом эфире студии theCUBE, принадлежащей SiliconANGLE Media.
RL Rollouts — это функция в статусе preview, построенная на фреймворке Dynamo от Nvidia и рассчитанная на обучение с подкреплением для агентных моделей. При обучении таких моделей с наградами и верификаторами инференс становится узким местом на этапе развертывания, отметила Чоудхари. Функция загружает новые чекпоинты в действующее развертывание без остановки масштабированного инференса. В итоге обучение продолжается, а инференс масштабируется параллельно, сокращая цикл итераций.
CoreWeave Forge объединяет обслуживание моделей, наблюдаемость, постобучение и оценку в одной платформе, представленной на мероприятии. Базовый доступ бесплатен, а платные тарифы добавляют дополнительные возможности для разработчиков и команд. Чоудхари заявила, что даже индивидуальный разработчик получает ту же производительность и надежность без компромиссов. В основе лежат инструменты с открытым кодом, в развитие которых компания вносит вклад для сохранения гибкости клиентов.
Что ускорение инференса дает бюджетам на ИИ
Для компаний, использующих чат-ботов, ассистентов и агентов, настройка слоев выше оборудования напрямую влияет на задержки и стоимость каждого запроса. CoreWeave называет среди мер оптимизации движок vLLM, квантованные модели и кастомные спекулятивные декодеры. Небольшая команда может начать с бесплатного уровня Forge и получить управляемое обслуживание и оценку без собственной инфраструктуры. Крупная организация может стандартизировать постобучение и наблюдаемость, масштабируя инференс отдельно от обучения.
У подхода есть ограничения, которые стоит проверить до переноса рабочих нагрузок в промышленную эксплуатацию. Ускорение в 15 раз получено в тестировании относительно базовой конфигурации, а фактический эффект зависит от размера модели, частоты чекпоинтов и схемы развертывания. Открытость инструментов не снимает зависимости от инфраструктуры CoreWeave и фреймворка Dynamo от Nvidia. Заказчикам стоит уточнить список поддерживаемых моделей, компромиссы квантования, условия надежности и отличия платных тарифов от бесплатного доступа.
Показателем подтверждения тренда станет adoption платформы Forge после запуска и переход пользователей с бесплатного доступа на платные тарифы в ближайшие 12 месяцев. Параллельным сигналом будет дальнейший рост доли инференса в нагрузках клиентов, как в примере медицинской компании из исследования theCUBE Research. Если обе тенденции сохранятся, комплексная оптимизация инференса станет стандартным требованием к облачным контрактам на ИИ.
