Cloudflare выпустила Clef, семейство моделей с открытыми весами, которые выбирают между заданными вариантами вместо генерации текста. Выпуск состоялся в рамках Birthday Week и включает мультимодальные версии на 27B и 9B параметров, а также платформу для настройки под задачи принятия решений. Это важно, поскольку маршрутизация, эскалация и сортировка обращений внутри агентов могут перейти от медленной генерации текста к быстрой классификации.

Cloudflare открыла модели принятия решений Clef для агентов

Модели Clef, задержки и совместимость

Старшая модель Clef принимает состояние и схему типизированных вопросов, а затем возвращает вероятность для каждого допустимого варианта по каждому вопросу. Она обрабатывает текст, JSON, изображения или видео и выдает типизированный результат за один проход, без свободного текста и разбора ответа. Cloudflare предлагает использовать такой вывод напрямую в логике агентов, например для маршрутизации запроса в поддержку, его эскалации или передачи решения человеку.

Конструкция рассчитана на размещение в горячем контуре агента. Мишель Чен, Алекс Рено и Кевин Флансбург поясняют, что размещение на инфраструктуре Cloudflare использует GPU на периферии сети, что снижает сетевую задержку и ускоряет решения. Заявленная связка такова: Clef отвечает за этап решения, а LLM на Workers AI выполняет действие. Cloudflare также сообщает о совместимости своего API с моделью Jev System One от Typesafe AI.

Наиболее заметный контраст между размерами дает задержка. Clef-Flash, модель на 9B параметров для чувствительных к задержке решений, показала в замерах Cloudflare медианную задержку 38,8 мс против 209,3 мс у модели Clef на 27B. Старшая модель получила зрительный кодировщик для классификации визуального контента, тогда как Jev сегодня работает только с классификацией текста, по словам авторов. Clef также предлагает контекстное окно 64k против 32k у Jev, что позволяет передавать больше входного состояния на классификацию.

Что быстрая классификация дает создателям агентов

Для компаний, занятых сортировкой обращений, выявлением ботов или маршрутизацией запросов, классификатор с откликом в миллисекунды меняет место автоматической оценки. Вместо вызова общей текстовой модели и разбора ответа команды получают структурированные вероятности, которые встраиваются в правила, пороги и маршруты эскалации. Небольшие фирмы получают готовую отправную точку для загрузки, а крупные операции могут унифицировать маршрутизацию в очередях с высоким объемом без дополнительного кода разбора.

Ограничения связаны с точностью, калибровкой уверенности и соответствием локальным данным. Обсуждение на Hacker News затронуло вопрос, образуют ли модели решений новую категорию, и риск подгонки под публичные тесты. Пользователь Reddit сформулировал проверку иначе: важно, умеет ли Clef вовремя передавать решение человеку, особенно там, где ложное срабатывание дороже пропуска, и падает ли уверенность при сдвиге данных. Одни лишь цифры тестов этого не показывают.

Показателем станет донастройка Cloudflare под сортировку обращений и классификацию ботов на исторических размеченных данных, а также адаптация под задачи клиентов через сервис дообучения. Этот сервис сначала работает при поддержке инженеров Cloudflare, а платформа самообслуживания запланирована на более поздний выпуск без твердой даты. Если настроенные версии выйдут на Workers AI, а отзывы на Hugging Face подтвердят корректное поведение при передаче решений, классификация как отдельный слой агентов станет подтвержденной практикой для бизнеса.