Генеральный директор OpenAI Сэм Альтман на Dev Day во вторник раскрыл Decisions API — инструмент, который позволяет модели Luna выбирать из заранее заданного набора вариантов вместо свободной генерации текста. Продукт близок к Jev, выпущенной в начале этого месяца компанией TypeSafe AI как быстрый классификатор для автоматизации ПО. Новость важна для бизнеса, поскольку контроль агентов остается дорогим: в одном демо мониторинг стоил 2,94 доллара с Jev против 372 долларов с передовой LLM.
Чем Decisions API похож на подход Jev
TypeSafe AI выпустила Jev в начале этого месяца как усиленный классификатор на базе большой языковой модели. Разработчик передает набор вариантов, а модель возвращает их в виде вероятностей — дешево и на высокой скорости. Альтман описал Decisions API похожими словами, назвав примерами категории для классификации изображений или разные варианты поведения агентов. Продукт вышел в ограниченном предварительном доступе, а разработчики пока не успели публично проверить его в работе.
По словам Альтмана, концентрация модели на узком выборе делает ее крайне быстрой и сохраняет понимание изображений, широкую языковую поддержку и защитные механизмы. Такая конструкция заменяет открытую генерацию ограниченным выбором, что подходит для повторяющихся решений в ПО. В TypeSafe называют ту же идею совместимостью с System One, то есть быстрой интуитивной оценкой, а не вдумчивым рассуждением System Two. Общая логика — оставить тяжелые модели для сложных задач, а рутинный выбор передать дальше.
Анонс укладывается в более широкий сдвиг: использовать общие модели для каждой задачи ПО медленно и дорого. По данным источника, разработчики уже дополняют LLM моделью Jev и получают более быструю и дешевую работу. Decisions API — не единственное подобное предложение: такие модели выпускают и другие стартапы, а OpenAI вряд ли станет последней крупной технологической компанией. Обсуждение в X показало явный интерес, хотя прямых сравнений точности и калибровки пока нет.
Что дешевые модели решений меняют в работе агентов
Для компаний, использующих агентов, практический эффект — более дешевый слой проверки и управления поведением в масштабе. Генеральный директор TypeSafe Диогу Алмейда, бывший инженер OpenAI, названный в материале одним из создателей обучения с подкреплением, пошутил в X про начало войн клонов. Он отметил, что интерес OpenAI говорит о будущем разработки в логике System One. Небольшие команды получают классификацию, маршрутизацию и проверку правил без оплаты каждого вызова по тарифу передовой модели.
Ограничения связаны не со скоростью, а с качеством решений, поскольку дешево и быстро само по себе не дает полезных ответов. Алмейда заявил, что компания опирается на синтетические данные для статистически пригодных результатов, а главной целью назвал интеллект на доллар. Ключевой открытый вопрос — насколько калибровка каждой такой модели соответствует реальным условиям. Поэтому покупателям стоит проверять точность на своих категориях, спрашивать о методике калибровки и не считать preview аналогом Jev до независимых тестов.
Конкретный сценарий — мониторинг агентов, когда отдельная модель отслеживает нежелательные действия ценой заметных вычислений после инцидентов с некорректным поведением агентов в открытом интернете. Специалист по кибербезопасности Шапор Нагибзаде, возглавляющий QueryStory, на хакатоне в прошлые выходные собрал демо, которое сверяет каждое действие агента с поставленной задачей. Демо блокирует действия с высокой уверенностью во вреде, отправляет спорные случаи на проверку и разрешает остальные. Автор считает, что такой контроль мог остановить инцидент Hugging Face, а Jev достаточно дешев для проверки каждого действия.
