Компания Iterate Studio Inc. выпустила Lifeboat — движок инференса больших языковых моделей со встроенными конфиденциальными вычислениями, который размещает на каждом графическом процессоре в два-шесть раз больше одновременных сессий ИИ-агентов. В собственных тестах компании на одном GPU Nvidia RTX PRO 6000 Blackwell с моделью Qwen 30B-A3B движок удержал 2048 одновременных сессий, причем все запросы были выполнены. Для банков, страховщиков и медицинских организаций это важно, поскольку обещает сократить расходы на GPU и оставить данные внутри собственной инфраструктуры без перехода на сторонние облачные сервисы с оплатой за токены.
Как Lifeboat справляется с нагрузкой агентов на память
Lifeboat нацелен на узкое место памяти, которое агенты создают в масштабе. Вопрос чат-боту обычно вызывает один вызов модели, тогда как агент при решении одной задачи может сделать десятки вызовов, а его контекстное окно растет с каждым шагом и быстро заполняет key-value cache. По данным Iterate. ai, стандартные движки инференса могут останавливаться уже при четырех-пяти одновременных запросах с длинным контекстом. Достигнув этого предела, команды обычно покупают дополнительные GPU либо переносят нагрузку наружу и передают данные третьей стороне. Сооснователь и технический директор Брайан Сатианатан представил Lifeboat как способ запускать агентов на собственных данных внутри периметра компании.
Движок сочетает честное планирование и контроль допуска, поэтому каждая сессия получает свою долю мощности GPU, а тяжелый агент обработки документов не вытесняет интерактивные задачи. По заявлению компании, оптимизации key-value cache удваивают его эффективную емкость, а веса модели сохраняют полную точность. В моделях класса mixture-of-experts загружаются только те эксперты, которые нужны конкретному агенту, а не весь набор. Каждая сессия также работает в собственной защитной капсуле с фильтрацией, бюджетами токенов и изолированным исполнением. В совокупности эти механизмы закрывают вопросы пропускной способности, изоляции и стоимости в одном развертывании.
Релиз выходит на фоне растущего корпоративного спроса на агентов, работающих с длинными документами и многошаговыми задачами. Такой сценарий отличается от одношагового чата и создает длительную нагрузку на память, планирование и безопасность, а не только на качество модели. Центры обработки данных и так называемые neo-cloud сталкиваются с тем же ограничением, поскольку удвоение числа сессий на карту возвращает мощность без новых стоек и энергозатрат. Сооснователь и генеральный директор Джон Нордмарк посоветовал сначала проверить возможности имеющихся GPU, прежде чем покупать новые. Ранний доступ к Lifeboat собрал тысячи загрузок за несколько дней, а сейчас движок уже доступен для всех.
Что это меняет для компаний, использующих ИИ-агентов
Для операционных команд практический эффект заключается в большей плотности агентов на уже купленном оборудовании. Компания сообщила о 8714 токенах в секунду с включенными оптимизациями против 4965 без них при вдвое большем числе одновременных сессий в этом сравнении. В тесте под давлением памяти со 128 сессиями и запросами по 18000 токенов Lifeboat удержал время до первого токена на уровне 99-го перцентиля в 1,5 секунды против 189 секунд у базового варианта. Небольшая компания сможет пилотировать агентов с длинным контекстом на одном-двух серверах, а крупная организация — отложить закупки и оставить чувствительные нагрузки в своем контуре. Бесплатная лицензия Developer License покрывает некоммерческое и оценочное использование на двух серверах инференса в пределах одного узла.
Второе следствие касается регулируемых данных и выбора поставщика. Старшая редакция Confidential Computing не обслуживает запрос, пока не пройдена аппаратная аттестация, охватывающая доверенные среды исполнения процессоров Advanced Micro Devices и Intel, а также режим конфиденциальных вычислений Nvidia на H100, B200, GB300 и других поддерживаемых GPU. Веса модели изолируются внутри доверенной среды исполнения и остаются зашифрованными во время использования — как в облачной конфиденциальной виртуальной машине, так и на собственном оборудовании заказчика. Покупателям все же следует проверить покрытие аттестации для конкретных чипов, облачной конфигурации и требований комплаенса. Платные тарифы доступны с бесплатным семидневным периодом без банковской карты: Standard стоит 49,99 доллара в месяц, а Confidential Computing — 499,99 доллара в месяц.
Признаком подтверждения тренда станет независимое подтверждение плотности сессий на реальных производственных смесях задач, а не только в контролируемых тестах. Если предприятия или облачные операторы покажут устойчивый двукратный или больший рост параллельности при длинном контексте и стабильной задержке, подход перейдет из категории бенчмарка в операционную практику. Компания также обсудила платформу Generate и партнерство с NetApp в студии theCUBE на конференции NetApp Insight. Эти внедрения покажут, сокращают ли эффективность памяти и аттестация сроки закупок для регулируемых отраслей.
