1 октября 2026 года Cerebras Systems сообщила о пятикратном росте пропускной способности инференса в ранних тестах благодаря дизагрегации при том же числе систем Cerebras и без снижения скорости генерации токенов. Сообщение опубликовано в корпоративном блоге в статье Исаака Тая и Чжэньвэя Гао Disaggregated Inference From the Ground Up, открывающей запланированную серию. Для бизнеса это важно, поскольку рост пропускной способности получен без расширения парка оборудования на базе wafer-scale чипов.
Гетерогенная дизагрегация в ранних тестах Cerebras
Компания отметила, что в традиционной объединенной системе рост мощности требовал дополнительного оборудования, а новый подход задействует ускорители партнеров для обработки промптов при неизменном парке WSE. Схема в статье показывает системы AWS Trainium и AMD Helios Instinct GPU в качестве вариантов prefill перед пулом декодирования Cerebras. Cerebras заявила об объявленных партнерствах с несколькими производителями оборудования для выпуска большего объема сверхбыстрых токенов. Результат представлен как раннее тестирование, а не как итоговый производственный бенчмарк.
Дизагрегация разделяет инференс на отдельные аппаратные пулы для prefill и decode, позволяя независимо подбирать мощность, пакетную обработку и планирование для каждой стадии. После построения KV cache в ходе prefill это состояние запроса передается в пул декодирования и загружается в память перед продолжением генерации, тогда как веса модели уже загружены в обоих пулах. Операторы могут выделить больше мощности под prefill при жестких требованиях к time-to-first-token либо расширить пул decode для ровной потоковой выдачи. В статье говорится о сетевых и координационных издержках передачи, а также о возможном простое одного из пулов при несоответствии мощностей спросу.
Объяснение строится от арифметической интенсивности, определяемой как число операций с плавающей точкой, деленное на число байтов между памятью и вычислительными блоками. Сложение двух матриц дает 1 FLOP на 6 байтов, или 0,167 FLOP на байт, причем соотношение не меняется с ростом матриц, а матричное умножение повторно использует загруженные значения для большего числа выходов. Во время prefill промпты объемом в тысячи или сотни тысяч токенов обрабатываются как крупные параллельные матричные операции между фиксированными весами и входными токенами. Во время decode токены создаются по одному с повторным использованием ключей и значений из KV cache, однако веса объемом в сотни гигабайтов или терабайты по-прежнему перемещаются для каждого токена.
Что разделение prefill и decode дает пользователям ИИ
Для компаний, использующих чат-ботов, ассистентов и обработку документов, раздельные пулы позволяют защитить активные ответы от задержек, когда вычислительно тяжелый prefill выполняется на общем оборудовании. Планировщикам уже не нужно выбирать внутри одной очереди между быстрым первым токеном, ровной потоковой выдачей и общей пропускной способностью. Пакетирование по-прежнему позволяет совместным запросам делить чтение весов, но крупные пакеты могут удлинять каждый шаг decode, поэтому суммарная пропускная способность растет при замедлении выдачи для каждого пользователя. Независимые пулы дают бизнесу возможность выбрать приоритет: быстрый первый ответ для поддержки или стабильную генерацию длинных текстов.
Агентные приложения выглядят ближайшим кандидатом на выгоду, поскольку длинные многошаговые сценарии наращивают контекст между вызовами модели и задержки накапливаются на каждом шаге. Небольшая компания, покупающая инференс через API, может сравнивать поставщиков по числу выходных токенов в секунду на длинных входах, например 1669 у Cerebras для GPT-oss-120B при 10000 входных токенов против 708 у SambaNova и 475 у Groq. Крупный оператор с собственным парком серверов иначе оценит простой мощностей, передачу кэша между соседними машинами или регионами и раздельные правила масштабирования. В обоих случаях опубликованный показатель в 5 раз сам по себе не гарантирует снижения стоимости токена.
Ожидается, что следующие части серии раскроют аппаратный и программный стеки, а также экономические компромиссы внедрения дизагрегированного инференса в масштабе. Подтверждением тренда станут конкретные детали внедрения: названные партнерские конфигурации, измеренные издержки передачи и цены на раздельные мощности prefill и decode. Если эти раскрытия покажут устойчивый рост пропускной способности без замедления потоковой выдачи токенов, гетерогенные пулы инференса станут практичным вариантом закупок для высоконагруженных ИИ-систем.
