Цены токенов продолжают снижаться, а аренда GPU H100 остается стабильной или растет, согласно данным Ornn, Silicon Data и Bloomberg на август 2026 года. В a16z назвали эту картину классическим парадоксом Джевонса на рынке ИИ. Дешевые токены открывают дорогу агентам, автоматизации и новым приложениям, поэтому общий объем растет быстрее снижения удельной цены. Для поставщиков оборудования это сценарий, при котором спрос остается высоким, а мощности дефицитными.
Почему дешевые токены поддерживают спрос на оборудование
Ornn, Silicon Data и Bloomberg фиксируют два расходящихся тренда: токены инференса дешевеют, а аренда H100 не следует за ними вниз. Срез за август 2026 года показывает отсутствие параллельного снижения арендных ставок несмотря на более дешевый результат. Это расхождение важно, поскольку выручка инференса зависит от произведения объема на цену. Пока потребление растет достаточно быстро, снижение цен токенов не сокращает общие расходы на инфраструктуру.
Механизм связан с интенсивностью использования, а не только с производительностью чипов. Низкая стоимость токенов делает рентабельными ИИ-агенты, широкую автоматизацию и приложения, которые раньше были слишком дорогими. Каждая задача затем потребляет заметно больше токенов на планирование, вызовы инструментов, проверки и повторы. Агентный ИИ расходует токены с огромной скоростью, поэтому даже ограниченное внедрение может создавать крупную вычислительную нагрузку.
Источник описывает это как классический эффект эффективности: падение цены единицы расширяет общее потребление. Главный неопределенный момент — какая часть спроса исходит от людей, а какая от самих систем. Часть измеряемого спроса на вычисления может быть искусственно завышена машинным трафиком между моделями и инструментами. В этом случае даже умеренный рост человеческого использования способен вызвать непропорционально высокие потребности в оборудовании.
Что это значит для покупателей ИИ-мощностей
Для покупателей ИИ-сервисов дешевые токены снижают цену каждого запроса, но усиливают стимул автоматизировать более крупные процессы. Компании, использующие разбор обращений, обработку документов, исследование продаж или внутренних ассистентов, могут позволить более длинные запуски агентов и частые проверки. Небольшие фирмы получают доступ к сценариям, где раньше приходилось строго нормировать вызовы. В крупных компаниях главный сдвиг виден в совокупном объеме, когда много команд и процессов создают постоянное потребление токенов.
Риск связан с допущением, на котором держится вся цепочка: использование должно расти достаточно быстро, чтобы компенсировать падение цен токенов. Если спрос стабилизируется, давление перейдет от производителей чипов и поставщиков памяти к энергетическим компаниям и облачным провайдерам. Поэтому покупателям стоит отделять цену токена от полной стоимости владения, включая повторы, контроль и инфраструктуру. Также не следует считать каждое повышение эффективности постоянной экономией, поскольку расширение задач может поглотить разницу.
Практический ориентир — продолжает ли объем инференса опережать снижение цен токенов в отраслевых данных. Второй сигнал — устойчивость выручки крупных провайдеров моделей после сообщений о том, что годовая выручка OpenAI может быть ниже ранее называвшейся, что повлияло на акции США. Если рост объемов замедлится при высокой аренде, первыми изменятся условия закупок и планирование мощностей.
