Исследование Lava, опубликованное 8 октября, выявило около 2100 общедоступных хостов NVIDIA DCGM Exporter, которые без аутентификации отдавали данные более чем о 12000 уникальных GPU. В ходе работы исследователь Майкл Катчинский обнаружил серьезную уязвимость, позволяющую неаутентифицированному атакующему исчерпать ресурсы и остановить мониторинг GPU. NVIDIA присвоила проблеме номер CVE-2026-47483, оценку 8.2 High и выпустила обновление. Этот случай важен, потому что сервисы наблюдения за дорогими ИИ-вычислениями сами нуждаются в защите.

Lava нашла 2100 открытых GPU-мониторов и уязвимость NVIDIA

Как Lava посчитала открытые хосты и нашла уязвимость

Lava провела четыре сканирования с марта по май 2026 года, поэтому итоги описывают наблюдения за этот период, а не текущее число систем, которые остаются открытыми сегодня. Хосты без аутентификации отдавали телеметрию GPU, включая ускорители для центров обработки данных H100, H200 и Blackwell Ultra B300, а также системы на RTX 4090 и 5090. Lava оценила стоимость замеченного оборудования более чем в 100 млн долларов по примерным рыночным ценам, и эта цифра описывает ценность техники, а не убытки от атаки. Около четверти открытых хостов DCGM также открывали внутренние Go-эндпоинты профилирования. Lava воспроизвела исчерпание ресурсов в контролируемой среде и не утверждала, что найденные организации были взломаны или что данные моделей украдены.

DCGM — это Data Center GPU Manager, а DCGM Exporter собирает отдельные поля телеметрии GPU и отдает их в формате, который может потреблять Prometheus. Его эндпоинт метрик обычно снабжает системы мониторинга данными о температуре, загрузке, использовании памяти, энергопотреблении и ошибках узлов GPU. NVIDIA локализует уязвимость в эндпоинтах экспортера /debug/pprof, где одновременные неаутентифицированные запросы профилирования могут вызвать неконтролируемое потребление ресурсов с возможным отказом в обслуживании и раскрытием информации. Сначала Lava подозревала ошибку конфигурации операторов, затем воспроизвела поведение на официальном контейнере NVIDIA. Сбой лишает видимости состояния GPU, а нагрузка на CPU и память может затронуть задачи обучения или инференса на том же сервере.

Публичная телеметрия не раскрывает веса моделей, обучающие данные или запросы, но все равно служит источником инвентаризации и разведки. Модели оборудования, детали ПО и операционные показатели помогают постороннему сузить круг того, что содержит среда и когда она активна. Повторные замеры могут указать на периоды загрузки и регулярную активность, не доказывая, какая именно модель обучается или обслуживается. Отдельно Lava сообщила о 12096 общедоступных хостах Node Exporter, которые раскрывают данные о сервере и операционной системе, а не телеметрию GPU. Эти подсчеты нельзя смешивать с числом хостов, подтвержденно уязвимых к CVE-2026-47483. Картина соответствует более широкому пробелу, когда контроль доступа к моделям автоматически не закрывает сервисы метрик рядом с моделью.

Что это значит для операторов ИИ-инфраструктуры

Компании с нагрузками на GPU получают прямое основание включить эндпоинты мониторинга в периметр безопасности. Обновленный, но по-прежнему публичный экспортер может и дальше раскрывать посторонним типы оборудования, загрузку и режимы активности. Небольшие команды с несколькими узлами на RTX рискуют показать график работы и версии ПО, а крупные операторы парков H100, H200 или B300 рискуют картированием значительных мощностей стоимостью в миллионы. Перенос метрик, API и интерфейсов профилирования в частные сети с аутентификацией меняет картину за считанные дни. Распределение ответственности между инфраструктурой провайдера и сервисами, развернутыми клиентом, не дает эндпоинту зависнуть между двумя командами.

Установка исправления и ограничение доступа решают разные задачи, и обе нуждаются в проверке. NVIDIA указывает DCGM Exporter 4.8.2 как обновленную версию, а также перечисляет DCGM 4.5.3, причем операторам следует сверить бюллетень для поддерживаемой связки под свое развертывание. Обновление устраняет раскрытую уязвимость, но само по себе не закрывает эндпоинт метрик. Модель безопасности Prometheus предостерегает от открытия HTTP-эндпоинтов компонентов в публичных сетях без надлежащих мер, включая метрики и Go-интерфейсы профилирования. Сбой экспортера не обязательно останавливает нагрузку GPU, поэтому при пропаже метрик во время замедления нужно проверять, не отказала ли сама система наблюдения.

Подтверждением станут проверки текущих развертываний, а не новые сканирования исторических данных. Конкретный маркер — проверят ли операторы нынешнюю доступность, применят ли поддерживаемую связку экспортера и DCGM и удержат ли внутренние сервисы наблюдения внутри доверенного контура. NVIDIA указывает Катчинского как автора сообщения, а ее бюллетень дает командам путь устранения проблемы. Если сбои мониторинга перестанут совпадать с публичными эндпоинтами, урок о защите систем измерения будет усвоен.