NVIDIA представила Fleet Intelligence для мониторинга ИИ-кластеров
NVIDIA представила управляемую платформу Fleet Intelligence, предназначенную для мониторинга состояния крупных кластеров ускорителей, используемых в ИИ-инфраструктуре. Сервис уже доступен бесплатно для клиентов, применяющих продукты NVIDIA на базе ускорителей семейств Hopper, Blackwell и Vera Rubin.
Платформа позиционируется как независимый слой телеметрии и мониторинга, позволяющий отслеживать работу в гетерогенных инфраструктурных средах независимо от стека оркестрации или планировщика задач.
Для этого используется «лёгкий» агент, интегрируемый в хост-систему; он передаёт телеметрию с ИИ-ускорителей в облачную службу Fleet Intelligence, функционирующую в экосистеме NVIDIA GPU Cloud (NGC). Агент объединяет несколько технологий NVIDIA: службу мониторинга GPUd, инструмент управления и диагностики чипов DCGM, а также средства проверки целостности оборудования и ПО NVIDIA Attestation SDK. Код агента опубликован на GitHub, что позволяет операторам ИИ-инфраструктуры самостоятельно оценить механизмы телеметрии.
Большие возможности сбора данных и диагностики
Fleet Intelligence ведёт сбор данных о степени загруженности ускорителей, пропускной способности памяти, энергопотреблении системы, состоянии интерконнектов NVLink, температуре системы, ошибках ECC, а также показателях аппаратной составляющей.

Это помогает операторам ЦОД организовать раннее выявление недоиспользованных ресурсов и сбоев, снижая простои крупных ИИ-кластеров. Одними из основных свойств платформы стали возможности проверки целостности и аттестации на основе технологий защищённых вычислений NVIDIA Confidential Computing.
Проверка целостности и аттестация
Fleet Intelligence проводит криптографическую валидацию прошивок ИИ-ускорителей и целостность среды выполнения с помощью корневых сертификатов доверия NVIDIA, а также сервиса удалённой проверки оборудования NRAS (NVIDIA Remote Attestation Service). Платформа может подтвердить, что ускорители используют утверждённую прошивку, применяя манифесты целостности Reference Integrity Manifests, привязанные к определённым версиям vBIOS.
При разработке Fleet Intelligence компания опиралась на опыт эксплуатации облачных платформ NVIDIA DGX Cloud, использовавших сотни тысяч ИИ-ускорителей. В числе корпоративных пользователей, получивших ранний доступ к платформе, — Lambda и Iren, которые предоставляли обратную связь в ходе работ.
Стратегическое значение новой платформы
Премьера Fleet Intelligence свидетельствует, что амбиции NVIDIA простираются далеко за пределы простой разработки ИИ-ускорителей: компания развивает ПО и инструменты управления для ИИ-фабрик. Это дополнение уже имеющегося стека, включающего системы DGX, интерконнекты NVLink, сетевые продукты Spectrum-X, платформу оркестрации Mission Control и решения для защищённых вычислений.

Добавление масштабной телеметрии и предиктивной аналитики отражает растущий спрос гиперскейлеров и корпоративных клиентов на максимальное использование ресурсов ускорителей.
Премьера платформы является отражением роста конкуренции на рынке систем мониторинга и эксплуатации ИИ-инфраструктуры.
Облачные операторы, а также AMD, Intel и другие компании строят собственные платформы для телеметрии, диагностики и управления крупными ИИ-кластерами. Возможность NVIDIA интегрировать аппаратную телеметрию, проверку надёжности прошивок и операционную аналитику напрямую в инфраструктурный стек усиливает позиции компании в роли вертикально интегрированного поставщика ИИ-инфраструктуры.