Серверное оборудование для бизнеса — надёжные решения для любых задач Подробнее →
Статья

NVIDIA представила Fleet Intelligence для мониторинга ИИ-кластеров

NVIDIA представила управляемую платформу Fleet Intelligence, предназначенную для мониторинга состояния крупных кластеров ускорителей, используемых в ИИ-инфраструктуре. Сервис уже доступен бесплатно для клиентов, применяющих продукты NVIDIA на базе ускорителей семейств Hopper, Blackwell и Vera Rubin.

Платформа позиционируется как независимый слой телеметрии и мониторинга, позволяющий отслеживать работу в гетерогенных инфраструктурных средах независимо от стека оркестрации или планировщика задач.

Для этого используется «лёгкий» агент, интегрируемый в хост-систему; он передаёт телеметрию с ИИ-ускорителей в облачную службу Fleet Intelligence, функционирующую в экосистеме NVIDIA GPU Cloud (NGC). Агент объединяет несколько технологий NVIDIA: службу мониторинга GPUd, инструмент управления и диагностики чипов DCGM, а также средства проверки целостности оборудования и ПО NVIDIA Attestation SDK. Код агента опубликован на GitHub, что позволяет операторам ИИ-инфраструктуры самостоятельно оценить механизмы телеметрии.

Большие возможности сбора данных и диагностики

Fleet Intelligence ведёт сбор данных о степени загруженности ускорителей, пропускной способности памяти, энергопотреблении системы, состоянии интерконнектов NVLink, температуре системы, ошибках ECC, а также показателях аппаратной составляющей.

Это помогает операторам ЦОД организовать раннее выявление недоиспользованных ресурсов и сбоев, снижая простои крупных ИИ-кластеров. Одними из основных свойств платформы стали возможности проверки целостности и аттестации на основе технологий защищённых вычислений NVIDIA Confidential Computing.

Проверка целостности и аттестация

Fleet Intelligence проводит криптографическую валидацию прошивок ИИ-ускорителей и целостность среды выполнения с помощью корневых сертификатов доверия NVIDIA, а также сервиса удалённой проверки оборудования NRAS (NVIDIA Remote Attestation Service). Платформа может подтвердить, что ускорители используют утверждённую прошивку, применяя манифесты целостности Reference Integrity Manifests, привязанные к определённым версиям vBIOS.

При разработке Fleet Intelligence компания опиралась на опыт эксплуатации облачных платформ NVIDIA DGX Cloud, использовавших сотни тысяч ИИ-ускорителей. В числе корпоративных пользователей, получивших ранний доступ к платформе, — Lambda и Iren, которые предоставляли обратную связь в ходе работ.

Стратегическое значение новой платформы

Премьера Fleet Intelligence свидетельствует, что амбиции NVIDIA простираются далеко за пределы простой разработки ИИ-ускорителей: компания развивает ПО и инструменты управления для ИИ-фабрик. Это дополнение уже имеющегося стека, включающего системы DGX, интерконнекты NVLink, сетевые продукты Spectrum-X, платформу оркестрации Mission Control и решения для защищённых вычислений.

Добавление масштабной телеметрии и предиктивной аналитики отражает растущий спрос гиперскейлеров и корпоративных клиентов на максимальное использование ресурсов ускорителей. 

Премьера платформы является отражением роста конкуренции на рынке систем мониторинга и эксплуатации ИИ-инфраструктуры.

Облачные операторы, а также AMD, Intel и другие компании строят собственные платформы для телеметрии, диагностики и управления крупными ИИ-кластерами. Возможность NVIDIA интегрировать аппаратную телеметрию, проверку надёжности прошивок и операционную аналитику напрямую в инфраструктурный стек усиливает позиции компании в роли вертикально интегрированного поставщика ИИ-инфраструктуры.

Для ответа вы можете авторизоваться