Характеристики NVIDIA DGX H100 Новый
Описание NVIDIA DGX H100
NVIDIA DGX H100 — интегрированная вычислительная система для обучения, дообучения и инференса крупных моделей искусственного интеллекта, ускоренной аналитики и высокопроизводительных вычислений (HPC). Платформа ориентирована на организации, которым требуется собственная управляемая инфраструктура для постоянной работы с ресурсоемкими нагрузками.
DGX H100 объединяет ускорители, процессорную подсистему, высокоскоростную сеть, локальное хранение и поддерживаемый программный стек NVIDIA в единой архитектуре. По сравнению с самостоятельной сборкой многопроцессорного GPU-сервера такой подход сокращает объем интеграции компонентов и создает стандартизированную основу для корпоративной платформы ИИ. Систему можно использовать как автономный узел или включить в масштабируемый вычислительный кластер.
Вычислительная архитектура для крупных моделей
В DGX H100 установлены восемь ускорителей NVIDIA H100 Tensor Core в исполнении SXM. Каждый GPU оснащен 80 ГБ памяти HBM3, поэтому ее совокупный объем составляет 640 ГБ. Память физически распределена между восемью ускорителями и не образует единого общего пула: эффективность системы зависит от поддержки параллелизма модели, данных или вычислительного конвейера и от оптимизации обмена между GPU.
H100 построен на архитектуре NVIDIA Hopper и оснащен тензорными ядрами четвертого поколения. NVIDIA Transformer Engine адаптивно использует FP8 и 16-битные форматы с плавающей точкой, чтобы ускорять операции, характерные для трансформерных моделей, при сохранении требуемой точности. Это делает DGX H100 подходящей для больших языковых и мультимодальных моделей и других нейросетей с высокой вычислительной сложностью.
Четыре коммутатора NVIDIA NVSwitch третьего поколения формируют полносвязный домен из восьми GPU через NVLink четвертого поколения. Двунаправленная пропускная способность NVLink достигает 900 ГБ/с на каждый H100. Такая фабрика уменьшает задержки при передаче тензоров, синхронизации параметров и выполнении коллективных операций, позволяя эффективнее задействовать несколько ускорителей в одной задаче.
Два процессора Intel Xeon Platinum 8480C предоставляют 112 физических ядер суммарно, а 2 ТБ системной памяти обслуживают подготовку данных, контейнеры, служебные процессы и CPU-зависимые этапы вычислительных конвейеров.
Основные сценарии применения
- Обучение и дообучение моделей. Полное обучение, тонкая настройка и адаптация больших языковых, мультимодальных и отраслевых моделей на корпоративных данных.
- Генеративный ИИ и промышленный инференс. Интеллектуальные помощники, сервисы генерации, семантический поиск, RAG-системы и пакетная обработка запросов.
- Компьютерное зрение, речь и рекомендации. Видеоаналитика, распознавание и синтез речи, классификация, ранжирование и персонализация.
- Аналитика и HPC. Биоинформатика, молекулярное моделирование, инженерные симуляции, научные расчеты и смешанные конвейеры ИИ и HPC.
- Совместное использование ресурсов. Multi-Instance GPU (MIG) второго поколения разделяет физический H100 на аппаратно изолированные экземпляры с выделенными вычислительными ресурсами, кэшем и памятью. При профиле 1g.10gb на одном H100 доступно до семи экземпляров MIG, что помогает распределять ресурсы между командами и задачами, которым не требуется целый GPU.
NVIDIA DGX H100 в корпоративной инфраструктуре
NVIDIA DGX H100 предназначена для проектов, в которых задачи искусственного интеллекта выходят за рамки отдельных экспериментов и требуют постоянного доступа к производительным GPU-ресурсам. Система может стать единым вычислительным контуром для исследовательских подразделений, инженеров машинного обучения и разработчиков прикладных сервисов, поддерживая работу с моделями на этапах подготовки, тестирования и промышленной эксплуатации.
Платформу можно развернуть как самостоятельный узел и в дальнейшем расширять инфраструктуру по мере роста моделей, объема данных и числа пользователей. При планировании проекта необходимо учитывать не только требуемую вычислительную производительность, но и пропускную способность сети и внешнего хранилища, характер распределения нагрузок, требования к доступности сервисов и готовность центра обработки данных к размещению оборудования.
DGX H100 формирует стандартизированную основу для корпоративных проектов ИИ и HPC, сокращает объем самостоятельной интеграции аппаратных и программных компонентов и упрощает дальнейшее масштабирование. Наибольшую эффективность система обеспечивает в составе комплексного решения, в котором вычислительная платформа, программная среда, данные и инженерная инфраструктура спроектированы под конкретные рабочие сценарии.