Для действующей инфраструктуры может подойти архитектура Hopper, в частности H100 если достаточно 640 ГБ памяти GPU, а если нет - H200 лучше справляется с крупными моделями, длинным контекстом и большим KV-кэшем. DGX B200 — наиболее сбалансированный переход на Blackwell для обучения, дообучения и промышленного вывода моделей. DGX B300 нужен там, где критичны 288 ГБ на каждом GPU, модели с поддержкой рассуждения и высокая нагрузка в несколько потоков. Однако преимущества топовых моделей раскрываются только при готовности сети, электропитания, охлаждения, хранилища и конечно же команды эксплуатации.
Серверы NVIDIA DGX
Четыре DGX-сервера и три этапа развития
DGX H100 и H200 относятся к поколению Hopper. Оба сервера содержат восемь ускорителей, соединённых NVLink и NVSwitch, но H200 получил значительно больше памяти HBM3e. Поэтому переход с H100 на H200 прежде всего решает проблему объёма модели и пропускной способности памяти, а не меняет всю архитектуру.
DGX B200 — переход на Blackwell: больше памяти, пятое поколение NVLink/NVSwitch и аппаратная поддержка FP4. DGX B300 использует Blackwell Ultra. Его ключевое отличие от B200 — 288 ГБ памяти на GPU вместо 180 ГБ, а также более высокая плотная производительность FP4 и сеть до 800 Гбит/с на адаптер.
Не путать DGX B200 и B300 с NVL72
DGX B200 и B300 — отдельные восьмиускорительные серверы высотой 10U. DGX GB200 NVL72 и GB300 NVL72 — стоечные системы с десятками ускорителей и другой архитектурой соединений. Их результаты бенчмарков, энергопотребление и требования к сети нельзя автоматически переносить на один DGX.
Основные характеристики
| Параметр | DGX H100 | DGX H200 | DGX B200 | DGX B300 |
|---|---|---|---|---|
| Архитектура | Hopper | Hopper | Blackwell | Blackwell Ultra |
| GPU | 8 × H100 SXM | 8 × H200 SXM | 8 × B200 SXM | 8 × B300 SXM |
| Память одного GPU | 80 ГБ | 141 ГБ | 180 ГБ | 288 ГБ |
| Общая память GPU | 640 ГБ | 1 128 ГБ | 1 440 ГБ | 2 304 ГБ |
| FP8 | около 32 Пфлопс с разреженностью | около 32 Пфлопс с разреженностью | 72 Пфлопс с разреженностью | 72 Пфлопс с разреженностью |
| FP4 | нет нативного Blackwell FP4 | нет нативного Blackwell FP4 | 144/72 Пфлопс, разреженный/плотный режим | 144/108 Пфлопс, разреженный/плотный режим |
| Соединение GPU | NVLink/NVSwitch 4 | NVLink/NVSwitch 4 | NVLink/NVSwitch 5 | NVLink/NVSwitch 5 |
| Кластерная сеть | до 8 × 400 Гбит/с | до 8 × 400 Гбит/с | до 8 × 400 Гбит/с | до 8 × 800 Гбит/с |
| Оперативная память | 2 ТБ | 2 ТБ | 2 ТБ, до 4 ТБ | 2 ТБ, до 4 ТБ |
| Высота | 8U | 8U | 10U | 10U |
| Максимальная мощность | 10,2 кВт | 10,2 кВт | 14,3 кВт | до 15 кВт |
Петафлопсы нельзя использовать как простой рейтинг. FP8 и FP4 — разные форматы, а показатели с разреженностью достижимы только при подходящей структуре данных и программной поддержке. Например, B200 и B300 имеют одинаковые 144 Пфлопс FP4 с разреженностью, но в плотном режиме это 72 и 108 Пфлопс.
Для B300 встречаются обозначения 2,1 и 2,3 ТБ. Точный физический объём — восемь модулей по 288 ГБ, то есть 2 304 ГБ; различие связано с округлением и способом пересчёта единиц.
Что изменилось от Hopper к Blackwell Ultra
Объём одного GPU важнее общей суммы
Память восьми ускорителей не превращается в полностью прозрачный единый массив. Модель распределяется между GPU, а данные передаются через NVLink и NVSwitch. Поэтому 288 ГБ на одном B300 помогают:
- размещать крупные слои и экспертов без лишнего дробления;
- уменьшать тензорный параллелизм и число обменов;
- оставлять больше места под KV-кэш и буферы;
- запускать несколько экземпляров модели или адаптеров;
- снижать фрагментацию памяти.
В таких сценариях ёмкость одного ускорителя может быть важнее пиковой вычислительной мощности всей системы.
FP4 ускоряет не любую модель
BF16, FP16 и FP8 остаются важными для обучения. FP4 в Blackwell ориентирован главным образом на высокопроизводительный вывод и отдельные операции обучения. Для его использования нужны корректно квантованные веса, поддерживающий движок и проверка качества результата.
Снижение точности может ухудшить генерацию или работу отдельных слоёв. Поэтому сравнивать H200 и B300 только по FP4-производительности нельзя.
Сеть B300 требует новой инфраструктуры
B300 использует восемь ConnectX-8 со скоростью до 800 Гбит/с. Это важно для распределённого обучения и обслуживания моделей на нескольких узлах, но не даст эффекта в старой 400-гигабитной фабрике. Переход может потребовать новых коммутаторов, оптики, кабелей, настроек RDMA и более быстрого хранилища.
Сколько памяти действительно требуется LLM
Для первичной оценки весов можно использовать приближение:
- BF16 или FP16 — около 2 байт на параметр;
- FP8 или INT8 — около 1 байта;
- 4-битное хранение — около 0,5 байта.
Модель на 70 млрд параметров в BF16 занимает примерно 140 ГБ только под веса, а модель на 400 млрд — около 800 ГБ. Реальный расход выше из-за служебных данных, выравнивания и рабочих областей библиотек.
Размер файла модели — не полный расчёт
Во время вывода память также занимают:
- KV-кэш для уже обработанных токенов;
- входной и создаваемый контекст;
- параллельные последовательности;
- временные тензоры и буферы CUDA;
- пакетная обработка;
- адаптеры LoRA;
- резерв системы оркестрации.
KV-кэш быстро растёт при длинном контексте и большом числе пользователей. Поэтому модель может запускаться в одиночном тесте, но не выдерживать промышленную нагрузку.
Дообучение требует больше памяти
При полном fine-tuning нужно хранить веса, градиенты, активации и состояния оптимизатора. Суммарный объём во много раз превышает размер весов. LoRA и QLoRA снижают требования, поскольку обучают небольшие дополнительные матрицы, а базовую модель можно хранить в пониженной точности.
Фраза «модель помещается на H200» не означает, что на нём возможно её полное дообучение. Нужно учитывать длину последовательности, размер пакета, метод оптимизации и схему распределения между GPU.
DGX для обучения больших моделей
H100 и H200
Hopper подходит, если компания уже использует совместимые версии CUDA, контейнеры и библиотеки. Расширение существующего кластера обычно проще, чем одновременная смена ускорителей, сети и программной среды.
H200 предпочтительнее H100, когда:
- модели не хватает 80 ГБ на одном GPU;
- приходится уменьшать пакет;
- длинные последовательности занимают слишком много памяти;
- данные часто выгружаются в оперативную память;
- нужен больший резерв под активации.
Если задача уверенно помещается в 640 ГБ и хорошо масштабируется, замена H100 только ради нового поколения может не окупиться.
B200 и B300
B200 подходит для нового универсального кластера, где обучение сочетается с дообучением и выводом. Это разумный выбор, если организация готова обновить программный стек, но ещё не нуждается в 288 ГБ на каждом GPU.
B300 оправдан для моделей с длинным контекстом, крупных смесей экспертов и полного дообучения. Особенно он может быть полезен в случае, когда большая память позволяет разместить модель на меньшем числе узлов или уменьшить степень параллелизма.
При многоузловом обучении ограничением могут стать сеть, чтение датасета, коллективные операции и запись контрольных сохранений. Если GPU простаивают в ожидании данных, переход с B200 на B300 не обеспечит пропорционального ускорения.
LoRA, QLoRA и полное дообучение
Для LoRA и QLoRA часто достаточно H100 или H200. H200 удобнее для крупной модели, длинного контекста, нескольких адаптеров и более крупного пакета.
B200 лучше подходит многопроектной среде: дополнительная память позволяет параллельно запускать больше экспериментов и реже выгружать данные в системную память. B300 нужен, если требуется:
- полное дообучение крупных LLM;
- несколько тяжёлых экспериментов одновременно;
- максимальная длина последовательности;
- крупные пакеты;
- сокращение числа узлов на одну задачу.
При низкой загрузке преимущество B300 не окупается. Несколько более доступных серверов иногда удобнее разделять между командами и проще поддерживать резервирование и отказоустойчивость.
Серверы NVIDIA DGX
Какой DGX выбрать для inference
Вывод модели состоит из двух стадий. Сначала сервер обрабатывает весь входной запрос; затем токены ответа создаются последовательно. Первая стадия сильнее зависит от вычислительной мощности и длины входа, вторая — от пропускной способности памяти и KV-кэша.
Поэтому общего показателя токенов в секунду недостаточно. Для сервиса важны:
- задержка до первого токена;
- задержка между следующими токенами;
- число одновременных запросов;
- длина входа и ответа;
- стабильность при пиковых нагрузках.
H100 против H200
H100 подходит для небольших и средних моделей, умеренного контекста и уже работающей инфраструктуры. H200 лучше, когда растёт KV-кэш, увеличивается число параллельных последовательностей или модель приходится слишком сильно дробить между GPU.
Поскольку обе системы относятся к Hopper, переход на H200 может увеличить вместимость без полной смены программной среды.
B200 против B300
B200 — сбалансированная Blackwell-платформа для массового вывода и смешанной нагрузки. B300 раскрывается, когда одновременно присутствуют крупная модель, длинный контекст и много пользователей. Это характерно для моделей рассуждения и ИИ-агентов с длинными цепочками действий.
Большая память позволяет держать больше KV-кэша и уменьшать дробление модели. Но результат зависит от движка вывода, квантования и библиотек: старый контейнер может не использовать преимущества Blackwell Ultra.
RAG и ИИ-агенты
RAG включает создание поискового представления, обращение к базе, повторное ранжирование, сбор контекста и генерацию. Иногда добавляются вызовы инструментов и повторные циклы рассуждения.
GPU ускоряет генерацию и часть ранжирования, но задержка может определяться CPU, RAM, NVMe, сетью или базой данных. Медленный поиск не станет быстрее после замены H200 на B300.
H100/H200 подходят для зрелых RAG-систем с контролируемой нагрузкой. B200 — для новой промышленной платформы, где генерация и дообучение работают вместе. B300 полезен при длинном контексте, множестве агентов и большом числе одновременных цепочек.
Центральные процессоры DGX участвуют в подготовке данных и вводе-выводе. Эти операции близки к задачам, которые выполняют серверы на Intel Xeon, поэтому CPU нельзя считать второстепенным компонентом RAG-платформы.
Многопользовательская ИИ-лаборатория
В лаборатории важна доля полезной загрузки, а не рекорд одной модели. Ресурсы распределяют через контейнеры, Slurm или Kubernetes; поддерживаемые режимы MIG позволяют разделять GPU на изолированные вычислительные экземпляры.
Нужно учитывать ограничения памяти, приоритет заданий, длительность экспериментов, конкуренцию за NVMe и сеть, а также фактически использованные GPU-часы.
B300 удобен, если несколько команд регулярно запускают крупные модели. При нерегулярной нагрузке несколько H100/H200 или даже менее плотных классических GPU-серверов могут быть практичнее: проекты меньше мешают друг другу, а отказ одного узла не останавливает всю лабораторию.
Один DGX или кластер
Один сервер проще развернуть и обслуживать. Он подходит для одной крупной модели или обучения, которое помещается в память узла. Внутренний NVLink обеспечивает быстрый обмен без внешней сети.
Ограничения одиночного DGX:
- обслуживание требует остановки или переноса нагрузки;
- отказ затрагивает все размещённые модели;
- пиковая нагрузка ограничена одной системой;
- нельзя независимо масштабировать стадии обработки.
Кластер позволяет создавать реплики, распределять обучение и разделять обработку входа и генерацию. Для этого нужны балансировка, общее хранилище и InfiniBand либо Ethernet с RDMA.
Удвоение числа серверов редко удваивает скорость: часть времени уходит на синхронизацию и обмен тензорами. Эффективность зависит от модели, параллелизма и сетевой топологии.
Электропитание, охлаждение и размещение
DGX H100/H200 занимают 8U и потребляют до 10,2 кВт. B200/B300 занимают 10U; максимальная мощность составляет 14,3 и 15 кВт. Для стойки нужно учитывать:
- доступную мощность и резерв;
- распределение по PDU и фазам;
- количество силовых соединений;
- тепловую плотность и воздушный поток;
- температуру входящего воздуха;
- массу оборудования.
Четыре B300 физически занимают 40U, но их максимальная нагрузка приближается к 60 кВт без учёта сети и хранилища. Одного свободного места в стойке недостаточно, если площадка не способна отвести такое количество тепла.
B300 доступен с подключением к PDU или шинопроводу постоянного тока. Версия с блоками питания использует двенадцать модулей и резервирование N+N. Масса системы с блоками питания достигает примерно 168 кг, поэтому для монтажа нужны подходящие направляющие и подъёмное оборудование.
Где теряется производительность: сеть и хранилище
Внешняя сеть становится критичной, когда обучение или модель распределены между несколькими DGX. B300 предлагает до восьми подключений по 800 Гбит/с, но для них нужны совместимые коммутаторы, кабели и настройки. В 400-гигабитной фабрике часть возможностей ConnectX-8 не используется.
Хранилище должно обслуживать датасеты, версии моделей, контрольные сохранения, журналы, базы знаний и резервные копии. Локальные NVMe DGX удобны как быстрый кэш, но не заменяют общее отказоустойчивое хранилище с достаточной производительностью как самого хранилища, так и доступа к нему.
Если данные читаются медленно или контрольные сохранения надолго блокируют обучение, GPU простаивают. Поэтому сеть и хранилище рассчитывают вместе с вычислительными узлами, а не после их покупки.
Совместимость программного стека
Hopper привлекателен зрелыми драйверами, готовыми контейнерами и библиотеками. Это снижает риск миграции, особенно при собственных расширениях CUDA.
Для Blackwell и Blackwell Ultra нужно проверить:
- версии CUDA и драйверов;
- контейнерные образы;
- библиотеки распределённых вычислений;
- поддержку FP4 и FP8;
- собственные вычислительные ядра;
- движок вывода и оркестрацию.
Совместимость не означает одинаковую эффективность. Приложение может запуститься на B300, но не использовать FP4, улучшения механизма внимания или оптимальную схему обмена. Сравнивать следует полный сценарий: загрузку модели, задержку, скорость генерации, расход памяти и масштабирование.
Полная стоимость владения
Кроме сервера в проект входят сеть, оптика, PDU, модернизация питания, охлаждение, стойки, хранилище, поддержка, электроэнергия и работа команды.
Платформы лучше сравнивать не только по стоимости покупки, но и по эксплуатационным расходам. Подойдут следующие метрики стоимости:
- час реально загруженных GPU;
- цикл обучения;
- миллион токенов при заданной задержке;
- обслуживание нужного числа пользователей;
- обучение команды;
- простой и восстановления после сбоя.
B300 может быть экономичнее, если заменяет несколько узлов или сокращает межсерверный обмен. Но при загрузке 20–30% дополнительные возможности могут не покрыть расходы на более современную платформу. Это не универсальная граница, а причина заранее измерять профиль нагрузки.
Когда лучше выбрать другой GPU-сервер
DGX — согласованная платформа с заданной топологией GPU, сетью, программным стеком и поддержкой NVIDIA. Другой сервер может быть выгоднее, если не нужна максимальная производительность на узел, но нужны дополнительные накопители, иной набор GPU, особые CPU, нестандартная сеть или интеграция в существующий парк.
Для таких проектов можно рассматривать серверы Dell для AI. Доступны конфигурации с восемью NVIDIA B300, восемью B200 или восемью H200. Сравнивать нужно топологию GPU, накопители, сеть, сертификацию и поддержку, а не только модель ускорителя.
Выбор DGX по задаче
| Сценарий | Предпочтительный вариант | Почему |
|---|---|---|
| Расширение Hopper-кластера | H100/H200 | Меньше изменений в программной и сетевой среде |
| H100 не хватает памяти | H200 | 141 ГБ на GPU и 1 128 ГБ на сервер |
| LoRA и QLoRA | H200 или B200 | Достаточный запас без обязательной покупки B300 |
| Полное дообучение крупной LLM | B200 или B300 | Больше памяти для градиентов и оптимизатора |
| Новый универсальный кластер | B200 | Сбалансированный переход на Blackwell |
| Длинный контекст и большой KV-кэш | H200, B200 или B300 | Выбор зависит от модели и числа пользователей |
| Модели рассуждения и ИИ-агенты | B300 | 288 ГБ на GPU и больше места для последовательностей |
| Высоконагруженный вывод | B200 или B300 | FP4 при оптимизированном программном стеке |
| Многопользовательская лаборатория | H200 или B200 | Баланс памяти, зрелости и стоимости |
| Ограниченная мощность стойки | H100 или H200 | Ниже максимальная нагрузка |
Таблица задаёт направление, но не заменяет тест модели с ожидаемым контекстом, пакетом, числом пользователей и требованиями к задержке.
Частые ошибки при сравнении
- Считать FP4, FP8, плотный и разреженный режимы одинаковыми показателями.
- Оценивать общую память без учёта объёма одного GPU.
- Считать только веса и забывать о KV-кэше, активациях и буферах.
- Переносить показатели NVL72 на одиночный DGX.
- Смотреть на токены в секунду без задержки первого токена.
- Ожидать линейного ускорения от второго узла.
- Покупать 800-гигабитные адаптеры без соответствующей фабрики.
- Игнорировать питание и охлаждение стойки.
- Не проверять поддержку Blackwell в программном стеке.
- Выбирать B300 для нагрузки, которая ограничена CPU, сетью или хранилищем.
Какой NVIDIA DGX выбрать
Источник изображения: NVIDIA
DGX H100 подходит для зрелой Hopper-инфраструктуры и задач, которым хватает 640 ГБ памяти GPU. H200 — лучший вариант внутри Hopper для крупных моделей, длинного контекста и большого KV-кэша. B200 является основной точкой перехода на Blackwell и подходит большинству новых смешанных кластеров. B300 стоит выбирать для максимального запаса по памяти, моделей рассуждения, полного дообучения и высокой одновременной нагрузки.
Выбор начинают с размера модели, точности весов, KV-кэша, длины контекста, числа пользователей и режима дообучения. Затем оценивают сеть, хранилище, питание, охлаждение и загрузку. Такой расчёт показывает, даст ли новое поколение реальное преимущество или добавит дорогую неиспользуемую мощность.

