Выберите ваш город

NVIDIA DGX B300 vs DGX B200 vs DGX H100/H200: какой DGX-сервер выбрать под LLM, inference и fine-tuning

29.07.2026
17 мин на чтение
2

Для действующей инфраструктуры может подойти архитектура Hopper, в частности H100 если достаточно 640 ГБ памяти GPU, а если нет - H200 лучше справляется с крупными моделями, длинным контекстом и большим KV-кэшем. DGX B200 — наиболее сбалансированный переход на Blackwell для обучения, дообучения и промышленного вывода моделей. DGX B300 нужен там, где критичны 288 ГБ на каждом GPU, модели с поддержкой рассуждения и высокая нагрузка в несколько потоков. Однако преимущества топовых моделей раскрываются только при готовности сети, электропитания, охлаждения, хранилища и конечно же команды эксплуатации.

Серверы NVIDIA DGX

Для AI
Новый
NVIDIA DGX B300
CPU:
2x Intel Xeon 6776P (64c/128t, 2.3GHz-3.9GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B300 SXM

от 116 666 760

4 054 170 ₽/мес в лизинг

от 97 222 300

+ 19 444 460 НДС

Для AI
Новый
NVIDIA DGX H200
CPU:
2x Intel Xeon Platinum 8480C (56c/112t, 2GHz-3.8GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA H200

от 64 235 160

2 232 172 ₽/мес в лизинг

от 53 529 300

+ 10 705 860 НДС

Для AI
Новый
NVIDIA DGX B200
CPU:
2x Intel Xeon Platinum 8570 (56c/112t, 2.1GHz-4GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B200 SXM

от 84 645 600

2 941 435 ₽/мес в лизинг

от 70 538 000

+ 14 107 600 НДС

Для AI
Новый
NVIDIA DGX A100 2NVMe
CPU:
2x AMD EPYC 7742 (64c/128t, 2.25GHz-3.4GHz, 225W)
RAM:
2000GB (DDR4 ECC REG)
GPU:
8 x NVIDIA A100

от 15 897 960

552 454 ₽/мес в лизинг

от 13 248 300

+ 2 649 660 НДС

Четыре DGX-сервера и три этапа развития

DGX H100 и H200 относятся к поколению Hopper. Оба сервера содержат восемь ускорителей, соединённых NVLink и NVSwitch, но H200 получил значительно больше памяти HBM3e. Поэтому переход с H100 на H200 прежде всего решает проблему объёма модели и пропускной способности памяти, а не меняет всю архитектуру.

DGX B200 — переход на Blackwell: больше памяти, пятое поколение NVLink/NVSwitch и аппаратная поддержка FP4. DGX B300 использует Blackwell Ultra. Его ключевое отличие от B200 — 288 ГБ памяти на GPU вместо 180 ГБ, а также более высокая плотная производительность FP4 и сеть до 800 Гбит/с на адаптер.

Не путать DGX B200 и B300 с NVL72

DGX B200 и B300 — отдельные восьмиускорительные серверы высотой 10U. DGX GB200 NVL72 и GB300 NVL72 — стоечные системы с десятками ускорителей и другой архитектурой соединений. Их результаты бенчмарков, энергопотребление и требования к сети нельзя автоматически переносить на один DGX.

Основные характеристики

Параметр DGX H100 DGX H200 DGX B200 DGX B300
Архитектура Hopper Hopper Blackwell Blackwell Ultra
GPU 8 × H100 SXM 8 × H200 SXM 8 × B200 SXM 8 × B300 SXM
Память одного GPU 80 ГБ 141 ГБ 180 ГБ 288 ГБ
Общая память GPU 640 ГБ 1 128 ГБ 1 440 ГБ 2 304 ГБ
FP8 около 32 Пфлопс с разреженностью около 32 Пфлопс с разреженностью 72 Пфлопс с разреженностью 72 Пфлопс с разреженностью
FP4 нет нативного Blackwell FP4 нет нативного Blackwell FP4 144/72 Пфлопс, разреженный/плотный режим 144/108 Пфлопс, разреженный/плотный режим
Соединение GPU NVLink/NVSwitch 4 NVLink/NVSwitch 4 NVLink/NVSwitch 5 NVLink/NVSwitch 5
Кластерная сеть до 8 × 400 Гбит/с до 8 × 400 Гбит/с до 8 × 400 Гбит/с до 8 × 800 Гбит/с
Оперативная память 2 ТБ 2 ТБ 2 ТБ, до 4 ТБ 2 ТБ, до 4 ТБ
Высота 8U 8U 10U 10U
Максимальная мощность 10,2 кВт 10,2 кВт 14,3 кВт до 15 кВт

Петафлопсы нельзя использовать как простой рейтинг. FP8 и FP4 — разные форматы, а показатели с разреженностью достижимы только при подходящей структуре данных и программной поддержке. Например, B200 и B300 имеют одинаковые 144 Пфлопс FP4 с разреженностью, но в плотном режиме это 72 и 108 Пфлопс.

Для B300 встречаются обозначения 2,1 и 2,3 ТБ. Точный физический объём — восемь модулей по 288 ГБ, то есть 2 304 ГБ; различие связано с округлением и способом пересчёта единиц.

Что изменилось от Hopper к Blackwell Ultra

Объём одного GPU важнее общей суммы

Память восьми ускорителей не превращается в полностью прозрачный единый массив. Модель распределяется между GPU, а данные передаются через NVLink и NVSwitch. Поэтому 288 ГБ на одном B300 помогают:

  • размещать крупные слои и экспертов без лишнего дробления;
  • уменьшать тензорный параллелизм и число обменов;
  • оставлять больше места под KV-кэш и буферы;
  • запускать несколько экземпляров модели или адаптеров;
  • снижать фрагментацию памяти.

В таких сценариях ёмкость одного ускорителя может быть важнее пиковой вычислительной мощности всей системы.

FP4 ускоряет не любую модель

BF16, FP16 и FP8 остаются важными для обучения. FP4 в Blackwell ориентирован главным образом на высокопроизводительный вывод и отдельные операции обучения. Для его использования нужны корректно квантованные веса, поддерживающий движок и проверка качества результата.

Снижение точности может ухудшить генерацию или работу отдельных слоёв. Поэтому сравнивать H200 и B300 только по FP4-производительности нельзя.

Сеть B300 требует новой инфраструктуры

B300 использует восемь ConnectX-8 со скоростью до 800 Гбит/с. Это важно для распределённого обучения и обслуживания моделей на нескольких узлах, но не даст эффекта в старой 400-гигабитной фабрике. Переход может потребовать новых коммутаторов, оптики, кабелей, настроек RDMA и более быстрого хранилища.

Сколько памяти действительно требуется LLM

Требования LLM к памяти GPU

Для первичной оценки весов можно использовать приближение:

  • BF16 или FP16 — около 2 байт на параметр;
  • FP8 или INT8 — около 1 байта;
  • 4-битное хранение — около 0,5 байта.

Модель на 70 млрд параметров в BF16 занимает примерно 140 ГБ только под веса, а модель на 400 млрд — около 800 ГБ. Реальный расход выше из-за служебных данных, выравнивания и рабочих областей библиотек.

Размер файла модели — не полный расчёт

Во время вывода память также занимают:

  • KV-кэш для уже обработанных токенов;
  • входной и создаваемый контекст;
  • параллельные последовательности;
  • временные тензоры и буферы CUDA;
  • пакетная обработка;
  • адаптеры LoRA;
  • резерв системы оркестрации.

KV-кэш быстро растёт при длинном контексте и большом числе пользователей. Поэтому модель может запускаться в одиночном тесте, но не выдерживать промышленную нагрузку.

Дообучение требует больше памяти

При полном fine-tuning нужно хранить веса, градиенты, активации и состояния оптимизатора. Суммарный объём во много раз превышает размер весов. LoRA и QLoRA снижают требования, поскольку обучают небольшие дополнительные матрицы, а базовую модель можно хранить в пониженной точности.

Фраза «модель помещается на H200» не означает, что на нём возможно её полное дообучение. Нужно учитывать длину последовательности, размер пакета, метод оптимизации и схему распределения между GPU.

DGX для обучения больших моделей

H100 и H200

Hopper подходит, если компания уже использует совместимые версии CUDA, контейнеры и библиотеки. Расширение существующего кластера обычно проще, чем одновременная смена ускорителей, сети и программной среды.

H200 предпочтительнее H100, когда:

  • модели не хватает 80 ГБ на одном GPU;
  • приходится уменьшать пакет;
  • длинные последовательности занимают слишком много памяти;
  • данные часто выгружаются в оперативную память;
  • нужен больший резерв под активации.

Если задача уверенно помещается в 640 ГБ и хорошо масштабируется, замена H100 только ради нового поколения может не окупиться.

B200 и B300

B200 подходит для нового универсального кластера, где обучение сочетается с дообучением и выводом. Это разумный выбор, если организация готова обновить программный стек, но ещё не нуждается в 288 ГБ на каждом GPU.

B300 оправдан для моделей с длинным контекстом, крупных смесей экспертов и полного дообучения. Особенно он может быть полезен в случае, когда большая память позволяет разместить модель на меньшем числе узлов или уменьшить степень параллелизма.

При многоузловом обучении ограничением могут стать сеть, чтение датасета, коллективные операции и запись контрольных сохранений. Если GPU простаивают в ожидании данных, переход с B200 на B300 не обеспечит пропорционального ускорения.

LoRA, QLoRA и полное дообучение

LoRA, QLoRA и полное дообучение

Для LoRA и QLoRA часто достаточно H100 или H200. H200 удобнее для крупной модели, длинного контекста, нескольких адаптеров и более крупного пакета.

B200 лучше подходит многопроектной среде: дополнительная память позволяет параллельно запускать больше экспериментов и реже выгружать данные в системную память. B300 нужен, если требуется:

  • полное дообучение крупных LLM;
  • несколько тяжёлых экспериментов одновременно;
  • максимальная длина последовательности;
  • крупные пакеты;
  • сокращение числа узлов на одну задачу.

При низкой загрузке преимущество B300 не окупается. Несколько более доступных серверов иногда удобнее разделять между командами и проще поддерживать резервирование и отказоустойчивость.

Серверы NVIDIA DGX

Для AI
Новый
NVIDIA DGX B300
CPU:
2x Intel Xeon 6776P (64c/128t, 2.3GHz-3.9GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B300 SXM

от 116 666 760

4 054 170 ₽/мес в лизинг

от 97 222 300

+ 19 444 460 НДС

Для AI
Новый
NVIDIA DGX H200
CPU:
2x Intel Xeon Platinum 8480C (56c/112t, 2GHz-3.8GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA H200

от 64 235 160

2 232 172 ₽/мес в лизинг

от 53 529 300

+ 10 705 860 НДС

Для AI
Новый
NVIDIA DGX B200
CPU:
2x Intel Xeon Platinum 8570 (56c/112t, 2.1GHz-4GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B200 SXM

от 84 645 600

2 941 435 ₽/мес в лизинг

от 70 538 000

+ 14 107 600 НДС

Для AI
Новый
NVIDIA DGX A100 2NVMe
CPU:
2x AMD EPYC 7742 (64c/128t, 2.25GHz-3.4GHz, 225W)
RAM:
2000GB (DDR4 ECC REG)
GPU:
8 x NVIDIA A100

от 15 897 960

552 454 ₽/мес в лизинг

от 13 248 300

+ 2 649 660 НДС

Какой DGX выбрать для inference

Вывод модели состоит из двух стадий. Сначала сервер обрабатывает весь входной запрос; затем токены ответа создаются последовательно. Первая стадия сильнее зависит от вычислительной мощности и длины входа, вторая — от пропускной способности памяти и KV-кэша.

Поэтому общего показателя токенов в секунду недостаточно. Для сервиса важны:

  • задержка до первого токена;
  • задержка между следующими токенами;
  • число одновременных запросов;
  • длина входа и ответа;
  • стабильность при пиковых нагрузках.

H100 против H200

H100 подходит для небольших и средних моделей, умеренного контекста и уже работающей инфраструктуры. H200 лучше, когда растёт KV-кэш, увеличивается число параллельных последовательностей или модель приходится слишком сильно дробить между GPU.

Поскольку обе системы относятся к Hopper, переход на H200 может увеличить вместимость без полной смены программной среды.

B200 против B300

B200 — сбалансированная Blackwell-платформа для массового вывода и смешанной нагрузки. B300 раскрывается, когда одновременно присутствуют крупная модель, длинный контекст и много пользователей. Это характерно для моделей рассуждения и ИИ-агентов с длинными цепочками действий.

Большая память позволяет держать больше KV-кэша и уменьшать дробление модели. Но результат зависит от движка вывода, квантования и библиотек: старый контейнер может не использовать преимущества Blackwell Ultra.

RAG и ИИ-агенты

RAG включает создание поискового представления, обращение к базе, повторное ранжирование, сбор контекста и генерацию. Иногда добавляются вызовы инструментов и повторные циклы рассуждения.

GPU ускоряет генерацию и часть ранжирования, но задержка может определяться CPU, RAM, NVMe, сетью или базой данных. Медленный поиск не станет быстрее после замены H200 на B300.

H100/H200 подходят для зрелых RAG-систем с контролируемой нагрузкой. B200 — для новой промышленной платформы, где генерация и дообучение работают вместе. B300 полезен при длинном контексте, множестве агентов и большом числе одновременных цепочек.

Центральные процессоры DGX участвуют в подготовке данных и вводе-выводе. Эти операции близки к задачам, которые выполняют серверы на Intel Xeon, поэтому CPU нельзя считать второстепенным компонентом RAG-платформы.

Многопользовательская ИИ-лаборатория

В лаборатории важна доля полезной загрузки, а не рекорд одной модели. Ресурсы распределяют через контейнеры, Slurm или Kubernetes; поддерживаемые режимы MIG позволяют разделять GPU на изолированные вычислительные экземпляры.

Нужно учитывать ограничения памяти, приоритет заданий, длительность экспериментов, конкуренцию за NVMe и сеть, а также фактически использованные GPU-часы.

B300 удобен, если несколько команд регулярно запускают крупные модели. При нерегулярной нагрузке несколько H100/H200 или даже менее плотных классических GPU-серверов могут быть практичнее: проекты меньше мешают друг другу, а отказ одного узла не останавливает всю лабораторию.

Один DGX или кластер

Один сервер проще развернуть и обслуживать. Он подходит для одной крупной модели или обучения, которое помещается в память узла. Внутренний NVLink обеспечивает быстрый обмен без внешней сети.

Ограничения одиночного DGX:

  • обслуживание требует остановки или переноса нагрузки;
  • отказ затрагивает все размещённые модели;
  • пиковая нагрузка ограничена одной системой;
  • нельзя независимо масштабировать стадии обработки.

Кластер позволяет создавать реплики, распределять обучение и разделять обработку входа и генерацию. Для этого нужны балансировка, общее хранилище и InfiniBand либо Ethernet с RDMA.

Удвоение числа серверов редко удваивает скорость: часть времени уходит на синхронизацию и обмен тензорами. Эффективность зависит от модели, параллелизма и сетевой топологии.

Электропитание, охлаждение и размещение

Электропитание, охлаждение и размещение DGX

DGX H100/H200 занимают 8U и потребляют до 10,2 кВт. B200/B300 занимают 10U; максимальная мощность составляет 14,3 и 15 кВт. Для стойки нужно учитывать:

  • доступную мощность и резерв;
  • распределение по PDU и фазам;
  • количество силовых соединений;
  • тепловую плотность и воздушный поток;
  • температуру входящего воздуха;
  • массу оборудования.

Четыре B300 физически занимают 40U, но их максимальная нагрузка приближается к 60 кВт без учёта сети и хранилища. Одного свободного места в стойке недостаточно, если площадка не способна отвести такое количество тепла.

B300 доступен с подключением к PDU или шинопроводу постоянного тока. Версия с блоками питания использует двенадцать модулей и резервирование N+N. Масса системы с блоками питания достигает примерно 168 кг, поэтому для монтажа нужны подходящие направляющие и подъёмное оборудование.

Где теряется производительность: сеть и хранилище

Внешняя сеть становится критичной, когда обучение или модель распределены между несколькими DGX. B300 предлагает до восьми подключений по 800 Гбит/с, но для них нужны совместимые коммутаторы, кабели и настройки. В 400-гигабитной фабрике часть возможностей ConnectX-8 не используется.

Хранилище должно обслуживать датасеты, версии моделей, контрольные сохранения, журналы, базы знаний и резервные копии. Локальные NVMe DGX удобны как быстрый кэш, но не заменяют общее отказоустойчивое хранилище с достаточной производительностью как самого хранилища, так и доступа к нему.

Если данные читаются медленно или контрольные сохранения надолго блокируют обучение, GPU простаивают. Поэтому сеть и хранилище рассчитывают вместе с вычислительными узлами, а не после их покупки.

Совместимость программного стека

Hopper привлекателен зрелыми драйверами, готовыми контейнерами и библиотеками. Это снижает риск миграции, особенно при собственных расширениях CUDA.

Для Blackwell и Blackwell Ultra нужно проверить:

  • версии CUDA и драйверов;
  • контейнерные образы;
  • библиотеки распределённых вычислений;
  • поддержку FP4 и FP8;
  • собственные вычислительные ядра;
  • движок вывода и оркестрацию.

Совместимость не означает одинаковую эффективность. Приложение может запуститься на B300, но не использовать FP4, улучшения механизма внимания или оптимальную схему обмена. Сравнивать следует полный сценарий: загрузку модели, задержку, скорость генерации, расход памяти и масштабирование.

Полная стоимость владения

Кроме сервера в проект входят сеть, оптика, PDU, модернизация питания, охлаждение, стойки, хранилище, поддержка, электроэнергия и работа команды.

Платформы лучше сравнивать не только по стоимости покупки, но и по эксплуатационным расходам. Подойдут следующие метрики стоимости:

  • час реально загруженных GPU;
  • цикл обучения;
  • миллион токенов при заданной задержке;
  • обслуживание нужного числа пользователей;
  • обучение команды;
  • простой и восстановления после сбоя.

B300 может быть экономичнее, если заменяет несколько узлов или сокращает межсерверный обмен. Но при загрузке 20–30% дополнительные возможности могут не покрыть расходы на более современную платформу. Это не универсальная граница, а причина заранее измерять профиль нагрузки.

Когда лучше выбрать другой GPU-сервер

DGX — согласованная платформа с заданной топологией GPU, сетью, программным стеком и поддержкой NVIDIA. Другой сервер может быть выгоднее, если не нужна максимальная производительность на узел, но нужны дополнительные накопители, иной набор GPU, особые CPU, нестандартная сеть или интеграция в существующий парк.

Для таких проектов можно рассматривать серверы Dell для AI. Доступны конфигурации с восемью NVIDIA B300, восемью B200 или восемью H200. Сравнивать нужно топологию GPU, накопители, сеть, сертификацию и поддержку, а не только модель ускорителя.

Выбор DGX по задаче

Сценарий Предпочтительный вариант Почему
Расширение Hopper-кластера H100/H200 Меньше изменений в программной и сетевой среде
H100 не хватает памяти H200 141 ГБ на GPU и 1 128 ГБ на сервер
LoRA и QLoRA H200 или B200 Достаточный запас без обязательной покупки B300
Полное дообучение крупной LLM B200 или B300 Больше памяти для градиентов и оптимизатора
Новый универсальный кластер B200 Сбалансированный переход на Blackwell
Длинный контекст и большой KV-кэш H200, B200 или B300 Выбор зависит от модели и числа пользователей
Модели рассуждения и ИИ-агенты B300 288 ГБ на GPU и больше места для последовательностей
Высоконагруженный вывод B200 или B300 FP4 при оптимизированном программном стеке
Многопользовательская лаборатория H200 или B200 Баланс памяти, зрелости и стоимости
Ограниченная мощность стойки H100 или H200 Ниже максимальная нагрузка

Таблица задаёт направление, но не заменяет тест модели с ожидаемым контекстом, пакетом, числом пользователей и требованиями к задержке.

Частые ошибки при сравнении

  1. Считать FP4, FP8, плотный и разреженный режимы одинаковыми показателями.
  2. Оценивать общую память без учёта объёма одного GPU.
  3. Считать только веса и забывать о KV-кэше, активациях и буферах.
  4. Переносить показатели NVL72 на одиночный DGX.
  5. Смотреть на токены в секунду без задержки первого токена.
  6. Ожидать линейного ускорения от второго узла.
  7. Покупать 800-гигабитные адаптеры без соответствующей фабрики.
  8. Игнорировать питание и охлаждение стойки.
  9. Не проверять поддержку Blackwell в программном стеке.
  10. Выбирать B300 для нагрузки, которая ограничена CPU, сетью или хранилищем.

Какой NVIDIA DGX выбрать

NVIDIA DGX B300

Источник изображения: NVIDIA

DGX H100 подходит для зрелой Hopper-инфраструктуры и задач, которым хватает 640 ГБ памяти GPU. H200 — лучший вариант внутри Hopper для крупных моделей, длинного контекста и большого KV-кэша. B200 является основной точкой перехода на Blackwell и подходит большинству новых смешанных кластеров. B300 стоит выбирать для максимального запаса по памяти, моделей рассуждения, полного дообучения и высокой одновременной нагрузки.

Выбор начинают с размера модели, точности весов, KV-кэша, длины контекста, числа пользователей и режима дообучения. Затем оценивают сеть, хранилище, питание, охлаждение и загрузку. Такой расчёт показывает, даст ли новое поколение реальное преимущество или добавит дорогую неиспользуемую мощность.


Автор

СЕРВЕР МОЛЛ

Поделиться
Комментарии
(0)
Ещё не добавлено ни одного комментария
Написать комментарий
Поля, отмеченные *, обязательны для заполнения
Для AI
Новый
NVIDIA DGX B300
CPU:
2x Intel Xeon 6776P (64c/128t, 2.3GHz-3.9GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B300 SXM

от 116 666 760

4 054 170 ₽/мес в лизинг

от 97 222 300

+ 19 444 460 НДС

Для AI
Новый
NVIDIA DGX H200
CPU:
2x Intel Xeon Platinum 8480C (56c/112t, 2GHz-3.8GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA H200

от 64 235 160

2 232 172 ₽/мес в лизинг

от 53 529 300

+ 10 705 860 НДС

Для AI
Новый
NVIDIA DGX B200
CPU:
2x Intel Xeon Platinum 8570 (56c/112t, 2.1GHz-4GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B200 SXM

от 84 645 600

2 941 435 ₽/мес в лизинг

от 70 538 000

+ 14 107 600 НДС

Для AI
Новый
NVIDIA DGX A100 2NVMe
CPU:
2x AMD EPYC 7742 (64c/128t, 2.25GHz-3.4GHz, 225W)
RAM:
2000GB (DDR4 ECC REG)
GPU:
8 x NVIDIA A100

от 15 897 960

552 454 ₽/мес в лизинг

от 13 248 300

+ 2 649 660 НДС

Больше статей

client consultations icon-delivery discount icon-facebook franchise icon-google_plus it-solutions icon-jivosite icon-menu icon-up icon-message payment icon-recall shops-local shops-network icon-solutions icon-support tasks icon-twitter Group 8 icon-user icon-viber icon-vk icon-watsup icon-watsup-2
Мы используем файлы 'cookie', чтобы обеспечить максимальное удобство пользователям.