Выберите ваш город

NVIDIA DGX B300 vs DGX GB300: когда достаточно AI-сервера, а когда нужна rack-scale инфраструктура

03.08.2026
17 мин на чтение
8

NVIDIA DGX B300 обычно достаточно, если модель вместе с контекстом, KV-кэшем и рабочими данными помещается в восемь тесно связанных GPU, а компании от неё нужны инференс, RAG, дообучение и внутренние AI-сервисы. DGX GB300 стоит рассматривать, когда одна нагрузка должна эффективно использовать десятки GPU, критична скорость обмена между ними и система будет постоянно выполнять крупномасштабный инференс, обучение или постобучение. Это не две версии одного сервера: B300 — самостоятельный узел 10U, а GB300 — жидкостно охлаждаемая вычислительная стойка с другими требованиями к сети, питанию и эксплуатации.

Серверы NVIDIA DGX

Для AI
Новый
NVIDIA DGX B300
CPU:
2x Intel Xeon 6776P (64c/128t, 2.3GHz-3.9GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B300 SXM

от 116 666 760

4 054 170 ₽/мес в лизинг

от 97 222 300

+ 19 444 460 НДС

Для AI
Новый
NVIDIA DGX H200
CPU:
2x Intel Xeon Platinum 8480C (56c/112t, 2GHz-3.8GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA H200

от 64 235 160

2 232 172 ₽/мес в лизинг

от 53 529 300

+ 10 705 860 НДС

Для AI
Новый
NVIDIA DGX B200
CPU:
2x Intel Xeon Platinum 8570 (56c/112t, 2.1GHz-4GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B200 SXM

от 84 645 600

2 941 435 ₽/мес в лизинг

от 70 538 000

+ 14 107 600 НДС

Для AI
Новый
NVIDIA DGX A100 2NVMe
CPU:
2x AMD EPYC 7742 (64c/128t, 2.25GHz-3.4GHz, 225W)
RAM:
2000GB (DDR4 ECC REG)
GPU:
8 x NVIDIA A100

от 15 897 960

552 454 ₽/мес в лизинг

от 13 248 300

+ 2 649 660 НДС

Два разных уровня AI-инфраструктуры

Сравнение только по числу ускорителей вводит в заблуждение. В DGX B300 установлено восемь GPU Blackwell Ultra, в DGX GB300 — 72. Но важнее не девятикратная разница, а способ соединения GPU.

Инфраструктуру можно масштабировать тремя способами:

  1. Один AI-сервер. Восемь GPU работают внутри локального домена NVLink.
  2. Кластер серверов. Несколько B300 соединяются через InfiniBand или Ethernet, но каждый узел сохраняет собственный восьми-GPU домен.
  3. Система уровня стойки. В GB300 все 72 GPU объединены NVLink-коммутацией в единый вычислительный комплекс.

Поэтому правильный вопрос звучит не «сколько GPU нужно компании», а «сколько тесно связанных GPU требуется одной задаче». Сотню ускорителей можно эффективно загружать независимыми нагрузками без единого домена и дорогостоящей платформы. И наоборот, одна крупная распределённая нагрузка способна выйти за пределы восьми GPU даже при небольшом числе пользователей.

Что представляет собой NVIDIA DGX B300

NVIDIA DGX B300: фронтальный вид

Официальный фронтальный вид NVIDIA DGX B300 с установленной лицевой панелью.

Источник изображения: NVIDIA DOCS

DGX B300 — коробочный AI-сервер для обучения, дообучения, инференса и аналитических нагрузок. По официальной спецификации NVIDIA, он содержит восемь GPU Blackwell Ultra SXM, два процессора Intel Xeon 6776P, два коммутатора NVLink и 2,1 ТиБ суммарной памяти GPU. Также предусмотрены восемь интерфейсов ConnectX-8 со скоростью до 800 Гбит/с, два DPU BlueField-3, два загрузочных NVMe и восемь локальных NVMe по 3,84 ТБ. Сервер занимает 10U и потребляет около 14 кВт при использовании.

В документации встречаются значения 2,1 и 2,3 ТБ памяти. Это одна конфигурация: восемь модулей по 288 ГБ дают 2304 ГБ в десятичном исчислении, то есть примерно 2,3 ТБ, или около 2,1 ТиБ в двоичном.

B300 использует привычную для корпоративной инфраструктуры архитектуру x86. Это упрощает перенос внутренних приложений, агентов мониторинга и контейнеров, которые уже работают на серверах с Intel Xeon. Основные вычисления выполняют GPU, а процессоры обслуживают подготовку данных, сеть, планирование и системные задачи.

Система поддерживает питание переменным током и подключение к шинопроводу постоянного тока. Охлаждение воздушное, но требования существенно выше, чем у обычного двухсокетного сервера: руководство NVIDIA указывает максимальное потребление 14,5 кВт, массу до 168 кг и воздушный поток до 1500 кубических футов в минуту.

Поэтому свободных 10U в обычной стойке недостаточно. До установки необходимо проверить мощность PDU, резервирование линий, отвод тепла, массу и наличие высокоскоростной сети.

Как устроен NVIDIA DGX GB300

Схема NVIDIA DGX GB300 NVL72

Официальная схема компоновки DGX GB300 NVL72.

Источник: NVIDIA DOCS

DGX GB300 — готовая система уровня стойки, построенная на архитектуре GB300 NVL72. В ней 72 GPU Blackwell Ultra объединены с 36 процессорами Grace на архитектуре Arm. Объём памяти GPU достигает 20 ТБ, а общий объём быстрой памяти с учётом памяти Grace — 37 ТБ. Для вычислительной сети предусмотрены 72 интерфейса ConnectX-8, для хранения и инфраструктурных функций — 18 DPU BlueField-3.

В стойку входят:

  • 18 вычислительных модулей по четыре GPU и два Grace CPU;
  • девять коммутационных модулей NVLink;
  • полки питания и шинопровод постоянного тока;
  • модули управления;
  • контуры прямого жидкостного охлаждения;
  • датчики утечек на уровне модулей и стойки.

NVLink обеспечивает связанность всех 72 GPU с совокупной пропускной способностью около 130 ТБ/с. Полная стойка может потреблять до 142 кВт. Локальные NVMe в вычислительных модулях используются прежде всего для операционной системы и быстрого кэша, а не как замена общему хранилищу данных.

Различается и архитектура CPU: Если B300 использует x86-процессоры Intel, то GB300 — ARM-процессоры Grace. Современный контейнерный AI-стек обычно переносится без радикальной переработки, но собственные библиотеки, закрытые агенты и приложения без сборок под другую архитектуру необходимо проверить до миграции.

DGX B300 и DGX GB300: основные различия

Параметр NVIDIA DGX B300 NVIDIA DGX GB300
Уровень системы Отдельный AI-сервер Полная вычислительная стойка
GPU 8 × Blackwell Ultra 72 × Blackwell Ultra
CPU 2 × Intel Xeon 6776P 36 × NVIDIA Grace
Архитектура CPU x86 Arm
Память GPU Около 2,3 ТБ Около 20 ТБ
NVLink-домен 8 GPU 72 GPU
Охлаждение Воздушное Прямое жидкостное
Энергопотребление До 14–14,5 кВт До 142 кВт на стойку
Масштабирование Добавлением узлов Внутри стойки и объединением стоек
Типичные задачи Корпоративный инференс, RAG, дообучение Масштабный инференс, обучение и постобучение

Пиковые показатели в петафлопсах не показывают скорость конкретной модели. На результат влияют формат вычислений, длина контекста, размер пакета запросов, способ разделения модели, загрузка GPU, скорость хранилища и доля времени, уходящая на обмен данными. Поэтому нельзя просто разделить производительность GB300 на показатель B300 и получить универсальный коэффициент ускорения.

Когда одного DGX B300 достаточно

Когда одного DGX B300 достаточно

Модель помещается в восемь GPU

Оценивать нужно не только веса модели. В памяти также размещаются:

  • KV-кэш активных последовательностей;
  • входной и генерируемый контекст;
  • рабочие буферы среды инференса;
  • активации, градиенты и состояния оптимизатора при обучении;
  • резерв для стабильной работы без постоянной выгрузки данных.

Если полный набор данных помещается в 2,3 ТБ памяти восьми GPU с приемлемым запасом, переход к NVL72 только ради большей суммарной памяти обычно не нужен. Сначала стоит проверить квантизацию, пакетную обработку, настройки KV-кэша и программной платформы.

Корпоративный инференс и внутренние сервисы

Один B300 может обслуживать:

  • помощника по внутренним документам;
  • генерацию и проверку кода;
  • обработку обращений;
  • суммаризацию документов;
  • поиск по базе знаний;
  • специализированные модели для изображений, аудио и видео.

Число пользователей само по себе мало о чём говорит. Тысяча сотрудников с короткими запросами может создавать меньшую нагрузку, чем несколько аналитиков, работающих с длинным контекстом и моделями рассуждения. Для расчёта нужны запросы в секунду, входные и выходные токены, требуемая задержка и профиль пиков.

Если одной копии модели не хватает по пропускной способности, часто эффективнее добавить второй B300 и запустить ещё одну реплику. Это работает, когда обращения независимы и распределяются балансировщиком.

RAG

RAG редко требует 72 тесно связанных GPU только из-за большого архива документов. Сервис включает подготовку данных, создание эмбеддингов, поиск, повторное ранжирование, формирование контекста и генерацию ответа.

Узким местом может оказаться векторная база, скорость NVMe, передача документов или неудачное разбиение текста. GB300 не устранит эти ограничения автоматически. Для корпоративного RAG разумнее разделить поисковый и генеративный контуры, а GPU выделить на нагрузки, которые действительно могут использовать не только вычисления на процессоре.

Дообучение и работа ML-команд

B300 подходит для LoRA, QLoRA, обучения адаптеров, настройки моделей под корпоративные данные и нескольких независимых экспериментов. Полное дообучение требует больше памяти, поскольку вместе с весами хранятся градиенты, активации и состояния оптимизатора, но необходимость GB300 всё равно определяется размером модели и схемой распределения, а не самим словом «дообучение».

Отдельные серверы удобны и при постепенном росте. Компания может начать с одного B300, добавить второй для резервирования или другой команды, затем построить кластер с общей сетью и хранилищем. Это снижает риск купить большую стойку до появления постоянной нагрузки.

Когда нужен DGX GB300

Серверы NVIDIA DGX

Для AI
Новый
NVIDIA DGX B300
CPU:
2x Intel Xeon 6776P (64c/128t, 2.3GHz-3.9GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B300 SXM

от 116 666 760

4 054 170 ₽/мес в лизинг

от 97 222 300

+ 19 444 460 НДС

Для AI
Новый
NVIDIA DGX H200
CPU:
2x Intel Xeon Platinum 8480C (56c/112t, 2GHz-3.8GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA H200

от 64 235 160

2 232 172 ₽/мес в лизинг

от 53 529 300

+ 10 705 860 НДС

Для AI
Новый
NVIDIA DGX B200
CPU:
2x Intel Xeon Platinum 8570 (56c/112t, 2.1GHz-4GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B200 SXM

от 84 645 600

2 941 435 ₽/мес в лизинг

от 70 538 000

+ 14 107 600 НДС

Для AI
Новый
NVIDIA DGX A100 2NVMe
CPU:
2x AMD EPYC 7742 (64c/128t, 2.25GHz-3.4GHz, 225W)
RAM:
2000GB (DDR4 ECC REG)
GPU:
8 x NVIDIA A100

от 15 897 960

552 454 ₽/мес в лизинг

от 13 248 300

+ 2 649 660 НДС

Одна задача требует десятков связанных GPU

Главный аргумент в пользу GB300 — необходимость постоянно обмениваться данными между частями одной нагрузки. Это характерно для тензорного и конвейерного параллелизма, распределённого обучения, крупных моделей со смесью экспертов и других схем, где вычислительные операции разделены между десятками GPU.

В кластере B300 обмен внутри сервера проходит через NVLink, а между серверами — через внешнюю сеть. Даже быстрые InfiniBand и Ethernet имеют другую топологию и задержку. Чем выше доля коллективных операций, тем заметнее сеть влияет на время выполнения и тем ценнее единый 72-GPU домен.

Масштабный инференс

Большой поток запросов не всегда означает необходимость GB300. Если модель помещается в B300, независимые запросы можно распределять между несколькими копиями на отдельных серверах.

Стойка NVL72 становится оправданнее, когда одновременно выполняется несколько условий:

  • один экземпляр модели требует больше восьми GPU;
  • используется очень длинный контекст;
  • KV-кэш занимает значительную часть памяти;
  • модели рассуждения создают много промежуточных токенов;
  • агентные системы запускают длинные цепочки вызовов;
  • требуется высокая пропускная способность при строгой задержке;
  • оборудование будет загружено круглосуточно.

Здесь ценность дают не только вычисления, но и высокая плотность GPU, связность внутри стойки и централизованное управление нагрузками.

Обучение и постобучение

GB300 рассчитан на продолжительные синхронные задачи, где простой десятков ускорителей особенно дорог:

  • обучение крупных базовых моделей;
  • полное дообучение моделей с большим числом параметров;
  • обучение с подкреплением;
  • генерация и оценка больших массивов синтетических данных;
  • увеличение объёма вычислений во время инференса;
  • конвейеры, в которых несколько моделей генерируют, проверяют и оценивают ответы.

Если нагрузка требует сотен или тысяч GPU, одна GB300 становится не конечной системой, а масштабируемым блоком инфраструктуры с общей сетью, хранилищем и управлением.

Когда действительно появляется AI-фабрика

AI-фабрика — это постоянно работающий производственный контур, а не просто помещение с большим числом ускорителей. Для него характерны несколько обслуживаемых сервисов, централизованные очереди и квоты, круглосуточные нагрузки, телеметрия от GPU до стойки, регулярное обновление моделей и требования к восстановлению после отказов.

Если компания проводит отдельные эксперименты и поддерживает несколько внутренних сервисов, это само по себе не делает GB300 необходимым. Стойка оправдана, когда такой контур уже спроектирован и способен стабильно загружать её полезной работой.

Почему девять DGX B300 не равны одному DGX GB300

Девять DGX B300 и один DGX GB300

Девять B300 и одна GB300 дают по 72 GPU. Суммарный объём памяти тоже близок: около 20,7 ТБ у девяти B300 против 20 ТБ у GB300. Но девять серверов образуют девять отдельных доменов по восемь GPU. Между ними данные передаются через сетевые адаптеры и внешние коммутаторы.

В GB300 все 72 GPU входят в единую NVLink-систему. Это не превращает их в одну супер-GPU c единой физической памятью, но обеспечивает более тесную связанность для коллективных операций и частей распределённой модели.

Несколько B300 могут быть предпочтительнее, если:

  • модели помещаются в восемь GPU;
  • команды и задачи независимы;
  • производительность растёт запуском дополнительных копий;
  • закупка проводится поэтапно;
  • отдельные узлы нужно обслуживать без остановки всего пула;
  • важна изоляция проектов.

GB300 выигрывает, когда одна нагрузка постоянно пересекает границы восьми-GPU узла и межсерверный обмен снижает эффективность. Решающим становится не суммарное число ускорителей, а топология соединений.

Требования к дата-центру

Требования к дата-центру для DGX B300 и DGX GB300

Выбор нельзя оставлять только ML-команде. До закупки архитекторы дата-центра должны оценить питание, охлаждение, массу, сеть и обслуживание.

Для DGX B300

Потребуются:

  • 10U свободного пространства;
  • до 14,5 кВт мощности на узел;
  • достаточный воздушный поток;
  • резервирование питающих линий;
  • высокоскоростные порты для вычислительной сети и хранения;
  • внешнее хранилище для наборов данных и контрольных точек.

Один B300 способен превысить допустимую мощность старой стойки. Четыре сервера займут стандартные 40U, но их суммарное потребление приблизится к 58 кВт, поэтому ограничение по питанию и отводу тепла может возникнуть значительно раньше, чем закончится место.

Для DGX GB300

Нужна площадка для высокоплотных жидкостно охлаждаемых систем. Она должна поддерживать:

  • подачу и возврат охлаждающей жидкости;
  • блок распределения охлаждения;
  • контроль температуры, давления и утечек;
  • силовую инфраструктуру до 142 кВт на стойку;
  • отдельную сеть управления;
  • вычислительную сеть для объединения стоек;
  • сеть доступа к хранилищу;
  • обслуживание жидкостного контура.

Обычный коммерческий ЦОД может принимать мощные GPU-серверы, но не поддерживать такую плотность или прямое жидкостное охлаждение. Тогда остаются специализированная площадка, инфраструктура партнёра или облачный доступ.

Локальные NVMe обеих систем не заменяют общее хранилище для наборов данных, контрольных точек и реестра моделей. Десятки дорогих GPU будут простаивать, если данные поступают недостаточно быстро, поэтому сеть и хранилище должны проектироваться вместе с вычислительным слоем.

Экономика: стоимость полезной работы важнее цены стойки

В расчёт полной стоимости владения входят:

  • оборудование, сеть, оптика и кабели;
  • общее хранилище;
  • подготовка электропитания и охлаждения;
  • программное обеспечение и поддержка;
  • работа инфраструктурной команды;
  • резерв мощности и запасные компоненты;
  • миграция приложений и стоимость простоев.

Полезнее сравнивать стоимость миллиона токенов, время обучения, число запросов на ватт, соблюдение целевой задержки и среднюю загрузку GPU. Высокая пиковая производительность невыгодна, если система большую часть недели ждёт задачу.

GB300 может снизить стоимость единицы результата при постоянной загрузке и нагрузках, которые используют связность 72 GPU. Для нерегулярных экспериментов несколько B300 или сочетание собственного сервера с облачными ресурсами обычно уменьшают финансовый риск.

Нужно учитывать и концентрацию ресурсов: обслуживание одной стойки затрагивает большой объём вычислений. Поэтому высокая плотность требует резервирования задач, данных и инженерных систем.

Типовые сценарии выбора

Ситуация Наиболее вероятный вариант Почему
Корпоративный помощник и RAG Один или два DGX B300 Модель обычно помещается в 8 GPU; второй узел даёт резервирование
Несколько независимых ML-команд Кластер DGX B300 Проще разделять ресурсы и обслуживать узлы
LoRA, QLoRA и прикладное дообучение DGX B300 NVL72 часто будет избыточна
Большой поток коротких запросов Несколько DGX B300 Запросы распределяются между копиями модели
Одна модель требует десятков GPU DGX GB300 Важен единый 72-GPU домен
Длинный контекст и модели рассуждения при постоянной загрузке DGX GB300 Нужны память, плотность и быстрый обмен
Обучение крупной базовой модели DGX GB300 или несколько стоек Требуются длительные синхронные вычисления
ЦОД не поддерживает жидкостное охлаждение DGX B300 либо внешняя площадка GB300 нельзя установить как обычный сервер
Нагрузка пока экспериментальная B300 и облако для пиков Ниже риск незагруженного оборудования

Альтернативы готовой платформе DGX

DGX объединяет вычислители, сеть, системное программное обеспечение и поддержку в проверенную платформу. Но компании могут выбрать GPU-серверы OEM-производителей и самостоятельно определить процессоры, накопители, сеть и ускорители.

Например, в актуальном поколении доступны серверы Dell PowerEdge 17G, есть модели для высокоплотных вычислений. Существуют и конфигурации на AMD EPYC, позволяющие иначе сбалансировать линии PCIe, ядра CPU и системную память.

Такой подход даёт больше свободы и облегчает поэтапную модернизацию, но заказчик сам отвечает за топологию PCIe и NVLink, совместимость GPU, сетевую фабрику, охлаждение, программный стек и отказоустойчивость.

OEM-сервер с восемью B300 может быть близок к DGX B300 по вычислителям, но не становится автоматически эквивалентом по интеграции и поддержке. Набор отдельных GPU-серверов также не заменяет GB300, если задаче нужен единый домен NVL72.

Как перейти от одного сервера к стойке

Переход можно выполнять поэтапно:

  1. развернуть один B300 для первых производственных моделей;
  2. добавить второй узел для резервирования и параллельных задач;
  3. создать кластер с общей сетью и хранилищем;
  4. собрать данные о загрузке GPU, задержке и межузловом обмене;
  5. выделить задачи, которые неэффективно работают в границах восьми GPU;
  6. подготовить площадку с подходящим питанием и жидкостным охлаждением;
  7. внедрить GB300 для наиболее тесно связанных нагрузок.

Смешанная архитектура нередко выгоднее полной замены. B300 продолжают обслуживать небольшие модели, разработку и независимый инференс, а GB300 получает задачи, где её топология даёт измеримое преимущество.

Для упрощения миграции стоит заранее стандартизировать контейнеры, форматы моделей, хранение контрольных точек, телеметрию и планирование ресурсов. Тогда задачи можно переносить между отдельными узлами и стойками без жёсткой привязки к одному способу размещения.

Что выбрать

DGX B300 подходит большинству компаний, которые строят корпоративные AI-сервисы, развивают RAG, выполняют прикладное дообучение и обслуживают модели, помещающиеся в восемь GPU. Несколько B300 остаются логичным выбором для независимых команд и запросов, которые можно распределить между копиями модели.

DGX GB300 нужна, когда ограничением становится размер связного вычислительного домена. Если одна модель или учебная задача должна постоянно обмениваться данными между десятками GPU, а дата-центр готов к мощности до 142 кВт и прямому жидкостному охлаждению, NVL72 даёт преимущество, которого нельзя получить простым сложением серверов.

Переход к GB300 должен подтверждаться измерениями: расходом памяти, долей коммуникаций, длиной очередей, целевой задержкой, загрузкой GPU и стоимостью полезной работы. Пока таких данных нет, B300 или кластер из нескольких узлов обычно обеспечивают более гибкий и менее рискованный путь роста.


Автор

СЕРВЕР МОЛЛ

Поделиться
Комментарии
(0)
Ещё не добавлено ни одного комментария
Написать комментарий
Поля, отмеченные *, обязательны для заполнения
Для AI
Новый
NVIDIA DGX B300
CPU:
2x Intel Xeon 6776P (64c/128t, 2.3GHz-3.9GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B300 SXM

от 116 666 760

4 054 170 ₽/мес в лизинг

от 97 222 300

+ 19 444 460 НДС

Для AI
Новый
NVIDIA DGX H200
CPU:
2x Intel Xeon Platinum 8480C (56c/112t, 2GHz-3.8GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA H200

от 64 235 160

2 232 172 ₽/мес в лизинг

от 53 529 300

+ 10 705 860 НДС

Для AI
Новый
NVIDIA DGX B200
CPU:
2x Intel Xeon Platinum 8570 (56c/112t, 2.1GHz-4GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B200 SXM

от 84 645 600

2 941 435 ₽/мес в лизинг

от 70 538 000

+ 14 107 600 НДС

Для AI
Новый
NVIDIA DGX A100 2NVMe
CPU:
2x AMD EPYC 7742 (64c/128t, 2.25GHz-3.4GHz, 225W)
RAM:
2000GB (DDR4 ECC REG)
GPU:
8 x NVIDIA A100

от 15 897 960

552 454 ₽/мес в лизинг

от 13 248 300

+ 2 649 660 НДС

Больше статей

client consultations icon-delivery discount icon-facebook franchise icon-google_plus it-solutions icon-jivosite icon-menu icon-up icon-message payment icon-recall shops-local shops-network icon-solutions icon-support tasks icon-twitter Group 8 icon-user icon-viber icon-vk icon-watsup icon-watsup-2
Мы используем файлы 'cookie', чтобы обеспечить максимальное удобство пользователям.