NVIDIA DGX B300 обычно достаточно, если модель вместе с контекстом, KV-кэшем и рабочими данными помещается в восемь тесно связанных GPU, а компании от неё нужны инференс, RAG, дообучение и внутренние AI-сервисы. DGX GB300 стоит рассматривать, когда одна нагрузка должна эффективно использовать десятки GPU, критична скорость обмена между ними и система будет постоянно выполнять крупномасштабный инференс, обучение или постобучение. Это не две версии одного сервера: B300 — самостоятельный узел 10U, а GB300 — жидкостно охлаждаемая вычислительная стойка с другими требованиями к сети, питанию и эксплуатации.
Серверы NVIDIA DGX
Два разных уровня AI-инфраструктуры
Сравнение только по числу ускорителей вводит в заблуждение. В DGX B300 установлено восемь GPU Blackwell Ultra, в DGX GB300 — 72. Но важнее не девятикратная разница, а способ соединения GPU.
Инфраструктуру можно масштабировать тремя способами:
- Один AI-сервер. Восемь GPU работают внутри локального домена NVLink.
- Кластер серверов. Несколько B300 соединяются через InfiniBand или Ethernet, но каждый узел сохраняет собственный восьми-GPU домен.
- Система уровня стойки. В GB300 все 72 GPU объединены NVLink-коммутацией в единый вычислительный комплекс.
Поэтому правильный вопрос звучит не «сколько GPU нужно компании», а «сколько тесно связанных GPU требуется одной задаче». Сотню ускорителей можно эффективно загружать независимыми нагрузками без единого домена и дорогостоящей платформы. И наоборот, одна крупная распределённая нагрузка способна выйти за пределы восьми GPU даже при небольшом числе пользователей.
Что представляет собой NVIDIA DGX B300
Официальный фронтальный вид NVIDIA DGX B300 с установленной лицевой панелью.
Источник изображения: NVIDIA DOCS
DGX B300 — коробочный AI-сервер для обучения, дообучения, инференса и аналитических нагрузок. По официальной спецификации NVIDIA, он содержит восемь GPU Blackwell Ultra SXM, два процессора Intel Xeon 6776P, два коммутатора NVLink и 2,1 ТиБ суммарной памяти GPU. Также предусмотрены восемь интерфейсов ConnectX-8 со скоростью до 800 Гбит/с, два DPU BlueField-3, два загрузочных NVMe и восемь локальных NVMe по 3,84 ТБ. Сервер занимает 10U и потребляет около 14 кВт при использовании.
В документации встречаются значения 2,1 и 2,3 ТБ памяти. Это одна конфигурация: восемь модулей по 288 ГБ дают 2304 ГБ в десятичном исчислении, то есть примерно 2,3 ТБ, или около 2,1 ТиБ в двоичном.
B300 использует привычную для корпоративной инфраструктуры архитектуру x86. Это упрощает перенос внутренних приложений, агентов мониторинга и контейнеров, которые уже работают на серверах с Intel Xeon. Основные вычисления выполняют GPU, а процессоры обслуживают подготовку данных, сеть, планирование и системные задачи.
Система поддерживает питание переменным током и подключение к шинопроводу постоянного тока. Охлаждение воздушное, но требования существенно выше, чем у обычного двухсокетного сервера: руководство NVIDIA указывает максимальное потребление 14,5 кВт, массу до 168 кг и воздушный поток до 1500 кубических футов в минуту.
Поэтому свободных 10U в обычной стойке недостаточно. До установки необходимо проверить мощность PDU, резервирование линий, отвод тепла, массу и наличие высокоскоростной сети.
Как устроен NVIDIA DGX GB300
Официальная схема компоновки DGX GB300 NVL72.
Источник: NVIDIA DOCS
DGX GB300 — готовая система уровня стойки, построенная на архитектуре GB300 NVL72. В ней 72 GPU Blackwell Ultra объединены с 36 процессорами Grace на архитектуре Arm. Объём памяти GPU достигает 20 ТБ, а общий объём быстрой памяти с учётом памяти Grace — 37 ТБ. Для вычислительной сети предусмотрены 72 интерфейса ConnectX-8, для хранения и инфраструктурных функций — 18 DPU BlueField-3.
В стойку входят:
- 18 вычислительных модулей по четыре GPU и два Grace CPU;
- девять коммутационных модулей NVLink;
- полки питания и шинопровод постоянного тока;
- модули управления;
- контуры прямого жидкостного охлаждения;
- датчики утечек на уровне модулей и стойки.
NVLink обеспечивает связанность всех 72 GPU с совокупной пропускной способностью около 130 ТБ/с. Полная стойка может потреблять до 142 кВт. Локальные NVMe в вычислительных модулях используются прежде всего для операционной системы и быстрого кэша, а не как замена общему хранилищу данных.
Различается и архитектура CPU: Если B300 использует x86-процессоры Intel, то GB300 — ARM-процессоры Grace. Современный контейнерный AI-стек обычно переносится без радикальной переработки, но собственные библиотеки, закрытые агенты и приложения без сборок под другую архитектуру необходимо проверить до миграции.
DGX B300 и DGX GB300: основные различия
| Параметр | NVIDIA DGX B300 | NVIDIA DGX GB300 |
|---|---|---|
| Уровень системы | Отдельный AI-сервер | Полная вычислительная стойка |
| GPU | 8 × Blackwell Ultra | 72 × Blackwell Ultra |
| CPU | 2 × Intel Xeon 6776P | 36 × NVIDIA Grace |
| Архитектура CPU | x86 | Arm |
| Память GPU | Около 2,3 ТБ | Около 20 ТБ |
| NVLink-домен | 8 GPU | 72 GPU |
| Охлаждение | Воздушное | Прямое жидкостное |
| Энергопотребление | До 14–14,5 кВт | До 142 кВт на стойку |
| Масштабирование | Добавлением узлов | Внутри стойки и объединением стоек |
| Типичные задачи | Корпоративный инференс, RAG, дообучение | Масштабный инференс, обучение и постобучение |
Пиковые показатели в петафлопсах не показывают скорость конкретной модели. На результат влияют формат вычислений, длина контекста, размер пакета запросов, способ разделения модели, загрузка GPU, скорость хранилища и доля времени, уходящая на обмен данными. Поэтому нельзя просто разделить производительность GB300 на показатель B300 и получить универсальный коэффициент ускорения.
Когда одного DGX B300 достаточно
Модель помещается в восемь GPU
Оценивать нужно не только веса модели. В памяти также размещаются:
- KV-кэш активных последовательностей;
- входной и генерируемый контекст;
- рабочие буферы среды инференса;
- активации, градиенты и состояния оптимизатора при обучении;
- резерв для стабильной работы без постоянной выгрузки данных.
Если полный набор данных помещается в 2,3 ТБ памяти восьми GPU с приемлемым запасом, переход к NVL72 только ради большей суммарной памяти обычно не нужен. Сначала стоит проверить квантизацию, пакетную обработку, настройки KV-кэша и программной платформы.
Корпоративный инференс и внутренние сервисы
Один B300 может обслуживать:
- помощника по внутренним документам;
- генерацию и проверку кода;
- обработку обращений;
- суммаризацию документов;
- поиск по базе знаний;
- специализированные модели для изображений, аудио и видео.
Число пользователей само по себе мало о чём говорит. Тысяча сотрудников с короткими запросами может создавать меньшую нагрузку, чем несколько аналитиков, работающих с длинным контекстом и моделями рассуждения. Для расчёта нужны запросы в секунду, входные и выходные токены, требуемая задержка и профиль пиков.
Если одной копии модели не хватает по пропускной способности, часто эффективнее добавить второй B300 и запустить ещё одну реплику. Это работает, когда обращения независимы и распределяются балансировщиком.
RAG
RAG редко требует 72 тесно связанных GPU только из-за большого архива документов. Сервис включает подготовку данных, создание эмбеддингов, поиск, повторное ранжирование, формирование контекста и генерацию ответа.
Узким местом может оказаться векторная база, скорость NVMe, передача документов или неудачное разбиение текста. GB300 не устранит эти ограничения автоматически. Для корпоративного RAG разумнее разделить поисковый и генеративный контуры, а GPU выделить на нагрузки, которые действительно могут использовать не только вычисления на процессоре.
Дообучение и работа ML-команд
B300 подходит для LoRA, QLoRA, обучения адаптеров, настройки моделей под корпоративные данные и нескольких независимых экспериментов. Полное дообучение требует больше памяти, поскольку вместе с весами хранятся градиенты, активации и состояния оптимизатора, но необходимость GB300 всё равно определяется размером модели и схемой распределения, а не самим словом «дообучение».
Отдельные серверы удобны и при постепенном росте. Компания может начать с одного B300, добавить второй для резервирования или другой команды, затем построить кластер с общей сетью и хранилищем. Это снижает риск купить большую стойку до появления постоянной нагрузки.
Когда нужен DGX GB300
Серверы NVIDIA DGX
Одна задача требует десятков связанных GPU
Главный аргумент в пользу GB300 — необходимость постоянно обмениваться данными между частями одной нагрузки. Это характерно для тензорного и конвейерного параллелизма, распределённого обучения, крупных моделей со смесью экспертов и других схем, где вычислительные операции разделены между десятками GPU.
В кластере B300 обмен внутри сервера проходит через NVLink, а между серверами — через внешнюю сеть. Даже быстрые InfiniBand и Ethernet имеют другую топологию и задержку. Чем выше доля коллективных операций, тем заметнее сеть влияет на время выполнения и тем ценнее единый 72-GPU домен.
Масштабный инференс
Большой поток запросов не всегда означает необходимость GB300. Если модель помещается в B300, независимые запросы можно распределять между несколькими копиями на отдельных серверах.
Стойка NVL72 становится оправданнее, когда одновременно выполняется несколько условий:
- один экземпляр модели требует больше восьми GPU;
- используется очень длинный контекст;
- KV-кэш занимает значительную часть памяти;
- модели рассуждения создают много промежуточных токенов;
- агентные системы запускают длинные цепочки вызовов;
- требуется высокая пропускная способность при строгой задержке;
- оборудование будет загружено круглосуточно.
Здесь ценность дают не только вычисления, но и высокая плотность GPU, связность внутри стойки и централизованное управление нагрузками.
Обучение и постобучение
GB300 рассчитан на продолжительные синхронные задачи, где простой десятков ускорителей особенно дорог:
- обучение крупных базовых моделей;
- полное дообучение моделей с большим числом параметров;
- обучение с подкреплением;
- генерация и оценка больших массивов синтетических данных;
- увеличение объёма вычислений во время инференса;
- конвейеры, в которых несколько моделей генерируют, проверяют и оценивают ответы.
Если нагрузка требует сотен или тысяч GPU, одна GB300 становится не конечной системой, а масштабируемым блоком инфраструктуры с общей сетью, хранилищем и управлением.
Когда действительно появляется AI-фабрика
AI-фабрика — это постоянно работающий производственный контур, а не просто помещение с большим числом ускорителей. Для него характерны несколько обслуживаемых сервисов, централизованные очереди и квоты, круглосуточные нагрузки, телеметрия от GPU до стойки, регулярное обновление моделей и требования к восстановлению после отказов.
Если компания проводит отдельные эксперименты и поддерживает несколько внутренних сервисов, это само по себе не делает GB300 необходимым. Стойка оправдана, когда такой контур уже спроектирован и способен стабильно загружать её полезной работой.
Почему девять DGX B300 не равны одному DGX GB300
Девять B300 и одна GB300 дают по 72 GPU. Суммарный объём памяти тоже близок: около 20,7 ТБ у девяти B300 против 20 ТБ у GB300. Но девять серверов образуют девять отдельных доменов по восемь GPU. Между ними данные передаются через сетевые адаптеры и внешние коммутаторы.
В GB300 все 72 GPU входят в единую NVLink-систему. Это не превращает их в одну супер-GPU c единой физической памятью, но обеспечивает более тесную связанность для коллективных операций и частей распределённой модели.
Несколько B300 могут быть предпочтительнее, если:
- модели помещаются в восемь GPU;
- команды и задачи независимы;
- производительность растёт запуском дополнительных копий;
- закупка проводится поэтапно;
- отдельные узлы нужно обслуживать без остановки всего пула;
- важна изоляция проектов.
GB300 выигрывает, когда одна нагрузка постоянно пересекает границы восьми-GPU узла и межсерверный обмен снижает эффективность. Решающим становится не суммарное число ускорителей, а топология соединений.
Требования к дата-центру
Выбор нельзя оставлять только ML-команде. До закупки архитекторы дата-центра должны оценить питание, охлаждение, массу, сеть и обслуживание.
Для DGX B300
Потребуются:
- 10U свободного пространства;
- до 14,5 кВт мощности на узел;
- достаточный воздушный поток;
- резервирование питающих линий;
- высокоскоростные порты для вычислительной сети и хранения;
- внешнее хранилище для наборов данных и контрольных точек.
Один B300 способен превысить допустимую мощность старой стойки. Четыре сервера займут стандартные 40U, но их суммарное потребление приблизится к 58 кВт, поэтому ограничение по питанию и отводу тепла может возникнуть значительно раньше, чем закончится место.
Для DGX GB300
Нужна площадка для высокоплотных жидкостно охлаждаемых систем. Она должна поддерживать:
- подачу и возврат охлаждающей жидкости;
- блок распределения охлаждения;
- контроль температуры, давления и утечек;
- силовую инфраструктуру до 142 кВт на стойку;
- отдельную сеть управления;
- вычислительную сеть для объединения стоек;
- сеть доступа к хранилищу;
- обслуживание жидкостного контура.
Обычный коммерческий ЦОД может принимать мощные GPU-серверы, но не поддерживать такую плотность или прямое жидкостное охлаждение. Тогда остаются специализированная площадка, инфраструктура партнёра или облачный доступ.
Локальные NVMe обеих систем не заменяют общее хранилище для наборов данных, контрольных точек и реестра моделей. Десятки дорогих GPU будут простаивать, если данные поступают недостаточно быстро, поэтому сеть и хранилище должны проектироваться вместе с вычислительным слоем.
Экономика: стоимость полезной работы важнее цены стойки
В расчёт полной стоимости владения входят:
- оборудование, сеть, оптика и кабели;
- общее хранилище;
- подготовка электропитания и охлаждения;
- программное обеспечение и поддержка;
- работа инфраструктурной команды;
- резерв мощности и запасные компоненты;
- миграция приложений и стоимость простоев.
Полезнее сравнивать стоимость миллиона токенов, время обучения, число запросов на ватт, соблюдение целевой задержки и среднюю загрузку GPU. Высокая пиковая производительность невыгодна, если система большую часть недели ждёт задачу.
GB300 может снизить стоимость единицы результата при постоянной загрузке и нагрузках, которые используют связность 72 GPU. Для нерегулярных экспериментов несколько B300 или сочетание собственного сервера с облачными ресурсами обычно уменьшают финансовый риск.
Нужно учитывать и концентрацию ресурсов: обслуживание одной стойки затрагивает большой объём вычислений. Поэтому высокая плотность требует резервирования задач, данных и инженерных систем.
Типовые сценарии выбора
| Ситуация | Наиболее вероятный вариант | Почему |
|---|---|---|
| Корпоративный помощник и RAG | Один или два DGX B300 | Модель обычно помещается в 8 GPU; второй узел даёт резервирование |
| Несколько независимых ML-команд | Кластер DGX B300 | Проще разделять ресурсы и обслуживать узлы |
| LoRA, QLoRA и прикладное дообучение | DGX B300 | NVL72 часто будет избыточна |
| Большой поток коротких запросов | Несколько DGX B300 | Запросы распределяются между копиями модели |
| Одна модель требует десятков GPU | DGX GB300 | Важен единый 72-GPU домен |
| Длинный контекст и модели рассуждения при постоянной загрузке | DGX GB300 | Нужны память, плотность и быстрый обмен |
| Обучение крупной базовой модели | DGX GB300 или несколько стоек | Требуются длительные синхронные вычисления |
| ЦОД не поддерживает жидкостное охлаждение | DGX B300 либо внешняя площадка | GB300 нельзя установить как обычный сервер |
| Нагрузка пока экспериментальная | B300 и облако для пиков | Ниже риск незагруженного оборудования |
Альтернативы готовой платформе DGX
DGX объединяет вычислители, сеть, системное программное обеспечение и поддержку в проверенную платформу. Но компании могут выбрать GPU-серверы OEM-производителей и самостоятельно определить процессоры, накопители, сеть и ускорители.
Например, в актуальном поколении доступны серверы Dell PowerEdge 17G, есть модели для высокоплотных вычислений. Существуют и конфигурации на AMD EPYC, позволяющие иначе сбалансировать линии PCIe, ядра CPU и системную память.
Такой подход даёт больше свободы и облегчает поэтапную модернизацию, но заказчик сам отвечает за топологию PCIe и NVLink, совместимость GPU, сетевую фабрику, охлаждение, программный стек и отказоустойчивость.
OEM-сервер с восемью B300 может быть близок к DGX B300 по вычислителям, но не становится автоматически эквивалентом по интеграции и поддержке. Набор отдельных GPU-серверов также не заменяет GB300, если задаче нужен единый домен NVL72.
Как перейти от одного сервера к стойке
Переход можно выполнять поэтапно:
- развернуть один B300 для первых производственных моделей;
- добавить второй узел для резервирования и параллельных задач;
- создать кластер с общей сетью и хранилищем;
- собрать данные о загрузке GPU, задержке и межузловом обмене;
- выделить задачи, которые неэффективно работают в границах восьми GPU;
- подготовить площадку с подходящим питанием и жидкостным охлаждением;
- внедрить GB300 для наиболее тесно связанных нагрузок.
Смешанная архитектура нередко выгоднее полной замены. B300 продолжают обслуживать небольшие модели, разработку и независимый инференс, а GB300 получает задачи, где её топология даёт измеримое преимущество.
Для упрощения миграции стоит заранее стандартизировать контейнеры, форматы моделей, хранение контрольных точек, телеметрию и планирование ресурсов. Тогда задачи можно переносить между отдельными узлами и стойками без жёсткой привязки к одному способу размещения.
Что выбрать
DGX B300 подходит большинству компаний, которые строят корпоративные AI-сервисы, развивают RAG, выполняют прикладное дообучение и обслуживают модели, помещающиеся в восемь GPU. Несколько B300 остаются логичным выбором для независимых команд и запросов, которые можно распределить между копиями модели.
DGX GB300 нужна, когда ограничением становится размер связного вычислительного домена. Если одна модель или учебная задача должна постоянно обмениваться данными между десятками GPU, а дата-центр готов к мощности до 142 кВт и прямому жидкостному охлаждению, NVL72 даёт преимущество, которого нельзя получить простым сложением серверов.
Переход к GB300 должен подтверждаться измерениями: расходом памяти, долей коммуникаций, длиной очередей, целевой задержкой, загрузкой GPU и стоимостью полезной работы. Пока таких данных нет, B300 или кластер из нескольких узлов обычно обеспечивают более гибкий и менее рискованный путь роста.

