Для большинства корпоративных AI-решений отправной точкой будет HPE ProLiant DL385 Gen11: он сочетает современные ускорители с производительными AMD EPYC, большим объёмом оперативной памяти и гибкой дисковой подсистемой. HPE ProLiant Compute DL380a Gen12 стоит выбирать, когда заранее нужна высокая плотность GPU, планируется одновременный запуск нескольких моделей или требуется запас для масштабного инференса. Для полного обучения крупных моделей, где критичен быстрый обмен между восемью ускорителями, лучше рассматривать специализированную платформу уровня HPE ProLiant Compute XD685.
HPE ProLiant DL380a Gen12 и DL385 Gen11 серверы
Чем универсальный сервер отличается от специализированной GPU-платформы
Наличие свободных слотов PCIe ещё не делает сервер полноценной AI-платформой. В универсальной системе ускорители делят внутренние ресурсы с сетевыми адаптерами, контроллерами хранения и NVMe-накопителями. Такой сервер удобен, когда на одном узле работает небольшая модель, векторная база, контейнеры, виртуальные машины и прикладные сервисы, но может не подойти для серьёзных AI-нагрузок.
Чтобы было проще подобрать сервер, сначала нужно определиться с линейкой. У HPE можно выделить три основных класса систем в разрезе возможностей GPU.
Универсальные серверы с поддержкой GPU
К этому классу относятся DL380 Gen12, DL340 Gen12, DL325 Gen11 и другие модели, для которых GPU являются одной из возможных конфигураций.
Их основные преимущества:
- проще встроить в существующую стойку и систему управления;
- можно сохранить больше места под накопители и сетевые карты;
- удобно начинать с одной или двух GPU;
- сервер остаётся пригодным для виртуализации, баз данных и обычных приложений;
- ниже требования к питанию и охлаждению, чем у максимально плотных AI-систем.
Основное ограничение — сравнительно небольшое количество мощных двухслотовых ускорителей. Кроме того, число доступных GPU может зависеть от дисковой корзины, райзеров, сетевой конфигурации и выбранных процессоров.
Серверы, изначально рассчитанные на ускорители
DL380a Gen12 — не обычный DL380 с дополнительным комплектом кабелей. Это 4U-платформа, в которой корпус, воздушные каналы, питание и расположение слотов рассчитаны на плотную установку GPU.
Ускорители размещаются по определённым схемам и распределяются между двумя процессорными сокетами. Такая архитектура подходит для:
- консолидации нескольких AI-сервисов;
- крупного инференса;
- дообучения моделей;
- обработки большого числа видеопотоков;
- параллельной работы нескольких команд.
За высокую плотность приходится платить повышенными требованиями к стойке, электропитанию и охлаждению.
Специализированные системы для обучения
Платформы уровня XD685 используют восемь ускорителей как единый вычислительный комплекс. В них важны не только сами GPU, но и высокоскоростная связь между ними, специализированная коммутация, питание и охлаждение.
Большое количество отдельных PCIe-карт не делает сервер эквивалентом системы HGX. Если модель постоянно передаёт тензоры между ускорителями, пропускная способность интерконнекта может влиять на время обучения сильнее, чем формальное количество GPU.
Сравнение HPE ProLiant для AI-нагрузок
| Платформа | Форм-фактор и CPU | Поддержка GPU | Подходящие задачи | Основное ограничение |
|---|---|---|---|---|
| HPE ProLiant Compute DL380a Gen12 | 4U, два Intel Xeon 6 | До 10 двухслотовых или 16 однослотовых GPU в поддерживаемых схемах | Плотный инференс, несколько моделей, дообучение, мультимодальные сервисы | Высокие требования к питанию, охлаждению и топологии |
| HPE ProLiant DL385 Gen11 | 2U, два AMD EPYC 9004/9005 | До 4 двухслотовых или 8 однослотовых GPU | RAG, инференс, компьютерное зрение, смешанные нагрузки | Ограниченный запас дальнейшего расширения GPU |
| HPE ProLiant Compute DL380 Gen12 | 2U, два Intel Xeon 6 | Несколько GPU, максимум зависит от комплектации | Универсальная инфраструктура, AI как одна из нагрузок | Слоты делятся с сетью, накопителями и контроллерами |
| HPE ProLiant Compute DL340 Gen12 | 2U, один Intel Xeon 6 | До 4 двухслотовых или 6 однослотовых GPU в GPU-шасси | Инференс, компьютерное зрение, экономичная одноcокетная система | Ниже запас по CPU и памяти |
| HPE ProLiant DL325 Gen11 | 1U, один AMD EPYC 9004/9005 | До 2 двухслотовых или 4 однослотовых GPU | Небольшие AI-узлы, VDI, периферийный инференс | Плотная компоновка и ограниченное расширение |
| HPE ProLiant Compute XD685 | 5U с жидкостным или 6U с воздушным охлаждением | 8 ускорителей NVIDIA или AMD | Обучение крупных моделей, полное дообучение, высокопроизводительные вычисления | Стоимость и требования к инфраструктуре ЦОД |
Указанные максимумы доступны не для любой конфигурации. Конкретное количество ускорителей зависит от модели GPU, её мощности, форм-фактора, выбранных райзеров, системы охлаждения и других плат расширения.
HPE ProLiant Compute DL380a Gen12: когда нужна высокая плотность GPU
Источник изображения: Сервер Молл
DL380a Gen12 занимает 4U и использует два процессора Intel Xeon 6. Платформа поддерживает PCIe 5.0 и рассчитана на конфигурации с 2, 4, 8 или 10 двухслотовыми ускорителями, а также с 8 или 16 однослотовыми. GPU устанавливаются парами и равномерно распределяются между процессорными сокетами.
Максимум в десять двухслотовых карт важен не сам по себе. Он даёт возможность:
- закрепить отдельные модели за выделенными ускорителями;
- увеличить число одновременных запросов к LLM;
- разместить разные версии модели для нескольких подразделений;
- параллельно выполнять дообучение и рабочий инференс;
- разделить компьютерное зрение, распознавание речи и генерацию текста;
- проводить несколько экспериментов без постоянного перераспределения оборудования.
Для каких нагрузок подходит DL380a Gen12
Платформа особенно хорошо раскрывается, когда GPU можно использовать независимо. Например, четыре ускорителя обслуживают основную языковую модель, две карты выделены под модель эмбеддингов, ещё две — под компьютерное зрение, а оставшиеся используются для тестирования.
DL380a также уместен для пакетного инференса, когда важна общая пропускная способность, а не минимальная задержка одного запроса. В таком режиме сервер одновременно обрабатывает большие группы заданий и распределяет их между ускорителями.
Другой сценарий — несколько команд или внутренних заказчиков. Высокая плотность позволяет выделить каждой группе собственные GPU, не разворачивая отдельный физический сервер для каждого проекта.
Почему десять GPU не всегда лучше восьми
Если одна крупная модель разделена между всеми ускорителями, важна скорость обмена между ними. PCIe обеспечивает связь GPU с процессорами, памятью и другими устройствами, но не всегда даёт такую же пропускную способность между ускорителями, как NVLink и NVSwitch в специализированных платформах.
На итоговую производительность влияют:
- расположение GPU относительно процессорных сокетов;
- объём видеопамяти каждой карты;
- возможность прямого обмена между ускорителями;
- поддержка выбранной топологии программной платформой;
- скорость передачи данных из оперативной памяти и NVMe;
- пропускная способность сети при объединении нескольких узлов.
Для нескольких независимых моделей десять PCIe-карт могут быть очень эффективны. Для синхронного обучения одной крупной модели восьмиускорительная система с быстрым интерконнектом часто предпочтительнее.
Ограничения плотной конфигурации
Высокоплотный узел концентрирует мощность и тепло в одном корпусе. При проектировании нужно учитывать:
- суммарное потребление GPU, CPU, памяти и сетевых адаптеров;
- число и тип подключений к PDU;
- резервирование блоков питания;
- допустимую мощность на стойку;
- температуру входящего воздуха;
- возможность прямого жидкостного охлаждения;
- стоимость простоя узла, на котором размещено много сервисов.
Иногда два менее плотных сервера удобнее одного максимально заполненного: их проще охлаждать, обслуживать и резервировать.
HPE ProLiant DL385 Gen11: сбалансированная AMD-платформа
Источник изображения: HPE
DL385 Gen11 — двухсокетный 2U-сервер на AMD EPYC 9004 и 9005. Он поддерживает до четырёх двухслотовых или восьми однослотовых GPU, PCIe 5.0 и до 6 ТБ DDR5.
Это делает DL385 интересным не только как GPU-узел, но и как сервер, на котором рядом с моделью выполняются поиск, подготовка данных, хранение и прикладная логика.
Платформа подходит для:
- RAG с локальной векторной базой;
- инференса одной крупной или нескольких средних моделей;
- дообучения LoRA и QLoRA;
- классического машинного обучения;
- обработки изображений и видеопотоков;
- виртуальных рабочих станций с GPU;
- контейнерной среды со смешанными сервисами.
Почему процессоры остаются важными
Даже когда основная модель работает на GPU, процессоры выполняют значительную часть конвейера:
- очищают и преобразуют входные данные;
- разбивают текст на токены;
- выполняют поиск и фильтрацию документов;
- распаковывают датасеты;
- декодируют изображения, аудио и видео;
- обслуживают сетевые соединения;
- запускают векторную базу, контейнеры и виртуальные машины.
Поэтому серверы на AMD EPYC нужно сравнивать не только по количеству ядер. Важны частота, пропускная способность памяти, заполнение каналов, доступные линии PCIe и распределение устройств между сокетами.
Где заканчиваются преимущества универсальности
Четырёх мощных двухслотовых GPU достаточно для многих корпоративных проектов, но может не хватить для крупной модели, которую нельзя эффективно квантизировать или разделить.
Установка ускорителей также влияет на остальные компоненты:
- часть слотов расширения становится недоступной;
- количество накопителей может зависеть от GPU-комплекта;
- тепловые ограничения сокращают список допустимых CPU и GPU;
- переход с двух на четыре карты может потребовать других райзеров, вентиляторов и блоков питания.
Если уже на этапе проектирования понятен рост до восьми–десяти мощных GPU в одном узле, DL380a даёт более прямой путь масштабирования.
Intel Xeon или AMD EPYC для AI-сервера
Выбор между Intel и AMD нельзя отделять от конкретной серверной платформы. DL380a Gen12 построен вокруг Intel Xeon 6 и высокой плотности ускорителей. DL385 Gen11 использует AMD EPYC и делает акцент на балансе CPU, памяти, GPU и хранения.
На какие параметры смотреть
Количество ядер важно для параллельной подготовки данных, виртуализации и обслуживания множества процессов. Для последовательных этапов, части операций токенизации и сетевой логики может быть важнее производительность одного ядра.
В AI-системе также имеют значение:
- пропускная способность памяти;
- число заполненных каналов;
- количество линий PCIe;
- топология подключения GPU;
- энергопотребление процессоров;
- стоимость лицензий, рассчитываемых по ядрам или сокетам.
NUMA и расположение устройств
В двухсокетной системе каждая GPU физически подключена к определённому процессору. Если приложение обращается к памяти другого сокета или передаёт данные устройству на противоположной стороне, возникает дополнительный переход через межпроцессорное соединение.
NUMA-архитектуру необходимо учитывать при:
- закреплении процессов за ядрами;
- размещении оперативной памяти;
- распределении GPU между контейнерами;
- установке сетевых карт и NVMe;
- настройке виртуальных машин с прямым пробросом устройств.
При подборе серверов на Intel Xeon для AI важна не только модель CPU, но и влияние процессоров на допустимые режимы GPU, охлаждение и общую мощность системы.
Для инференса, почти полностью ограниченного GPU, различия между ускорителями и их топологией обычно важнее бренда процессора. Для RAG, подготовки данных и мультимодальной обработки CPU может заметно влиять на задержку всего сервиса.
Какой сервер нужен для разных AI-задач
| Сценарий | Основное узкое место | Требования к GPU | Подходящий сервер | Что часто недооценивают |
|---|---|---|---|---|
| Инференс LLM | Видеопамять, KV-кэш, параллельность запросов | От одной GPU до нескольких карт с достаточной VRAM | DL385 для умеренного масштаба, DL380a для высокой плотности | Длину контекста и количество одновременных сессий |
| RAG | Баланс GPU, CPU, RAM, NVMe и сети | Обычно 1–4 GPU | DL385, DL380, DL325; DL380a для нескольких моделей | Поиск и подготовка контекста |
| LoRA и QLoRA | VRAM, чтение датасета, обмен между GPU | Часто 1–4 мощные GPU | DL385 или DL380a | Интенсивную запись контрольных точек |
| Полное обучение | Объём VRAM и соединение между GPU | 8 тесно связанных ускорителей или несколько узлов | XD685 и другие специализированные системы | Сеть и файловую систему |
| Классическое машинное обучение | CPU, RAM, чтение данных | Иногда достаточно одной GPU | Универсальный DL380, DL385 или DL325 | Не каждый алгоритм масштабируется на несколько GPU |
| Компьютерное зрение | Декодирование, число потоков, VRAM | Зависит от разрешения и модели | DL340, DL385 или DL380a | Входящий трафик и декодирование видео |
| Мультимодальные модели | VRAM, обработка данных, хранение объектов | Несколько GPU при высокой нагрузке | DL385 или DL380a, для обучения — XD685 | Нагрузку на CPU, RAM и NVMe |
Инференс LLM
Для запуска языковой модели сначала оценивают, помещаются ли её веса в видеопамять в выбранном формате. Но этого недостаточно. Дополнительную VRAM занимает KV-кэш — данные, которые модель сохраняет для уже обработанного контекста.
Потребление памяти растёт при увеличении:
- длины контекста;
- числа одновременных пользователей;
- размера пакетной обработки;
- числа параллельных последовательностей;
- точности вычислений.
Модель может свободно помещаться на GPU в одиночном тесте, но исчерпать память под реальной нагрузкой. Поэтому сервер выбирают по целевой параллельности и задержке, а не только по количеству параметров.
DL385 подходит, когда достаточно одной–четырёх мощных карт. DL380a лучше раскрывается при размещении нескольких моделей, высокой параллельности или выделении отдельных GPU разным сервисам.
RAG
В системе генерации с поиском GPU отвечает только за часть конвейера. До обращения к языковой модели необходимо найти документы, отфильтровать результаты, собрать контекст и передать его на генерацию.
На задержку влияют:
- скорость векторной базы;
- объём индекса в RAM;
- производительность CPU;
- скорость NVMe;
- сеть между компонентами;
- модель эмбеддингов;
- длина сформированного контекста.
Если векторная база и модель работают на одном сервере, DL385 удобен большим объёмом памяти и сильной процессорной частью. Если один узел обслуживает несколько генеративных моделей и множество пользователей, более плотный DL380a может быть выгоднее.
Дообучение LoRA и QLoRA
Эти методы изменяют ограниченную часть параметров и требуют меньше памяти, чем полное дообучение. Для многих корпоративных моделей достаточно одной–четырёх GPU, поэтому DL385 Gen11 позволяет закрыть задачу без перехода к специализированной восьмиускорительной платформе.
DL380a имеет смысл, когда:
- несколько команд обучают модели одновременно;
- нужно параллельно проверять гиперпараметры;
- ожидается увеличение размера моделей;
- часть GPU должна оставаться доступной для инференса.
При расчёте хранения необходимо учитывать исходный датасет, подготовленные версии, контрольные точки, журналы экспериментов и временные файлы.
Полное обучение крупных моделей
В полном обучении на каждом шаге синхронизируются веса, градиенты и состояния оптимизатора. Если данные постоянно передаются через обычную PCIe-топологию, дополнительные ускорители могут давать всё меньший прирост.
Для этого класса задач важны:
- NVLink или NVSwitch внутри узла;
- сеть 200/400 Гбит/с между узлами;
- удалённый прямой доступ к памяти;
- параллельная файловая система;
- стабильная подача данных без простоев GPU;
- охлаждение всей стойки.
При выборе специализированной платформы, вроде XD685, нельзя считать её просто более дорогим DL380a. Это система другого класса, рассчитанная на восемь тесно связанных ускорителей и крупные задачи обучения, поэтому иногда она станет оптимальным выбором вместо классических серверов.
Компьютерное зрение и мультимодальные модели
Для видеоаналитики нужно считать не только скорость работы нейросети. Перед инференсом потоки принимаются по сети, декодируются, масштабируются и преобразуются. CPU или аппаратные блоки декодирования могут стать узким местом раньше вычислительных ядер GPU.
В мультимодальных моделях добавляются:
- загрузка изображений, аудио и видео;
- временное хранение файлов;
- преобразование форматов;
- работа нескольких энкодеров;
- более крупный контекст;
- повышенное потребление RAM и VRAM.
DL340 подходит для компактного одноcокетного узла компьютерного зрения. DL385 — для сбалансированной обработки и хранения. DL380a нужен, когда в одном сервере объединяется много потоков, моделей или независимых сервисов.
Как выбирать GPU
Объём видеопамяти
Максимальная вычислительная производительность бесполезна, если модель не помещается в VRAM.
Необходимый объём зависит от:
- количества параметров;
- формата весов;
- длины контекста;
- размера KV-кэша;
- пакетной обработки;
- метода дообучения;
- необходимости хранить градиенты и состояние оптимизатора.
Квантизация уменьшает потребление памяти, но может повлиять на точность, скорость отдельных операций и требования к программному обеспечению. Расчёт нужно проверять на выбранной модели, движке инференса и реальном профиле запросов.
Однослотовые и двухслотовые ускорители
Однослотовые карты позволяют разместить больше независимых устройств. Они удобны для нескольких небольших моделей, инференса, VDI и видеопотоков.
Двухслотовые GPU обычно имеют более высокий тепловой пакет, больший объём памяти и производительность, но занимают больше места и требуют усиленного охлаждения.
Сравнивать нужно не «16 против 10», а конкретные поддерживаемые карты, их VRAM, мощность и способ подключения.
PCIe, NVLink и NVSwitch
PCIe соединяет ускоритель с процессором, памятью, сетью и накопителями. NVLink создаёт более быстрые соединения между совместимыми GPU. NVSwitch объединяет несколько ускорителей через специализированную коммутационную среду.
PCIe 5.0 увеличивает пропускную способность шины, но не превращает отдельные карты в единый модуль HGX. Для независимого инференса это может быть некритично. Для обучения и разделения одной модели между многими GPU разница становится существенной.
Совместимость определяется всей конфигурацией
В ProLiant нельзя устанавливать GPU только потому, что карта физически помещается в слот.
Поддержка зависит от:
- версии корпуса и системной платы;
- райзеров;
- кабелей питания;
- блоков питания;
- комплекта вентиляторов;
- теплового пакета CPU и GPU;
- версии BIOS и iLO;
- драйверов и операционной системы.
В DL380a Gen12 также нельзя произвольно смешивать разные модели GPU в одной системе. Допустимые ускорители и ограничения необходимо сверять с актуальными QuickSpecs.
Что ещё ограничивает производительность AI-сервера
Оперативная память
RAM используется для загрузки моделей, подготовки данных, кэширования документов, работы векторной базы и буферов ввода-вывода.
При выгрузке части весов или KV-кэша из VRAM требования к системной памяти и PCIe возрастают, а задержка может заметно ухудшиться.
Важны не только гигабайты, но и:
- число занятых каналов;
- частота модулей;
- симметрия между сокетами;
- локальность памяти относительно GPU;
- запас для контейнеров и операционной системы.
NVMe
Для AI-узла полезно разделять роли накопителей:
- загрузочный массив;
- хранилище моделей;
- рабочие датасеты;
- индекс векторной базы;
- временное пространство;
- контрольные точки обучения.
Последовательная скорость важна при загрузке крупных файлов, а задержка и количество операций ввода-вывода — при работе с большим числом мелких объектов.
Для обучения также нужно учитывать ресурс перезаписи: контрольные точки и промежуточные данные создают интенсивную запись. Локальные диски при этом не должны быть единственным местом хранения моделей и результатов.
PCIe и топология
Количество физических слотов не равно количеству полноскоростных соединений. GPU, NVMe, сетевые карты и контроллеры используют общий ресурс PCIe.
Неудачная компоновка приводит к тому, что:
- данные идут через другой процессорный сокет;
- сетевая карта находится далеко от обслуживаемой GPU;
- несколько устройств делят пропускную способность;
- контейнер получает память не из того NUMA-узла;
- ускорители простаивают в ожидании данных.
Сеть
Для одиночного узла и небольшого RAG часто достаточно 10 или 25 Гбит/с. Сеть 100 Гбит/с полезна, когда модели и данные хранятся отдельно, несколько серверов совместно обслуживают инференс или требуется быстро загружать крупные датасеты.
Для распределённого обучения обычно рассматривают 200/400 Гбит/с, RoCE или InfiniBand.
Ethernet остаётся универсальным транспортом. RoCE добавляет удалённый прямой доступ к памяти поверх совместимой Ethernet-инфраструктуры, но требует правильной настройки сети. InfiniBand обеспечивает низкую задержку, однако повышает стоимость и сложность поддержки системы.
Питание, охлаждение и требования к стойке
GPU-сервер нельзя выбирать отдельно от дата-центра. Номинал блоков питания ещё не показывает реальное потребление: необходимо сложить мощность ускорителей, процессоров, памяти, накопителей, сетевых карт и вентиляторов, а затем учесть резервирование.
Для плотных конфигураций проверяют:
- мощность и тип PDU;
- число доступных подключений;
- схему резервного питания;
- допустимую мощность на стойку;
- тепловыделение соседних серверов;
- температуру воздуха на входе;
- направление воздушного потока;
- возможность жидкостного охлаждения;
- допустимую нагрузку на стойку и фальшпол.
Мощный GPU-сервер не подходит для обычной серверной рядом с офисом только потому, что корпус физически помещается в стойку. Высокая температура и недостаточный отвод тепла могут привести к снижению частот или невозможности использовать максимальную конфигурацию.
Альтернативы DL380a Gen12 и DL385 Gen11
HPE ProLiant Compute DL380 Gen12
Универсальный двухсокетный сервер на Intel Xeon 6 подходит, когда GPU — только одна из нагрузок. Он оставляет больше свободы для накопителей, сетевых адаптеров и обычных приложений, но уступает DL380a по плотности ускорителей.
HPE ProLiant Compute DL340 Gen12
DL340 Gen12 — 2U-система с одним Intel Xeon 6. В GPU-шасси она поддерживает до четырёх двухслотовых или шести однослотовых ускорителей.
Такой вариант интересен, если второй CPU не нужен, но требуется больше GPU, чем обычно помещается в компактный 1U-сервер.
HPE ProLiant DL325 Gen11 и DL325 Gen12
DL325 Gen11 — односокетный 1U-сервер на AMD EPYC с поддержкой до двух двухслотовых или четырёх однослотовых GPU. Он подходит для периферийного инференса, виртуальных рабочих мест, небольших моделей и распределённых узлов компьютерного зрения.
DL325 Gen12 является более новым вычислительным сервером, но позиционируется HPE прежде всего как плотная одноcокетная платформа общего назначения. Если задача требует нескольких GPU, конкретную Gen12-конфигурацию необходимо особенно внимательно сверять с актуальными QuickSpecs.
HPE ProLiant DL380a Gen11
Предыдущее поколение поддерживает до четырёх двухслотовых или восьми однослотовых ускорителей. На вторичном рынке оно может быть выгодно для инференса и дообучения, если совместимо с нужными GPU.
Сравнивать нужно не цену пустого корпуса, а стоимость готовой конфигурации, включая:
- GPU-комплекты;
- райзеры;
- кабели питания;
- производительные вентиляторы;
- блоки питания;
- лицензии и драйверы;
- актуальные прошивки.
HPE ProLiant Compute XD685
XD685 рассчитан на восемь ускорителей NVIDIA или AMD и выпускается в вариантах с прямым жидкостным и воздушным охлаждением.
Переход к такой платформе оправдан, когда задача требует:
- восьми тесно связанных GPU;
- высокоскоростной фабрики внутри узла;
- сети 200/400 Гбит/с между серверами;
- специализированного охлаждения;
- параллельного хранения;
- программной среды распределённого обучения.
Для нескольких независимых моделей DL380a может быть гибче. Для одной крупной задачи XD685 лучше соответствует архитектуре нагрузки.
Примеры конфигураций по типу нагрузки
Небольшой корпоративный RAG
Обычно достаточно одной–двух GPU с подходящим объёмом VRAM, большого запаса RAM, быстрых NVMe и сети 25–100 Гбит/с.
DL385 удобен, если векторная база и модель находятся в одном узле. DL325 Gen11 или универсальный DL380 подходят для более компактной системы.
Несколько LLM для разных подразделений
Если модели работают независимо, полезнее распределить их по отдельным GPU, чем пытаться объединить все ускорители в один вычислительный домен.
DL380a позволяет разместить больше сервисов в одном корпусе, но требует ограничения ресурсов и резервного сценария на случай отказа узла.
Дообучение LoRA или QLoRA
Две–четыре GPU, быстрый локальный NVMe и достаточная RAM часто закрывают потребности корпоративного дообучения.
DL385 подходит при умеренном масштабе. DL380a — при параллельных экспериментах и ожидаемом росте.
Обучение крупной модели
Восемь связанных ускорителей, высокоскоростная сеть, параллельная файловая система и специализированное охлаждение указывают на класс XD685.
Максимальная конфигурация DL380a не устраняет ограничений обмена между отдельными PCIe-картами.
Ответы на частые вопросы
Можно ли установить в ProLiant любую серверную GPU?
Нет. Нужны официально поддерживаемая карта, совместимые райзеры, питание, вентиляторы, прошивки и подходящая конфигурация корпуса. В теории запуск GPU возможен, но гарантии стабильной работы при выборе карты не из HCL не будет.
Подойдёт ли DL380a Gen12 для обучения моделей?
Да, особенно для дообучения и параллельных экспериментов. Для полного обучения крупной модели на восьми GPU специализированная HGX-платформа может быть эффективнее благодаря быстрому обмену между ускорителями.
Всегда ли большее количество GPU означает большую скорость?
Нет. Производительность могут ограничивать объём VRAM, топология, обмен между GPU, CPU, RAM, NVMe, сеть и программное обеспечение.
Нужны ли два процессора?
Не всегда. Второй CPU полезен при большом количестве ускорителей, интенсивной подготовке данных и необходимости в дополнительных линиях PCIe. Для одной–двух GPU односокетная система может быть дешевле и проще.
Что важнее для RAG — GPU или NVMe?
Оба компонента решают разные задачи. GPU выполняет генерацию и часто расчёт эмбеддингов, а NVMe, RAM и CPU обслуживают поиск, индекс, документы и подготовку контекста. Скорость системы определяется самым медленным этапом.
Какую платформу выбрать
- HPE ProLiant Compute DL380a Gen12 — для высокой плотности GPU, нескольких AI-сервисов, масштабного инференса и большого запаса расширения.
- HPE ProLiant DL385 Gen11 — для одной–четырёх мощных GPU, RAG и смешанной нагрузки, где важны CPU, оперативная память и NVMe.
- DL380 Gen12, DL340 Gen12 и DL325 Gen11 — когда достаточно небольшого или среднего числа ускорителей и нужна более универсальная или компактная система.
- HPE ProLiant Compute XD685 — для полного обучения и дообучения крупных моделей, чувствительных к скорости обмена между восемью GPU.
Окончательный выбор начинается не с названия сервера, а с расчёта видеопамяти, количества одновременных запросов, топологии ускорителей, объёма данных и возможностей дата-центра. Только после этого можно определить, нужен ли универсальный ProLiant, плотный DL380a или специализированная восьмиускорительная платформа.

