Выберите ваш город

Сергей Алимушкин: «Кремниевая лихорадка: планирование ИИ-инфраструктуры в дефиците»

Опубликовано 19.08.2026
16 мин
13
Сергей Алимушкин: «Кремниевая лихорадка: планирование ИИ-инфраструктуры в дефиците»  Изображение 1

Коммерческий директор «Сервер Молл» Сергей Алимушкин — о производстве GPU, тотальном дефиците, ценах в $2 млн за сервер и в каком году ждать улучшений.

Сергей Алимушкин

Сергей Алимушкин

Коммерческий директор Сервер Молл

Эксперт по антикризисному управлению, оптимизации ИТ-процессов и развитию инфраструктурных решений.

Подробнее про эксперта



ИИ-продукты — больше не эксперимент, а фактор конкурентоспособности. Компании закладывают бюджеты на обучение собственных моделей, внедряют генеративный ИИ в разработку, аналитику, службы поддержки и внутренние процессы, но закупка серверов с GPU под ИИ-вычисления осложнена жесточайшим дефицитом.

Проблема не в ценах, так как даже при достаточном бюджете компании до полугода ждут поставок GPU-серверов, из-за чего отменяют проекты, откладывают запуск новых продуктов и ищут альтернативные поставки с мгновенной доступностью.

За недостаточный объем GPU одновременно конкурируют целые страны, крупнейшие мировые облачные провайдеры, гиперскейлеры, разработчики ИИ-моделей, госы, лаборатории, корпоративный сектор и стартапы.

В этом интервью мы поговорили с Сергеем Алимушкиным, коммерческим директором компании Сервер Молл (поставщик и интегратор ИТ-инфраструктуры), о том, почему производство растет, но мировой рынок не может насытиться GPU, какие сложности мешают наращивать производство, когда стабилизируются поставки и как планировать ИИ-инфраструктуру в таких условиях.

— Сергей, в прошлый раз мы обсуждали скорость принятия решений о закупках, так как гиперскейлеры и другие компании сметают все GPU с рынка по любым ценам. В том интервью мы говорили о ценообразовании GPU для серверов, дефиците, логистике и строгом контроле со стороны Nvidia. Сейчас, судя по новостям, ситуация стала еще сложнее.

— Все так. Я немного расскажу о том, как устроены сами GPU для ИИ и их производство, чтобы стало понятно, почему дефицит до сих пор с нами, а ждать улучшений в ближайшие полгода-год не стоит.

Итак, любой современный чип с транзисторами, например от AMD или Nvidia, основан на кремниевой подложке (отсюда, кстати, и название Кремниевой долины в Калифорнии) — таком тонком круглом диске из сверхчистого монокристаллического кремния, который сначала добывают в карьерах, очищают, плавят, обрабатывают и нарезают на пластины, похожие на блины. На деле процесс чуть сложнее, но суть такая. Так вот раньше сложности у TSMC и других фабрик были в основном на этом этапе производства, но теперь, с бумом ИИ, добавилась еще одна проблема — дефицит производственных линий с упаковкой кристаллов на кремниевом интерпозере по технологии CoWoS (Chip-on-Wafer-on-Substrate).

CoWoS-L.png

CoWoS-L, источник изображения: https://3dfabric.tsmc.com

CoWoS, если сильно не углубляться, позволяет на одной кремниевой подложке соединить вычислительные ядра, память HBM (то есть сделать не просто чип, а чиплет) и другие компоненты. Но это не просто сборка чиплетов (так умеют многие) — это еще и соединение компонентов через кремниевую подложку-посредник (интерпозер), отсюда и получается сумасшедшая плотность контактов и скорость обмена с HBM-памятью. И, к сожалению, эти производственные линии CoWoS забронированы до середины 2027 года.

Конечно же, беда одна не ходит, и ситуацию усугубил дефицит самой HBM-памяти. Например, флагманскому GPU Nvidia B300 нужно аж 288 ГБ такой памяти, а производство 1 гигабайта HBM требует в 3–4 раза больше кремниевых пластин, чем стандартная DDR5, так как чипы c HBM — это что-то вроде небоскребов из 8, 12 или 16 слоев памяти, склеенных вертикально. На каждый слой нужна полноценная кремниевая подложка. Крупнейшие производители — Samsung, SK Hynix и Micron — досрочно распродали весь объем DRAM и HBM на 2027 год. И большинство покупателей получают лишь 60–70% от запрошенного объема.

Представьте, что вы собираете двигатель для автомобиля: у вас есть все технологии, люди, деньги, покупатель, да и сам автомобиль собран (не считая двигателя). Но вы не можете собрать блок цилиндров, потому что нужен уникальный сверхточный станок, очередь на который расписана на годы вперед. А еще сырья хватает лишь на 60 двигателей, когда купить хотят 100.

Вот так и с GPU — мир уперся в физические ограничения производства.

Серверы GIGABYTE для AI

Для AI
Новый
Gigabyte G894-SD3-AAX7 8SFF/NVMe
CPU:
2× Intel Xeon 6 6700-серии или 6500-серии с TDP до 350W в сокетах LGA 4710
RAM:
8192GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B300 SXM

от 83 931 300

2 916 613 ₽/мес в лизинг

от 68 796 148

+ 15 135 152 НДС

Для AI
Новый
Gigabyte G294-A22-AAP2 8SFF
CPU:
1x Intel Xeon 6944P (72c/144t, 1.8GHz-3.9GHz, 350W)
RAM:
1152GB (DDR5 ECC REG)
GPU:
4 x NVIDIA RTX PRO 6000 Blackwell

от 12 574 296

436 957 ₽/мес в лизинг

от 10 306 800

+ 2 267 496 НДС

Для AI
Новый
Gigabyte G593-SD1-AAX3 8SFF/NVMe
CPU:
2x LGA4677 и процессоры Intel Xeon Scalable 4/5-го поколения, а также Intel Xeon CPU Max Series
RAM:
8192GB (DDR5 ECC REG)
GPU:
8 x NVIDIA H200

от 56 972 292

1 979 787 ₽/мес в лизинг

от 46 698 600

+ 10 273 692 НДС

Для AI
Новый
Gigabyte AI TOP ATOM
CPU:
GB10 Grace Superchip
RAM:
128GB (LPDDR5x)
GPU:
1 x NVIDIA GB10

от 707 600

24 589 ₽/мес в лизинг

от 580 000

+ 127 600 НДС

— То есть даже американские компании не могут просто прийти и купить нужные серверы?

— Нет. Даже в США и Европе стандартный срок отгрузки по официальным контрактам — от 4–5 месяцев до полугода. У нас привыкли, что проблемы поставок появились из-за санкций, но на деле весь мир конкурирует за одни и те же дефицитные ресурсы: американцы, европейцы, китайцы, мы и все остальные. Оборудование нужно крупнейшим облачным платформам, гиперскейлерам, разработчикам больших языковых моделей, крупному и среднему бизнесу, государственным проектам и т.д. Когда производитель открывает новое окно поставок, почти все объемы резервируют задолго до того, как чип начнут производить.

Поэтому все готовы ждать до полугода. А куда деваться? Новая фабрика TSMC не появится завтра (хотя ее строят), а альтернатив по оборудованию просто не существует.

— Почему не стоит ждать улучшений в ближайшие полгода-год? В 2024 году, когда уже начался дефицит, TSMC пообещала удвоить (до 32 тысяч пластин в месяц) производство процессоров с упаковкой CoWoS на своих фабриках на Тайване. Это не помогло?

— Помогло, но спрос растет вместе с предложением. Скажу вам больше: TSMC производит уже по 120-140 тысяч пластин ежемесячно. А если посчитать с подрядчиками (ASE, Amkor), то все 200 тысяч. Nvidia потребляет около 60% всего объема для чипов на архитектурах Blackwell и Rubin, а еще есть AMD, Broadcom и крупные облачные провайдеры, вроде AWS, Google и Microsoft.

— Сергей, когда мы увидим ИИ-серверы по официальной отпускной цене?

— Когда закончится этот идеальный шторм. По прогнозам к концу 2026 года разрыв между спросом и предложением на TSMC CoWoS уменьшится с 20% до 10%. Хорошо, если ситуация с поставками улучшится к концу 2027 года, но из-за отложенного спроса я бы не рассчитывал на заводские цены и полные склады с готовыми ИИ-серверами с GPU. А еще и дефицит памяти никуда не делся: как HBM для GPU, так и DDR5 для серверов и других устройств.

Например, есть заводской прайс — $500 тысяч, — если вы встали в очередь полгода назад. При такой отпускной цене конечные покупатели сметают серверы по $2 миллиона — вот такая премия за «здесь и сейчас». Особенно хороший аппетит в этом деле у китайцев — они по всему миру выкупают все, что находят. На стоковом рынке в Азии за готовый сервер с Nvidia B300 просят 12-13 миллионов юаней (около $1,7-1.9 миллиона) и выше. Но серверы все равно покупают, потому что потребление токенов ИИ-моделями за последний год выросло в 6–7 раз.

Так что по моим оценкам, если не случится нового бума, заводская цена возможна (с оговорками) в 2028 году на официальных рынках.

— Раз уж заговорили о деньгах: как планировать бюджет, окупаемость и другие финансовые моменты, связанные с ИИ-серверами?

— Отличный вопрос, его задают почти все наши клиенты. Первый шаг перед покупкой GPU-сервера — это расчет показателя рентабельности инвестиций (ROI, Return-on-Investment). В прошлом интервью я уже рассказал, что внедрение ИИ в бизнес-процессы может сильно повысить производительность, особенно у крупных компаний. Но многомиллионные инвестиции без погружения в ИИ-проект не сделают его выгодным (скорее наоборот). Нужно понимать, сколько часов в месяц ваш физический GPU будет реально загружен, сколько будет стоить один час таких вычислений с учетом электричества, охлаждения, обслуживания, оплаты труда и амортизации.

Иногда расчеты показывают, что покупать сервер на Nvidia B300 экономически нецелесообразно, даже если очень хочется и деньги есть: проекту не нужна такая производительность постоянно, а загрузка GPU будет всего 20–30%. Таким клиентам мы советуем собрать сервер попроще (на тех же H200), а масштабироваться по мере роста. Да, это не столь изящно с точки зрения архитектуры, зато бизнес не переплачивает за оборудование, которое стоит без дела. Некоторые вообще решают арендовать мощности в облаке, но там много своих нюансов, начиная от конфиденциальности и стабильности, заканчивая требованиями регуляторов.

И наоборот, если GPU нужны постоянно, загрузка околомаксимальна, есть стабильный объем задач на несколько лет и аренда обходится дороже владения, то свои GPU-серверы окупятся довольно быстро.

Поэтому сначала проводим аудиты, считаем ROI, а уже потом подбираем железо.

— Уже несколько раз вы упомянули Nvidia B300. Это лучший GPU для ИИ на сегодня?

— Короткий ответ — да. Но вообще я бы поставил вопрос иначе, так как лучшего GPU не существует: он либо подходит под задачу, либо нет.

Если компании нужно обучать собственные большие модели, работать с триллионами параметров или строить крупные ИИ-кластеры, то, пожалуй, Nvidia B300 — лучшее на сегодня решение. У него огромная вычислительная производительность и запредельный объем памяти, высочайшая пропускная способность памяти и прекрасная энергоэффективность (по сравнению с предыдущим поколением), а еще — оптимизированное ПО. Поэтому все крупнейшие облачные провайдеры и гиперскейлеры сейчас выстраиваются за B300 в очередь. На российском рынке его выбирает в основном финтех, продуктами которого мы пользуемся ежедневно.

Но не каждый заказчик может потратиться на сервер с B300 — слишком дорого и инфраструктура не всегда готова. Многие крупные компании занимаются не только обучением фундаментальных моделей, но и инференсом (то есть выводом), дообучением существующих LLM, компьютерным зрением, рекомендательными системами или корпоративными ИИ-сервисами. Для таких задач подойдет и Nvidia H200 предыдущего поколения: производительности хватает с головой, 141 ГБ памяти — тоже, при этом стоимость в два раза ниже. А бизнес поменьше и вовсе берет видеокарты, которые можно установить в любую совместимую базу: Nvidia H100, RTX 2000 и 6000 Server Edition и т.п.

Так что есть два сценария. Если нужен флагман и бюджет позволяет — выбирают B300. Если же нужно оптимальное соотношение цены, производительности и доступности, то очень многие останавливаются на H200 или (редко) на видеокартах.

Серверы NVIDIA DGX

Для AI
Новый
Nvidia DGX Spark GB10 1NVMe
1x NVIDIA GB10 Grace CPU (10 ядер Cortex-X925, 10 ядер Cortex-A725) / 128GB / 1x БП

от 599 000

20 815 ₽/мес в лизинг

от 490 984

+ 108 016 НДС

Для AI
Новый
NVIDIA DGX B300
CPU:
2x Intel Xeon 6776P (64c/128t, 2.3GHz-3.9GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B300 SXM

от 118 611 206

4 121 739 ₽/мес в лизинг

от 97 222 300

+ 21 388 906 НДС

Для AI
Новый
NVIDIA DGX H200
CPU:
2x Intel Xeon Platinum 8480C (56c/112t, 2GHz-3.8GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA H200

от 65 305 746

2 269 375 ₽/мес в лизинг

от 53 529 300

+ 11 776 446 НДС

Для AI
Новый
NVIDIA DGX A100 2NVMe
CPU:
2x AMD EPYC 7742 (64c/128t, 2.25GHz-3.4GHz, 225W)
RAM:
2000GB (DDR4 ECC REG)
GPU:
8 x NVIDIA A100

от 16 162 926

561 662 ₽/мес в лизинг

от 13 248 300

+ 2 914 626 НДС

— А что насчет нового поколения GPU Nvidia Vera Rubin, которое обещает стать еще мощнее? Может, бизнесу стоит подождать его, а не гоняться за дефицитным B300?

— У них новая архитектура, да и характеристики впечатляют, но пока есть только выставочные образцы. Массовое производство запустят к концу года, а первые партии целиком уйдут гиперскейлерам, которые выкупили их еще, вероятно, до официального анонса. Для остального рынка, тем более для нас, Rubin — это экзотика. А потому ориентируемся на то, что физически есть на складах и что можно заказать в обозримом будущем, привезти и установить в стойку. А это, если брать самые востребованные решения, B300 и H200.

— А есть ли какая-то альтернатива большим GPU-серверам, когда нужны платформы для ИИ, но нет возможности ждать B300 или H200 несколько месяцев?

— Да, есть отдельный сегмент устройств — ИИ рабочие станции (по сути мини-суперкомпьютеры), компактные и как правило односокетные системы в привычном офисном форм-факторе. Для таких систем даже серверная комната не обязательна — можно поставить на рабочий стол. Они, конечно, не заменят полноценный GPU-кластер, но зато можно получить вычислительные мощности для ИИ без ожидания и огромных переплат.

Nvidia DGX Spark GB10.png

Nvidia DGX Spark GB10 справа от ноутбука, источник изображения: https://www.nvidia.com

Например, есть малыш Nvidia DGX Spark на базе суперчипа GB10. Очень компактная система с 128 ГБ унифицированной памяти, CPU и GPU (и все это внутри одного чипа). По сути, это персональный ИИ-суперкомпьютер, который можно поставить на стол разработчика, подключить к сети и использовать для разработки, тестирования и запуска моделей локально. NVIDIA прямо позиционирует DGX Spark для прототипирования, тонкой настройки моделей (fine-tuning) и работы с моделями вплоть до 200 млрд параметров на одной системе.

Если компания или стартап создает собственного ИИ-ассистента, сервис компьютерного зрения или дообучает открытую языковую модель, ей не нужно сразу покупать доргущие серверы. Разработчику с головой хватит такой локальной машины, чтобы развернуть тот же CUDA-стек, провести эксперименты и проверить модель.

Настольный суперкомпьютер для ИИ с NVIDIA GB300 Grac Blackwell Ultra Desktop Superchip.png

Настольный суперкомпьютер для ИИ с NVIDIA GB300 Grac Blackwell Ultra Desktop Superchip, источник изображения: https://www.gigabyte.com

Есть устройства и классом повыше — рабочие станции размером с настольный игровой ПК, вроде GIGABYTE W775-V10-L01 на NVIDIA GB300 Grace Blackwell Ultra. Там уже 252 ГБ HBM3E с пропускной способностью 7,1 ТБ/с и 496 ГБ LPDDR5X для CPU. Такая система максимально близка к ИИ-серверам, но дешевле, проще в развертывании и обслуживании.

Да, DGX Spark и рабочая станция от GIGABYTE, хороши, но они не заменят большие серверы с H200 или B300: для массового обслуживания пользователей, обучения фундаментальных моделей или большого количества параллельных задач все равно нужен кластер. Так что, если ваши задачи закрывают устройства этого класса, то нет смысла конкурировать с гиперскейлерами за каждую доступную B300. Берите рабочую станцию для ИИ и сразу начинайте работать над минимально жизнеспособным продуктом (MVP), а большие GPU-серверы можно заказать отдельно, немного подождать и получить их, когда уже будете выводить продукт на рынок.

— Есть ли какая-то жизнь вне экосистемы Nvidia? Почему не взять AMD Instinct, чтобы сэкономить? Они не сильно отстают в технологиях, а цены ниже.

— У AMD отличное железо, которое по сухим характеристикам догоняет Nvidia, но почти все главные мировые ИИ-модели написаны под CUDA (Compute Unified Device Architecture) — этаким расширением языка программирования, которое позволяет инженерам писать программы так, чтобы GPU понимал сложные математические ИИ-задачи и решала их на огромной скорости. Переход на аналогичный стек программного обеспечения AMD ROCm — это от 3 до 6 месяцев ручной доработки кода, доустановки библиотек и исправления багов под конкретные модели. А еще надо где-то найти и нанять первоклассных инженеров. К тому же AMD производят свои чипы тоже на заводах TSMC, а тайваньцы отдают приоритет огромным заказам Nvidia. Так что достать GPU AMD Instinct на рынке тоже трудно.

Не все готовы рисковать показателем вывода новых продуктов на рынок (TTM, Time-to-Market) ради экономии на железе, но как раз крупные гиперскейлеры и облачные провайдеры этот риск нивелируют деньгами и мощными инженерами. Обучать модели на AMD, может, и сложнее, но инференс (вывод) обученной модели для сотен миллионов пользователей на чипах AMD гораздо дешевле. Кстати, AMD сама проблему знает и инвестирует миллиарды долларов в ИИ-лаборатории для диверсификации (например, проект с Anthropic), чтобы совместно совершенствовать софт и делать модели кроссплатформенными.

А из небольших компаний мне видятся только стартапы и создатели открытых моделей: первым нужны мощности в аренду здесь и сейчас (Nvidia нужно ждать, тогда как AMD Instinct можно арендовать быстрее у облачных провайдеров); а вторые изначально пишут код без привязки к проприетарной CUDA от Nvidia — сообщество энтузиастов само оптимизирует библиотеки под AMD ROCm.

— И последний вопрос: как планировать построение и развитие ИИ-инфраструктуры в таких условиях?

— Главный совет — не воспринимать GPU как обычное серверное оборудование. Это дефицитный производственный ресурс с длинным циклом поставки, который нужен всем по любым ценам. Поэтому ИИ-планирование нужно строить из реальных сроков поставок. Если архитектура проекта понятна, то сразу резервируйте оборудование (даже если разработка в процессе). Надеяться, что рынок восстановится через несколько месяцев и вы сэкономите — недальновидно. Для этого просто нет объективных предпосылок.

Автор

СЕРВЕР МОЛЛ

Поделиться
Комментарии
(0)
Ещё не добавлено ни одного комментария
Написать комментарий
Поля, отмеченные *, обязательны для заполнения
Для AI
Новый
DELL PowerEdge XE9780 16SFF
CPU:
2× Intel Xeon 6 серии (до 86 ядер на процессор)
RAM:
4096GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B300 SXM

от 116 469 008

4 047 298 ₽/мес в лизинг

от 95 466 400

+ 21 002 608 НДС

Для AI
Новый
ASUS ESC8000A-E13 SKU1 6SFF/NVMe
CPU:
2x AMD EPYC 9575F (64c/128t, 3.3GHz-5GHz, 400W)
RAM:
768GB (DDR5 ECC REG)
GPU:
8 x NVIDIA RTX PRO 6000 Blackwell

от 17 333 272

602 331 ₽/мес в лизинг

от 14 207 600

+ 3 125 672 НДС

Для AI
Новый
Supermicro AS-5126GS-TNRT2 2SFF+8NVMe
CPU:
2x AMD EPYC 9554 (64/128, 3.1GHz-3.75GHz, 360W)
RAM:
1536GB (DDR5 ECC REG)
GPU:
8 x NVIDIA RTX PRO 6000 Blackwell

от 21 455 164

745 567 ₽/мес в лизинг

от 17 586 200

+ 3 868 964 НДС

Для AI
Новый
NVIDIA DGX B200
CPU:
2x Intel Xeon Platinum 8570 (56c/112t, 2.1GHz-4GHz, 350W)
RAM:
2000GB (DDR5 ECC REG)
GPU:
8 x NVIDIA B200 SXM

от 86 056 360

2 990 458 ₽/мес в лизинг

от 70 538 000

+ 15 518 360 НДС

client consultations icon-delivery discount icon-facebook franchise icon-google_plus it-solutions icon-jivosite icon-menu icon-up icon-message payment icon-recall shops-local shops-network icon-solutions icon-support tasks icon-twitter Group 8 icon-user icon-viber icon-vk icon-watsup icon-watsup-2
Мы используем файлы 'cookie', чтобы обеспечить максимальное удобство пользователям.