close

Сервер для инференса на AMD Instinct MI350P: восемь ускорителей в одном 4U ITPOD

4 августа 2026 г.
Сервер для инференса на AMD Instinct MI350P: восемь ускорителей в одном 4U ITPOD

Узкое место инференса сегодня - не вычисления, а память и киловатты на вводе. Восемь карт AMD Instinct MI350P в сервере ITPOD-SYR4108G-D08NV-G5 дают 1 152 ГБ памяти GPU при классическом воздушном охлаждении. Разбираю, почему для бизнеса на открытых моделях это сильная альтернатива варианту с картами NVIDIA, и почему старт продаж мы ставим на начало Q4.

Краткая выжимка: паспорт узла

Screenshot 1.png

Узкое место рынка сейчас - не серверы и не ускорители, а мощность, заведённая в здание. Стойку с жидкостным охлаждением и парой сотен киловатт может позволить себе облачный гиперскейлер. Обычному банку, ритейлеру или промышленному заказчику нужно другое — запустить инференс на том дата-центре, что уже есть: воздух, ограниченный лимит по питанию, стабильная работа круглые сутки.

И запрос у них другой. Никто из них не обучает базовые модели с нуля. Бизнес берёт готовые открытые модели — DeepSeek-V4, Qwen3.5, GLM-5.2, Kimi K3, gpt-oss — и раздаёт их: ответы и поиск по внутренней базе (RAG), ассистенты, классификация документов. Это инференс в реальной эксплуатации, а у него совсем другая математика, чем у обучения.

Почему для инференса LLM память и её пропускная способность важнее вычислений

Инференс - это не разовый прогон обучения. Это постоянная, чувствительная к задержке нагрузка: много пользователей, короткие запросы, ответ нужен сейчас. Чтобы держать задержку низкой, модель должна целиком лежать в памяти GPU — иначе начинаются перекладывания весов и провалы по времени ответа. Поэтому решают не пиковые вычисления, а объём и пропускная способность памяти. Ровно сюда попадает MI350P.

Screenshot2.png

Источник: официальные спецификации AMD (MI350P: 144 ГБ, 4,0 ТБ/с) и NVIDIA (RTX PRO 6000 SE: 96 ГБ, 1,8 ТБ/с); агрегат — арифметика по 8 картам.

На практике это два сценария развёртывания.

→ Основной для больших MoE-моделей (Mixture-of-Experts) - Expert Parallelism, параллелизм по экспертам. В каждом MoE-слое DeepSeek-V4-Pro 384 маршрутизируемых эксперта плюс один общий, а на каждый токен срабатывают лишь 6 из них. Раскладываем эти 384 эксперта по восьми картам узла - по 48 экспертов на карту. В 4-битном формате (MXFP4) вся модель весит порядка 850 ГБ, то есть около 105 ГБ на карту из 144, и оставляет ~40 ГБ под KV-cache. Полный размер — 1,6 трлн параметров, но на токен работают лишь ~49 млрд, поэтому скорость генерации высокая при триллионном объёме.
→ Второй - для модели, которая целиком помещается на одну карту: запускаем несколько независимых инстансов, по одному на карту. Qwen3.5-122B-A10B в формате MXFP4 занимает ~65 из 144 ГБ карты и оставляет около 80 ГБ под KV-cache - большой запас под длинный контекст и параллельные запросы. Активны лишь 10 млрд параметров из 122, поэтому инстанс отвечает быстро. На узле — восемь таких инстансов, каждый со своей очередью запросов.

Переведём вычисления в токены - то, что считает бизнес. Это оценка, а не паспортная цифра: зависит от модели, точности и пакетной обработки. У Qwen3.5-122B-A10B активны лишь 10 млрд параметров, поэтому один инстанс отдаёт порядка 150 токенов в секунду на пользователя — в разы быстрее скорости чтения, а восемь инстансов узла держат сотни одновременных сессий. Скорость генерации задаёт пропускная способность памяти, а не пиковые вычисления, - поэтому память здесь и решает.

AMD Instinct MI350P против NVIDIA RTX PRO 6000 Blackwell SE: производительность по форматам

Прямой конкурент MI350P - NVIDIA RTX PRO 6000 Blackwell Server Edition, карта того же класса: full-height, двойная ширина, воздух, 600 Вт, PCIe Gen5. По фактическим (delivered) показателям MI350P впереди по всей линейке форматов,  и особенно в FP4/FP6, куда сейчас смещается инференс: там точность контролируема, а скорость кратно выше. Обе карты FP4/FP6 умеют, но MI350P выдаёт на них заметно больше. Приведённые цифры — данные AMD: независимых бенчмарков MI350P пока нет, а независимый разбор анонса и позиционирования карты (модели на 200–250 млрд параметров на GPU)  в обзоре Phoronix.

Screenshot3.png

Как восемь GPU подключаются через два PCIe-коммутатора вместо NVLink

Внутри сервера восемь ускорителей подключены через два PCIe-коммутатора Broadcom PEX 89144 (по 144 линии PCIe Gen5 каждый). Каждая карта получает собственный канал x16 PCIe Gen5 - 128 ГБ/с суммарно в обе стороны (64 ГБ/с в каждую), а два процессора EPYC связаны между собой шиной XGMI. На эти же коммутаторы заведены восемь дисков U.2 NVMe Gen5 и слоты под сетевые карты.

Screenshot4.png

Честно про масштабирование. У MI350P нет выделенной шины между картами (типа NVLink у старших ускорителей NVIDIA) - но её нет и у сопоставимой карты NVIDIA этого класса, RTX PRO 6000 Blackwell SE. В сегменте PCIe-карт под инференс это осознанный выбор, а не пробел: модель целиком помещается в один узел, а рост нагрузки закрывается репликами — добавили карты или узлы, размножили копии модели за балансировщиком. И ещё один честный момент: у карты NVIDIA есть аппаратный видео-энкодер, которого у MI350P нет. Если ваш сценарий — тяжёлый транскодинг видео, это её плюс; для языковых моделей и RAG роли не играет.

Как перейти с NVIDIA CUDA на AMD ROCm без переписывания кода

Главный страх при уходе от NVIDIA - «придётся всё переписывать под другой софт». На инференсе открытых моделей это давно не так. В основе — ROCm, открытый программный стек AMD, который встаёт вместо CUDA под привычные инструменты без переписывания кода.

Screenshot6.png

Принцип простой: если ваша нагрузка работает на vLLM или PyTorch — она работает и на MI350P. vLLM сегодня — почти стандарт для раздачи моделей, и он поддерживается на AMD напрямую. Открытые модели AMD проверяет под запуск «с нуля дня» (day-0), собственные ядра CUDA переносятся инструментом HIPify, а поверх есть готовые инференс-микросервисы с совместимым API, менеджер ресурсов и разделение GPU. Никакой второй привязки к поставщику (vendor lock-in): ни к закрытому софту, ни к закрытой модели.

Характеристики сервера ITPOD-SYR4108G-D08NV-G5 на 2× AMD EPYC 9005

Основа решения — наш сервер ITPOD-SYR4108G-D08NV-G5 с нашей интеграцией, гарантией и запасом комплектующих. Тот самый 4U, который сегодня едет с картами NVIDIA RTX PRO 6000 Blackwell Server Edition, получает вариант с восемью AMD Instinct MI350P — в тех же слотах.

ITPOD-SYR4108G-D08NV-G5, задняя панель: слоты расширения и блоки питания

Задняя панель: восемь двойных слотов PCIe Gen5 под ускорители, слоты сетевых карт и четыре блока питания (3+1)

Screenshot7.png

Неочевидное следствие сертификации. Платформа уже проверена как NVIDIA-Certified (MGX) и сегодня штатно несёт карты NVIDIA RTX PRO 6000 Blackwell SE. Слоты - стандартные full-height, двойной ширины, PCIe Gen5. Значит, переход на AMD MI350P здесь - это замена карт и смена программного стека, а не новый сервер, новая стойка и новое охлаждение. Один и тот же 4U закрывает оба сценария.

По питанию всё сходится без чудес: восемь карт по 600 Вт плюс два процессора по 500 Вт плюс обвязка - порядка 6,5 кВт на узел, что укладывается в схему 3+1 из четырёх блоков по 3200 Вт (80PLUS Titanium) с резервом. А если дата-центр совсем зажат по мощности, полную мощность карты можно снизить с 600 до 450 Вт: производительность падает, но появляется шанс встать в существующий лимит. Охлаждение остаётся классическим, воздухом, стойка - стандартной, жидкость не требуется.

Кому подходит GPU-сервер для инференса на открытых моделях

Это узел для тех, кто выводит инференс на открытых моделях в работу и считает не пиковые цифры из бенчмарков, а стоимость на токен и киловатты на вводе: банки (выявление мошенничества, поддержка клиентов), ритейл (рекомендации, прогноз спроса), промышленность (компьютерное зрение, предиктивное обслуживание), внутренние ассистенты и сценарии RAG. Начать можно с двух карт и наращивать до восьми по мере роста нагрузки - не перестраивая инфраструктуру.

Про сроки - без обещаний. AMD обещает готовность MI350P к отгрузке в Q3–Q4 2026. Синхронно с этим мы прогнозируем старт продаж узла на начало Q4 2026. Это прогноз, а не обязательство по дате - точно подтвердим ближе к доступности карт.

Дальше - предметно

Партнёрам и заказчикам: опишите сценарий (какие модели, какая нагрузка, какой лимит по питанию в стойке) — вернёмся с расчётом конфигурации сервера.

Карточка платформы ITPOD-SYR4108G-D08NV-G5 · info@itpod.com