Открыта запись на тестирование сервера ITPOD‑SL201‑D12R‑NV‑G5 для ИИ‑инференса

Запись на августовское тестирование открыта: сервер ITPOD‑SL201‑D12R‑NV‑G5 для ИИ‑инференса
Мы приглашаем вас на тестовый прогон новой модели ITPOD‑SL201‑D12R‑NV‑G5 (2U, 12 отсеков с фронтальной горячей заменой) – специальной конфигурации, оптимизированной под задачи вывода (инференса) больших языковых моделей и работы с векторными базами.
Гибкость хранилища – без компромиссов
Индекс D12R‑NV говорит о главном: универсальный backplane позволяет одновременно использовать SATA/SAS и NVMe в любых пропорциях на одних и тех же 12 отсеках.
- Векторные базы данных требуют быстрых NVMe‑накопителей.
- Архивы документов и резервные копии отлично чувствуют себя на ёмких SAS‑дисках.
Вам не придётся разносить эти нагрузки на два разных сервера – всё умещается в одной платформе.
Два слота OCP 3.0 на шине PCIe 5.0 дают подключение к сетям 25/100 Гбит/с, не занимая райзеры. Освободившиеся слоты остаются под контроллеры хранения или будущие ускорители – задел на перспективу.
Тонкости памяти и NUMA – важны для реальной производительности
Память: 32 слота на два сокета (8 каналов × 2 модуля на канал). Максимальная частота 6400 МТ/с гарантируется только при заполнении одного модуля на канал (16 планок). Второй модуль на канал (2 DPC) даёт прирост ёмкости, но снижает частоту. Поскольку инференс упирается в пропускную способность памяти, мы по умолчанию собираем конфигурацию с 16 крупными модулями, а не с 32 мелкими – так вы получаете максимум скорости.
NUMA: Два процессора Xeon 6 образуют четыре домена NUMA. Для воспроизведения заявленных показателей (время до первого токена, токены/с) необходимо корректно привязать vLLM к доменам, иначе движок будет обращаться к весам через межпроцессорную шину, теряя производительность. Эту настройку мы выполняем на этапе пуско‑наладки – вы получаете готовую к работе систему.
Когда достаточно процессора, а когда нужен GPU?
Граница проходит там же, где и год назад, но сама планка поднялась. На Xeon 6 комфортно работают модели размером 8–11B в интерактивных сценариях с десятками параллельных запросов.
За этой чертой – задачи для GPU‑серверов (наша серия AI/ML Computing, 4U под 8 ускорителей):
- Модели от 30B и выше, особенно с длинным контекстом и жёсткими требованиями к задержкам;
- Высокая конкурентность (сотни и тысячи сессий на инстанс);
- Обучение, дообучение, пакетная обработка больших массивов, компьютерное зрение в реальном времени.
Однако начинать проект с GPU, если ваш первый сценарий – чат‑бот по базе знаний, – значит переплачивать за дорогую память HBM там, где упираетесь в DDR5. Мы поможем выбрать оптимальный вариант.
Читайте подробный материал в нашем блоге
Август: ваш слот на реальные тесты
Мы получим несколько экземпляров ITPOD‑SL201‑D12R‑NV‑G5 и готовы прогнать на них не синтетику, а вашу реальную нагрузку:
- ваши документы,
- ваш профиль запросов,
- ваша модель.
На выходе вы получите цифры того же формата, что в наших таблицах: конкурентность, время до первого токена, токены в секунду на пользователя – именно под ваши условия.
Как записаться?
Расскажите нам о своей задаче:
- сценарий использования,
- размер модели,
- ожидаемое количество пользователей,
- требования к контуру данных.
Мы оценим, ложится ли она на Xeon 6, где проходит граница с GPU‑конфигурацией и какая сборка ITPOD оптимальна. Если окажется, что этот сервер вам не подходит – мы скажем честно и предложим альтернативу.
Напишите нам сейчас, и мы поставим вас в очередь на тестовый прогон в августе. Количество слотов ограничено – не откладывайте!