close

Открыта запись на тестирование сервера ITPOD‑SL201‑D12R‑NV‑G5 для ИИ‑инференса

тестирование.png

Запись на августовское тестирование открыта: сервер ITPOD‑SL201‑D12R‑NV‑G5 для ИИ‑инференса

Мы приглашаем вас на тестовый прогон новой модели ITPOD‑SL201‑D12R‑NV‑G5 (2U, 12 отсеков с фронтальной горячей заменой) – специальной конфигурации, оптимизированной под задачи вывода (инференса) больших языковых моделей и работы с векторными базами.

Гибкость хранилища – без компромиссов

Индекс D12R‑NV говорит о главном: универсальный backplane позволяет одновременно использовать SATA/SAS и NVMe в любых пропорциях на одних и тех же 12 отсеках.

  • Векторные базы данных требуют быстрых NVMe‑накопителей.
  • Архивы документов и резервные копии отлично чувствуют себя на ёмких SAS‑дисках.
    Вам не придётся разносить эти нагрузки на два разных сервера – всё умещается в одной платформе.

Два слота OCP 3.0 на шине PCIe 5.0 дают подключение к сетям 25/100 Гбит/с, не занимая райзеры. Освободившиеся слоты остаются под контроллеры хранения или будущие ускорители – задел на перспективу.

Тонкости памяти и NUMA – важны для реальной производительности

Память: 32 слота на два сокета (8 каналов × 2 модуля на канал). Максимальная частота 6400 МТ/с гарантируется только при заполнении одного модуля на канал (16 планок). Второй модуль на канал (2 DPC) даёт прирост ёмкости, но снижает частоту. Поскольку инференс упирается в пропускную способность памяти, мы по умолчанию собираем конфигурацию с 16 крупными модулями, а не с 32 мелкими – так вы получаете максимум скорости.

NUMA: Два процессора Xeon 6 образуют четыре домена NUMA. Для воспроизведения заявленных показателей (время до первого токена, токены/с) необходимо корректно привязать vLLM к доменам, иначе движок будет обращаться к весам через межпроцессорную шину, теряя производительность. Эту настройку мы выполняем на этапе пуско‑наладки – вы получаете готовую к работе систему.

Когда достаточно процессора, а когда нужен GPU?

Граница проходит там же, где и год назад, но сама планка поднялась. На Xeon 6 комфортно работают модели размером 8–11B в интерактивных сценариях с десятками параллельных запросов.

За этой чертой – задачи для GPU‑серверов (наша серия AI/ML Computing, 4U под 8 ускорителей):

  • Модели от 30B и выше, особенно с длинным контекстом и жёсткими требованиями к задержкам;
  • Высокая конкурентность (сотни и тысячи сессий на инстанс);
  • Обучение, дообучение, пакетная обработка больших массивов, компьютерное зрение в реальном времени.

Однако начинать проект с GPU, если ваш первый сценарий – чат‑бот по базе знаний, – значит переплачивать за дорогую память HBM там, где упираетесь в DDR5. Мы поможем выбрать оптимальный вариант.

Читайте подробный материал в нашем блоге

Август: ваш слот на реальные тесты

Мы получим несколько экземпляров ITPOD‑SL201‑D12R‑NV‑G5 и готовы прогнать на них не синтетику, а вашу реальную нагрузку:

  • ваши документы,
  • ваш профиль запросов,
  • ваша модель.

На выходе вы получите цифры того же формата, что в наших таблицах: конкурентность, время до первого токена, токены в секунду на пользователя – именно под ваши условия.

Как записаться?

Расскажите нам о своей задаче:

  • сценарий использования,
  • размер модели,
  • ожидаемое количество пользователей,
  • требования к контуру данных.

Мы оценим, ложится ли она на Xeon 6, где проходит граница с GPU‑конфигурацией и какая сборка ITPOD оптимальна. Если окажется, что этот сервер вам не подходит – мы скажем честно и предложим альтернативу.

Напишите нам сейчас, и мы поставим вас в очередь на тестовый прогон в августе. Количество слотов ограничено – не откладывайте!