Инференс LLM без GPU: сервер ITPOD-SL201-D12R-NV-G5 на Intel Xeon 6 P-cores с AMX
Под чат-бота на 8B-модели покупают GPU-сервер, а потом видят в мониторинге 10 % загрузки ускорителя. Разбираем, где вместо GPU честно хватает двух Xeon 6 с AMX, и что это за машина.
Почему GPU-сервер под LLM на 8B параметров загружен на 10 % и что взять вместо него
Типовой корпоративный ИИ-проект 2026 года выглядит так: база знаний из PDF, векторный поиск, чат-бот поверх открытой модели уровня 8B, полсотни-сотня активных пользователей внутри периметра. Под него закупается сервер с ускорителем, потому что «ИИ - это GPU». Через квартал в графиках видно, что HBM занят на четверть, SM-ядра простаивают между запросами, а половина стойки под этот проект - это вообще не ИИ.
Второе наблюдение важнее первого. Конвейер поисковой генерации (RAG) состоит не из одной модели. В нём балансировщик, сервер приложений, очередь Kafka, векторная база, MongoDB с метаданными, модель эмбеддингов, модель переранжирования - и только в конце движок vLLM с самой LLM. Всё, кроме последнего, работает на процессоре и памяти. Если LLM-часть тоже укладывается в процессор, весь конвейер живёт в одном кластере, на одном оркестраторе, с одной моделью эксплуатации - вместо связки «GPU-остров плюс CPU-обвязка».
Из чего на самом деле состоит RAG-конвейер

Третье - данные. Открытые модели в собственном контуре снимают вопрос ИБ: документы, записи разговоров и тендерная переписка не покидают дата-центр, а вместо облачных кредитов за API распознавания речи вы платите за амортизацию своего железа.
Что даёт Intel Xeon 6 P-cores для ИИ-инференса: AMX, 8 каналов DDR5-6400 и PCIe 5.0
Xeon 6 разделён на две линейки: P-ядра - производительность на ядро, E-ядра - производительность на ватт (CDN, микросервисы, DevOps). Под машинное обучение и HPC берутся P-ядра.
Внутри P-линейки тоже есть развилка. Серия 6900P (Granite Rapids AP) - до 128 ядер, 12 каналов памяти, теплопакет до 500 Вт. Серия 6700P (Granite Rapids SP) — до 86 ядер, 8 каналов, теплопакет до 350 Вт, до 88 линий PCIe 5.0 и до 4 ТБ памяти на сокет. ITPOD-SL201-D12R-NV-G5 построен как раз на SP-профиле: два сокета, до 350 Вт на процессор, 32 слота DDR5.
Ключевая для инференса деталь - Intel AMX, матричный ускоритель внутри процессора. Он не отнимает ресурсы у ядер, а работает как встроенный акселератор и поддерживает FP16. Публичный замер Phoronix: геометрическое среднее по всему набору тестов - 156,99 с включённым AMX против 57,15 с выключенным. То есть разница между «инференс на CPU не взлетает» и «инференс на CPU работает» - это не поколение железа, а один блок в процессоре и правильно собранный движок.
Что даёт AMX на одном и том же процессоре

Практический смысл: пропускная способность памяти выросла примерно вдвое относительно Gen2, а инференс небольших моделей упирается именно в память, а не в арифметику.
Сколько одновременных запросов держит Llama 3.1 8B на двух Intel Xeon 6767P: результаты замеров
Intel опубликовала замеры на двухсокетной системе с Xeon 6767P — 64 ядра на сокет, 128 ядер суммарно, четыре домена NUMA, память DDR5-6400. Движок — vLLM 0.9.0 с префиксным кэшированием, ОС Ubuntu 22.04 и RHEL 9.6, набор данных Sonnet, по три прогона на комбинацию. Одна и та же модель, четыре профиля нагрузки — различается только диапазон входа и выхода.

Ориентир приемлемого пользовательского опыта в генеративных интерфейсах - 10 токенов в секунду на пользователя: это быстрее, чем читает человек. Все четыре профиля его проходят, а чат-профиль делает это при почти сотне одновременных запросов и ответе меньше чем за секунду.
Пересчёт в людей выполняется через конвейер. Сотня одновременных запросов к движку - это порядка тысячи пользователей, вошедших в систему с браузера или мобильного приложения: до vLLM запросы доезжают через балансировщик, сервер приложений и Kafka, которая сглаживает поток. Плюс кэш: в узком корпоративном сценарии запросы сильно повторяются, и слой кэширования перед движком отдаёт часть из них вообще без вычислений — прямо из DDR5 того же сервера.
Какие корпоративные ИИ-задачи работают на CPU-инференсе: сценарии для моделей 8-11B
Карта корпоративных сценариев, которую Intel собрала по своей практике, повторяется от заказчика к заказчику:
- RAG по документам — FAQ с сайта, руководства по продуктам, кадровые политики, база тикетов из сервис-деска. Самый частый первый проект.
- Разбор нормативки — регулярные предписания регулятора: краулер собирает документы, система размечает их тегами, показывает связанные и предыдущие редакции и отвечает, действует ли требование сейчас.
- Оценка тендеров, проверка аудиторских документов, генерация отчётов — сценарии с прямой отдачей: процесс, занимавший две недели, сжимается до получаса, человек остаётся проверяющим.
- Разговорный ИИ и речь — распознавание, перевод, синтез, автоматический разбор разговоров оператора с клиентом: следовал ли регламенту, рассказал ли о продукте.
- Естественно-языковые запросы к хранилищу данных — «сколько жалоб пришло с площадки в июле, сколько из них утренних».
Общее у них одно: модель уровня 8–11B, десятки одновременных запросов и требование не выпускать данные наружу. Именно этот профиль комфортно живёт на процессоре.
Как развернуть RAG-конвейер на CPU: vLLM, готовые конвейеры OPEA и Kubernetes
Собирать конвейер с нуля не нужно. Intel участвует в консорциуме OPEA (Open Platform for Enterprise AI, проект фонда LF AI & Data) и выкладывает провалидированные RAG-конвейеры: разбор PDF, загрузка в векторную базу, метаданные в MongoDB, извлечение контекста и передача в vLLM. Развёртывание — Docker или Kubernetes, в том числе поверх OpenShift, Nutanix и VMware.
Два архитектурных совета из практики, которые экономят потом кварталы работы:
- Слой оркестрации обязателен. Парк будет неоднородным — разные поколения процессоров, GPU разных вендоров. Kubernetes гомогенизирует его и даёт поды и под ИИ-, и под обычные нагрузки конвейера.
- Слой задач поверх моделей. Сегодня вопросно-ответную задачу закрывает Llama, завтра — DeepSeek. Если прикладной код ходит в API задачи, а не в конкретную модель, смена модели не задевает решение.
Характеристики сервера ITPOD-SL201-D12R-NV-G5: конфигурация 2U под ИИ-инференс
ITPOD-SL201-D12R-NV-G5 (в центре стойки): 2U, 12 универсальных отсеков с фронтальной горячей заменой.

Что здесь важно именно для ИИ-конвейера. Индекс D12R-NV означает универсальный backplane: на одних и тех же двенадцати отсеках живут и SATA/SAS, и NVMe в любых комбинациях. Векторная база хочет NVMe, архив документов и бэкапы — ёмкие SAS-диски, и разносить их по двум серверам не нужно. Два слота OCP 3.0 на PCIe 5.0 закрывают сеть 25/100G, не расходуя райзеры: те остаются под контроллеры хранения или ускоритель, если он понадобится позже.
Инженерная заметка про память. 32 слота на два сокета — это 8 каналов × 2 модуля на канал. Номинальные 6400 MT/s гарантированы при заполнении одного модуля на канал (16 модулей). Вторая половина слотов — это про ёмкость, а не про скорость: при 2 DPC частота снижается. Инференс упирается в пропускную способность памяти, поэтому под ИИ-профиль мы по умолчанию собираем 16 модулей побольше, а не 32 поменьше.
Инженерная заметка про NUMA. Два сокета Xeon 6 — это четыре домена NUMA. Без корректного пиннинга vLLM по доменам цифры из таблицы выше не воспроизводятся: движок начинает ходить за весами через межпроцессорную шину. Это настройка при развёртывании, и мы её делаем на этапе пуско-наладки.
Когда для инференса LLM нужен GPU-сервер, а не Xeon 6
Граница проходит там же, где и год назад, просто сдвинулась. На процессоре комфортно живут модели 8–11B в интерактивных сценариях с десятками одновременных запросов. За этой границей — GPU:
- модели от 30B и выше, особенно с длинным контекстом и требованием к латентности;
- высокая конкурентность на одну модель - сотни и тысячи параллельных сессий на инстанс;
- обучение и дообучение, пакетная обработка больших массивов данных, компьютерное зрение в потоке.
Для этих задач у нас серия AI/ML Computing - 4U под восемь ускорителей. Но начинать проект с неё, когда первый сценарий - это чат-бот по базе знаний, значит купить дорогую память HBM под нагрузку, которая упирается в DDR5.
В августе получаем тестовые ITPOD-SL201-D12R-NV-G5 - заберите слот
Мы берём несколько машин на тесты и готовы прогнать на них не синтетику, а вашу задачу: ваши документы, ваш профиль запросов, вашу модель. На выходе - цифры того же формата, что в таблице выше: конкурентность, время до первого токена, токены в секунду на пользователя.
Расскажите задачу: сценарий, размер модели, сколько пользователей ожидаете, требования по контуру данных. Посмотрим, ложится ли она на Xeon 6, где проходит граница с GPU-конфигурацией и какая сборка ITPOD под неё нужна. Если окажется, что вам нужен не этот сервер, мы так и скажем.
Напишите нам, и мы поставим вас в очередь на тестовый прогон в августе.