Сервер для языковой модели: память, контекст и скорость ответа
Подбор оборудования для локального запуска LLM и обслуживания запросов. Отправная точка — конкретная модель, формат весов и нагрузка вашего приложения.
Память
Веса модели плюс KV-кэш и рабочие буферы.
Нагрузка
Длина входа и ответа, одновременные запросы, требуемая задержка.
Платформа
Один GPU, несколько GPU для одной модели либо независимые копии сервиса.
Сколько памяти занимают веса модели
Для предварительной оценки умножьте число параметров на число байт на параметр. Ниже показана арифметическая оценка только весов плотной модели: BF16/FP16 — 2 байта, 8 бит — 1 байт, 4 бита — 0,5 байта. Использованы десятичные ГБ, 1 ГБ = 10⁹ байт.
| Размер модели | BF16 / FP16 | 8 бит | 4 бита |
|---|---|---|---|
| 7B | 14 ГБ | 7 ГБ | 3,5 ГБ |
| 14B | 28 ГБ | 14 ГБ | 7 ГБ |
| 32B | 64 ГБ | 32 ГБ | 16 ГБ |
| 70B | 140 ГБ | 70 ГБ | 35 ГБ |
Это не таблица необходимой VRAM сервера. К весам добавляются KV-кэш, буферы выполнения и служебные данные. Квантизация может хранить дополнительные масштабы и часть параметров в более высокой точности. Фактический объём зависит от реализации и модели.
Например, 70B в 4 битах дают около 35 ГБ только для весов. Из этого нельзя заключить, что GPU 48 ГБ обеспечит любой контекст и число пользователей. Нужен расчёт остальных компонентов памяти и проверка запуска.
Почему один пользователь и десять запросов — разные нагрузки
KV-кэш сохраняет промежуточные данные генерации. Длинные последовательности и параллельная обработка запросов могут заметно увеличить его объём. Его устройство зависит от архитектуры модели и движка. Перенос кэша в RAM позволяет менять требования к памяти GPU, но добавляет обмен данными и может влиять на скорость.
Для сравнения серверов укажите время до первого токена, скорость дальнейшей генерации, число одновременных запросов и допустимую очередь. Показатель токенов в секунду без длины входа, ответа и параллельности нельзя переносить на произвольное приложение.
Один GPU или несколько
| Вариант | Когда рассматривать | Что проверить |
|---|---|---|
| Один GPU | Модель и рабочая нагрузка помещаются в его память | Запас под контекст и параллельность, поддержка точности в выбранном ПО. |
| Несколько GPU на одну модель | Требуется распределить память и вычисления | Поддержка модели движком, схема разделения и пропускная способность обмена. |
| Независимые копии модели | Нужно обслуживать больше запросов | Балансировка, очередь, суммарная нагрузка и резервирование. |
Платформы из каталога для предварительного подбора

Supermicro SYS-521GE-TNRT
Платформа PCIe 5U. Модель и число устанавливаемых GPU проверяются отдельно.

Supermicro SYS-421GU-TNXR (EOL)
Платформа 4U с GPU. Конфигурация определяется после расчёта нагрузки.

Supermicro SYS-821GE-TNHR
HGX H100/H200 с восемью SXM GPU: вариант для задач, требующих соответствующей архитектуры.
Фотографии и ссылки показывают серверные платформы. Они не означают, что в цену включён выбранный вами набор GPU. Модели ускорителей, RAM, диски, сеть, гарантия и комплект фиксируются в предложении.
Техническое задание на сервер для LLM
Укажите модель и её версию; формат и точность весов; максимальную длину входа и ответа; число одновременно исполняемых запросов; целевое время ответа; используемый движок; требования к локальному размещению и бюджет. Если модель ещё не выбрана, начните с набора примеров задач и критерия качества.
Для корпоративного поиска по документам потребуется ещё обработка и индексирование данных — см. подбор оборудования для RAG. Если нужно менять веса модели, используйте требования к серверу для обучения.
Ускорители для проекта на PCIe
Для предварительного выбора сравните NVIDIA L4 и NVIDIA L40S. Сначала оцените память и режим работы модели, затем согласуйте поддержку конкретной карты сервером. Ссылки ведут к ускорителям; их включение в выбранный сервер оформляется отдельной спецификацией.
Варианты сервера для локальной LLM
Один GPU
NVIDIA L4 или NVIDIA L40S — кандидаты для проверки модели на одной карте. Сначала измеряем память с целевым контекстом и параллельностью.
Несколько экземпляров
Независимые копии модели на нескольких GPU можно распределить между пользователями. Число реплик выбираем по замерам загрузки и очереди запросов.
Supermicro SYS-521GE-TNRT — пример масштабируемой платформы PCIe: производитель указывает поддержку L4, L40S, H100 NVL и H200 NVL. Для небольшого узла с одной картой проверяем также более компактные совместимые серверы. Поддержка семейства GPU не подтверждает наличие карт в конкретном товарном комплекте.
| До выбора CPU/RAM/SSD | Что фиксируем в задании |
|---|---|
| Нагрузка | Название и версия модели, точность весов, максимальный контекст, одновременные запросы. |
| Приёмка | Время первого токена, скорость генерации, доля ошибок и память на согласованном наборе запросов. |
| Эксплуатация | Резервирование, обновления, журналирование, доступ к данным и ограничения стойки. |
Объём RAM и дисков рассчитываем после выбора способа загрузки модели, кэшей и резервирования. Сам по себе объём видеопамяти не гарантирует нужную скорость ответа.
Технические сведения: Supermicro SYS-521GE-TNRT: поддерживаемые GPU. Исполнение и совместимость проверяются по конкретному артикулу.
Подобрать оборудование под вашу задачу
Укажите модель нейросети, сценарий работы, число пользователей, требования к размещению и бюджет. Если нужен конкретный товар — приложите артикул или спецификацию.
Обсудить конфигурациюОтправить техническое заданиеДокументация для проверки проекта: Hugging Face: KV-кэш; Платформа SYS-521GE-TNRT; Платформа SYS-421GU-TNXR; HGX в SYS-821GE-TNHR.
