info@qbs.ru
×
0
0

Ваша корзина пуста!
Серверы для локальных LLM и инференса
QBS / ЛОКАЛЬНЫЕ LLM

Сервер для языковой модели: память, контекст и скорость ответа

Подбор оборудования для локального запуска LLM и обслуживания запросов. Отправная точка — конкретная модель, формат весов и нагрузка вашего приложения.

Память

Веса модели плюс KV-кэш и рабочие буферы.

Нагрузка

Длина входа и ответа, одновременные запросы, требуемая задержка.

Платформа

Один GPU, несколько GPU для одной модели либо независимые копии сервиса.

Сколько памяти занимают веса модели

Для предварительной оценки умножьте число параметров на число байт на параметр. Ниже показана арифметическая оценка только весов плотной модели: BF16/FP16 — 2 байта, 8 бит — 1 байт, 4 бита — 0,5 байта. Использованы десятичные ГБ, 1 ГБ = 10⁹ байт.

Размер моделиBF16 / FP168 бит4 бита
7B14 ГБ7 ГБ3,5 ГБ
14B28 ГБ14 ГБ7 ГБ
32B64 ГБ32 ГБ16 ГБ
70B140 ГБ70 ГБ35 ГБ

Это не таблица необходимой VRAM сервера. К весам добавляются KV-кэш, буферы выполнения и служебные данные. Квантизация может хранить дополнительные масштабы и часть параметров в более высокой точности. Фактический объём зависит от реализации и модели.

Например, 70B в 4 битах дают около 35 ГБ только для весов. Из этого нельзя заключить, что GPU 48 ГБ обеспечит любой контекст и число пользователей. Нужен расчёт остальных компонентов памяти и проверка запуска.

Почему один пользователь и десять запросов — разные нагрузки

KV-кэш сохраняет промежуточные данные генерации. Длинные последовательности и параллельная обработка запросов могут заметно увеличить его объём. Его устройство зависит от архитектуры модели и движка. Перенос кэша в RAM позволяет менять требования к памяти GPU, но добавляет обмен данными и может влиять на скорость.

Для сравнения серверов укажите время до первого токена, скорость дальнейшей генерации, число одновременных запросов и допустимую очередь. Показатель токенов в секунду без длины входа, ответа и параллельности нельзя переносить на произвольное приложение.

Один GPU или несколько

ВариантКогда рассматриватьЧто проверить
Один GPUМодель и рабочая нагрузка помещаются в его памятьЗапас под контекст и параллельность, поддержка точности в выбранном ПО.
Несколько GPU на одну модельТребуется распределить память и вычисленияПоддержка модели движком, схема разделения и пропускная способность обмена.
Независимые копии моделиНужно обслуживать больше запросовБалансировка, очередь, суммарная нагрузка и резервирование.

Платформы из каталога для предварительного подбора

Supermicro SYS-521GE-TNRT

Supermicro SYS-521GE-TNRT

Платформа PCIe 5U. Модель и число устанавливаемых GPU проверяются отдельно.

Supermicro SYS-421GU-TNXR

Supermicro SYS-421GU-TNXR (EOL)

Платформа 4U с GPU. Конфигурация определяется после расчёта нагрузки.

Supermicro SYS-821GE-TNHR

Supermicro SYS-821GE-TNHR

HGX H100/H200 с восемью SXM GPU: вариант для задач, требующих соответствующей архитектуры.

Фотографии и ссылки показывают серверные платформы. Они не означают, что в цену включён выбранный вами набор GPU. Модели ускорителей, RAM, диски, сеть, гарантия и комплект фиксируются в предложении.

Техническое задание на сервер для LLM

Укажите модель и её версию; формат и точность весов; максимальную длину входа и ответа; число одновременно исполняемых запросов; целевое время ответа; используемый движок; требования к локальному размещению и бюджет. Если модель ещё не выбрана, начните с набора примеров задач и критерия качества.

Для корпоративного поиска по документам потребуется ещё обработка и индексирование данных — см. подбор оборудования для RAG. Если нужно менять веса модели, используйте требования к серверу для обучения.

О модели SYS-421GU-TNXR: производитель пометил её EOL. Это HGX H100/H200 с четырьмя SXM GPU. Ссылка оставлена для идентификации платформы; возможность поставки требует подтверждения.

Ускорители для проекта на PCIe

Для предварительного выбора сравните NVIDIA L4 и NVIDIA L40S. Сначала оцените память и режим работы модели, затем согласуйте поддержку конкретной карты сервером. Ссылки ведут к ускорителям; их включение в выбранный сервер оформляется отдельной спецификацией.

Варианты сервера для локальной LLM

Один GPU

NVIDIA L4 или NVIDIA L40S — кандидаты для проверки модели на одной карте. Сначала измеряем память с целевым контекстом и параллельностью.

Несколько экземпляров

Независимые копии модели на нескольких GPU можно распределить между пользователями. Число реплик выбираем по замерам загрузки и очереди запросов.

Модель на нескольких GPU

H100 NVL или H200 NVL NVL рассматриваем вместе с поддерживаемой платформой, мостами и средствами распределения модели.

Supermicro SYS-521GE-TNRT — пример масштабируемой платформы PCIe: производитель указывает поддержку L4, L40S, H100 NVL и H200 NVL. Для небольшого узла с одной картой проверяем также более компактные совместимые серверы. Поддержка семейства GPU не подтверждает наличие карт в конкретном товарном комплекте.

До выбора CPU/RAM/SSDЧто фиксируем в задании
НагрузкаНазвание и версия модели, точность весов, максимальный контекст, одновременные запросы.
ПриёмкаВремя первого токена, скорость генерации, доля ошибок и память на согласованном наборе запросов.
ЭксплуатацияРезервирование, обновления, журналирование, доступ к данным и ограничения стойки.

Объём RAM и дисков рассчитываем после выбора способа загрузки модели, кэшей и резервирования. Сам по себе объём видеопамяти не гарантирует нужную скорость ответа.

Технические сведения: Supermicro SYS-521GE-TNRT: поддерживаемые GPU. Исполнение и совместимость проверяются по конкретному артикулу.

Подобрать оборудование под вашу задачу

Укажите модель нейросети, сценарий работы, число пользователей, требования к размещению и бюджет. Если нужен конкретный товар — приложите артикул или спецификацию.

Обсудить конфигурациюОтправить техническое задание

Документация для проверки проекта: Hugging Face: KV-кэш; Платформа SYS-521GE-TNRT; Платформа SYS-421GU-TNXR; HGX в SYS-821GE-TNHR.


Новинка
GPU-сервер Supermicro SYS-421GU-TNXR, 4U
GPU-сервер Supermicro SYS-421GU-TNXR, 4U
SYS-421GU-TNXR
Уточняйте
Цена по запросу
Новинка
GPU-сервер Supermicro SYS-521GE-TNRT — 2×8558, 16×64 ГБ, 2×7,68 ТБ
GPU-сервер Supermicro SYS-521GE-TNRT — 2×8558, 16×64 ГБ, 2×7,68 ТБ
SYS-521GE-TNRT-2X8558-16X64GB-2X7680GBSSD-6XPCIE20
Уточняйте
Цена по запросу
Новинка
GPU-сервер Supermicro SYS-821GE-TNHR, 8U
GPU-сервер Supermicro SYS-821GE-TNHR, 8U
SYS-821GE-TNHR
Уточняйте
Цена по запросу
Показано с 1 по 3 из 3 (всего 1 страниц)