info@qbs.ru
×
0
0

Ваша корзина пуста!
Серверы для обучения и дообучения нейросетей
QBS / ОБУЧЕНИЕ / FINE-TUNING

Сервер для обучения: сначала определить метод

LoRA, полное дообучение и обучение с нуля требуют разных ресурсов. Подбор начинается с того, какие параметры модели изменяются и за какое время нужно получить результат.

LoRA и адаптеры

Обучается часть параметров, базовые веса в обычном режиме LoRA остаются замороженными.

Полное дообучение

Нужно учитывать веса, градиенты, состояния оптимизатора и активации.

Несколько GPU

Распределение памяти и вычислений требует согласованной схемы обмена.

Как режим обучения влияет на выбор

МетодЧто требуется уточнитьСледствие для подбора
LoRA / адаптерыБазовая модель, целевые слои, ранг адаптера, точность и длина последовательностиМеньше обучаемых параметров, но базовая модель и активации продолжают занимать память.
Полное дообучениеВсе обучаемые параметры, оптимизатор, размер пакета и чекпоинтыОценка памяти существенно отличается от простого размещения модели для инференса.
Обучение с нуляАрхитектура, объём данных, число шагов и срок выполненияПомимо памяти нужна оценка общего объёма вычислений, хранения и времени экспериментов.

Из чего складывается память при обучении

Расчёт должен включать веса модели, градиенты, состояния оптимизатора, сохранённые активации и временные буферы. Их объём зависит от точности, алгоритма оптимизации и распределения работы. Увеличение длины последовательности и размера пакета может изменить требования даже при неизменном числе параметров модели.

Проверяются методы снижения потребления памяти: накопление градиентов, пересчёт активаций и распределение состояний между устройствами. Они меняют соотношение памяти, времени вычисления и обмена. Нельзя брать таблицу памяти для инференса и считать её достаточной спецификацией сервера для обучения.

Когда нужна связанная платформа из нескольких GPU

В распределённом обучении устройства обмениваются данными. Для одних схем важна синхронизация градиентов, для других — частый обмен частями вычислений одной модели. Время связи может ограничить пользу от добавления GPU. Поэтому проверяют выбранную стратегию на конкретной топологии, а при нескольких узлах также сеть между серверами.

SYS-821GE-TNHR предусматривает HGX H100/H200 с восемью SXM GPU и NVLink/NVSwitch. Это пример подходящей архитектуры для рассмотрения задач с интенсивным обменом, но требуемую скорость и состав исполнения нужно подтвердить для вашего проекта.

Платформы и предложения в каталоге

Supermicro SYS-821GE-TNHR

Supermicro SYS-821GE-TNHR

Серверная платформа HGX H100/H200, 8U. Исполнение и комплект уточняются.

SYS-821GE-TNHR, вариант с кодом 8×H200

SYS-821GE-TNHR, вариант с кодом 8×H200

Артикул содержит 8×H200, 2×8558 и 16×64 ГБ. Полный состав требует подтверждения предложения.

Supermicro SYS-420GP-TNAR

Supermicro SYS-420GP-TNAR

Платформа HGX A100 с восемью SXM GPU. Проверяются вариант A100 и комплект.

Названия и фотографии не заменяют спецификацию поставки. Для сравнения вариантов учитывайте также состояние оборудования, гарантию, сеть, накопители и требования к размещению.

Данные и контрольные точки — часть расчёта

Накопители должны вмещать рабочий набор данных, промежуточные версии и сохраняемые состояния обучения. При частом сохранении контрольных точек нагрузка на диски может становиться заметной. Согласуйте число сохраняемых версий, резервное копирование и время восстановления после прерывания.

Для проверки результата зафиксируйте модель и датасет, параметры обучения, число шагов, критерий качества, версии ПО и время выполнения. Сравнение оборудования имеет смысл при одинаковом результате, а не только по скорости отдельного шага.

Что указать в техническом задании

Метод обучения; модель и число параметров; длина последовательности; размер пакета и число шагов; оптимизатор и точность; объём датасета; частоту сохранения; предельный срок выполнения; число параллельных экспериментов; ограничения по стойке, питанию и охлаждению. Для действующего проекта полезен профиль расхода памяти и времени по этапам.

Если требуется только давать ответы по новым документам, сначала сравните задачу с RAG. Если веса модели не изменяются и нужен запуск сервиса, перейдите к подбору для инференса.

Варианты проекта для дообучения и обучения

Адаптерное дообучение

Для LoRA и других адаптерных методов сначала измеряем память и время шага на целевой модели, длине последовательности и размере пакета.

Распределённое обучение

Для полного дообучения или крупных задач оцениваем обмен между GPU, способ распределения состояний, загрузку данных и время сохранения контрольных точек.

Размещение узла

Мощность стойки, охлаждение, сеть и сервисный доступ согласуются до выбора окончательной платформы.

Для проекта PCIe можно рассматривать Supermicro SYS-521GE-TNRT с поддерживаемыми H100 NVL или H200 NVL. Для специализированной HGX-системы в каталоге есть Supermicro SYS-821GE-TNHR: производитель описывает платформу с восемью H100 или H200 в исполнении SXM. Карта H200 NVL PCIe не является заменой SXM-модуля для этой платформы.

ВариантЧто должно быть известно до закупки
Дообучение одной моделиМетод, версия фреймворка, точность, датасет, длина последовательности, целевой размер пакета.
Один многопроцессорный GPU-узелСовместимость ускорителей, топология обмена, объём памяти для весов, градиентов и состояний оптимизатора.
Несколько узловСеть, коллективные операции, схема хранения, пропускная способность загрузки данных, восстановление после сбоя.

Количество GPU и длительность обучения не выводим из одного названия модели. Итоговый состав подтверждаем пилотным запуском или согласованным расчётом с указанными допущениями; результаты одного теста не переносим на другую нагрузку без проверки.

Технические сведения: Supermicro SYS-521GE-TNRT: поддерживаемые GPU. Исполнение и совместимость проверяются по конкретному артикулу.

Технические сведения: Supermicro SYS-821GE-TNHR: платформа HGX. Исполнение и совместимость проверяются по конкретному артикулу.

Подобрать оборудование под вашу задачу

Укажите модель нейросети, сценарий работы, число пользователей, требования к размещению и бюджет. Если нужен конкретный товар — приложите артикул или спецификацию.

Обсудить конфигурациюОтправить техническое задание

Документация для проверки проекта: Hugging Face: принцип LoRA; Память при обучении; Supermicro: платформа HGX H100/H200.


Новинка
GPU-сервер Supermicro SYS-420GP-TNAR, 4U
GPU-сервер Supermicro SYS-420GP-TNAR, 4U
SYS-420GP-TNAR
Уточняйте
Цена по запросу
Новинка
GPU-сервер Supermicro SYS-821GE-TNHR — 8×H200, 2×8558, 16×64 ГБ
GPU-сервер Supermicro SYS-821GE-TNHR — 8×H200, 2×8558, 16×64 ГБ
SYS-821GE-TNHR-2X8558-16X64GB-2X7680GBSSD-8XH200-1
Уточняйте
Цена по запросу
Новинка
GPU-сервер Supermicro SYS-821GE-TNHR, 8U
GPU-сервер Supermicro SYS-821GE-TNHR, 8U
SYS-821GE-TNHR
Уточняйте
Цена по запросу
Показано с 1 по 3 из 3 (всего 1 страниц)