Сервер для ответов по вашим документам
RAG добавляет к языковой модели поиск по подготовленным источникам. Оборудование подбирают для всего процесса: загрузки документов, построения индекса, поиска и генерации ответа.
01 / Документы
Извлечение текста, таблиц и метаданных; OCR для сканов.
02 / Индекс
Фрагменты документов, векторы и сведения о правах доступа.
03 / Поиск
Отбор подходящих фрагментов и при необходимости их переоценка.
04 / Ответ
Передача найденных фрагментов LLM и формирование ответа с источниками.
Какая часть RAG нагружает сервер
| Этап | Основные ресурсы | Что измерять |
|---|---|---|
| Загрузка и обработка | CPU, RAM, диски; GPU при использовании соответствующих моделей OCR/извлечения | Число и формат документов, скорость первичной загрузки и обновлений. |
| Эмбеддинги | Ресурсы выбранной модели преобразования текста в векторы | Число фрагментов, размер пакета, время обновления индекса. |
| Поиск и reranking | RAM, NVMe, CPU и при необходимости GPU для переоценки результатов | Время поиска, размер индекса и число параллельных запросов. |
| Генерация | Память и вычисления LLM | Контекст с найденными фрагментами, задержка и скорость ответа. |
Один узел или разделение сервисов
Для пилота можно рассматривать один сервер, если выбранные компоненты помещаются в его ресурсы и допустим общий режим обслуживания. При совместной работе индексации и пользовательских запросов они могут конкурировать за CPU, память, диски и GPU. Поэтому проверяют не только отдельные операции, но и одновременную нагрузку.
Когда обновление документов мешает ответам, имеет смысл отделить обработку и индекс от сервиса генерации. Для устойчивой работы также обсуждают резервирование, резервные копии, восстановление индекса и работу приложения при недоступности одного компонента. Схема определяется требованиями проекта, а не фиксированным числом документов.
Пример оценки размера векторов
Если хранить 1 миллион векторов размерности 1024 в FP32, сами значения займут около 4,096 ГБ: 1 000 000 × 1024 × 4 байта. Это арифметический пример, а не требование ко всему серверу. Индекс поиска, исходные фрагменты, метаданные, реплики и служебные структуры требуют дополнительного места.
Укажите количество именно фрагментов после разбиения, а не только файлов. Один большой документ может дать много фрагментов. На объём и время обработки влияют выбранная модель эмбеддингов, размер фрагмента, пересечения и формат хранения.
Проверка качества до выбора окончательной конфигурации
Подготовьте набор типовых вопросов с ожидаемыми источниками. Проверьте, найден ли нужный документ, корректно ли извлечены таблицы, подтверждается ли ответ ссылками и что происходит при отсутствии данных. Отдельно проверьте доступ: пользователь не должен получать фрагменты документов, которые ему не разрешено читать.
Скорость измеряйте от отправки запроса до готового ответа, затем отдельно разбирайте время поиска, переоценки и генерации. Увеличение мощности GPU не исправит ошибочное разбиение документов или отсутствие нужного источника в индексе.
Серверные платформы для обсуждения проекта

Supermicro SYS-521GE-TNRT
Платформа PCIe для подбора GPU-части сервиса. Состав GPU и дисковой подсистемы согласуется.

Supermicro SYS-421GU-TNXR (EOL)
Серверная платформа 4U. Возможность совместного размещения компонентов RAG проверяется расчётом.
Это варианты платформ, а не протестированные готовые комплекты RAG. Выбранные LLM, эмбеддинги, база поиска и программная архитектура определяют конфигурацию. Для полностью локальной системы отдельно проверяют, какие компоненты обращаются к внешним сервисам.
Что включить в запрос на подбор
Форматы и объём документов; доля сканов и таблиц; число новых документов за день; частота обновления; система прав доступа; предполагаемая LLM; число одновременных запросов; целевое время ответа и требования к резервированию. Если уже есть пилот, приложите измерения по этапам.
Выбор GPU для генерации ответа
NVIDIA L4 и NVIDIA L40S можно рассмотреть после оценки языковой модели и параллельных запросов. Для OCR, эмбеддингов и поиска нагрузку считайте отдельно. Название RAG не задаёт фиксированный состав GPU, RAM и накопителей.
Варианты построения RAG-сервера
Совмещённый узел
Поиск, генерация и подготовка документов работают на одном сервере. Проверяем, что переиндексация не ухудшает время ответа пользователям.
Разделение обработки
OCR и построение индекса выносятся в отдельную очередь или узел. Подходит как вариант при большом потоке обновлений и разной нагрузке этапов.
Контроль качества
До масштабирования проверяем поиск нужных фрагментов, ссылки на источники и соблюдение прав доступа на тестовых вопросах.
NVIDIA L4 и NVIDIA L40S — кандидаты для GPU-этапов, если их поддерживает выбранное ПО. Поиск по индексу, OCR, вычисление эмбеддингов и генерация имеют разные требования; необходимость GPU и размер ресурсов оцениваем для каждого этапа отдельно.
| Этап | Данные для расчёта | Проверка результата |
|---|---|---|
| Документы и OCR | Типы файлов, языки, объём поступления, доля сканов | Точность извлечения текста и скорость загрузки. |
| Индекс и поиск | Число фрагментов, модель эмбеддингов, метаданные, обновления | Размер индекса, время поиска, доля найденных релевантных фрагментов. |
| Ответ пользователю | Модель, контекст, параллельность, ограничения доступа | Время ответа, обоснованность по источникам, отсутствие доступа к чужим документам. |
Для проекта фиксируем объём исходных документов, правила резервного копирования и рост индекса. Ёмкость SSD нельзя рассчитывать только по размеру исходных файлов: место требуется также индексу, журналам, промежуточным данным и резерву обновления.
Подобрать оборудование под вашу задачу
Укажите модель нейросети, сценарий работы, число пользователей, требования к размещению и бюджет. Если нужен конкретный товар — приложите артикул или спецификацию.
Обсудить конфигурациюОтправить техническое заданиеДокументация для проверки проекта: NVIDIA: архитектура RAG и её компоненты; Supermicro SYS-521GE-TNRT; Supermicro SYS-421GU-TNXR (EOL).
