info@qbs.ru
×
0
0

Ваша корзина пуста!
Серверы для RAG и корпоративной базы знаний
QBS / RAG / КОРПОРАТИВНЫЙ ПОИСК

Сервер для ответов по вашим документам

RAG добавляет к языковой модели поиск по подготовленным источникам. Оборудование подбирают для всего процесса: загрузки документов, построения индекса, поиска и генерации ответа.

01 / Документы

Извлечение текста, таблиц и метаданных; OCR для сканов.

02 / Индекс

Фрагменты документов, векторы и сведения о правах доступа.

03 / Поиск

Отбор подходящих фрагментов и при необходимости их переоценка.

04 / Ответ

Передача найденных фрагментов LLM и формирование ответа с источниками.

Какая часть RAG нагружает сервер

ЭтапОсновные ресурсыЧто измерять
Загрузка и обработкаCPU, RAM, диски; GPU при использовании соответствующих моделей OCR/извлеченияЧисло и формат документов, скорость первичной загрузки и обновлений.
ЭмбеддингиРесурсы выбранной модели преобразования текста в векторыЧисло фрагментов, размер пакета, время обновления индекса.
Поиск и rerankingRAM, NVMe, CPU и при необходимости GPU для переоценки результатовВремя поиска, размер индекса и число параллельных запросов.
ГенерацияПамять и вычисления LLMКонтекст с найденными фрагментами, задержка и скорость ответа.

Один узел или разделение сервисов

Для пилота можно рассматривать один сервер, если выбранные компоненты помещаются в его ресурсы и допустим общий режим обслуживания. При совместной работе индексации и пользовательских запросов они могут конкурировать за CPU, память, диски и GPU. Поэтому проверяют не только отдельные операции, но и одновременную нагрузку.

Когда обновление документов мешает ответам, имеет смысл отделить обработку и индекс от сервиса генерации. Для устойчивой работы также обсуждают резервирование, резервные копии, восстановление индекса и работу приложения при недоступности одного компонента. Схема определяется требованиями проекта, а не фиксированным числом документов.

Пример оценки размера векторов

Если хранить 1 миллион векторов размерности 1024 в FP32, сами значения займут около 4,096 ГБ: 1 000 000 × 1024 × 4 байта. Это арифметический пример, а не требование ко всему серверу. Индекс поиска, исходные фрагменты, метаданные, реплики и служебные структуры требуют дополнительного места.

Укажите количество именно фрагментов после разбиения, а не только файлов. Один большой документ может дать много фрагментов. На объём и время обработки влияют выбранная модель эмбеддингов, размер фрагмента, пересечения и формат хранения.

Проверка качества до выбора окончательной конфигурации

Подготовьте набор типовых вопросов с ожидаемыми источниками. Проверьте, найден ли нужный документ, корректно ли извлечены таблицы, подтверждается ли ответ ссылками и что происходит при отсутствии данных. Отдельно проверьте доступ: пользователь не должен получать фрагменты документов, которые ему не разрешено читать.

Скорость измеряйте от отправки запроса до готового ответа, затем отдельно разбирайте время поиска, переоценки и генерации. Увеличение мощности GPU не исправит ошибочное разбиение документов или отсутствие нужного источника в индексе.

Серверные платформы для обсуждения проекта

Supermicro SYS-521GE-TNRT

Supermicro SYS-521GE-TNRT

Платформа PCIe для подбора GPU-части сервиса. Состав GPU и дисковой подсистемы согласуется.

Supermicro SYS-421GU-TNXR

Supermicro SYS-421GU-TNXR (EOL)

Серверная платформа 4U. Возможность совместного размещения компонентов RAG проверяется расчётом.

Это варианты платформ, а не протестированные готовые комплекты RAG. Выбранные LLM, эмбеддинги, база поиска и программная архитектура определяют конфигурацию. Для полностью локальной системы отдельно проверяют, какие компоненты обращаются к внешним сервисам.

Что включить в запрос на подбор

Форматы и объём документов; доля сканов и таблиц; число новых документов за день; частота обновления; система прав доступа; предполагаемая LLM; число одновременных запросов; целевое время ответа и требования к резервированию. Если уже есть пилот, приложите измерения по этапам.

О модели SYS-421GU-TNXR: производитель пометил её EOL. Это HGX H100/H200 с четырьмя SXM GPU. Ссылка оставлена для идентификации платформы; возможность поставки требует подтверждения.

Выбор GPU для генерации ответа

NVIDIA L4 и NVIDIA L40S можно рассмотреть после оценки языковой модели и параллельных запросов. Для OCR, эмбеддингов и поиска нагрузку считайте отдельно. Название RAG не задаёт фиксированный состав GPU, RAM и накопителей.

Варианты построения RAG-сервера

Совмещённый узел

Поиск, генерация и подготовка документов работают на одном сервере. Проверяем, что переиндексация не ухудшает время ответа пользователям.

Разделение обработки

OCR и построение индекса выносятся в отдельную очередь или узел. Подходит как вариант при большом потоке обновлений и разной нагрузке этапов.

Контроль качества

До масштабирования проверяем поиск нужных фрагментов, ссылки на источники и соблюдение прав доступа на тестовых вопросах.

NVIDIA L4 и NVIDIA L40S — кандидаты для GPU-этапов, если их поддерживает выбранное ПО. Поиск по индексу, OCR, вычисление эмбеддингов и генерация имеют разные требования; необходимость GPU и размер ресурсов оцениваем для каждого этапа отдельно.

ЭтапДанные для расчётаПроверка результата
Документы и OCRТипы файлов, языки, объём поступления, доля скановТочность извлечения текста и скорость загрузки.
Индекс и поискЧисло фрагментов, модель эмбеддингов, метаданные, обновленияРазмер индекса, время поиска, доля найденных релевантных фрагментов.
Ответ пользователюМодель, контекст, параллельность, ограничения доступаВремя ответа, обоснованность по источникам, отсутствие доступа к чужим документам.

Для проекта фиксируем объём исходных документов, правила резервного копирования и рост индекса. Ёмкость SSD нельзя рассчитывать только по размеру исходных файлов: место требуется также индексу, журналам, промежуточным данным и резерву обновления.

Подобрать оборудование под вашу задачу

Укажите модель нейросети, сценарий работы, число пользователей, требования к размещению и бюджет. Если нужен конкретный товар — приложите артикул или спецификацию.

Обсудить конфигурациюОтправить техническое задание

Документация для проверки проекта: NVIDIA: архитектура RAG и её компоненты; Supermicro SYS-521GE-TNRT; Supermicro SYS-421GU-TNXR (EOL).


Новинка
GPU-сервер Supermicro SYS-421GU-TNXR, 4U
GPU-сервер Supermicro SYS-421GU-TNXR, 4U
SYS-421GU-TNXR
Уточняйте
Цена по запросу
Новинка
GPU-сервер Supermicro SYS-521GE-TNRT — 2×8558, 16×64 ГБ, 2×7,68 ТБ
GPU-сервер Supermicro SYS-521GE-TNRT — 2×8558, 16×64 ГБ, 2×7,68 ТБ
SYS-521GE-TNRT-2X8558-16X64GB-2X7680GBSSD-6XPCIE20
Уточняйте
Цена по запросу
Показано с 1 по 2 из 2 (всего 1 страниц)