ИИ-серверы под ключ
Подбираем, поставляем и настраиваем GPU-серверы для локальных LLM, RAG, генерации видео и машинного зрения. От рабочей станции до серверного узла: модель и нагрузка определяют конфигурацию.
- RTX 5090 32 ГБ и RTX PRO 6000 Blackwell 96 ГБ
- H100, H200, B200 и AMD Instinct под серверные задачи
- Расчёт памяти всех весов и KV-cache
- Установка inference-стека, испытания и мониторинг
Что входит в поставку
Расчёт конфигурации
Учитываем весь checkpoint, KV-cache, длину контекста и параллельные запросы. Для видео — также разрешение, число кадров и активации.
Сборка и испытания
Проверяем совместимость платы, корпуса, питания, памяти, дисков и охлаждения. Измеряем поведение системы под рабочей нагрузкой.
Настройка ПО
Фиксируем совместимые версии драйверов, CUDA или ROCm и inference-движка. Проверяем нужную модель и API на вашей конфигурации.
Эксплуатация
Настраиваем мониторинг GPU, памяти, очередей и ошибок. Согласуем обновление моделей, резервирование и регламент сопровождения.
Оборудование для локального ИИ
Проверено по официальным источникам 7 сентября 2026 года
| Ускоритель | Память | Применение / исполнение |
|---|---|---|
| RTX 5090 | 32 ГБ GDDR7 | Рабочая станция |
| RTX PRO 6000 Blackwell | 96 ГБ GDDR7 ECC | Рабочая станция или сервер; разные исполнения |
| H100 SXM | 80 ГБ HBM3 | Серверный ускоритель |
| H200 | 141 ГБ HBM3e | Серверный ускоритель |
| B200 (DGX B200) | 180 ГБ HBM3e на GPU | 1 440 ГБ на узел из 8 GPU |
| AMD Instinct MI300X | 192 ГБ HBM3 | Сервер; проверка совместимости ROCm |
| AMD Instinct MI350X | 288 ГБ HBM3e | Сервер; проверка совместимости ROCm |
Как собираем и запускаем
-
01
Расчёт конфигурации
От модели к железу: VRAM под веса + KV-cache + overhead, throughput, batch size. Сравнение cost-per-token на 3 года с учётом доступности GPU на российском рынке.
-
02
Сборка и стресс-тест
Собираем в сертифицированных корпусах с запасом по питанию и cooling budget. 48 часов под 100% нагрузкой - фиксируем троттлинг, OOM, нестабильность.
-
03
Пусконаладка и передача
Устанавливаем CUDA, Docker, inference-серверы, мониторинг. Настраиваем API, доступы, бэкапы. Передаём в вашем контуре с документацией и обучением команды.
-
04
Гарантия и сопровождение
1 - 5 лет гарантии на железо. Удалённый мониторинг, плановое обновление стека и моделей, замена GPU при отказе. Помогаем с fine-tuning и LoRA-адаптацией.
Как выбрать GPU под модель
Память считается по всей модели
Память = все веса checkpoint + KV-cache/активации + runtime и параллельные запросы. Активные параметры MoE не равны объёму загружаемых весов. CPU/RAM-offload возможен, но меняет задержку. GPU, лицензия, quantization, контекст и throughput проверяются пилотом; наличие и цена оборудования уточняются отдельно.
Грубая нижняя оценка только весов: число параметров × разрядность / 8. Например, для 27B при 4 битах это около 13,5 ГБ без служебных данных квантования, KV-cache и runtime. Это не готовое требование к VRAM и не обещание работы с максимальным контекстом.
Рабочая станция и кластер
Компактные модели вроде Gemma 4 12B и Qwen3.8-27B рассматриваем для одной GPU с подходящим форматом весов. DeepSeek V4 Flash 0731, GLM-5.3-Flash и Kimi K2.7 Code требуют существенно большего бюджета памяти. Offload в RAM возможен в совместимых движках, но его задержку нужно измерять.
Для нескольких GPU сравниваем tensor, pipeline, expert и data parallelism. NVLink/NVSwitch полезны для частых обменов, но не являются обязательным условием любого multi-GPU inference. Выбор зависит от модели, runtime и допустимой задержки.
Спецификации производителей
- RTX 5090 — 32 ГБ GDDR7.
- RTX PRO 6000 Blackwell — 96 ГБ GDDR7 ECC.
- H100 SXM — 80 ГБ HBM3.
- H200 — 141 ГБ HBM3e.
- B200 (DGX B200) — 180 ГБ HBM3e на GPU.
- AMD Instinct MI300X — 192 ГБ HBM3.
- AMD Instinct MI350X — 288 ГБ HBM3e.
Проверяем конкретное исполнение
У H100, RTX PRO 6000 и других семейств различаются серверные и настольные варианты, память, питание и охлаждение. Для DGX B200 производитель указывает 1 440 ГБ суммарной памяти на 8 GPU. Спецификацию, поставку и совместимость фиксируем до заказа.
Что проверяем до покупки
Полные веса MoE
Число активных параметров определяет лишь часть вычислений. Нельзя выбирать GPU только по этой цифре.
Контекст и нагрузка
Один короткий запрос и десятки длинных диалогов требуют разного объёма памяти. Проверяем оба сценария.
Инфраструктура
Мощность, отвод тепла, сеть и диски рассчитываются для конкретного сервера и стойки.
Реальные измерения
Не обещаем токены в секунду, число пользователей или окупаемость до теста на согласованных данных.
Нужен ИИ-сервер?
Назовите модели, количество пользователей и требования к приватности - рассчитаем конфигурацию, стоимость владения и сроки поставки.