Услуга

ИИ-серверы под ключ

Подбираем, поставляем и настраиваем GPU-серверы для локальных LLM, RAG, генерации видео и машинного зрения. От рабочей станции до серверного узла: модель и нагрузка определяют конфигурацию.

  • RTX 5090 32 ГБ и RTX PRO 6000 Blackwell 96 ГБ
  • H100, H200, B200 и AMD Instinct под серверные задачи
  • Расчёт памяти всех весов и KV-cache
  • Установка inference-стека, испытания и мониторинг

Что входит в поставку

Расчёт конфигурации

Учитываем весь checkpoint, KV-cache, длину контекста и параллельные запросы. Для видео — также разрешение, число кадров и активации.

Сборка и испытания

Проверяем совместимость платы, корпуса, питания, памяти, дисков и охлаждения. Измеряем поведение системы под рабочей нагрузкой.

Настройка ПО

Фиксируем совместимые версии драйверов, CUDA или ROCm и inference-движка. Проверяем нужную модель и API на вашей конфигурации.

Эксплуатация

Настраиваем мониторинг GPU, памяти, очередей и ошибок. Согласуем обновление моделей, резервирование и регламент сопровождения.

Оборудование для локального ИИ

Проверено по официальным источникам 7 сентября 2026 года

УскорительПамятьПрименение / исполнение
RTX 5090 32 ГБ GDDR7 Рабочая станция
RTX PRO 6000 Blackwell 96 ГБ GDDR7 ECC Рабочая станция или сервер; разные исполнения
H100 SXM 80 ГБ HBM3 Серверный ускоритель
H200 141 ГБ HBM3e Серверный ускоритель
B200 (DGX B200) 180 ГБ HBM3e на GPU 1 440 ГБ на узел из 8 GPU
AMD Instinct MI300X 192 ГБ HBM3 Сервер; проверка совместимости ROCm
AMD Instinct MI350X 288 ГБ HBM3e Сервер; проверка совместимости ROCm
Процесс

Как собираем и запускаем

  1. 01

    Расчёт конфигурации

    От модели к железу: VRAM под веса + KV-cache + overhead, throughput, batch size. Сравнение cost-per-token на 3 года с учётом доступности GPU на российском рынке.

  2. 02

    Сборка и стресс-тест

    Собираем в сертифицированных корпусах с запасом по питанию и cooling budget. 48 часов под 100% нагрузкой - фиксируем троттлинг, OOM, нестабильность.

  3. 03

    Пусконаладка и передача

    Устанавливаем CUDA, Docker, inference-серверы, мониторинг. Настраиваем API, доступы, бэкапы. Передаём в вашем контуре с документацией и обучением команды.

  4. 04

    Гарантия и сопровождение

    1 - 5 лет гарантии на железо. Удалённый мониторинг, плановое обновление стека и моделей, замена GPU при отказе. Помогаем с fine-tuning и LoRA-адаптацией.

Как выбрать GPU под модель

Память считается по всей модели

Память = все веса checkpoint + KV-cache/активации + runtime и параллельные запросы. Активные параметры MoE не равны объёму загружаемых весов. CPU/RAM-offload возможен, но меняет задержку. GPU, лицензия, quantization, контекст и throughput проверяются пилотом; наличие и цена оборудования уточняются отдельно.

Грубая нижняя оценка только весов: число параметров × разрядность / 8. Например, для 27B при 4 битах это около 13,5 ГБ без служебных данных квантования, KV-cache и runtime. Это не готовое требование к VRAM и не обещание работы с максимальным контекстом.

Рабочая станция и кластер

Компактные модели вроде Gemma 4 12B и Qwen3.8-27B рассматриваем для одной GPU с подходящим форматом весов. DeepSeek V4 Flash 0731, GLM-5.3-Flash и Kimi K2.7 Code требуют существенно большего бюджета памяти. Offload в RAM возможен в совместимых движках, но его задержку нужно измерять.

Для нескольких GPU сравниваем tensor, pipeline, expert и data parallelism. NVLink/NVSwitch полезны для частых обменов, но не являются обязательным условием любого multi-GPU inference. Выбор зависит от модели, runtime и допустимой задержки.

Спецификации производителей

Проверяем конкретное исполнение

У H100, RTX PRO 6000 и других семейств различаются серверные и настольные варианты, память, питание и охлаждение. Для DGX B200 производитель указывает 1 440 ГБ суммарной памяти на 8 GPU. Спецификацию, поставку и совместимость фиксируем до заказа.

Что проверяем до покупки

Полные веса MoE

Число активных параметров определяет лишь часть вычислений. Нельзя выбирать GPU только по этой цифре.

Контекст и нагрузка

Один короткий запрос и десятки длинных диалогов требуют разного объёма памяти. Проверяем оба сценария.

Инфраструктура

Мощность, отвод тепла, сеть и диски рассчитываются для конкретного сервера и стойки.

Реальные измерения

Не обещаем токены в секунду, число пользователей или окупаемость до теста на согласованных данных.

Нужен ИИ-сервер?

Назовите модели, количество пользователей и требования к приватности - рассчитаем конфигурацию, стоимость владения и сроки поставки.