Услуга

GPU-кластеры и HPC-инфраструктура

Проектируем и разворачиваем multi-GPU кластеры для инференса и обучения LLM. От 4 GPU до сотен узлов с InfiniBand, NVLink и полным стеком управления.

  • Подбор топологии: NVLink/NVSwitch, InfiniBand NDR 400Gb/s
  • GPU H100 (80 ГБ HBM3), H200 (141 ГБ HBM3e), B200 (192 ГБ HBM3e)
  • Kubernetes + NVIDIA GPU Operator / Slurm
  • DCGM, Prometheus, Grafana, алерты
  • Полностью on-premise, ваш ЦОД или выделенный ДЦ
  • Гарантия, удалённое обслуживание, апгрейд
Состав работ

Что входит

Полный цикл: от проектирования до эксплуатации

Проектирование топологии

NVSwitch внутри узла (900 ГБ/с на H100), InfiniBand NDR (400 Gb/s) между узлами, топология fat-tree. Расчёт intra/inter-node-пропускной способности и выбор стратегии параллелизма.

Подбор и поставка GPU

H100 SXM5, H200, B200 - под вашу модель и нагрузку. Расчёт VRAM, TFLOPS, TCO, анализ сценария: инференс, fine-tuning, pre-training.

Сеть и коммутация

InfiniBand NDR для основного трафика NCCL, RoCE v2 или Ethernet для управления. NCCL-оптимизация, предотвращение бутылочных горлышек при all-reduce.

Система хранения

NVMe-oF для чекпойнтов (50+ GB/s), параллельная ФС (WekaFS / Lustre) для датасетов, S3-объектное хранилище для архивов.

Планировщик и оркестрация

Slurm с gres.conf и topology-aware scheduling или Kubernetes + NVIDIA GPU Operator. MIG для инференса, time-slicing, fair-share между командами.

Мониторинг и алерты

DCGM Exporter > Prometheus > Grafana. Утилизация GPU, NVLink-трафик, термальный троттлинг, SM occupancy. Алерты при падении утилизации.

Платформы и назначение

Проверено по официальным источникам 7 сентября 2026 года

ПлатформаРесурсыЧто проверяем
Узел H100 / H200 Количество GPU и память по спецификации узла Сеть, топология, параллелизм и целевая модель
DGX B200 8 GPU / 1 440 ГБ HBM3e Питание, охлаждение, профиль inference и обучения
DGX B300 8 Blackwell Ultra GPU / 2,1 ТБ памяти узла Спецификация конкретной поставки и совместимость ПО
AMD Instinct MI350X 288 ГБ HBM3e на ускоритель Поддержка модели, ROCm и межсоединений
Процесс

Как мы внедряем

От аудита ЦОД до промышленной эксплуатации кластера

  1. 01

    Аудит инфраструктуры

    Обследуем ЦОД: свободные стойки, питание, охлаждение и сеть. Проверяем требования конкретных серверных платформ, возможность выделенного сегмента и закрытого режима.

  2. 02

    Архитектура и ТЗ

    Готовим схему топологии, спецификацию GPU/сети/СХД, смету и TCO на 3 года. Выбираем стратегию параллелизма под вашу задачу.

  3. 03

    Поставка и монтаж

    Поставляем оборудование, монтируем в стойки, коммутируем InfiniBand и Ethernet. Подключаем резервированное питание и охлаждение.

  4. 04

    Настройка стека

    CUDA 13.2, NVIDIA Container Toolkit, vLLM / SGLang, Docker / K8s / Slurm. Развёртываем мониторинг и алертинг.

  5. 05

    Приёмка и документация

    Тестируем under-load: latency, throughput, пропускная способность сети, скорость I/O. Передаём паспорт кластера, регламенты и runbook.

Архитектура под вашу нагрузку

Число GPU выбираем после расчёта полного checkpoint, KV-cache, batch и резервирования. Для inference сравниваем tensor, pipeline, expert и data parallelism; для обучения дополнительно учитываем состояния оптимизатора и градиенты.

Версии inference-движка, драйверов и контейнеров фиксируем после проверки модели. Топология PCIe, NVLink/NVSwitch и межузловая сеть влияют на задержку обменов; универсальной конфигурации для всех моделей нет.

DGX B200 — спецификация NVIDIA. DGX B300 — спецификация NVIDIA. AMD Instinct MI350 — спецификация AMD.

GPU без архитектуры - деньги на ветер

Покупка GPU без проекта топологии, сети и СХД приводит к утилизации 20-40% и перерасходу бюджета. Кластер - это не сумма видеокарт, а единая система. Мы начинаем с аудита и расчёта, а не с заказа железа.

Риски

Ошибки, которых мы не допускаем

Типовые проблемы, которые мы исключаем на этапе архитектуры

PCIe вместо NVSwitch

All-reduce через PCIe - узкое место для multi-GPU. Тренировка модели 70B на PCIe-связке даёт 3-5x меньший throughput. NVSwitch/NVLink обязателен.

NFS для чекпойнтов

Сохранение чекпойнта 64 GPU на NFS длится минуты, I/O stall теряет дорогие GPU-циклы. NVMe-oF или параллельная ФС - не опция, а требование.

Отсутствие планировщика

Без Slurm/K8s команды вручную занимают GPU, конфликтуют за ресурсы. Планировщик - не роскошь, а базовая функция кластера.

Неверный parallel strategy

Неучёт 18:1 ratio intra/inter-node bandwidth ломает масштабирование. TP - внутри узла, PP/DP - между узлами. Ошибка в стратегии = 40-60% потеря throughput.

Тепловой троттлинг

700 Вт на H100 SXM5, до 1 200 Вт на B200. Без инженерного расчёта охлаждения - гарантированный троттлинг через 10-15 минут.

Нет мониторинга утилизации

Кластер при 40% утилизации теряет больше половины вложений в год. DCGM + Prometheus + Grafana с алертами - обязательный минимум с первого дня.

Спроектировать GPU-кластер?

Опишите задачу: модель, ожидаемая нагрузка (RPS / пользователей), требования к приватности (on-premise / air-gap / выделенный ДЦ). Вернёмся с архитектурой, спецификацией и TCO на 3 года.