GPU-кластеры и HPC-инфраструктура
Проектируем и разворачиваем multi-GPU кластеры для инференса и обучения LLM. От 4 GPU до сотен узлов с InfiniBand, NVLink и полным стеком управления.
- Подбор топологии: NVLink/NVSwitch, InfiniBand NDR 400Gb/s
- GPU H100 (80 ГБ HBM3), H200 (141 ГБ HBM3e), B200 (192 ГБ HBM3e)
- Kubernetes + NVIDIA GPU Operator / Slurm
- DCGM, Prometheus, Grafana, алерты
- Полностью on-premise, ваш ЦОД или выделенный ДЦ
- Гарантия, удалённое обслуживание, апгрейд
Что входит
Полный цикл: от проектирования до эксплуатации
Проектирование топологии
NVSwitch внутри узла (900 ГБ/с на H100), InfiniBand NDR (400 Gb/s) между узлами, топология fat-tree. Расчёт intra/inter-node-пропускной способности и выбор стратегии параллелизма.
Подбор и поставка GPU
H100 SXM5, H200, B200 - под вашу модель и нагрузку. Расчёт VRAM, TFLOPS, TCO, анализ сценария: инференс, fine-tuning, pre-training.
Сеть и коммутация
InfiniBand NDR для основного трафика NCCL, RoCE v2 или Ethernet для управления. NCCL-оптимизация, предотвращение бутылочных горлышек при all-reduce.
Система хранения
NVMe-oF для чекпойнтов (50+ GB/s), параллельная ФС (WekaFS / Lustre) для датасетов, S3-объектное хранилище для архивов.
Планировщик и оркестрация
Slurm с gres.conf и topology-aware scheduling или Kubernetes + NVIDIA GPU Operator. MIG для инференса, time-slicing, fair-share между командами.
Мониторинг и алерты
DCGM Exporter > Prometheus > Grafana. Утилизация GPU, NVLink-трафик, термальный троттлинг, SM occupancy. Алерты при падении утилизации.
Платформы и назначение
Проверено по официальным источникам 7 сентября 2026 года
| Платформа | Ресурсы | Что проверяем |
|---|---|---|
| Узел H100 / H200 | Количество GPU и память по спецификации узла | Сеть, топология, параллелизм и целевая модель |
| DGX B200 | 8 GPU / 1 440 ГБ HBM3e | Питание, охлаждение, профиль inference и обучения |
| DGX B300 | 8 Blackwell Ultra GPU / 2,1 ТБ памяти узла | Спецификация конкретной поставки и совместимость ПО |
| AMD Instinct MI350X | 288 ГБ HBM3e на ускоритель | Поддержка модели, ROCm и межсоединений |
Как мы внедряем
От аудита ЦОД до промышленной эксплуатации кластера
-
01
Аудит инфраструктуры
Обследуем ЦОД: свободные стойки, питание, охлаждение и сеть. Проверяем требования конкретных серверных платформ, возможность выделенного сегмента и закрытого режима.
-
02
Архитектура и ТЗ
Готовим схему топологии, спецификацию GPU/сети/СХД, смету и TCO на 3 года. Выбираем стратегию параллелизма под вашу задачу.
-
03
Поставка и монтаж
Поставляем оборудование, монтируем в стойки, коммутируем InfiniBand и Ethernet. Подключаем резервированное питание и охлаждение.
-
04
Настройка стека
CUDA 13.2, NVIDIA Container Toolkit, vLLM / SGLang, Docker / K8s / Slurm. Развёртываем мониторинг и алертинг.
-
05
Приёмка и документация
Тестируем under-load: latency, throughput, пропускная способность сети, скорость I/O. Передаём паспорт кластера, регламенты и runbook.
Архитектура под вашу нагрузку
Число GPU выбираем после расчёта полного checkpoint, KV-cache, batch и резервирования. Для inference сравниваем tensor, pipeline, expert и data parallelism; для обучения дополнительно учитываем состояния оптимизатора и градиенты.
Версии inference-движка, драйверов и контейнеров фиксируем после проверки модели. Топология PCIe, NVLink/NVSwitch и межузловая сеть влияют на задержку обменов; универсальной конфигурации для всех моделей нет.
DGX B200 — спецификация NVIDIA. DGX B300 — спецификация NVIDIA. AMD Instinct MI350 — спецификация AMD.
GPU без архитектуры - деньги на ветер
Покупка GPU без проекта топологии, сети и СХД приводит к утилизации 20-40% и перерасходу бюджета. Кластер - это не сумма видеокарт, а единая система. Мы начинаем с аудита и расчёта, а не с заказа железа.
Ошибки, которых мы не допускаем
Типовые проблемы, которые мы исключаем на этапе архитектуры
PCIe вместо NVSwitch
All-reduce через PCIe - узкое место для multi-GPU. Тренировка модели 70B на PCIe-связке даёт 3-5x меньший throughput. NVSwitch/NVLink обязателен.
NFS для чекпойнтов
Сохранение чекпойнта 64 GPU на NFS длится минуты, I/O stall теряет дорогие GPU-циклы. NVMe-oF или параллельная ФС - не опция, а требование.
Отсутствие планировщика
Без Slurm/K8s команды вручную занимают GPU, конфликтуют за ресурсы. Планировщик - не роскошь, а базовая функция кластера.
Неверный parallel strategy
Неучёт 18:1 ratio intra/inter-node bandwidth ломает масштабирование. TP - внутри узла, PP/DP - между узлами. Ошибка в стратегии = 40-60% потеря throughput.
Тепловой троттлинг
700 Вт на H100 SXM5, до 1 200 Вт на B200. Без инженерного расчёта охлаждения - гарантированный троттлинг через 10-15 минут.
Нет мониторинга утилизации
Кластер при 40% утилизации теряет больше половины вложений в год. DCGM + Prometheus + Grafana с алертами - обязательный минимум с первого дня.
Спроектировать GPU-кластер?
Опишите задачу: модель, ожидаемая нагрузка (RPS / пользователей), требования к приватности (on-premise / air-gap / выделенный ДЦ). Вернёмся с архитектурой, спецификацией и TCO на 3 года.