Как устроен GPU Cloud
GPU Cloud построен на технологии NVIDIA vGPU поверх VMware vSphere с лицензированием NVIDIA AI Enterprise. Один физический ускоритель делится между несколькими виртуальными машинами, каждая получает свой vGPU-профиль — фиксированный объём видеопамяти и долю вычислительных ресурсов карты.
За разделение отвечает vGPU Manager — драйвер на уровне гипервизора. Внутри вашей виртуальной машины стоит обычный драйвер NVIDIA, который видит выделенный ей vGPU как отдельное устройство.
Три способа разделить карту
| Режим | Как делится | Изоляция | Когда применяется |
|---|---|---|---|
| MIG-backed vGPU | Аппаратно, на уровне прошивки карты | Полная: свои вычислительные блоки, кэш и полоса памяти | Нагрузки, где нужна предсказуемая производительность |
| Time-Sliced vGPU | Программно, планировщиком NVIDIA по времени | Память разделена, вычислительные ресурсы — по очереди | Неравномерная нагрузка, много небольших задач |
| Passthrough | Не делится: карта целиком отдаётся одной ВМ | Абсолютная | Максимальная производительность, специфические драйверы |
MIG-backed vGPU
Карта аппаратно разбивается на изолированные экземпляры. У каждого свои потоковые мультипроцессоры, кэш L2, контроллеры памяти и полоса пропускания. Соседние машины друг друга не видят и за ресурсы не конкурируют.
Что это даёт на практике:
- предсказуемую производительность — эффекта «шумного соседа» нет;
- изоляцию сбоев — проблема в одной виртуальной машине не затрагивает остальные;
- гарантированную полосу памяти — без конкуренции за кэш и контроллеры.
Ограничение: на одной карте можно создать профили только одного размера.
Time-Sliced vGPU
Планировщик NVIDIA переключает карту между виртуальными машинами по времени. Видеопамять при этом разделена жёстко, а вычислительные ресурсы машины получают по очереди.
Есть два варианта разбиения:
- Same Size — все профили на карте одинакового размера. Проще планировать и диагностировать, все машины равны.
- Mixed Size — профили разного размера, но на разных картах. В пределах одной карты разбиение всегда однородное.
Passthrough (DirectPath I/O)
Физическая карта передаётся одной виртуальной машине целиком, минуя слой vGPU. Производительность близка к работе на физическом сервере, но карта не делится. Режим доступен по запросу.
Объединение двух карт H200 через мост NVLink доступно как отдельная опция услуги; для остальных карт связка не предусмотрена. Если нужен физический сервер целиком — посмотрите Dedicated GPU.
Что поддерживают карты
| Семейство | Time-Sliced vGPU | MIG-backed vGPU | Passthrough |
|---|---|---|---|
| H200 NVL | да | да | да |
| RTX PRO 6000 Blackwell | да | да | да |
| A100 и A800 80GB | да | да | да |
Аппаратное разбиение MIG поддерживают все карты, доступные в GPU Cloud, — оно включено в лицензию NVIDIA AI Enterprise, входящую в услугу.
Что дальше
- Выбор карты и профиля — какой профиль брать под вашу задачу
- Подготовка виртуальной машины — от создания ВМ до работающего
nvidia-smi - Запуск LLM — Ollama, llama.cpp, vLLM и Triton на готовой машине