Объединение карт через NVLink
NVLink — прямое соединение между графическими картами в обход шины PCIe. Карты обмениваются данными напрямую и на порядок быстрее, а их память для приложения выглядит как общий пул.
Кто поддерживает, а кто нет
| Ускоритель | NVLink | Как соединяются карты |
|---|---|---|
| NVIDIA H200 NVL | да | Мост на 2 или 4 карты, 900 ГБ/с |
| NVIDIA A100 и A800 | да | Мост на 2 карты, до 600 и до 400 ГБ/с |
| NVIDIA RTX PRO 6000 Blackwell Server Edition | нет | Только PCIe 5.0 x16 |
| NVIDIA A16 | нет | Только PCIe |
Отсутствие NVLink — это свойство самой карты, а не конфигурации сервера. RTX PRO 6000 Blackwell мостом не объединяется ни на какой платформе. Если решение строится вокруг связки карт, выбор — H200 NVL, а в облаке также A100 и A800.
Разница в пропускной способности принципиальная. PCIe 5.0 x16 даёт около 128 ГБ/с в обе стороны, NVLink на H200 — 900 ГБ/с на карту. Именно поэтому обмен между картами через PCIe становится узким местом там, где через NVLink его нет.
A800 отличается от A100 только пропускной способностью NVLink — 400 ГБ/с против 600. На остальных характеристиках это не сказывается.
Когда NVLink действительно нужен
Нужен:
- модель не помещается в память одной карты и разносится между несколькими (тензорный параллелизм);
- обучение с частой синхронизацией градиентов между картами;
- работа с объёмами данных, которые постоянно переливаются между картами.
Не нужен:
- инференс модели, помещающейся в память одной карты;
- несколько независимых задач, каждая на своей карте;
- пакетная обработка, где карты не обмениваются промежуточными результатами.
Во втором случае карты без NVLink дадут ту же производительность — платить за связку смысла нет.
Где доступно
На выделенном сервере карты объединяются физическим мостом и передаются операционной системе напрямую. Готовые конфигурации на платформе SYR4108G включают мосты:
| Карт H200 NVL | Как объединены |
|---|---|
| 2 | Мост на 2 карты |
| 3 | Мост на 2 карты, третья работает отдельно |
| 4 | Мосты на все карты |
| 8 | Два моста по 4 карты |
В GPU Cloud объединение двух карт H200 через мост NVLink доступно как отдельная опция услуги. Для остальных карт облака связка не предусмотрена: на уровне vGPU они работают независимо.
Мост устанавливается при сборке сервера, поэтому потребность в NVLink нужно обозначить при заказе: добавить его к уже собранному серверу — это физические работы на площадке.
Проверка после установки драйвера
Установите драйвер NVIDIA для дата-центров и выполните:
nvidia-smi topo --matrix
В матрице связей между картами должно быть указано соединение NVLink (обозначается
как NV с числом линий), а не PHB, PXB или SYS — это варианты подключения
через PCIe и системную шину.
Состояние самих линий:
nvidia-smi nvlink --status
Команда покажет каждую линию и её скорость. Если линии не отображаются, а физически
мост установлен — проверьте, что карты видны обе (nvidia-smi -L), и обратитесь
в поддержку ITGLOBAL.COM.
На виртуальных машинах с проброшенными картами дополнительно требуется увеличенный размер адресного пространства MMIO — суммарно на все карты с запасом. Если параметр задан меньше, машина не включится.