Перейти к основному содержимому

Объединение карт через NVLink

NVLink — прямое соединение между графическими картами в обход шины PCIe. Карты обмениваются данными напрямую и на порядок быстрее, а их память для приложения выглядит как общий пул.

Кто поддерживает, а кто нет

УскорительNVLinkКак соединяются карты
NVIDIA H200 NVLдаМост на 2 или 4 карты, 900 ГБ/с
NVIDIA A100 и A800даМост на 2 карты, до 600 и до 400 ГБ/с
NVIDIA RTX PRO 6000 Blackwell Server EditionнетТолько PCIe 5.0 x16
NVIDIA A16нетТолько PCIe
warning

Отсутствие NVLink — это свойство самой карты, а не конфигурации сервера. RTX PRO 6000 Blackwell мостом не объединяется ни на какой платформе. Если решение строится вокруг связки карт, выбор — H200 NVL, а в облаке также A100 и A800.

Разница в пропускной способности принципиальная. PCIe 5.0 x16 даёт около 128 ГБ/с в обе стороны, NVLink на H200 — 900 ГБ/с на карту. Именно поэтому обмен между картами через PCIe становится узким местом там, где через NVLink его нет.

A800 отличается от A100 только пропускной способностью NVLink — 400 ГБ/с против 600. На остальных характеристиках это не сказывается.

Нужен:

  • модель не помещается в память одной карты и разносится между несколькими (тензорный параллелизм);
  • обучение с частой синхронизацией градиентов между картами;
  • работа с объёмами данных, которые постоянно переливаются между картами.

Не нужен:

  • инференс модели, помещающейся в память одной карты;
  • несколько независимых задач, каждая на своей карте;
  • пакетная обработка, где карты не обмениваются промежуточными результатами.

Во втором случае карты без NVLink дадут ту же производительность — платить за связку смысла нет.

Где доступно

На выделенном сервере карты объединяются физическим мостом и передаются операционной системе напрямую. Готовые конфигурации на платформе SYR4108G включают мосты:

Карт H200 NVLКак объединены
2Мост на 2 карты
3Мост на 2 карты, третья работает отдельно
4Мосты на все карты
8Два моста по 4 карты

В GPU Cloud объединение двух карт H200 через мост NVLink доступно как отдельная опция услуги. Для остальных карт облака связка не предусмотрена: на уровне vGPU они работают независимо.

Мост устанавливается при сборке сервера, поэтому потребность в NVLink нужно обозначить при заказе: добавить его к уже собранному серверу — это физические работы на площадке.

Проверка после установки драйвера

Установите драйвер NVIDIA для дата-центров и выполните:

nvidia-smi topo --matrix

В матрице связей между картами должно быть указано соединение NVLink (обозначается как NV с числом линий), а не PHB, PXB или SYS — это варианты подключения через PCIe и системную шину.

Состояние самих линий:

nvidia-smi nvlink --status

Команда покажет каждую линию и её скорость. Если линии не отображаются, а физически мост установлен — проверьте, что карты видны обе (nvidia-smi -L), и обратитесь в поддержку ITGLOBAL.COM.

примечание

На виртуальных машинах с проброшенными картами дополнительно требуется увеличенный размер адресного пространства MMIO — суммарно на все карты с запасом. Если параметр задан меньше, машина не включится.