NVIDIA A100 SXM4 — serwer klasy DGX z NVLink

A100 SXM4 to modułowa wersja układu A100: zamiast karty w gnieździe PCIe moduł przykręcany jest do płyty bazowej i wymienia dane z sąsiadami przez NVLink trzeciej generacji o przepustowości 600 GB/s. W tej formie A100 występuje w węzłach DGX A100 — wariancie 320 GB z modułami po 40 GB i wariancie 640 GB z modułami po 80 GB. Konfiguracje SXM4 wyceniamy indywidualnie, bo cena zależy od wariantu pamięci, obsady kart sieciowych i długości umowy.

Przeglądaj katalog →
Serwery DGX 2

Do czego to służy

Moduł SXM4 wybiera się wtedy, gdy karty muszą ze sobą rozmawiać w trakcie liczenia, a nie tylko wymieniać wyniki po każdym kroku. Trening z podziałem modelu między układy, duże operacje all-reduce i równoległość potokowa opierają się o pasmo międzykartowe: 600 GB/s przez NVLink wobec 32 GB/s w jedną stronę na łączu PCIe 4.0 to różnica rzędu wielkości.

Węzeł 640 GB daje osiem modułów po 80 GB HBM2e spiętych sześcioma przełącznikami NVSwitch drugiej generacji, 2 TB pamięci systemowej, 128 rdzeni procesorowych i 30 TB pamięci podręcznej NVMe na dane treningowe. Wariant 320 GB ma moduły po 40 GB, 1 TB pamięci systemowej i 15 TB NVMe — obsługuje te same schematy równoległości przy mniejszym budżecie pamięci na model.

Do tego dochodzi sieć klastrowa: do ośmiu jednoportowych kart ConnectX-7 albo ConnectX-6 o przepustowości 200 Gb/s pozwala łączyć węzły w klaster, w którym trening rozpięty jest na wielu maszynach. To scenariusz, w którym pojedynczy serwer PCIe przestaje wystarczać.

Porównanie i dobór

Wobec wersji PCIe tej samej karty pamięć jest taka sama, zmienia się sposób łączenia i gęstość. Osiem modułów SXM4 pracuje w jednej domenie NVLink w obudowie 6U o poborze 6,5 kW; osiem kart A100 PCIe stoi w kadłubie 4U i komunikuje się przez magistralę systemową. Przy inferencji i zadaniach dzielonych na niezależne procesy różnica jest niewielka, przy treningu rozproszonym decyduje o czasie epoki.

Wobec nowszej generacji modułowej: H100 SXM5 ma pamięć HBM3 o przepustowości 3,35 TB/s wobec około 2 TB/s w A100, NVLink 900 GB/s zamiast 600 GB/s oraz Transformer Engine z natywnym FP8, którego generacja Ampere nie obsługuje. Węzeł H100 pobiera za to około 10,2 kW i zajmuje 8U, wobec 6,5 kW i 6U dla A100.

Deklarowana wydajność węzła A100 to 5 petaFLOPS w obliczeniach AI i 10 petaOPS w INT8. Producent opisuje przewagę wariantu 640 GB nad 320 GB jako do trzech razy szybsze zadania treningowe dużej skali, przy niezmienionej mocy obliczeniowej samego układu — pracuje tu podwojona pamięć, nie zegar.

Najczęstsze pytania

Czym SXM4 różni się od A100 w wersji PCIe?

Sposobem montażu, poborem mocy i łączem między układami. Moduł SXM4 siedzi na płycie bazowej i korzysta z NVLink 600 GB/s oraz przełączników NVSwitch, karta PCIe wpina się w gniazdo i wymienia dane przez magistralę systemową. Konfiguracji SXM4 nie składa się dowolnie — węzeł jest fabrycznie ośmiomodułowy.

Ile realnie daje NVLink przy treningu?

Zysk rośnie wraz z udziałem komunikacji w kroku treningowym. Przy modelu dzielonym między układy albo dużym rozmiarze partii kolejne kroki czekają na wymianę gradientów, więc pasmo 600 GB/s skraca czas epoki. Przy zadaniach, które mieszczą się w jednej karcie i liczą niezależnie, różnica jest marginalna.

Wariant 320 GB czy 640 GB?

320 GB to moduły po 40 GB, 1 TB pamięci systemowej i 15 TB NVMe — wystarcza, gdy model mieści się w 40 GB na układ. 640 GB to moduły po 80 GB, 2 TB pamięci systemowej i 30 TB przestrzeni na dane; ten wariant bierze się pod większe modele i dłuższe zbiory treningowe.

Jakich warunków wymaga taki węzeł w kolokacji?

Obudowa ma 6U i waży ponad 120 kg, pobór szczytowy sięga 6,5 kW przy sześciu zasilaczach 3000 W w układzie nadmiarowym, a chłodzenie jest powietrzne i przewidziane na zakres od 5 do 30 stopni Celsjusza. Maszyna pracuje w naszej serwerowni, więc te warunki zapewniamy po naszej stronie.

Czy można wynająć mniej niż osiem modułów SXM4?

Płyta bazowa węzła jest fabrycznie obsadzona ośmioma modułami i nie rozdziela się jej na mniejsze części. Gdy potrzebne są dwie albo cztery karty, właściwym wyborem jest wersja PCIe opisana na stronie A100.

Dlaczego cena jest podawana na zapytanie?

Węzły SXM4 różnią się wariantem pamięci, obsadą kart sieciowych i konfiguracją przestrzeni dyskowej, a każdy z tych elementów zmienia ratę. Zamiast publikować jedną liczbę oderwaną od konfiguracji, przygotowujemy wycenę pod konkretny zestaw — zwykle w ciągu doby roboczej.

Czy węzeł A100 SXM4 da się połączyć z drugim w klaster?

Tak. Konstrukcja przewiduje do ośmiu jednoportowych kart ConnectX-7 albo ConnectX-6 po 200 Gb/s plus porty Ethernet, co pozwala spiąć węzły siecią klastrową. Topologię i liczbę portów ustalamy na etapie wyceny, bo zależą od planowanej skali treningu.