- DGX A100 320 GB — od 14 875 zł netto/mies.
- DGX A100 640 GB — od 47 614 zł netto/mies.
Do czego to służy
Moduł SXM4 wybiera się wtedy, gdy karty muszą ze sobą rozmawiać w trakcie liczenia, a nie tylko wymieniać wyniki po każdym kroku. Trening z podziałem modelu między układy, duże operacje all-reduce i równoległość potokowa opierają się o pasmo międzykartowe: 600 GB/s przez NVLink wobec 32 GB/s w jedną stronę na łączu PCIe 4.0 to różnica rzędu wielkości.
Węzeł 640 GB daje osiem modułów po 80 GB HBM2e spiętych sześcioma przełącznikami NVSwitch drugiej generacji, 2 TB pamięci systemowej, 128 rdzeni procesorowych i 30 TB pamięci podręcznej NVMe na dane treningowe. Wariant 320 GB ma moduły po 40 GB, 1 TB pamięci systemowej i 15 TB NVMe — obsługuje te same schematy równoległości przy mniejszym budżecie pamięci na model.
Do tego dochodzi sieć klastrowa: do ośmiu jednoportowych kart ConnectX-7 albo ConnectX-6 o przepustowości 200 Gb/s pozwala łączyć węzły w klaster, w którym trening rozpięty jest na wielu maszynach. To scenariusz, w którym pojedynczy serwer PCIe przestaje wystarczać.
Porównanie i dobór
Wobec wersji PCIe tej samej karty pamięć jest taka sama, zmienia się sposób łączenia i gęstość. Osiem modułów SXM4 pracuje w jednej domenie NVLink w obudowie 6U o poborze 6,5 kW; osiem kart A100 PCIe stoi w kadłubie 4U i komunikuje się przez magistralę systemową. Przy inferencji i zadaniach dzielonych na niezależne procesy różnica jest niewielka, przy treningu rozproszonym decyduje o czasie epoki.
Wobec nowszej generacji modułowej: H100 SXM5 ma pamięć HBM3 o przepustowości 3,35 TB/s wobec około 2 TB/s w A100, NVLink 900 GB/s zamiast 600 GB/s oraz Transformer Engine z natywnym FP8, którego generacja Ampere nie obsługuje. Węzeł H100 pobiera za to około 10,2 kW i zajmuje 8U, wobec 6,5 kW i 6U dla A100.
Deklarowana wydajność węzła A100 to 5 petaFLOPS w obliczeniach AI i 10 petaOPS w INT8. Producent opisuje przewagę wariantu 640 GB nad 320 GB jako do trzech razy szybsze zadania treningowe dużej skali, przy niezmienionej mocy obliczeniowej samego układu — pracuje tu podwojona pamięć, nie zegar.
Najczęstsze pytania
Czym SXM4 różni się od A100 w wersji PCIe?
Sposobem montażu, poborem mocy i łączem między układami. Moduł SXM4 siedzi na płycie bazowej i korzysta z NVLink 600 GB/s oraz przełączników NVSwitch, karta PCIe wpina się w gniazdo i wymienia dane przez magistralę systemową. Konfiguracji SXM4 nie składa się dowolnie — węzeł jest fabrycznie ośmiomodułowy.
Ile realnie daje NVLink przy treningu?
Zysk rośnie wraz z udziałem komunikacji w kroku treningowym. Przy modelu dzielonym między układy albo dużym rozmiarze partii kolejne kroki czekają na wymianę gradientów, więc pasmo 600 GB/s skraca czas epoki. Przy zadaniach, które mieszczą się w jednej karcie i liczą niezależnie, różnica jest marginalna.
Wariant 320 GB czy 640 GB?
320 GB to moduły po 40 GB, 1 TB pamięci systemowej i 15 TB NVMe — wystarcza, gdy model mieści się w 40 GB na układ. 640 GB to moduły po 80 GB, 2 TB pamięci systemowej i 30 TB przestrzeni na dane; ten wariant bierze się pod większe modele i dłuższe zbiory treningowe.
Jakich warunków wymaga taki węzeł w kolokacji?
Obudowa ma 6U i waży ponad 120 kg, pobór szczytowy sięga 6,5 kW przy sześciu zasilaczach 3000 W w układzie nadmiarowym, a chłodzenie jest powietrzne i przewidziane na zakres od 5 do 30 stopni Celsjusza. Maszyna pracuje w naszej serwerowni, więc te warunki zapewniamy po naszej stronie.
Czy można wynająć mniej niż osiem modułów SXM4?
Płyta bazowa węzła jest fabrycznie obsadzona ośmioma modułami i nie rozdziela się jej na mniejsze części. Gdy potrzebne są dwie albo cztery karty, właściwym wyborem jest wersja PCIe opisana na stronie A100.
Dlaczego cena jest podawana na zapytanie?
Węzły SXM4 różnią się wariantem pamięci, obsadą kart sieciowych i konfiguracją przestrzeni dyskowej, a każdy z tych elementów zmienia ratę. Zamiast publikować jedną liczbę oderwaną od konfiguracji, przygotowujemy wycenę pod konkretny zestaw — zwykle w ciągu doby roboczej.
Czy węzeł A100 SXM4 da się połączyć z drugim w klaster?
Tak. Konstrukcja przewiduje do ośmiu jednoportowych kart ConnectX-7 albo ConnectX-6 po 200 Gb/s plus porty Ethernet, co pozwala spiąć węzły siecią klastrową. Topologię i liczbę portów ustalamy na etapie wyceny, bo zależą od planowanej skali treningu.