- DGX H100 — od 79 992 zł netto/mies.
- ESC N8-E11 — od 123 453 zł netto/mies.
- G593-SD0 — od 152 402 zł netto/mies.
- G593-SD1 — od 130 720 zł netto/mies.
- SYS-821GE-TNHR — od 206 411 zł netto/mies.
- AS-8125GS-TNHR — od 134 877 zł netto/mies.
Do czego to służy
640 GB pamięci w jednym węźle to budżet pod wstępne trenowanie modeli fundamentowych i pod trening z podziałem modelu między układy, gdzie każdy krok kończy się wymianą gradientów. Przy takim schemacie pracy o czasie epoki decyduje pasmo między układami, a nie sama moc obliczeniowa — i właśnie tu 7,2 TB/s na przełącznikach NVSwitch robi różnicę.
Węzeł skaluje się dalej siecią klastrową: cztery gniazda OSFP obsługują osiem jednoportowych kart ConnectX-7 do 400 Gb/s, co daje szczytowo 1 TB/s pasma dwukierunkowo i pozwala budować z takich maszyn większe klastry treningowe. Dane leżą na ośmiu dyskach NVMe po 3,84 TB, obok pary nośników systemowych.
Poza treningiem ta sama konfiguracja obsługuje obliczenia naukowe wymagające dużej pamięci rezydentnej oraz produkcyjne serwowanie kilku modeli naraz, gdy priorytetem jest stała, przewidywalna przepustowość. Maszyna pracuje w naszej serwerowni i jest udostępniana zdalnie przez cały okres najmu.
Porównanie i dobór
Wobec formatu PCIe tego samego układu: moduł SXM5 wymienia dane z sąsiadami z przepustowością 900 GB/s, podczas gdy łącze PCIe 5.0 x16 daje 64 GB/s w jedną stronę. Przy zadaniach niezależnych różnica jest niewielka, przy treningu rozproszonym decyduje o czasie epoki. Wersję kartową opisuje strona H100 NVL.
Wobec H200 SXM5: identyczna topologia i to samo gniazdo, ale 141 GB HBM3e i 4,8 TB/s zamiast 80 GB HBM3 i 3,35 TB/s. W skali węzła to 1 128 GB wobec 640 GB pamięci graficznej przy tej samej wydajności obliczeniowej FP8 — wybór sprowadza się do tego, czy modelowi brakuje pamięci.
Platformy z tą samą płytą bazową różnią się pamięcią systemową i obudową: fabryczny węzeł DGX H100 to 8U, 2 TB pamięci i pobór około 10,2 kW; ASUS ESC N8-E11 mieści się w 7U i przyjmuje do 4 TB; Gigabyte G593-SD0 i G593-SD1 schodzą do 5U przy 8 TB pamięci; Supermicro AS-8125GS-TNHR pracuje z 6 TB. Moc obliczeniowa jest w nich taka sama — różnica dotyczy pamięci systemowej, liczby slotów i gęstości montażu.
Najczęstsze pytania
Kiedy wybrać SXM5 zamiast wersji PCIe?
Gdy zadanie dzieli model albo partię danych między układy i każdy krok kończy się wymianą wyników. Wtedy pasmo 900 GB/s i przełączniki NVSwitch skracają czas treningu. Przy inferencji i zadaniach liczonych niezależnie taniej wypada kadłub PCIe.
Co realnie daje NVSwitch o przepustowości 7,2 TB/s?
Pozwala każdemu z ośmiu układów rozmawiać z każdym innym z pełną prędkością NVLink, zamiast dzielić jedno łącze. W operacjach all-reduce, które w treningu rozproszonym powtarzają się po każdym kroku, to właśnie ta topologia decyduje o skalowaniu.
Czy dostępna jest konfiguracja mniejsza niż osiem modułów?
Płyta bazowa HGX jest fabrycznie ośmiomodułowa i nie rozdziela się jej na mniejsze części. Gdy potrzeba dwóch albo czterech układów H100, właściwym kierunkiem są maszyny PCIe opisane na stronie H100.
Jakiego zasilania i chłodzenia wymaga taki węzeł?
Fabryczny węzeł DGX H100 ma sześć zasilaczy 3,3 kW w układzie nadmiarowym i pobiera szczytowo około 10,2 kW przy chłodzeniu powietrznym; platformy partnerskie pracują z sześcioma zasilaczami 3000 W. Maszyna stoi w naszej serwerowni, więc przygotowanie szafy jest po naszej stronie.
Czy węzeł można wpiąć w sieć InfiniBand?
Tak. Konstrukcja przewiduje osiem jednoportowych kart ConnectX-7 do 400 Gb/s pracujących w trybie InfiniBand albo Ethernet, plus porty na ruch do magazynu danych. Docelową topologię ustalamy na etapie wyceny, bo zależy od liczby węzłów w klastrze.
Którą platformę wybrać: DGX czy maszynę partnerską?
DGX H100 to zamknięta konfiguracja fabryczna z 2 TB pamięci systemowej i stosem oprogramowania producenta. Platformy ASUS, Gigabyte i Supermicro dają większą pamięć systemową (do 8 TB) i inną gęstość montażu przy tej samej płycie bazowej z ośmioma modułami.
Jak wypada stała rata wobec rozliczenia godzinowego?
Węzeł treningowy rzadko stoi bezczynnie — trening trwa dobami. Przy pracy ciągłej powyżej mniej więcej stu trzydziestu godzin miesięcznie stała rata za całą maszynę daje niższy i przewidywalny rachunek, bez pozycji za transfer danych.
Dlaczego wycena jest indywidualna?
Węzły z modułami SXM5 różnią się platformą, pamięcią systemową w zakresie od 2 do 8 TB, przestrzenią NVMe i obsadą kart sieciowych. Każdy z tych parametrów zmienia ratę, więc liczymy ją pod konkretny zestaw — zwykle w ciągu doby roboczej.