NVIDIA B200 — serwer Blackwell do treningu dużych modeli

B200 to pierwszy układ generacji Blackwell w formacie modułu SXM. W węźle ośmiomodułowym daje 1 440 GB pamięci HBM3e o sumarycznej przepustowości 64 TB/s, spiętej dwoma przełącznikami NVLink piątej generacji o łącznej przepustowości 14,4 TB/s. Maszyna zajmuje 10U i pobiera około 14,3 kW, dlatego stoi w naszej serwerowni, a nie u klienta. Konfiguracje z B200 wyceniamy indywidualnie i podajemy wraz z terminem dostawy.

Przeglądaj katalog →
Serwery DGX 1

Do czego to służy

Blackwell liczy natywnie w formacie FP4, czego generacja Hopper nie potrafi. Węzeł ośmiomodułowy osiąga 144 petaFLOPS w FP4 z rzadkością i 72 petaFLOPS gęsto, a w FP8 odpowiednio 72 i 36 petaFLOPS. Przy inferencji dużych modeli oznacza to więcej tokenów na sekundę z tej samej szafy, o ile model został przygotowany pod niższą precyzję.

1 440 GB pamięci graficznej to pojemność pod wstępne trenowanie modeli fundamentowych powyżej stu miliardów parametrów bez rozbijania wag na wiele węzłów. Pamięć systemowa startuje z 2 TB i rozszerza się do 4 TB, a dane leżą na ośmiu dyskach NVMe o pojemności 3,84 TB każdy, obok pary dysków systemowych.

Sieć: cztery gniazda OSFP obsługują osiem jednoportowych kart ConnectX-7 do 400 Gb/s, a dwie dwuportowe karty BlueField-3 dokładają po 400 Gb/s na obsługę ruchu do magazynu danych. Taki węzeł jest projektowany jako element klastra, nie jako pojedyncza maszyna do zadań wsadowych.

Porównanie i dobór

Wobec węzła H200: 1 440 GB pamięci zamiast 1 128 GB, przepustowość HBM3e 64 TB/s w skali węzła, natywny FP4 oraz przełączniki NVLink piątej generacji o łącznym paśmie 14,4 TB/s. W FP8 wydajność rośnie z 32 do 72 petaFLOPS z rzadkością. Ceną za to jest pobór około 14,3 kW wobec około 10,2 kW i obudowa 10U zamiast 8U.

Wobec B300, czyli Blackwella Ultra: ta sama liczba modułów, ale 2,1 TB pamięci graficznej zamiast 1,44 TB i sieć klastrowa podwojona do ośmiu portów ConnectX-8 po 800 Gb/s. Wydajność FP8 jest w obu maszynach identyczna (72 petaFLOPS z rzadkością), różnica siedzi w FP4 liczonym gęsto: 108 wobec 72 petaFLOPS.

Wobec generacji Ampere różnica jest już nieporównywalna wprost — węzeł z modułami A100 SXM4 deklaruje 5 petaFLOPS w obliczeniach AI i 640 GB pamięci. B200 bierze się tam, gdzie skala modelu wymusza pracę w niskiej precyzji i dużej pamięci na węzeł, A100 — gdzie liczy się koszt utrzymania stałej mocy obliczeniowej.

Najczęstsze pytania

Czym B200 różni się od H100 i H200?

Architekturą i formatami liczbowymi. Blackwell wprowadza natywny FP4 i podnosi wydajność FP8 z 32 do 72 petaFLOPS na węzeł, a pamięć rośnie do 180 GB HBM3e na moduł. Hopper pozostaje sensowny tam, gdzie stos oprogramowania jest już dopięty pod FP8 albo BF16 i nie korzysta z niższej precyzji.

Ile modułów B200 pracuje w jednym systemie?

Osiem — tyle obsadza płyta bazowa HGX B200, spięta dwoma przełącznikami NVLink piątej generacji. Mniejszych obsad ta konstrukcja nie przewiduje; przy mniejszym budżecie mocy właściwym kierunkiem są maszyny PCIe z kartami H200 NVL.

Jakich warunków wymaga węzeł B200 w serwerowni?

Obudowa 10U o masie ponad 140 kg, sześć zasilaczy 3,3 kW w układzie nadmiarowym, pobór szczytowy około 14,3 kW i chłodzenie powietrzne o wydatku około 1 550 stóp sześciennych na minutę w zakresie od 10 do 35 stopni Celsjusza. Te warunki zapewnia nasza serwerownia — najemca dostaje gotową maszynę.

Czy B200 jest dostępny od ręki?

Maszyny tej klasy kompletujemy pod zamówienie, więc termin dostawy potwierdzamy w ofercie razem z ceną. W zapytaniu warto podać planowany start projektu — od niego zależy, który wariant sieci i przestrzeni dyskowej ma sens.

Jaki jest minimalny okres najmu?

Rozliczamy w okresach miesięcznym, sześciomiesięcznym i dwunastomiesięcznym; przy maszynach tej klasy dłuższy okres obniża ratę najbardziej zauważalnie. Konkretne poziomy stawek są częścią wyceny.

Jak przenieść dane z obecnej infrastruktury?

Węzeł ma osiem dysków NVMe po 3,84 TB na dane oraz karty sieciowe po 400 Gb/s, więc kopia zbioru treningowego idzie łączem, a nie nośnikiem. Harmonogram przenosin ustalamy przed startem umowy, żeby maszyna liczyła od pierwszego dnia.

Dlaczego cena B200 jest podawana na zapytanie?

Rata zależy od wariantu pamięci systemowej (2 albo 4 TB), obsady kart sieciowych i długości umowy, a przy tej klasie sprzętu każda z tych pozycji przesuwa kwotę o rząd wielkości większy niż cały serwer PCIe. Dlatego liczymy ją pod konkretną konfigurację.