
TR DC Rack H200 4
- Karty
- 4× H200 NVL 141 GB
- Rdzenie
- 64 fizyczne
- RAM
- 1 024 GB · 8,00 TB NVMe
H200 to układ Hopper z pamięcią 141 GB HBM3e i przepustowością 4,8 TB/s — ta sama moc obliczeniowa FP8 co w H100, ale znacznie więcej miejsca na wagi modelu i cache kontekstu. W katalogu mamy dwie konfiguracje rackowe: czterokartową z 564 GB pamięci graficznej i ośmiokartową z 1 128 GB. Stawka zaczyna się od 41 915 zł miesięcznie, czyli 14,35 zł za godzinę pracy jednej karty w przeliczeniu, i nie zmienia się wraz z obciążeniem maszyny.
Przeglądaj katalog →

Pojemność pamięci decyduje o tym, ile modelu zmieści się na jednym układzie. 141 GB HBM3e przyjmuje model klasy 70B w BF16 (około 140 GB wag) — z zapasem na kontekst pracuje się wtedy na parze kart i 282 GB. Model klasy 405B w FP8 to około 405 GB wag, więc mieści się w czterokartowym węźle z 564 GB pamięci graficznej.
Osiem kart i 1 128 GB to pojemność, przy której jeden węzeł obsługuje kilka dużych modeli równolegle albo jeden model z bardzo długim oknem kontekstu, gdzie cache uwagi rośnie szybciej niż same wagi. Przepustowość 4,8 TB/s przekłada się wprost na liczbę tokenów na sekundę przy generowaniu — inferencja autoregresywna jest ograniczona pasmem pamięci, a nie liczbą operacji.
Do tego dochodzą zadania, które po prostu nie mieściły się wcześniej w jednym węźle: trening z długim kontekstem, symulacje z dużymi macierzami rezydentnymi w pamięci karty oraz inferencja wielodzierżawna, gdzie każdy proces dostaje własny wycinek pamięci bez schodzenia do pamięci systemowej.
Względem H100 zmienia się wyłącznie podsystem pamięci: 141 GB HBM3e i 4,8 TB/s zamiast 80 GB HBM3 i 3,35 TB/s, przy identycznej wydajności obliczeniowej FP8. To maszyna pod modele, które nie mieściły się w H100, a nie pod większą liczbę operacji na sekundę. W węźle ośmiokartowym różnica robi się widoczna w sumie: 1 128 GB wobec 640 GB pamięci graficznej.
Względem Blackwella różnica jest generacyjna. Węzeł z ośmioma modułami B200 ma 1 440 GB HBM3e o łącznej przepustowości 64 TB/s i liczy natywnie w FP4, czego Hopper nie potrafi; kosztem jest pobór około 14,3 kW wobec około 10,2 kW dla węzła H200 i obudowa 10U zamiast 8U. Szczegóły po stronie Blackwella: B200.
W obrębie samego H200 wybór sprowadza się do formy montażu: wersja H200 NVL na PCIe stoi w naszych kadłubach rackowych i ma jawny cennik, a moduły H200 SXM5 pracują na płycie bazowej HGX z łączem 900 GB/s na układ i są wyceniane indywidualnie.
Więcej miejsca na model i szybszy dostęp do niego: 141 GB zamiast 80 GB oraz 4,8 TB/s zamiast 3,35 TB/s. Przy generowaniu tokenów, które jest ograniczone pasmem pamięci, przekłada się to na wyższą przepustowość, a przy dużych modelach pozwala zejść z liczby kart potrzebnych do uruchomienia jednej instancji.
Gdy model i cache kontekstu mieszczą się w 80 GB na układ i całość zadania jest ograniczona mocą obliczeniową, a nie pamięcią. W takim przypadku ta sama praca wykona się na H100, a przy zadaniach bez FP8 — na A100 z tańszą ratą miesięczną.
1 128 GB pamięci graficznej to na przykład dwa modele klasy 405B w FP8 z zapasem na kontekst albo kilkanaście modeli klasy 8–32B serwowanych równolegle, każdy na własnym układzie. Realną liczbę wyznacza wielkość okna kontekstu i liczba równoczesnych sesji, nie same wagi.
Wariant czterokartowy ma 564 GB pamięci graficznej, 1 TB pamięci systemowej i 8 TB NVMe; wariant ośmiokartowy — 1 128 GB pamięci graficznej, 2 TB pamięci systemowej i 28 TB NVMe. Oba stoją na kadłubie ASUS ESC8000-E12 z dwoma procesorami Intel Xeon serii 6.
Tak. Rata miesięczna jest niższa przy umowie sześciomiesięcznej i jeszcze niższa przy rocznej; wszystkie trzy poziomy są wypisane w tabeli cen przy każdej konfiguracji. Sama zasada rozliczenia zostaje ta sama — jedna stała kwota za miesiąc pracy maszyny.
Montaż maszyny w szafie, konfigurację systemu i zdalnego dostępu oraz testy przed przekazaniem. Kwota różni się między wariantem czterokartowym a ośmiokartowym i jest podana przy każdej pozycji cennika.
Maszyny tego działu kompletujemy na zamówienie, dlatego termin dostawy potwierdzamy w ofercie. Data przekazania dostępu jest częścią wyceny, którą przygotowujemy w ciągu doby roboczej.
Tak. Przedmiotem najmu jest cała fizyczna maszyna: wszystkie karty H200, procesory, pamięć i dyski pozostają do wyłącznej dyspozycji jednej umowy przez cały okres jej trwania.