Więcej niż jedna karta, więcej niż jedna maszyna · Server Room · zał. 2004

Skalowanie w górę jedzie po PCIe. Skalowanie wszerz jedzie po porcie.

Pojedyncza karta w pojedynczej maszynie to zamknięta arytmetyka, wyceniona w całości na stronie GPU. Powyżej jednej zaczyna się inżynieria: kolejna karta walczy o linie i waty wewnątrz obudowy, kolejna maszyna rozmawia przez port kupowany per węzeł, a platforma, która maksuje jedną z tych osi, dobija do dna na drugiej. Nasz katalog podaje ten kompromis w liczbach, a ta strona je drukuje.

Zobacz kompromis linie kontra port Wycena sieci

Pojedynczy najemca na każdej obudowie, passthrough PCIe na każdej karcie i żaden licznik bajtów na żadnym porcie — ruch między twoimi węzłami nie jest niczyją pozycją na fakturze.

Policzone, nie złożone

  • 4Platforms that seat a card
  • 100 GbpsTop port speed, per node
  • 2Socket ceiling, one chassis
  • 1 TBRAM ceiling, one chassis
  • 2Cities stocking all of them

Wywiedzione z katalogu zamówień przy tym żądaniu — z tych samych wierszy, z których rozlicza koszyk, więc nic nie może być nieaktualne. To, co fizycznie stoi w szafie i jest zasilane w chwili, gdy to czytasz, to osobne pytanie, a serwery natychmiastowe prowadzą tę listę.

Najpierw nazwij wąskie gardło

Druga karta i druga maszyna leczą różne niedobory.

„Potrzebujemy więcej mocy obliczeniowej” to jeszcze nie specyfikacja. To, czy niedobór siedzi wewnątrz obudowy, czy w poprzek szafy, decyduje o tym, co się zamawia, jak płyną pieniądze i w który sufit uderzysz jako następny — dlatego strona rozdziela się tutaj, tak samo jak rozdzieli się zamówienie.

Wewnątrz obudowy

Dodaj kartę do maszyny, którą masz

Objaw to zagłodzony akcelerator albo wyrzucony zestaw roboczy: partie czekają w kolejce na magistrali albo model przerósł pamięć karty. Lekarstwem jest druga karta — a to, ile obudowa ich pomieści, wyznaczają prześwit na sloty, budżet linii na gniazdo i zapas mocy zasilacza, trzy liczby należące do konkretnej obudowy trzymającej konkretną kartę, a nie do żadnego wiersza katalogu. Wyceniamy to z nazwaną częścią, zamiast sprzedawać checkbox.

Co o tym decyduje: obudowa. Podaj kartę, a wycena poda obudowę, która pomieści ich tyle, i datę.

Czym dwie karty nie są: jedną dużą kartą. Ich pule pamięci pozostają osobne, chyba że twoje środowisko uruchomieniowe podzieli pracę między nie — równoległość tensorowa lub potokowa dla jednego dużego zadania, która płaci myto na łączu między kartami. Praca, która już jest wieloma niezależnymi zadaniami, po prostu biegnie na dwukrotnie większej ilości krzemu, bez zmian.

W poprzek szafy

Postaw obok drugą maszynę

Objaw to pełna maszyna: gniazda zajęte, sloty DIMM obsadzone, zadania czekają za zadaniami. Najlepsze, co oferuje tutaj jakakolwiek platforma przyjmująca karty, to 2 sockets and 1 TB, a za tą ścianą w tym katalogu nie istnieje żadne większe pojedyncze pudło — następną jednostką pojemności jest kolejny serwer, nie większy.

Co o tym decyduje: budynek i port. Ruch między węzłami ma sens tylko w obrębie jednego obiektu, a każdy węzeł kupuje własny port — rachunek za sieć to cena portu razy liczba węzłów, co miesiąc.

Czym jest tutaj klaster: n osobnych serwerów. Zamawiane osobno, fakturowane osobno, rozbudowywane i wymieniane osobno. Nie istnieje żaden SKU klastra, co oznacza też, że nie istnieje ani premia klastrowa, ani minimalna liczba węzłów.

Kompromis zmierzony

Najszersza magistrala i najszybszy port są na różnych maszynach.

Każda platforma, w której osadzimy kartę, na osiach dobierających klaster, a nie serwer. Generacje magistrali to ta sama tabela źródłowa, którą drukuje strona GPU — jeden plik, dwie strony, żadnej możliwości rozbieżności — a cała reszta to katalog zamówień mówiący sam za siebie.

Live from the order catalog on this request. Follow any row across: the bus column and the port column pull against each other.
PlatformPCIe to the cardPort ceilingSocketsRAM ceilingCities
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Jak inżynier czyta tę tabelę

  • Linie PCIe ograniczają transfer host–karta — strumieniowanie partii, ładowanie scen, wszystko, co wylewa się z pamięci karty. Model, który rezyduje i pozostaje rezydentny, przestaje się nimi przejmować.
  • Pułap portu ogranicza transfer węzeł–węzeł. Przy jednej maszynie jest nieistotny; przy dwóch to cały problem.
  • Miasta to kolumna, którą dla klastra sprawdza się najpierw, nie na końcu: platforma idealna i nieobecna w twoim budynku nie jest kandydatem.
  • Zatem: praca jednowęzłowa karmiona z magistrali należy na najszersze linie i może ignorować port; praca partycjonowana należy tam, gdzie port sięga szczytu, i może tolerować starszą magistralę. Konstrukcja żądająca obu maksimów naraz nie istnieje w tym katalogu, a my drukujemy to tutaj, zamiast pozwolić ci odkryć to przy fakturze.

Jaki krzem wchodzi do slotu i jaka jest własna miesięczna stawka każdej karty, to serwery dedykowane GPU — jedyna strona w tej domenie, która może wycenić kartę. Nic poniżej nie powtarza żadnej liczby stamtąd.

Rachunek za sieć

Pomnóż port przez n, zanim nazwiesz to budżetem.

Port jest wyceniany za maszynę, więc połączenie pod klastrem to ta sama pozycja raz na węzeł. Tabela podaje to mnożenie już wykonane, bo budżety składane z cen pojedynczych serwerów to sposób, w jaki wyceny klastrów wracają jako niespodzianki.

Monthly, per machine, on top of the machine itself. A cluster buys its speed once per node — the multiplied columns are the fabric bill.
SpeedPer node× 2 nodes× 4 nodesReaches it
1 Gbpsincludedincludedincludedall 4 platforms
2 Gbps$189$378$756all 4 platforms
3 Gbps$299$598$1,196all 4 platforms
5 Gbps$459$918$1,836all 4 platforms
10 Gbps$529$1,058$2,116all 4 platforms
20 Gbps$1,629$3,258$6,516all 4 platforms
40 Gbps$2,799$5,598$11,1962 of 4 platforms
100 Gbps$3,999$7,998$15,9961 of 4 platforms

Warto zauważyć w tej drabinie

  • Szczeble nie są wyceniane liniowo. W kilku punktach n maszyn o szczebel niżej kosztuje mniej niż n−1 maszyn o szczebel wyżej — i kupuje ci cały dodatkowy serwer. To, czy ten kompromis jest dla ciebie dostępny, zależy wyłącznie od tego, czy zadanie się partycjonuje.
  • Prawa kolumna rzednie ku górze. Najwyższe prędkości istnieją na mniejszej liczbie platform i nie na tej z najszerszą magistralą — argument tabeli platform, czytany od strony sieci.

Czego nie ma w katalogu, powiedziane wprost zamiast zasugerowane

Między dwiema naszymi maszynami wymienione łącze to port Ethernet. Na żadnym formularzu zamówienia nie ma pozycji InfiniBand ani mostka karta–karta, a strona o klastrach, która omija ten fakt, wprowadza cię w błąd układem. Jeśli konstrukcja potrzebuje któregokolwiek, zapytaj przed zamówieniem: odpowiedzią jest wycena, a czasem odpowiedzią jest nie — obie taniej usłyszeć najpierw.

Każdy szczebel jest nielimitowany w obu kierunkach, bez limitu transferu i bez żadnej pozycji za ruch wychodzący nigdzie na fakturze — replikacja, tasowania i punkty kontrolne między twoimi węzłami kosztują port i nic więcej. Jeden port na jednej maszynie, oceniany na własnych zasadach, to strona porty nielimitowane.

Umiejscowienie

Klaster umieszcza się w budynku, zanim się go skonfiguruje.

Opóźnienie czyni obiekt twardym ograniczeniem: węzły dzielące zadanie dzielą pomieszczenie. Nasze pięć pomieszczeń nie magazynuje tych samych platform, więc inżynier, który najpierw wybiera platformę, może wybrać taką, której jego miasto nie ma — sprawdź pomieszczenie, potem konfiguruj. Siatka poniżej jest wywiedziona, więc platforma docierająca do nowego miasta pojawia się tutaj bez niczyjej edycji.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Same budynki — zasilanie, operatorzy i kto odbiera telefon w każdym — są na centra danych. Jeśli opóźnienie między dwoma naszymi miastami ma znaczenie dla twojej pary węzłów, poproś support o pomiar między tymi pomieszczeniami; liczba bije mapę.

Od zamówienia do szafy

Data przychodzi z wyceną, nie po płatności.

Konstrukcja wielowęzłowa to kilka maszyn i często części warte zamówienia zakupowego — więc publikuje się nie slogan o dostawie, lecz rejestr czasów realizacji, którego używają już budowa na zamówienie i strona GPU, z najdłuższym elementem wskazanym, zanim do czegokolwiek się zobowiążesz.

  1. ~30 minut

    Już w szafie, brane jak stoi

    Bez montażu i bez wizyty w szafie — maszyny istnieją i są przekazywane. Serwery natychmiastowe to ta lista, a dla zwykłych węzłów klastra to pierwsze miejsce warte przeczytania.

  2. 4–24 godziny

    Złożone z własnego magazynu

    Standardowy przypadek: karty osadzone, macierze zbudowane, systemy operacyjne zainstalowane — każdy węzeł obrabiany równolegle, a nie w kolejce za sąsiadem.

  3. 5–10 dni roboczych

    Dokupione do konstrukcji

    Część ze specyfikacji to coś, czego nie trzymamy na półce, więc zamawia się ją najpierw. Dla obudowy wielokartowej to zwykły szczebel i zwykle to obudowa, a nie krzem, go wyznacza.

  4. 10–15 dni roboczych

    Na przydziale

    Akceleratory obecnej generacji przychodzą, kiedy dystrybutor mówi, że przychodzą. Nazywamy tę zależność z góry, a sprzęt kupowany pod pojedyncze zamówienie wymaga trzech miesięcy z góry — anulowanie w drugim tygodniu zostawiłoby maszynę zbudowaną dla nikogo.

Zegar każdego szczebla startuje, gdy płatność i weryfikacja antyfraudowa się rozliczą — jedyny krok bez obiecanego czasu trwania. Przy dużym pierwszym zamówieniu przelew zwykle przechodzi weryfikację szybciej niż karta; warto wybrać świadomie, gdy czeka na to wizyta w szafie.

Klaster lepiej znosi czat niż formularz. — ile węzłów, czy zadanie się partycjonuje i z czym ma rozmawiać — a osoba odpowiadająca wyceniała już taką wcześniej. Jeśli jedna maszyna to pokryje, powie ci to, zamiast sprzedawać ci cztery.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. Card prices are missing on purpose — GPU dedicated servers prints every one of them beside the machine each figure belongs to.

Cards in one chassis
Above one, the count is quoted: slot clearance, the per-socket lane budget and the power envelope belong to a specific chassis holding a specific card, so the honest number needs the part named. Name it, and the quote comes back with the chassis, the count and the date.
Nodes in one cluster
Any number from one up. Each node is a whole physical server with its own invoice and its own term, ordered, upgraded and replaced independently — no cluster SKU exists here, so neither does a cluster premium or a minimum count.
Card-taking platforms
4, and they specialise: AMD EPYC gives a card the widest bus (PCIe 4.0, 128 lanes per socket) while topping out at 20 Gbps of network in 2 of 5 cities; the 100 Gbps ceiling belongs to Intel Xeon Silver / Gold, which feeds a card an older bus. Scaling up and scaling out are therefore different platform choices.
The link between nodes
An Ethernet port on each node — 1 Gbps included on each of them, priced rungs to 100 Gbps — bought per machine per month, so a cluster pays the rung once per node. No InfiniBand line and no card-to-card bridge is in the catalog; anything past the port is quoted, and the answer can be no.
Where one machine stops
2 sockets and 1 TB of RAM, on the best of these platforms. Past either figure the unit of capacity is the next machine, not a bigger one.
Cities
5: New York, Miami, San Francisco, Amsterdam, Bucharest. Nodes that share a job belong in one of them together, and New York and Bucharest stock the complete platform set.
Traffic
Unmetered at every speed, both directions, with no allowance and no egress line — replication, shuffles and checkpoints between your nodes cost the port and nothing further.
Tenancy
One account per physical machine, on every node of the cluster, each card on PCIe passthrough into that account’s own operating system — no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
Delivery
About half an hour for machines racked as-is, four to twenty-four hours fitted from our stock, five to ten working days bought in, ten to fifteen for an allocation part — and a multi-node quote names its long pole before you pay.
Term
Monthly per machine, no contract; three, six and twelve-month cycles discount up to 15%. Hardware bought in against a single order takes three months up front.
Card money
Absent from this page by rule. Every card we seat and its own monthly line are on GPU dedicated servers, each figure printed beside the exact machine it belongs to.