Mehr als eine Karte, mehr als eine Maschine · Server Room · gegr. 2004

Hochskalieren läuft über PCIe. Ausskalieren läuft über den Port.

Eine einzelne Karte in einer einzelnen Maschine ist abgeschlossene Arithmetik, komplett bepreist auf der GPU-Seite. Jenseits davon beginnt die Ingenieursarbeit: Die nächste Karte konkurriert um Lanes und Watt im Gehäuse, die nächste Maschine spricht über einen Port, der pro Node gekauft wird, und die Plattform, die eine dieser Achsen maximiert, stößt auf der anderen an ihre Grenze. Unser Katalog beziffert diesen Kompromiss in Zahlen, und diese Seite druckt sie aus.

Den Lane-gegen-Port-Kompromiss ansehen Das Fabric bepreisen

Einzelmandant auf jedem Gehäuse, PCIe-Passthrough auf jeder Karte und kein Byte-Zähler auf irgendeinem Port — Verkehr zwischen Ihren Nodes ist niemandes Rechnungsposten.

Gezählt, nicht zusammengestellt

  • 4Platforms that seat a card
  • 100 GbpsTop port speed, per node
  • 2Socket ceiling, one chassis
  • 1 TBRAM ceiling, one chassis
  • 2Cities stocking all of them

Abgeleitet aus dem Bestellkatalog bei dieser Anfrage — dieselben Zeilen, aus denen der Checkout abrechnet, sodass nichts davon veraltet sein kann. Was physisch gerackt und eingeschaltet ist, während Sie dies lesen, ist eine andere Frage, und Sofort-Server führt diese Liste.

Zuerst den Engpass benennen

Eine zweite Karte und eine zweite Maschine beheben unterschiedliche Engpässe.

„Wir brauchen mehr Rechenleistung“ ist noch keine Spezifikation. Ob der Engpass im Gehäuse oder über das Rack hinweg liegt, entscheidet, was bestellt wird, wie das Geld fließt und an welche Grenze Sie als Nächstes stoßen — deshalb teilt sich die Seite hier, genauso wie sich die Bestellung teilen wird.

Im Gehäuse

Eine Karte zur vorhandenen Maschine hinzufügen

Das Symptom ist ein ausgehungerter Beschleuniger oder ein verdrängtes Working Set: Batches stauen sich auf dem Bus, oder das Modell ist über den Speicher der Karte hinausgewachsen. Die Lösung ist eine zweite Karte — und wie viele das Gehäuse aufnimmt, wird durch den Slot-Freiraum, das Lane-Budget pro Sockel und die Reserve des Netzteils bestimmt, drei Zahlen, die zu einem bestimmten Gehäuse mit einer bestimmten Karte gehören und nicht zu irgendeiner Katalogzeile. Wir quotieren es mit benanntem Bauteil, statt eine Checkbox zu verkaufen.

Was es entscheidet: das Gehäuse. Nennen Sie die Karte, und das Angebot nennt das Gehäuse, das so viele davon aufnimmt, und das Datum.

Was zwei Karten nicht sind: eine große Karte. Ihre Speicherpools bleiben getrennt, es sei denn, Ihre Laufzeitumgebung teilt die Arbeit zwischen ihnen auf — Tensor- oder Pipeline-Parallelität für einen großen Job, was einen Tribut auf der Verbindung zwischen den Karten kostet. Arbeit, die bereits aus vielen unabhängigen Jobs besteht, läuft einfach auf doppeltem Silizium, unverändert.

Über das Rack hinweg

Eine zweite Maschine danebenstellen

Das Symptom ist eine volle Maschine: Sockel belegt, DIMM-Steckplätze bestückt, Jobs reihen sich hinter Jobs. Das Beste, was eine kartenaufnehmende Plattform hier bietet, ist 2 sockets and 1 TB, und jenseits dieser Wand existiert in diesem Katalog kein größerer Einzelrechner — die nächste Kapazitätseinheit ist ein weiterer Server, kein größerer.

Was es entscheidet: das Gebäude und der Port. Node-zu-Node-Verkehr ist nur innerhalb einer Einrichtung sinnvoll, und jeder Node kauft seinen eigenen Port — die Fabric-Rechnung ist der Portpreis mal der Node-Anzahl, jeden Monat.

Was ein Cluster hier ist: n getrennte Server. Getrennt bestellt, getrennt fakturiert, getrennt aufgerüstet und ersetzt. Es existiert keine Cluster-SKU, was auch bedeutet, dass weder ein Cluster-Aufschlag noch eine Mindest-Node-Anzahl existiert.

Der Kompromiss, gemessen

Der breiteste Bus und der schnellste Port stecken in verschiedenen Maschinen.

Jede Plattform, in die wir eine Karte einsetzen, auf den Achsen, die einen Cluster statt eines Servers dimensionieren. Die Bus-Generationen sind dieselbe bezogene Tabelle, die die GPU-Seite druckt — eine Datei, zwei Seiten, keine Möglichkeit, sich zu widersprechen — und alles andere ist der Bestellkatalog, der für sich selbst spricht.

Live from the order catalog on this request. Follow any row across: the bus column and the port column pull against each other.
PlatformPCIe to the cardPort ceilingSocketsRAM ceilingCities
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Wie ein Ingenieur diese Tabelle liest

  • PCIe-Lanes begrenzen den Host-zu-Karte-Transfer — Batch-Streaming, Szenenladen, alles, was aus dem Kartenspeicher herausläuft. Ein Modell, das resident ist und resident bleibt, hört auf, sich um sie zu kümmern.
  • Die Port-Obergrenze begrenzt den Node-zu-Node-Transfer. Bei einer Maschine ist sie irrelevant; bei zweien ist sie das ganze Problem.
  • Städte ist die Spalte, die man für einen Cluster zuerst prüft, nicht zuletzt: Eine Plattform, die perfekt ist und in Ihrem Gebäude fehlt, ist kein Kandidat.
  • Daher: busgespeiste Einzel-Node-Arbeit gehört auf die breitesten Lanes und kann den Port ignorieren; partitionierte Arbeit gehört dorthin, wo der Port am höchsten ausläuft, und kann einen älteren Bus tolerieren. Ein Build, der beide Maxima gleichzeitig verlangt, existiert in diesem Katalog nicht, und wir drucken das hier, statt Sie es zur Rechnungszeit herausfinden zu lassen.

Welches Silizium in den Slot kommt und die eigene monatliche Zeile jeder Karte, steht unter GPU dedizierte Server — die einzige Seite dieser Domain, die eine Karte bepreisen darf. Nichts unten wiederholt eine Zahl von dort.

Die Fabric-Rechnung

Multiplizieren Sie den Port mit n, bevor Sie es ein Budget nennen.

Ein Port wird pro Maschine bepreist, also ist die Verbindung unter einem Cluster derselbe Rechnungsposten einmal pro Node. Die Tabelle trägt diese Multiplikation bereits ausgeführt, denn Budgets, die aus Einzelserver-Preisen zusammengesetzt sind, sind der Grund, warum Cluster-Angebote als Überraschungen zurückkommen.

Monthly, per machine, on top of the machine itself. A cluster buys its speed once per node — the multiplied columns are the fabric bill.
SpeedPer node× 2 nodes× 4 nodesReaches it
1 Gbpsincludedincludedincludedall 4 platforms
2 Gbps$189$378$756all 4 platforms
3 Gbps$299$598$1,196all 4 platforms
5 Gbps$459$918$1,836all 4 platforms
10 Gbps$529$1,058$2,116all 4 platforms
20 Gbps$1,629$3,258$6,516all 4 platforms
40 Gbps$2,799$5,598$11,1962 of 4 platforms
100 Gbps$3,999$7,998$15,9961 of 4 platforms

Bemerkenswert in dieser Leiter

  • Die Sprossen sind nicht linear bepreist. An mehreren Punkten kosten n Maschinen eine Sprosse tiefer weniger als n−1 Maschinen eine Sprosse höher — und bringen Ihnen einen ganzen zusätzlichen Server. Ob dieser Kompromiss Ihnen offensteht, hängt nur davon ab, ob der Job partitioniert.
  • Die rechte Spalte dünnt nach oben hin aus. Die höchsten Geschwindigkeiten existieren auf weniger Plattformen und nicht auf der mit dem breitesten Bus — das Argument der Plattformtabelle, von der Netzwerkseite gelesen.

Was nicht im Katalog steht, ausgesprochen statt angedeutet

Zwischen zwei unserer Maschinen ist die aufgeführte Verbindung ein Ethernet-Port. Es gibt keinen InfiniBand-Rechnungsposten und keine Karte-zu-Karte-Brücke auf irgendeinem Bestellformular, und eine Seite über Cluster, die um diese Tatsache herumschreibt, führt Sie mit Layout in die Irre. Wenn ein Build eines von beidem braucht, fragen Sie vor der Bestellung: Die Antwort ist ein Angebot, und manchmal ist die Antwort nein — beides ist billiger, zuerst zu hören.

Jede Sprosse ist in beide Richtungen ungedrosselt, ohne Freikontingent und ohne Egress-Zeile irgendwo auf einer Rechnung — Replikation, Shuffles und Checkpoints zwischen Ihren Nodes kosten den Port und nichts weiter. Für einen Port auf einer Maschine, nach eigenen Kriterien beurteilt, ist Ungedrosselte Ports die Seite.

Platzierung

Ein Cluster wird in ein Gebäude platziert, bevor er konfiguriert wird.

Latenz macht die Einrichtung zu einer harten Einschränkung: Nodes, die einen Job teilen, teilen einen Raum. Unsere fünf Räume führen nicht dieselben Plattformen, also kann ein Ingenieur, der zuerst die Plattform wählt, eine wählen, die seine Stadt nicht führt — prüfen Sie den Raum, dann konfigurieren Sie. Das Raster unten ist abgeleitet, sodass eine Plattform, die eine neue Stadt erreicht, hier erscheint, ohne dass jemand etwas bearbeitet.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Die Gebäude selbst — Strom, Carrier und wer in jedem ans Telefon geht — stehen unter Rechenzentren. Wenn die Latenz zwischen zwei unserer Städte für Ihr Node-Paar wichtig ist, bitten Sie den Support, sie zwischen diesen Räumen zu messen; eine Zahl schlägt eine Karte.

Von der Bestellung bis ins Rack

Das Datum kommt mit dem Angebot, nicht nach der Zahlung.

Ein Multi-Node-Build besteht aus mehreren Maschinen und oft aus Teilen im Wert einer Bestellung — deshalb wird hier kein Liefer-Slogan veröffentlicht, sondern das Lieferzeit-Register, das Build to Order und die GPU-Seite bereits verwenden, mit dem langen Pol identifiziert, bevor Sie sich auf irgendetwas festlegen.

  1. ~30 Minuten

    Bereits gerackt, wie besehen übernommen

    Keine Montage und kein Rack-Besuch — die Maschinen existieren und werden übergeben. Sofort-Server ist diese Liste, und für die einfachen Nodes eines Clusters ist sie der erste Ort, der lesenswert ist.

  2. 4–24 Stunden

    Aus eigenem Bestand montiert

    Der Standardfall: Karten eingesetzt, Arrays gebaut, Betriebssysteme installiert — jeder Node parallel bearbeitet statt hinter seinem Nachbarn eingereiht.

  3. 5–10 Arbeitstage

    Für den Build eingekauft

    Ein Teil in der Spezifikation ist keines, das wir lagern, also wird es zuerst bestellt. Für ein Multi-Karten-Gehäuse ist dies die übliche Sprosse, und meist ist es das Gehäuse statt des Siliziums, das sie bestimmt.

  4. 10–15 Arbeitstage

    Auf Zuteilung

    Beschleuniger der aktuellen Generation kommen, wenn der Distributor sagt, dass sie kommen. Wir benennen diese Abhängigkeit im Voraus, und Hardware, die gegen eine einzelne Bestellung eingekauft wird, erfordert drei Monate im Voraus — eine Stornierung in Woche zwei würde eine Maschine hinterlassen, die für niemanden gebaut wurde.

Die Uhr jeder Sprosse startet, wenn Zahlung und Betrugsprüfung abgeschlossen sind — der eine Schritt, der keine zugesagte Dauer trägt. Bei einer großen Erstbestellung passiert eine Überweisung die Prüfung tendenziell schneller als eine Karte; bewusst zu wählen lohnt sich, wenn ein Rack-Besuch darauf wartet.

Ein Cluster übersteht einen Chat besser als ein Formular. — wie viele Nodes, ob der Job partitioniert und womit er sprechen muss — und die antwortende Person hat so etwas schon einmal quotiert. Wenn eine Maschine es abdeckt, wird sie Ihnen das sagen, statt Ihnen vier zu verkaufen.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. Card prices are missing on purpose — GPU dedicated servers prints every one of them beside the machine each figure belongs to.

Cards in one chassis
Above one, the count is quoted: slot clearance, the per-socket lane budget and the power envelope belong to a specific chassis holding a specific card, so the honest number needs the part named. Name it, and the quote comes back with the chassis, the count and the date.
Nodes in one cluster
Any number from one up. Each node is a whole physical server with its own invoice and its own term, ordered, upgraded and replaced independently — no cluster SKU exists here, so neither does a cluster premium or a minimum count.
Card-taking platforms
4, and they specialise: AMD EPYC gives a card the widest bus (PCIe 4.0, 128 lanes per socket) while topping out at 20 Gbps of network in 2 of 5 cities; the 100 Gbps ceiling belongs to Intel Xeon Silver / Gold, which feeds a card an older bus. Scaling up and scaling out are therefore different platform choices.
The link between nodes
An Ethernet port on each node — 1 Gbps included on each of them, priced rungs to 100 Gbps — bought per machine per month, so a cluster pays the rung once per node. No InfiniBand line and no card-to-card bridge is in the catalog; anything past the port is quoted, and the answer can be no.
Where one machine stops
2 sockets and 1 TB of RAM, on the best of these platforms. Past either figure the unit of capacity is the next machine, not a bigger one.
Cities
5: New York, Miami, San Francisco, Amsterdam, Bucharest. Nodes that share a job belong in one of them together, and New York and Bucharest stock the complete platform set.
Traffic
Unmetered at every speed, both directions, with no allowance and no egress line — replication, shuffles and checkpoints between your nodes cost the port and nothing further.
Tenancy
One account per physical machine, on every node of the cluster, each card on PCIe passthrough into that account’s own operating system — no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
Delivery
About half an hour for machines racked as-is, four to twenty-four hours fitted from our stock, five to ten working days bought in, ten to fifteen for an allocation part — and a multi-node quote names its long pole before you pay.
Term
Monthly per machine, no contract; three, six and twelve-month cycles discount up to 15%. Hardware bought in against a single order takes three months up front.
Card money
Absent from this page by rule. Every card we seat and its own monthly line are on GPU dedicated servers, each figure printed beside the exact machine it belongs to.