Plus d’une carte, plus d’une machine · Server Room · depuis 2004

Monter en puissance passe par le PCIe. Passer à l’échelle passe par le port.

Une seule carte dans une seule machine est une arithmétique réglée, tarifée complètement sur la page GPU. Au-delà d’une, c’est là que l’ingénierie commence : la carte suivante se dispute les voies et les watts à l’intérieur du châssis, la machine suivante communique par un port facturé par nœud, et la plateforme qui maximise l’un de ces axes s’effondre sur l’autre. Notre catalogue énonce ce compromis en chiffres, et cette page les imprime.

Voir le compromis voies contre port Chiffrer le réseau

Locataire unique sur chaque châssis, passthrough PCIe sur chaque carte, et aucun compteur d’octets sur aucun port — le trafic entre vos nœuds n’est la ligne de compte de personne.

Compté, pas composé

  • 4Platforms that seat a card
  • 100 GbpsTop port speed, per node
  • 2Socket ceiling, one chassis
  • 1 TBRAM ceiling, one chassis
  • 2Cities stocking all of them

Dérivé du catalogue de commandes sur cette requête — les mêmes lignes que la caisse facture, donc rien ne peut être périmé. Ce qui est physiquement en rack et sous tension pendant que vous lisez ceci est une question distincte, et serveurs instantanés tient cette liste.

D’abord, nommez le goulot d’étranglement

Une deuxième carte et une deuxième machine remédient à des pénuries différentes.

« Nous avons besoin de plus de calcul » n’est pas encore une spécification. Que la pénurie se situe à l’intérieur du châssis ou à travers le rack détermine ce qui est commandé, comment l’argent circule, et quel plafond vous rencontrerez ensuite — donc la page se divise ici, de la même manière que la commande le fera.

À l’intérieur du châssis

Ajoutez une carte à la machine que vous avez

Le symptôme est un accélérateur affamé ou un ensemble de travail expulsé : les lots font la queue sur le bus, ou le modèle a dépassé la mémoire de la carte. Le remède est une deuxième carte — et combien le châssis peut en accueillir est déterminé par le dégagement des emplacements, le budget de voies par socket et la marge de l’alimentation, trois chiffres qui appartiennent à un châssis précis contenant une carte précise plutôt qu’à une ligne quelconque du catalogue. Nous le chiffrons en nommant la pièce au lieu de vendre une case à cocher.

Ce qui en décide : le châssis. Nommez la carte, et le devis nomme le châssis qui en accueille autant, et la date.

Ce que deux cartes ne sont pas : une grande carte. Leurs pools de mémoire restent séparés à moins que votre runtime ne répartisse le travail entre elles — parallélisme tensoriel ou pipeline pour un grand travail, ce qui paie un péage sur la liaison entre les cartes. Un travail qui est déjà de nombreux travaux indépendants s’exécute simplement sur deux fois plus de silicium, inchangé.

À travers le rack

Placez une deuxième machine à côté

Le symptôme est une machine pleine : sockets occupés, emplacements DIMM peuplés, travaux en file derrière des travaux. Le mieux que toute plateforme acceptant des cartes offre ici est 2 sockets and 1 TB, et au-delà de ce mur aucune boîte unique plus grande n’existe dans ce catalogue — l’unité de capacité suivante est un autre serveur, pas un plus grand.

Ce qui en décide : le bâtiment et le port. Le trafic de nœud à nœud n’est utile qu’à l’intérieur d’une seule installation, et chaque nœud achète son propre port — la facture du réseau est le prix du port multiplié par le nombre de nœuds, chaque mois.

Ce qu’est un cluster ici : n serveurs séparés. Commandés séparément, facturés séparément, mis à niveau et remplacés séparément. Aucun SKU de cluster n’existe, ce qui signifie aussi qu’aucune prime de cluster et aucun nombre minimum de nœuds n’existent non plus.

Le compromis, mesuré

Le bus le plus large et le port le plus rapide sont sur des machines différentes.

Chaque plateforme dans laquelle nous installerons une carte, sur les axes qui dimensionnent un cluster plutôt qu’un serveur. Les générations de bus sont la même table sourcée que la page GPU imprime — un fichier, deux pages, aucune possibilité de désaccord — et tout le reste est le catalogue de commandes qui parle de lui-même.

Live from the order catalog on this request. Follow any row across: the bus column and the port column pull against each other.
PlatformPCIe to the cardPort ceilingSocketsRAM ceilingCities
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Comment un ingénieur lit cette table

  • Les voies PCIe bornent le transfert hôte-vers-carte — streaming par lots, chargements de scènes, tout ce qui déborde de la mémoire de la carte. Un modèle qui est résident et le reste cesse de s’en soucier.
  • Le plafond du port borne le transfert de nœud à nœud. À une machine, il est sans importance ; à deux, c’est tout le problème.
  • Villes est la colonne à vérifier en premier pour un cluster, pas en dernier : une plateforme parfaite et absente de votre bâtiment n’est pas candidate.
  • Donc : le travail mono-nœud alimenté par le bus appartient aux voies les plus larges et peut ignorer le port ; le travail partitionné appartient là où le port culmine et peut tolérer un bus plus ancien. Une configuration exigeant les deux maxima à la fois n’existe pas dans ce catalogue, et nous l’imprimons ici plutôt que de vous laisser le découvrir au moment de la facture.

Quel silicium va dans l’emplacement, et la ligne mensuelle propre à chaque carte, c’est serveurs dédiés GPU — la seule page de ce domaine autorisée à tarifer une carte. Rien ci-dessous ne répète un chiffre de cette page.

La facture du réseau

Multipliez le port par n avant d’appeler cela un budget.

Un port est facturé par machine, donc l’interconnexion sous un cluster est la même ligne de compte une fois par nœud. La table porte cette multiplication déjà faite, parce que les budgets composés à partir de prix de serveur unique sont la façon dont les devis de cluster reviennent comme des surprises.

Monthly, per machine, on top of the machine itself. A cluster buys its speed once per node — the multiplied columns are the fabric bill.
SpeedPer node× 2 nodes× 4 nodesReaches it
1 Gbpsincludedincludedincludedall 4 platforms
2 Gbps$189$378$756all 4 platforms
3 Gbps$299$598$1,196all 4 platforms
5 Gbps$459$918$1,836all 4 platforms
10 Gbps$529$1,058$2,116all 4 platforms
20 Gbps$1,629$3,258$6,516all 4 platforms
40 Gbps$2,799$5,598$11,1962 of 4 platforms
100 Gbps$3,999$7,998$15,9961 of 4 platforms

Ce qui mérite l’attention dans cette échelle

  • Les barreaux ne sont pas tarifés linéairement. À plusieurs points, n machines un barreau plus bas coûtent moins que n−1 machines un barreau plus haut — et vous achètent un serveur supplémentaire entier. Que ce compromis vous soit disponible dépend uniquement de si le travail se partitionne.
  • La colonne de droite s’amincit vers le haut. Les vitesses les plus élevées existent sur moins de plateformes, et pas sur celle au bus le plus large — l’argument de la table des plateformes, lu du côté réseau.

Ce qui n’est pas dans le catalogue, énoncé plutôt que sous-entendu

Entre deux de nos machines, la liaison listée est un port Ethernet. Il n’y a aucune ligne InfiniBand et aucun pont carte-à-carte sur aucun formulaire de commande, et une page sur les clusters qui contourne ce fait vous induit en erreur par la mise en page. Si une configuration a besoin de l’un ou l’autre, demandez avant de commander : la réponse est un devis, et parfois la réponse est non — les deux sont moins chers à entendre d’abord.

Chaque barreau est sans compteur dans les deux directions, sans quota et sans ligne de sortie nulle part sur une facture — la réplication, les mélanges et les points de contrôle entre vos nœuds coûtent le port et rien de plus. Pour un port sur une machine, jugé sur ses propres mérites, ports sans compteur est la page.

Placement

Un cluster est placé dans un bâtiment avant d’être configuré.

La latence fait de l’installation une contrainte dure : les nœuds qui partagent un travail partagent une salle. Nos cinq salles ne stockent pas les mêmes plateformes, donc un ingénieur qui choisit la plateforme d’abord peut en choisir une que sa ville ne propose pas — vérifiez la salle, puis configurez. La grille ci-dessous est dérivée, donc une plateforme atteignant une nouvelle ville apparaît ici sans que personne n’édite rien.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Les bâtiments eux-mêmes — alimentation, opérateurs, et qui répond au téléphone dans chacun — sont sur centres de données. Si la latence entre deux de nos villes compte pour votre paire de nœuds, demandez au support de la mesurer entre ces salles ; un chiffre vaut mieux qu’une carte.

De la commande au rack

La date arrive avec le devis, pas après le paiement.

Une configuration multi-nœuds est plusieurs machines et, souvent, l’équivalent d’un bon de commande en pièces — donc ce qui est publié n’est pas un slogan de livraison mais le registre des délais que construction à la commande et la page GPU utilisent déjà, avec le pôle long identifié avant que vous ne vous engagiez à quoi que ce soit.

  1. ~30 minutes

    Déjà en rack, pris tel quel

    Aucun montage et aucune visite de rack — les machines existent et sont remises. Serveurs instantanés est cette liste, et pour les nœuds simples d’un cluster c’est le premier endroit qui vaut la peine d’être lu.

  2. 4–24 heures

    Monté depuis notre propre stock

    Le cas standard : cartes installées, matrices construites, systèmes d’exploitation installés — chaque nœud traité en parallèle plutôt qu’en file derrière son voisin.

  3. 5–10 jours ouvrés

    Acheté pour la configuration

    Une pièce de la spécification n’est pas une que nous stockons, donc elle est commandée d’abord. Pour un châssis multi-cartes, c’est le barreau habituel, et c’est généralement le châssis plutôt que le silicium qui le détermine.

  4. 10–15 jours ouvrés

    Sur allocation

    Les accélérateurs de génération actuelle arrivent quand le distributeur dit qu’ils arrivent. Nous nommons cette dépendance d’emblée, et le matériel acheté contre une seule commande prend trois mois d’avance — une annulation en deuxième semaine laisserait une machine construite pour personne.

L’horloge de chaque barreau démarre quand le paiement et la revue anti-fraude sont validés — la seule étape qui ne porte aucune durée promise. Sur une première commande importante, un virement tend à passer la revue plus vite qu’une carte ; cela vaut la peine de choisir délibérément quand une visite de rack l’attend.

Un cluster survit mieux au chat qu’à un formulaire. — combien de nœuds, si le travail se partitionne, et avec quoi il doit communiquer — et la personne qui répond en a déjà chiffré un. Si une machine suffit, elle vous le dira au lieu de vous en vendre quatre.

Pages adjacentes

Une question ici. Dix de plus, une page chacune.

Cette page s’en tient à ce à quoi ressemblent plus d’une carte, et plus d’une machine. Tout ce qui borde cette question a sa propre page, et voici l’ensemble complet des portes.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. Card prices are missing on purpose — GPU dedicated servers prints every one of them beside the machine each figure belongs to.

Cards in one chassis
Above one, the count is quoted: slot clearance, the per-socket lane budget and the power envelope belong to a specific chassis holding a specific card, so the honest number needs the part named. Name it, and the quote comes back with the chassis, the count and the date.
Nodes in one cluster
Any number from one up. Each node is a whole physical server with its own invoice and its own term, ordered, upgraded and replaced independently — no cluster SKU exists here, so neither does a cluster premium or a minimum count.
Card-taking platforms
4, and they specialise: AMD EPYC gives a card the widest bus (PCIe 4.0, 128 lanes per socket) while topping out at 20 Gbps of network in 2 of 5 cities; the 100 Gbps ceiling belongs to Intel Xeon Silver / Gold, which feeds a card an older bus. Scaling up and scaling out are therefore different platform choices.
The link between nodes
An Ethernet port on each node — 1 Gbps included on each of them, priced rungs to 100 Gbps — bought per machine per month, so a cluster pays the rung once per node. No InfiniBand line and no card-to-card bridge is in the catalog; anything past the port is quoted, and the answer can be no.
Where one machine stops
2 sockets and 1 TB of RAM, on the best of these platforms. Past either figure the unit of capacity is the next machine, not a bigger one.
Cities
5: New York, Miami, San Francisco, Amsterdam, Bucharest. Nodes that share a job belong in one of them together, and New York and Bucharest stock the complete platform set.
Traffic
Unmetered at every speed, both directions, with no allowance and no egress line — replication, shuffles and checkpoints between your nodes cost the port and nothing further.
Tenancy
One account per physical machine, on every node of the cluster, each card on PCIe passthrough into that account’s own operating system — no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
Delivery
About half an hour for machines racked as-is, four to twenty-four hours fitted from our stock, five to ten working days bought in, ten to fifteen for an allocation part — and a multi-node quote names its long pole before you pay.
Term
Monthly per machine, no contract; three, six and twelve-month cycles discount up to 15%. Hardware bought in against a single order takes three months up front.
Card money
Absent from this page by rule. Every card we seat and its own monthly line are on GPU dedicated servers, each figure printed beside the exact machine it belongs to.