Più di una scheda, più di una macchina · Server Room · dal 2004

Scalare in verticale passa dal PCIe. Scalare in orizzontale passa dalla porta.

Una singola scheda in una singola macchina è aritmetica già risolta, prezzata per intero nella pagina GPU. Oltre quella inizia l'ingegneria: la scheda successiva contende corsie e watt dentro lo chassis, la macchina successiva dialoga attraverso una porta che si paga per nodo, e la piattaforma che spinge al massimo uno di quegli assi tocca il fondo sull'altro. Il nostro catalogo espone quel compromesso in numeri, e questa pagina li stampa.

Vedi il compromesso corsie contro porta Prezza la fabric

Tenant singolo su ogni chassis, passthrough PCIe su ogni scheda e nessun contatore di byte su alcuna porta — il traffico tra i tuoi nodi non è una voce in fattura di nessuno.

Contato, non composto

  • 4Platforms that seat a card
  • 100 GbpsTop port speed, per node
  • 2Socket ceiling, one chassis
  • 1 TBRAM ceiling, one chassis
  • 2Cities stocking all of them

Derivato dal catalogo ordini su questa richiesta — le stesse righe da cui fattura il checkout, quindi nulla può essere obsoleto. Cosa sia fisicamente montato in rack e alimentato mentre leggi è una questione separata, e server istantanei tiene quell'elenco.

Prima, dai un nome al collo di bottiglia

Una seconda scheda e una seconda macchina curano carenze diverse.

“Ci serve più calcolo” non è ancora una specifica. Se la carenza sta dentro lo chassis o attraverso il rack decide cosa ordinare, come scorre il denaro e quale tetto incontrerai dopo — quindi la pagina si divide qui, nello stesso modo in cui si dividerà l'ordine.

Dentro lo chassis

Aggiungi una scheda alla macchina che hai

Il sintomo è un acceleratore affamato o un working set espulso: i batch fanno coda sul bus, oppure il modello ha superato la memoria della scheda. La cura è una seconda scheda — e quante ne ospita lo chassis è stabilito dallo spazio per gli slot, dal budget di corsie per socket e dal margine dell'alimentatore, tre numeri che appartengono a uno chassis specifico che ospita una scheda specifica piuttosto che a una riga qualsiasi di catalogo. Lo quotiamo indicando il componente per nome invece di vendere una casella da spuntare.

Cosa lo decide: lo chassis. Indica la scheda, e il preventivo indica lo chassis che ne ospita quel numero, e la data.

Cosa non sono due schede: una scheda grande. I loro pool di memoria restano separati a meno che il tuo runtime non divida il lavoro tra loro — parallelismo tensoriale o a pipeline per un singolo lavoro grande, che paga un pedaggio sul collegamento tra le schede. Il lavoro che è già molti lavori indipendenti gira semplicemente su silicio doppio, invariato.

Attraverso il rack

Affianca una seconda macchina

Il sintomo è una macchina piena: socket occupati, slot DIMM popolati, lavori in coda dietro altri lavori. Il massimo che qualsiasi piattaforma per schede offre qui è 2 sockets and 1 TB, e oltre quel muro non esiste in questo catalogo un singolo box più grande — l'unità di capacità successiva è un altro server, non uno più grande.

Cosa lo decide: l'edificio e la porta. Il traffico da nodo a nodo è utile solo dentro una singola struttura, e ogni nodo paga la propria porta — il conto della fabric è il prezzo della porta per il numero di nodi, ogni mese.

Cos'è un cluster qui: n server separati. Ordinati separatamente, fatturati separatamente, aggiornati e sostituiti separatamente. Non esiste alcuna SKU cluster, il che significa che non esistono nemmeno un sovrapprezzo cluster né un numero minimo di nodi.

Il compromesso, misurato

Il bus più largo e la porta più veloce stanno su macchine diverse.

Ogni piattaforma in cui montiamo una scheda, sugli assi che dimensionano un cluster piuttosto che un server. Le generazioni di bus sono la stessa tabella sorgente che stampa la pagina GPU — un file, due pagine, nessun modo di contraddirsi — e tutto il resto è il catalogo ordini che parla da sé.

Live from the order catalog on this request. Follow any row across: the bus column and the port column pull against each other.
PlatformPCIe to the cardPort ceilingSocketsRAM ceilingCities
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Come legge quella tabella un ingegnere

  • Le corsie PCIe vincolano il trasferimento host-scheda — streaming di batch, caricamento di scene, qualsiasi cosa trabocchi dalla memoria della scheda. Un modello residente che resta residente smette di curarsene.
  • Il tetto della porta vincola il trasferimento nodo-nodo. Con una macchina è irrilevante; con due è l'intero problema.
  • Città è la colonna da controllare per prima per un cluster, non per ultima: una piattaforma perfetta ma assente dal tuo edificio non è una candidata.
  • Quindi: il lavoro a nodo singolo alimentato dal bus appartiene alle corsie più larghe e può ignorare la porta; il lavoro partizionato appartiene dove la porta raggiunge il massimo e può tollerare un bus più vecchio. Una build che esige entrambi i massimi insieme non esiste in questo catalogo, e lo stampiamo qui invece di lasciartelo scoprire al momento della fattura.

Quale silicio va nello slot, e la riga mensile di ciascuna scheda, è server dedicati GPU — l'unica pagina di questo dominio autorizzata a prezzare una scheda. Nulla sotto ripete una cifra da lì.

Il conto della fabric

Moltiplica la porta per n prima di chiamarlo budget.

Una porta ha un prezzo per macchina, quindi l'interconnessione sotto un cluster è la stessa voce una volta per nodo. La tabella riporta quella moltiplicazione già fatta, perché i budget composti da prezzi per server singolo sono il modo in cui i preventivi cluster tornano come sorprese.

Monthly, per machine, on top of the machine itself. A cluster buys its speed once per node — the multiplied columns are the fabric bill.
SpeedPer node× 2 nodes× 4 nodesReaches it
1 Gbpsincludedincludedincludedall 4 platforms
2 Gbps$189$378$756all 4 platforms
3 Gbps$299$598$1,196all 4 platforms
5 Gbps$459$918$1,836all 4 platforms
10 Gbps$529$1,058$2,116all 4 platforms
20 Gbps$1,629$3,258$6,516all 4 platforms
40 Gbps$2,799$5,598$11,1962 of 4 platforms
100 Gbps$3,999$7,998$15,9961 of 4 platforms

Da notare in quella scala

  • I pioli non hanno un prezzo lineare. In diversi punti, n macchine un piolo più in basso costano meno di n−1 macchine un piolo più in alto — e ti comprano un intero server in più. Se quel compromesso sia disponibile per te dipende solo dal fatto che il lavoro si partizioni.
  • La colonna di destra si assottiglia verso l'alto. Le velocità più alte esistono su meno piattaforme, e non su quella con il bus più largo — l'argomento della tabella piattaforme, letto dal lato rete.

Cosa non è nel catalogo, dichiarato invece che implicito

Tra due delle nostre macchine il collegamento elencato è una porta Ethernet. Non c'è alcuna voce InfiniBand né alcun bridge scheda-scheda su nessun modulo d'ordine, e una pagina sui cluster che gira intorno a quel fatto ti sta ingannando con l'impaginazione. Se una build richiede l'uno o l'altro, chiedi prima di ordinare: la risposta è un preventivo, e a volte la risposta è no — entrambe costano meno sentirle prima.

Ogni piolo è senza limiti in entrambe le direzioni, senza alcuna franchigia e senza alcuna riga di egress in nessun punto di una fattura — replica, shuffle e checkpoint tra i tuoi nodi costano la porta e nient'altro. Per una porta su una macchina, giudicata per i suoi meriti, porte senza limiti è la pagina.

Collocazione

Un cluster viene collocato in un edificio prima di essere configurato.

La latenza rende la struttura un vincolo rigido: i nodi che condividono un lavoro condividono una stanza. Le nostre cinque stanze non tengono a stock le stesse piattaforme, quindi un ingegnere che sceglie prima la piattaforma può sceglierne una che la sua città non offre — controlla la stanza, poi configura. La griglia sotto è derivata, quindi una piattaforma che arriva in una nuova città compare qui senza che nessuno modifichi nulla.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Gli edifici stessi — alimentazione, carrier e chi risponde al telefono in ciascuno — sono su data center. Se la latenza tra due delle nostre città conta per la tua coppia di nodi, chiedi al supporto di misurarla tra quelle stanze; un numero batte una mappa.

Dall'ordine al rack

La data arriva con il preventivo, non dopo il pagamento.

Una build multi-nodo è fatta di più macchine e, spesso, di componenti per un intero ordine d'acquisto — quindi ciò che viene pubblicato non è uno slogan di consegna ma il registro dei tempi di approvvigionamento che build su ordinazione e la pagina GPU già usano, con il collo di bottiglia identificato prima che tu ti impegni su qualsiasi cosa.

  1. ~30 minuti

    Già in rack, preso così com'è

    Nessun montaggio e nessuna visita al rack — le macchine esistono e vengono consegnate. Server istantanei è quell'elenco, e per i nodi semplici di un cluster è il primo posto che vale la pena leggere.

  2. 4–24 ore

    Montato dal nostro stock

    Il caso standard: schede installate, array costruiti, sistemi operativi installati — ogni nodo lavorato in parallelo invece che in coda dietro il vicino.

  3. 5–10 giorni lavorativi

    Acquistato per la build

    Un componente della specifica non è tra quelli che teniamo a magazzino, quindi viene ordinato per primo. Per uno chassis multi-scheda questo è il piolo abituale, e di solito è lo chassis piuttosto che il silicio a determinarlo.

  4. 10–15 giorni lavorativi

    Su allocazione

    Gli acceleratori di generazione corrente arrivano quando il distributore dice che arrivano. Dichiariamo quella dipendenza in anticipo, e l'hardware acquistato contro un singolo ordine richiede tre mesi di anticipo — una cancellazione alla seconda settimana lascerebbe una macchina costruita per nessuno.

L'orologio di ogni piolo parte quando pagamento e revisione antifrode si concludono — l'unico passaggio che non porta alcuna durata promessa. Su un primo ordine grande, un bonifico tende a superare la revisione più in fretta di una carta; vale la pena sceglierlo deliberatamente quando una visita al rack dipende da quello.

Un cluster sopravvive meglio a una chat che a un modulo. — quanti nodi, se il lavoro si partiziona e con cosa deve dialogare — e chi risponde ne ha già quotato uno. Se una sola macchina basta, te lo dirà invece di vendertene quattro.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. Card prices are missing on purpose — GPU dedicated servers prints every one of them beside the machine each figure belongs to.

Cards in one chassis
Above one, the count is quoted: slot clearance, the per-socket lane budget and the power envelope belong to a specific chassis holding a specific card, so the honest number needs the part named. Name it, and the quote comes back with the chassis, the count and the date.
Nodes in one cluster
Any number from one up. Each node is a whole physical server with its own invoice and its own term, ordered, upgraded and replaced independently — no cluster SKU exists here, so neither does a cluster premium or a minimum count.
Card-taking platforms
4, and they specialise: AMD EPYC gives a card the widest bus (PCIe 4.0, 128 lanes per socket) while topping out at 20 Gbps of network in 2 of 5 cities; the 100 Gbps ceiling belongs to Intel Xeon Silver / Gold, which feeds a card an older bus. Scaling up and scaling out are therefore different platform choices.
The link between nodes
An Ethernet port on each node — 1 Gbps included on each of them, priced rungs to 100 Gbps — bought per machine per month, so a cluster pays the rung once per node. No InfiniBand line and no card-to-card bridge is in the catalog; anything past the port is quoted, and the answer can be no.
Where one machine stops
2 sockets and 1 TB of RAM, on the best of these platforms. Past either figure the unit of capacity is the next machine, not a bigger one.
Cities
5: New York, Miami, San Francisco, Amsterdam, Bucharest. Nodes that share a job belong in one of them together, and New York and Bucharest stock the complete platform set.
Traffic
Unmetered at every speed, both directions, with no allowance and no egress line — replication, shuffles and checkpoints between your nodes cost the port and nothing further.
Tenancy
One account per physical machine, on every node of the cluster, each card on PCIe passthrough into that account’s own operating system — no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
Delivery
About half an hour for machines racked as-is, four to twenty-four hours fitted from our stock, five to ten working days bought in, ten to fifteen for an allocation part — and a multi-node quote names its long pole before you pay.
Term
Monthly per machine, no contract; three, six and twelve-month cycles discount up to 15%. Hardware bought in against a single order takes three months up front.
Card money
Absent from this page by rule. Every card we seat and its own monthly line are on GPU dedicated servers, each figure printed beside the exact machine it belongs to.