Mai mult de o placă, mai mult de o mașină · Server Room · din 2004

Scalarea pe verticală merge pe PCIe. Scalarea pe orizontală merge pe port.

O singură placă într-o singură mașină este aritmetică stabilită, cu prețul complet pe pagina GPU. Dincolo de una începe ingineria: următoarea placă concurează pentru benzi și wați în interiorul carcasei, următoarea mașină comunică printr-un port care se cumpără per nod, iar platforma care maximizează una dintre aceste axe atinge limita pe cealaltă. Catalogul nostru exprimă acest compromis în cifre, iar această pagină le tipărește.

Vezi compromisul benzi-versus-port Prețul rețelei

Un singur chiriaș pe fiecare carcasă, passthrough PCIe pe fiecare placă și niciun contor de octeți pe niciun port — traficul dintre nodurile tale nu este linia de cost a nimănui.

Numărate, nu compuse

  • 4Platforms that seat a card
  • 100 GbpsTop port speed, per node
  • 2Socket ceiling, one chassis
  • 1 TBRAM ceiling, one chassis
  • 2Cities stocking all of them

Derivate din catalogul de comenzi la această cerere — aceleași rânduri pe care le facturează checkout-ul, așa că nimic nu poate fi învechit. Ce este fizic montat în rack și alimentat în timp ce citești este o întrebare separată, iar servere instant păstrează acea listă.

Mai întâi, numește blocajul

O a doua placă și o a doua mașină vindecă lipsuri diferite.

“Avem nevoie de mai multă putere de calcul” nu este încă o specificație. Dacă lipsa se află în interiorul carcasei sau de-a lungul rack-ului decide ce se comandă, cum curg banii și ce plafon întâlnești în continuare — așa că pagina se împarte aici, la fel cum se va împărți și comanda.

În interiorul carcasei

Adaugă o placă la mașina pe care o ai

Simptomul este un accelerator înfometat sau un set de lucru evacuat: loturile așteaptă la coadă pe magistrală, sau modelul a depășit memoria plăcii. Leacul este o a doua placă — iar câte încape în carcasă este stabilit de spațiul pentru sloturi, bugetul de benzi per soclu și rezerva de putere a sursei, trei cifre care aparțin unei carcase specifice care găzduiește o placă specifică, nu unui rând oarecare din catalog. O cotăm cu piesa numită, în loc să vindem o bifă.

Ce o decide: carcasa. Numește placa, iar oferta numește carcasa care găzduiește atâtea plăci de acel fel, și data.

Ce nu sunt două plăci: o placă mare. Pool-urile lor de memorie rămân separate, cu excepția cazului în care runtime-ul tău împarte lucrul între ele — paralelism tensor sau pipeline pentru o singură lucrare mare, care plătește un tribut pe legătura dintre plăci. Lucrul care este deja multe lucrări independente rulează pur și simplu pe dublu siliciu, neschimbat.

De-a lungul rack-ului

Așază o a doua mașină lângă ea

Simptomul este o mașină plină: socluri ocupate, sloturi DIMM populate, lucrări care așteaptă la coadă după alte lucrări. Cel mai bun lucru pe care îl oferă orice platformă care acceptă plăci aici este 2 sockets and 1 TB, iar dincolo de acel zid nu există nicio cutie unică mai mare în acest catalog — următoarea unitate de capacitate este un alt server, nu unul mai mare.

Ce o decide: clădirea și portul. Traficul nod-la-nod este util doar în interiorul unei singure facilități, iar fiecare nod își cumpără propriul port — factura de rețea este prețul portului înmulțit cu numărul de noduri, în fiecare lună.

Ce este un cluster aici: n servere separate. Comandate separat, facturate separat, actualizate și înlocuite separat. Nu există niciun SKU de cluster, ceea ce înseamnă că nu există nici primă de cluster și nici număr minim de noduri.

Compromisul, măsurat

Cea mai lată magistrală și cel mai rapid port sunt pe mașini diferite.

Fiecare platformă în care vom monta o placă, pe axele care dimensionează un cluster, nu un server. Generațiile de magistrală sunt același tabel sursă pe care îl tipărește pagina GPU — un singur fișier, două pagini, nicio posibilitate de contradicție — iar restul este catalogul de comenzi vorbind de la sine.

Live from the order catalog on this request. Follow any row across: the bus column and the port column pull against each other.
PlatformPCIe to the cardPort ceilingSocketsRAM ceilingCities
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Cum citește un inginer acel tabel

  • Benzile PCIe limitează transferul gazdă-la-placă — streaming de loturi, încărcări de scene, orice se revarsă din memoria plăcii. Un model care este rezident și rămâne rezident încetează să le mai pese de ele.
  • Plafonul portului limitează transferul nod-la-nod. La o singură mașină este irelevant; la două este întreaga problemă.
  • Orașele este coloana de verificat prima pentru un cluster, nu ultima: o platformă perfectă și absentă din clădirea ta nu este o candidată.
  • Prin urmare: lucrul pe un singur nod alimentat de magistrală aparține celor mai late benzi și poate ignora portul; lucrul partiționat aparține acolo unde portul atinge maximul și poate tolera o magistrală mai veche. O construcție care cere ambele maxime simultan nu există în acest catalog, iar noi tipărim asta aici în loc să te lăsăm să o descoperi la facturare.

Ce siliciu intră în slot și linia lunară proprie a fiecărei plăci este servere dedicate GPU — singura pagină de pe acest domeniu căreia i se permite să prețuiască o placă. Nimic de mai jos nu repetă o cifră de acolo.

Factura de rețea

Înmulțește portul cu n înainte să-i spui buget.

Un port are preț per mașină, așa că interconectarea dintr-un cluster este același element de linie o dată per nod. Tabelul prezintă acea înmulțire deja făcută, pentru că bugetele compuse din prețuri de server unic sunt modul în care ofertele de cluster revin ca surprize.

Monthly, per machine, on top of the machine itself. A cluster buys its speed once per node — the multiplied columns are the fabric bill.
SpeedPer node× 2 nodes× 4 nodesReaches it
1 Gbpsincludedincludedincludedall 4 platforms
2 Gbps$189$378$756all 4 platforms
3 Gbps$299$598$1,196all 4 platforms
5 Gbps$459$918$1,836all 4 platforms
10 Gbps$529$1,058$2,116all 4 platforms
20 Gbps$1,629$3,258$6,516all 4 platforms
40 Gbps$2,799$5,598$11,1962 of 4 platforms
100 Gbps$3,999$7,998$15,9961 of 4 platforms

De remarcat în acea scară

  • Treptele nu au preț liniar. În mai multe puncte, n mașini cu o treaptă mai jos costă mai puțin decât n−1 mașini cu o treaptă mai sus — și îți cumpără un server întreg în plus. Dacă acel compromis îți este disponibil depinde doar de dacă lucrarea se partiționează.
  • Coloana din dreapta se subțiază spre vârf. Cele mai mari viteze există pe mai puține dintre platforme, și nu pe cea cu cea mai lată magistrală — argumentul tabelului de platforme, citit dinspre partea de rețea.

Ce nu este în catalog, afirmat în loc de sugerat

Între două dintre mașinile noastre, legătura listată este un port Ethernet. Nu există niciun element de linie InfiniBand și nicio punte placă-la-placă pe niciun formular de comandă, iar o pagină despre clustere care scrie ocolind acel fapt te induce în eroare prin aranjament. Dacă o construcție are nevoie de oricare dintre ele, întreabă înainte de a comanda: răspunsul este o ofertă, iar uneori răspunsul este nu — ambele sunt mai ieftin de auzit mai întâi.

Fiecare treaptă este nemăsurată în ambele direcții, fără nicio alocație și fără nicio linie de ieșire nicăieri pe o factură — replicarea, amestecările și punctele de control dintre nodurile tale costă portul și nimic în plus. Pentru un port pe o mașină, judecat pe propriile merite, porturi nemăsurate este pagina.

Amplasare

Un cluster este plasat într-o clădire înainte de a fi configurat.

Latența face din facilitate o constrângere dură: nodurile care împart o lucrare împart o cameră. Cele cinci camere ale noastre nu stochează aceleași platforme, așa că un inginer care alege platforma prima poate alege una pe care orașul său nu o are — verifică camera, apoi configurează. Grila de mai jos este derivată, așa că o platformă care ajunge într-un oraș nou apare aici fără ca nimeni să editeze ceva.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Clădirile în sine — puterea, operatorii și cine răspunde la telefon în fiecare — sunt pe centre de date. Dacă latența dintre două dintre orașele noastre contează pentru perechea ta de noduri, cere suportului să o măsoare între acele camere; o cifră bate o hartă.

De la comandă la montat în rack

Data sosește cu oferta, nu după plată.

O construcție multi-nod înseamnă mai multe mașini și, adesea, piese cât pentru o comandă de achiziție — așa că ce se publică nu este un slogan de livrare, ci registrul de termene de execuție pe care construcție la comandă și pagina GPU îl folosesc deja, cu stâlpul lung identificat înainte să te angajezi la ceva.

  1. ~30 de minute

    Deja montat în rack, luat ca atare

    Fără montare și fără vizită la rack — mașinile există și sunt predate. Servere instant este acea listă, iar pentru nodurile simple ale unui cluster este primul loc care merită citit.

  2. 4–24 de ore

    Montat din stocul nostru propriu

    Cazul standard: plăci montate, array-uri construite, sisteme de operare instalate — fiecare nod lucrat în paralel, nu pus la coadă în spatele vecinului său.

  3. 5–10 zile lucrătoare

    Cumpărat pentru construcție

    O piesă din specificație nu este una pe care o avem pe raft, așa că se comandă prima. Pentru o carcasă multi-placă aceasta este treapta obișnuită, iar de obicei carcasa, nu siliciul, este cea care o stabilește.

  4. 10–15 zile lucrătoare

    Pe alocare

    Acceleratoarele din generația curentă sosesc când spune distribuitorul că sosesc. Numim acea dependență din start, iar hardware-ul cumpărat pentru o singură comandă se ia cu trei luni în avans — o anulare în săptămâna a doua ar lăsa o mașină construită pentru nimeni.

Ceasul fiecărei trepte pornește când plata și verificarea antifraudă se finalizează — singurul pas care nu poartă nicio durată promisă. La o primă comandă mare, un transfer bancar tinde să treacă de verificare mai repede decât un card; merită ales deliberat când o vizită la rack așteaptă după el.

Un cluster supraviețuiește mai bine unui chat decât unui formular. — câte noduri, dacă lucrarea se partiționează și cu ce trebuie să comunice — iar persoana care răspunde a mai cotat una înainte. Dacă o singură mașină o acoperă, îți va spune asta în loc să-ți vândă patru.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. Card prices are missing on purpose — GPU dedicated servers prints every one of them beside the machine each figure belongs to.

Cards in one chassis
Above one, the count is quoted: slot clearance, the per-socket lane budget and the power envelope belong to a specific chassis holding a specific card, so the honest number needs the part named. Name it, and the quote comes back with the chassis, the count and the date.
Nodes in one cluster
Any number from one up. Each node is a whole physical server with its own invoice and its own term, ordered, upgraded and replaced independently — no cluster SKU exists here, so neither does a cluster premium or a minimum count.
Card-taking platforms
4, and they specialise: AMD EPYC gives a card the widest bus (PCIe 4.0, 128 lanes per socket) while topping out at 20 Gbps of network in 2 of 5 cities; the 100 Gbps ceiling belongs to Intel Xeon Silver / Gold, which feeds a card an older bus. Scaling up and scaling out are therefore different platform choices.
The link between nodes
An Ethernet port on each node — 1 Gbps included on each of them, priced rungs to 100 Gbps — bought per machine per month, so a cluster pays the rung once per node. No InfiniBand line and no card-to-card bridge is in the catalog; anything past the port is quoted, and the answer can be no.
Where one machine stops
2 sockets and 1 TB of RAM, on the best of these platforms. Past either figure the unit of capacity is the next machine, not a bigger one.
Cities
5: New York, Miami, San Francisco, Amsterdam, Bucharest. Nodes that share a job belong in one of them together, and New York and Bucharest stock the complete platform set.
Traffic
Unmetered at every speed, both directions, with no allowance and no egress line — replication, shuffles and checkpoints between your nodes cost the port and nothing further.
Tenancy
One account per physical machine, on every node of the cluster, each card on PCIe passthrough into that account’s own operating system — no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
Delivery
About half an hour for machines racked as-is, four to twenty-four hours fitted from our stock, five to ten working days bought in, ten to fifteen for an allocation part — and a multi-node quote names its long pole before you pay.
Term
Monthly per machine, no contract; three, six and twelve-month cycles discount up to 15%. Hardware bought in against a single order takes three months up front.
Card money
Absent from this page by rule. Every card we seat and its own monthly line are on GPU dedicated servers, each figure printed beside the exact machine it belongs to.