Περισσότερες από μία κάρτες, περισσότερα από ένα μηχανήματα · Server Room · από το 2004

Η κλιμάκωση προς τα πάνω περνά από το PCIe. Η κλιμάκωση προς τα έξω περνά από τη θύρα.

Μία κάρτα σε ένα μηχάνημα είναι λυμένη αριθμητική, τιμολογημένη πλήρως στη σελίδα GPU. Μετά το ένα ξεκινά η μηχανική: η επόμενη κάρτα διεκδικεί λωρίδες και watt μέσα στο πλαίσιο, το επόμενο μηχάνημα μιλά μέσα από μια θύρα που αγοράζεται ανά κόμβο, και η πλατφόρμα που μεγιστοποιεί τον έναν άξονα πιάνει πάτο στον άλλο. Ο κατάλογός μας δηλώνει αυτή την ανταλλαγή σε αριθμούς, και αυτή η σελίδα τους τυπώνει.

Δείτε την ανταλλαγή λωρίδων-έναντι-θύρας Τιμολογήστε το fabric

Ένας μισθωτής σε κάθε πλαίσιο, PCIe passthrough σε κάθε κάρτα, και κανένας μετρητής byte σε καμία θύρα — η κίνηση μεταξύ των κόμβων σας δεν είναι γραμμή τιμολογίου κανενός.

Μετρημένο, όχι συντεθειμένο

  • 4Platforms that seat a card
  • 100 GbpsTop port speed, per node
  • 2Socket ceiling, one chassis
  • 1 TBRAM ceiling, one chassis
  • 2Cities stocking all of them

Προέρχεται από τον κατάλογο παραγγελιών σε αυτό το αίτημα — τις ίδιες γραμμές από τις οποίες χρεώνει το ταμείο, ώστε τίποτα να μην μπορεί να είναι ξεπερασμένο. Το τι είναι φυσικά τοποθετημένο σε rack και τροφοδοτημένο καθώς το διαβάζετε είναι ξεχωριστό ερώτημα, και οι άμεσοι διακομιστές κρατούν αυτή τη λίστα.

Πρώτα, ονομάστε το σημείο συμφόρησης

Μια δεύτερη κάρτα και ένα δεύτερο μηχάνημα θεραπεύουν διαφορετικές ελλείψεις.

“Χρειαζόμαστε περισσότερη υπολογιστική ισχύ” δεν είναι ακόμα προδιαγραφή. Το αν η έλλειψη βρίσκεται μέσα στο πλαίσιο ή σε όλο το rack αποφασίζει τι παραγγέλνεται, πώς τρέχουν τα χρήματα και ποιο ταβάνι συναντάτε μετά — έτσι η σελίδα χωρίζει εδώ, με τον ίδιο τρόπο που θα χωρίσει και η παραγγελία.

Μέσα στο πλαίσιο

Προσθέστε μια κάρτα στο μηχάνημα που έχετε

Το σύμπτωμα είναι ένας λιμοκτονούντας επιταχυντής ή ένα εκδιωγμένο σύνολο εργασίας: οι παρτίδες κάνουν ουρά στον δίαυλο, ή το μοντέλο έχει ξεπεράσει τη μνήμη της κάρτας. Η θεραπεία είναι μια δεύτερη κάρτα — και το πόσες χωρά το πλαίσιο καθορίζεται από το διάκενο υποδοχής, τον προϋπολογισμό λωρίδων ανά socket και το περιθώριο του τροφοδοτικού, τρεις αριθμούς που ανήκουν σε ένα συγκεκριμένο πλαίσιο που κρατά μια συγκεκριμένη κάρτα και όχι σε οποιαδήποτε γραμμή καταλόγου. Το τιμολογούμε με το εξάρτημα ονομασμένο αντί να πουλάμε ένα checkbox.

Τι το αποφασίζει: το πλαίσιο. Ονομάστε την κάρτα, και η προσφορά ονομάζει το πλαίσιο που χωρά τόσες από αυτές, και την ημερομηνία.

Τι δεν είναι δύο κάρτες: μία μεγάλη κάρτα. Οι δεξαμενές μνήμης τους παραμένουν ξεχωριστές εκτός αν το runtime σας χωρίσει την εργασία μεταξύ τους — tensor ή pipeline parallel για μία μεγάλη εργασία, που πληρώνει διόδια στη σύνδεση μεταξύ των καρτών. Εργασία που είναι ήδη πολλές ανεξάρτητες εργασίες απλώς τρέχει σε διπλάσιο πυρίτιο, αμετάβλητη.

Σε όλο το rack

Στήστε ένα δεύτερο μηχάνημα δίπλα του

Το σύμπτωμα είναι ένα γεμάτο μηχάνημα: sockets απασχολημένα, υποδοχές DIMM γεμάτες, εργασίες σε ουρά πίσω από εργασίες. Το καλύτερο που προσφέρει οποιαδήποτε πλατφόρμα που δέχεται κάρτες εδώ είναι 2 sockets and 1 TB, και πέρα από αυτόν τον τοίχο δεν υπάρχει μεγαλύτερο μονό κουτί σε αυτόν τον κατάλογο — η επόμενη μονάδα χωρητικότητας είναι άλλος διακομιστής, όχι μεγαλύτερος.

Τι το αποφασίζει: το κτίριο και η θύρα. Η κίνηση κόμβου-προς-κόμβο είναι χρήσιμη μόνο μέσα σε μία εγκατάσταση, και κάθε κόμβος αγοράζει τη δική του θύρα — ο λογαριασμός fabric είναι η τιμή θύρας επί τον αριθμό κόμβων, κάθε μήνα.

Τι είναι ένα cluster εδώ: n ξεχωριστοί διακομιστές. Παραγγέλνονται ξεχωριστά, τιμολογούνται ξεχωριστά, αναβαθμίζονται και αντικαθίστανται ξεχωριστά. Δεν υπάρχει SKU cluster, που σημαίνει επίσης ότι δεν υπάρχει ούτε premium cluster ούτε ελάχιστος αριθμός κόμβων.

Η ανταλλαγή, μετρημένη

Ο πιο φαρδύς δίαυλος και η πιο γρήγορη θύρα είναι σε διαφορετικά μηχανήματα.

Κάθε πλατφόρμα στην οποία θα τοποθετήσουμε κάρτα, στους άξονες που καθορίζουν το μέγεθος ενός cluster και όχι ενός διακομιστή. Οι γενιές διαύλου είναι ο ίδιος πίνακας προέλευσης που τυπώνει η σελίδα GPU — ένα αρχείο, δύο σελίδες, κανένας τρόπος να διαφωνήσουν — και όλα τα υπόλοιπα είναι ο κατάλογος παραγγελιών που μιλά από μόνος του.

Live from the order catalog on this request. Follow any row across: the bus column and the port column pull against each other.
PlatformPCIe to the cardPort ceilingSocketsRAM ceilingCities
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Πώς διαβάζει ένας μηχανικός αυτόν τον πίνακα

  • Οι λωρίδες PCIe δεσμεύουν τη μεταφορά host-προς-κάρτα — ροή παρτίδων, φόρτωση σκηνών, οτιδήποτε ξεχειλίζει από τη μνήμη της κάρτας. Ένα μοντέλο που είναι resident και παραμένει resident σταματά να νοιάζεται για αυτές.
  • Το ταβάνι θύρας δεσμεύει τη μεταφορά κόμβου-προς-κόμβο. Σε ένα μηχάνημα είναι άσχετο· σε δύο είναι όλο το πρόβλημα.
  • Οι πόλεις είναι η στήλη που πρέπει να ελέγξετε πρώτα για ένα cluster, όχι τελευταία: μια πλατφόρμα που είναι τέλεια και απουσιάζει από το κτίριό σας δεν είναι υποψήφια.
  • Επομένως: εργασία ενός κόμβου που τροφοδοτείται από δίαυλο ανήκει στις πιο φαρδιές λωρίδες και μπορεί να αγνοήσει τη θύρα· η κατατμημένη εργασία ανήκει εκεί όπου η θύρα φτάνει στο μέγιστο και μπορεί να ανεχθεί παλαιότερο δίαυλο. Μια κατασκευή που απαιτεί και τα δύο μέγιστα ταυτόχρονα δεν υπάρχει σε αυτόν τον κατάλογο, και το τυπώνουμε εδώ αντί να σας αφήσουμε να το ανακαλύψετε την ώρα του τιμολογίου.

Ποιο πυρίτιο μπαίνει στην υποδοχή, και η μηνιαία γραμμή κάθε κάρτας, είναι στους αποκλειστικούς διακομιστές GPU — η μόνη σελίδα σε αυτόν τον τομέα που επιτρέπεται να τιμολογήσει κάρτα. Τίποτα παρακάτω δεν επαναλαμβάνει αριθμό από εκεί.

Ο λογαριασμός fabric

Πολλαπλασιάστε τη θύρα επί n πριν το πείτε προϋπολογισμό.

Μια θύρα τιμολογείται ανά μηχάνημα, οπότε η διασύνδεση κάτω από ένα cluster είναι η ίδια γραμμή μία φορά ανά κόμβο. Ο πίνακας φέρει αυτόν τον πολλαπλασιασμό ήδη ολοκληρωμένο, επειδή οι προϋπολογισμοί που συντίθενται από τιμές ενός διακομιστή είναι ο τρόπος με τον οποίο οι προσφορές cluster επιστρέφουν ως εκπλήξεις.

Monthly, per machine, on top of the machine itself. A cluster buys its speed once per node — the multiplied columns are the fabric bill.
SpeedPer node× 2 nodes× 4 nodesReaches it
1 Gbpsincludedincludedincludedall 4 platforms
2 Gbps$189$378$756all 4 platforms
3 Gbps$299$598$1,196all 4 platforms
5 Gbps$459$918$1,836all 4 platforms
10 Gbps$529$1,058$2,116all 4 platforms
20 Gbps$1,629$3,258$6,516all 4 platforms
40 Gbps$2,799$5,598$11,1962 of 4 platforms
100 Gbps$3,999$7,998$15,9961 of 4 platforms

Αξίζει να προσέξετε σε αυτή τη σκάλα

  • Τα σκαλοπάτια δεν τιμολογούνται γραμμικά. Σε αρκετά σημεία, n μηχανήματα ένα σκαλοπάτι πιο κάτω κοστίζουν λιγότερο από n−1 μηχανήματα ένα σκαλοπάτι πιο πάνω — και σας αγοράζουν έναν ολόκληρο επιπλέον διακομιστή. Το αν αυτή η ανταλλαγή είναι διαθέσιμη σε εσάς εξαρτάται μόνο από το αν η εργασία κατατέμνεται.
  • Η δεξιά στήλη αραιώνει προς την κορυφή. Οι υψηλότερες ταχύτητες υπάρχουν σε λιγότερες από τις πλατφόρμες, και όχι σε αυτή με τον πιο φαρδύ δίαυλο — το επιχείρημα του πίνακα πλατφορμών, διαβασμένο από την πλευρά του δικτύου.

Τι δεν υπάρχει στον κατάλογο, δηλωμένο αντί υπονοούμενο

Μεταξύ δύο μηχανημάτων μας η αναγραφόμενη σύνδεση είναι θύρα Ethernet. Δεν υπάρχει γραμμή InfiniBand και καμία γέφυρα κάρτας-προς-κάρτα σε καμία φόρμα παραγγελίας, και μια σελίδα για clusters που γράφει γύρω από αυτό το γεγονός σας παραπλανά με τη διάταξη. Αν μια κατασκευή χρειάζεται κάποιο από τα δύο, ρωτήστε πριν παραγγείλετε: η απάντηση είναι προσφορά, και μερικές φορές η απάντηση είναι όχι — και τα δύο είναι φθηνότερο να τα ακούσετε πρώτα.

Κάθε σκαλοπάτι είναι χωρίς μέτρηση και προς τις δύο κατευθύνσεις, χωρίς επίδομα και χωρίς γραμμή εξόδου πουθενά σε τιμολόγιο — η αναπαραγωγή, τα shuffles και τα checkpoints μεταξύ των κόμβων σας κοστίζουν τη θύρα και τίποτα παραπάνω. Για μία θύρα σε ένα μηχάνημα, κρινόμενη με τα δικά της πλεονεκτήματα, οι θύρες χωρίς μέτρηση είναι η σελίδα.

Τοποθέτηση

Ένα cluster τοποθετείται σε κτίριο πριν διαμορφωθεί.

Η καθυστέρηση κάνει την εγκατάσταση σκληρό περιορισμό: κόμβοι που μοιράζονται εργασία μοιράζονται δωμάτιο. Τα πέντε δωμάτιά μας δεν διαθέτουν τις ίδιες πλατφόρμες, οπότε ένας μηχανικός που διαλέγει πρώτα την πλατφόρμα μπορεί να διαλέξει μία που η πόλη του δεν διαθέτει — ελέγξτε το δωμάτιο, μετά διαμορφώστε. Το πλέγμα παρακάτω προέρχεται αυτόματα, οπότε μια πλατφόρμα που φτάνει σε νέα πόλη εμφανίζεται εδώ χωρίς να επεξεργαστεί κανείς τίποτα.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Τα ίδια τα κτίρια — ρεύμα, πάροχοι, και ποιος απαντά το τηλέφωνο σε καθένα — είναι στα κέντρα δεδομένων. Αν η καθυστέρηση μεταξύ δύο πόλεών μας έχει σημασία για το ζεύγος κόμβων σας, ζητήστε από την υποστήριξη να τη μετρήσει μεταξύ αυτών των δωματίων· ένας αριθμός νικά έναν χάρτη.

Από την παραγγελία στο rack

Η ημερομηνία φτάνει με την προσφορά, όχι μετά την πληρωμή.

Μια κατασκευή πολλών κόμβων είναι αρκετά μηχανήματα και, συχνά, εξαρτήματα αξίας εντολής αγοράς — οπότε αυτό που δημοσιεύεται δεν είναι σλόγκαν παράδοσης αλλά το μητρώο χρόνου παράδοσης που χρησιμοποιούν ήδη η κατασκευή κατά παραγγελία και η σελίδα GPU, με το μακρύτερο σκέλος εντοπισμένο πριν δεσμευτείτε σε οτιδήποτε.

  1. ~30 λεπτά

    Ήδη σε rack, παραλαμβάνεται ως έχει

    Καμία συναρμολόγηση και καμία επίσκεψη rack — τα μηχανήματα υπάρχουν και παραδίδονται. Οι άμεσοι διακομιστές είναι αυτή η λίστα, και για τους απλούς κόμβους ενός cluster είναι το πρώτο μέρος που αξίζει να διαβάσετε.

  2. 4–24 ώρες

    Συναρμολογημένο από δικό μας απόθεμα

    Η τυπική περίπτωση: κάρτες τοποθετημένες, συστοιχίες χτισμένες, λειτουργικά συστήματα εγκατεστημένα — κάθε κόμβος δουλεύεται παράλληλα αντί να κάνει ουρά πίσω από τον γείτονά του.

  3. 5–10 εργάσιμες ημέρες

    Αγορασμένο για την κατασκευή

    Ένα εξάρτημα στην προδιαγραφή δεν είναι κάτι που κρατάμε στο ράφι, οπότε παραγγέλνεται πρώτα. Για ένα πλαίσιο πολλών καρτών αυτό είναι το συνηθισμένο σκαλοπάτι, και συνήθως το πλαίσιο και όχι το πυρίτιο είναι αυτό που το καθορίζει.

  4. 10–15 εργάσιμες ημέρες

    Σε κατανομή

    Οι επιταχυντές τρέχουσας γενιάς φτάνουν όταν ο διανομέας λέει ότι φτάνουν. Ονομάζουμε αυτή την εξάρτηση εκ των προτέρων, και το υλικό που αγοράζεται έναντι μίας παραγγελίας απαιτεί τρεις μήνες προκαταβολικά — μια ακύρωση τη δεύτερη εβδομάδα θα άφηνε ένα μηχάνημα χτισμένο για κανέναν.

Το ρολόι κάθε σκαλοπατιού ξεκινά όταν η πληρωμή και ο έλεγχος απάτης καθαρίσουν — το μόνο βήμα που δεν φέρει υποσχόμενη διάρκεια. Σε μια μεγάλη πρώτη παραγγελία, ένα έμβασμα τείνει να καθαρίσει τον έλεγχο γρηγορότερα από μια κάρτα· αξίζει να το επιλέξετε σκόπιμα όταν μια επίσκεψη rack το περιμένει.

Ένα cluster επιβιώνει καλύτερα στη συνομιλία παρά σε φόρμα. — πόσοι κόμβοι, αν η εργασία κατατέμνεται, και με τι πρέπει να μιλήσει — και το άτομο που απαντά έχει τιμολογήσει παρόμοια στο παρελθόν. Αν ένα μηχάνημα την καλύπτει, θα σας το πουν αντί να σας πουλήσουν τέσσερα.

Παρακείμενες σελίδες

Μία ερώτηση εδώ. Δέκα ακόμα, μία σελίδα η καθεμία.

Αυτή η σελίδα περιορίζεται στο πώς μοιάζουν περισσότερες από μία κάρτες, και περισσότερα από ένα μηχανήματα. Ό,τι συνορεύει με αυτή την ερώτηση έχει τη δική του σελίδα, και αυτό είναι το πλήρες σύνολο θυρών.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. Card prices are missing on purpose — GPU dedicated servers prints every one of them beside the machine each figure belongs to.

Cards in one chassis
Above one, the count is quoted: slot clearance, the per-socket lane budget and the power envelope belong to a specific chassis holding a specific card, so the honest number needs the part named. Name it, and the quote comes back with the chassis, the count and the date.
Nodes in one cluster
Any number from one up. Each node is a whole physical server with its own invoice and its own term, ordered, upgraded and replaced independently — no cluster SKU exists here, so neither does a cluster premium or a minimum count.
Card-taking platforms
4, and they specialise: AMD EPYC gives a card the widest bus (PCIe 4.0, 128 lanes per socket) while topping out at 20 Gbps of network in 2 of 5 cities; the 100 Gbps ceiling belongs to Intel Xeon Silver / Gold, which feeds a card an older bus. Scaling up and scaling out are therefore different platform choices.
The link between nodes
An Ethernet port on each node — 1 Gbps included on each of them, priced rungs to 100 Gbps — bought per machine per month, so a cluster pays the rung once per node. No InfiniBand line and no card-to-card bridge is in the catalog; anything past the port is quoted, and the answer can be no.
Where one machine stops
2 sockets and 1 TB of RAM, on the best of these platforms. Past either figure the unit of capacity is the next machine, not a bigger one.
Cities
5: New York, Miami, San Francisco, Amsterdam, Bucharest. Nodes that share a job belong in one of them together, and New York and Bucharest stock the complete platform set.
Traffic
Unmetered at every speed, both directions, with no allowance and no egress line — replication, shuffles and checkpoints between your nodes cost the port and nothing further.
Tenancy
One account per physical machine, on every node of the cluster, each card on PCIe passthrough into that account’s own operating system — no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
Delivery
About half an hour for machines racked as-is, four to twenty-four hours fitted from our stock, five to ten working days bought in, ten to fifteen for an allocation part — and a multi-node quote names its long pole before you pay.
Term
Monthly per machine, no contract; three, six and twelve-month cycles discount up to 15%. Hardware bought in against a single order takes three months up front.
Card money
Absent from this page by rule. Every card we seat and its own monthly line are on GPU dedicated servers, each figure printed beside the exact machine it belongs to.