Birden fazla kart, birden fazla makine · Server Room · kuruluş 2004

Yukarı ölçekleme PCIe'den geçer. Dışa ölçekleme porttan geçer.

Tek makinede tek kart, GPU sayfasında eksiksiz fiyatlandırılmış, çözülmüş bir aritmetiktir. Birin ötesi mühendisliğin başladığı yerdir: sonraki kart kasa içinde hat ve watt için çekişir, sonraki makine düğüm başına satın alınan bir port üzerinden konuşur ve bu eksenlerden birini en üst düzeye çıkaran platform diğerinde dibe vurur. Kataloğumuz bu takası rakamlarla belirtir, bu sayfa da onları basar.

Hat-karşı-port takasını gör Fabric'i fiyatlandır

Her kasada tek kiracı, her kartta PCIe passthrough ve hiçbir portta bayt sayacı yok — düğümleriniz arasındaki trafik kimsenin fatura kalemi değildir.

Sayılmıştır, uydurulmamıştır

  • 4Platforms that seat a card
  • 100 GbpsTop port speed, per node
  • 2Socket ceiling, one chassis
  • 1 TBRAM ceiling, one chassis
  • 2Cities stocking all of them

Bu istekteki sipariş kataloğundan türetilmiştir — kasanın faturalandırdığı satırların aynısı, yani hiçbiri bayat olamaz. Siz bunu okurken fiziksel olarak rafta ve güç altında olanlar ayrı bir sorudur ve anında sunucular o listeyi tutar.

Önce darboğazı adlandırın

İkinci bir kart ile ikinci bir makine farklı eksiklikleri giderir.

“Daha fazla işlem gücüne ihtiyacımız var” henüz bir şartname değildir. Eksikliğin kasa içinde mi yoksa raf boyunca mı olduğu, neyin sipariş edileceğini, paranın nasıl akacağını ve bir sonraki hangi tavana çarpacağınızı belirler — bu yüzden sayfa, siparişin de ayrılacağı gibi burada ikiye ayrılır.

Kasa içinde

Elinizdeki makineye bir kart ekleyin

Belirti, aç kalmış bir hızlandırıcı ya da dışarı atılmış bir çalışma kümesidir: yığınlar veri yolunda kuyruğa girer ya da model kartın belleğini aşmıştır. Çare ikinci bir karttır — ve kasanın kaç tane alacağını slot boşluğu, soket başına hat bütçesi ve güç kaynağının payı belirler; bunlar herhangi bir katalog satırına değil, belirli bir kartı tutan belirli bir kasaya ait üç rakamdır. Bir onay kutusu satmak yerine parçayı adıyla anarak fiyat veririz.

Buna karar veren: kasadır. Kartı adlandırın, fiyat teklifi o karttan o kadarını alan kasayı ve tarihi adlandırsın.

İki kartın olmadığı şey: tek bir büyük kart. Çalışma zamanınız işi aralarında bölmedikçe bellek havuzları ayrı kalır — tek bir büyük iş için tensör ya da ardışık düzen paralelliği, ki bu kartlar arasındaki bağlantıdan geçiş ücreti öder. Zaten çok sayıda bağımsız iş olan iş, değişmeden iki kat silikon üzerinde çalışır.

Raf boyunca

Yanına ikinci bir makine dikin

Belirti dolu bir makinedir: soketler meşgul, DIMM yuvaları dolu, işler işlerin arkasında kuyrukta. Buradaki kart alan herhangi bir platformun sunduğu en iyisi 2 sockets and 1 TB ve o duvarın ötesinde bu katalogda daha büyük tek bir kutu yok — bir sonraki kapasite birimi daha büyük bir sunucu değil, başka bir sunucudur.

Buna karar veren: bina ve porttur. Düğümden düğüme trafik yalnızca tek bir tesis içinde işe yarar ve her düğüm kendi portunu satın alır — fabric faturası, port fiyatı çarpı düğüm sayısıdır, her ay.

Burada kümenin anlamı: n ayrı sunucu. Ayrı sipariş edilir, ayrı faturalanır, ayrı yükseltilir ve ayrı değiştirilir. Küme SKU'su yoktur, bu da küme primi ve asgari düğüm sayısı da yok demektir.

Takas, ölçülmüş olarak

En geniş veri yolu ile en hızlı port farklı makinelerdedir.

Kart oturtacağımız her platform, bir sunucuyu değil bir kümeyi boyutlandıran eksenlerde. Veri yolu nesilleri, GPU sayfasının bastığı aynı kaynaklı tablodur — tek dosya, iki sayfa, çelişme imkânı yok — ve geri kalan her şey sipariş kataloğunun kendi adına konuşmasıdır.

Live from the order catalog on this request. Follow any row across: the bus column and the port column pull against each other.
PlatformPCIe to the cardPort ceilingSocketsRAM ceilingCities
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Bir mühendis o tabloyu nasıl okur

  • PCIe hatları ana bilgisayardan karta aktarımı sınırlar — yığın akışı, sahne yüklemeleri, kart belleğinden taşan her şey. Yerleşik olan ve yerleşik kalan bir model onları umursamayı bırakır.
  • Port tavanı düğümden düğüme aktarımı sınırlar. Tek makinede önemsizdir; iki makinede bütün sorun odur.
  • Şehirler bir küme için en son değil ilk bakılacak sütundur: kusursuz olan ama binanızda bulunmayan bir platform aday değildir.
  • Dolayısıyla: veri yolundan beslenen tek düğümlü iş en geniş hatlara aittir ve portu yok sayabilir; bölümlenmiş iş portun zirve yaptığı yere aittir ve daha eski bir veri yolunu tolere edebilir. Aynı anda her iki maksimumu da talep eden bir yapı bu katalogda yoktur ve bunu fatura zamanında keşfetmenize izin vermek yerine burada basarız.

Slota hangi silikonun girdiği ve her kartın kendi aylık satırı GPU özel sunucular sayfasındadır — bu alan adında bir kartı fiyatlandırmasına izin verilen tek sayfa. Aşağıdaki hiçbir şey ondan bir rakamı tekrarlamaz.

Fabric faturası

Bütçe demeden önce portu n ile çarpın.

Bir port makine başına fiyatlandırılır, dolayısıyla bir kümenin altındaki ara bağlantı düğüm başına aynı fatura kalemidir. Tablo bu çarpmayı zaten yapılmış olarak taşır, çünkü tek sunucu fiyatlarından kurulan bütçeler küme tekliflerinin sürpriz olarak geri dönmesinin sebebidir.

Monthly, per machine, on top of the machine itself. A cluster buys its speed once per node — the multiplied columns are the fabric bill.
SpeedPer node× 2 nodes× 4 nodesReaches it
1 Gbpsincludedincludedincludedall 4 platforms
2 Gbps$189$378$756all 4 platforms
3 Gbps$299$598$1,196all 4 platforms
5 Gbps$459$918$1,836all 4 platforms
10 Gbps$529$1,058$2,116all 4 platforms
20 Gbps$1,629$3,258$6,516all 4 platforms
40 Gbps$2,799$5,598$11,1962 of 4 platforms
100 Gbps$3,999$7,998$15,9961 of 4 platforms

O merdivende dikkate değer olanlar

  • Basamaklar doğrusal fiyatlandırılmamıştır. Birkaç noktada, bir basamak aşağıdaki n makine, bir basamak yukarıdaki n−1 makineden daha ucuza gelir — ve size tam bir ekstra sunucu kazandırır. Bu takasın size açık olup olmadığı yalnızca işin bölümlenip bölümlenmediğine bağlıdır.
  • Sağdaki sütun yukarı doğru incelir. En yüksek hızlar platformların daha azında bulunur ve en geniş veri yoluna sahip olanda bulunmaz — platform tablosunun argümanı, ağ tarafından okunduğunda.

Katalogda olmayanlar, ima edilmek yerine açıkça belirtilmiştir

İki makinemiz arasında listelenen bağlantı bir Ethernet portudur. Hiçbir sipariş formunda InfiniBand fatura kalemi ve karttan karta köprü yoktur ve kümeler hakkında bu gerçeğin etrafından dolaşan bir sayfa sizi yerleşim düzeniyle yanıltıyordur. Bir yapı bunlardan birine ihtiyaç duyarsa siparişten önce sorun: cevap bir fiyat teklifidir ve bazen cevap hayırdır — ikisini de önce duymak daha ucuzdur.

Her basamak her iki yönde de limitsizdir, hiçbir faturada kota ve çıkış satırı yoktur — düğümleriniz arasındaki çoğaltma, karıştırma ve kontrol noktaları porta mal olur, başka hiçbir şeye değil. Tek makinede tek port için, kendi değerleriyle değerlendirildiğinde, limitsiz portlar sayfasıdır.

Yerleşim

Bir küme, yapılandırılmadan önce bir binaya yerleştirilir.

Gecikme, tesisi katı bir kısıt hâline getirir: bir işi paylaşan düğümler bir odayı paylaşır. Beş odamız aynı platformları stoklamaz, bu yüzden önce platformu seçen bir mühendis şehrinin taşımadığı birini seçebilir — önce odayı kontrol edin, sonra yapılandırın. Aşağıdaki ızgara türetilmiştir, yani yeni bir şehre ulaşan bir platform burada kimse hiçbir şey düzenlemeden görünür.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Binaların kendisi — güç, operatörler ve her birinde telefona kimin baktığı — veri merkezleri sayfasındadır. İki şehrimiz arasındaki gecikme düğüm çiftiniz için önemliyse, destekten bu odalar arasında ölçmesini isteyin; bir rakam haritadan iyidir.

Siparişten rafa

Tarih, ödemeden sonra değil, teklifle birlikte gelir.

Çok düğümlü bir yapı birkaç makinedir ve çoğu zaman bir satın alma siparişi değerinde parçadır — bu yüzden yayımlanan bir teslimat sloganı değil, siparişe göre üretim ve GPU sayfasının zaten kullandığı teslim süresi kaydıdır; uzun kutup, herhangi bir şeye bağlanmadan önce belirlenir.

  1. ~30 dakika

    Zaten rafta, olduğu gibi alınır

    Montaj yok ve raf ziyareti yok — makineler mevcuttur ve teslim edilir. Anında sunucular o listedir ve bir kümenin sade düğümleri için okumaya değer ilk yerdir.

  2. 4–24 saat

    Kendi stoğumuzdan monte edilir

    Standart durum: kartlar oturtulur, diziler kurulur, işletim sistemleri yüklenir — her düğüm komşusunun arkasında kuyruğa girmek yerine paralel çalışılır.

  3. 5–10 iş günü

    Yapı için satın alınır

    Şartnamedeki bir parça rafta tuttuğumuz bir parça değilse önce o sipariş edilir. Çok kartlı bir kasa için bu olağan basamaktır ve bunu belirleyen genellikle silikondan çok kasadır.

  4. 10–15 iş günü

    Tahsis üzerine

    Güncel nesil hızlandırıcılar, dağıtıcı ne zaman geleceğini söylüyorsa o zaman gelir. Bu bağımlılığı baştan adlandırırız ve tek bir siparişe karşı satın alınan donanım üç ay önceden alınır — ikinci haftada bir iptal, kimse için yapılmamış bir makine bırakırdı.

Her basamağın saati, ödeme ve dolandırıcılık incelemesi temizlendiğinde başlar — taahhüt edilen süre taşımayan tek adım. Büyük bir ilk siparişte havale, incelemeyi karttan daha hızlı geçme eğilimindedir; bir raf ziyareti buna bağlıyken bilinçli seçmeye değer.

Bir küme, formdan çok sohbette ayakta kalır. — kaç düğüm, işin bölümlenip bölümlenmediği ve neyle konuşması gerektiği — ve cevap veren kişi daha önce bir tane fiyatlandırmıştır. Tek bir makine yetiyorsa, size dört tane satmak yerine bunu söyler.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. Card prices are missing on purpose — GPU dedicated servers prints every one of them beside the machine each figure belongs to.

Cards in one chassis
Above one, the count is quoted: slot clearance, the per-socket lane budget and the power envelope belong to a specific chassis holding a specific card, so the honest number needs the part named. Name it, and the quote comes back with the chassis, the count and the date.
Nodes in one cluster
Any number from one up. Each node is a whole physical server with its own invoice and its own term, ordered, upgraded and replaced independently — no cluster SKU exists here, so neither does a cluster premium or a minimum count.
Card-taking platforms
4, and they specialise: AMD EPYC gives a card the widest bus (PCIe 4.0, 128 lanes per socket) while topping out at 20 Gbps of network in 2 of 5 cities; the 100 Gbps ceiling belongs to Intel Xeon Silver / Gold, which feeds a card an older bus. Scaling up and scaling out are therefore different platform choices.
The link between nodes
An Ethernet port on each node — 1 Gbps included on each of them, priced rungs to 100 Gbps — bought per machine per month, so a cluster pays the rung once per node. No InfiniBand line and no card-to-card bridge is in the catalog; anything past the port is quoted, and the answer can be no.
Where one machine stops
2 sockets and 1 TB of RAM, on the best of these platforms. Past either figure the unit of capacity is the next machine, not a bigger one.
Cities
5: New York, Miami, San Francisco, Amsterdam, Bucharest. Nodes that share a job belong in one of them together, and New York and Bucharest stock the complete platform set.
Traffic
Unmetered at every speed, both directions, with no allowance and no egress line — replication, shuffles and checkpoints between your nodes cost the port and nothing further.
Tenancy
One account per physical machine, on every node of the cluster, each card on PCIe passthrough into that account’s own operating system — no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
Delivery
About half an hour for machines racked as-is, four to twenty-four hours fitted from our stock, five to ten working days bought in, ten to fifteen for an allocation part — and a multi-node quote names its long pole before you pay.
Term
Monthly per machine, no contract; three, six and twelve-month cycles discount up to 15%. Hardware bought in against a single order takes three months up front.
Card money
Absent from this page by rule. Every card we seat and its own monthly line are on GPU dedicated servers, each figure printed beside the exact machine it belongs to.