Mais de uma placa, mais de uma máquina · Server Room · desde 2004

Escalar para cima depende do PCIe. Escalar para fora depende da porta.

Uma única placa em uma única máquina é aritmética resolvida, com preço completo na página de GPU. Passar de uma é onde a engenharia começa: a próxima placa disputa pistas e watts dentro do chassi, a próxima máquina conversa por uma porta que é comprada por nó, e a plataforma que maximiza um desses eixos atinge o limite no outro. Nosso catálogo declara essa troca em números, e esta página os imprime.

Veja a troca entre pistas e porta Calcule o preço da malha

Locatário único em cada chassi, passthrough PCIe em cada placa e nenhum contador de bytes em qualquer porta — o tráfego entre seus nós não é item de fatura de ninguém.

Contado, não composto

  • 4Platforms that seat a card
  • 100 GbpsTop port speed, per node
  • 2Socket ceiling, one chassis
  • 1 TBRAM ceiling, one chassis
  • 2Cities stocking all of them

Derivado do catálogo de pedidos nesta requisição — as mesmas linhas que o checkout fatura, para que nada possa estar desatualizado. O que está fisicamente em rack e ligado enquanto você lê isto é uma questão separada, e servidores instantâneos mantém essa lista.

Primeiro, nomeie o gargalo

Uma segunda placa e uma segunda máquina curam escassezes diferentes.

“Precisamos de mais computação” ainda não é uma especificação. Se a escassez está dentro do chassi ou ao longo do rack decide o que é pedido, como o dinheiro flui e qual teto você encontra em seguida — então a página se divide aqui, do mesmo jeito que o pedido se dividirá.

Dentro do chassi

Adicione uma placa à máquina que você tem

O sintoma é um acelerador faminto ou um conjunto de trabalho expulso: lotes fazem fila no barramento, ou o modelo superou a memória da placa. A cura é uma segunda placa — e quantas o chassi acomoda é definido pela folga do slot, pelo orçamento de pistas por soquete e pela margem da fonte de alimentação, três números que pertencem a um chassi específico segurando uma placa específica, e não a qualquer linha de catálogo. Nós cotamos com a peça nomeada em vez de vender uma caixa de seleção.

O que decide: o chassi. Nomeie a placa, e a cotação nomeia o chassi que acomoda essa quantidade dela, e a data.

O que duas placas não são: uma placa grande. Seus pools de memória permanecem separados, a menos que seu runtime divida o trabalho entre elas — paralelismo de tensor ou pipeline para um trabalho grande, que paga um pedágio no enlace entre as placas. Trabalho que já são muitos trabalhos independentes simplesmente roda no dobro do silício, sem mudanças.

Ao longo do rack

Coloque uma segunda máquina ao lado

O sintoma é uma máquina cheia: soquetes ocupados, slots DIMM preenchidos, trabalhos enfileirando atrás de trabalhos. O melhor que qualquer plataforma que aceita placas oferece aqui é 2 sockets and 1 TB, e além dessa parede não existe caixa única maior neste catálogo — a próxima unidade de capacidade é outro servidor, não um maior.

O que decide: o prédio e a porta. Tráfego nó a nó só é útil dentro de uma instalação, e cada nó compra sua própria porta — a conta da malha é o preço da porta vezes a contagem de nós, todo mês.

O que um cluster é aqui: n servidores separados. Pedidos separados, faturas separadas, upgrades e substituições separados. Não existe SKU de cluster, o que também significa que não existe prêmio de cluster nem contagem mínima de nós.

A troca, medida

O barramento mais largo e a porta mais rápida estão em máquinas diferentes.

Cada plataforma em que colocaremos uma placa, nos eixos que dimensionam um cluster em vez de um servidor. As gerações de barramento são a mesma tabela de origem que a página de GPU imprime — um arquivo, duas páginas, sem como discordar — e todo o resto é o catálogo de pedidos falando por si.

Live from the order catalog on this request. Follow any row across: the bus column and the port column pull against each other.
PlatformPCIe to the cardPort ceilingSocketsRAM ceilingCities
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Como um engenheiro lê essa tabela

  • Pistas PCIe limitam a transferência host-placa — streaming de lotes, carregamento de cenas, qualquer coisa que transborde da memória da placa. Um modelo que está residente e permanece residente deixa de se importar com elas.
  • O teto da porta limita a transferência nó a nó. Em uma máquina é irrelevante; em duas é o problema inteiro.
  • Cidades é a coluna a verificar primeiro para um cluster, não por último: uma plataforma perfeita e ausente do seu prédio não é candidata.
  • Portanto: trabalho de nó único alimentado por barramento pertence às pistas mais largas e pode ignorar a porta; trabalho particionado pertence onde a porta atinge o máximo e pode tolerar um barramento mais antigo. Uma configuração que exige os dois máximos ao mesmo tempo não existe neste catálogo, e imprimimos isso aqui em vez de deixar você descobrir na hora da fatura.

Qual silício vai no slot, e a linha mensal de cada placa, está em servidores dedicados GPU — a única página neste domínio autorizada a precificar uma placa. Nada abaixo repete um número dela.

A conta da malha

Multiplique a porta por n antes de chamar de orçamento.

Uma porta é precificada por máquina, então a interconexão sob um cluster é o mesmo item de linha uma vez por nó. A tabela traz essa multiplicação já feita, porque orçamentos compostos de preços de servidor único são como cotações de cluster voltam como surpresas.

Monthly, per machine, on top of the machine itself. A cluster buys its speed once per node — the multiplied columns are the fabric bill.
SpeedPer node× 2 nodes× 4 nodesReaches it
1 Gbpsincludedincludedincludedall 4 platforms
2 Gbps$189$378$756all 4 platforms
3 Gbps$299$598$1,196all 4 platforms
5 Gbps$459$918$1,836all 4 platforms
10 Gbps$529$1,058$2,116all 4 platforms
20 Gbps$1,629$3,258$6,516all 4 platforms
40 Gbps$2,799$5,598$11,1962 of 4 platforms
100 Gbps$3,999$7,998$15,9961 of 4 platforms

Vale notar nessa escada

  • Os degraus não têm preço linear. Em vários pontos, n máquinas um degrau abaixo custam menos que n−1 máquinas um degrau acima — e compram um servidor extra inteiro. Se essa troca está disponível para você depende apenas de o trabalho particionar.
  • A coluna da direita afina em direção ao topo. As velocidades mais altas existem em menos plataformas, e não naquela com o barramento mais largo — o argumento da tabela de plataformas, lido pelo lado da rede.

O que não está no catálogo, declarado em vez de implícito

Entre duas de nossas máquinas, o enlace listado é uma porta Ethernet. Não há item de linha InfiniBand nem ponte placa a placa em qualquer formulário de pedido, e uma página sobre clusters que contorna esse fato está enganando você com o layout. Se uma configuração precisa de qualquer um deles, pergunte antes de pedir: a resposta é uma cotação, e às vezes a resposta é não — ambos são mais baratos de ouvir primeiro.

Cada degrau é sem medição em ambas as direções, sem franquia e sem linha de saída em qualquer lugar de uma fatura — replicação, shuffles e checkpoints entre seus nós custam a porta e nada mais. Para uma porta em uma máquina, julgada por seus próprios méritos, portas sem medição é a página.

Posicionamento

Um cluster é colocado em um prédio antes de ser configurado.

A latência torna a instalação uma restrição rígida: nós que compartilham um trabalho compartilham uma sala. Nossas cinco salas não estocam as mesmas plataformas, então um engenheiro que escolhe a plataforma primeiro pode escolher uma que sua cidade não carrega — verifique a sala, depois configure. A grade abaixo é derivada, então uma plataforma que chega a uma nova cidade aparece aqui sem ninguém editar nada.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Os próprios prédios — energia, operadoras e quem atende o telefone em cada um — estão em data centers. Se a latência entre duas de nossas cidades importa para seu par de nós, peça ao suporte para medi-la entre essas salas; um número vale mais que um mapa.

Do pedido ao rack

A data chega com a cotação, não depois do pagamento.

Uma configuração de múltiplos nós são várias máquinas e, frequentemente, peças no valor de uma ordem de compra — então o que é publicado não é um slogan de entrega, mas o registro de prazos que build to order e a página de GPU já usam, com o caminho crítico identificado antes de você se comprometer com qualquer coisa.

  1. ~30 minutos

    Já em rack, entregue como está

    Sem instalação e sem visita ao rack — as máquinas existem e são entregues. Servidores instantâneos é essa lista, e para os nós simples de um cluster é o primeiro lugar que vale a pena ler.

  2. 4–24 horas

    Montado do nosso próprio estoque

    O caso padrão: placas encaixadas, arrays construídos, sistemas operacionais instalados — cada nó trabalhado em paralelo em vez de enfileirado atrás do vizinho.

  3. 5–10 dias úteis

    Comprado para a configuração

    Uma peça na especificação não é uma que mantemos em prateleira, então é pedida primeiro. Para um chassi de múltiplas placas, este é o degrau usual, e geralmente é o chassi, e não o silício, que o define.

  4. 10–15 dias úteis

    Sob alocação

    Aceleradores da geração atual chegam quando o distribuidor diz que chegam. Nomeamos essa dependência antecipadamente, e hardware comprado contra um único pedido exige três meses de antecedência — um cancelamento na segunda semana deixaria uma máquina construída para ninguém.

O relógio de cada degrau começa quando o pagamento e a revisão de fraude são liberados — o único passo que não carrega duração prometida. Em um primeiro pedido grande, uma transferência tende a liberar a revisão mais rápido que um cartão; vale escolher deliberadamente quando uma visita ao rack está esperando por isso.

Um cluster sobrevive melhor ao chat do que a um formulário. — quantos nós, se o trabalho particiona e com o que ele precisa conversar — e a pessoa que responde já cotou um antes. Se uma máquina cobre isso, ela dirá isso em vez de vender quatro.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. Card prices are missing on purpose — GPU dedicated servers prints every one of them beside the machine each figure belongs to.

Cards in one chassis
Above one, the count is quoted: slot clearance, the per-socket lane budget and the power envelope belong to a specific chassis holding a specific card, so the honest number needs the part named. Name it, and the quote comes back with the chassis, the count and the date.
Nodes in one cluster
Any number from one up. Each node is a whole physical server with its own invoice and its own term, ordered, upgraded and replaced independently — no cluster SKU exists here, so neither does a cluster premium or a minimum count.
Card-taking platforms
4, and they specialise: AMD EPYC gives a card the widest bus (PCIe 4.0, 128 lanes per socket) while topping out at 20 Gbps of network in 2 of 5 cities; the 100 Gbps ceiling belongs to Intel Xeon Silver / Gold, which feeds a card an older bus. Scaling up and scaling out are therefore different platform choices.
The link between nodes
An Ethernet port on each node — 1 Gbps included on each of them, priced rungs to 100 Gbps — bought per machine per month, so a cluster pays the rung once per node. No InfiniBand line and no card-to-card bridge is in the catalog; anything past the port is quoted, and the answer can be no.
Where one machine stops
2 sockets and 1 TB of RAM, on the best of these platforms. Past either figure the unit of capacity is the next machine, not a bigger one.
Cities
5: New York, Miami, San Francisco, Amsterdam, Bucharest. Nodes that share a job belong in one of them together, and New York and Bucharest stock the complete platform set.
Traffic
Unmetered at every speed, both directions, with no allowance and no egress line — replication, shuffles and checkpoints between your nodes cost the port and nothing further.
Tenancy
One account per physical machine, on every node of the cluster, each card on PCIe passthrough into that account’s own operating system — no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
Delivery
About half an hour for machines racked as-is, four to twenty-four hours fitted from our stock, five to ten working days bought in, ten to fifteen for an allocation part — and a multi-node quote names its long pole before you pay.
Term
Monthly per machine, no contract; three, six and twelve-month cycles discount up to 15%. Hardware bought in against a single order takes three months up front.
Card money
Absent from this page by rule. Every card we seat and its own monthly line are on GPU dedicated servers, each figure printed beside the exact machine it belongs to.