Más de una tarjeta, más de una máquina · Server Room · desde 2004

Escalar hacia arriba viaja por PCIe. Escalar hacia afuera viaja por el puerto.

Una sola tarjeta en una sola máquina es aritmética resuelta, con precio completo en la página de GPU. Pasada esa frontera empieza la ingeniería: la siguiente tarjeta compite por carriles y vatios dentro del chasis, la siguiente máquina habla a través de un puerto que se compra por nodo, y la plataforma que maximiza uno de esos ejes se queda corta en el otro. Nuestro catálogo expresa ese intercambio en números, y esta página los imprime.

Ver el intercambio entre carriles y puerto Precio de la red

Un solo inquilino en cada chasis, passthrough PCIe en cada tarjeta y ningún contador de bytes en ningún puerto — el tráfico entre tus nodos no es partida de nadie.

Contado, no compuesto

  • 4Platforms that seat a card
  • 100 GbpsTop port speed, per node
  • 2Socket ceiling, one chassis
  • 1 TBRAM ceiling, one chassis
  • 2Cities stocking all of them

Derivado del catálogo de pedidos en esta solicitud — las mismas filas que factura el checkout, así que nada puede estar desactualizado. Lo que está físicamente en rack y encendido mientras lees esto es otra cuestión, y servidores instantáneos mantiene esa lista.

Primero, nombra el cuello de botella

Una segunda tarjeta y una segunda máquina curan escaseces distintas.

“Necesitamos más cómputo” todavía no es una especificación. Si la escasez está dentro del chasis o a lo largo del rack decide qué se pide, cómo corre el dinero y qué techo encuentras después — así que la página se divide aquí, igual que se dividirá el pedido.

Dentro del chasis

Añade una tarjeta a la máquina que tienes

El síntoma es un acelerador hambriento o un conjunto de trabajo desalojado: los lotes hacen cola en el bus, o el modelo ha superado la memoria de la tarjeta. La cura es una segunda tarjeta — y cuántas admite el chasis lo fijan el espacio de ranura, el presupuesto de carriles por socket y el margen de la fuente de alimentación, tres números que pertenecen a un chasis concreto que aloja una tarjeta concreta y no a ninguna fila del catálogo. Lo cotizamos con la pieza nombrada en lugar de vender una casilla de verificación.

Qué lo decide: el chasis. Nombra la tarjeta, y la cotización nombra el chasis que admite esa cantidad de ellas, y la fecha.

Lo que dos tarjetas no son: una tarjeta grande. Sus reservas de memoria permanecen separadas salvo que tu runtime divida el trabajo entre ellas — paralelismo de tensor o de pipeline para un trabajo grande, que paga un peaje en el enlace entre las tarjetas. El trabajo que ya son muchos trabajos independientes simplemente corre en el doble de silicio, sin cambios.

A lo largo del rack

Pon una segunda máquina a su lado

El síntoma es una máquina llena: sockets ocupados, ranuras DIMM pobladas, trabajos haciendo cola detrás de trabajos. Lo máximo que ofrece aquí cualquier plataforma que admite tarjetas es 2 sockets and 1 TB, y pasado ese muro no existe en este catálogo una caja individual más grande — la siguiente unidad de capacidad es otro servidor, no uno mayor.

Qué lo decide: el edificio y el puerto. El tráfico nodo a nodo solo es útil dentro de una instalación, y cada nodo compra su propio puerto — la factura de red es el precio del puerto por el número de nodos, cada mes.

Qué es un clúster aquí: n servidores separados. Pedidos por separado, facturados por separado, actualizados y reemplazados por separado. No existe ningún SKU de clúster, lo que también significa que no existe prima de clúster ni número mínimo de nodos.

El intercambio, medido

El bus más ancho y el puerto más rápido están en máquinas distintas.

Cada plataforma en la que asentaremos una tarjeta, en los ejes que dimensionan un clúster y no un servidor. Las generaciones de bus son la misma tabla de origen que imprime la página de GPU — un archivo, dos páginas, sin forma de discrepar — y todo lo demás es el catálogo de pedidos hablando por sí mismo.

Live from the order catalog on this request. Follow any row across: the bus column and the port column pull against each other.
PlatformPCIe to the cardPort ceilingSocketsRAM ceilingCities
Intel Xeon Silver / Gold48 lanes per socketPCIe 3.0100 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v3/v440 lanes per socketPCIe 3.040 Gbps1 Gbps included21 TB5
Intel Xeon E5-2600 v1/v240 lanes per socketPCIe 3.020 Gbps1 Gbps included2256 GB3
AMD EPYC128 lanes per socketPCIe 4.020 Gbps1 Gbps included21 TB2

Cómo lee esa tabla un ingeniero

  • Los carriles PCIe limitan la transferencia host-tarjeta — streaming de lotes, cargas de escena, cualquier cosa que se derrame de la memoria de la tarjeta. Un modelo residente que va a seguir residente deja de preocuparse por ellos.
  • El techo del puerto limita la transferencia nodo a nodo. Con una máquina es irrelevante; con dos es todo el problema.
  • Ciudades es la columna que hay que mirar primero para un clúster, no la última: una plataforma perfecta y ausente de tu edificio no es candidata.
  • Por lo tanto: el trabajo de un solo nodo alimentado por bus pertenece a los carriles más anchos y puede ignorar el puerto; el trabajo particionado pertenece donde el puerto llega a su tope y puede tolerar un bus más viejo. Una construcción que exija ambos máximos a la vez no existe en este catálogo, y lo imprimimos aquí en lugar de dejar que lo descubras al recibir la factura.

Qué silicio va en la ranura, y la línea mensual de cada tarjeta, está en servidores dedicados GPU — la única página de este dominio con permiso para poner precio a una tarjeta. Nada de lo que sigue repite una cifra de allí.

La factura de red

Multiplica el puerto por n antes de llamarlo presupuesto.

Un puerto tiene precio por máquina, así que la interconexión bajo un clúster es la misma partida una vez por nodo. La tabla trae esa multiplicación ya hecha, porque los presupuestos compuestos con precios de un solo servidor son la razón por la que las cotizaciones de clúster vuelven como sorpresas.

Monthly, per machine, on top of the machine itself. A cluster buys its speed once per node — the multiplied columns are the fabric bill.
SpeedPer node× 2 nodes× 4 nodesReaches it
1 Gbpsincludedincludedincludedall 4 platforms
2 Gbps$189$378$756all 4 platforms
3 Gbps$299$598$1,196all 4 platforms
5 Gbps$459$918$1,836all 4 platforms
10 Gbps$529$1,058$2,116all 4 platforms
20 Gbps$1,629$3,258$6,516all 4 platforms
40 Gbps$2,799$5,598$11,1962 of 4 platforms
100 Gbps$3,999$7,998$15,9961 of 4 platforms

Lo que vale la pena notar en esa escalera

  • Los peldaños no tienen precio lineal. En varios puntos, n máquinas un peldaño más abajo cuestan menos que n−1 máquinas un peldaño más arriba — y te compran un servidor entero extra. Si ese intercambio está disponible para ti depende solo de si el trabajo se particiona.
  • La columna de la derecha se adelgaza hacia arriba. Las velocidades más altas existen en menos plataformas, y no en la del bus más ancho — el argumento de la tabla de plataformas, leído desde el lado de la red.

Lo que no está en el catálogo, dicho en lugar de insinuado

Entre dos de nuestras máquinas el enlace listado es un puerto Ethernet. No hay partida de InfiniBand ni puente tarjeta a tarjeta en ningún formulario de pedido, y una página sobre clústeres que escriba alrededor de ese hecho te está engañando con el diseño. Si una construcción necesita cualquiera de los dos, pregunta antes de pedir: la respuesta es una cotización, y a veces la respuesta es no — ambas son más baratas de escuchar primero.

Cada peldaño es sin medición en ambas direcciones, sin franquicia y sin línea de salida en ninguna factura — la replicación, los barajados y los puntos de control entre tus nodos cuestan el puerto y nada más. Para un puerto en una máquina, juzgado por sus propios méritos, puertos sin medición es la página.

Ubicación

Un clúster se coloca en un edificio antes de configurarse.

La latencia hace de la instalación una restricción dura: los nodos que comparten un trabajo comparten una sala. Nuestras cinco salas no almacenan las mismas plataformas, así que un ingeniero que elige primero la plataforma puede elegir una que su ciudad no tiene — revisa la sala, luego configura. La cuadrícula de abajo es derivada, así que una plataforma que llega a una ciudad nueva aparece aquí sin que nadie edite nada.

  • New York, US4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Bucharest, EU4 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2 · AMD EPYC
  • Miami, US3 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4 · Intel Xeon E5-2600 v1/v2
  • San Francisco, US2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4
  • Amsterdam, EU2 of 4 platformsIntel Xeon Silver / Gold · Intel Xeon E5-2600 v3/v4

Los edificios en sí — energía, operadores y quién contesta el teléfono en cada uno — están en centros de datos. Si la latencia entre dos de nuestras ciudades importa para tu par de nodos, pide a soporte que la mida entre esas salas; un número vale más que un mapa.

Del pedido al rack

La fecha llega con la cotización, no después del pago.

Una construcción multinodo son varias máquinas y, a menudo, piezas por valor de una orden de compra — así que lo que se publica no es un eslogan de entrega sino el registro de plazos que construcción a pedido y la página de GPU ya usan, con el palo largo identificado antes de que te comprometas a nada.

  1. ~30 minutos

    Ya en rack, se entrega tal cual

    Sin montaje y sin visita al rack — las máquinas existen y se entregan. Servidores instantáneos es esa lista, y para los nodos simples de un clúster es el primer lugar que vale la pena leer.

  2. 4–24 horas

    Montado desde nuestro propio stock

    El caso estándar: tarjetas asentadas, arreglos construidos, sistemas operativos instalados — cada nodo trabajado en paralelo en lugar de hacer cola detrás de su vecino.

  3. 5–10 días laborables

    Comprado para la construcción

    Una pieza de la especificación no es una que tengamos en estantería, así que se pide primero. Para un chasis multitarjeta este es el peldaño habitual, y normalmente es el chasis y no el silicio lo que lo fija.

  4. 10–15 días laborables

    En asignación

    Los aceleradores de la generación actual llegan cuando el distribuidor dice que llegan. Nombramos esa dependencia por adelantado, y el hardware comprado contra un solo pedido se toma con tres meses de antelación — una cancelación en la segunda semana dejaría una máquina construida para nadie.

El reloj de cada peldaño arranca cuando el pago y la revisión antifraude se despejan — el único paso que no lleva duración prometida. En un primer pedido grande, una transferencia suele despejar la revisión más rápido que una tarjeta; vale la pena elegirla deliberadamente cuando una visita al rack está esperando por ello.

Un clúster sobrevive mejor al chat que a un formulario. — cuántos nodos, si el trabajo se particiona y con qué tiene que hablar — y la persona que responde ya ha cotizado uno antes. Si una máquina lo cubre, te lo dirá en lugar de venderte cuatro.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. Card prices are missing on purpose — GPU dedicated servers prints every one of them beside the machine each figure belongs to.

Cards in one chassis
Above one, the count is quoted: slot clearance, the per-socket lane budget and the power envelope belong to a specific chassis holding a specific card, so the honest number needs the part named. Name it, and the quote comes back with the chassis, the count and the date.
Nodes in one cluster
Any number from one up. Each node is a whole physical server with its own invoice and its own term, ordered, upgraded and replaced independently — no cluster SKU exists here, so neither does a cluster premium or a minimum count.
Card-taking platforms
4, and they specialise: AMD EPYC gives a card the widest bus (PCIe 4.0, 128 lanes per socket) while topping out at 20 Gbps of network in 2 of 5 cities; the 100 Gbps ceiling belongs to Intel Xeon Silver / Gold, which feeds a card an older bus. Scaling up and scaling out are therefore different platform choices.
The link between nodes
An Ethernet port on each node — 1 Gbps included on each of them, priced rungs to 100 Gbps — bought per machine per month, so a cluster pays the rung once per node. No InfiniBand line and no card-to-card bridge is in the catalog; anything past the port is quoted, and the answer can be no.
Where one machine stops
2 sockets and 1 TB of RAM, on the best of these platforms. Past either figure the unit of capacity is the next machine, not a bigger one.
Cities
5: New York, Miami, San Francisco, Amsterdam, Bucharest. Nodes that share a job belong in one of them together, and New York and Bucharest stock the complete platform set.
Traffic
Unmetered at every speed, both directions, with no allowance and no egress line — replication, shuffles and checkpoints between your nodes cost the port and nothing further.
Tenancy
One account per physical machine, on every node of the cluster, each card on PCIe passthrough into that account’s own operating system — no hypervisor, no MIG partition, no vGPU profile, no time-slicing.
Delivery
About half an hour for machines racked as-is, four to twenty-four hours fitted from our stock, five to ten working days bought in, ten to fifteen for an allocation part — and a multi-node quote names its long pole before you pay.
Term
Monthly per machine, no contract; three, six and twelve-month cycles discount up to 15%. Hardware bought in against a single order takes three months up front.
Card money
Absent from this page by rule. Every card we seat and its own monthly line are on GPU dedicated servers, each figure printed beside the exact machine it belongs to.