Alojamiento de LLM en servidores dedicados · Server Room · desde 2004

Un rack. Todas las formas de ejecutar un modelo.

Los modelos de lenguaje no necesitan un solo tipo de máquina — necesitan la correcta. Una pasarela de agentes quiere una caja barata que nunca duerma. El asistente de un equipo ejecuta un Llama o Qwen cuantizado directamente desde la memoria del sistema. Un 70B quiere memoria de tarjeta, y una factura por token quiere tu crecimiento. Elige la bahía: toda la máquina es tuya por mes, nada compartido, nada medido, y la cifra que aparece es la misma del checkout.

Elige tu bahía Dimensiona tu modelo

  • Inquilino único
  • Tráfico sin medición
  • Cinco ciudades
  • Mensual, sin contrato

Leído del catálogo de pedidos en el momento de servir esta página. Haz clic en una bahía.

Contado, no compuesto

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Cada cifra de arriba se deriva en esta solicitud de las filas que factura el configurador, para que nada quede obsoleto entre despliegues. Lo que está en rack y encendido mientras lees esto es otra cuestión, y servidores instantáneos se encarga de ella — esta página se lee igual con el estante lleno que vacío.

El catálogo, por carga de trabajo

Cuatro bahías, con precio completo.

No son cuatro niveles de un producto — son cuatro máquinas diferentes para cuatro trabajos diferentes, cada cifra es el total mensual de la configuración exacta impresa a su lado. Nada llega después: el puerto, la dirección y la consola fuera de banda ya están en el número.

inferencia en cpu

Un asistente privado para todo el equipo

Un Llama, Qwen o Mistral cuantizado de 7–8B sirve chat, recuperación y embeddings directamente desde 128 GB de memoria del sistema — el trabajo para el que se escribieron llama.cpp y Ollama. Sin tarjeta gráfica, sin el precio de la tarjeta gráfica, y el almacén de vectores vive en el mismo metal que el modelo. Construido bajo pedido en 4–24 horas, en las cinco ciudades.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

agentes

La caja del agente

Pasarelas como OpenClaw pasan su vida llamando a modelos en otros sitios y esperando respuestas. Necesitan tiempo de actividad y un puerto, no aceleradores — y la máquina honesta más barata para esa tarea es esta.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

servicio en gpu · ajuste fino

Memoria de tarjeta para los grandes

De 13B con velocidad a 70B en 4 bits, el trabajo se mueve a la memoria de la tarjeta, y vLLM convierte la tarjeta en un endpoint por lotes compatible con OpenAI que tu código cliente ya habla. La cifra de abajo es una máquina completa con el acelerador de 48 GB ya instalado; la línea debajo es lo que aporta solo la tarjeta, y la configuración de 80 GB a su lado es el mismo chasis llevando un 70B en 8 bits.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Qué tarjeta, de todas las que instalamos, es una página propia — cada una con su precio como línea propia junto a su máquina, en la página de GPU.

caja de desarrollo

DGX Spark, sin el escritorio

La pequeña máquina GB10 de NVIDIA, en rack en Nueva York con plazo anual — la caja a la que apuntan primero los frameworks, sin la importación y sin el ruido del ventilador junto a tu silla.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

custodia

UE o EE. UU., tú decides

Ámsterdam y Bucarest mantienen el trabajo europeo en Europa; Nueva York, Miami y San Francisco mantienen el trabajo estadounidense en casa. Los cinco edificios →

¿Más grande que una bahía?

Una segunda tarjeta en el chasis, o una segunda máquina a su lado, es una cuestión diferente con su propia página — carriles, puertos y ubicación, cotizados con la pieza nombrada. O salta adelante: y la respuesta nombra el chasis y el plazo de entrega.

La aritmética

Dimensiona el modelo. La máquina sigue.

Los pesos son parámetros por bytes por parámetro — aritmética, no benchmarking, y la misma tabla con fuentes que imprime la página de GPU. Elige un tamaño y una precisión; la respuesta nombra la memoria que necesitan los pesos, la bahía más barata que los lleva y el margen restante como una proporción simple, porque un modelo que apenas cabe no sirve.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Solo los pesos — el runtime y la ventana de contexto viven en el margen, por eso ninguna respuesta de arriba llena su memoria hasta el borde. Las licencias son entre tú y el editor del modelo; la máquina no controla lo que cargas.

Ya en cada cifra

Lo que incluye cada bahía.

Un inquilinoLa máquina física es solo tuya. Sin hipervisor debajo, sin tarjeta compartida, sin división de tiempo, sin trabajo por lotes del vecino en tu silicio.
Root y la consolaUn sistema operativo limpio a tu elección, root en el metal y una consola fuera de banda (iLO, iDRAC, IPMI) que sigue respondiendo cuando el sistema operativo no lo hace.
Un puerto sin mediciónNada contado en ninguna dirección. Datasets entrando, checkpoints saliendo, usuarios servidos — no existe ninguna línea de salida en ninguna factura.
Tu stack, tus versionesOllama, llama.cpp, vLLM — los instalas y los fijas tú, y nada los mueve después. ¿Quieres el driver de GPU instalado antes de la entrega? Pon la versión exacta en el pedido.
CustodiaLos prompts, el contexto y los datos de ajuste fino se mueven entre tus usuarios y tu máquina, sin terceros en el camino para registrarlos, entrenar con ellos o reescribir sus términos en torno a ellos.
Personas, todo el díaChat, correo y teléfono, cada hora del año — y una pieza muerta se cambia según un reloj escrito, no una promesa de buena voluntad. Los relojes están publicados.

La otra factura

La tarifa plana gana a la medición cuando el trabajo es constante.

Una API por token es la herramienta correcta para picos y para la calidad de los modelos frontera — lo diremos claramente en lugar de vender en contra. La máquina gana cuando el volumen es constante, cuando los datos deben permanecer bajo tu custodia, o cuando un modelo abierto ajustado ya hace el trabajo: su cifra se lee igual con diez veces el tráfico, y el crecimiento deja de ser una partida. Cada cifra mensual de este dominio, reunida en una tabla, es la página de precios; por qué las máquinas más antiguas aquí siguen siendo baratas es la página de valor.

Preguntado antes de comprar

Diez respuestas directas.

¿Puedo servir un LLM sin tarjeta gráfica?

Sí, dentro de un límite que vale la pena declarar: un modelo cuantizado de 7–8B en la bahía de CPU sirve honestamente el asistente de un equipo, la recuperación y los embeddings. No servirá un 70B a mil usuarios — ese es el trabajo de la bahía de GPU, y esta página lo dice aquí en lugar de dejar que lo descubras.

¿Qué necesita un modelo de 70B?

Unos 38 GB de memoria de tarjeta en 4 bits, que lleva la tarjeta de 48 GB; 70 GB en 8 bits, que requiere la tarjeta de 80 GB; 140 GB en precisión completa, que es más de una tarjeta y se convierte en la cuestión de la página multi-tarjeta.

¿Qué modelos tengo permitido ejecutar?

Cualquiera cuyos pesos puedas poseer: las familias Llama, Qwen, Mistral, Gemma y DeepSeek y sus ajustes finos. La licencia está entre tú y el editor — la máquina no la lee y nosotros no la controlamos.

¿Se usan mis datos para entrenar algo?

No. Nada en el camino los lee. Un inquilino por máquina, tu sistema operativo, tus discos; nosotros operamos el hardware y la red debajo, nunca la carga de trabajo encima.

¿Por qué no quedarse en una API por token?

Quédate mientras tu tráfico sea irregular o el modelo frontera sea el producto. Muévete cuando el volumen sea constante, los datos sean sensibles o un modelo abierto ajustado ya haga el trabajo — y ambos se mezclan bien: muchos stacks enrutan el cinco por ciento más difícil a una API y sirven el resto ellos mismos.

¿Alquilar mensualmente o comprar el hardware?

Comprar gana después de uno o dos años de uso constante, más alguien pagado para alojarlo, alimentarlo, enfriarlo y repararlo. Alquilar gana el primer día, en cada actualización y a las tres de la mañana cuando una pieza muere según nuestro reloj escrito en lugar del tuyo.

¿Qué tan rápida es la entrega?

Unos treinta minutos para una máquina en el estante, de cuatro a veinticuatro horas para una construcción, más tiempo cuando una pieza se compra por encargo — la escalera se imprime en el punto de pedido, y servidores instantáneos lista lo que está en rack ahora mismo.

¿Hay una prueba?

No hay cuentas de prueba. Dentro de los tres días naturales desde la primera activación, la política de reembolso se aplica tal como está escrita, y los pagos con criptomonedas se reembolsan como crédito de tienda. La prueba honesta más barata es un mes en la bahía de CPU.

¿Las piezas de pedido especial tienen términos diferentes?

A veces. Una pieza comprada por encargo para tu pedido puede llevar una parte por adelantado o un plazo mínimo — y se te dice exactamente qué antes de pagar, nunca después. Las máquinas en el estante llevan lo predeterminado: un mes, sin contrato.

¿Qué pasa cuando supero la bahía?

La siguiente bahía, normalmente en el mismo edificio: una máquina CPU entrega sus pesos a una máquina GPU por el cable local, o se cambia la tarjeta en el chasis que ya tienes y la factura se mueve exactamente por la diferencia.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt