Hébergement LLM sur serveurs dédiés · Server Room · fondé en 2004

Un rack. Toutes les façons de faire tourner un modèle.

Les modèles de langage n’ont pas besoin d’un seul type de machine — ils ont besoin de la bonne. Une passerelle d’agents veut une machine économique qui ne dort jamais. L’assistant d’une équipe fait tourner un Llama ou un Qwen quantifié directement depuis la mémoire système. Un 70B veut de la mémoire de carte, et une facturation au jeton veut votre croissance. Choisissez la baie : la machine entière est à vous au mois, rien de partagé, rien de mesuré, et le chiffre affiché est celui du paiement lui-même.

Choisissez votre baie Dimensionnez votre modèle

  • Locataire unique
  • Trafic non mesuré
  • Cinq villes
  • Au mois, sans engagement

Lu depuis le catalogue de commandes au moment où cette page a été servie. Cliquez sur une baie.

Compté, pas composé

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Chaque chiffre ci-dessus est dérivé lors de cette requête des lignes que le configurateur facture, afin qu’aucun ne puisse devenir obsolète entre deux déploiements. Ce qui est en rack et sous tension au moment où vous lisez ceci est une autre question, et les serveurs instantanés s’en occupent — cette page se lit de la même façon sur une étagère pleine et sur une étagère vide.

Le catalogue, par charge de travail

Quatre baies, au prix complet.

Pas quatre paliers d’un même produit — quatre machines différentes pour quatre tâches différentes, chaque chiffre étant le total mensuel de la configuration exacte imprimée à côté. Rien n’arrive plus tard : le port, l’adresse et la console hors bande sont déjà dans le nombre.

inférence cpu

Un assistant privé pour toute l’équipe

Un Llama, Qwen ou Mistral quantifié de 7–8B sert le chat, la récupération et les embeddings directement depuis 128 Go de mémoire système — le travail pour lequel llama.cpp et Ollama ont été écrits. Pas de carte graphique, pas de prix de carte graphique, et le magasin vectoriel vit sur le même métal que le modèle. Construit à la commande en 4–24 heures, dans les cinq villes.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

agents

La machine de l’agent

Les passerelles comme OpenClaw passent leur vie à appeler des modèles ailleurs et à attendre des réponses. Elles ont besoin de disponibilité et d’un port, pas d’accélérateurs — et la machine honnête la moins chère pour cette tâche est celle-ci.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

serving gpu · fine-tuning

De la mémoire de carte pour les gros

Du 13B à pleine vitesse au 70B en 4 bits, le travail passe en mémoire de carte, et vLLM transforme la carte en un point de terminaison par lots compatible OpenAI que votre code client parle déjà. Le chiffre ci-dessous est une machine complète avec l’accélérateur de 48 Go déjà installé ; la ligne en dessous est ce que la carte seule apporte, et la configuration de 80 Go à côté est le même châssis portant un 70B en 8 bits.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Quelle carte, parmi toutes celles que nous installons, est une page à part entière — chacune tarifée comme sa propre ligne à côté de sa machine, sur la page GPU.

machine de dev

DGX Spark, sans le bureau

La petite machine GB10 de NVIDIA, en rack à New York sur une durée annuelle — la machine que les frameworks ciblent en premier, sans l’importation ni le bruit de ventilateur à côté de votre chaise.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

garde

UE ou États-Unis, à vous de choisir

Amsterdam et Bucarest gardent le travail européen en Europe ; New York, Miami et San Francisco gardent le travail américain chez lui. Les cinq bâtiments →

Plus grand qu’une seule baie ?

Une deuxième carte dans le châssis, ou une deuxième machine à côté, est une question différente avec sa propre page — voies, ports et placement, chiffrés avec la pièce nommée. Ou passez directement : et la réponse nomme le châssis et le délai.

L’arithmétique

Dimensionnez le modèle. La machine suit.

Les poids sont des paramètres multipliés par des octets par paramètre — de l’arithmétique, pas de l’évaluation comparative, et la même table sourcée que la page GPU imprime. Choisissez une taille et une précision ; la réponse nomme la mémoire dont les poids ont besoin, la baie la moins chère qui les porte, et la marge restante sous forme de simple ratio, car un modèle qui tient à peine ne sert pas.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Les poids seuls — le runtime et la fenêtre de contexte vivent dans la marge, c’est pourquoi aucune réponse ci-dessus ne remplit sa mémoire à ras bord. Les licences sont entre vous et l’éditeur du modèle ; la machine ne contrôle pas ce que vous chargez.

Déjà dans chaque chiffre

Ce que chaque baie inclut.

Un locataireLa machine physique est à vous seul. Pas d’hyperviseur en dessous, pas de carte partagée, pas de découpage temporel, pas de tâche par lots du voisin sur votre silicium.
Root et la consoleUn OS propre de votre choix, root sur le métal, et une console hors bande (iLO, iDRAC, IPMI) qui répond encore quand l’OS ne répond pas.
Un port non mesuréRien de compté dans aucune direction. Jeux de données entrants, points de contrôle sortants, utilisateurs servis — aucune ligne de sortie n’existe sur aucune facture.
Votre pile, vos versionsOllama, llama.cpp, vLLM — vous les installez et les épinglez, et rien ne les déplace ensuite. Vous voulez le pilote GPU en place avant la livraison ? Mettez la version exacte sur la commande.
GardeLes invites, le contexte et les données de fine-tuning circulent entre vos utilisateurs et votre machine, sans tiers sur le chemin pour les journaliser, s’entraîner dessus, ou réécrire ses conditions autour d’elles.
Des personnes, 24 heures sur 24Chat, courriel et téléphone, à toute heure de l’année — et une pièce morte est remplacée selon une horloge écrite, pas une promesse de bonne volonté. Les horloges sont publiées.

L’autre facture

Le forfait bat le mesuré quand le travail est régulier.

Une API au jeton est le bon outil pour les pics et pour la qualité des modèles de pointe — nous le dirons clairement plutôt que de vendre contre elle. La machine gagne quand le volume est constant, quand les données doivent rester sous votre garde, ou quand un modèle ouvert ajusté fait déjà le travail : son chiffre se lit de la même façon à dix fois le trafic, et la croissance cesse d’être un poste de facturation. Chaque chiffre mensuel de ce domaine, rassemblé dans un seul tableau, est la page des tarifs ; pourquoi les machines plus anciennes ici restent bon marché est la page de la valeur.

Demandé avant d’acheter

Dix réponses directes.

Puis-je servir un LLM sans carte graphique ?

Oui, dans une limite qui mérite d’être énoncée : un modèle quantifié de 7–8B sur la baie CPU sert honnêtement l’assistant d’une équipe, la récupération et les embeddings. Il ne servira pas un 70B à mille utilisateurs — c’est le travail de la baie GPU, et cette page le dit ici plutôt que de vous laisser le découvrir.

De quoi un modèle 70B a-t-il besoin ?

Environ 38 Go de mémoire de carte en 4 bits, que la carte de 48 Go porte ; 70 Go en 8 bits, ce qui prend la carte de 80 Go ; 140 Go en pleine précision, ce qui est plus qu’une carte et devient la question de la page multi-cartes.

Quels modèles ai-je le droit d’exécuter ?

Tout ce dont vous pouvez détenir les poids : les familles Llama, Qwen, Mistral, Gemma et DeepSeek et leurs ajustements. La licence se trouve entre vous et l’éditeur — la machine ne la lit pas et nous ne la contrôlons pas.

Mes données servent-elles à entraîner quoi que ce soit ?

Non. Rien sur le chemin ne les lit. Un locataire par machine, votre système d’exploitation, vos disques ; nous exploitons le matériel et le réseau en dessous, jamais la charge de travail au-dessus.

Pourquoi ne pas rester sur une API au jeton ?

Restez tant que votre trafic est en pics ou que le modèle de pointe est le produit. Passez à la machine quand le volume est régulier, que les données sont sensibles, ou qu’un modèle ouvert ajusté fait déjà le travail — et les deux se mélangent bien : beaucoup de piles acheminent les cinq pour cent les plus difficiles vers une API et servent le reste elles-mêmes.

Louer au mois, ou acheter le matériel ?

Acheter gagne après un an ou deux d’utilisation constante, plus quelqu’un payé pour l’héberger, l’alimenter, le refroidir et le réparer. Louer gagne le premier jour, à chaque mise à niveau, et à trois heures du matin quand une pièce meurt selon notre horloge écrite au lieu de la vôtre.

Quelle est la rapidité de livraison ?

Environ trente minutes pour une machine en stock, quatre à vingt-quatre heures pour une construction, plus longtemps quand une pièce est achetée — l’échelle est imprimée au moment de la commande, et les serveurs instantanés listent ce qui est en rack en ce moment.

Y a-t-il un essai ?

Pas de comptes d’essai. Dans les trois jours calendaires suivant la première activation, la politique de remboursement s’applique telle qu’écrite, et les paiements en cryptomonnaie sont remboursés en avoir. L’essai honnête le moins cher est un mois sur la baie CPU.

Les pièces commandées spécialement ont-elles des conditions différentes ?

Parfois. Une pièce achetée pour votre commande peut comporter une part initiale ou une durée minimale — et on vous le dit exactement avant de payer, jamais après. Les machines en stock portent la valeur par défaut : un mois, sans engagement.

Que se passe-t-il quand je dépasse la baie ?

La baie suivante, généralement dans le même bâtiment : une machine CPU remet ses poids à une machine GPU par le câble local, ou la carte du châssis que vous détenez déjà est remplacée et la facture évolue exactement de la différence.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt