Hosting LLM su server dedicati · Server Room · dal 2004

Un rack. Ogni modo per eseguire un modello.

I modelli linguistici non hanno bisogno di un solo tipo di macchina — hanno bisogno di quella giusta. Un gateway per agenti vuole un box economico che non dorme mai. L’assistente di un team esegue un Llama o Qwen quantizzato direttamente dalla memoria di sistema. Un 70B vuole memoria della scheda, e una fattura per token vuole la tua crescita. Scegli il bay: l’intera macchina è tua per mese, niente condivisione, niente misurazione, e la cifra che vedi è quella del checkout.

Scegli il tuo bay Dimensiona il tuo modello

  • Tenant singolo
  • Traffico senza limiti
  • Cinque città
  • Mensile, senza contratto

Letto dal catalogo ordini mentre questa pagina veniva servita. Clicca un bay.

Contato, non composto

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Ogni cifra qui sopra è derivata su questa richiesta dalle righe che il configuratore fattura, quindi nulla può diventare obsoleto tra un deploy e l’altro. Cosa è montato e alimentato mentre leggi è un’altra questione, e server istantanei se ne occupa — questa pagina si legge uguale con uno scaffale pieno o vuoto.

Il catalogo, per carico di lavoro

Quattro bay, prezzo completo.

Non quattro livelli di un prodotto — quattro macchine diverse per quattro lavori diversi, ogni cifra è il totale mensile dell’esatta configurazione stampata accanto. Non arriva nulla dopo: la porta, l’indirizzo e la console out-of-band sono già nel numero.

inferenza cpu

Un assistente privato per tutto il team

Un Llama, Qwen o Mistral quantizzato da 7–8B serve chat, retrieval ed embedding direttamente da 128 GB di memoria di sistema — il lavoro per cui llama.cpp e Ollama sono stati scritti. Nessuna scheda grafica, nessun prezzo da scheda grafica, e il vector store vive sullo stesso metallo del modello. Costruito su ordine in 4–24 ore, in tutte e cinque le città.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

agenti

Il box dell’agente

Gateway come OpenClaw passano la vita a chiamare modelli altrove e ad aspettare risposte. Hanno bisogno di uptime e di una porta, non di acceleratori — e la macchina onesta più economica per quel compito è questa.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

serving gpu · fine-tuning

Memoria della scheda per i grandi

Da 13B a velocità piena a 70B a 4-bit, il lavoro si sposta nella memoria della scheda, e vLLM trasforma la scheda in un endpoint batched compatibile con OpenAI che il tuo codice client già parla. La cifra sotto è una macchina completa con l’acceleratore da 48 GB già montato; la riga sotto è ciò che la sola scheda contribuisce, e la build da 80 GB accanto è lo stesso chassis che porta un 70B a 8-bit.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Quale scheda, tra tutte quelle che montiamo, è una pagina a sé — ognuna prezzata come riga propria accanto alla sua macchina, sulla pagina GPU.

dev box

DGX Spark, senza la scrivania

La piccola macchina GB10 di NVIDIA, montata a New York con durata annuale — il box che i framework prendono di mira per primi, senza l’importazione e il rumore della ventola accanto alla sedia.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

custodia

UE o USA, scegli tu

Amsterdam e Bucarest tengono il lavoro europeo in Europa; New York, Miami e San Francisco tengono il lavoro americano a casa. I cinque edifici →

Più grande di un bay?

Una seconda scheda nello chassis, o una seconda macchina accanto, è una questione diversa con una pagina propria — lane, porte e posizionamento, quotati con il componente nominato. Oppure salta avanti: e la risposta nomina lo chassis e i tempi di consegna.

L’aritmetica

Dimensiona il modello. La macchina segue.

I pesi sono parametri per byte per parametro — aritmetica, non benchmarking, e la stessa tabella con fonti che stampa la pagina GPU. Scegli una dimensione e una precisione; la risposta nomina la memoria che i pesi richiedono, il bay più economico che li porta, e il margine rimasto come rapporto semplice, perché un modello che entra a malapena non serve.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Solo i pesi — il runtime e la finestra di contesto vivono nel margine, ed è per questo che nessuna risposta sopra riempie la memoria fino all’orlo. Le licenze sono tra te e l’editore del modello; la macchina non limita cosa carichi.

Già in ogni cifra

Cosa include ogni bay.

Un tenantLa macchina fisica è solo tua. Nessun hypervisor sotto, nessuna scheda condivisa, nessun time-slicing, nessun job batch del vicino sul tuo silicio.
Root e la consoleUn OS pulito a tua scelta, root sul metallo, e una console out-of-band (iLO, iDRAC, IPMI) che risponde ancora quando l’OS non lo fa.
Una porta senza limitiNiente contato in nessuna direzione. Dataset in entrata, checkpoint in uscita, utenti serviti — nessuna riga di egress esiste su alcuna fattura.
Il tuo stack, le tue versioniOllama, llama.cpp, vLLM — li installi e li blocchi tu, e nulla li sposta dopo. Vuoi il driver GPU già in posizione prima della consegna? Metti la versione esatta sull’ordine.
CustodiaPrompt, contesto e dati di fine-tuning si muovono tra i tuoi utenti e la tua macchina, senza terze parti nel percorso a registrarli, addestrarsi su di essi o riscriverne i termini.
Persone, tutto il giornoChat, mail e telefono, ogni ora dell’anno — e un componente guasto viene sostituito su un orologio scritto, non su una promessa di buona volontà. Gli orologi sono pubblicati.

L’altra fattura

Il flat batte il misurato quando il lavoro è costante.

Un’API per token è lo strumento giusto per i picchi e per la qualità dei modelli di frontiera — lo diremo chiaramente invece di vendere contro. La macchina vince quando il volume è costante, quando i dati devono restare in tua custodia, o quando un modello aperto ottimizzato fa già il lavoro: la sua cifra si legge uguale a dieci volte il traffico, e la crescita smette di essere una voce di riga. Ogni cifra mensile su questo dominio, raccolta in una tabella, è la pagina dei prezzi; perché le macchine più vecchie qui restano economiche è la pagina del valore.

Chiesto prima di comprare

Dieci risposte dirette.

Posso servire un LLM senza scheda grafica?

Sì, entro un confine che vale la pena dichiarare: un modello quantizzato da 7–8B sul bay CPU serve onestamente l’assistente di un team, retrieval ed embedding. Non servirà un 70B a mille utenti — quello è il lavoro del bay GPU, e questa pagina lo dice qui invece di lasciartelo scoprire.

Cosa serve a un modello 70B?

Circa 38 GB di memoria della scheda a 4-bit, che la scheda da 48 GB porta; 70 GB a 8-bit, che richiede la scheda da 80 GB; 140 GB a piena precisione, che è più di una scheda e diventa la domanda della pagina multi-scheda.

Quali modelli posso eseguire?

Qualsiasi cosa i cui pesi puoi detenere: le famiglie Llama, Qwen, Mistral, Gemma e DeepSeek e i loro fine-tune. La licenza sta tra te e l’editore — la macchina non la legge e noi non la limitiamo.

I miei dati vengono usati per addestrare qualcosa?

No. Nulla nel percorso li legge. Un tenant per macchina, il tuo sistema operativo, i tuoi dischi; noi gestiamo l’hardware e la rete sotto, mai il carico di lavoro sopra.

Perché non restare su un’API per token?

Resta finché il tuo traffico è a raffiche o il modello di frontiera è il prodotto. Spostati quando il volume è costante, i dati sono sensibili, o un modello aperto ottimizzato fa già il lavoro — e i due si mescolano bene: molti stack instradano il cinque percento più difficile a un’API e servono il resto da soli.

Affitto mensile, o compro l’hardware?

Comprare vince dopo un anno o due di uso costante, più qualcuno pagato per ospitarlo, alimentarlo, raffreddarlo e ripararlo. Affittare vince dal primo giorno, a ogni aggiornamento, e alle tre del mattino quando un componente muore sul nostro orologio scritto invece che sul tuo.

Quanto è veloce la consegna?

Circa trenta minuti per una macchina a scaffale, da quattro a ventiquattro ore per una build, di più quando un componente viene acquistato — la scala è stampata al momento dell’ordine, e server istantanei elenca cosa è montato adesso.

C’è una prova?

Nessun account di prova. Entro tre giorni di calendario dalla prima attivazione si applica la politica di rimborso come scritta, e i pagamenti in criptovaluta vengono rimborsati come credito del negozio. La prova onesta più economica è un mese sul bay CPU.

I componenti su ordine speciale hanno termini diversi?

A volte. Un componente acquistato per il tuo ordine può comportare una quota anticipata o una durata minima — e ti viene detto esattamente cosa prima di pagare, mai dopo. Le macchine a scaffale hanno il default: un mese, nessun contratto.

Cosa succede quando supero il bay?

Il bay successivo, di solito nello stesso edificio: una macchina CPU passa i suoi pesi a una macchina GPU sul cavo locale, oppure la scheda nello chassis che già tieni viene sostituita e la fattura si muove esattamente della differenza.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt