Găzduire LLM pe servere dedicate · Server Room · din 2004

Un singur rack. Toate modurile de a rula un model.

Modelele de limbaj nu au nevoie de un singur tip de mașină — au nevoie de cea potrivită. Un gateway de agenți vrea o cutie ieftină care nu doarme niciodată. Asistentul unei echipe rulează un Llama sau Qwen cuantizat direct din memoria de sistem. Un 70B vrea memorie de placă, iar o factură per token vrea creșterea ta. Alege locașul: întreaga mașină este a ta pe lună, nimic partajat, nimic contorizat, iar cifra de pe ea este chiar cea a comenzii.

Alege-ți locașul Dimensionează-ți modelul

  • Un singur chiriaș
  • Trafic nemăsurat
  • Cinci orașe
  • Lunar, fără contract

Citit din catalogul de comenzi în momentul servirii acestei pagini. Apasă pe un locaș.

Numărate, nu compuse

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Fiecare cifră de mai sus este derivată la această cerere din rândurile pe care configuratorul le facturează, astfel încât nimic nu poate rămâne învechit între implementări. Ce este montat în rack și alimentat chiar acum este o altă întrebare, iar serverele instant o dețin — această pagină arată la fel pe un raft plin și pe unul gol.

Catalogul, pe tip de lucru

Patru locașuri, prețuite complet.

Nu patru niveluri ale unui singur produs — patru mașini diferite pentru patru sarcini diferite, fiecare cifră fiind totalul lunar al configurației exacte tipărite lângă ea. Nimic nu sosește mai târziu: portul, adresa și consola out-of-band sunt deja incluse în număr.

inferență pe cpu

Un asistent privat pentru întreaga echipă

Un Llama, Qwen sau Mistral cuantizat de 7–8B servește chat, regăsire și embeddings direct din 128 GB de memorie de sistem — sarcina pentru care au fost scrise llama.cpp și Ollama. Fără placă grafică, fără prețul plăcii grafice, iar depozitul vectorial trăiește pe același metal ca modelul. Construit la comandă în 4–24 de ore, în toate cele cinci orașe.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

agenți

Cutia agentului

Gateway-uri precum OpenClaw își petrec viața apelând modele din altă parte și așteptând răspunsuri. Au nevoie de uptime și de un port, nu de acceleratoare — iar cea mai ieftină mașină cinstită pentru această sarcină este aceasta.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

servire pe gpu · fine-tuning

Memorie de placă pentru cele mari

De la 13B la viteză până la 70B pe 4 biți, lucrul se mută în memoria plăcii, iar vLLM transformă placa într-un endpoint batch, compatibil OpenAI, pe care codul tău client îl vorbește deja. Cifra de mai jos este o mașină completă cu acceleratorul de 48 GB deja montat; linia de sub ea este ceea ce contribuie doar placa, iar configurația de 80 GB de lângă ea este același șasiu care duce un 70B pe 8 biți.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Care placă, dintre toate pe care le montăm, este o pagină de sine stătătoare — fiecare prețuită ca linie proprie lângă mașina ei, pe pagina GPU.

cutie de dezvoltare

DGX Spark, fără birou

Mica mașină GB10 de la NVIDIA, montată în rack în New York pe un termen anual — cutia pe care framework-urile o vizează prima, fără import și fără zgomotul ventilatorului de lângă scaunul tău.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

custodie

UE sau SUA, alegerea ta

Amsterdam și București țin munca europeană în Europa; New York, Miami și San Francisco țin munca americană acasă. Cele cinci clădiri →

Mai mare decât un singur locaș?

O a doua placă în șasiu, sau o a doua mașină lângă el, este o altă întrebare cu propria pagină — benzi, porturi și amplasare, cotate cu piesa numită. Sau sari înainte: și răspunsul numește șasiul și timpul de livrare.

Aritmetica

Dimensionează modelul. Mașina urmează.

Greutățile sunt parametri ori octeți per parametru — aritmetică, nu benchmarking, și același tabel sursă pe care îl tipărește pagina GPU. Alege o dimensiune și o precizie; răspunsul numește memoria de care au nevoie greutățile, cel mai ieftin locaș care le duce și spațiul rămas ca raport simplu, pentru că un model care abia încape nu servește.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Doar greutățile — runtime-ul și fereastra de context trăiesc în spațiul rămas, motiv pentru care niciun răspuns de mai sus nu își umple memoria până la refuz. Un fișier așa cum este livrat rulează mai greu decât aritmetica, pentru că formatele comune pe 4 biți păstrează unii tensori la precizie mai mare: Llama 3.1 70B implicit pe 4 biți al lui Ollama este o descărcare de 43 GB, nu 38 GB, așa că dimensionează din fișierul pe care îl vei încărca. Licențele sunt între tine și editorul modelului; mașina nu restricționează ce încarci.

Deja în fiecare cifră

Ce include fiecare locaș.

Un singur chiriașMașina fizică este doar a ta. Fără hypervisor dedesubt, fără placă partajată, fără time-slicing, fără jobul batch al vecinului pe siliciul tău.
Root și consolaUn sistem de operare curat la alegerea ta, root pe metal și o consolă out-of-band (iLO, iDRAC, IPMI) care răspunde în continuare când sistemul de operare nu o face.
Un port nemăsuratNimic contorizat în nicio direcție. Seturi de date înăuntru, checkpoint-uri afară, utilizatori serviți — nu există nicio linie de egress pe nicio factură.
Stack-ul tău, versiunile taleOllama, llama.cpp, vLLM — tu le instalezi și le fixezi, iar nimic nu le mută după aceea. Vrei driverul GPU instalat înainte de predare? Pune versiunea exactă pe comandă.
CustodiePrompturile, contextul și datele de fine-tuning se deplasează între utilizatorii tăi și mașina ta, fără nicio terță parte în cale care să le logheze, să se antreneze pe ele sau să își rescrie termenii în jurul lor.
Oameni, non-stopChat, e-mail și telefon, în fiecare oră a anului — iar o piesă moartă este înlocuită pe un ceas scris, nu pe o promisiune de bunăvoință. Ceasurile sunt publicate.

Cealaltă factură

Tariful fix bate contorizarea când munca este constantă.

Un API per token este instrumentul potrivit pentru vârfuri și pentru calitatea modelelor de frontieră — o vom spune deschis, nu vom vinde împotriva lui. Mașina câștigă când volumul este constant, când datele trebuie să rămână în custodia ta sau când un model deschis reglat face deja treaba: cifra ei arată la fel la un trafic de zece ori mai mare, iar creșterea încetează să mai fie un element de linie. Fiecare cifră lunară de pe acest domeniu, adunată într-un singur tabel, este pagina de prețuri; de ce mașinile mai vechi de aici rămân ieftine este pagina de valoare.

Întrebate înainte de cumpărare

Zece răspunsuri directe.

Pot servi un LLM fără placă grafică?

Da, într-o limită care merită spusă: un model cuantizat de 7–8B pe locașul CPU servește cinstit asistentul unei echipe, regăsirea și embeddings. Nu va servi un 70B la o mie de utilizatori — aceasta este treaba locașului GPU, iar această pagină o spune aici în loc să te lase să o descoperi singur.

De ce are nevoie un model de 70B?

Aproximativ 38 GB de memorie de placă pe 4 biți, pe care îi duce placa de 48 GB; 70 GB pe 8 biți, ceea ce necesită placa de 80 GB; 140 GB la precizie completă, ceea ce înseamnă mai mult de o placă și devine întrebarea paginii multi-placă.

Ce modele am voie să rulez?

Orice ale căror greutăți le poți deține: familiile Llama, Qwen, Mistral, Gemma și DeepSeek și fine-tuning-urile lor. Licența stă între tine și editor — mașina nu o citește și noi nu o restricționăm.

Sunt folosite datele mele pentru a antrena ceva?

Nu. Nimic din cale nu le citește. Un singur chiriaș pe mașină, sistemul tău de operare, discurile tale; noi operăm hardware-ul și rețeaua de dedesubt, niciodată sarcina de deasupra.

De ce să nu rămân pe un API per token?

Rămâi cât timp traficul tău este în vârfuri sau modelul de frontieră este produsul. Mută-te când volumul este constant, datele sunt sensibile sau un model deschis reglat face deja treaba — iar cele două se amestecă bine: multe stack-uri rutează cele mai grele cinci procente către un API și servesc restul singure.

Închiriez lunar sau cumpăr hardware-ul?

Cumpărarea câștigă după un an sau doi de utilizare constantă, plus cineva plătit să îl găzduiască, alimenteze, răcească și repare. Închirierea câștigă din prima zi, la fiecare upgrade și la trei dimineața când o piesă moare pe ceasul nostru scris, nu pe al tău.

Cât de rapidă este livrarea?

Aproximativ treizeci de minute pentru o mașină de pe raft, patru până la douăzeci și patru de ore pentru o configurație, mai mult când o piesă este cumpărată la comandă — scara este tipărită la punctul de comandă, iar serverele instant listează ce este montat chiar acum.

Există o perioadă de probă?

Fără conturi de probă. În termen de trei zile calendaristice de la prima activare, politica de rambursare se aplică așa cum este scrisă, iar plățile în criptomonedă se rambursează ca credit de magazin. Cea mai ieftină probă cinstită este o lună pe locașul CPU.

Piesele comandate special au termeni diferiți?

Uneori. O piesă cumpărată la comandă pentru comanda ta poate avea o porțiune în avans sau un termen minim — și ți se spune exact ce înainte să plătești, niciodată după. Mașinile de pe raft au implicit: o lună, fără contract.

Ce se întâmplă când depășesc locașul?

Următorul locaș, de obicei în aceeași clădire: o mașină CPU își predă greutățile unei mașini GPU prin firul local, sau placa din șasiul pe care îl ai deja este schimbată și factura se modifică exact cu diferența.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt