Găzduire LLM pe servere dedicate · Server Room · din 2004

Un singur rack. Toate modurile de a rula un model.

Modelele de limbaj nu au nevoie de un singur tip de mașină — au nevoie de cea potrivită. Un gateway de agenți vrea o cutie ieftină care nu doarme niciodată. Asistentul unei echipe rulează un Llama sau Qwen cuantizat direct din memoria de sistem. Un 70B vrea memorie de placă, iar o factură per token vrea creșterea ta. Alege locașul: întreaga mașină este a ta pe lună, nimic partajat, nimic contorizat, iar cifra de pe ea este chiar cea a casei de marcat.

Alege-ți locașul Dimensionează-ți modelul

  • Un singur chiriaș
  • Trafic nemăsurat
  • Cinci orașe
  • Lunar, fără contract

Citit din catalogul de comenzi în momentul servirii acestei pagini. Dă clic pe un locaș.

Numărate, nu compuse

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Fiecare cifră de mai sus este derivată la această cerere din rândurile pe care configuratorul le facturează, astfel încât nimic nu poate rămâne învechit între implementări. Ce este montat în rack și alimentat chiar acum este o altă întrebare, iar serverele instant o dețin — această pagină arată la fel pe un raft plin și pe unul gol.

Catalogul, pe tip de lucru

Patru locașuri, preț complet.

Nu patru niveluri ale unui singur produs — patru mașini diferite pentru patru sarcini diferite, fiecare cifră fiind totalul lunar al configurației exacte tipărite lângă ea. Nimic nu sosește mai târziu: portul, adresa și consola out-of-band sunt deja incluse în număr.

inferență cpu

Un asistent privat pentru întreaga echipă

Un Llama, Qwen sau Mistral cuantizat de 7–8B servește chat, recuperare și embeddings direct din 128 GB de memorie de sistem — sarcina pentru care au fost scrise llama.cpp și Ollama. Fără placă grafică, fără prețul plăcii grafice, iar depozitul vectorial trăiește pe același metal ca modelul. Construit la comandă în 4–24 de ore, în toate cele cinci orașe.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

agenți

Cutia agentului

Gateway-uri precum OpenClaw își petrec viața apelând modele din altă parte și așteptând răspunsuri. Au nevoie de uptime și de un port, nu de acceleratoare — iar cea mai ieftină mașină cinstită pentru această sarcină este aceasta.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

servire gpu · fine-tuning

Memorie de placă pentru cele mari

De la 13B la viteză până la 70B pe 4 biți, lucrul se mută în memoria plăcii, iar vLLM transformă placa într-un endpoint batch, compatibil OpenAI, pe care codul tău client îl vorbește deja. Cifra de mai jos este o mașină completă cu acceleratorul de 48 GB deja montat; linia de sub ea este ceea ce contribuie doar placa, iar configurația de 80 GB de lângă ea este același șasiu care poartă un 70B pe 8 biți.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Care placă, dintre toate pe care le montăm, este o pagină de sine stătătoare — fiecare cu prețul ei ca linie proprie lângă mașina ei, pe pagina GPU.

cutie de dezvoltare

DGX Spark, fără birou

Mica mașină GB10 de la NVIDIA, montată în rack în New York pe un termen anual — cutia pe care framework-urile o vizează prima, minus importul și zgomotul ventilatorului de lângă scaunul tău.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

custodie

UE sau SUA, alegerea ta

Amsterdam și București țin munca europeană în Europa; New York, Miami și San Francisco țin munca americană acasă. Cele cinci clădiri →

Mai mare decât un locaș?

O a doua placă în șasiu, sau o a doua mașină lângă el, este o altă întrebare cu propria pagină — benzi, porturi și amplasare, cotate cu piesa numită. Sau sari înainte: și răspunsul numește șasiul și timpul de livrare.

Aritmetica

Dimensionează modelul. Mașina urmează.

Greutățile sunt parametri ori octeți per parametru — aritmetică, nu benchmarking, și același tabel cu surse pe care îl tipărește pagina GPU. Alege o dimensiune și o precizie; răspunsul numește memoria de care au nevoie greutățile, cel mai ieftin locaș care le poartă și spațiul rămas ca raport simplu, pentru că un model care abia încape nu servește.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Doar greutățile — runtime-ul și fereastra de context trăiesc în spațiul rămas, motiv pentru care niciun răspuns de mai sus nu își umple memoria până la refuz. Licențele sunt între tine și editorul modelului; mașina nu restricționează ce încarci.

Deja în fiecare cifră

Ce include fiecare locaș.

Un singur chiriașMașina fizică este doar a ta. Fără hypervisor dedesubt, fără placă partajată, fără time-slicing, fără jobul batch al vecinului pe siliciul tău.
Root și consolaUn sistem de operare curat, la alegerea ta, root pe metal și o consolă out-of-band (iLO, iDRAC, IPMI) care răspunde în continuare când sistemul de operare nu o face.
Un port nemăsuratNimic contorizat în nicio direcție. Seturi de date înăuntru, checkpoint-uri afară, utilizatori serviți — nicio linie de egress nu există pe nicio factură.
Stack-ul tău, versiunile taleOllama, llama.cpp, vLLM — le instalezi și le fixezi tu, iar nimic nu le mută după aceea. Vrei driverul GPU instalat înainte de predare? Pune versiunea exactă pe comandă.
CustodiePrompturile, contextul și datele de fine-tuning se deplasează între utilizatorii tăi și mașina ta, fără nicio terță parte în cale care să le înregistreze, să se antreneze pe ele sau să își rescrie termenii în jurul lor.
Oameni, non-stopChat, e-mail și telefon, în fiecare oră a anului — iar o piesă moartă este înlocuită pe un ceas scris, nu pe o promisiune de bunăvoință. Ceasurile sunt publicate.

Cealaltă factură

Tariful fix bate contorizarea când munca este constantă.

Un API per token este instrumentul potrivit pentru vârfuri și pentru calitatea modelelor de frontieră — o spunem deschis, nu vindem împotriva lui. Mașina câștigă când volumul este constant, când datele trebuie să rămână în custodia ta sau când un model deschis reglat își face deja treaba: cifra ei arată la fel la un trafic de zece ori mai mare, iar creșterea încetează să mai fie un element de linie. Fiecare cifră lunară de pe acest domeniu, adunată într-un singur tabel, este pagina de prețuri; de ce mașinile mai vechi de aici rămân ieftine este pagina de valoare.

Întrebate înainte de cumpărare

Zece răspunsuri directe.

Pot servi un LLM fără placă grafică?

Da, într-o limită care merită spusă: un model cuantizat de 7–8B pe locașul CPU servește cinstit asistentul unei echipe, recuperarea și embeddings. Nu va servi un 70B pentru o mie de utilizatori — aceasta este treaba locașului GPU, iar această pagină o spune aici în loc să te lase să o descoperi singur.

De ce are nevoie un model de 70B?

Aproximativ 38 GB de memorie de placă la 4 biți, pe care placa de 48 GB o poartă; 70 GB la 8 biți, ceea ce necesită placa de 80 GB; 140 GB la precizie completă, ceea ce înseamnă mai mult de o placă și devine întrebarea paginii multi-placă.

Ce modele am voie să rulez?

Orice ale căror greutăți ai dreptul să le deții: familiile Llama, Qwen, Mistral, Gemma și DeepSeek și fine-tune-urile lor. Licența stă între tine și editor — mașina nu o citește și noi nu o restricționăm.

Sunt datele mele folosite pentru a antrena ceva?

Nu. Nimic din cale nu le citește. Un singur chiriaș pe mașină, sistemul tău de operare, discurile tale; noi operăm hardware-ul și rețeaua de dedesubt, niciodată sarcina de deasupra.

De ce să nu rămân pe un API per token?

Rămâi cât timp traficul tău este în rafale sau modelul de frontieră este produsul. Mută-te când volumul este constant, datele sunt sensibile sau un model deschis reglat își face deja treaba — iar cele două se combină bine: o mulțime de stack-uri direcționează cei mai grei cinci la sută către un API și servesc restul singure.

Închiriez lunar sau cumpăr hardware-ul?

Cumpărarea câștigă după un an sau doi de utilizare constantă, plus cineva plătit să îl găzduiască, să îl alimenteze, să îl răcească și să îl repare. Închirierea câștigă din prima zi, la fiecare upgrade și la trei dimineața când o piesă moare pe ceasul nostru scris, nu pe al tău.

Cât de rapidă este livrarea?

Aproximativ treizeci de minute pentru o mașină de pe raft, patru până la douăzeci și patru de ore pentru o configurație, mai mult când o piesă este cumpărată la cerere — scara este tipărită la punctul de comandă, iar serverele instant listează ce este montat în rack chiar acum.

Există o perioadă de probă?

Fără conturi de probă. În termen de trei zile calendaristice de la prima activare, politica de rambursare se aplică așa cum este scrisă, iar plățile în criptomonedă se rambursează ca credit de magazin. Cea mai ieftină probă cinstită este o lună pe locașul CPU.

Piesele la comandă specială au termeni diferiți?

Uneori. O piesă cumpărată la cerere pentru comanda ta poate avea o porțiune în avans sau un termen minim — și ți se spune exact ce înainte să plătești, niciodată după. Mașinile de pe raft au implicit: o lună, fără contract.

Ce se întâmplă când depășesc locașul?

Următorul locaș, de obicei în aceeași clădire: o mașină CPU își predă greutățile unei mașini GPU prin firul local, sau placa din șasiul pe care îl ai deja este schimbată, iar factura se modifică exact cu diferența.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt