Özel sunucularda LLM barındırma · Server Room · kuruluş 2004

Tek raf. Model çalıştırmanın her yolu.

Dil modelleri tek tip bir makineye değil — doğru olana ihtiyaç duyar. Bir aracı ağ geçidi, hiç uyumayan ucuz bir kutu ister. Bir ekibin asistanı, nicemlenmiş bir Llama veya Qwen'i doğrudan sistem belleğinden çalıştırır. Bir 70B kart belleği ister, token başına faturalandırma da büyümenizi ister. Bölmeyi seçin: makinenin tamamı aylık olarak sizindir, paylaşımsız, ölçümsüz ve üzerindeki rakam doğrudan ödeme sayfasının kendisidir.

Bölmenizi seçin Modelinizi boyutlandırın

  • Tek kiracı
  • Ölçümsüz trafik
  • Beş şehir
  • Aylık, sözleşmesiz

Bu sayfa sunulurken sipariş kataloğundan okunur. Bir bölmeye tıklayın.

Sayıldı, yazılmadı

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Yukarıdaki her rakam, bu istek üzerine yapılandırıcının faturalandırdığı satırlardan türetilir; böylece hiçbiri dağıtımlar arasında bayatlayamaz. Bunu okurken rafta ve güçte olan şey farklı bir sorudur ve anında sunucular sayfasının konusudur — bu sayfa dolu bir rafta da boş bir rafta da aynı şeyi okur.

İş yüküne göre katalog

Dört bölme, eksiksiz fiyatlandırılmış.

Tek bir ürünün dört kademesi değil — dört farklı iş için dört farklı makine; her rakam, yanında yazılı tam yapılandırmanın aylık toplamıdır. Sonradan hiçbir şey gelmez: port, adres ve bant dışı konsol zaten rakamın içindedir.

cpu çıkarımı

Tüm ekip için özel bir asistan

Nicemlenmiş 7–8B'lik bir Llama, Qwen veya Mistral; sohbet, getirme ve gömme işlerini doğrudan 128 GB sistem belleğinden sunar — llama.cpp ve Ollama'nın yazıldığı iş tam olarak budur. Grafik kartı yok, grafik kartının fiyatı yok ve vektör deposu modelle aynı donanım üzerinde yaşar. Beş şehrin tamamında 4–24 saat içinde sipariş üzerine kurulur.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

aracılar

Aracının kutusu

OpenClaw gibi ağ geçitleri ömürlerini başka yerlerdeki modelleri çağırıp yanıt bekleyerek geçirir. Hızlandırıcıya değil, çalışma süresine ve bir porta ihtiyaç duyarlar — ve bu görev için en ucuz dürüst makine budur.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

gpu sunumu · ince ayar

Büyükler için kart belleği

Hızlı 13B'den 4-bit 70B'ye kadar iş kart belleğine taşınır ve vLLM kartı, istemci kodunuzun zaten konuştuğu toplu, OpenAI uyumlu bir uç noktaya dönüştürür. Aşağıdaki rakam, 48 GB hızlandırıcısı zaten takılı eksiksiz bir makinedir; altındaki satır kartın tek başına kattığı değerdir ve yanındaki 80 GB'lık yapı, 8-bit'te bir 70B taşıyan aynı kasadır.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Taktığımız her karttan hangisinin seçileceği kendi sayfasının konusudur — her biri makinesinin yanında kendi satırı olarak fiyatlandırılır, GPU sayfasında.

geliştirme kutusu

DGX Spark, masasız

NVIDIA’nın küçük GB10 makinesi, New York'ta yıllık dönemle rafta — çerçevelerin önce hedeflediği kutu; ithalat ve sandalyenizin yanındaki fan gürültüsü hariç.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

saklama

AB veya ABD, sizin kararınız

Amsterdam ve Bükreş Avrupa işlerini Avrupa'da tutar; New York, Miami ve San Francisco Amerikan işlerini evinde tutar. Beş bina →

Tek bölmeden daha büyük mü?

Kasada ikinci bir kart veya yanında ikinci bir makine, kendi sayfası olan farklı bir sorudur — hatlar, portlar ve yerleşim, parça adıyla birlikte fiyatlandırılır. Ya da ileri atlayın: ve yanıt kasayı ve teslim süresini adlandırır.

Aritmetik

Modeli boyutlandırın. Makine onu izler.

Ağırlıklar; parametre sayısı çarpı parametre başına bayttır — kıyaslama değil aritmetiktir ve GPU sayfasının bastığı aynı kaynaklı tablodur. Bir boyut ve bir hassasiyet seçin; yanıt, ağırlıkların ihtiyaç duyduğu belleği, onları taşıyan en ucuz bölmeyi ve kalan boşluğu düz bir oran olarak adlandırır; çünkü zar zor sığan bir model hizmet vermez.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Yalnızca ağırlıklar — çalışma zamanı ve bağlam penceresi boşlukta yaşar; bu yüzden yukarıdaki hiçbir yanıt belleğini ağzına kadar doldurmaz. Lisanslar sizinle modelin yayıncısı arasındadır; makine ne yüklediğinize kapı koymaz.

Zaten her rakamın içinde

Her bölmenin içerdikleri.

Tek kiracıFiziksel makine yalnızca sizindir. Altında hipervizör yok, paylaşılan kart yok, zaman dilimleme yok, silikonunuzda komşunun toplu işi yok.
Root ve konsolSeçtiğiniz temiz bir işletim sistemi, donanım üzerinde root ve işletim sistemi yanıt vermediğinde bile yanıt veren bir bant dışı konsol (iLO, iDRAC, IPMI).
Ölçümsüz bir portHer iki yönde de hiçbir şey sayılmaz. Veri kümeleri içeri, kontrol noktaları dışarı, kullanıcılara hizmet — hiçbir faturada çıkış satırı yoktur.
Sizin yığınınız, sizin sürümlerinizOllama, llama.cpp, vLLM — kurar ve sabitlersiniz; sonrasında hiçbir şey onları taşımaz. Devir teslimden önce GPU sürücüsünün yerinde olmasını mı istiyorsunuz? Siparişe tam sürümü yazın.
Saklamaİstemler, bağlam ve ince ayar verileri kullanıcılarınızla makineniz arasında hareket eder; yolda onları günlüğe kaydedecek, üzerinde eğitecek veya şartlarını onlara göre yeniden yazacak üçüncü bir taraf yoktur.
İnsanlar, günün her saatiSohbet, posta ve telefon, yılın her saati — ve ölü bir parça iyi niyet vaadiyle değil, yazılı bir saatle değiştirilir. Saatler yayınlanmıştır.

Diğer fatura

İş sabitken sabit ücret, ölçümlüyü yener.

Token başına bir API; ani artışlar ve öncü model kalitesi için doğru araçtır — buna karşı satış yapmak yerine bunu açıkça söyleriz. Makine; hacim sabitken, veriler sizin saklamanızda kalmalıyken veya ayarlanmış açık bir model zaten işi yapıyorken kazanır: rakamı on kat trafikte aynı okunur ve büyüme bir satır kalemi olmaktan çıkar. Bu alan adındaki her aylık rakam, tek bir tabloda toplanmış olarak fiyatlandırma sayfasıdır; buradaki eski makinelerin neden ucuz kaldığı ise değer sayfasıdır.

Satın almadan önce soruldu

On düz yanıt.

Grafik kartı olmadan bir LLM sunabilir miyim?

Evet, belirtmeye değer bir sınır içinde: CPU bölmesindeki nicemlenmiş 7–8B'lik bir model, bir ekibin asistanını, getirme ve gömme işlerini dürüstçe sunar. Bin kullanıcıya bir 70B sunmaz — bu GPU bölmesinin işidir ve bu sayfa bunu keşfetmenize izin vermek yerine burada söyler.

Bir 70B modelin neye ihtiyacı var?

4-bit'te yaklaşık 38 GB kart belleği; bunu 48 GB kart taşır; 8-bit'te 70 GB, bu da 80 GB kartı gerektirir; tam hassasiyette 140 GB, bu birden fazla karttır ve çok kartlı sayfanın sorusu olur.

Hangi modelleri çalıştırmama izin var?

Ağırlıklarını elinizde tutabileceğiniz her şey: Llama, Qwen, Mistral, Gemma ve DeepSeek aileleri ve bunların ince ayarları. Lisans sizinle yayıncı arasındadır — makine onu okumaz ve biz ona kapı koymayız.

Verilerim herhangi bir şeyi eğitmek için kullanılıyor mu?

Hayır. Yoldaki hiçbir şey onu okumaz. Makine başına tek kiracı, sizin işletim sisteminiz, sizin diskleriniz; biz alttaki donanımı ve ağı işletiriz, üstteki iş yükünü asla.

Neden token başına bir API'de kalmayayım?

Trafiğiniz ani veya öncü model ürünün kendisiyken kalın. Hacim sabitken, veriler hassasken veya ayarlanmış açık bir model zaten işi yapıyorken geçin — ve ikisi iyi karışır: pek çok yığın en zor yüzde beşi bir API'ye yönlendirir ve gerisini kendisi sunar.

Aylık kiralayayım mı, donanımı satın mı alayım?

Satın almak bir veya iki yıllık sürekli kullanımdan sonra kazanır; artı barındırması, güç vermesi, soğutması ve onarması için birine ödenen para. Kiralamak birinci günde, her yükseltmede ve bir parça sizin değil bizim yazılı saatimizde sabah üçte öldüğünde kazanır.

Teslimat ne kadar hızlı?

Raftaki bir makine için yaklaşık otuz dakika, bir kurulum için dört ila yirmi dört saat, bir parça satın alındığında daha uzun — merdiven sipariş noktasında yazdırılır ve anında sunucular şu anda rafta olanı listeler.

Deneme var mı?

Deneme hesabı yok. İlk etkinleştirmeden itibaren üç takvim günü içinde iade politikası yazıldığı gibi uygulanır ve kripto para ödemeleri mağaza kredisi olarak iade edilir. En ucuz dürüst deneme, CPU bölmesinde bir aydır.

Özel sipariş parçaları farklı koşullar mı taşır?

Bazen. Siparişiniz için satın alınan bir parça, ön ödeme payı veya asgari dönem taşıyabilir — ve ödemeden önce size tam olarak ne olduğu söylenir, asla sonra değil. Raftaki makineler varsayılanı taşır: bir ay, sözleşmesiz.

Bölmeyi aştığımda ne olur?

Sonraki bölme, genellikle aynı binada: bir CPU makinesi ağırlıklarını yerel hat üzerinden bir GPU makinesine devreder veya zaten elinizde tuttuğunuz kasadaki kart değiştirilir ve fatura tam olarak aradaki fark kadar hareket eder.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt