Özel sunucularda LLM barındırma · Server Room · kuruluş 2004

Tek raf. Model çalıştırmanın her yolu.

Dil modelleri tek tip bir makineye değil — doğru olana ihtiyaç duyar. Bir aracı ağ geçidi, hiç uyumayan ucuz bir kutu ister. Bir ekibin asistanı, nicemlenmiş bir Llama veya Qwen'i doğrudan sistem belleğinden çalıştırır. Bir 70B kart belleği ister, token başına faturalanan bir iş de büyümenizi ister. Yuvayı seçin: makinenin tamamı aylık olarak sizindir, paylaşımsız, ölçümsüz ve üzerindeki rakam doğrudan ödeme sayfasının kendi rakamıdır.

Yuvanızı seçin Modelinizi boyutlandırın

  • Tek kiracı
  • Ölçümsüz trafik
  • Beş şehir
  • Aylık, sözleşmesiz

Bu sayfa sunulurken sipariş kataloğundan okunur. Bir yuvaya tıklayın.

Sayıldı, uydurulmadı

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Yukarıdaki her rakam, bu istek üzerine yapılandırıcının faturalandırdığı satırlardan türetilir; böylece hiçbiri dağıtımlar arasında bayatlayamaz. Bunu okurken rafta ve güçte olan şey ayrı bir sorudur ve anında sunucular sayfasının konusudur — bu sayfa dolu bir rafta da boş bir rafta da aynı şeyi okur.

İş yüküne göre katalog

Dört yuva, eksiksiz fiyatlandırılmış.

Tek bir ürünün dört kademesi değil — dört farklı iş için dört farklı makine; her rakam, yanında yazılı tam yapılandırmanın aylık toplamıdır. Sonradan hiçbir şey gelmez: port, adres ve bant dışı konsol zaten rakamın içindedir.

cpu çıkarımı

Tüm ekip için özel bir asistan

Nicemlenmiş 7–8B'lik bir Llama, Qwen veya Mistral; sohbeti, getirmeyi ve gömmeleri doğrudan 128 GB sistem belleğinden sunar — llama.cpp ve Ollama'nın yazıldığı iş tam olarak budur. Grafik kartı yok, grafik kartının fiyatı yok ve vektör deposu modelle aynı donanım üzerinde yaşar. Beş şehrin tamamında 4–24 saat içinde sipariş üzerine kurulur.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

aracılar

Aracının kutusu

OpenClaw gibi ağ geçitleri ömürlerini başka yerlerdeki modelleri çağırıp yanıt bekleyerek geçirir. Hızlandırıcıya değil, çalışma süresine ve bir porta ihtiyaç duyarlar — ve bu görev için en ucuz dürüst makine budur.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

gpu sunumu · ince ayar

Büyükler için kart belleği

Hızlı 13B'den 4-bit 70B'ye kadar iş kart belleğine taşınır ve vLLM kartı, istemci kodunuzun zaten konuştuğu toplu, OpenAI uyumlu bir uç noktaya dönüştürür. Aşağıdaki rakam, 48 GB hızlandırıcısı zaten takılı eksiksiz bir makinedir; altındaki satır kartın tek başına kattığı değerdir ve yanındaki 80 GB yapılandırma, 70B'yi 8-bit olarak taşıyan aynı kasadır.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Taktığımız her kart arasından hangisi, kendi sayfası olan bir konudur — her biri makinesinin yanında kendi satırı olarak fiyatlandırılır, GPU sayfasında.

geliştirme kutusu

DGX Spark, masasız

NVIDIA'nın küçük GB10 makinesi, New York'ta yıllık dönemle rafta — çerçevelerin önce hedeflediği kutu; ithalat derdi ve sandalyenizin yanındaki fan gürültüsü olmadan.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

saklama

AB veya ABD, sizin kararınız

Amsterdam ve Bükreş Avrupa işini Avrupa'da tutar; New York, Miami ve San Francisco Amerikan işini evinde tutar. Beş bina →

Bir yuvadan daha büyük mü?

Kasada ikinci bir kart veya yanında ikinci bir makine, kendi sayfası olan farklı bir sorudur — hatlar, portlar ve yerleşim, parça adıyla birlikte fiyatlandırılır. Ya da ileri atlayın: ve yanıt kasayı ve teslim süresini adlandırır.

Aritmetik

Modeli boyutlandırın. Makine onu izler.

Ağırlıklar; parametre sayısı çarpı parametre başına bayttır — kıyaslama değil aritmetiktir ve GPU sayfasının bastığı aynı kaynaklı tablodur. Bir boyut ve bir hassasiyet seçin; yanıt, ağırlıkların ihtiyaç duyduğu belleği, onları taşıyan en ucuz yuvayı ve kalan boşluğu düz bir oran olarak adlandırır, çünkü zar zor sığan bir model hizmet vermez.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Yalnızca ağırlıklar — çalışma zamanı ve bağlam penceresi boşlukta yaşar; bu yüzden yukarıdaki hiçbir yanıt belleğini ağzına kadar doldurmaz. Gönderilen bir dosya aritmetikten daha ağır çalışır, çünkü yaygın 4-bit biçimler bazı tensörleri daha yüksek hassasiyette tutar: Ollama'nın varsayılan 4-bit Llama 3.1 70B'si 38 GB değil 43 GB'lık bir indirmedir; bu yüzden yükleyeceğiniz dosyaya göre boyutlandırın. Lisanslar sizinle modelin yayıncısı arasındadır; makine ne yüklediğinize kapı koymaz.

Zaten her rakamın içinde

Her yuvanın içerdikleri.

Tek kiracıFiziksel makine yalnızca sizindir. Altında hipervizör yok, paylaşılan kart yok, zaman dilimleme yok, silikonunuzda komşunun toplu işi yok.
Root ve konsolSeçtiğiniz temiz bir işletim sistemi, donanım üzerinde root ve işletim sistemi yanıt vermediğinde bile yanıt veren bir bant dışı konsol (iLO, iDRAC, IPMI).
Ölçümsüz bir portHer iki yönde de hiçbir şey sayılmaz. Veri kümeleri içeri, kontrol noktaları dışarı, kullanıcılara hizmet — hiçbir faturada çıkış satırı yoktur.
Sizin yığınınız, sizin sürümlerinizOllama, llama.cpp, vLLM — kurar ve sabitlersiniz; sonrasında hiçbir şey onları değiştirmez. Teslimden önce GPU sürücüsünün yerinde olmasını mı istiyorsunuz? Siparişe tam sürümü yazın.
Saklamaİstemler, bağlam ve ince ayar verileri kullanıcılarınızla makineniz arasında hareket eder; yolda onları kaydedecek, üzerlerinde eğitecek veya koşullarını onların etrafında yeniden yazacak üçüncü bir taraf yoktur.
İnsanlar, günün her saatiSohbet, posta ve telefon, yılın her saati — ve ölü bir parça iyi niyet vaadiyle değil, yazılı bir saatle değiştirilir. Saatler yayınlanmıştır.

Diğer fatura

İş sabitken sabit ücret, ölçümlüyü yener.

Token başına API; ani artışlar ve öncü model kalitesi için doğru araçtır — bunu ona karşı satış yapmak yerine açıkça söyleyeceğiz. Makine; hacim sabitken, veriler sizin saklamanızda kalmalıyken veya ince ayarlı açık bir model zaten işi yapıyorken kazanır: rakamı on kat trafikte de aynı okunur ve büyüme bir satır kalemi olmaktan çıkar. Bu alan adındaki her aylık rakam, tek bir tabloda toplanmış olarak fiyatlandırma sayfasıdır; buradaki eski makinelerin neden ucuz kaldığı ise değer sayfasıdır.

Satın almadan önce soruldu

On net yanıt.

Grafik kartı olmadan bir LLM sunabilir miyim?

Evet, belirtmeye değer bir sınır içinde: CPU yuvasındaki nicemlenmiş 7–8B'lik bir model, bir ekibin asistanını, getirmeyi ve gömmeleri dürüstçe sunar. Bin kullanıcıya bir 70B sunmaz — bu GPU yuvasının işidir ve bu sayfa bunu keşfetmenize izin vermek yerine burada söyler.

Bir 70B modelin neye ihtiyacı var?

4-bit'te yaklaşık 38 GB kart belleği; bunu 48 GB kart taşır; 8-bit'te 70 GB, bu da 80 GB kartı gerektirir; tam hassasiyette 140 GB, bu birden fazla karttır ve çok kartlı sayfanın sorusu olur.

Hangi modelleri çalıştırmama izin var?

Ağırlıklarını elinizde tutabileceğiniz her şey: Llama, Qwen, Mistral, Gemma ve DeepSeek aileleri ve bunların ince ayarları. Lisans sizinle yayıncı arasındadır — makine onu okumaz ve biz ona kapı koymayız.

Verilerim herhangi bir şeyi eğitmek için kullanılıyor mu?

Hayır. Yoldaki hiçbir şey onu okumaz. Makine başına tek kiracı, sizin işletim sisteminiz, sizin diskleriniz; biz alttaki donanımı ve ağı işletiriz, üstteki iş yükünü asla.

Neden token başına API'de kalmayayım?

Trafiğiniz ani artışlıyken veya öncü model ürünün kendisiyken kalın. Hacim sabitken, veriler hassasken veya ince ayarlı açık bir model zaten işi yapıyorken geçin — ve ikisi iyi karışır: pek çok yığın en zor yüzde beşi bir API'ye yönlendirir ve gerisini kendisi sunar.

Aylık kiralayayım mı, donanımı mı satın alayım?

Satın almak bir veya iki yıllık sürekli kullanımdan sonra kazanır; artı barındırması, güç vermesi, soğutması ve onarması için birine ödeme yapılır. Kiralamak birinci günde, her yükseltmede ve sabahın üçünde bir parça sizin değil bizim yazılı saatimizde öldüğünde kazanır.

Teslimat ne kadar hızlı?

Raftaki bir makine için yaklaşık otuz dakika, bir yapılandırma için dört ila yirmi dört saat, bir parça sipariş edildiğinde daha uzun — merdiven sipariş noktasında yazdırılır ve anında sunucular şu anda rafta olanı listeler.

Deneme var mı?

Deneme hesabı yok. İlk etkinleştirmeden itibaren üç takvim günü içinde iade politikası yazıldığı gibi uygulanır ve kripto para ödemeleri mağaza kredisi olarak iade edilir. En ucuz dürüst deneme, CPU yuvasında bir aydır.

Özel sipariş parçaları farklı koşullar mı taşır?

Bazen. Siparişiniz için satın alınan bir parça ön ödeme payı veya asgari dönem taşıyabilir — ve size ödemeden önce tam olarak ne olduğu söylenir, asla sonra değil. Raftaki makineler varsayılanı taşır: bir ay, sözleşmesiz.

Yuvayı aştığımda ne olur?

Bir sonraki yuva, genellikle aynı binada: bir CPU makinesi ağırlıklarını yerel hat üzerinden bir GPU makinesine devreder ya da zaten elinizde tuttuğunuz kasadaki kart değiştirilir ve fatura tam olarak aradaki fark kadar hareket eder.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt