Hosting LLM na serwerach dedykowanych · Server Room · zał. 2004

Jedna szafa. Każdy sposób, by uruchomić model.

Modele językowe nie potrzebują jednego rodzaju maszyny — potrzebują właściwej. Brama agentowa chce taniego pudełka, które nigdy nie zasypia. Asystent zespołu uruchamia skwantyzowaną Lamę lub Qwen prosto z pamięci systemowej. Model 70B chce pamięci karty, a rachunek za token chce Twojego wzrostu. Wybierz zatokę: cała maszyna jest Twoja na miesiąc, nic współdzielonego, nic liczonego, a kwota na jej froncie to kwota z kasy.

Wybierz zatokę Dobierz model

  • Jeden najemca
  • Ruch nielimitowany
  • Pięć miast
  • Miesięcznie, bez umowy

Odczytane z katalogu zamówień w chwili wyświetlenia tej strony. Kliknij zatokę.

Policzone, nie zmyślone

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Każda powyższa liczba jest wyliczana przy tym żądaniu z wierszy, z których rozlicza konfigurator, więc żadna nie może się zestarzeć między wdrożeniami. Co jest w szafie i pod prądem w chwili, gdy to czytasz, to inne pytanie i serwery natychmiastowe je obsługują — ta strona wygląda tak samo przy pełnej i pustej półce.

Katalog według obciążeń

Cztery zatoki, wycenione kompletnie.

Nie cztery poziomy jednego produktu — cztery różne maszyny do czterech różnych zadań, a każda kwota to miesięczna suma dokładnie tej konfiguracji wydrukowanej obok. Nic nie przychodzi później: port, adres i konsola poza pasmem są już w cenie.

inferencja CPU

Prywatny asystent dla całego zespołu

Skwantyzowana Lama, Qwen lub Mistral 7–8B obsługuje czat, wyszukiwanie i osadzenia prosto ze 128 GB pamięci systemowej — zadanie, do którego napisano llama.cpp i Ollamę. Bez karty graficznej, bez ceny karty graficznej, a magazyn wektorów żyje na tym samym metalu co model. Budowane na zamówienie w 4–24 godziny, we wszystkich pięciu miastach.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

agenci

Pudełko agenta

Bramy takie jak OpenClaw spędzają życie na wywoływaniu modeli gdzie indziej i czekaniu na odpowiedzi. Potrzebują czasu pracy i portu, nie akceleratorów — a najtańszą uczciwą maszyną do tego obowiązku jest ta.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

serwowanie GPU · dostrajanie

Pamięć karty dla tych dużych

Od 13B z pełną prędkością do 70B w 4-bitach praca przenosi się do pamięci karty, a vLLM zamienia kartę w zrównoleglony, zgodny z OpenAI punkt końcowy, który Twój kod kliencki już zna. Kwota poniżej to kompletna maszyna z akceleratorem 48 GB już osadzonym; linia pod nią to wkład samej karty, a konfiguracja 80 GB obok to ta sama obudowa niosąca model 70B w 8-bitach.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Która karta, spośród wszystkich, które montujemy, to osobna strona — każda wyceniona jako własna linia obok swojej maszyny, na stronie GPU.

pudełko deweloperskie

DGX Spark, bez biurka

Mała maszyna GB10 od NVIDIA, w szafie w Nowym Jorku na okres roczny — pudełko, na które frameworki celują najpierw, bez importu i szumu wentylatora obok krzesła.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

jurysdykcja

UE albo USA, Twój wybór

Amsterdam i Bukareszt trzymają europejską pracę w Europie; Nowy Jork, Miami i San Francisco trzymają amerykańską pracę u siebie. Pięć budynków →

Większe niż jedna zatoka?

Druga karta w obudowie albo druga maszyna obok to inne pytanie z własną stroną — linie, porty i rozmieszczenie, wycenione z nazwaną częścią. Albo przeskocz dalej: , a odpowiedź poda obudowę i czas realizacji.

Arytmetyka

Dobierz model. Maszyna podąży za nim.

Wagi to parametry razy bajty na parametr — arytmetyka, nie benchmarki, i ta sama tabela źródłowa, którą drukuje strona GPU. Wybierz rozmiar i precyzję; odpowiedź poda pamięć, jakiej wagi potrzebują, najtańszą zatokę, która je uniesie, i zapas jako zwykły stosunek, bo model, który ledwo się mieści, nie serwuje.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Same wagi — środowisko uruchomieniowe i okno kontekstu żyją w zapasie, dlatego żadna odpowiedź powyżej nie wypełnia pamięci po brzegi. Plik w wersji dystrybucyjnej waży więcej niż arytmetyka, bo popularne formaty 4-bitowe trzymają część tensorów w wyższej precyzji: domyślna 4-bitowa Lama 3.1 70B z Ollamy to pobranie 43 GB, nie 38 GB, więc dobieraj rozmiar według pliku, który załadujesz. Licencje to sprawa między Tobą a wydawcą modelu; maszyna nie bramkuje tego, co ładujesz.

Już w każdej kwocie

Co zawiera każda zatoka.

Jeden najemcaFizyczna maszyna jest wyłącznie Twoja. Żadnego hipernadzorcy pod spodem, żadnej współdzielonej karty, żadnego dzielenia czasu, żadnego zadania wsadowego sąsiada na Twoim krzemie.
Root i konsolaCzysty system operacyjny do wyboru, root na metalu i konsola poza pasmem (iLO, iDRAC, IPMI), która wciąż odpowiada, gdy system nie odpowiada.
Port nielimitowanyNic nie jest liczone w żadną stronę. Zbiory danych wchodzą, punkty kontrolne wychodzą, użytkownicy są obsługiwani — na żadnej fakturze nie ma wiersza za transfer wychodzący.
Twój stos, Twoje wersjeOllama, llama.cpp, vLLM — instalujesz je i przypinasz, a potem nic ich nie rusza. Chcesz sterownik GPU na miejscu przed przekazaniem? Wpisz dokładną wersję w zamówieniu.
JurysdykcjaPrompty, kontekst i dane do dostrajania przemieszczają się między Twoimi użytkownikami a Twoją maszyną, bez żadnej trzeciej strony na ścieżce, która by je logowała, trenowała na nich albo przepisywała wokół nich swoje warunki.
Ludzie, całą dobęCzat, mail i telefon, o każdej godzinie roku — a martwa część jest wymieniana według zapisanego zegara, nie obietnicy dobrej woli. Zegary są opublikowane.

Ten drugi rachunek

Stała opłata wygrywa z liczoną, gdy praca jest równa.

API za token to właściwe narzędzie do skoków i do jakości modeli frontierowych — powiemy to wprost, zamiast sprzedawać przeciwko niemu. Maszyna wygrywa, gdy wolumen jest stały, gdy dane muszą zostać pod Twoją pieczą albo gdy dostrojony otwarty model już robi swoje: jej kwota wygląda tak samo przy dziesięciokrotnym ruchu, a wzrost przestaje być pozycją na rachunku. Każda miesięczna kwota na tej domenie, zebrana w jednej tabeli, to strona z cenami; dlaczego starsze maszyny tutaj pozostają tanie, wyjaśnia strona o wartości.

Pytane przed zakupem

Dziesięć prostych odpowiedzi.

Czy mogę serwować LLM bez karty graficznej?

Tak, w granicy, którą warto podać: skwantyzowany model 7–8B na zatoce CPU uczciwie obsługuje asystenta zespołu, wyszukiwanie i osadzenia. Nie obsłuży modelu 70B dla tysiąca użytkowników — to zadanie zatoki GPU i ta strona mówi to tutaj, zamiast pozwolić Ci odkryć to samemu.

Czego potrzebuje model 70B?

Około 38 GB pamięci karty w 4-bitach, co uniesie karta 48 GB; 70 GB w 8-bitach, co wymaga karty 80 GB; 140 GB w pełnej precyzji, czyli więcej niż jedna karta, i to staje się pytaniem strony wielokartowej.

Które modele wolno mi uruchamiać?

Wszystko, czego wagi możesz posiadać: rodziny Llama, Qwen, Mistral, Gemma i DeepSeek oraz ich dostrojenia. Licencja jest między Tobą a wydawcą — maszyna jej nie czyta, a my jej nie bramkujemy.

Czy moje dane są używane do trenowania czegokolwiek?

Nie. Nic na ścieżce ich nie czyta. Jeden najemca na maszynę, Twój system operacyjny, Twoje dyski; obsługujemy sprzęt i sieć pod spodem, nigdy obciążenie na górze.

Dlaczego nie zostać przy API za token?

Zostań, dopóki Twój ruch jest skokowy albo model frontierowy jest produktem. Przenieś się, gdy wolumen jest stały, dane wrażliwe albo dostrojony otwarty model już robi swoje — a te dwa dobrze się mieszają: mnóstwo stosów kieruje najtrudniejsze pięć procent do API, a resztę serwuje samodzielnie.

Wynajem miesięczny czy zakup sprzętu?

Zakup wygrywa po roku lub dwóch ciągłego użytkowania, plus ktoś opłacony za pomieszczenie, zasilanie, chłodzenie i naprawy. Wynajem wygrywa pierwszego dnia, przy każdej modernizacji i o trzeciej nad ranem, gdy część pada na naszym zapisanym zegarze, nie na Twoim.

Jak szybka jest dostawa?

Około trzydziestu minut dla maszyny z półki, cztery do dwudziestu czterech godzin dla konfiguracji, dłużej, gdy część jest sprowadzana — drabina jest drukowana w punkcie zamówienia, a serwery natychmiastowe pokazują, co jest w szafie teraz.

Czy jest okres próbny?

Brak kont próbnych. W ciągu trzech dni kalendarzowych od pierwszej aktywacji polityka zwrotów obowiązuje jak napisano, a płatności kryptowalutowe zwracane są jako środki w sklepie. Najtańszy uczciwy test to jeden miesiąc na zatoce CPU.

Czy części na specjalne zamówienie mają inne warunki?

Czasami. Część sprowadzana na Twoje zamówienie może wiązać się z opłatą wstępną albo minimalnym okresem — i dowiadujesz się dokładnie czego przed zapłatą, nigdy po. Maszyny z półki mają warunki domyślne: jeden miesiąc, bez umowy.

Co się dzieje, gdy wyrosnę z zatoki?

Następna zatoka, zwykle w tym samym budynku: maszyna CPU przekazuje swoje wagi maszynie GPU po lokalnym kablu albo karta w obudowie, którą już masz, jest wymieniana, a faktura zmienia się dokładnie o różnicę.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt