Hosting LLM na serwerach dedykowanych · Server Room · zał. 2004

Jedna szafa. Każdy sposób, by uruchomić model.

Modele językowe nie potrzebują jednego rodzaju maszyny — potrzebują właściwej. Brama agenta chce taniego pudełka, które nigdy nie zasypia. Asystent zespołu uruchamia skwantyzowaną Lamę lub Qwen prosto z pamięci systemowej. Model 70B chce pamięci karty, a rachunek za token chce Twojego wzrostu. Wybierz zatokę: cała maszyna jest Twoja na miesiąc, nic współdzielonego, nic liczonego, a kwota na jej froncie to kwota z kasy.

Wybierz zatokę Dobierz model

  • Jeden najemca
  • Ruch nielimitowany
  • Pięć miast
  • Miesięcznie, bez umowy

Odczytane z katalogu zamówień w momencie wyświetlenia tej strony. Kliknij zatokę.

Policzone, nie złożone

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Każda powyższa liczba jest wyliczana przy tym żądaniu z wierszy, którymi fakturowany jest konfigurator, więc żadna nie może się zestarzeć między wdrożeniami. To, co jest w szafie i pod prądem w chwili, gdy to czytasz, to inne pytanie i serwery natychmiastowe są za nie odpowiedzialne — ta strona czyta to samo przy pełnej półce i przy pustej.

Katalog według obciążenia

Cztery zatoki, wycenione kompletnie.

Nie cztery poziomy jednego produktu — cztery różne maszyny do czterech różnych zadań, a każda kwota to miesięczna suma dokładnej konfiguracji wydrukowanej obok. Nic nie przychodzi później: port, adres i konsola poza pasmem są już w cenie.

inferencja CPU

Prywatny asystent dla całego zespołu

Skwantyzowana Lama, Qwen lub Mistral 7–8B obsługuje czat, wyszukiwanie i osadzenia prosto ze 128 GB pamięci systemowej — zadanie, do którego napisano llama.cpp i Ollamę. Bez karty graficznej, bez ceny karty graficznej, a magazyn wektorów mieszka na tym samym metalu co model. Budowane na zamówienie w 4–24 godziny, we wszystkich pięciu miastach.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

agenci

Pudełko agenta

Bramy takie jak OpenClaw spędzają życie na wywoływaniu modeli gdzie indziej i czekaniu na odpowiedzi. Potrzebują czasu pracy i portu, nie akceleratorów — a najtańszą uczciwą maszyną do tego obowiązku jest ta.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

serwowanie GPU · dostrajanie

Pamięć karty dla tych dużych

Od 13B z prędkością do 70B w 4-bitach praca przenosi się do pamięci karty, a vLLM zamienia kartę w wsadowy, zgodny z OpenAI endpoint, który Twój kod kliencki już zna. Poniższa kwota to kompletna maszyna z już osadzonym akceleratorem 48 GB; linia pod nią to wkład samej karty, a konfiguracja 80 GB obok to ta sama obudowa niosąca 70B w 8-bitach.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Która karta, spośród wszystkich, które montujemy, to osobna strona — każda wyceniona jako własna linia obok swojej maszyny, na stronie GPU.

dev box

DGX Spark, bez biurka

Mała maszyna GB10 od NVIDIA, w szafie w Nowym Jorku na okres roczny — pudełko, na które frameworki celują najpierw, minus import i szum wentylatora obok Twojego krzesła.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

jurysdykcja

UE lub USA, Twój wybór

Amsterdam i Bukareszt trzymają europejską pracę w Europie; Nowy Jork, Miami i San Francisco trzymają amerykańską pracę w domu. Pięć budynków →

Większe niż jedna zatoka?

Druga karta w obudowie albo druga maszyna obok to inne pytanie z własną stroną — linie, porty i rozmieszczenie, wycenione z nazwaną częścią. Albo przeskocz dalej: , a odpowiedź poda obudowę i czas realizacji.

Arytmetyka

Dobierz model. Maszyna podąży.

Wagi to parametry razy bajty na parametr — arytmetyka, nie benchmarki, i ta sama tabela źródłowa, którą drukuje strona GPU. Wybierz rozmiar i precyzję; odpowiedź poda pamięć, której wagi potrzebują, najtańszą zatokę, która je uniesie, i zapas jako zwykły stosunek, bo model, który ledwo się mieści, nie serwuje.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Same wagi — środowisko uruchomieniowe i okno kontekstu żyją w zapasie, dlatego żadna powyższa odpowiedź nie wypełnia pamięci po brzegi. Licencje to sprawa między Tobą a wydawcą modelu; maszyna nie bramkuje tego, co ładujesz.

Już w każdej kwocie

Co zawiera każda zatoka.

Jeden najemcaFizyczna maszyna jest wyłącznie Twoja. Żadnego hipernadzorcy pod spodem, żadnej współdzielonej karty, żadnego dzielenia czasu, żadnego zadania wsadowego sąsiada na Twoim krzemie.
Root i konsolaCzysty system operacyjny według Twojego wyboru, root na metalu i konsola poza pasmem (iLO, iDRAC, IPMI), która wciąż odpowiada, gdy system nie odpowiada.
Port nielimitowanyNic nie jest liczone w żadnym kierunku. Zbiory danych wchodzą, checkpointy wychodzą, użytkownicy są obsługiwani — na żadnej fakturze nie istnieje linia za egress.
Twój stos, Twoje wersjeOllama, llama.cpp, vLLM — instalujesz je i przypinasz, a potem nic ich nie rusza. Chcesz sterownik GPU na miejscu przed przekazaniem? Wpisz dokładną wersję w zamówieniu.
JurysdykcjaPrompty, kontekst i dane dostrajające poruszają się między Twoimi użytkownikami a Twoją maszyną, bez trzeciej strony na ścieżce, która by je logowała, trenowała na nich albo przepisywała wokół nich swoje warunki.
Ludzie, całą dobęCzat, mail i telefon, o każdej godzinie roku — a martwa część jest wymieniana według zapisanego zegara, nie obietnicy dobrej woli. Zegary są opublikowane.

Ten drugi rachunek

Stała opłata bije liczoną, gdy praca jest równa.

API za token to właściwe narzędzie do skoków i do jakości modeli frontierowych — powiemy to wprost, zamiast sprzedawać przeciwko niemu. Maszyna wygrywa, gdy wolumen jest stały, gdy dane muszą zostać pod Twoją pieczą albo gdy dostrojony otwarty model już wykonuje robotę: jej kwota czyta to samo przy dziesięciokrotnym ruchu, a wzrost przestaje być pozycją na fakturze. Każda miesięczna kwota na tej domenie, zebrana w jednej tabeli, to strona cennika; dlaczego starsze maszyny tutaj pozostają tanie, to strona wartości.

Pytane przed zakupem

Dziesięć prostych odpowiedzi.

Czy mogę serwować LLM bez karty graficznej?

Tak, w granicy, którą warto podać: skwantyzowany model 7–8B na zatoce CPU uczciwie obsługuje asystenta zespołu, wyszukiwanie i osadzenia. Nie obsłuży modelu 70B dla tysiąca użytkowników — to zadanie zatoki GPU i ta strona mówi to tutaj, zamiast pozwolić Ci to odkryć.

Czego potrzebuje model 70B?

Około 38 GB pamięci karty w 4-bitach, co uniesie karta 48 GB; 70 GB w 8-bitach, co wymaga karty 80 GB; 140 GB w pełnej precyzji, co przekracza jedną kartę i staje się pytaniem strony wielokartowej.

Które modele wolno mi uruchamiać?

Wszystko, czego wagi możesz posiadać: rodziny Llama, Qwen, Mistral, Gemma i DeepSeek oraz ich dostrojenia. Licencja jest między Tobą a wydawcą — maszyna jej nie czyta, a my jej nie bramkujemy.

Czy moje dane są używane do trenowania czegokolwiek?

Nie. Nic na ścieżce ich nie czyta. Jeden najemca na maszynę, Twój system operacyjny, Twoje dyski; my obsługujemy sprzęt i sieć pod spodem, nigdy obciążenie na górze.

Dlaczego nie zostać przy API za token?

Zostań, póki Twój ruch jest skokowy albo model frontierowy jest produktem. Przenieś się, gdy wolumen jest stały, dane są wrażliwe albo dostrojony otwarty model już wykonuje pracę — a te dwa dobrze się mieszają: mnóstwo stosów kieruje najtrudniejsze pięć procent do API, a resztę serwuje samo.

Wynajem miesięczny czy zakup sprzętu?

Zakup wygrywa po roku lub dwóch ciągłego użytkowania, plus ktoś opłacony, by go trzymać, zasilać, chłodzić i naprawiać. Wynajem wygrywa pierwszego dnia, przy każdej modernizacji i o trzeciej nad ranem, gdy część umiera według naszego zapisanego zegara zamiast Twojego.

Jak szybka jest dostawa?

Około trzydziestu minut dla maszyny z półki, cztery do dwudziestu czterech godzin dla konfiguracji, dłużej, gdy część jest dokupowana — drabina jest drukowana w punkcie zamówienia, a serwery natychmiastowe wymieniają to, co jest w szafie teraz.

Czy jest okres próbny?

Brak kont próbnych. W ciągu trzech dni kalendarzowych od pierwszej aktywacji polityka zwrotów obowiązuje jak napisano, a płatności kryptowalutowe zwracane są jako kredyt sklepowy. Najtańszy uczciwy test to jeden miesiąc na zatoce CPU.

Czy części na specjalne zamówienie mają inne warunki?

Czasami. Część dokupiona do Twojego zamówienia może mieć część płatną z góry albo minimalny okres — i dowiadujesz się dokładnie czego przed zapłatą, nigdy po. Maszyny z półki mają domyślne: jeden miesiąc, bez umowy.

Co się dzieje, gdy wyrosnę z zatoki?

Następna zatoka, zwykle w tym samym budynku: maszyna CPU przekazuje swoje wagi maszynie GPU po lokalnym kablu albo karta w obudowie, którą już masz, jest wymieniana, a faktura przesuwa się dokładnie o różnicę.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt