LLM-Hosting auf dedizierten Servern · Server Room · gegr. 2004

Ein Rack. Jeder Weg, ein Modell zu betreiben.

Sprachmodelle brauchen nicht irgendeine Maschine — sie brauchen die richtige. Ein Agenten-Gateway will eine günstige Box, die niemals schläft. Der Assistent eines Teams betreibt ein quantisiertes Llama oder Qwen direkt aus dem Systemspeicher. Ein 70B will Kartenspeicher, und eine Abrechnung pro Token will Ihr Wachstum. Wählen Sie den Einschub: Die ganze Maschine gehört Ihnen monatsweise, nichts geteilt, nichts gemessen, und die Zahl auf ihrem Gesicht ist die der Kasse selbst.

Einschub wählen Modell dimensionieren

  • Einzelmandant
  • Unbegrenzter Traffic
  • Fünf Städte
  • Monatlich, ohne Vertrag

Aus dem Bestellkatalog gelesen, als diese Seite ausgeliefert wurde. Klicken Sie auf einen Einschub.

Gezählt, nicht verfasst

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Jede Zahl oben wird bei dieser Anfrage aus den Zeilen abgeleitet, aus denen der Konfigurator abrechnet, sodass nichts davon zwischen Deployments veralten kann. Was gerade eingebaut und eingeschaltet ist, während Sie dies lesen, ist eine andere Frage, und Sofort-Server beantwortet sie — diese Seite liest sich auf einem vollen Regal genauso wie auf einem leeren.

Der Katalog, nach Workload

Vier Einschübe, komplett bepreist.

Nicht vier Stufen eines Produkts — vier verschiedene Maschinen für vier verschiedene Aufgaben, jede Zahl die Monatssumme des exakten Builds, der daneben steht. Es kommt nichts später: Der Port, die Adresse und die Out-of-Band-Konsole stecken bereits in der Zahl.

CPU-Inferenz

Ein privater Assistent für das ganze Team

Ein quantisiertes 7–8B-Llama, -Qwen oder -Mistral bedient Chat, Retrieval und Embeddings direkt aus 128 GB Systemspeicher — die Aufgabe, für die llama.cpp und Ollama geschrieben wurden. Keine Grafikkarte, kein Grafikkartenpreis, und der Vektorspeicher liegt auf demselben Metall wie das Modell. Auf Bestellung gebaut in 4–24 Stunden, in allen fünf Städten.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

Agenten

Die Box des Agenten

Gateways wie OpenClaw verbringen ihr Leben damit, Modelle anderswo aufzurufen und auf Antworten zu warten. Sie brauchen Uptime und einen Port, keine Beschleuniger — und die günstigste ehrliche Maschine für diese Aufgabe ist diese hier.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

GPU-Serving · Fine-Tuning

Kartenspeicher für die Großen

Von 13B mit Tempo bis 70B mit 4 Bit wandert die Arbeit in den Kartenspeicher, und vLLM macht aus der Karte einen gebatchten, OpenAI-kompatiblen Endpunkt, den Ihr Client-Code bereits spricht. Die Zahl unten ist eine komplette Maschine mit bereits eingesetztem 48 GB-Beschleuniger; die Zeile darunter ist, was die Karte allein beiträgt, und der 80 GB-Build daneben ist dasselbe Chassis, das ein 70B mit 8 Bit trägt.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Welche Karte, aus jeder, die wir einbauen, ist eine eigene Seite — jede als eigene Zeile neben ihrer Maschine bepreist, auf der GPU-Seite.

Dev-Box

DGX Spark, ohne den Schreibtisch

NVIDIAs kleine GB10-Maschine, in New York eingebaut, mit jährlicher Laufzeit — die Box, auf die die Frameworks zuerst zielen, minus Import und Lüftergeräusch neben Ihrem Stuhl.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

Standort

EU oder USA, Ihre Wahl

Amsterdam und Bukarest halten europäische Arbeit in Europa; New York, Miami und San Francisco halten amerikanische Arbeit zu Hause. Die fünf Gebäude →

Größer als ein Einschub?

Eine zweite Karte im Chassis oder eine zweite Maschine daneben ist eine andere Frage mit eigener Seite — Lanes, Ports und Platzierung, mit benanntem Bauteil angeboten. Oder springen Sie vor: , und die Antwort nennt das Chassis und die Lieferzeit.

Die Arithmetik

Dimensionieren Sie das Modell. Die Maschine folgt.

Gewichte sind Parameter mal Bytes pro Parameter — Arithmetik, kein Benchmarking, und dieselbe belegte Tabelle, die die GPU-Seite druckt. Wählen Sie eine Größe und eine Präzision; die Antwort nennt den Speicher, den die Gewichte brauchen, den günstigsten Einschub, der sie trägt, und den verbleibenden Spielraum als schlichtes Verhältnis, denn ein Modell, das gerade so hineinpasst, bedient nicht.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Nur Gewichte — die Laufzeit und das Kontextfenster leben im Spielraum, weshalb keine Antwort oben ihren Speicher bis zum Rand füllt. Lizenzen sind eine Sache zwischen Ihnen und dem Herausgeber des Modells; die Maschine kontrolliert nicht, was Sie laden.

In jeder Zahl bereits enthalten

Was jeder Einschub beinhaltet.

Ein MandantDie physische Maschine gehört Ihnen allein. Kein Hypervisor darunter, keine geteilte Karte, kein Time-Slicing, kein Batch-Job des Nachbarn auf Ihrem Silizium.
Root und die KonsoleEin sauberes Betriebssystem Ihrer Wahl, Root auf dem Metall und eine Out-of-Band-Konsole (iLO, iDRAC, IPMI), die noch antwortet, wenn das Betriebssystem es nicht tut.
Ein unbegrenzter PortNichts wird in irgendeine Richtung gezählt. Datensätze rein, Checkpoints raus, Nutzer bedient — auf keiner Rechnung existiert eine Egress-Zeile.
Ihr Stack, Ihre VersionenOllama, llama.cpp, vLLM — Sie installieren und pinnen sie, und nichts bewegt sie danach. Wollen Sie den GPU-Treiber vor der Übergabe an Ort und Stelle? Schreiben Sie die exakte Version auf die Bestellung.
StandortPrompts, Kontext und Fine-Tuning-Daten bewegen sich zwischen Ihren Nutzern und Ihrer Maschine, ohne Dritte im Pfad, die sie protokollieren, darauf trainieren oder ihre Bedingungen darum herum umschreiben.
Menschen, rund um die UhrChat, Mail und Telefon, zu jeder Stunde des Jahres — und ein totes Bauteil wird nach einer schriftlich festgelegten Uhr getauscht, nicht nach einem Goodwill-Versprechen. Die Uhren sind veröffentlicht.

Die andere Rechnung

Flat schlägt gemessen, wenn die Arbeit stetig ist.

Eine API pro Token ist das richtige Werkzeug für Spitzen und für Frontier-Modell-Qualität — das sagen wir klar, statt dagegen zu verkaufen. Die Maschine gewinnt, wenn das Volumen konstant ist, wenn die Daten in Ihrer Obhut bleiben müssen oder wenn ein abgestimmtes offenes Modell die Aufgabe bereits erledigt: Ihre Zahl liest sich bei zehnfachem Traffic gleich, und Wachstum hört auf, ein Posten zu sein. Jede Monatszahl dieser Domain, gesammelt in einer Tabelle, ist die Preisseite; warum die älteren Maschinen hier günstig bleiben, ist die Wertseite.

Vor dem Kauf gefragt

Zehn klare Antworten.

Kann ich ein LLM ohne Grafikkarte betreiben?

Ja, innerhalb einer Grenze, die es wert ist, genannt zu werden: Ein quantisiertes 7–8B-Modell auf dem CPU-Einschub bedient ehrlich den Assistenten, die Retrieval und die Embeddings eines Teams. Es wird kein 70B für tausend Nutzer bedienen — das ist die Aufgabe des GPU-Einschubs, und diese Seite sagt es hier, statt Sie es selbst entdecken zu lassen.

Was braucht ein 70B-Modell?

Etwa 38 GB Kartenspeicher bei 4 Bit, was die 48 GB-Karte trägt; 70 GB bei 8 Bit, wofür es die 80 GB-Karte braucht; 140 GB bei voller Präzision, was mehr als eine Karte ist und zur Frage der Multi-Karten-Seite wird.

Welche Modelle darf ich betreiben?

Alles, dessen Gewichte Sie halten dürfen: die Familien Llama, Qwen, Mistral, Gemma und DeepSeek und ihre Fine-Tunes. Die Lizenz liegt zwischen Ihnen und dem Herausgeber — die Maschine liest sie nicht, und wir kontrollieren sie nicht.

Werden meine Daten zum Trainieren verwendet?

Nein. Nichts im Pfad liest sie. Ein Mandant pro Maschine, Ihr Betriebssystem, Ihre Festplatten; wir betreiben die Hardware und das Netzwerk darunter, niemals den Workload darüber.

Warum nicht bei einer API pro Token bleiben?

Bleiben Sie, solange Ihr Traffic stoßweise ist oder das Frontier-Modell das Produkt ist. Wechseln Sie, wenn das Volumen stetig ist, die Daten sensibel sind oder ein abgestimmtes offenes Modell die Arbeit bereits erledigt — und beides mischt sich gut: Viele Stacks leiten die schwierigsten fünf Prozent an eine API und bedienen den Rest selbst.

Monatlich mieten oder die Hardware kaufen?

Kaufen gewinnt nach ein oder zwei Jahren konstanter Nutzung, plus jemand, der dafür bezahlt wird, sie unterzubringen, zu versorgen, zu kühlen und zu reparieren. Mieten gewinnt am ersten Tag, bei jedem Upgrade und um drei Uhr morgens, wenn ein Teil nach unserer schriftlich festgelegten Uhr stirbt statt nach Ihrer.

Wie schnell ist die Lieferung?

Etwa dreißig Minuten für eine Maschine im Regal, vier bis vierundzwanzig Stunden für einen Build, länger, wenn ein Teil eingekauft wird — die Leiter wird am Bestellpunkt gedruckt, und Sofort-Server listet, was gerade eingebaut ist.

Gibt es eine Testphase?

Keine Testkonten. Innerhalb von drei Kalendertagen nach der ersten Aktivierung gilt die Rückerstattungsrichtlinie wie geschrieben, und Kryptowährungszahlungen werden als Guthaben erstattet. Der günstigste ehrliche Test ist ein Monat auf dem CPU-Einschub.

Haben Sonderbestellteile andere Bedingungen?

Manchmal. Ein für Ihre Bestellung eingekauftes Teil kann einen Vorabanteil oder eine Mindestlaufzeit mit sich bringen — und Sie erfahren genau was, bevor Sie zahlen, niemals danach. Maschinen im Regal tragen den Standard: ein Monat, kein Vertrag.

Was passiert, wenn ich aus dem Einschub herauswachse?

Der nächste Einschub, normalerweise im selben Gebäude: Eine CPU-Maschine übergibt ihre Gewichte über das lokale Kabel an eine GPU-Maschine, oder die Karte im Chassis, das Sie bereits halten, wird getauscht, und die Rechnung bewegt sich um exakt die Differenz.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt