Φιλοξενία LLM σε dedicated servers · Server Room · από το 2004

Ένα rack. Κάθε τρόπος να τρέξεις ένα μοντέλο.

Τα γλωσσικά μοντέλα δεν χρειάζονται ένα είδος μηχανήματος — χρειάζονται το σωστό. Μια πύλη agent θέλει ένα φτηνό κουτί που δεν κοιμάται ποτέ. Ο βοηθός μιας ομάδας τρέχει ένα κβαντισμένο Llama ή Qwen κατευθείαν από τη μνήμη συστήματος. Ένα 70B θέλει μνήμη κάρτας, και ένας λογαριασμός ανά token θέλει την ανάπτυξή σου. Διάλεξε τη θέση: ολόκληρο το μηχάνημα είναι δικό σου με τον μήνα, τίποτα κοινόχρηστο, τίποτα μετρημένο, και το νούμερο στην πρόσοψή του είναι αυτό του checkout.

Διάλεξε τη θέση σου Υπολόγισε το μοντέλο σου

  • Ένας ένοικος
  • Αμέτρητη κίνηση
  • Πέντε πόλεις
  • Μηνιαία, χωρίς συμβόλαιο

Διαβάστηκε από τον κατάλογο παραγγελιών τη στιγμή που σερβιρίστηκε αυτή η σελίδα. Κάνε κλικ σε μια θέση.

Μετρημένα, όχι συντεθειμένα

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Κάθε νούμερο παραπάνω προκύπτει σε αυτό το αίτημα από τις γραμμές που χρεώνει ο configurator, ώστε τίποτα να μην παλιώνει ανάμεσα στα deploys. Το τι είναι racked και τροφοδοτημένο καθώς το διαβάζεις είναι διαφορετική ερώτηση, και την κατέχει η σελίδα instant servers — αυτή η σελίδα διαβάζεται το ίδιο σε γεμάτο ράφι και σε άδειο.

Ο κατάλογος, ανά φόρτο εργασίας

Τέσσερις θέσεις, με πλήρη τιμή.

Όχι τέσσερις βαθμίδες ενός προϊόντος — τέσσερα διαφορετικά μηχανήματα για τέσσερις διαφορετικές δουλειές, κάθε νούμερο το μηνιαίο σύνολο της ακριβούς σύνθεσης που τυπώνεται δίπλα του. Τίποτα δεν έρχεται αργότερα: η θύρα, η διεύθυνση και η out-of-band κονσόλα είναι ήδη μέσα στο νούμερο.

cpu inference

Ένας ιδιωτικός βοηθός για όλη την ομάδα

Ένα κβαντισμένο 7–8B Llama, Qwen ή Mistral σερβίρει chat, retrieval και embeddings κατευθείαν από 128 GB μνήμης συστήματος — η δουλειά για την οποία γράφτηκαν το llama.cpp και το Ollama. Χωρίς κάρτα γραφικών, χωρίς την τιμή κάρτας γραφικών, και το vector store ζει στο ίδιο μέταλλο με το μοντέλο. Φτιάχνεται κατά παραγγελία σε 4–24 ώρες, και στις πέντε πόλεις.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

agents

Το κουτί του agent

Πύλες όπως το OpenClaw περνούν τη ζωή τους καλώντας μοντέλα αλλού και περιμένοντας απαντήσεις. Χρειάζονται uptime και μια θύρα, όχι accelerators — και το φτηνότερο τίμιο μηχάνημα για αυτό το καθήκον είναι αυτό εδώ.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

gpu serving · fine-tuning

Μνήμη κάρτας για τα μεγάλα

Από 13B σε ταχύτητα έως 70B σε 4-bit, η δουλειά μεταφέρεται στη μνήμη κάρτας, και το vLLM μετατρέπει την κάρτα σε batched, OpenAI-συμβατό endpoint που ο κώδικας του πελάτη σου ήδη μιλάει. Το νούμερο παρακάτω είναι ένα πλήρες μηχάνημα με τον 48 GB accelerator ήδη τοποθετημένο· η γραμμή από κάτω είναι ό,τι συνεισφέρει μόνη της η κάρτα, και η σύνθεση 80 GB δίπλα της είναι το ίδιο chassis να κουβαλάει ένα 70B σε 8-bit.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Ποια κάρτα, από όλες όσες τοποθετούμε, είναι σελίδα από μόνη της — κάθε μία τιμολογημένη ως δική της γραμμή δίπλα στο μηχάνημά της, στη σελίδα GPU.

dev box

DGX Spark, χωρίς το γραφείο

Το μικρό μηχάνημα GB10 της NVIDIA, racked στη Νέα Υόρκη με ετήσια δέσμευση — το κουτί που στοχεύουν πρώτα τα frameworks, μείον την εισαγωγή και τον θόρυβο του ανεμιστήρα δίπλα στην καρέκλα σου.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

custody

ΕΕ ή ΗΠΑ, δική σου επιλογή

Το Άμστερνταμ και το Βουκουρέστι κρατούν την ευρωπαϊκή δουλειά στην Ευρώπη· η Νέα Υόρκη, το Μαϊάμι και το Σαν Φρανσίσκο κρατούν την αμερικανική δουλειά στο σπίτι. Τα πέντε κτίρια →

Μεγαλύτερο από μία θέση;

Μια δεύτερη κάρτα στο chassis, ή ένα δεύτερο μηχάνημα δίπλα του, είναι διαφορετική ερώτηση με τη δική της σελίδα — lanes, θύρες και τοποθέτηση, με προσφορά που ονομάζει το εξάρτημα. Ή προσπέρασε: και η απάντηση ονομάζει το chassis και τον χρόνο παράδοσης.

Η αριθμητική

Υπολόγισε το μοντέλο. Το μηχάνημα ακολουθεί.

Τα weights είναι παράμετροι επί bytes ανά παράμετρο — αριθμητική, όχι benchmarking, και ο ίδιος πίνακας με πηγές που τυπώνει η σελίδα GPU. Διάλεξε μέγεθος και ακρίβεια· η απάντηση ονομάζει τη μνήμη που χρειάζονται τα weights, τη φτηνότερη θέση που τα κουβαλάει, και το περιθώριο που απομένει ως απλό λόγο, γιατί ένα μοντέλο που μόλις χωράει δεν σερβίρει.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Μόνο τα weights — το runtime και το context window ζουν στο περιθώριο, γι’ αυτό καμία απάντηση παραπάνω δεν γεμίζει τη μνήμη της μέχρι το χείλος. Ένα αρχείο όπως αποστέλλεται τρέχει βαρύτερο από την αριθμητική, επειδή τα κοινά 4-bit formats κρατούν κάποιους tensors σε υψηλότερη ακρίβεια: το προεπιλεγμένο 4-bit Llama 3.1 70B του Ollama είναι λήψη 43 GB, όχι 38 GB, οπότε υπολόγισε από το αρχείο που θα φορτώσεις. Οι άδειες είναι ανάμεσα σε εσένα και τον εκδότη του μοντέλου· το μηχάνημα δεν ελέγχει τι φορτώνεις.

Ήδη μέσα σε κάθε νούμερο

Τι περιλαμβάνει κάθε θέση.

Ένας ένοικοςΤο φυσικό μηχάνημα είναι αποκλειστικά δικό σου. Χωρίς hypervisor από κάτω, χωρίς κοινή κάρτα, χωρίς time-slicing, χωρίς batch job γείτονα στο πυρίτιό σου.
Root και η κονσόλαΈνα καθαρό λειτουργικό της επιλογής σου, root στο μέταλλο, και μια out-of-band κονσόλα (iLO, iDRAC, IPMI) που εξακολουθεί να απαντά όταν το λειτουργικό δεν απαντά.
Μια αμέτρητη θύραΤίποτα μετρημένο προς καμία κατεύθυνση. Datasets μέσα, checkpoints έξω, χρήστες εξυπηρετημένοι — καμία γραμμή egress δεν υπάρχει σε κανένα τιμολόγιο.
Το stack σου, οι εκδόσεις σουOllama, llama.cpp, vLLM — τα εγκαθιστάς και τα καρφιτσώνεις εσύ, και τίποτα δεν τα μετακινεί μετά. Θέλεις τον GPU driver στη θέση του πριν την παράδοση; Βάλε την ακριβή έκδοση στην παραγγελία.
CustodyPrompts, context και δεδομένα fine-tuning κινούνται ανάμεσα στους χρήστες σου και το μηχάνημά σου, χωρίς τρίτο μέρος στη διαδρομή να τα καταγράφει, να εκπαιδεύεται πάνω τους ή να ξαναγράφει τους όρους του γύρω τους.
Άνθρωποι, όλο το εικοσιτετράωροChat, mail και τηλέφωνο, κάθε ώρα του χρόνου — και ένα νεκρό εξάρτημα αντικαθίσταται σε γραπτό ρολόι, όχι υπόσχεση καλής θέλησης. Τα ρολόγια είναι δημοσιευμένα.

Ο άλλος λογαριασμός

Το flat κερδίζει το metered όταν η δουλειά είναι σταθερή.

Ένα API ανά token είναι το σωστό εργαλείο για εκρήξεις και για ποιότητα frontier-model — θα το πούμε ευθέως αντί να πουλήσουμε εναντίον του. Το μηχάνημα κερδίζει όταν ο όγκος είναι σταθερός, όταν τα δεδομένα πρέπει να μείνουν στην κατοχή σου, ή όταν ένα tuned ανοιχτό μοντέλο κάνει ήδη τη δουλειά: το νούμερό του διαβάζεται το ίδιο σε δεκαπλάσια κίνηση, και η ανάπτυξη παύει να είναι γραμμή τιμολογίου. Κάθε μηνιαίο νούμερο σε αυτό το domain, συγκεντρωμένο σε έναν πίνακα, είναι η σελίδα τιμολόγησης· γιατί τα παλαιότερα μηχανήματα εδώ μένουν φτηνά είναι η σελίδα αξίας.

Ρωτήθηκαν πριν την αγορά

Δέκα ευθείες απαντήσεις.

Μπορώ να σερβίρω ένα LLM χωρίς κάρτα γραφικών;

Ναι, μέσα σε ένα όριο που αξίζει να ειπωθεί: ένα κβαντισμένο μοντέλο 7–8B στη θέση CPU σερβίρει τίμια τον βοηθό μιας ομάδας, retrieval και embeddings. Δεν θα σερβίρει ένα 70B σε χίλιους χρήστες — αυτή είναι η δουλειά της θέσης GPU, και αυτή η σελίδα το λέει εδώ αντί να σε αφήσει να το ανακαλύψεις.

Τι χρειάζεται ένα μοντέλο 70B;

Περίπου 38 GB μνήμης κάρτας σε 4-bit, που τα κουβαλάει η κάρτα 48 GB· 70 GB σε 8-bit, που παίρνει την κάρτα 80 GB· 140 GB σε πλήρη ακρίβεια, που είναι περισσότερα από μία κάρτα και γίνεται η ερώτηση της σελίδας πολλαπλών καρτών.

Ποια μοντέλα επιτρέπεται να τρέξω;

Οτιδήποτε του οποίου τα weights μπορείς να κατέχεις: οι οικογένειες Llama, Qwen, Mistral, Gemma και DeepSeek και τα fine-tunes τους. Η άδεια βρίσκεται ανάμεσα σε εσένα και τον εκδότη — το μηχάνημα δεν τη διαβάζει και εμείς δεν την ελέγχουμε.

Χρησιμοποιούνται τα δεδομένα μου για εκπαίδευση;

Όχι. Τίποτα στη διαδρομή δεν τα διαβάζει. Ένας ένοικος ανά μηχάνημα, το λειτουργικό σου σύστημα, οι δίσκοι σου· λειτουργούμε το hardware και το δίκτυο από κάτω, ποτέ τον φόρτο εργασίας από πάνω.

Γιατί να μη μείνω σε API ανά token;

Μείνε όσο η κίνησή σου είναι εκρηκτική ή το frontier model είναι το προϊόν. Μετακινήσου όταν ο όγκος είναι σταθερός, τα δεδομένα ευαίσθητα, ή ένα tuned ανοιχτό μοντέλο κάνει ήδη τη δουλειά — και τα δύο αναμειγνύονται καλά: πολλά stacks δρομολογούν το δυσκολότερο πέντε τοις εκατό σε ένα API και σερβίρουν τα υπόλοιπα μόνα τους.

Μηνιαία ενοικίαση ή αγορά του hardware;

Η αγορά κερδίζει μετά από ένα ή δύο χρόνια συνεχούς χρήσης, συν κάποιον που πληρώνεται για να το στεγάσει, να το τροφοδοτήσει, να το ψύξει και να το επισκευάσει. Η ενοικίαση κερδίζει την πρώτη μέρα, σε κάθε αναβάθμιση, και στις τρεις το πρωί όταν ένα εξάρτημα πεθαίνει στο δικό μας γραπτό ρολόι αντί στο δικό σου.

Πόσο γρήγορη είναι η παράδοση;

Περίπου τριάντα λεπτά για μηχάνημα στο ράφι, τέσσερις έως είκοσι τέσσερις ώρες για σύνθεση, περισσότερο όταν ένα εξάρτημα αγοράζεται — η σκάλα τυπώνεται στο σημείο της παραγγελίας, και η σελίδα instant servers καταγράφει τι είναι racked αυτή τη στιγμή.

Υπάρχει δοκιμή;

Όχι δοκιμαστικοί λογαριασμοί. Εντός τριών ημερολογιακών ημερών από την πρώτη ενεργοποίηση ισχύει η πολιτική επιστροφών όπως είναι γραμμένη, και οι πληρωμές σε κρυπτονόμισμα επιστρέφονται ως πίστωση καταστήματος. Η φτηνότερη τίμια δοκιμή είναι ένας μήνας στη θέση CPU.

Τα εξαρτήματα ειδικής παραγγελίας έχουν διαφορετικούς όρους;

Μερικές φορές. Ένα εξάρτημα που αγοράστηκε για την παραγγελία σου μπορεί να φέρει προκαταβολικό μέρος ή ελάχιστη διάρκεια — και ενημερώνεσαι ακριβώς τι πριν πληρώσεις, ποτέ μετά. Τα μηχανήματα στο ράφι φέρουν το προεπιλεγμένο: ένας μήνας, χωρίς συμβόλαιο.

Τι συμβαίνει όταν ξεπεράσω τη θέση;

Η επόμενη θέση, συνήθως στο ίδιο κτίριο: ένα μηχάνημα CPU παραδίδει τα weights του σε ένα μηχάνημα GPU μέσω του τοπικού καλωδίου, ή η κάρτα στο chassis που ήδη κατέχεις αντικαθίσταται και το τιμολόγιο μετακινείται ακριβώς κατά τη διαφορά.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt