Φιλοξενία LLM σε dedicated servers · Server Room · από το 2004

Ένα rack. Κάθε τρόπος να τρέξεις ένα μοντέλο.

Τα γλωσσικά μοντέλα δεν χρειάζονται ένα είδος μηχανήματος — χρειάζονται το σωστό. Μια πύλη πρακτόρων θέλει ένα φτηνό κουτί που δεν κοιμάται ποτέ. Ο βοηθός μιας ομάδας τρέχει ένα κβαντισμένο Llama ή Qwen κατευθείαν από τη μνήμη συστήματος. Ένα 70B θέλει μνήμη κάρτας, και ένας λογαριασμός ανά token θέλει την ανάπτυξή σου. Διάλεξε τη θέση: ολόκληρο το μηχάνημα είναι δικό σου με τον μήνα, τίποτα κοινόχρηστο, τίποτα μετρημένο, και το νούμερο πάνω του είναι του ίδιου του checkout.

Διάλεξε τη θέση σου Υπολόγισε το μοντέλο σου

  • Ένας μισθωτής
  • Αμέτρητη κίνηση
  • Πέντε πόλεις
  • Μηνιαίο, χωρίς συμβόλαιο

Διαβάστηκε από τον κατάλογο παραγγελιών τη στιγμή που σερβιρίστηκε αυτή η σελίδα. Κάνε κλικ σε μια θέση.

Μετρημένο, όχι συντεθειμένο

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Κάθε νούμερο παραπάνω προκύπτει σε αυτό το αίτημα από τις γραμμές που χρεώνει ο configurator, οπότε τίποτα δεν μπορεί να μείνει ξεπερασμένο μεταξύ αναπτύξεων. Το τι είναι racked και τροφοδοτημένο καθώς το διαβάζεις είναι διαφορετική ερώτηση, και την κατέχει η σελίδα instant servers — αυτή η σελίδα διαβάζεται το ίδιο σε γεμάτο ράφι και σε άδειο.

Ο κατάλογος, ανά φόρτο εργασίας

Τέσσερις θέσεις, με πλήρη τιμή.

Όχι τέσσερις βαθμίδες ενός προϊόντος — τέσσερα διαφορετικά μηχανήματα για τέσσερις διαφορετικές δουλειές, κάθε νούμερο το μηνιαίο σύνολο της ακριβούς σύνθεσης που τυπώνεται δίπλα του. Τίποτα δεν έρχεται αργότερα: η θύρα, η διεύθυνση και η out-of-band κονσόλα είναι ήδη μέσα στο νούμερο.

cpu inference

Ένας ιδιωτικός βοηθός για όλη την ομάδα

Ένα κβαντισμένο 7–8B Llama, Qwen ή Mistral σερβίρει chat, retrieval και embeddings κατευθείαν από 128 GB μνήμης συστήματος — η δουλειά για την οποία γράφτηκαν το llama.cpp και το Ollama. Χωρίς κάρτα γραφικών, χωρίς την τιμή κάρτας γραφικών, και το vector store ζει στο ίδιο μέταλλο με το μοντέλο. Φτιάχνεται κατά παραγγελία σε 4–24 ώρες, και στις πέντε πόλεις.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

agents

Το κουτί του πράκτορα

Πύλες όπως το OpenClaw περνούν τη ζωή τους καλώντας μοντέλα αλλού και περιμένοντας απαντήσεις. Χρειάζονται uptime και μια θύρα, όχι επιταχυντές — και το φτηνότερο τίμιο μηχάνημα για αυτό το καθήκον είναι αυτό εδώ.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

gpu serving · fine-tuning

Μνήμη κάρτας για τα μεγάλα

Από 13B σε ταχύτητα έως 70B σε 4-bit, η δουλειά μετακινείται στη μνήμη κάρτας, και το vLLM μετατρέπει την κάρτα σε ένα batched, OpenAI-συμβατό endpoint που ο κώδικας του πελάτη σου ήδη μιλάει. Το νούμερο παρακάτω είναι ένα πλήρες μηχάνημα με τον 48 GB επιταχυντή ήδη τοποθετημένο· η γραμμή κάτω από αυτό είναι ό,τι συνεισφέρει μόνη της η κάρτα, και η σύνθεση 80 GB δίπλα του είναι το ίδιο chassis που κουβαλάει ένα 70B σε 8-bit.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Ποια κάρτα, από όλες όσες τοποθετούμε, είναι δική της σελίδα — η καθεμία τιμολογημένη ως δική της γραμμή δίπλα στο μηχάνημά της, στη σελίδα GPU.

dev box

DGX Spark, χωρίς το γραφείο

Το μικρό μηχάνημα GB10 της NVIDIA, racked στη Νέα Υόρκη με ετήσια διάρκεια — το κουτί στο οποίο στοχεύουν πρώτα τα frameworks, μείον την εισαγωγή και τον θόρυβο ανεμιστήρα δίπλα στην καρέκλα σου.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

custody

ΕΕ ή ΗΠΑ, δική σου επιλογή

Το Άμστερνταμ και το Βουκουρέστι κρατούν την ευρωπαϊκή δουλειά στην Ευρώπη· η Νέα Υόρκη, το Μαϊάμι και το Σαν Φρανσίσκο κρατούν την αμερικανική δουλειά στο σπίτι. Τα πέντε κτίρια →

Μεγαλύτερο από μία θέση;

Μια δεύτερη κάρτα στο chassis, ή ένα δεύτερο μηχάνημα δίπλα του, είναι διαφορετική ερώτηση με δική της σελίδα — lanes, θύρες και τοποθέτηση, με προσφορά που ονομάζει το εξάρτημα. Ή προσπέρασε: και η απάντηση ονομάζει το chassis και τον χρόνο παράδοσης.

Η αριθμητική

Υπολόγισε το μοντέλο. Το μηχάνημα ακολουθεί.

Τα βάρη είναι παράμετροι επί bytes ανά παράμετρο — αριθμητική, όχι benchmarking, και ο ίδιος πίνακας με πηγές που τυπώνει η σελίδα GPU. Διάλεξε μέγεθος και ακρίβεια· η απάντηση ονομάζει τη μνήμη που χρειάζονται τα βάρη, τη φτηνότερη θέση που τα κουβαλάει, και το περιθώριο που απομένει ως απλό λόγο, γιατί ένα μοντέλο που μόλις χωράει δεν σερβίρει.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Μόνο τα βάρη — το runtime και το context window ζουν στο περιθώριο, γι' αυτό καμία απάντηση παραπάνω δεν γεμίζει τη μνήμη της μέχρι το χείλος. Οι άδειες είναι μεταξύ εσένα και του εκδότη του μοντέλου· το μηχάνημα δεν φιλτράρει τι φορτώνεις.

Ήδη μέσα σε κάθε νούμερο

Τι περιλαμβάνει κάθε θέση.

Ένας μισθωτήςΤο φυσικό μηχάνημα είναι αποκλειστικά δικό σου. Χωρίς hypervisor από κάτω, χωρίς κοινή κάρτα, χωρίς time-slicing, χωρίς batch job γείτονα στο πυρίτιό σου.
Root και η κονσόλαΈνα καθαρό λειτουργικό της επιλογής σου, root στο μέταλλο, και μια out-of-band κονσόλα (iLO, iDRAC, IPMI) που εξακολουθεί να απαντάει όταν το λειτουργικό δεν απαντάει.
Μια αμέτρητη θύραΤίποτα μετρημένο προς καμία κατεύθυνση. Datasets μέσα, checkpoints έξω, χρήστες εξυπηρετημένοι — καμία γραμμή egress δεν υπάρχει σε κανένα τιμολόγιο.
Το stack σου, οι εκδόσεις σουOllama, llama.cpp, vLLM — τα εγκαθιστάς και τα καρφιτσώνεις εσύ, και τίποτα δεν τα μετακινεί μετά. Θέλεις τον οδηγό GPU στη θέση του πριν την παράδοση; Βάλε την ακριβή έκδοση στην παραγγελία.
CustodyPrompts, context και δεδομένα fine-tuning κινούνται μεταξύ των χρηστών σου και του μηχανήματός σου, χωρίς τρίτο μέρος στη διαδρομή να τα καταγράφει, να εκπαιδεύεται πάνω τους ή να ξαναγράφει τους όρους του γύρω τους.
Άνθρωποι, όλο το εικοσιτετράωροChat, mail και τηλέφωνο, κάθε ώρα του χρόνου — και ένα χαλασμένο εξάρτημα αντικαθίσταται σε γραπτό ρολόι, όχι υπόσχεση καλής θέλησης. Τα ρολόγια είναι δημοσιευμένα.

Ο άλλος λογαριασμός

Το flat κερδίζει το metered όταν η δουλειά είναι σταθερή.

Ένα API ανά token είναι το σωστό εργαλείο για εκρήξεις και για ποιότητα frontier-model — θα το πούμε ευθέως αντί να πουλήσουμε εναντίον του. Το μηχάνημα κερδίζει όταν ο όγκος είναι σταθερός, όταν τα δεδομένα πρέπει να μείνουν στην κατοχή σου, ή όταν ένα tuned ανοιχτό μοντέλο κάνει ήδη τη δουλειά: το νούμερό του διαβάζεται το ίδιο σε δεκαπλάσια κίνηση, και η ανάπτυξη παύει να είναι γραμμή τιμολογίου. Κάθε μηνιαίο νούμερο σε αυτό το domain, συγκεντρωμένο σε έναν πίνακα, είναι η σελίδα τιμολόγησης· γιατί τα παλαιότερα μηχανήματα εδώ μένουν φτηνά είναι η σελίδα αξίας.

Ερωτημένο πριν την αγορά

Δέκα ευθείες απαντήσεις.

Μπορώ να σερβίρω ένα LLM χωρίς κάρτα γραφικών;

Ναι, μέσα σε ένα όριο που αξίζει να δηλωθεί: ένα κβαντισμένο μοντέλο 7–8B στη θέση CPU σερβίρει τίμια τον βοηθό μιας ομάδας, retrieval και embeddings. Δεν θα σερβίρει ένα 70B σε χίλιους χρήστες — αυτό είναι δουλειά της θέσης GPU, και αυτή η σελίδα το λέει εδώ αντί να σε αφήσει να το ανακαλύψεις.

Τι χρειάζεται ένα μοντέλο 70B;

Περίπου 38 GB μνήμης κάρτας σε 4-bit, που τα κουβαλάει η κάρτα 48 GB· 70 GB σε 8-bit, που παίρνει την κάρτα 80 GB· 140 GB σε πλήρη ακρίβεια, που είναι περισσότερο από μία κάρτα και γίνεται ερώτηση της σελίδας πολλαπλών καρτών.

Ποια μοντέλα επιτρέπεται να τρέξω;

Οτιδήποτε του οποίου τα βάρη επιτρέπεται να κατέχεις: οι οικογένειες Llama, Qwen, Mistral, Gemma και DeepSeek και τα fine-tunes τους. Η άδεια βρίσκεται μεταξύ εσένα και του εκδότη — το μηχάνημα δεν τη διαβάζει και εμείς δεν τη φιλτράρουμε.

Χρησιμοποιούνται τα δεδομένα μου για εκπαίδευση οτιδήποτε;

Όχι. Τίποτα στη διαδρομή δεν τα διαβάζει. Ένας μισθωτής ανά μηχάνημα, το λειτουργικό σου σύστημα, οι δίσκοι σου· εμείς λειτουργούμε το hardware και το δίκτυο από κάτω, ποτέ τον φόρτο εργασίας από πάνω.

Γιατί να μη μείνω σε API ανά token;

Μείνε όσο η κίνησή σου είναι εκρηκτική ή το frontier model είναι το προϊόν. Μετακινήσου όταν ο όγκος είναι σταθερός, τα δεδομένα ευαίσθητα, ή ένα tuned ανοιχτό μοντέλο κάνει ήδη τη δουλειά — και τα δύο αναμειγνύονται καλά: πολλά stacks δρομολογούν το δυσκολότερο πέντε τοις εκατό σε ένα API και σερβίρουν τα υπόλοιπα μόνα τους.

Μηνιαία ενοικίαση, ή αγορά του hardware;

Η αγορά κερδίζει μετά από ένα ή δύο χρόνια συνεχούς χρήσης, συν κάποιον που πληρώνεται για να το στεγάσει, να το τροφοδοτήσει, να το ψύξει και να το επισκευάσει. Η ενοικίαση κερδίζει την πρώτη μέρα, σε κάθε αναβάθμιση, και στις τρεις το πρωί όταν ένα εξάρτημα πεθαίνει στο δικό μας γραπτό ρολόι αντί στο δικό σου.

Πόσο γρήγορη είναι η παράδοση;

Περίπου τριάντα λεπτά για μηχάνημα στο ράφι, τέσσερις έως είκοσι τέσσερις ώρες για σύνθεση, περισσότερο όταν ένα εξάρτημα αγοράζεται — η σκάλα τυπώνεται στο σημείο της παραγγελίας, και τα instant servers απαριθμούν τι είναι racked αυτή τη στιγμή.

Υπάρχει δοκιμή;

Όχι δοκιμαστικοί λογαριασμοί. Εντός τριών ημερολογιακών ημερών από την πρώτη ενεργοποίηση ισχύει η πολιτική επιστροφών όπως γράφεται, και οι πληρωμές σε κρυπτονόμισμα επιστρέφονται ως πίστωση καταστήματος. Η φτηνότερη τίμια δοκιμή είναι ένας μήνας στη θέση CPU.

Τα εξαρτήματα ειδικής παραγγελίας έχουν διαφορετικούς όρους;

Μερικές φορές. Ένα εξάρτημα που αγοράστηκε για την παραγγελία σου μπορεί να φέρει προκαταβολικό μέρος ή ελάχιστη διάρκεια — και σου λέγεται ακριβώς τι πριν πληρώσεις, ποτέ μετά. Τα μηχανήματα στο ράφι φέρουν το προεπιλεγμένο: ένας μήνας, χωρίς συμβόλαιο.

Τι συμβαίνει όταν ξεπεράσω τη θέση;

Η επόμενη θέση, συνήθως στο ίδιο κτίριο: ένα μηχάνημα CPU παραδίδει τα βάρη του σε ένα μηχάνημα GPU μέσω του τοπικού καλωδίου, ή η κάρτα στο chassis που ήδη κατέχεις αντικαθίσταται και το τιμολόγιο μετακινείται ακριβώς κατά τη διαφορά.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt