Η CMP 170HX φέρει το ίδιο die GA100 με την A100 και βγήκε από το εργοστάσιο με το μεγαλύτερο μέρος του die αποκλεισμένο: 8 GB από τη μνήμη HBM2e ορατά, το FP32 περιορισμένο σε ρυθμό σταγόνας και η σύνδεση κλειδωμένη σε PCIe Gen 1. Μια patched έκδοση του ανοιχτού driver της NVIDIA’ αφαιρεί τους περιορισμούς. Τη μεταγλωττίζουμε σε Ubuntu κατά την εγκατάσταση του server σας, ώστε η κάρτα να είναι ξεκλείδωτη πριν συνδεθείτε για πρώτη φορά.
Τα LTT Labs ξεκλείδωσαν μια CMP 170HX τον Σεπτέμβριο του 2026 και τη δοκίμασαν με τον εαυτό της, κλειδωμένη και ξεκλείδωτη, στον ίδιο πάγκο δοκιμών. Αυτά είναι τα δικά τους νούμερα, όχι τα δικά μας, και κάθε γραμμή αναφέρει από πού προέρχεται. Τα παραθέτουμε για το μέγεθος της αλλαγής: οι ρυθμοί token μεταβάλλονται ανάλογα με το μοντέλο, την κβαντοποίηση, την έκδοση του llama.cpp και τις σημαίες, οπότε διαβάστε τα ως αναλογία και όχι ως υπόσχεση.
| Measure | As NVIDIA shipped it | Unlocked | Source |
|---|---|---|---|
| Card memory | 8 GB HBM2e | 64 GB HBM2e | cmpunlocker; 65,536 MiB measured by LTT Labs |
| FP32 fused multiply-add | about 0.39 TFLOPS | unthrottled | 170th Street (stock); cmpunlocker (full SM throughput) |
| PCIe link | Gen 1 x4 | Gen 2 x4 | cmpunlocker |
| Host to card, measured | 0.84 GB/s | 1.68 GB/s | LTT Labs, nvbandwidth |
| 8B model at 4-bit, generating | 30 tokens/s | 113 tokens/s | LTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M |
| 8B model at 4-bit, reading a prompt | 351 tokens/s | 2,994 tokens/s | LTT Labs, llama.cpp, pp512 |
| 27B model at 4-bit (~16 GB) | does not fit | 38 tokens/s | LTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M |
| 27B model at 8-bit (~29 GB) | does not fit | 33 tokens/s | LTT Labs, llama.cpp, Qwen 3.8 27B Q8_0 |
Η μνήμη είναι η αλλαγή που μετράει. Στα 8 GB η κάρτα χωράει ένα μικρό μοντέλο και ελάχιστα άλλα. Στα 64 GB χωράει ένα μοντέλο 27 δισεκατομμυρίων παραμέτρων στα 8-bit με το μεγαλύτερο μέρος της κάρτας ακόμα ελεύθερο για context, κι αυτή είναι η διαφορά ανάμεσα σε μια κάρτα για πειραματισμό και σε μια για παραγωγική εξυπηρέτηση.
Η παραγωγή token βασίζεται στο εύρος ζώνης, η ανάγνωση prompt στην αριθμητική. Η παραγωγή κειμένου περιορίζεται από το πόσο γρήγορα ρέουν τα βάρη από τη μνήμη, κάτι στο οποίο η HBM2e ήταν πάντα καλή· η ανάγνωση ενός μεγάλου prompt περιορίζεται από τις μονάδες πολλαπλασιασμού-πρόσθεσης, εκεί όπου ο περιορισμός έπληττε περισσότερο και όπου το ξεκλείδωμα φαίνεται πιο έντονα.
Η σύνδεση μετά βίας έχει σημασία μόλις φορτωθεί ένα μοντέλο. Το Gen 2 x4 διπλασιάζει τον ρυθμό host-προς-κάρτα, γεγονός που συντομεύει τη φόρτωση. Μετά από αυτό τα βάρη μένουν στην κάρτα και ο δίαυλος παραμένει αδρανής.
Οποιοσδήποτε μπορεί να διαβάσει το README του cmpunlocker. Το κομμάτι που αξίζει να πληρώσετε είναι όλα όσα το περιβάλλουν, που γίνονται πριν την παράδοση και συνεχίζουν να λειτουργούν μετά από αυτήν. Δεν χρειάζεται να εκτελέσετε τίποτα εσείς.
Ο εγκαταστάτης προσθέτει το αποθετήριο CUDA της NVIDIA και εγκαθιστά τον ανοιχτό οδηγό πυρήνα 610.57.04, χωρίς γραφικό περιβάλλον και χωρίς DKMS, μαζί με το πακέτο nvidia-driver-pinning-610.57.04 που κρατά κάθε κομμάτι του σε αυτή την έκδοση. Το ξεκλείδωμα έχει φτιαχτεί για έναν συγκεκριμένο οδηγό· η καρφίτσα είναι αυτό που εμποδίζει ένα συνηθισμένο apt upgrade να τραβήξει τις βιβλιοθήκες κάτω από τα πόδια του.
Κατεβάζουμε το cmpunlocker σε συγκεκριμένο commit και χτίζουμε το τροποποιημένο nvidia.ko μέσα στο νέο σύστημα, για τον πυρήνα με τον οποίο πρόκειται να εκκινήσει, πριν ο εγκαταστάτης κλείσει το μηχάνημα. Οι τροποποιήσεις αλλάζουν τον τρόπο με τον οποίο ο οδηγός ενεργοποιεί την κάρτα. Τίποτα δεν εγγράφεται μόνιμα στην κάρτα, οπότε αν αφαιρέσετε τον οδηγό, επιστρέφει ακριβώς στην προηγούμενη κατάστασή της.
Το ξεκλείδωμα ενεργοποιείται μόνο στο πρώτο φόρτωμα του οδηγού αφού η κάρτα έχει απενεργοποιηθεί πλήρως. Οι εγκαταστάσεις Ubuntu που κάνουμε τελειώνουν ήδη έτσι: ο εγκαταστάτης κλείνει τον διακομιστή και εμείς τον ενεργοποιούμε ξανά μέσω του BMC, ώστε το πρώτο πράγμα που αγγίζει την κάρτα να είναι ο τροποποιημένος οδηγός.
Όταν το εγκατεστημένο σύστημα απαντήσει για πρώτη φορά, η εγκατάσταση ρωτά κάθε κάρτα τι αναγνωρίστηκε ως — μνήμη, γενιά PCIe και πλάτος διαύλου — και γράφει την απάντηση στο αρχείο καταγραφής εγκατάστασης του διακομιστή, όπου μπορεί να τη δει η υποστήριξη. Η εντολή cmp-unlock status σας δίνει την ίδια απάντηση από ένα τερματικό οποιαδήποτε στιγμή.
Ένα hook στο /etc/kernel/postinst.d ξαναχτίζει τα τροποποιημένα modules για κάθε νέο πυρήνα, από ένα αντίγραφο του πηγαίου κώδικα της NVIDIA που διατηρείται στο μηχάνημα, ώστε μια αυτόματη αναβάθμιση να μην επαναφέρει αθόρυβα την κάρτα στα 8 GB. Το apt έχει επίσης ρυθμιστεί να αρνείται τα πακέτα που θα έβαζαν δίπλα του έναν δεύτερο, εργοστασιακό οδηγό· εγκαταστήστε το CUDA με apt install cuda-toolkit και δεν εμφανίζεται ποτέ.
Μόνο βάρη, στρογγυλοποιημένα προς τα πάνω. Ένα μοντέλο θεωρείται ότι χωράει όταν η κάρτα μπορεί να το κρατήσει με ένα τέταρτο έως μισό επιπλέον περιθώριο για την κρυφή μνήμη KV και το runtime· κάτω από αυτό, φορτώνει και μετά ξεμένει μόλις μεγαλώσει το context. Είναι ο ίδιος κανόνας με τον οποίο η σελίδα μας για LLM διαστασιολογεί κάθε κάρτα.
| Model size | Precision | Weights | 8 GB, locked | 64 GB, unlocked |
|---|---|---|---|---|
| 7-8 billion parameters | 16-bit | 16 GB | — | fits |
| 8-bit | 8 GB | — | fits | |
| 4-bit | 5 GB | fits | fits | |
| 13-14 billion parameters | 16-bit | 28 GB | — | fits |
| 8-bit | 14 GB | — | fits | |
| 4-bit | 8 GB | — | fits | |
| 30-34 billion parameters | 16-bit | 68 GB | — | — |
| 8-bit | 34 GB | — | fits | |
| 4-bit | 19 GB | — | fits | |
| 70 billion parameters | 16-bit | 140 GB | — | — |
| 8-bit | 70 GB | — | — | |
| 4-bit | 38 GB | — | fits |
Μια ξεκλείδωτη CMP είναι μια πολύ καλή κάρτα συμπερασμού για την τιμή της. Δεν είναι A100, και αυτά είναι τα σημεία όπου φαίνεται.
Η κάρτα είναι ξεχωριστή γραμμή στο τιμολόγιο και το μηχάνημα άλλη· τα δύο αθροίζονται. Τα παρακάτω νούμερα είναι το ελάχιστο κόστος αυτής της σύνθεσης: η κάρτα στο φθηνότερο πλήρες μηχάνημα που τη δέχεται, πριν από κάθε φόρο πωλήσεων. Ο διαμορφωτής μπορεί να ανοίξει με περισσότερη μνήμη από αυτήν· αλλάξτε εκεί τον επεξεργαστή, τη μνήμη ή τους δίσκους και κοστολογεί κάθε αλλαγή τη στιγμή που την κάνετε.
| Card | NVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver) |
|---|---|
| Card, per month | $189 |
| Machine | Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps |
| Machine, per month | $83.67 |
| Together | $272.67 a month |
| Setup | $29 once |
| Cards per machine | 1 to 4 |
| Cities | New York, Bucharest, San Francisco and Miami |
| Term | Monthly; 15% off on a twelve-month cycle |
| Driver | NVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04, 24.04 or 26.04 |