Die CMP 170HX trägt denselben GA100-Die wie eine A100 und verließ das Werk mit dem größten Teil dieses Dies abgeriegelt: 8 GB ihres HBM2e sichtbar, FP32 auf ein Rinnsal gedrosselt, die Verbindung auf PCIe Gen 1 festgehalten. Ein gepatchter Build von NVIDIAs offenem Treiber reißt die Zäune nieder. Wir kompilieren ihn in Ubuntu, während wir Ihren Server installieren, sodass die Karte entsperrt ist, bevor Sie sich das erste Mal anmelden.
LTT Labs hat im September 2026 eine CMP 170HX freigeschaltet und sie auf demselben Prüfstand gegen sich selbst antreten lassen – gesperrt und entsperrt. Es sind ihre Zahlen, nicht unsere, und jede Zeile nennt ihre Herkunft. Wir zitieren sie wegen der Größenordnung der Veränderung: Die Token-Raten hängen vom Modell, der Quantisierung, dem llama.cpp-Build und den Flags ab, lesen Sie sie also als Verhältnis, nicht als Versprechen.
| Measure | As NVIDIA shipped it | Unlocked | Source |
|---|---|---|---|
| Card memory | 8 GB HBM2e | 64 GB HBM2e | cmpunlocker; 65,536 MiB measured by LTT Labs |
| FP32 fused multiply-add | about 0.39 TFLOPS | unthrottled | 170th Street (stock); cmpunlocker (full SM throughput) |
| PCIe link | Gen 1 x4 | Gen 2 x4 | cmpunlocker |
| Host to card, measured | 0.84 GB/s | 1.68 GB/s | LTT Labs, nvbandwidth |
| 8B model at 4-bit, generating | 30 tokens/s | 113 tokens/s | LTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M |
| 8B model at 4-bit, reading a prompt | 351 tokens/s | 2,994 tokens/s | LTT Labs, llama.cpp, pp512 |
| 27B model at 4-bit (~16 GB) | does not fit | 38 tokens/s | LTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M |
| 27B model at 8-bit (~29 GB) | does not fit | 33 tokens/s | LTT Labs, llama.cpp, Qwen 3.8 27B Q8_0 |
Der Speicher ist die Veränderung, auf die es ankommt. Mit 8 GB fasst die Karte ein kleines Modell und sonst wenig. Mit 64 GB fasst sie ein Modell mit 27 Milliarden Parametern in 8-Bit, wobei der größte Teil der Karte noch für Kontext frei bleibt – genau der Unterschied zwischen einer Karte zum Experimentieren und einer, von der aus man bereitstellen kann.
Die Token-Erzeugung hängt an der Bandbreite, das Prompt-Lesen an der Rechenleistung. Beim Erzeugen von Text ist die Geschwindigkeit entscheidend, mit der die Gewichte aus dem Speicher strömen – darin war HBM2e schon immer gut; beim Lesen eines langen Prompts sind die Multiply-Add-Einheiten der Flaschenhals, und genau dort drückte die Drossel am stärksten und zeigt sich die Freischaltung am deutlichsten.
Die Verbindung spielt kaum noch eine Rolle, sobald ein Modell geladen ist. Gen 2 x4 verdoppelt die Host-zu-Karte-Rate und verkürzt so das Laden. Danach liegen die Gewichte auf der Karte, und der Bus ist untätig.
Jeder kann das cmpunlocker-README lesen. Der Teil, für den sich das Bezahlen lohnt, ist alles darum herum – erledigt vor der Übergabe und danach funktionsfähig gehalten. Sie müssen nichts ausführen.
Das Installationsprogramm fügt NVIDIAs CUDA-Repository hinzu und installiert den offenen Kernel-Treiber 610.57.04, headless und ohne DKMS, zusammen mit dem Paket nvidia-driver-pinning-610.57.04, das jeden Bestandteil davon auf dieser Version hält. Der Unlock ist für genau einen Treiber gebaut; die Festsetzung verhindert, dass ein routinemäßiges apt upgrade ihm die Bibliotheken unter dem Hintern wegzieht.
Wir holen cmpunlocker bei einem festen Commit und bauen dessen gepatchtes nvidia.ko im neuen System, gegen den Kernel, mit dem es gleich booten wird, bevor das Installationsprogramm den Rechner ausschaltet. Die Patches ändern, wie der Treiber die Karte hochfährt. Auf der Karte wird nichts geflasht; entfernt man den Treiber, kehrt sie exakt in ihren vorherigen Zustand zurück.
Der Unlock greift nur beim ersten Treiberladen, nachdem die Karte stromlos war. Unsere Ubuntu-Installationen enden bereits so: Das Installationsprogramm schaltet den Server aus, und wir schalten ihn über sein BMC wieder ein, sodass das Erste, was die Karte berührt, der gepatchte Treiber ist.
Wenn das installierte System zum ersten Mal antwortet, fragt die Installation jede Karte, als was sie hochgekommen ist — Speicher, PCIe-Generation und Linkbreite — und schreibt die Antwort ins Setup-Protokoll des Servers, wo der Support sie einsehen kann. cmp-unlock status liefert Ihnen dieselbe Antwort jederzeit aus einer Shell.
Ein Hook in /etc/kernel/postinst.d baut die gepatchten Module für jeden neuen Kernel neu, aus einer auf der Maschine gehaltenen Kopie von NVIDIAs Quellcode, sodass ein unbeaufsichtigtes Upgrade die Karte nicht stillschweigend auf 8 GB zurückwirft. apt wird außerdem angewiesen, die Pakete abzulehnen, die einen zweiten, unveränderten Treiber danebenstellen würden; installieren Sie CUDA mit apt install cuda-toolkit, und es kommt nie dazu.
Nur Gewichte, aufgerundet. Ein Modell gilt als passend, wenn die Karte es aufnehmen kann und noch ein Viertel bis die Hälfte zusätzlich für den KV-Cache und die Laufzeit übrig bleibt; darunter lädt es und geht dann sofort aus, sobald der Kontext wächst. Es ist dieselbe Regel, nach der unsere LLM-Seite jede Karte dimensioniert.
| Model size | Precision | Weights | 8 GB, locked | 64 GB, unlocked |
|---|---|---|---|---|
| 7-8 billion parameters | 16-bit | 16 GB | — | fits |
| 8-bit | 8 GB | — | fits | |
| 4-bit | 5 GB | fits | fits | |
| 13-14 billion parameters | 16-bit | 28 GB | — | fits |
| 8-bit | 14 GB | — | fits | |
| 4-bit | 8 GB | — | fits | |
| 30-34 billion parameters | 16-bit | 68 GB | — | — |
| 8-bit | 34 GB | — | fits | |
| 4-bit | 19 GB | — | fits | |
| 70 billion parameters | 16-bit | 140 GB | — | — |
| 8-bit | 70 GB | — | — | |
| 4-bit | 38 GB | — | fits |
Eine entsperrte CMP ist für ihren Preis eine sehr gute Inferenzkarte. Sie ist keine A100, und hier zeigt sich das.
Die Karte steht als eigene Position auf der Rechnung und die Maschine als weitere; beides addiert sich. Die Zahlen unten sind das Minimum, das dieser Build kosten kann: die Karte in der günstigsten vollständigen Maschine, die sie aufnimmt, vor jeder Umsatzsteuer. Der Konfigurator öffnet möglicherweise mit mehr Arbeitsspeicher; ändern Sie dort Prozessor, Arbeitsspeicher oder Festplatten, wird jede Änderung sofort eingepreist.
| Card | NVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver) |
|---|---|
| Card, per month | $189 |
| Machine | Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps |
| Machine, per month | $83.67 |
| Together | $272.67 a month |
| Setup | $29 once |
| Cards per machine | 1 to 4 |
| Cities | New York, Bucharest, San Francisco and Miami |
| Term | Monthly; 15% off on a twelve-month cycle |
| Driver | NVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04, 24.04 or 26.04 |