NVIDIA CMP 170HX · GA100 · bei der Installation entsperrt

Entsperrte CMP-Dedicated-Server. Alle 64 GB der Karte, nicht die 8 GB, die NVIDIA eingeschaltet ließ.

Die CMP 170HX trägt denselben GA100-Die wie eine A100 und verließ das Werk mit dem größten Teil dieses Dies abgeriegelt: 8 GB ihres HBM2e sichtbar, FP32 auf ein Rinnsal gedrosselt, die Verbindung auf PCIe Gen 1 festgehalten. Ein gepatchter Build von NVIDIAs offenem Treiber reißt die Zäune nieder. Wir kompilieren ihn in Ubuntu, während wir Ihren Server installieren, sodass die Karte entsperrt ist, bevor Sie sich das erste Mal anmelden.

64 GB HBM2e per cardUbuntu 22.04 / 24.04 / 26.04Up to 4 cards per machinefrom $272.67/mo complete
Vorher und nachher, auf derselben Karte

Was der gepatchte Treiber ändert

LTT Labs hat im September 2026 eine CMP 170HX freigeschaltet und sie auf demselben Prüfstand gegen sich selbst antreten lassen – gesperrt und entsperrt. Es sind ihre Zahlen, nicht unsere, und jede Zeile nennt ihre Herkunft. Wir zitieren sie wegen der Größenordnung der Veränderung: Die Token-Raten hängen vom Modell, der Quantisierung, dem llama.cpp-Build und den Flags ab, lesen Sie sie also als Verhältnis, nicht als Versprechen.

MeasureAs NVIDIA shipped itUnlockedSource
Card memory8 GB HBM2e64 GB HBM2ecmpunlocker; 65,536 MiB measured by LTT Labs
FP32 fused multiply-addabout 0.39 TFLOPSunthrottled170th Street (stock); cmpunlocker (full SM throughput)
PCIe linkGen 1 x4Gen 2 x4cmpunlocker
Host to card, measured0.84 GB/s1.68 GB/sLTT Labs, nvbandwidth
8B model at 4-bit, generating30 tokens/s113 tokens/sLTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M
8B model at 4-bit, reading a prompt351 tokens/s2,994 tokens/sLTT Labs, llama.cpp, pp512
27B model at 4-bit (~16 GB)does not fit38 tokens/sLTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M
27B model at 8-bit (~29 GB)does not fit33 tokens/sLTT Labs, llama.cpp, Qwen 3.8 27B Q8_0

Der Speicher ist die Veränderung, auf die es ankommt. Mit 8 GB fasst die Karte ein kleines Modell und sonst wenig. Mit 64 GB fasst sie ein Modell mit 27 Milliarden Parametern in 8-Bit, wobei der größte Teil der Karte noch für Kontext frei bleibt – genau der Unterschied zwischen einer Karte zum Experimentieren und einer, von der aus man bereitstellen kann.

Die Token-Erzeugung hängt an der Bandbreite, das Prompt-Lesen an der Rechenleistung. Beim Erzeugen von Text ist die Geschwindigkeit entscheidend, mit der die Gewichte aus dem Speicher strömen – darin war HBM2e schon immer gut; beim Lesen eines langen Prompts sind die Multiply-Add-Einheiten der Flaschenhals, und genau dort drückte die Drossel am stärksten und zeigt sich die Freischaltung am deutlichsten.

Die Verbindung spielt kaum noch eine Rolle, sobald ein Modell geladen ist. Gen 2 x4 verdoppelt die Host-zu-Karte-Rate und verkürzt so das Laden. Danach liegen die Gewichte auf der Karte, und der Bus ist untätig.

Quellen: LTT Labs, “Actually Download More RAM” (12. September 2026) für jede gemessene Zeile; 170th Street für den FP32-Wert ab Werk; cmpunlocker für das, was die Patches wiederherstellen.

Die Installation, Schritt für Schritt

Wie der Unlock auf die Maschine kommt

Jeder kann das cmpunlocker-README lesen. Der Teil, für den sich das Bezahlen lohnt, ist alles darum herum – erledigt vor der Übergabe und danach funktionsfähig gehalten. Sie müssen nichts ausführen.

  1. NVIDIAs offener Treiber, auf eine Version festgesetzt

    Das Installationsprogramm fügt NVIDIAs CUDA-Repository hinzu und installiert den offenen Kernel-Treiber 610.57.04, headless und ohne DKMS, zusammen mit dem Paket nvidia-driver-pinning-610.57.04, das jeden Bestandteil davon auf dieser Version hält. Der Unlock ist für genau einen Treiber gebaut; die Festsetzung verhindert, dass ein routinemäßiges apt upgrade ihm die Bibliotheken unter dem Hintern wegzieht.

  2. cmpunlocker, für Ihren Kernel kompiliert

    Wir holen cmpunlocker bei einem festen Commit und bauen dessen gepatchtes nvidia.ko im neuen System, gegen den Kernel, mit dem es gleich booten wird, bevor das Installationsprogramm den Rechner ausschaltet. Die Patches ändern, wie der Treiber die Karte hochfährt. Auf der Karte wird nichts geflasht; entfernt man den Treiber, kehrt sie exakt in ihren vorherigen Zustand zurück.

  3. Ein kalter erster Boot

    Der Unlock greift nur beim ersten Treiberladen, nachdem die Karte stromlos war. Unsere Ubuntu-Installationen enden bereits so: Das Installationsprogramm schaltet den Server aus, und wir schalten ihn über sein BMC wieder ein, sodass das Erste, was die Karte berührt, der gepatchte Treiber ist.

  4. Beim ersten Login geprüft

    Wenn das installierte System zum ersten Mal antwortet, fragt die Installation jede Karte, als was sie hochgekommen ist — Speicher, PCIe-Generation und Linkbreite — und schreibt die Antwort ins Setup-Protokoll des Servers, wo der Support sie einsehen kann. cmp-unlock status liefert Ihnen dieselbe Antwort jederzeit aus einer Shell.

  5. Kernel-Updates sperren es nicht wieder

    Ein Hook in /etc/kernel/postinst.d baut die gepatchten Module für jeden neuen Kernel neu, aus einer auf der Maschine gehaltenen Kopie von NVIDIAs Quellcode, sodass ein unbeaufsichtigtes Upgrade die Karte nicht stillschweigend auf 8 GB zurückwirft. apt wird außerdem angewiesen, die Pakete abzulehnen, die einen zweiten, unveränderten Treiber danebenstellen würden; installieren Sie CUDA mit apt install cuda-toolkit, und es kommt nie dazu.

Dimensionierung nach der Regel, die auch der Rest der Website verwendet

Was in 64 GB passt und was in 8 GB passte

Nur Gewichte, aufgerundet. Ein Modell gilt als passend, wenn die Karte es aufnehmen kann und noch ein Viertel bis die Hälfte zusätzlich für den KV-Cache und die Laufzeit übrig bleibt; darunter lädt es und geht dann sofort aus, sobald der Kontext wächst. Es ist dieselbe Regel, nach der unsere LLM-Seite jede Karte dimensioniert.

Model sizePrecisionWeights8 GB, locked64 GB, unlocked
7-8 billion parameters16-bit16 GBfits
8-bit8 GBfits
4-bit5 GBfitsfits
13-14 billion parameters16-bit28 GBfits
8-bit14 GBfits
4-bit8 GBfits
30-34 billion parameters16-bit68 GB
8-bit34 GBfits
4-bit19 GBfits
70 billion parameters16-bit140 GB
8-bit70 GB
4-bit38 GBfits

Zwei Karten in einem Rechner halten, was eine Karte nicht kann: Ein Modell mit 70 Milliarden Parametern bei 8 Bit benötigt etwa 70 GB, was über ein Paar passt. Das Aufteilen eines Modells auf mehrere Karten oder mehrere Rechner behandelt die Multi-GPU-Seite. Geben Sie dem Rechner außerdem mindestens so viel Systemspeicher wie die größte Modelldatei; der günstigste Build unten hat 16 GB, womit eine 38-GB-Datei lädt, nur langsam.

Lesen Sie dies, bevor Sie bestellen

Was das Unlock nicht ändert

Eine entsperrte CMP ist für ihren Preis eine sehr gute Inferenzkarte. Sie ist keine A100, und hier zeigt sich das.

Kein ECC
Die Fehlerkorrektur auf dem HBM2e ist weiterhin ausgeschaltet; sie steht auf der Liste der Dinge, die bisher niemand entsperrt hat. Bei der Inferenz kostet ein gekipptes Bit einen erneuten Versuch. Für ein einwöchiges Training oder alles, was bitexakt sein muss, wählen Sie eine Karte mit geschütztem Speicher, etwa die L40S.
PCIe Gen 2 x4
Etwa 1,7 GB/s vom Host zur Karte, gemessen, sodass allein der Bus rund 25 Sekunden benötigt, um ein 38-GB-Modell zu übertragen. Ein Modell überquert ihn einmal und lebt dann auf der Karte, weshalb das Serving davon kaum etwas merkt. Eine Trainingsschleife, die Batches aus dem Systemspeicher streamt, merkt es bei jedem Schritt.
Ampere’s Zahlenformate
FP16, BF16, TF32 und INT8 auf den Tensor-Kernen. Kein FP8 und kein FP4; beide kamen mit den Generationen nach Ampere. Quantisierte Modelle in GGUF, AWQ oder GPTQ laufen problemlos, weil sie in Formate entpackt werden, die die Karte beherrscht.
Nur Linux
Das Unlock ist ein Linux-Kernel-Treiber. Bestellen Sie die Maschine mit Ubuntu 22.04, 24.04 oder 26.04, dann ist er eingebaut; unter Windows oder einer anderen Distribution läuft die Karte so, wie NVIDIA sie ausgeliefert hat, mit 8 GB.
Secure Boot aus
Die gepatchten Module sind unsigniert, daher verweigert ein Kernel mit erzwungenem Secure Boot sie, und die Karte bleibt ganz ohne Treiber. Lassen Sie es ausgeschaltet.
Community-Code, nicht der von NVIDIA
cmpunlocker ist ein Open-Source-Projekt (GPL-2.0) von Amogh Munikote, und NVIDIA unterstützt es nicht. Wir installieren einen Commit, den wir gebaut und geprüft haben, und wir verschieben diesen Pin bewusst, niemals automatisch.
Die 10-GB-Karte stoppt bei 40 GB
Die 8-GB-Karte wird auf 64 GB entsperrt. Die 10-GB-Karte hat mehr Speicher auf ihrem Package, als unter Last stabil bleibt, daher stoppt das Unlock sie bei 40 GB, der Größe, die stabil bleibt. Die Installation erkennt, welche im Rechner steckt, und wendet auf jede Karte die richtige Geometrie an.
Die Maschine hinter dem Button

Eine freigeschaltete CMP, in der günstigsten Maschine, die sie aufnimmt

Die Karte steht als eigene Position auf der Rechnung und die Maschine als weitere; beides addiert sich. Die Zahlen unten sind das Minimum, das dieser Build kosten kann: die Karte in der günstigsten vollständigen Maschine, die sie aufnimmt, vor jeder Umsatzsteuer. Der Konfigurator öffnet möglicherweise mit mehr Arbeitsspeicher; ändern Sie dort Prozessor, Arbeitsspeicher oder Festplatten, wird jede Änderung sofort eingepreist.

Die NVIDIA CMP 170HX, eine passive Karte in voller Länge ohne Display-Ausgänge an der Blende
Eine passive Karte in voller Länge, die bis zu 250 W aufnimmt und keinen Lüfter hat. Sie ist für ein Servergehäuse gebaut, das Luft von vorn nach hinten zieht, und genau dort laufen unsere.
CardNVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver)
Card, per month$189
MachineIntel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
Machine, per month$83.67
Together$272.67 a month
Setup$29 once
Cards per machine1 to 4
CitiesNew York, Bucharest, San Francisco and Miami
TermMonthly; 15% off on a twelve-month cycle
DriverNVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04, 24.04 or 26.04

Diesen Build im Konfigurator öffnen →

Die Einrichtungsgebühr fällt an, weil die Karte auf Bestellung eingebaut wird: Eine Maschine mit nachträglich hinzugefügter Karte ist ein individueller Build. Der monatliche Betrag bleibt bei Verlängerung gleich. Jede andere Karte, die wir einbauen, wird auf der GPU-Seite genauso bepreist.

Fragen zu dieser Karte

Unlocked-CMP-Server – gefragt und beantwortet

Was ist eine entsperrte CMP 170HX?
Eine NVIDIA CMP 170HX, auf der ein gepatchter Build von NVIDIAs offenem Kernel-Treiber aus dem cmpunlocker-Projekt läuft. Die Karte ist ein GA100, der Die der A100, den NVIDIA mit 8 GB sichtbarem HBM2e ausgeliefert hat, mit gedrosseltem FP32-Multiply-Add und auf PCIe Gen 1 gehaltener Verbindung. Der gepatchte Treiber aktiviert 64 GB, entfernt die Drosselung und trainiert die Verbindung bei jedem Start der Karte auf Gen 2. An der Karte selbst wird nichts verändert.
Wie viel Speicher hat eine entsperrte CMP 170HX?
64 GB HBM2e auf der 8-GB-Karte – das meldet nvidia-smi, sobald der gepatchte Treiber läuft. Die 10-GB-Version der Karte wird bei 40 GB gehalten, der Größe, die auf ihr stabil bleibt. Ohne den gepatchten Treiber zeigt jede Karte das, was NVIDIA ausgeliefert hat: 8 oder 10 GB.
Übersteht die Entsperrung Neustarts und Kernel-Updates?
Ja. Die gepatchten Module werden wie jedes andere Kernel-Modul installiert und bei jedem Boot geladen. Wenn ein neuer Kernel kommt, baut ein Hook sie dafür aus der auf dem Rechner gehaltenen NVIDIA-Quelle neu, bevor Sie überhaupt hineinbooten. Sollte eine Karte trotzdem mit 8 GB hochkommen, führen Sie cmp-unlock build mit Ihrer Kernel-Version aus und starten Sie den Server über das Control Panel neu.
Welche Betriebssysteme erhalten den entsperrten Treiber?
Ubuntu 22.04, 24.04 und 26.04, von uns installiert, auf jedem Rechner mit dieser Karte: Es ist Teil der Installation, keine Option zum Ankreuzen. Windows und die anderen von uns installierten Linux-Distributionen erhalten die Karte so, wie NVIDIA sie ausgeliefert hat, denn die Entsperrung ist ein Linux-Treiber, und wir bauen ihn nur dort, wo wir ihn getestet haben.
Kann ich darauf CUDA, PyTorch, vLLM und llama.cpp nutzen?
Ja. Der Treiber ist NVIDIAs eigener 610.57.04 mit den Patches, daher läuft alles, was für eine Ampere-Karte mit aktuellem Treiber gebaut wurde. Installieren Sie das CUDA-Toolkit mit apt install cuda-toolkit; die Metapakete cuda und cuda-drivers würden einen zweiten, unveränderten Treiber mitbringen, daher ist apt so eingestellt, dass es sie ablehnt.
Läuft ein Modell mit 70 Milliarden Parametern auf einer Karte?
Mit 4 Bit ja: Die Gewichte kommen auf etwa 38 GB, womit auf einer 64-GB-Karte der Spielraum bleibt, den unsere Dimensionierungsregel verlangt. Mit 8 Bit kommen sie auf etwa 70 GB, dafür braucht es zwei Karten; ein Rechner nimmt bis zu vier auf.
Wie viele Karten passen in einen Server?
Bis zu vier in dem Rechner, auf den diese Seite verlinkt. Wählen Sie die Anzahl im Konfigurator. Für mehr als vier oder für ein über mehrere Rechner verteiltes Modell sehen Sie sich die Multi-GPU-Seite an.
Ist der entsperrte Speicher zuverlässig?
Die 8-GB-Karte mit 64 GB ist die Kombination, die sich in öffentlichen Tests bewährt hat, und die 10-GB-Karte bleibt aus demselben Grund bei 40 GB stehen. Es ist dennoch Speicher, den NVIDIA gebinnt hat, und eine Karte kann eine schwache Stelle haben: LTT Labs fand eine unter den von ihnen getesteten Karten. Bei jeder Installation wird geprüft, dass jede Karte mit ihrer vollen Größe hochkommt, was nicht dasselbe ist wie ein langer Speichertest. Führen Sie einen eigenen durch, bevor Sie einer Karte einen tagelangen Job anvertrauen, und melden Sie uns, wenn er fehlschlägt; die Karte wird wie jedes andere Bauteil ersetzt.
Warum gibt es bei diesem Build eine Einrichtungsgebühr?
Weil die Karte auf Bestellung eingebaut wird. Ein Rechner mit nachgerüsteter Karte ist ein Custom Build, und ein Custom Build trägt die einmalige Einrichtungsgebühr aus der Tabelle oben. Sie wird einmal berechnet, und der monatliche Betrag ändert sich bei Verlängerung nicht.
Wo stehen diese Server?
In jeder Stadt, die die Tabelle oben nennt. Die Linie wird auch in Amsterdam verkauft, aber der Konfigurator kann dort keine Karte einbauen, daher ist eine entsperrte CMP in dieser Stadt nicht verfügbar.

Weitere Anlaufstellen