La CMP 170HX embarque la même puce GA100 qu’une A100, et elle a quitté l’usine avec l’essentiel de cette puce clôturé : 8 Go de HBM2e visibles, un FP32 bridé au minimum, la liaison maintenue en PCIe Gen 1. Une version patchée du pilote ouvert de NVIDIA abat ces clôtures. Nous la compilons dans Ubuntu pendant l’installation de votre serveur, si bien que la carte est déverrouillée avant votre première connexion.
LTT Labs a déverrouillé une CMP 170HX en septembre 2026 et l’a comparée à elle-même, verrouillée puis déverrouillée, sur un même banc de test. Ce sont leurs chiffres, pas les nôtres, et chaque ligne indique sa provenance. Nous les citons pour l’ampleur du changement : les débits de jetons varient selon le modèle, la quantification, la version de llama.cpp et les options, alors lisez-les comme un rapport plutôt qu’une promesse.
| Measure | As NVIDIA shipped it | Unlocked | Source |
|---|---|---|---|
| Card memory | 8 GB HBM2e | 64 GB HBM2e | cmpunlocker; 65,536 MiB measured by LTT Labs |
| FP32 fused multiply-add | about 0.39 TFLOPS | unthrottled | 170th Street (stock); cmpunlocker (full SM throughput) |
| PCIe link | Gen 1 x4 | Gen 2 x4 | cmpunlocker |
| Host to card, measured | 0.84 GB/s | 1.68 GB/s | LTT Labs, nvbandwidth |
| 8B model at 4-bit, generating | 30 tokens/s | 113 tokens/s | LTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M |
| 8B model at 4-bit, reading a prompt | 351 tokens/s | 2,994 tokens/s | LTT Labs, llama.cpp, pp512 |
| 27B model at 4-bit (~16 GB) | does not fit | 38 tokens/s | LTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M |
| 27B model at 8-bit (~29 GB) | does not fit | 33 tokens/s | LTT Labs, llama.cpp, Qwen 3.8 27B Q8_0 |
La mémoire est le changement qui compte. À 8 Go, la carte ne contient qu’un petit modèle et guère plus. À 64 Go, elle contient un modèle de 27 milliards de paramètres en 8 bits avec l’essentiel de la carte encore libre pour le contexte, ce qui fait la différence entre une carte pour expérimenter et une carte pour servir.
La génération de jetons dépend de la bande passante, la lecture des invites de l’arithmétique. Générer du texte est limité par la vitesse à laquelle les poids sortent de la mémoire, ce que la HBM2e a toujours su faire ; lire une longue invite est limité par les unités de multiplication-addition, là où le bridage faisait le plus mal et là où le déverrouillage se voit le plus.
La liaison compte à peine une fois le modèle chargé. Le Gen 2 x4 double le débit hôte-carte, ce qui raccourcit le chargement. Ensuite, les poids vivent sur la carte et le bus reste inactif.
Tout le monde peut lire le README de cmpunlocker. Ce qui mérite d’être payé, c’est tout ce qui l’entoure, réalisé avant la remise et maintenu fonctionnel ensuite. Vous n’avez rien à exécuter.
L’installateur ajoute le dépôt CUDA de NVIDIA et installe l’espace utilisateur du pilote ouvert pour 610.57.04, sans affichage et sans DKMS, puis fige chacun de ses éléments à cette version : le paquet nvidia-driver-pinning-610.57.04 sur Ubuntu et Debian, un verrou de version dnf sur AlmaLinux et Rocky. Le déverrouillage est conçu pour un pilote exact ; c’est ce verrou qui empêche une mise à jour de routine de retirer les bibliothèques sur lesquelles il repose.
Nous récupérons cmpunlocker à un commit fixe et compilons son nvidia.ko patché dans le nouveau système, contre le noyau qu’il s’apprête à démarrer, avant que l’installateur ne s’éteigne. Les correctifs modifient la façon dont le pilote initialise la carte. Rien n’est flashé sur la carte, donc retirer le pilote la ramène exactement à son état d’origine.
Le déverrouillage ne prend effet qu’au premier chargement du pilote après la mise hors tension de la carte. Chacune de ces installations se termine donc par l’extinction du serveur, puis son redémarrage via son BMC, et la première chose à toucher la carte est le pilote patché.
Lorsque le système installé répond pour la première fois, l’installation demande à chaque carte ce qu’elle est devenue — mémoire, génération PCIe et largeur de lien — puis écrit et relit chaque octet de mémoire que le pilote distribue, avec des motifs fixes, d’adresse et pseudo-aléatoires. Les deux réponses sont consignées dans le journal d’installation du serveur, où le support peut les consulter. cmp-unlock status et cmp-unlock memtest vous donnent les mêmes réponses depuis un shell.
Un crochet noyau (/etc/kernel/postinst.d, ou /etc/kernel/install.d sur AlmaLinux et Rocky) reconstruit les modules patchés pour chaque nouveau noyau, à partir d’une copie des sources de NVIDIA conservée sur la machine, afin qu’une mise à niveau sans surveillance ne renvoie pas discrètement la carte à 8 Go. Le gestionnaire de paquets reçoit aussi l’instruction de refuser les paquets qui installeraient un second pilote standard à côté ; installez CUDA avec apt install cuda-toolkit ou dnf install cuda-toolkit et il n’apparaît jamais.
Poids uniquement, arrondis au supérieur. Un modèle est considéré comme tenant sur la carte lorsque celle-ci peut le contenir avec une marge d’un quart à la moitié pour le cache KV et l’exécution ; en dessous, il se charge puis s’arrête dès que le contexte s’allonge. C’est la même règle que notre page LLM applique pour dimensionner chaque carte.
| Model size | Precision | Weights | 8 GB, locked | 64 GB, unlocked |
|---|---|---|---|---|
| 7-8 billion parameters | 16-bit | 16 GB | — | fits |
| 8-bit | 8 GB | — | fits | |
| 4-bit | 5 GB | fits | fits | |
| 13-14 billion parameters | 16-bit | 28 GB | — | fits |
| 8-bit | 14 GB | — | fits | |
| 4-bit | 8 GB | — | fits | |
| 30-34 billion parameters | 16-bit | 68 GB | — | — |
| 8-bit | 34 GB | — | fits | |
| 4-bit | 19 GB | — | fits | |
| 70 billion parameters | 16-bit | 140 GB | — | — |
| 8-bit | 70 GB | — | — | |
| 4-bit | 38 GB | — | fits |
Une CMP déverrouillée est une très bonne carte d’inférence pour son prix. Ce n’est pas une A100, et voici où cela se voit.
La carte constitue une ligne à part sur la facture et la machine une autre ; les deux s’additionnent. Les montants ci-dessous représentent le minimum que cette configuration peut coûter : la carte dans la machine complète la moins chère qui l’accepte, avant toute taxe de vente. Le configurateur peut s’ouvrir avec davantage de mémoire ; modifiez-y le processeur, la mémoire ou les disques et chaque changement est chiffré au fur et à mesure.
| Card | NVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver) |
|---|---|
| Card, per month | $189 |
| Machine | Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps |
| Machine, per month | $83.67 |
| Together | $272.67 a month |
| Setup | $29 once |
| Cards per machine | 1 to 4 |
| Cities | New York, Bucharest, San Francisco and Miami |
| Term | Monthly; 15% off on a twelve-month cycle |
| Driver | NVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04–26.04, Debian 12/13, AlmaLinux 9/10 or Rocky Linux 9/10 |
| Memory test | Every byte the driver hands out, written and read back on each card before handover |