NVIDIA CMP 170HX · GA100 · déverrouillée dès l’installation

Serveurs dédiés CMP déverrouillés. Les 64 Go de la carte, pas les 8 que NVIDIA a laissés actifs.

La CMP 170HX embarque la même puce GA100 qu’une A100, et elle a quitté l’usine avec l’essentiel de cette puce clôturé : 8 Go de HBM2e visibles, un FP32 bridé au minimum, la liaison maintenue en PCIe Gen 1. Une version patchée du pilote ouvert de NVIDIA abat ces clôtures. Nous la compilons dans Ubuntu pendant l’installation de votre serveur, si bien que la carte est déverrouillée avant votre première connexion.

64 GB HBM2e per cardUbuntu, Debian, AlmaLinux or RockyUp to 4 cards per machinefrom $272.67/mo complete
Avant et après, sur la même carte

Ce que change le pilote patché

LTT Labs a déverrouillé une CMP 170HX en septembre 2026 et l’a comparée à elle-même, verrouillée puis déverrouillée, sur un même banc de test. Ce sont leurs chiffres, pas les nôtres, et chaque ligne indique sa provenance. Nous les citons pour l’ampleur du changement : les débits de jetons varient selon le modèle, la quantification, la version de llama.cpp et les options, alors lisez-les comme un rapport plutôt qu’une promesse.

MeasureAs NVIDIA shipped itUnlockedSource
Card memory8 GB HBM2e64 GB HBM2ecmpunlocker; 65,536 MiB measured by LTT Labs
FP32 fused multiply-addabout 0.39 TFLOPSunthrottled170th Street (stock); cmpunlocker (full SM throughput)
PCIe linkGen 1 x4Gen 2 x4cmpunlocker
Host to card, measured0.84 GB/s1.68 GB/sLTT Labs, nvbandwidth
8B model at 4-bit, generating30 tokens/s113 tokens/sLTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M
8B model at 4-bit, reading a prompt351 tokens/s2,994 tokens/sLTT Labs, llama.cpp, pp512
27B model at 4-bit (~16 GB)does not fit38 tokens/sLTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M
27B model at 8-bit (~29 GB)does not fit33 tokens/sLTT Labs, llama.cpp, Qwen 3.8 27B Q8_0

La mémoire est le changement qui compte. À 8 Go, la carte ne contient qu’un petit modèle et guère plus. À 64 Go, elle contient un modèle de 27 milliards de paramètres en 8 bits avec l’essentiel de la carte encore libre pour le contexte, ce qui fait la différence entre une carte pour expérimenter et une carte pour servir.

La génération de jetons dépend de la bande passante, la lecture des invites de l’arithmétique. Générer du texte est limité par la vitesse à laquelle les poids sortent de la mémoire, ce que la HBM2e a toujours su faire ; lire une longue invite est limité par les unités de multiplication-addition, là où le bridage faisait le plus mal et là où le déverrouillage se voit le plus.

La liaison compte à peine une fois le modèle chargé. Le Gen 2 x4 double le débit hôte-carte, ce qui raccourcit le chargement. Ensuite, les poids vivent sur la carte et le bus reste inactif.

Sources : LTT Labs, “Actually Download More RAM” (12 septembre 2026) pour chaque ligne mesurée ; 170th Street pour le chiffre FP32 d’origine ; cmpunlocker pour ce que les patchs restaurent.

L’installation, étape par étape

Comment le déverrouillage arrive sur la machine

Tout le monde peut lire le README de cmpunlocker. Ce qui mérite d’être payé, c’est tout ce qui l’entoure, réalisé avant la remise et maintenu fonctionnel ensuite. Vous n’avez rien à exécuter.

  1. Le pilote ouvert de NVIDIA, épinglé à une version précise

    L’installateur ajoute le dépôt CUDA de NVIDIA et installe l’espace utilisateur du pilote ouvert pour 610.57.04, sans affichage et sans DKMS, puis fige chacun de ses éléments à cette version : le paquet nvidia-driver-pinning-610.57.04 sur Ubuntu et Debian, un verrou de version dnf sur AlmaLinux et Rocky. Le déverrouillage est conçu pour un pilote exact ; c’est ce verrou qui empêche une mise à jour de routine de retirer les bibliothèques sur lesquelles il repose.

  2. cmpunlocker, compilé pour votre noyau

    Nous récupérons cmpunlocker à un commit fixe et compilons son nvidia.ko patché dans le nouveau système, contre le noyau qu’il s’apprête à démarrer, avant que l’installateur ne s’éteigne. Les correctifs modifient la façon dont le pilote initialise la carte. Rien n’est flashé sur la carte, donc retirer le pilote la ramène exactement à son état d’origine.

  3. Un premier démarrage à froid

    Le déverrouillage ne prend effet qu’au premier chargement du pilote après la mise hors tension de la carte. Chacune de ces installations se termine donc par l’extinction du serveur, puis son redémarrage via son BMC, et la première chose à toucher la carte est le pilote patché.

  4. Vérifié, puis testé en mémoire, dès la première connexion

    Lorsque le système installé répond pour la première fois, l’installation demande à chaque carte ce qu’elle est devenue — mémoire, génération PCIe et largeur de lien — puis écrit et relit chaque octet de mémoire que le pilote distribue, avec des motifs fixes, d’adresse et pseudo-aléatoires. Les deux réponses sont consignées dans le journal d’installation du serveur, où le support peut les consulter. cmp-unlock status et cmp-unlock memtest vous donnent les mêmes réponses depuis un shell.

  5. Les mises à jour du noyau ne le reverrouillent pas

    Un crochet noyau (/etc/kernel/postinst.d, ou /etc/kernel/install.d sur AlmaLinux et Rocky) reconstruit les modules patchés pour chaque nouveau noyau, à partir d’une copie des sources de NVIDIA conservée sur la machine, afin qu’une mise à niveau sans surveillance ne renvoie pas discrètement la carte à 8 Go. Le gestionnaire de paquets reçoit aussi l’instruction de refuser les paquets qui installeraient un second pilote standard à côté ; installez CUDA avec apt install cuda-toolkit ou dnf install cuda-toolkit et il n’apparaît jamais.

Dimensionnement, selon la règle utilisée partout ailleurs sur le site

Ce qui tient dans 64 Go, et ce qui tenait dans 8

Poids uniquement, arrondis au supérieur. Un modèle est considéré comme tenant sur la carte lorsque celle-ci peut le contenir avec une marge d’un quart à la moitié pour le cache KV et l’exécution ; en dessous, il se charge puis s’arrête dès que le contexte s’allonge. C’est la même règle que notre page LLM applique pour dimensionner chaque carte.

Model sizePrecisionWeights8 GB, locked64 GB, unlocked
7-8 billion parameters16-bit16 GB—fits
8-bit8 GB—fits
4-bit5 GBfitsfits
13-14 billion parameters16-bit28 GB—fits
8-bit14 GB—fits
4-bit8 GB—fits
30-34 billion parameters16-bit68 GB——
8-bit34 GB—fits
4-bit19 GB—fits
70 billion parameters16-bit140 GB——
8-bit70 GB——
4-bit38 GB—fits

Deux cartes dans une même machine contiennent ce qu’une seule carte ne peut pas : un modèle de 70 milliards de paramètres en 8 bits nécessite environ 70 Go, ce qui tient sur une paire. Répartir un modèle sur plusieurs cartes, ou plusieurs machines, est expliqué sur la page multi-GPU. Prévoyez aussi au moins autant de mémoire système que le plus gros fichier de modèle ; la configuration la moins chère ci-dessous a 16 Go, ce qui charge un fichier de 38 Go, mais lentement.

À lire avant de commander

Ce que le déverrouillage ne change pas

Une CMP déverrouillée est une très bonne carte d’inférence pour son prix. Ce n’est pas une A100, et voici où cela se voit.

Pas d’ECC
La correction d’erreurs sur la HBM2e reste désactivée ; elle figure sur la liste des choses que personne n’a encore déverrouillées. En inférence, un bit inversé coûte une nouvelle tentative. Pour un entraînement d’une semaine, ou tout ce qui doit être exact au bit près, choisissez une carte dont la mémoire est protégée, comme la L40S.
PCIe Gen 2 x4
Environ 1,7 Go/s de l’hôte vers la carte, mesuré, si bien que le bus seul met environ 25 secondes à déplacer un modèle de 38 Go. Un modèle le traverse une fois puis vit sur la carte, c’est pourquoi le service ne s’en aperçoit presque pas. Une boucle d’entraînement qui envoie des lots depuis la mémoire système le remarque à chaque étape.
Les formats numériques d’Ampere’s
FP16, BF16, TF32 et INT8 sur les cœurs tensoriels. Pas de FP8 ni de FP4 ; les deux sont arrivés avec les générations suivant Ampere. Les modèles quantifiés en GGUF, AWQ ou GPTQ fonctionnent très bien, car ils sont décompressés vers des formats que la carte possède.
Linux uniquement
Le déverrouillage est un pilote noyau Linux. Commandez la machine avec Ubuntu, Debian, AlmaLinux ou Rocky Linux et il est intégré ; sous Windows ou Proxmox VE, la carte fonctionne telle que NVIDIA l’a livrée, avec 8 Go.
Secure Boot désactivé
Les modules patchés ne sont pas signés, donc un noyau avec Secure Boot actif les refuse, et la carte se retrouve sans aucun pilote. Laissez-le désactivé.
Code communautaire, pas celui de NVIDIA’s
cmpunlocker est un projet open source (GPL-2.0) d’Amogh Munikote, et NVIDIA ne le prend pas en charge. Nous installons un commit que nous avons compilé et vérifié, et nous déplaçons ce repère volontairement, jamais automatiquement.
La carte de 10 Go s’arrête à 40 Go
La carte de 8 Go se déverrouille à 64 Go. La carte de 10 Go a plus de mémoire sur son boîtier qu’elle n’en supporte en charge, donc le déverrouillage la limite à 40 Go, la taille qui reste stable. L’installation lit laquelle se trouve dans la machine et applique la bonne géométrie à chaque carte.
La machine derrière le bouton

Une CMP débloquée, dans la machine la moins chère qui l’accepte

La carte constitue une ligne à part sur la facture et la machine une autre ; les deux s’additionnent. Les montants ci-dessous représentent le minimum que cette configuration peut coûter : la carte dans la machine complète la moins chère qui l’accepte, avant toute taxe de vente. Le configurateur peut s’ouvrir avec davantage de mémoire ; modifiez-y le processeur, la mémoire ou les disques et chaque changement est chiffré au fur et à mesure.

La NVIDIA CMP 170HX, une carte passive pleine longueur sans sorties vidéo sur son équerre
Une carte passive pleine longueur qui consomme jusqu’à 250 W et n’a pas de ventilateur. Elle est conçue pour un châssis serveur dont le flux d’air va de l’avant vers l’arrière, et c’est là que les nôtres tournent.
CardNVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver)
Card, per month$189
MachineIntel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
Machine, per month$83.67
Together$272.67 a month
Setup$29 once
Cards per machine1 to 4
CitiesNew York, Bucharest, San Francisco and Miami
TermMonthly; 15% off on a twelve-month cycle
DriverNVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04–26.04, Debian 12/13, AlmaLinux 9/10 or Rocky Linux 9/10
Memory testEvery byte the driver hands out, written and read back on each card before handover

Ouvrir cette configuration dans le configurateur →

Les frais d’installation s’expliquent par le fait que la carte est montée sur commande : une machine à laquelle on ajoute une carte est une configuration personnalisée. Le montant mensuel est identique au renouvellement. Toutes les autres cartes que nous installons sont tarifées de la même manière sur la page GPU.

Questions sur cette carte

Serveurs CMP débloqués, questions et réponses

Qu’est-ce qu’une CMP 170HX débloquée ?
Une NVIDIA CMP 170HX exécutant une version corrigée du pilote à noyau ouvert de NVIDIA, issue du projet cmpunlocker. La carte est une GA100, la puce de l’A100, que NVIDIA a livrée avec 8 Go de sa HBM2e visibles, son multiplication-addition FP32 bridée et sa liaison maintenue en PCIe Gen 1. Le pilote corrigé active 64 Go, supprime le bridage et entraîne la liaison en Gen 2 à chaque démarrage de la carte. Rien sur la carte elle-même n’est modifié.
Quelle quantité de mémoire possède une CMP 170HX débloquée ?
64 Go de HBM2e sur la carte de 8 Go, ce que rapporte nvidia-smi une fois le pilote corrigé en cours d’exécution. La version 10 Go de la carte est maintenue à 40 Go, la taille qui reste stable sur celle-ci. Sans le pilote corrigé, chaque carte affiche ce que NVIDIA a livré : 8 ou 10 Go.
Le déblocage survit-il aux redémarrages et aux mises à jour du noyau ?
Oui. Les modules corrigés sont installés comme n’importe quel autre module du noyau et se chargent à chaque démarrage. Lorsqu’un nouveau noyau arrive, un crochet les reconstruit pour celui-ci à partir des sources NVIDIA conservées sur la machine, avant même que vous ne démarriez dessus. Si une carte devait tout de même démarrer à 8 Go, exécutez cmp-unlock build avec votre version du noyau et coupez puis remettez l’alimentation du serveur depuis le panneau de contrôle.
Quels systèmes d’exploitation reçoivent le pilote débloqué ?
Ubuntu 22.04, 24.04 et 26.04, Debian 12 et 13, AlmaLinux 9 et 10, et Rocky Linux 9 et 10, installés par nos soins, sur toute machine équipée de la carte : cela fait partie de l’installation, ce n’est pas une option à cocher. Windows et Proxmox VE reçoivent la carte telle que NVIDIA l’a livrée : le déblocage est un pilote de noyau Linux, et sur Proxmox les cartes vont généralement aux machines virtuelles, qu’un pilote hôte n’atteint pas.
Puis-je utiliser CUDA, PyTorch, vLLM et llama.cpp dessus ?
Oui. Le pilote est le 610.57.04 de NVIDIA avec les correctifs appliqués, donc tout ce qui est conçu pour une carte Ampere avec un pilote récent fonctionne. Installez la boîte à outils CUDA seule, avec apt install cuda-toolkit ou dnf install cuda-toolkit ; les méta-paquets cuda et cuda-drivers apporteraient avec eux un second pilote standard, le gestionnaire de paquets est donc configuré pour les refuser.
Un modèle de 70 milliards de paramètres fonctionnera-t-il sur une seule carte ?
En 4 bits, oui : les poids occupent environ 38 Go, ce qui laisse la marge demandée par notre règle de dimensionnement sur une carte de 64 Go. En 8 bits, ils occupent environ 70 Go, ce qui nécessite deux cartes ; une machine en accepte jusqu’à quatre.
Combien de cartes puis-je mettre dans un seul serveur ?
Jusqu’à quatre dans la machine vers laquelle cette page renvoie. Choisissez le nombre dans le configurateur. Pour plus de quatre, ou pour un modèle réparti sur plusieurs machines, consultez la page multi-GPU.
La mémoire débloquée est-elle fiable ?
La carte de 8 Go à 64 Go est la combinaison qui a tenu lors des tests publics, et la carte de 10 Go s’arrête à 40 Go pour la même raison. Il s’agit toutefois de mémoire triée par NVIDIA, et une carte peut porter une zone faible : LTT Labs en a trouvé une parmi les cartes qu’ils ont testées. Chaque installation la teste donc : après le premier démarrage à froid, chaque octet que le pilote distribuera est écrit puis relu sur chaque carte, avec des motifs fixes, d’adresse et pseudo-aléatoires chacun inversé sur place, et le résultat est consigné dans le journal d’installation du serveur. C’est une vérification à la livraison, pas une garantie pour des années ; si une carte se comporte mal par la suite, exécutez cmp-unlock memtest et dites-nous ce qu’il indique. Une carte défaillante est remplacée comme n’importe quelle autre pièce.
Pourquoi y a-t-il des frais d’installation sur cette configuration ?
Parce que la carte est montée sur commande. Une machine avec une carte ajoutée est une configuration personnalisée, et une configuration personnalisée entraîne les frais d’installation uniques indiqués dans le tableau ci-dessus. Ils sont facturés une seule fois, et le montant mensuel ne change pas au renouvellement.
Où se trouvent ces serveurs ?
Dans chaque ville indiquée dans le tableau ci-dessus. La gamme est également vendue à Amsterdam, mais le configurateur ne peut pas y installer de carte, donc une CMP débloquée n’est pas disponible dans cette ville.

Autres pistes à explorer