NVIDIA CMP 170HX · GA100 · sbloccata all’installazione

Server dedicati CMP sbloccati. Tutti i 64 GB della scheda, non gli 8 che NVIDIA ha lasciato attivi.

La CMP 170HX monta lo stesso die GA100 di una A100, ed è uscita dalla fabbrica con gran parte di quel die recintato: 8 GB di HBM2e visibili, FP32 strozzato a un rivolo, il collegamento tenuto a PCIe Gen 1. Una build patchata del driver aperto di NVIDIA’ abbatte i recinti. La compiliamo dentro Ubuntu mentre installiamo il tuo server, così la scheda è sbloccata prima del tuo primo accesso.

64 GB HBM2e per cardUbuntu, Debian, AlmaLinux or RockyUp to 4 cards per machinefrom $272.67/mo complete
Prima e dopo, sulla stessa scheda

Cosa cambia con il driver patchato

LTT Labs ha sbloccato una CMP 170HX a settembre 2026 e l'ha confrontata con se stessa, bloccata e sbloccata, sullo stesso banco di prova. Sono i loro dati, non i nostri, e ogni riga indica la fonte. Li citiamo per l'entità del cambiamento: le velocità dei token variano con il modello, la quantizzazione, la build di llama.cpp e i flag, quindi vanno lette come un rapporto, non come una promessa.

MeasureAs NVIDIA shipped itUnlockedSource
Card memory8 GB HBM2e64 GB HBM2ecmpunlocker; 65,536 MiB measured by LTT Labs
FP32 fused multiply-addabout 0.39 TFLOPSunthrottled170th Street (stock); cmpunlocker (full SM throughput)
PCIe linkGen 1 x4Gen 2 x4cmpunlocker
Host to card, measured0.84 GB/s1.68 GB/sLTT Labs, nvbandwidth
8B model at 4-bit, generating30 tokens/s113 tokens/sLTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M
8B model at 4-bit, reading a prompt351 tokens/s2,994 tokens/sLTT Labs, llama.cpp, pp512
27B model at 4-bit (~16 GB)does not fit38 tokens/sLTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M
27B model at 8-bit (~29 GB)does not fit33 tokens/sLTT Labs, llama.cpp, Qwen 3.8 27B Q8_0

La memoria è il cambiamento che conta. A 8 GB la scheda ospita un modello piccolo e poco altro. A 64 GB ospita un modello da 27 miliardi di parametri a 8 bit con gran parte della scheda ancora libera per il contesto, ed è la differenza tra una scheda su cui sperimentare e una da cui servire.

La generazione dei token dipende dalla larghezza di banda, la lettura dei prompt dall'aritmetica. Generare testo è limitato dalla velocità con cui i pesi escono dalla memoria, cosa in cui HBM2e è sempre stata brava; leggere un prompt lungo è limitato dalle unità di moltiplicazione-addizione, ed è lì che il limite pesava di più e dove lo sblocco si vede maggiormente.

Il collegamento conta appena una volta caricato il modello. La Gen 2 x4 raddoppia la velocità host-scheda, il che accorcia il caricamento. Dopo, i pesi restano sulla scheda e il bus è inattivo.

Fonti: LTT Labs, “Actually Download More RAM” (12 settembre 2026) per ogni riga misurata; 170th Street per il dato FP32 di serie; cmpunlocker per ciò che le patch ripristinano.

L’installazione, passo dopo passo

Come lo sblocco arriva sulla macchina

Chiunque può leggere il README di cmpunlocker. La parte per cui vale la pena pagare è tutto ciò che gli sta intorno, fatto prima della consegna e mantenuto funzionante anche dopo. Non c’è nulla da eseguire per te.

  1. Il driver aperto di NVIDIA, bloccato a una singola release

    L’installer aggiunge il repository CUDA di NVIDIA e installa lo userspace del driver aperto per la versione 610.57.04, headless e senza DKMS, e mantiene ogni suo componente a quella release: il pacchetto nvidia-driver-pinning-610.57.04 su Ubuntu e Debian, un blocco di versione dnf su AlmaLinux e Rocky. Lo sblocco è compilato per un driver esatto; il blocco è ciò che impedisce a un aggiornamento di routine di togliere le librerie da sotto i suoi piedi.

  2. cmpunlocker, compilato per il tuo kernel

    Recuperiamo cmpunlocker a un commit fisso e compiliamo il suo nvidia.ko patchato dentro il nuovo sistema, contro il kernel che sta per avviare, prima che l’installer spenga la macchina. Le patch cambiano il modo in cui il driver inizializza la scheda. Nulla viene scritto in modo permanente sulla scheda, quindi rimuovere il driver la riporta esattamente a com’era.

  3. Un primo avvio a freddo

    Lo sblocco ha effetto solo al primo caricamento del driver dopo che la scheda è stata spenta, quindi ognuna di queste installazioni termina con il server spento e riacceso tramite il suo BMC, e la prima cosa a toccare la scheda è il driver patchato.

  4. Verificata, poi testata in memoria, al primo accesso

    Quando il sistema installato risponde per la prima volta, l’installazione chiede a ogni scheda come si è presentata — memoria, generazione PCIe e ampiezza del collegamento — e poi scrive e rilegge ogni byte di memoria che il driver assegna, con pattern fissi, a indirizzo e pseudo-casuali. Entrambe le risposte finiscono nel registro di configurazione del server, dove il supporto può vederle. cmp-unlock status e cmp-unlock memtest ti danno le stesse risposte da una shell.

  5. Gli aggiornamenti del kernel non lo ribloccano

    Un hook del kernel (/etc/kernel/postinst.d, o /etc/kernel/install.d su AlmaLinux e Rocky) ricompila i moduli patchati per ogni nuovo kernel, da una copia dei sorgenti di NVIDIA conservata sulla macchina, così un aggiornamento automatico non riporta silenziosamente la scheda a 8 GB. Al gestore di pacchetti viene anche detto di rifiutare i pacchetti che affiancherebbero un secondo driver stock; installa CUDA con apt install cuda-toolkit o dnf install cuda-toolkit e non comparirà mai.

Dimensionamento, secondo la regola usata dal resto del sito

Cosa sta in 64 GB, e cosa stava in 8

Solo pesi, arrotondati per eccesso. Un modello conta come compatibile quando la scheda può contenerlo con un margine da un quarto a metà in più per la cache KV e il runtime; al di sotto si carica e poi esaurisce la memoria appena il contesto cresce. È la stessa regola con cui la nostra pagina LLM dimensiona ogni scheda.

Model sizePrecisionWeights8 GB, locked64 GB, unlocked
7-8 billion parameters16-bit16 GB—fits
8-bit8 GB—fits
4-bit5 GBfitsfits
13-14 billion parameters16-bit28 GB—fits
8-bit14 GB—fits
4-bit8 GB—fits
30-34 billion parameters16-bit68 GB——
8-bit34 GB—fits
4-bit19 GB—fits
70 billion parameters16-bit140 GB——
8-bit70 GB——
4-bit38 GB—fits

Due schede in una macchina contengono ciò che una sola non può: un modello da 70 miliardi di parametri a 8 bit richiede circa 70 GB, che stanno in una coppia. Dividere un modello su più schede, o più macchine, è la pagina multi-GPU. Date alla macchina anche almeno tanta memoria di sistema quanto il file del modello più grande; la build più economica qui sotto ha 16 GB, che carica un file da 38 GB, solo lentamente.

Leggi questo prima di ordinare

Cosa non cambia con lo sblocco

Una CMP sbloccata è un'ottima scheda per l'inferenza, considerato il prezzo. Non è una A100, ed è qui che si vede la differenza.

Niente ECC
La correzione degli errori sulla HBM2e è ancora disattivata; è nell'elenco delle cose che nessuno ha ancora sbloccato. Per l'inferenza un bit invertito costa un nuovo tentativo. Per un addestramento lungo una settimana, o per qualsiasi cosa che debba essere esatta al bit, scegli una scheda con memoria protetta, come la L40S.
PCIe Gen 2 x4
Circa 1,7 GB/s dall'host alla scheda, misurati, quindi il solo bus impiega circa 25 secondi per spostare un modello da 38 GB. Un modello lo attraversa una volta e poi vive sulla scheda, ed è per questo che in serving non si nota quasi nulla. Un ciclo di addestramento che trasferisce batch dalla memoria di sistema lo nota a ogni passo.
I formati numerici di Ampere’s
FP16, BF16, TF32 e INT8 sui tensor core. Niente FP8 e niente FP4; entrambi sono arrivati con le generazioni successive ad Ampere. I modelli quantizzati in GGUF, AWQ o GPTQ funzionano bene, perché vengono decompressi nei formati supportati dalla scheda.
Solo Linux
Lo sblocco è un driver del kernel Linux. Ordina la macchina con Ubuntu, Debian, AlmaLinux o Rocky Linux ed è già integrato; su Windows o Proxmox VE la scheda funziona come l'ha distribuita NVIDIA, con 8 GB.
Secure Boot disattivato
I moduli patchati non sono firmati, quindi un kernel con Secure Boot attivo li rifiuta e la scheda resta senza alcun driver. Lascialo disattivato.
Codice della community, non di NVIDIA’s
cmpunlocker è un progetto open-source (GPL-2.0) di Amogh Munikote, e NVIDIA non lo supporta. Installiamo un commit che abbiamo compilato e verificato, e spostiamo quel pin di proposito, mai automaticamente.
La scheda da 10 GB si ferma a 40 GB
La scheda da 8 GB si sblocca a 64 GB. La scheda da 10 GB ha più memoria sul package di quanta ne regga sotto carico, quindi lo sblocco la ferma a 40 GB, la dimensione che resta stabile. L'installazione rileva quale delle due è presente nella macchina e applica la geometria corretta a ciascuna scheda.
La macchina dietro il pulsante

Una CMP sbloccata, nella macchina più economica che la supporta

La scheda è una voce a sé in fattura e la macchina un'altra; le due si sommano. Le cifre qui sotto rappresentano il costo minimo di questa configurazione: la scheda nella macchina completa più economica che la supporta, prima di qualsiasi imposta sulle vendite. Il configuratore potrebbe aprirsi con più memoria di quella indicata; modificando processore, memoria o dischi, ogni variazione viene prezzata nel momento in cui la si effettua.

La NVIDIA CMP 170HX, una scheda passiva a lunghezza intera senza uscite video sulla staffa
Una scheda passiva a lunghezza intera che assorbe fino a 250 W e non ha ventole. È progettata per uno chassis server con flusso d'aria frontale-posteriore, ed è lì che girano le nostre.
CardNVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver)
Card, per month$189
MachineIntel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
Machine, per month$83.67
Together$272.67 a month
Setup$29 once
Cards per machine1 to 4
CitiesNew York, Bucharest, San Francisco and Miami
TermMonthly; 15% off on a twelve-month cycle
DriverNVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04–26.04, Debian 12/13, AlmaLinux 9/10 or Rocky Linux 9/10
Memory testEvery byte the driver hands out, written and read back on each card before handover

Apri questa configurazione nel configuratore →

Il costo di setup è previsto perché la scheda viene montata su ordinazione: una macchina con una scheda aggiunta è una configurazione personalizzata. La cifra mensile resta la stessa al rinnovo. Ogni altra scheda che montiamo è prezzata allo stesso modo sulla pagina GPU.

Domande su questa scheda

Server CMP sbloccati, domande e risposte

Cos’è una CMP 170HX sbloccata?
Una NVIDIA CMP 170HX con una build patchata del driver kernel aperto di NVIDIA, dal progetto cmpunlocker. La scheda è una GA100, il die della A100, che NVIDIA ha distribuito con 8 GB della sua HBM2e visibili, la moltiplicazione-addizione FP32 limitata e il collegamento bloccato a PCIe Gen 1. Il driver patchato attiva 64 GB, rimuove la limitazione e addestra il collegamento a Gen 2 ogni volta che avvia la scheda. Nulla sulla scheda stessa viene modificato.
Quanta memoria ha una CMP 170HX sbloccata?
64 GB di HBM2e sulla scheda da 8 GB, che è quanto riporta nvidia-smi una volta che il driver patchato è in esecuzione. La versione da 10 GB della scheda è mantenuta a 40 GB, la dimensione che resta stabile su di essa. Senza il driver patchato, entrambe le schede mostrano quanto NVIDIA ha distribuito: 8 o 10 GB.
Lo sblocco sopravvive a riavvii e aggiornamenti del kernel?
Sì. I moduli patchati vengono installati come qualsiasi altro modulo del kernel e si caricano a ogni avvio. Quando arriva un nuovo kernel, un hook li ricompila per esso dai sorgenti NVIDIA conservati sulla macchina, prima ancora di avviarlo. Se una scheda dovesse comunque avviarsi a 8 GB, esegui cmp-unlock build con la versione del tuo kernel e spegni e riaccendi il server dal pannello di controllo.
Quali sistemi operativi ricevono il driver sbloccato?
Ubuntu 22.04, 24.04 e 26.04, Debian 12 e 13, AlmaLinux 9 e 10, e Rocky Linux 9 e 10, installati da noi, su qualsiasi macchina con la scheda al suo interno: fa parte dell’installazione, non è un’opzione da spuntare. Windows e Proxmox VE ricevono la scheda come l’ha distribuita NVIDIA: lo sblocco è un driver del kernel Linux, e su Proxmox le schede di solito vanno alle macchine virtuali, che un driver dell’host non raggiunge.
Posso usare CUDA, PyTorch, vLLM e llama.cpp su di essa?
Sì. Il driver è il 610.57.04 di NVIDIA con le patch applicate, quindi tutto ciò che è compilato per una scheda Ampere con un driver attuale funziona. Installa il toolkit CUDA da solo, con apt install cuda-toolkit o dnf install cuda-toolkit; i meta-pacchetti cuda e cuda-drivers porterebbero con sé un secondo driver stock, quindi il gestore di pacchetti è impostato per rifiutarli.
Un modello da 70 miliardi di parametri girerà su una sola scheda?
A 4 bit, sì: i pesi arrivano a circa 38 GB, il che lascia lo spazio che la nostra regola di dimensionamento richiede su una scheda da 64 GB. A 8 bit arrivano a circa 70 GB, il che richiede due schede; una macchina ne accetta fino a quattro.
Quante schede posso mettere in un server?
Fino a quattro nella macchina a cui si collega questa pagina. Scegli il numero nel configuratore. Per più di quattro, o per un modello suddiviso tra macchine, consulta la pagina multi-GPU.
La memoria sbloccata è affidabile?
La scheda da 8 GB a 64 GB è la combinazione che ha retto nei test pubblici, e la scheda da 10 GB si ferma a 40 GB per lo stesso motivo. È comunque memoria che NVIDIA ha selezionato, però, e una scheda può avere un punto debole: LTT Labs ne ha trovata una tra le schede testate. Quindi ogni installazione la verifica: dopo il primo avvio a freddo, ogni scheda fa scrivere e rileggere ogni byte che il driver assegnerà, con pattern fissi, di indirizzo e pseudo-casuali ciascuno invertito sul posto, e il risultato va nel registro di configurazione del server. È un controllo alla consegna, non una garanzia per anni; se una scheda in seguito si comporta male, esegui cmp-unlock memtest e dicci cosa riporta. Una scheda che fallisce viene sostituita come qualsiasi altro componente.
Perché c’è un costo di configurazione su questa build?
Perché la scheda viene montata su ordinazione. Una macchina con una scheda aggiunta è una build personalizzata, e una build personalizzata comporta il costo di configurazione una tantum mostrato nella tabella sopra. Viene addebitato una sola volta, e la cifra mensile non cambia al rinnovo.
Dove si trovano questi server?
In ogni città elencata nella tabella sopra. La linea è venduta anche ad Amsterdam, ma il configuratore non può montare una scheda lì, quindi una CMP sbloccata non è disponibile in quella città.

Un'altra direzione da esplorare