La CMP 170HX monta lo stesso die GA100 di una A100, ed è uscita dalla fabbrica con gran parte di quel die recintato: 8 GB di HBM2e visibili, FP32 strozzato a un rivolo, il collegamento tenuto a PCIe Gen 1. Una build patchata del driver aperto di NVIDIA’ abbatte i recinti. La compiliamo dentro Ubuntu mentre installiamo il tuo server, così la scheda è sbloccata prima del tuo primo accesso.
LTT Labs ha sbloccato una CMP 170HX a settembre 2026 e l'ha confrontata con se stessa, bloccata e sbloccata, sullo stesso banco di prova. Sono i loro dati, non i nostri, e ogni riga indica la fonte. Li citiamo per l'entità del cambiamento: le velocità dei token variano con il modello, la quantizzazione, la build di llama.cpp e i flag, quindi vanno lette come un rapporto, non come una promessa.
| Measure | As NVIDIA shipped it | Unlocked | Source |
|---|---|---|---|
| Card memory | 8 GB HBM2e | 64 GB HBM2e | cmpunlocker; 65,536 MiB measured by LTT Labs |
| FP32 fused multiply-add | about 0.39 TFLOPS | unthrottled | 170th Street (stock); cmpunlocker (full SM throughput) |
| PCIe link | Gen 1 x4 | Gen 2 x4 | cmpunlocker |
| Host to card, measured | 0.84 GB/s | 1.68 GB/s | LTT Labs, nvbandwidth |
| 8B model at 4-bit, generating | 30 tokens/s | 113 tokens/s | LTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M |
| 8B model at 4-bit, reading a prompt | 351 tokens/s | 2,994 tokens/s | LTT Labs, llama.cpp, pp512 |
| 27B model at 4-bit (~16 GB) | does not fit | 38 tokens/s | LTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M |
| 27B model at 8-bit (~29 GB) | does not fit | 33 tokens/s | LTT Labs, llama.cpp, Qwen 3.8 27B Q8_0 |
La memoria è il cambiamento che conta. A 8 GB la scheda ospita un modello piccolo e poco altro. A 64 GB ospita un modello da 27 miliardi di parametri a 8 bit con gran parte della scheda ancora libera per il contesto, ed è la differenza tra una scheda su cui sperimentare e una da cui servire.
La generazione dei token dipende dalla larghezza di banda, la lettura dei prompt dall'aritmetica. Generare testo è limitato dalla velocità con cui i pesi escono dalla memoria, cosa in cui HBM2e è sempre stata brava; leggere un prompt lungo è limitato dalle unità di moltiplicazione-addizione, ed è lì che il limite pesava di più e dove lo sblocco si vede maggiormente.
Il collegamento conta appena una volta caricato il modello. La Gen 2 x4 raddoppia la velocità host-scheda, il che accorcia il caricamento. Dopo, i pesi restano sulla scheda e il bus è inattivo.
Chiunque può leggere il README di cmpunlocker. La parte per cui vale la pena pagare è tutto ciò che gli sta intorno, fatto prima della consegna e mantenuto funzionante anche dopo. Non c’è nulla da eseguire per te.
L’installer aggiunge il repository CUDA di NVIDIA e installa lo userspace del driver aperto per la versione 610.57.04, headless e senza DKMS, e mantiene ogni suo componente a quella release: il pacchetto nvidia-driver-pinning-610.57.04 su Ubuntu e Debian, un blocco di versione dnf su AlmaLinux e Rocky. Lo sblocco è compilato per un driver esatto; il blocco è ciò che impedisce a un aggiornamento di routine di togliere le librerie da sotto i suoi piedi.
Recuperiamo cmpunlocker a un commit fisso e compiliamo il suo nvidia.ko patchato dentro il nuovo sistema, contro il kernel che sta per avviare, prima che l’installer spenga la macchina. Le patch cambiano il modo in cui il driver inizializza la scheda. Nulla viene scritto in modo permanente sulla scheda, quindi rimuovere il driver la riporta esattamente a com’era.
Lo sblocco ha effetto solo al primo caricamento del driver dopo che la scheda è stata spenta, quindi ognuna di queste installazioni termina con il server spento e riacceso tramite il suo BMC, e la prima cosa a toccare la scheda è il driver patchato.
Quando il sistema installato risponde per la prima volta, l’installazione chiede a ogni scheda come si è presentata — memoria, generazione PCIe e ampiezza del collegamento — e poi scrive e rilegge ogni byte di memoria che il driver assegna, con pattern fissi, a indirizzo e pseudo-casuali. Entrambe le risposte finiscono nel registro di configurazione del server, dove il supporto può vederle. cmp-unlock status e cmp-unlock memtest ti danno le stesse risposte da una shell.
Un hook del kernel (/etc/kernel/postinst.d, o /etc/kernel/install.d su AlmaLinux e Rocky) ricompila i moduli patchati per ogni nuovo kernel, da una copia dei sorgenti di NVIDIA conservata sulla macchina, così un aggiornamento automatico non riporta silenziosamente la scheda a 8 GB. Al gestore di pacchetti viene anche detto di rifiutare i pacchetti che affiancherebbero un secondo driver stock; installa CUDA con apt install cuda-toolkit o dnf install cuda-toolkit e non comparirà mai.
Solo pesi, arrotondati per eccesso. Un modello conta come compatibile quando la scheda può contenerlo con un margine da un quarto a metà in più per la cache KV e il runtime; al di sotto si carica e poi esaurisce la memoria appena il contesto cresce. È la stessa regola con cui la nostra pagina LLM dimensiona ogni scheda.
| Model size | Precision | Weights | 8 GB, locked | 64 GB, unlocked |
|---|---|---|---|---|
| 7-8 billion parameters | 16-bit | 16 GB | — | fits |
| 8-bit | 8 GB | — | fits | |
| 4-bit | 5 GB | fits | fits | |
| 13-14 billion parameters | 16-bit | 28 GB | — | fits |
| 8-bit | 14 GB | — | fits | |
| 4-bit | 8 GB | — | fits | |
| 30-34 billion parameters | 16-bit | 68 GB | — | — |
| 8-bit | 34 GB | — | fits | |
| 4-bit | 19 GB | — | fits | |
| 70 billion parameters | 16-bit | 140 GB | — | — |
| 8-bit | 70 GB | — | — | |
| 4-bit | 38 GB | — | fits |
Una CMP sbloccata è un'ottima scheda per l'inferenza, considerato il prezzo. Non è una A100, ed è qui che si vede la differenza.
La scheda è una voce a sé in fattura e la macchina un'altra; le due si sommano. Le cifre qui sotto rappresentano il costo minimo di questa configurazione: la scheda nella macchina completa più economica che la supporta, prima di qualsiasi imposta sulle vendite. Il configuratore potrebbe aprirsi con più memoria di quella indicata; modificando processore, memoria o dischi, ogni variazione viene prezzata nel momento in cui la si effettua.
| Card | NVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver) |
|---|---|
| Card, per month | $189 |
| Machine | Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps |
| Machine, per month | $83.67 |
| Together | $272.67 a month |
| Setup | $29 once |
| Cards per machine | 1 to 4 |
| Cities | New York, Bucharest, San Francisco and Miami |
| Term | Monthly; 15% off on a twelve-month cycle |
| Driver | NVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04–26.04, Debian 12/13, AlmaLinux 9/10 or Rocky Linux 9/10 |
| Memory test | Every byte the driver hands out, written and read back on each card before handover |
Noleggiabili anche mensilmente: macchine CMP 170HX che i proprietari hanno inserito nel nostro marketplace, ciascuna al prezzo stabilito dal proprietario. Alcune sono pubblicate tramite la nostra società consociata, Primcast, e vengono noleggiate su primcast.com.