CMP 170HX are același cip GA100 ca un A100 și a plecat din fabrică cu mare parte din acel cip îngrădită: 8 GB de HBM2e vizibili, FP32 limitat la un firicel, legătura ținută la PCIe Gen 1. O versiune modificată a driverului open-source NVIDIA dă jos gardurile. O compilăm în Ubuntu în timp ce instalăm serverul, astfel încât placa este deblocată înainte de prima ta autentificare.
LTT Labs a deblocat un CMP 170HX în septembrie 2026 și l-a testat cu el însuși, blocat și deblocat, pe același banc de testare. Acestea sunt cifrele lor, nu ale noastre, iar fiecare rând indică sursa. Le cităm pentru amploarea schimbării: ratele de tokeni variază în funcție de model, cuantizare, versiunea llama.cpp și flaguri, așa că interpretați-le ca pe un raport, nu ca pe o promisiune.
| Measure | As NVIDIA shipped it | Unlocked | Source |
|---|---|---|---|
| Card memory | 8 GB HBM2e | 64 GB HBM2e | cmpunlocker; 65,536 MiB measured by LTT Labs |
| FP32 fused multiply-add | about 0.39 TFLOPS | unthrottled | 170th Street (stock); cmpunlocker (full SM throughput) |
| PCIe link | Gen 1 x4 | Gen 2 x4 | cmpunlocker |
| Host to card, measured | 0.84 GB/s | 1.68 GB/s | LTT Labs, nvbandwidth |
| 8B model at 4-bit, generating | 30 tokens/s | 113 tokens/s | LTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M |
| 8B model at 4-bit, reading a prompt | 351 tokens/s | 2,994 tokens/s | LTT Labs, llama.cpp, pp512 |
| 27B model at 4-bit (~16 GB) | does not fit | 38 tokens/s | LTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M |
| 27B model at 8-bit (~29 GB) | does not fit | 33 tokens/s | LTT Labs, llama.cpp, Qwen 3.8 27B Q8_0 |
Memoria este schimbarea care contează. La 8 GB, placa încape un model mic și cam atât. La 64 GB, ține un model de 27 de miliarde de parametri pe 8 biți, cu cea mai mare parte a plăcii încă liberă pentru context, ceea ce face diferența dintre o placă pe care poți experimenta și una de pe care poți servi.
Generarea de tokeni depinde de lățimea de bandă, citirea promptului de aritmetică. Generarea textului este limitată de viteza cu care ponderile ies din memorie, lucru la care HBM2e a fost mereu bun; citirea unui prompt lung este limitată de unitățile de înmulțire-adunare, exact acolo unde limitarea a durut cel mai tare și unde deblocarea se vede cel mai mult.
Legătura abia contează odată ce un model este încărcat. Gen 2 x4 dublează rata gazdă-placă, ceea ce scurtează încărcarea. După aceea, ponderile stau pe placă, iar magistrala rămâne inactivă.
Oricine poate citi README-ul cmpunlocker. Partea pentru care merită să plătești este tot ce o înconjoară, făcut înainte de predare și menținut funcțional după aceea. Nu ai nimic de rulat.
Instalatorul adaugă repository-ul CUDA al NVIDIA și instalează userspace-ul driverului open pentru 610.57.04, headless și fără DKMS, apoi fixează fiecare componentă la acea versiune: pachetul nvidia-driver-pinning-610.57.04 pe Ubuntu și Debian, o blocare de versiune dnf pe AlmaLinux și Rocky. Deblocarea este construită pentru un singur driver exact; fixarea este cea care împiedică o actualizare de rutină să scoată bibliotecile de sub el.
Preluăm cmpunlocker la un commit fix și construim nvidia.ko-ul său modificat în interiorul noului sistem, împotriva kernelului pe care urmează să pornească, înainte ca instalatorul să se oprească. Patch-urile schimbă modul în care driverul pornește placa. Nimic nu este scris pe placă, așa că eliminarea driverului o readuce exact la starea inițială.
Deblocarea se activează doar la prima încărcare a driverului după ce placa a fost oprită complet, așa că fiecare dintre aceste instalări se încheie cu serverul oprit și repornit prin BMC-ul său, iar primul lucru care atinge placa este driverul modificat.
Când sistemul instalat răspunde prima dată, instalarea întreabă fiecare placă ce a raportat — memorie, generație PCIe și lățime de bandă — apoi scrie și citește înapoi fiecare octet de memorie pe care driverul îl alocă, cu modele fixe, pe adrese și pseudo-aleatoare. Ambele răspunsuri ajung în jurnalul de configurare al serverului, unde suportul le poate vedea. cmp-unlock status și cmp-unlock memtest îți oferă aceleași răspunsuri dintr-un shell.
Un hook de kernel (/etc/kernel/postinst.d, sau /etc/kernel/install.d pe AlmaLinux și Rocky) reconstruiește modulele modificate pentru fiecare kernel nou, dintr-o copie a sursei NVIDIA păstrată pe mașină, astfel încât o actualizare nesupravegheată nu trimite placa înapoi la 8 GB pe tăcute. Managerul de pachete este, de asemenea, configurat să refuze pachetele care ar pune un al doilea driver, stoc, lângă el; instalează CUDA cu apt install cuda-toolkit sau dnf install cuda-toolkit și nu apare niciodată.
Doar greutăți, rotunjite în sus. Un model se consideră că încape atunci când placa îl poate susține cu un sfert până la jumătate în plus pentru cache-ul KV și pentru runtime; sub acest nivel se încarcă, dar rămâne fără resurse imediat ce contextul crește. Este aceeași regulă după care pagina noastră LLM dimensionează fiecare placă.
| Model size | Precision | Weights | 8 GB, locked | 64 GB, unlocked |
|---|---|---|---|---|
| 7-8 billion parameters | 16-bit | 16 GB | — | fits |
| 8-bit | 8 GB | — | fits | |
| 4-bit | 5 GB | fits | fits | |
| 13-14 billion parameters | 16-bit | 28 GB | — | fits |
| 8-bit | 14 GB | — | fits | |
| 4-bit | 8 GB | — | fits | |
| 30-34 billion parameters | 16-bit | 68 GB | — | — |
| 8-bit | 34 GB | — | fits | |
| 4-bit | 19 GB | — | fits | |
| 70 billion parameters | 16-bit | 140 GB | — | — |
| 8-bit | 70 GB | — | — | |
| 4-bit | 38 GB | — | fits |
Un CMP deblocat este un card de inferență foarte bun pentru prețul lui. Nu este un A100, iar acestea sunt punctele unde se vede.
Cardul este o linie separată pe factură, iar mașina este alta; cele două se adună. Cifrele de mai jos reprezintă costul minim al acestei configurații: cardul în cea mai ieftină mașină completă care îl acceptă, înainte de orice taxă de vânzare. Configuratorul se poate deschide cu mai multă memorie decât atât; schimbă procesorul, memoria sau discurile acolo și prețul fiecărei modificări se calculează pe măsură ce o faci.
| Card | NVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver) |
|---|---|
| Card, per month | $189 |
| Machine | Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps |
| Machine, per month | $83.67 |
| Together | $272.67 a month |
| Setup | $29 once |
| Cards per machine | 1 to 4 |
| Cities | New York, Bucharest, San Francisco and Miami |
| Term | Monthly; 15% off on a twelve-month cycle |
| Driver | NVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04–26.04, Debian 12/13, AlmaLinux 9/10 or Rocky Linux 9/10 |
| Memory test | Every byte the driver hands out, written and read back on each card before handover |