NVIDIA CMP 170HX · GA100 · deblocat la instalare

Servere dedicate CMP deblocate. Toți cei 64 GB ai plăcii, nu cei 8 pe care NVIDIA i-a lăsat activi.

CMP 170HX are același cip GA100 ca un A100 și a plecat din fabrică cu mare parte din acel cip îngrădită: 8 GB de HBM2e vizibili, FP32 limitat la un firicel, legătura ținută la PCIe Gen 1. O versiune modificată a driverului open-source NVIDIA dă jos gardurile. O compilăm în Ubuntu în timp ce instalăm serverul, astfel încât placa este deblocată înainte de prima ta autentificare.

64 GB HBM2e per cardUbuntu, Debian, AlmaLinux or RockyUp to 4 cards per machinefrom $272.67/mo complete
Înainte și după, pe aceeași placă

Ce schimbă driverul modificat

LTT Labs a deblocat un CMP 170HX în septembrie 2026 și l-a testat cu el însuși, blocat și deblocat, pe același banc de testare. Acestea sunt cifrele lor, nu ale noastre, iar fiecare rând indică sursa. Le cităm pentru amploarea schimbării: ratele de tokeni variază în funcție de model, cuantizare, versiunea llama.cpp și flaguri, așa că interpretați-le ca pe un raport, nu ca pe o promisiune.

MeasureAs NVIDIA shipped itUnlockedSource
Card memory8 GB HBM2e64 GB HBM2ecmpunlocker; 65,536 MiB measured by LTT Labs
FP32 fused multiply-addabout 0.39 TFLOPSunthrottled170th Street (stock); cmpunlocker (full SM throughput)
PCIe linkGen 1 x4Gen 2 x4cmpunlocker
Host to card, measured0.84 GB/s1.68 GB/sLTT Labs, nvbandwidth
8B model at 4-bit, generating30 tokens/s113 tokens/sLTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M
8B model at 4-bit, reading a prompt351 tokens/s2,994 tokens/sLTT Labs, llama.cpp, pp512
27B model at 4-bit (~16 GB)does not fit38 tokens/sLTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M
27B model at 8-bit (~29 GB)does not fit33 tokens/sLTT Labs, llama.cpp, Qwen 3.8 27B Q8_0

Memoria este schimbarea care contează. La 8 GB, placa încape un model mic și cam atât. La 64 GB, ține un model de 27 de miliarde de parametri pe 8 biți, cu cea mai mare parte a plăcii încă liberă pentru context, ceea ce face diferența dintre o placă pe care poți experimenta și una de pe care poți servi.

Generarea de tokeni depinde de lățimea de bandă, citirea promptului de aritmetică. Generarea textului este limitată de viteza cu care ponderile ies din memorie, lucru la care HBM2e a fost mereu bun; citirea unui prompt lung este limitată de unitățile de înmulțire-adunare, exact acolo unde limitarea a durut cel mai tare și unde deblocarea se vede cel mai mult.

Legătura abia contează odată ce un model este încărcat. Gen 2 x4 dublează rata gazdă-placă, ceea ce scurtează încărcarea. După aceea, ponderile stau pe placă, iar magistrala rămâne inactivă.

Surse: LTT Labs, “Actually Download More RAM” (12 septembrie 2026) pentru fiecare rând măsurat; 170th Street pentru cifra FP32 de stoc; cmpunlocker pentru ce restaurează patch-urile.

Instalarea, pas cu pas

Cum ajunge deblocarea pe mașină

Oricine poate citi README-ul cmpunlocker. Partea pentru care merită să plătești este tot ce o înconjoară, făcut înainte de predare și menținut funcțional după aceea. Nu ai nimic de rulat.

  1. Driverul open NVIDIA, fixat pe o singură versiune

    Instalatorul adaugă repository-ul CUDA al NVIDIA și instalează userspace-ul driverului open pentru 610.57.04, headless și fără DKMS, apoi fixează fiecare componentă la acea versiune: pachetul nvidia-driver-pinning-610.57.04 pe Ubuntu și Debian, o blocare de versiune dnf pe AlmaLinux și Rocky. Deblocarea este construită pentru un singur driver exact; fixarea este cea care împiedică o actualizare de rutină să scoată bibliotecile de sub el.

  2. cmpunlocker, compilat pentru kernelul tău

    Preluăm cmpunlocker la un commit fix și construim nvidia.ko-ul său modificat în interiorul noului sistem, împotriva kernelului pe care urmează să pornească, înainte ca instalatorul să se oprească. Patch-urile schimbă modul în care driverul pornește placa. Nimic nu este scris pe placă, așa că eliminarea driverului o readuce exact la starea inițială.

  3. O primă pornire la rece

    Deblocarea se activează doar la prima încărcare a driverului după ce placa a fost oprită complet, așa că fiecare dintre aceste instalări se încheie cu serverul oprit și repornit prin BMC-ul său, iar primul lucru care atinge placa este driverul modificat.

  4. Verificat, apoi testat pe memorie, la prima autentificare

    Când sistemul instalat răspunde prima dată, instalarea întreabă fiecare placă ce a raportat — memorie, generație PCIe și lățime de bandă — apoi scrie și citește înapoi fiecare octet de memorie pe care driverul îl alocă, cu modele fixe, pe adrese și pseudo-aleatoare. Ambele răspunsuri ajung în jurnalul de configurare al serverului, unde suportul le poate vedea. cmp-unlock status și cmp-unlock memtest îți oferă aceleași răspunsuri dintr-un shell.

  5. Actualizările de kernel nu o reblochează

    Un hook de kernel (/etc/kernel/postinst.d, sau /etc/kernel/install.d pe AlmaLinux și Rocky) reconstruiește modulele modificate pentru fiecare kernel nou, dintr-o copie a sursei NVIDIA păstrată pe mașină, astfel încât o actualizare nesupravegheată nu trimite placa înapoi la 8 GB pe tăcute. Managerul de pachete este, de asemenea, configurat să refuze pachetele care ar pune un al doilea driver, stoc, lângă el; instalează CUDA cu apt install cuda-toolkit sau dnf install cuda-toolkit și nu apare niciodată.

Dimensionare, după regula folosită în restul site-ului

Ce încape în 64 GB și ce încăpea în 8

Doar greutăți, rotunjite în sus. Un model se consideră că încape atunci când placa îl poate susține cu un sfert până la jumătate în plus pentru cache-ul KV și pentru runtime; sub acest nivel se încarcă, dar rămâne fără resurse imediat ce contextul crește. Este aceeași regulă după care pagina noastră LLM dimensionează fiecare placă.

Model sizePrecisionWeights8 GB, locked64 GB, unlocked
7-8 billion parameters16-bit16 GB—fits
8-bit8 GB—fits
4-bit5 GBfitsfits
13-14 billion parameters16-bit28 GB—fits
8-bit14 GB—fits
4-bit8 GB—fits
30-34 billion parameters16-bit68 GB——
8-bit34 GB—fits
4-bit19 GB—fits
70 billion parameters16-bit140 GB——
8-bit70 GB——
4-bit38 GB—fits

Două plăci într-o singură mașină susțin ceea ce o singură placă nu poate: un model de 70 de miliarde de parametri la 8 biți are nevoie de aproximativ 70 GB, ceea ce încape pe o pereche. Împărțirea unui model pe mai multe plăci sau pe mai multe mașini este prezentată pe pagina multi-GPU. Oferiți mașinii cel puțin la fel de multă memorie de sistem ca cel mai mare fișier de model; cea mai ieftină configurație de mai jos are 16 GB, ceea ce încarcă un fișier de 38 GB, doar că lent.

Citește asta înainte să comanzi

Ce nu schimbă deblocarea

Un CMP deblocat este un card de inferență foarte bun pentru prețul lui. Nu este un A100, iar acestea sunt punctele unde se vede.

Fără ECC
Corecția de erori pe HBM2e rămâne dezactivată; se află pe lista lucrurilor pe care încă nu le-a deblocat nimeni. Pentru inferență, un bit inversat costă o reîncercare. Pentru un antrenament de o săptămână sau orice trebuie să fie exact la nivel de bit, alege un card cu memorie protejată, cum ar fi L40S.
PCIe Gen 2 x4
Aproximativ 1,7 GB/s de la gazdă la card, măsurat, așa că doar magistrala are nevoie de circa 25 de secunde pentru a muta un model de 38 GB. Un model o traversează o singură dată și apoi rămâne pe card, motiv pentru care servirea abia dacă observă. O buclă de antrenament care aduce loturi din memoria sistemului observă fiecare pas.
Formatele numerice ale lui Ampere’s
FP16, BF16, TF32 și INT8 pe nucleele tensor. Fără FP8 și fără FP4; ambele au apărut la generațiile de după Ampere. Modelele cuantizate în GGUF, AWQ sau GPTQ rulează fără probleme, pentru că se despachetează în formate pe care cardul le are.
Doar Linux
Deblocarea este un driver de kernel Linux. Comandă mașina cu Ubuntu, Debian, AlmaLinux sau Rocky Linux și este inclus; pe Windows sau Proxmox VE cardul rulează așa cum l-a livrat NVIDIA, cu 8 GB.
Secure Boot oprit
Modulele patch-uite sunt nesemnate, așa că un kernel cu Secure Boot activ le refuză, iar cardul rămâne fără niciun driver. Lasă-l oprit.
Cod comunitar, nu al NVIDIA’s
cmpunlocker este un proiect open-source (GPL-2.0) de Amogh Munikote, iar NVIDIA nu îl suportă. Instalăm un commit pe care l-am compilat și verificat și mutăm acel pin intenționat, niciodată automat.
Cardul de 10 GB se oprește la 40 GB
Cardul de 8 GB se deblochează la 64 GB. Cardul de 10 GB are mai multă memorie pe pachet decât rezistă sub sarcină, așa că deblocarea îl oprește la 40 GB, dimensiunea care rămâne stabilă. Instalarea citește care dintre ele este în mașină și aplică geometria potrivită fiecărui card.
Mașinăria din spatele butonului

Un singur CMP deblocat, în cea mai ieftină mașină care îl acceptă

Cardul este o linie separată pe factură, iar mașina este alta; cele două se adună. Cifrele de mai jos reprezintă costul minim al acestei configurații: cardul în cea mai ieftină mașină completă care îl acceptă, înainte de orice taxă de vânzare. Configuratorul se poate deschide cu mai multă memorie decât atât; schimbă procesorul, memoria sau discurile acolo și prețul fiecărei modificări se calculează pe măsură ce o faci.

NVIDIA CMP 170HX, un card pasiv full-length fără ieșiri video pe bracket
Un card pasiv, full-length, care consumă până la 250 W și nu are ventilator. Este construit pentru un șasiu de server care trage aerul din față spre spate, iar acolo rulează și ale noastre.
CardNVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver)
Card, per month$189
MachineIntel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
Machine, per month$83.67
Together$272.67 a month
Setup$29 once
Cards per machine1 to 4
CitiesNew York, Bucharest, San Francisco and Miami
TermMonthly; 15% off on a twelve-month cycle
DriverNVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04–26.04, Debian 12/13, AlmaLinux 9/10 or Rocky Linux 9/10
Memory testEvery byte the driver hands out, written and read back on each card before handover

Deschide această configurație în configurator →

Taxa de configurare există pentru că cardul este montat la comandă: o mașină cu un card adăugat este o configurație personalizată. Suma lunară este aceeași la reînnoire. Fiecare alt card pe care îl montăm este tarifat la fel pe pagina GPU.

Întrebări despre acest card

Servere CMP deblocate, întrebări și răspunsuri

Ce este un CMP 170HX deblocat?
Un NVIDIA CMP 170HX care rulează o versiune patch-uită a driverului de kernel deschis NVIDIA’s, din proiectul cmpunlocker. Cardul este un GA100, același cip ca în A100, pe care NVIDIA l-a livrat cu 8 GB din HBM2e vizibili, multiplicarea-adunarea FP32 limitată și legătura menținută la PCIe Gen 1. Driverul patch-uit activează 64 GB, elimină limitarea și antrenează legătura la Gen 2 de fiecare dată când pornește cardul. Nimic de pe card în sine nu este modificat.
Câtă memorie are un CMP 170HX deblocat?
64 GB de HBM2e pe cardul de 8 GB, ceea ce raportează nvidia-smi odată ce driverul patch-uit rulează. Versiunea de 10 GB a cardului este menținută la 40 GB, dimensiunea care rămâne stabilă pe acesta. Fără driverul patch-uit, oricare card arată ce a livrat NVIDIA: 8 sau 10 GB.
Deblocarea rezistă la reporniri și actualizări de kernel?
Da. Modulele patch-uite sunt instalate ca orice alt modul de kernel și se încarcă la fiecare pornire. Când apare un kernel nou, un hook le reconstruiește pentru acesta din sursa NVIDIA păstrată pe mașină, înainte să porniți vreodată în el. Dacă un card pornește totuși la 8 GB, rulați cmp-unlock build cu versiunea kernelului și reporniți serverul din panoul de control.
Ce sisteme de operare primesc driverul deblocat?
Ubuntu 22.04, 24.04 și 26.04, Debian 12 și 13, AlmaLinux 9 și 10, și Rocky Linux 9 și 10, instalate de noi, pe orice mașină cu cardul în ea: face parte din instalare, nu este o opțiune de bifat. Windows și Proxmox VE primesc cardul așa cum l-a livrat NVIDIA: deblocarea este un driver de kernel Linux, iar pe Proxmox cardurile merg de obicei către mașini virtuale, la care un driver de gazdă nu ajunge.
Pot folosi CUDA, PyTorch, vLLM și llama.cpp pe el?
Da. Driverul este propriul NVIDIA 610.57.04 cu patch-urile aplicate, așa că orice construit pentru un card Ampere cu un driver actual rulează. Instalați toolkit-ul CUDA separat, cu apt install cuda-toolkit sau dnf install cuda-toolkit; meta-pachetele cuda și cuda-drivers ar aduce cu ele un al doilea driver standard, așa că managerul de pachete este setat să le refuze.
Va rula un model de 70 de miliarde de parametri pe un singur card?
La 4-biți, da: ponderile ajung la aproximativ 38 GB, ceea ce lasă spațiul cerut de regula noastră de dimensionare pe un card de 64 GB. La 8-biți ajung la aproximativ 70 GB, ceea ce necesită două carduri; o mașină acceptă până la patru.
Câte carduri pot pune într-un singur server?
Până la patru în mașina către care trimite această pagină. Alegeți numărul în configurator. Pentru mai mult de patru, sau pentru un model împărțit între mașini, consultați pagina multi-GPU.
Este memoria deblocată fiabilă?
Cardul de 8 GB la 64 GB este combinația care a rezistat în testele publice, iar cardul de 10 GB se oprește la 40 GB din același motiv. Este totuși memorie sortată de NVIDIA, iar un card poate avea o zonă slabă: LTT Labs a găsit unul printre cardurile testate. Așa că fiecare instalare o testează: după prima pornire la rece, fiecare card are fiecare octet pe care driverul îl va aloca scris și citit înapoi, cu modele fixe, de adresă și pseudo-aleatoare, fiecare inversat pe loc, iar rezultatul ajunge în jurnalul de configurare al serverului. Aceasta este o verificare la predare, nu o garanție pentru ani; dacă un card se comportă ulterior defectuos, rulați cmp-unlock memtest și spuneți-ne ce afișează. Un card care eșuează este înlocuit ca orice altă componentă.
De ce există o taxă de configurare pentru această configurație?
Pentru că cardul este montat la comandă. O mașină cu un card adăugat este o configurație personalizată, iar o configurație personalizată implică taxa unică de configurare afișată în tabelul de mai sus. Se percepe o singură dată, iar suma lunară nu se modifică la reînnoire.
Unde sunt aceste servere?
În fiecare oraș listat în tabelul de mai sus. Linia este vândută și în Amsterdam, dar configuratorul nu poate monta un card acolo, așa că un CMP deblocat nu este disponibil în acel oraș.

Altundeva de privit