CMP 170HX 搭载与 A100 相同的 GA100 核心,但出厂时大部分核心被封锁:仅 8 GB HBM2e 可见,FP32 被限制到极低水平,链路被锁定在 PCIe Gen 1。基于 NVIDIA 开源驱动打造的补丁版本解除了这些限制。我们在安装服务器时将其编译进 Ubuntu,因此您首次登录前显卡即已解锁。
LTT Labs 在 2026 年 9 月解锁了一块 CMP 170HX,并在同一测试平台上让它以锁定和解锁两种状态分别与自己对比。以下是他们的数据,不是我们的,每一行都注明了来源。我们引用这些数据是为了说明变化的幅度:token 速率会随型号、量化方式、llama.cpp 版本和启动参数而变化,所以请把它当作一个比例来看,而不是一个承诺。
| Measure | As NVIDIA shipped it | Unlocked | Source |
|---|---|---|---|
| Card memory | 8 GB HBM2e | 64 GB HBM2e | cmpunlocker; 65,536 MiB measured by LTT Labs |
| FP32 fused multiply-add | about 0.39 TFLOPS | unthrottled | 170th Street (stock); cmpunlocker (full SM throughput) |
| PCIe link | Gen 1 x4 | Gen 2 x4 | cmpunlocker |
| Host to card, measured | 0.84 GB/s | 1.68 GB/s | LTT Labs, nvbandwidth |
| 8B model at 4-bit, generating | 30 tokens/s | 113 tokens/s | LTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M |
| 8B model at 4-bit, reading a prompt | 351 tokens/s | 2,994 tokens/s | LTT Labs, llama.cpp, pp512 |
| 27B model at 4-bit (~16 GB) | does not fit | 38 tokens/s | LTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M |
| 27B model at 8-bit (~29 GB) | does not fit | 33 tokens/s | LTT Labs, llama.cpp, Qwen 3.8 27B Q8_0 |
显存才是真正重要的变化。 8 GB 时,这块卡只能装下一个小模型,别的几乎放不下。64 GB 时,它能以 8-bit 精度装下一个 270 亿参数的模型,卡上大部分空间仍可用于上下文——这就是一块只能拿来试验的卡和一块可以直接对外提供服务的卡之间的区别。
token 生成靠带宽,提示词读取靠算力。 生成文本的速度取决于权重从显存中流出的速度,而这正是 HBM2e 一直擅长的;读取长提示词则受限于乘加单元,这正是限制最严重的地方,也是解锁后提升最明显的地方。
模型一旦加载完成,链路几乎无关紧要。 Gen 2 x4 将主机到显卡的速率翻倍,从而缩短了加载时间。之后权重就留在卡上,总线处于空闲状态。
任何人都能阅读 cmpunlocker 的 README。值得付费的是围绕它的一切——在交付前完成,并在交付后持续保持运行。你无需运行任何东西。
安装程序添加 NVIDIA’s CUDA 软件源,并安装开源内核驱动 610.57.04,无头模式且不带 DKMS,同时安装 nvidia-driver-pinning-610.57.04 包,将其每一部分都固定在该版本。解锁针对一个精确的驱动版本构建;固定版本正是为了防止常规的 apt upgrade 把库从它下面抽走。
我们在固定提交处获取 cmpunlocker,并在新系统内、针对它即将启动的内核,在安装程序关机之前构建其打过补丁的 nvidia.ko。补丁改变了驱动启动显卡的方式。没有任何内容被刷写到显卡上,因此移除驱动后,它会完全恢复原状。
解锁只在显卡断电后的第一次驱动加载时生效。我们的 Ubuntu 安装本来就是这样结束的:安装程序关闭服务器,我们通过其 BMC 重新开机,因此第一个接触显卡的就是打过补丁的驱动。
当安装好的系统首次响应时,安装程序会询问每张显卡它启动成了什么 — 显存、PCIe 代数和链路宽度 — 并把答案写入服务器的安装日志,支持人员可以看到。cmp-unlock status 让你随时在 shell 中获得同样的答案。
/etc/kernel/postinst.d 中的一个钩子会为每个新内核重新构建打过补丁的模块,使用机器上保留的 NVIDIA’s 源码副本,因此无人值守的升级不会悄悄把显卡送回 8 GB。apt 也被设置为拒绝那些会在旁边安装第二个、原版驱动的软件包;用 apt install cuda-toolkit 安装 CUDA,它永远不会出现。
仅计算权重,向上取整。当显卡能容纳模型,并留有四分之一到一半的余量给 KV 缓存和运行时,该模型才算装得下;低于这个余量,模型加载后一旦上下文增长就会立即耗尽内存。这与我们的 LLM 页面为每张显卡估算尺寸所用的规则相同。
| Model size | Precision | Weights | 8 GB, locked | 64 GB, unlocked |
|---|---|---|---|---|
| 7-8 billion parameters | 16-bit | 16 GB | — | fits |
| 8-bit | 8 GB | — | fits | |
| 4-bit | 5 GB | fits | fits | |
| 13-14 billion parameters | 16-bit | 28 GB | — | fits |
| 8-bit | 14 GB | — | fits | |
| 4-bit | 8 GB | — | fits | |
| 30-34 billion parameters | 16-bit | 68 GB | — | — |
| 8-bit | 34 GB | — | fits | |
| 4-bit | 19 GB | — | fits | |
| 70 billion parameters | 16-bit | 140 GB | — | — |
| 8-bit | 70 GB | — | — | |
| 4-bit | 38 GB | — | fits |
解锁后的 CMP 就其价格而言是一张非常出色的推理卡。它不是 A100,以下就是差距所在。
显卡在发票上单独列一行,机器另列一行;两者相加。以下数字是这套配置的最低成本:显卡装在能容纳它的最便宜整机里,不含任何销售税。配置器打开时可能显示更多内存;在那里更改处理器、内存或磁盘,每项更改都会即时计价。
| Card | NVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver) |
|---|---|
| Card, per month | $189 |
| Machine | Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps |
| Machine, per month | $83.67 |
| Together | $272.67 a month |
| Setup | $29 once |
| Cards per machine | 1 to 4 |
| Cities | New York, Bucharest, San Francisco and Miami |
| Term | Monthly; 15% off on a twelve-month cycle |
| Driver | NVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04, 24.04 or 26.04 |