NVIDIA CMP 170HX · GA100 · 安装时即解锁

解锁版 CMP 独立服务器。全部 64 GB显存,而非 NVIDIA 默认开启的那 8 GB。

CMP 170HX 搭载与 A100 相同的 GA100 核心,但出厂时大部分核心被封锁:仅 8 GB HBM2e 可见,FP32 被限制到极低水平,链路被锁定在 PCIe Gen 1。基于 NVIDIA 开源驱动打造的补丁版本解除了这些限制。我们在安装服务器时将其编译进 Ubuntu,因此您首次登录前显卡即已解锁。

64 GB HBM2e per cardUbuntu 22.04 / 24.04 / 26.04Up to 4 cards per machinefrom $272.67/mo complete
同一张卡,前后对比

补丁驱动改变了什么

LTT Labs 在 2026 年 9 月解锁了一块 CMP 170HX,并在同一测试平台上让它以锁定和解锁两种状态分别与自己对比。以下是他们的数据,不是我们的,每一行都注明了来源。我们引用这些数据是为了说明变化的幅度:token 速率会随型号、量化方式、llama.cpp 版本和启动参数而变化,所以请把它当作一个比例来看,而不是一个承诺。

MeasureAs NVIDIA shipped itUnlockedSource
Card memory8 GB HBM2e64 GB HBM2ecmpunlocker; 65,536 MiB measured by LTT Labs
FP32 fused multiply-addabout 0.39 TFLOPSunthrottled170th Street (stock); cmpunlocker (full SM throughput)
PCIe linkGen 1 x4Gen 2 x4cmpunlocker
Host to card, measured0.84 GB/s1.68 GB/sLTT Labs, nvbandwidth
8B model at 4-bit, generating30 tokens/s113 tokens/sLTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M
8B model at 4-bit, reading a prompt351 tokens/s2,994 tokens/sLTT Labs, llama.cpp, pp512
27B model at 4-bit (~16 GB)does not fit38 tokens/sLTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M
27B model at 8-bit (~29 GB)does not fit33 tokens/sLTT Labs, llama.cpp, Qwen 3.8 27B Q8_0

显存才是真正重要的变化。 8 GB 时,这块卡只能装下一个小模型,别的几乎放不下。64 GB 时,它能以 8-bit 精度装下一个 270 亿参数的模型,卡上大部分空间仍可用于上下文——这就是一块只能拿来试验的卡和一块可以直接对外提供服务的卡之间的区别。

token 生成靠带宽,提示词读取靠算力。 生成文本的速度取决于权重从显存中流出的速度,而这正是 HBM2e 一直擅长的;读取长提示词则受限于乘加单元,这正是限制最严重的地方,也是解锁后提升最明显的地方。

模型一旦加载完成,链路几乎无关紧要。 Gen 2 x4 将主机到显卡的速率翻倍,从而缩短了加载时间。之后权重就留在卡上,总线处于空闲状态。

来源:LTT Labs,“Actually Download More RAM”(2026 年 9 月 12 日),所有实测数据行;170th Street,原厂 FP32 数据;cmpunlocker,补丁恢复的内容。

安装过程,逐步说明

解锁如何进入机器

任何人都能阅读 cmpunlocker 的 README。值得付费的是围绕它的一切——在交付前完成,并在交付后持续保持运行。你无需运行任何东西。

  1. NVIDIA’s 开源驱动,锁定到单一版本

    安装程序添加 NVIDIA’s CUDA 软件源,并安装开源内核驱动 610.57.04,无头模式且不带 DKMS,同时安装 nvidia-driver-pinning-610.57.04 包,将其每一部分都固定在该版本。解锁针对一个精确的驱动版本构建;固定版本正是为了防止常规的 apt upgrade 把库从它下面抽走。

  2. cmpunlocker,为你的内核编译

    我们在固定提交处获取 cmpunlocker,并在新系统内、针对它即将启动的内核,在安装程序关机之前构建其打过补丁的 nvidia.ko。补丁改变了驱动启动显卡的方式。没有任何内容被刷写到显卡上,因此移除驱动后,它会完全恢复原状。

  3. 一次冷启动

    解锁只在显卡断电后的第一次驱动加载时生效。我们的 Ubuntu 安装本来就是这样结束的:安装程序关闭服务器,我们通过其 BMC 重新开机,因此第一个接触显卡的就是打过补丁的驱动。

  4. 首次登录时检查

    当安装好的系统首次响应时,安装程序会询问每张显卡它启动成了什么 — 显存、PCIe 代数和链路宽度 — 并把答案写入服务器的安装日志,支持人员可以看到。cmp-unlock status 让你随时在 shell 中获得同样的答案。

  5. 内核更新不会重新锁定它

    /etc/kernel/postinst.d 中的一个钩子会为每个新内核重新构建打过补丁的模块,使用机器上保留的 NVIDIA’s 源码副本,因此无人值守的升级不会悄悄把显卡送回 8 GB。apt 也被设置为拒绝那些会在旁边安装第二个、原版驱动的软件包;用 apt install cuda-toolkit 安装 CUDA,它永远不会出现。

尺寸估算,遵循全站其余部分使用的规则

64 GB 能装下什么,8 GB 曾经装下什么

仅计算权重,向上取整。当显卡能容纳模型,并留有四分之一到一半的余量给 KV 缓存和运行时,该模型才算装得下;低于这个余量,模型加载后一旦上下文增长就会立即耗尽内存。这与我们的 LLM 页面为每张显卡估算尺寸所用的规则相同。

Model sizePrecisionWeights8 GB, locked64 GB, unlocked
7-8 billion parameters16-bit16 GBfits
8-bit8 GBfits
4-bit5 GBfitsfits
13-14 billion parameters16-bit28 GBfits
8-bit14 GBfits
4-bit8 GBfits
30-34 billion parameters16-bit68 GB
8-bit34 GBfits
4-bit19 GBfits
70 billion parameters16-bit140 GB
8-bit70 GB
4-bit38 GBfits

一台机器里装两张卡,就能装下单张卡装不下的东西:一个 700 亿参数的 8 位模型大约需要 70 GB,正好能装进一对显卡里。把模型拆分到多张卡或多台机器上,请看多 GPU 页面。同时,机器的系统内存至少要与最大的模型文件一样大;下面最便宜的配置有 16 GB,能加载一个 38 GB 的文件,只是速度较慢。

下单前请阅读

解锁不会改变的地方

解锁后的 CMP 就其价格而言是一张非常出色的推理卡。它不是 A100,以下就是差距所在。

无 ECC
HBM2e 上的纠错仍然处于关闭状态;它仍在尚未被任何人解锁的功能清单上。对于推理来说,一个翻转的比特只意味着一次重试。但对于持续一周的训练任务,或任何必须逐位精确的工作,请选择显存受保护的显卡,例如 L40S
PCIe Gen 2 x4
实测从主机到显卡约为 1.7 GB/s,因此仅总线就需要约 25 秒来搬运一个 38 GB 的模型。模型只需跨越总线一次,之后便常驻显卡,所以推理服务几乎无感。而从系统内存持续拉取批次的训练循环,每一步都会感受到它的存在。
Ampere’s 数字格式
张量核心支持 FP16、BF16、TF32 和 INT8。没有 FP8,也没有 FP4;两者都是 Ampere 之后几代才引入的。GGUF、AWQ 或 GPTQ 格式的量化模型可以正常运行,因为它们会解包成该卡具备的格式。
仅限 Linux
该解锁是一个 Linux 内核驱动。订购机器时选择 Ubuntu 22.04、24.04 或 26.04,它便已内置;在 Windows 或其他发行版上,该卡将按 NVIDIA 出厂状态运行,只有 8 GB。
关闭 Secure Boot
打过补丁的模块未签名,因此启用 Secure Boot 的内核会拒绝加载它们,显卡将完全没有驱动。请保持关闭。
社区代码,而非 NVIDIA’s
cmpunlocker 是 Amogh Munikote 开发的开源项目(GPL-2.0),NVIDIA 不提供支持。我们安装的是自己构建并检查过的某个提交,并且会有意固定该版本,绝不自动更新。
10 GB 卡止步于 40 GB
8 GB 卡可解锁至 64 GB。10 GB 卡封装上的显存超出了负载下能稳定工作的容量,因此解锁将其限制在 40 GB,这是能够保持稳定的容量。安装程序会读取机器中的具体型号,并为每张卡应用正确的配置。
按钮背后的机器

一块解锁的 CMP,装在能容纳它的最便宜机器里

显卡在发票上单独列一行,机器另列一行;两者相加。以下数字是这套配置的最低成本:显卡装在能容纳它的最便宜整机里,不含任何销售税。配置器打开时可能显示更多内存;在那里更改处理器、内存或磁盘,每项更改都会即时计价。

NVIDIA CMP 170HX,一块全尺寸被动散热显卡,挡板上没有显示输出接口
一块被动散热、全尺寸的显卡,功耗最高 250 W,没有风扇。它专为前后通风的服务器机箱设计,我们的也正是这样运行的。
CardNVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver)
Card, per month$189
MachineIntel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
Machine, per month$83.67
Together$272.67 a month
Setup$29 once
Cards per machine1 to 4
CitiesNew York, Bucharest, San Francisco and Miami
TermMonthly; 15% off on a twelve-month cycle
DriverNVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04, 24.04 or 26.04

在配置器中打开这套配置 →

收取安装费是因为显卡按订单装配:加装显卡的机器属于定制配置。续费时月费不变。我们安装的其他显卡在 GPU 页面上也按同样方式计价。

关于这张卡的常见问题

解锁版 CMP 服务器,有问必答

什么是解锁版 CMP 170HX?
一块 NVIDIA CMP 170HX,运行来自 cmpunlocker 项目的 NVIDIA 开源内核驱动补丁版本。这张卡是 GA100,也就是 A100 所用的芯片,NVIDIA 出厂时只开放了 8 GB 的 HBM2e 显存,FP32 乘加运算被限速,链路被限制在 PCIe Gen 1。补丁驱动会启用全部 64 GB 显存、解除限速,并在每次启动显卡时将链路训练到 Gen 2。显卡本身没有任何改动。
解锁版 CMP 170HX 有多少显存?
8 GB 版本在补丁驱动运行后,nvidia-smi 会报告 64 GB 的 HBM2e。10 GB 版本则稳定在 40 GB。没有补丁驱动时,两种卡都只显示 NVIDIA 出厂时的容量:8 或 10 GB。
解锁在重启和内核更新后仍然有效吗?
有效。补丁模块和其他内核模块一样安装,每次开机都会加载。当新内核到来时,一个钩子会在你启动新内核之前,用机器上保留的 NVIDIA 源码为它重新构建模块。如果某张卡仍然只显示 8 GB,请运行 cmp-unlock build 并带上你的内核版本,然后从控制面板对服务器进行断电重启。
哪些操作系统能获得解锁驱动?
Ubuntu 22.04、24.04 和 26.04,由我们安装,适用于任何装有这张卡的机器:它是安装的一部分,不是可勾选的选项。Windows 以及我们安装的其他 Linux 发行版会得到 NVIDIA 出厂状态的显卡,因为解锁是一个 Linux 驱动,我们只在测试过的地方构建它。
我能在上面使用 CUDA、PyTorch、vLLM 和 llama.cpp 吗?
可以。驱动是 NVIDIA 自家的 610.57.04 打了补丁,所以任何为 Ampere 显卡和当前驱动构建的程序都能运行。用 apt install cuda-toolkit 安装 CUDA 工具包;cuda 和 cuda-drivers 元包会附带第二个原版驱动,所以 apt 被设置为拒绝安装它们。
700 亿参数的模型能在一张卡上运行吗?
4-bit 量化下可以:权重约 38 GB,在 64 GB 的卡上留出了我们容量规则要求的余量。8-bit 量化下权重约 70 GB,需要两张卡;一台机器最多支持四张。
一台服务器里能放多少张卡?
本页链接的机器最多四张。在配置器中选择数量。超过四张,或者需要跨机器拆分模型,请查看多 GPU 页面。
解锁后的显存可靠吗?
8 GB 卡解锁到 64 GB 是公开测试中表现稳定的组合,10 GB 卡停在 40 GB 也是出于同样的原因。不过它仍然是 NVIDIA 分拣过的显存,单张卡可能带有薄弱区域:LTT Labs 在他们测试的卡中发现过一张。每次安装都会检查每张卡是否达到完整容量,但这不等同于长时间内存测试。在把需要运行数天的任务交给一张卡之前,请自己跑一次测试,如果失败请告诉我们;这张卡会像其他部件一样更换。
为什么这个配置有设置费?
因为显卡是按订单安装的。加装显卡的机器属于定制配置,定制配置会收取上表所示的一次性设置费。只收取一次,续费时月费不变。
这些服务器在哪里?
在上表列出的每个城市。该产品线也在阿姆斯特丹销售,但配置器无法在那里安装显卡,因此解锁版 CMP 在该城市不可用。

其他值得一看的内容