CPU 推理
整个团队的私人助手
量化后的 7–8B Llama、Qwen 或 Mistral 直接从 128 GB 系统内存提供聊天、检索和嵌入服务 —— 这正是 llama.cpp 和 Ollama 的用武之地。没有显卡,也没有显卡的价格,向量存储与模型同在一台机器上。4–24 小时内按订单构建,五个城市均可。
AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps
专用服务器上的 LLM 托管 · Server Room · 始于 2004 年
语言模型不需要同一种机器 —— 它们需要的是合适的那一台。代理网关要的是一台便宜、永不休眠的盒子。团队的助手直接从系统内存运行量化后的 Llama 或 Qwen。70B 需要显卡内存,而按 token 计费则期待你的增长。选好机位:整台机器按月归你所有,不共享、不计流量,面板上的数字就是结账时的数字。
本页面呈现时从订单目录读取。点击一个机位。
计数而来,非拼凑而成
上面的每一个数字都在本次请求中从配置器计费所用的记录行派生而来,因此不会在部署之间过期。你读到这句话时什么已上架、什么已通电,是另一个问题,由即时服务器负责 —— 本页面在满架和空架时读起来都一样。
按工作负载划分的目录
不是同一产品的四个档位 —— 而是四种不同的机器对应四种不同的工作,每个数字都是旁边所印确切配置的月度总价。之后不会有任何额外费用:端口、地址和带外控制台都已包含在数字里。
CPU 推理
量化后的 7–8B Llama、Qwen 或 Mistral 直接从 128 GB 系统内存提供聊天、检索和嵌入服务 —— 这正是 llama.cpp 和 Ollama 的用武之地。没有显卡,也没有显卡的价格,向量存储与模型同在一台机器上。4–24 小时内按订单构建,五个城市均可。
AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps
代理
像 OpenClaw 这样的网关终其一生都在调用别处的模型并等待回复。它们需要的是正常运行时间和一个端口,而不是加速器 —— 而承担这项职责最便宜、最诚实的机器就是这一台。
Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps
+ $19 · OpenClaw image, one-time
GPU 服务 · 微调
从高速运行的 13B 到 4-bit 的 70B,工作移入显卡内存,vLLM 将显卡变成一个批处理的、兼容 OpenAI 的端点,你的客户端代码早已会说这种语言。下面的数字是一台完整机器,48 GB 加速器已就位;它下面那行是显卡单独贡献的部分,旁边的 80 GB 配置则是同一机箱以 8-bit 承载 70B。
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47
我们安装的每一张显卡,哪一张适合,自有其页面 —— 每张卡都作为独立条目与其机器并列定价,见GPU 页面。
开发盒
NVIDIA 的小型 GB10 机器,按年托管在纽约 —— 框架优先适配的那台盒子,减去进口麻烦和椅子旁的风扇噪音。
10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps
数据驻留
阿姆斯特丹和布加勒斯特让欧洲的工作留在欧洲;纽约、迈阿密和旧金山让美国的工作留在本土。五座数据中心 →
机箱里的第二张卡,或旁边的第二台机器,是另一个问题,有自己的页面 —— 通道、端口和摆放位置,报价时注明部件名称。或者直接跳过:,回复会给出机箱和交付周期。
算术
权重等于参数量乘以每参数字节数 —— 这是算术,不是基准测试,与 GPU 页面所印的同一张有来源的表格。选一个规模和一种精度;答案会给出权重所需的内存、承载它们最便宜的机位,以及剩余空间以简单比率表示,因为一个勉强装下的模型无法提供服务。
5 GB7-8 billion parameters · 4-bit
$249/mo · 128 GB / 5 GB = 25.6×
8 GB7-8 billion parameters · 8-bit
$249/mo · 128 GB / 8 GB = 16×
16 GB7-8 billion parameters · 16-bit
$532.67/mo · L40S · 48 GB / 16 GB = 3×
8 GB13-14 billion parameters · 4-bit
$249/mo · 128 GB / 8 GB = 16×
14 GB13-14 billion parameters · 8-bit
$532.67/mo · L40S · 48 GB / 14 GB = 3.4×
28 GB13-14 billion parameters · 16-bit
$532.67/mo · L40S · 48 GB / 28 GB = 1.7×
19 GB30-34 billion parameters · 4-bit
$532.67/mo · L40S · 48 GB / 19 GB = 2.5×
34 GB30-34 billion parameters · 8-bit
$532.67/mo · L40S · 48 GB / 34 GB = 1.4×
68 GB30-34 billion parameters · 16-bit
$972.47/mo · A100 80GB · 80 GB / 68 GB = 1.2×
38 GB70 billion parameters · 4-bit
$532.67/mo · L40S · 48 GB / 38 GB = 1.3×
70 GB70 billion parameters · 8-bit
$972.47/mo · A100 80GB · 80 GB / 70 GB = 1.1×
140 GB70 billion parameters · 16-bit
140 GB → /hpc
仅权重本身 —— 运行时和上下文窗口存在于剩余空间中,这就是为什么上面的答案都不会把内存填满。许可协议是你与模型发布方之间的事;机器不会限制你加载什么。
从 CPU 推理机位的系统内存运行 —— 无需显卡。 需要显卡内存:48 GB 加速器可承载,比率下方为完整定价。 需要 80 GB 显卡 —— 同一机箱,更大的加速器,完整定价。 超过一张显卡容量的权重。这是多卡页面的问题,报价时注明部件名称。已包含在每个数字中
购买前常问
可以,但有一个值得说明的边界:CPU 机位上的量化 7–8B 模型能诚实地服务一个团队的助手、检索和嵌入。它无法向一千个用户提供 70B 服务 —— 那是 GPU 机位的职责,本页面在这里直说,而不是让你自己去发现。
4-bit 约需 38 GB 显卡内存,48 GB 显卡可承载;8-bit 需 70 GB,需要 80 GB 显卡;全精度需 140 GB,超过一张卡的容量,成为多卡页面的问题。
任何你有权持有权重的模型:Llama、Qwen、Mistral、Gemma 和 DeepSeek 系列及其微调版本。许可协议在你与发布方之间 —— 机器不会读取它,我们也不会设限。
不会。路径中没有任何东西读取它。每台机器一个租户,你的操作系统,你的磁盘;我们运营底层的硬件和网络,从不碰上层的工作负载。
当你的流量是突发性的,或前沿模型本身就是产品时,就继续用。当流量稳定、数据敏感,或一个调优过的开放模型已经能胜任时,就迁移 —— 两者也能很好地混合:很多技术栈把最难的百分之五路由给 API,其余的自己服务。
持续使用一两年后,购买更划算,但还要有人负责存放、供电、散热和维修。租赁从第一天起就划算,在每次升级时划算,在凌晨三点某个部件坏掉时也划算 —— 按我们的书面时限更换,而不是你的。
现货机器约三十分钟,定制构建四到二十四小时,需要采购部件时更久 —— 阶梯在订购时即已印出,即时服务器列出当前已上架的产品。
没有试用账户。首次激活后三个日历日内,退款政策按书面条款适用,加密货币付款以商店积分形式退款。最便宜的诚实试用是 CPU 机位的一个月。
有时会有。为你的订单采购的部件可能带有预付款部分或最低期限 —— 而且你在付款前就会被告知确切内容,绝不会在付款后。现货机器适用默认条款:一个月,无合约。
下一个机位,通常在同一栋楼里:CPU 机器通过本地网络把权重交给 GPU 机器,或者你已持有的机箱中的显卡被更换,账单恰好按差额变动。
相邻页面
For the record
Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.