CPU 推理
整个团队的私人助手
量化后的 7–8B Llama、Qwen 或 Mistral 直接从 128 GB 系统内存提供聊天、检索和嵌入服务 —— 这正是 llama.cpp 和 Ollama 为之而生的任务。没有显卡,也没有显卡的价格,向量库与模型同在一台机器上。4–24 小时内按订单组装,五座城市均可。
AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps
专用服务器上的 LLM 托管 · Server Room · 始于 2004 年
语言模型不需要同一种机器 —— 它们需要的是合适的那一种。代理网关要的是一台便宜且从不休眠的盒子。团队助手直接从系统内存运行量化后的 Llama 或 Qwen。70B 需要显卡内存,按 token 计费则要的是你的增长。选好机位:整台机器按月归你所有,不共享、不计流量,标出的价格就是结账时的价格。
本页呈现时从订单目录读取。点击一个机位。
计数而来,非拼凑而成
上面每一个数字都在本次请求中从配置器计费所用的记录行派生而来,因此不会在部署之间过期。此刻机架上通电的是什么,那是另一个问题,由即时服务器负责 —— 本页在满架和空架时读到的内容都一样。
按工作负载划分的目录
不是同一产品的四个档次 —— 而是四种不同的机器对应四种不同的工作,每个价格都是旁边所印确切配置的月度总额。之后不会有任何额外费用:端口、地址和带外控制台都已包含在数字里。
CPU 推理
量化后的 7–8B Llama、Qwen 或 Mistral 直接从 128 GB 系统内存提供聊天、检索和嵌入服务 —— 这正是 llama.cpp 和 Ollama 为之而生的任务。没有显卡,也没有显卡的价格,向量库与模型同在一台机器上。4–24 小时内按订单组装,五座城市均可。
AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps
代理
像 OpenClaw 这样的网关,其一生都在调用别处的模型并等待回复。它们需要的是在线时间和端口,而不是加速器 —— 而承担这一职责最便宜、最诚实的机器就是这一台。
Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps
+ $19 · OpenClaw image, one-time
GPU 服务 · 微调
从高速运行的 13B 到 4-bit 的 70B,工作负载移入显卡内存,vLLM 把显卡变成一个你的客户端代码早已会调用的、支持批处理的 OpenAI 兼容端点。下面的数字是一台完整机器,48 GB 加速器已经就位;它下面那行是显卡单独贡献的部分,旁边的 80 GB 配置则是同一机箱以 8-bit 承载 70B。
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47
我们安装的每一张显卡中该选哪一张,自有其专属页面 —— 每张卡都作为独立一行标价,列在机器旁边,见 GPU 页面。
开发盒
NVIDIA 的小型 GB10 机器,按年托管在纽约 —— 框架最先适配的那台盒子,减去进口麻烦和你座椅旁的风扇噪音。
10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps
数据驻留
阿姆斯特丹和布加勒斯特让欧洲的工作留在欧洲;纽约、迈阿密和旧金山让美国的工作留在本土。五座数据中心 →
机箱里加第二张卡,或旁边加第二台机器,那是另一个问题,有自己的页面 —— 通道、端口和摆放位置,报价时注明部件名称。或者直接跳过:,回复会告诉你机箱和交付周期。
算术
权重等于参数量乘以每参数字节数 —— 这是算术,不是基准测试,用的正是 GPU 页面所印的同一张来源表。选一个规模和一种精度;答案会给出权重所需的内存、能承载它的最便宜机位,以及剩余余量,以简单比率表示,因为勉强装下的模型无法提供服务。
5 GB7-8 billion parameters · 4-bit
$249/mo · 128 GB / 5 GB = 25.6×
8 GB7-8 billion parameters · 8-bit
$249/mo · 128 GB / 8 GB = 16×
16 GB7-8 billion parameters · 16-bit
$532.67/mo · L40S · 48 GB / 16 GB = 3×
8 GB13-14 billion parameters · 4-bit
$249/mo · 128 GB / 8 GB = 16×
14 GB13-14 billion parameters · 8-bit
$532.67/mo · L40S · 48 GB / 14 GB = 3.4×
28 GB13-14 billion parameters · 16-bit
$532.67/mo · L40S · 48 GB / 28 GB = 1.7×
19 GB30-34 billion parameters · 4-bit
$532.67/mo · L40S · 48 GB / 19 GB = 2.5×
34 GB30-34 billion parameters · 8-bit
$532.67/mo · L40S · 48 GB / 34 GB = 1.4×
68 GB30-34 billion parameters · 16-bit
$972.47/mo · A100 80GB · 80 GB / 68 GB = 1.2×
38 GB70 billion parameters · 4-bit
$532.67/mo · L40S · 48 GB / 38 GB = 1.3×
70 GB70 billion parameters · 8-bit
$972.47/mo · A100 80GB · 80 GB / 70 GB = 1.1×
140 GB70 billion parameters · 16-bit
140 GB → /hpc
仅权重本身 —— 运行时和上下文窗口都住在余量里,这就是为什么上面的答案都不会把内存填满。实际发布的文件比算术结果更重,因为常见的 4-bit 格式会把部分张量保留在更高精度:Ollama 默认的 4-bit Llama 3.1 70B 是 43 GB 的下载量,而不是 38 GB,所以请按你将要加载的文件来估算。许可协议是你与模型发布方之间的事;机器不会限制你加载什么。
从系统内存运行于 CPU 推理机位 —— 无需显卡。 需要显卡内存:48 GB 加速器可承载,完整价格见比率下方。 需要 80 GB 显卡 —— 同一机箱,更大的加速器,完整价格。 权重超过一张卡的容量。那是多卡页面的问题,报价时注明部件名称。已包含在每个价格里
购买前常问
可以,但有一个值得说明的边界:CPU 机位上一个量化后的 7–8B 模型,能诚实地服务一个团队的助手、检索和嵌入。它无法向一千个用户提供 70B 服务 —— 那是 GPU 机位的职责,本页在这里就说明,而不是让你自己去发现。
4-bit 下约 38 GB 显卡内存,48 GB 显卡可承载;8-bit 下 70 GB,需要 80 GB 显卡;全精度下 140 GB,超过一张卡的容量,就成了多卡页面的问题。
任何你合法持有权重的模型:Llama、Qwen、Mistral、Gemma 和 DeepSeek 系列及其微调版本。许可协议在你与发布方之间 —— 机器不会去读它,我们也不会设限。
不会。路径中没有任何东西会读取它。每台机器一个租户,你的操作系统,你的磁盘;我们运营底层的硬件和网络,从不碰上面的工作负载。
当你的流量是突发性的,或前沿模型本身就是产品时,就继续用。当流量稳定、数据敏感,或一个调优过的开放模型已经能胜任时,就迁移 —— 两者也能很好地混合:很多技术栈把最难的那百分之五路由给 API,其余的自己服务。
持续使用一两年后,买断更划算,再加上有人付钱来存放、供电、散热和维修。租用在第一天、每次升级时、以及凌晨三点某个部件坏掉时都更划算 —— 那时按我们的书面时限更换,而不是你的。
现货机器约三十分钟,组装机器四到二十四小时,需要采购部件时更久 —— 阶梯在订购时就会显示,即时服务器列出此刻已上架通电的机器。
没有试用账户。首次激活后三个日历日内,退款政策按书面条款适用,加密货币付款以商店余额形式退款。最便宜也最诚实的试用,是 CPU 机位租一个月。
有时会有。为你的订单专门采购的部件可能带有预付款部分或最低租期 —— 而且会在你付款之前就明确告知,绝不事后才说。现货机器适用默认条款:一个月,无合约。
通常是同一栋楼里的下一个机位:CPU 机器通过本地网络把权重交给 GPU 机器,或者你手中机箱里的显卡被更换,账单只按差额变动。
相邻页面
机主挂牌的机器
机主在我们市场上挂牌的 GPU 机器,由机主按月定价。我们姊妹公司 Primcast 的挂牌也会出现;那些在 primcast.com 上租用。
For the record
Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.