专用服务器上的 LLM 托管 · Server Room · 始于 2004 年

一个机架,运行模型的每一种方式。

语言模型不需要同一种机器 —— 它们需要的是合适的那一种。代理网关要的是一台便宜且从不休眠的盒子。团队助手直接从系统内存运行量化后的 Llama 或 Qwen。70B 需要显卡内存,按 token 计费则要的是你的增长。选好机位:整台机器按月归你所有,不共享、不计流量,标出的价格就是结账时的价格。

选择你的机位 为你的模型选型

  • 单租户
  • 不限流量
  • 五座城市
  • 按月付费,无合约

本页呈现时从订单目录读取。点击一个机位。

计数而来,非拼凑而成

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

上面每一个数字都在本次请求中从配置器计费所用的记录行派生而来,因此不会在部署之间过期。此刻机架上通电的是什么,那是另一个问题,由即时服务器负责 —— 本页在满架和空架时读到的内容都一样。

按工作负载划分的目录

四个机位,价格完整。

不是同一产品的四个档次 —— 而是四种不同的机器对应四种不同的工作,每个价格都是旁边所印确切配置的月度总额。之后不会有任何额外费用:端口、地址和带外控制台都已包含在数字里。

CPU 推理

整个团队的私人助手

量化后的 7–8B Llama、Qwen 或 Mistral 直接从 128 GB 系统内存提供聊天、检索和嵌入服务 —— 这正是 llama.cpp 和 Ollama 为之而生的任务。没有显卡,也没有显卡的价格,向量库与模型同在一台机器上。4–24 小时内按订单组装,五座城市均可。

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

代理

代理的盒子

像 OpenClaw 这样的网关,其一生都在调用别处的模型并等待回复。它们需要的是在线时间和端口,而不是加速器 —— 而承担这一职责最便宜、最诚实的机器就是这一台。

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

GPU 服务 · 微调

大模型需要显卡内存

从高速运行的 13B 到 4-bit 的 70B,工作负载移入显卡内存,vLLM 把显卡变成一个你的客户端代码早已会调用的、支持批处理的 OpenAI 兼容端点。下面的数字是一台完整机器,48 GB 加速器已经就位;它下面那行是显卡单独贡献的部分,旁边的 80 GB 配置则是同一机箱以 8-bit 承载 70B。

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

我们安装的每一张显卡中该选哪一张,自有其专属页面 —— 每张卡都作为独立一行标价,列在机器旁边,见 GPU 页面。

开发盒

DGX Spark,不在你的桌边

NVIDIA 的小型 GB10 机器,按年托管在纽约 —— 框架最先适配的那台盒子,减去进口麻烦和你座椅旁的风扇噪音。

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

数据驻留

欧盟或美国,由你决定

阿姆斯特丹和布加勒斯特让欧洲的工作留在欧洲;纽约、迈阿密和旧金山让美国的工作留在本土。五座数据中心 →

比一个机位更大?

机箱里加第二张卡,或旁边加第二台机器,那是另一个问题,有自己的页面 —— 通道、端口和摆放位置,报价时注明部件名称。或者直接跳过:,回复会告诉你机箱和交付周期。

算术

为模型选型,机器随之而定。

权重等于参数量乘以每参数字节数 —— 这是算术,不是基准测试,用的正是 GPU 页面所印的同一张来源表。选一个规模和一种精度;答案会给出权重所需的内存、能承载它的最便宜机位,以及剩余余量,以简单比率表示,因为勉强装下的模型无法提供服务。

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

仅权重本身 —— 运行时和上下文窗口都住在余量里,这就是为什么上面的答案都不会把内存填满。实际发布的文件比算术结果更重,因为常见的 4-bit 格式会把部分张量保留在更高精度:Ollama 默认的 4-bit Llama 3.1 70B 是 43 GB 的下载量,而不是 38 GB,所以请按你将要加载的文件来估算。许可协议是你与模型发布方之间的事;机器不会限制你加载什么。

已包含在每个价格里

每个机位都包含什么。

单租户物理机器完全归你一人所有。底下没有虚拟机监控程序,没有共享显卡,没有时间分片,你的芯片上也没有邻居的批处理任务。
Root 权限和控制台你自选的全新操作系统,裸金属上的 root 权限,以及一个在操作系统无响应时仍能应答的带外控制台(iLO、iDRAC、IPMI)。
不限流量的端口两个方向都不计数。数据集进来,检查点出去,用户得到服务 —— 任何账单上都不存在出站流量这一行。
你的技术栈,你的版本Ollama、llama.cpp、vLLM —— 由你安装并锁定版本,之后没有任何东西会改动它们。想在交付前就装好 GPU 驱动?把确切版本写进订单。
数据驻留提示词、上下文和微调数据在你的用户与你的机器之间流动,路径中没有第三方去记录它们、拿它们训练,或围绕它们改写条款。
全天候有人值守聊天、邮件和电话,全年每一小时都在线 —— 坏掉的部件按书面承诺的时限更换,而不是靠善意承诺。时限已公布。

另一种账单

工作负载稳定时,固定价胜过按量计费。

按 token 计费的 API 是应对突发流量和前沿模型质量的正确工具 —— 我们会直说,而不是靠贬低它来推销。当流量恒定、数据必须留在你的掌控中,或者一个调优过的开放模型已经能胜任时,机器就赢了:它的价格在流量翻十倍时依然不变,增长不再是一个账单条目。本域名上每一个月度价格,汇总在一张表里,就是定价页面;为什么这里的老机器保持便宜,见价值页面。

购买前常问

十个直截了当的回答。

没有显卡能运行 LLM 吗?

可以,但有一个值得说明的边界:CPU 机位上一个量化后的 7–8B 模型,能诚实地服务一个团队的助手、检索和嵌入。它无法向一千个用户提供 70B 服务 —— 那是 GPU 机位的职责,本页在这里就说明,而不是让你自己去发现。

70B 模型需要什么?

4-bit 下约 38 GB 显卡内存,48 GB 显卡可承载;8-bit 下 70 GB,需要 80 GB 显卡;全精度下 140 GB,超过一张卡的容量,就成了多卡页面的问题。

允许我运行哪些模型?

任何你合法持有权重的模型:Llama、Qwen、Mistral、Gemma 和 DeepSeek 系列及其微调版本。许可协议在你与发布方之间 —— 机器不会去读它,我们也不会设限。

我的数据会被用来训练什么吗?

不会。路径中没有任何东西会读取它。每台机器一个租户,你的操作系统,你的磁盘;我们运营底层的硬件和网络,从不碰上面的工作负载。

为什么不继续用按 token 计费的 API?

当你的流量是突发性的,或前沿模型本身就是产品时,就继续用。当流量稳定、数据敏感,或一个调优过的开放模型已经能胜任时,就迁移 —— 两者也能很好地混合:很多技术栈把最难的那百分之五路由给 API,其余的自己服务。

按月租,还是买硬件?

持续使用一两年后,买断更划算,再加上有人付钱来存放、供电、散热和维修。租用在第一天、每次升级时、以及凌晨三点某个部件坏掉时都更划算 —— 那时按我们的书面时限更换,而不是你的。

交付有多快?

现货机器约三十分钟,组装机器四到二十四小时,需要采购部件时更久 —— 阶梯在订购时就会显示,即时服务器列出此刻已上架通电的机器。

有试用吗?

没有试用账户。首次激活后三个日历日内,退款政策按书面条款适用,加密货币付款以商店余额形式退款。最便宜也最诚实的试用,是 CPU 机位租一个月。

特殊订购的部件有不同的条款吗?

有时会有。为你的订单专门采购的部件可能带有预付款部分或最低租期 —— 而且会在你付款之前就明确告知,绝不事后才说。现货机器适用默认条款:一个月,无合约。

当我超出机位容量时怎么办?

通常是同一栋楼里的下一个机位:CPU 机器通过本地网络把权重交给 GPU 机器,或者你手中机箱里的显卡被更换,账单只按差额变动。

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt