专用服务器上的 LLM 托管 · Server Room · 始于 2004 年

一个机架。运行模型的每一种方式。

语言模型不需要同一种机器 —— 它们需要的是合适的那一台。代理网关要的是一台便宜、永不休眠的盒子。团队的助手直接从系统内存运行量化后的 Llama 或 Qwen。70B 需要显卡内存,而按 token 计费则期待你的增长。选好机位:整台机器按月归你所有,不共享、不计流量,面板上的数字就是结账时的数字。

选择你的机位 为你的模型选型

  • 单租户
  • 不限流量
  • 五个城市
  • 按月付费,无合约

本页面呈现时从订单目录读取。点击一个机位。

计数而来,非拼凑而成

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

上面的每一个数字都在本次请求中从配置器计费所用的记录行派生而来,因此不会在部署之间过期。你读到这句话时什么已上架、什么已通电,是另一个问题,由即时服务器负责 —— 本页面在满架和空架时读起来都一样。

按工作负载划分的目录

四个机位,完整定价。

不是同一产品的四个档位 —— 而是四种不同的机器对应四种不同的工作,每个数字都是旁边所印确切配置的月度总价。之后不会有任何额外费用:端口、地址和带外控制台都已包含在数字里。

CPU 推理

整个团队的私人助手

量化后的 7–8B Llama、Qwen 或 Mistral 直接从 128 GB 系统内存提供聊天、检索和嵌入服务 —— 这正是 llama.cpp 和 Ollama 的用武之地。没有显卡,也没有显卡的价格,向量存储与模型同在一台机器上。4–24 小时内按订单构建,五个城市均可。

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

代理

代理的盒子

像 OpenClaw 这样的网关终其一生都在调用别处的模型并等待回复。它们需要的是正常运行时间和一个端口,而不是加速器 —— 而承担这项职责最便宜、最诚实的机器就是这一台。

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

GPU 服务 · 微调

大模型需要显卡内存

从高速运行的 13B 到 4-bit 的 70B,工作移入显卡内存,vLLM 将显卡变成一个批处理的、兼容 OpenAI 的端点,你的客户端代码早已会说这种语言。下面的数字是一台完整机器,48 GB 加速器已就位;它下面那行是显卡单独贡献的部分,旁边的 80 GB 配置则是同一机箱以 8-bit 承载 70B。

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

我们安装的每一张显卡,哪一张适合,自有其页面 —— 每张卡都作为独立条目与其机器并列定价,见GPU 页面

开发盒

DGX Spark,不在你的桌边

NVIDIA 的小型 GB10 机器,按年托管在纽约 —— 框架优先适配的那台盒子,减去进口麻烦和椅子旁的风扇噪音。

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

数据驻留

欧盟或美国,由你决定

阿姆斯特丹和布加勒斯特让欧洲的工作留在欧洲;纽约、迈阿密和旧金山让美国的工作留在本土。五座数据中心 →

比一个机位更大?

机箱里的第二张卡,或旁边的第二台机器,是另一个问题,有自己的页面 —— 通道、端口和摆放位置,报价时注明部件名称。或者直接跳过:,回复会给出机箱和交付周期。

算术

为模型选型。机器随之而定。

权重等于参数量乘以每参数字节数 —— 这是算术,不是基准测试,与 GPU 页面所印的同一张有来源的表格。选一个规模和一种精度;答案会给出权重所需的内存、承载它们最便宜的机位,以及剩余空间以简单比率表示,因为一个勉强装下的模型无法提供服务。

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

仅权重本身 —— 运行时和上下文窗口存在于剩余空间中,这就是为什么上面的答案都不会把内存填满。许可协议是你与模型发布方之间的事;机器不会限制你加载什么。

已包含在每个数字中

每个机位包含的内容。

单租户物理机器完全归你所有。底层没有虚拟机监控程序,没有共享显卡,没有时间切片,没有邻居的批处理作业跑在你的芯片上。
Root 权限和控制台你选择的全新操作系统,裸机 root 权限,以及一个带外控制台(iLO、iDRAC、IPMI),即使操作系统无响应时仍可访问。
不限流量的端口双向均不计流量。数据集传入、检查点传出、用户得到服务 —— 任何账单上都不存在出站流量这一行。
你的技术栈,你的版本Ollama、llama.cpp、vLLM —— 由你安装并锁定版本,之后不会有任何变动。希望在交付前装好 GPU 驱动?把确切版本写进订单。
数据驻留提示词、上下文和微调数据在你的用户与你的机器之间传输,路径中没有第三方来记录它们、用它们训练,或围绕它们改写条款。
全天候人工支持聊天、邮件和电话,全年每一小时 —— 坏掉的部件按书面时限更换,而不是靠善意承诺。时限已公布。

另一种账单

工作稳定时,固定价格胜过按量计费。

按 token 计费的 API 适合突发流量和前沿模型质量 —— 我们会直说,而不是为了推销而贬低它。当流量恒定、数据必须留在你的掌控中,或者一个调优过的开放模型已经能胜任时,机器就赢了:它的数字在流量翻十倍时依然不变,增长不再是一个账单条目。本域名上的每一个月度数字,汇总在一张表中,就是定价页面;为什么这里的老机器保持便宜,见价值页面

购买前常问

十个直截了当的回答。

没有显卡能运行 LLM 吗?

可以,但有一个值得说明的边界:CPU 机位上的量化 7–8B 模型能诚实地服务一个团队的助手、检索和嵌入。它无法向一千个用户提供 70B 服务 —— 那是 GPU 机位的职责,本页面在这里直说,而不是让你自己去发现。

70B 模型需要什么?

4-bit 约需 38 GB 显卡内存,48 GB 显卡可承载;8-bit 需 70 GB,需要 80 GB 显卡;全精度需 140 GB,超过一张卡的容量,成为多卡页面的问题。

允许我运行哪些模型?

任何你有权持有权重的模型:Llama、Qwen、Mistral、Gemma 和 DeepSeek 系列及其微调版本。许可协议在你与发布方之间 —— 机器不会读取它,我们也不会设限。

我的数据会被用于训练吗?

不会。路径中没有任何东西读取它。每台机器一个租户,你的操作系统,你的磁盘;我们运营底层的硬件和网络,从不碰上层的工作负载。

为什么不继续用按 token 计费的 API?

当你的流量是突发性的,或前沿模型本身就是产品时,就继续用。当流量稳定、数据敏感,或一个调优过的开放模型已经能胜任时,就迁移 —— 两者也能很好地混合:很多技术栈把最难的百分之五路由给 API,其余的自己服务。

按月租,还是买硬件?

持续使用一两年后,购买更划算,但还要有人负责存放、供电、散热和维修。租赁从第一天起就划算,在每次升级时划算,在凌晨三点某个部件坏掉时也划算 —— 按我们的书面时限更换,而不是你的。

交付有多快?

现货机器约三十分钟,定制构建四到二十四小时,需要采购部件时更久 —— 阶梯在订购时即已印出,即时服务器列出当前已上架的产品。

有试用吗?

没有试用账户。首次激活后三个日历日内,退款政策按书面条款适用,加密货币付款以商店积分形式退款。最便宜的诚实试用是 CPU 机位的一个月。

特殊订购部件有不同的条款吗?

有时会有。为你的订单采购的部件可能带有预付款部分或最低期限 —— 而且你在付款前就会被告知确切内容,绝不会在付款后。现货机器适用默认条款:一个月,无合约。

当我超出机位容量时怎么办?

下一个机位,通常在同一栋楼里:CPU 机器通过本地网络把权重交给 GPU 机器,或者你已持有的机箱中的显卡被更换,账单恰好按差额变动。

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt