AMD Instinct GPU 服务器

在裸金属基础设施上部署 AMD Instinct MI210

AMD Instinct MI210 加速器配备 64 GB HBM2e,适用于机器学习与高性能计算,搭载于基于 Intel Xeon Scalable 或 AMD EPYC 平台的裸金属服务器中。为语言模型选配硬件是另一个问题:请从 LLM 托管 开始。

64 GB HBM2e,内存带宽达 1,638 GB/s。 PCIe 4.0 卡上的第二代 CDNA™ 架构。 三条服务器产品线:两条基于 Intel Xeon Scalable,一条基于 AMD EPYC。

AMD Instinct MI210 裸金属服务器

专为机器学习与高性能计算而设计。MI210 将第二代 CDNA™ 计算架构与 64 GB HBM2e 内存相结合,适用于高强度训练、推理及 HPC 应用。

极致计算吞吐量

第二代 CDNA™ 架构为深度学习训练和科学计算工作负载带来突破性的计算性能,满足对最大吞吐量的需求。

标准 PCIe 外形规格

MI210 将 MI200 系列芯片带入标准 PCIe 4.0 卡中,因此可安装于普通 Xeon Scalable 或 EPYC 服务器,而非专用加速器平台。

超大内存容量

64 GB 带 ECC 的 HBM2e 支持大规模模型训练与推理以及内存密集型 HPC 工作负载,1,638 GB/s 的带宽让计算单元始终有充足的数据供给。

MI200 系列中的 PCIe 成员

MI250 和 MI250X 是用于专用百亿亿次平台的 OAM 模块。MI210 则将相同的第二代 CDNA™ 架构带入标准 PCIe 4.0 卡——这正是它成为我们货架上 Instinct 加速器的原因。

第二代 CDNA™ 架构

专为计算打造的芯片,在大规模并行处理工作负载中提供卓越的密度与能效。

AI 加速

优化的矩阵运算与混合精度计算,加速深度学习训练、模型微调和推理部署。

内存一致性架构

第三代 AMD Infinity 架构在 GPU 计算单元与系统内存之间实现高带宽、低延迟通信,最大化数据吞吐量。

GPU 互连

AMD Infinity Fabric™ 链路支持 MI210 卡之间的高速点对点通信,适用于多 GPU 训练和分布式计算工作负载。

适用于 AMD Instinct™ 工作负载的 Intel Xeon Scalable 与 AMD EPYC 服务器

三种主机平台

MI210 可搭载于 Intel Xeon Scalable Silver 和 Gold 产品线、两条按单生产的企业级产品线(DDR4 上的 Xeon Gold 6330 至 6354,DDR5 上的 Gold 6438Y),以及 AMD EPYC 产品线,最高可选 64 核 EPYC 7763。EPYC 为显卡提供 PCIe 4.0 插槽,与其同代;Silver 和 Gold 则提供 PCIe 3.0,主机链路带宽减半,这会拖慢通过总线流式传输批次的训练循环,但对权重已驻留在 HBM 中的推理服务器毫无影响。

灵活扩展

通过快速的硬件供应按需扩展 GPU 基础设施。标准升级和额外容量通常在 24 小时内完成部署。

专家支持

GPU 基础设施专家通过在线聊天和电子邮件全天候待命,协助部署、优化和故障排除。

MI210 L40S A100 H100
GPU 架构 CDNA 2.0 Ada Lovelace NVIDIA Ampere Hopper
GPU 内存 64GB HBM2e 48GB GDDR6 80GB HBM2e 80GB HBM2e
GPU 内存带宽 1638 GB/s 864 GB/s 1935 GB/s 2039 GB/s
FP32 22.63 TFLOPS 91.6 TFLOPS 19.5 TFLOPS 51 TFLOPS
TF32 Tensor Core — 366 TFLOPS 312 TFLOPS 756 TFLOPS
FP16/BF16 Tensor Core 181 TFLOPS 733 TFLOPS 624 TFLOPS 1513 TFLOPS
功耗 最高 300W 最高 350W 最高 300W 最高 350W
仅显卡,每月 加载中... 加载中... 加载中... 加载中...

NVIDIA 公布的 L40S、A100 和 H100 张量核心数据包含结构化稀疏性,因此进行稠密矩阵运算时需将这些数值减半。AMD 引用的 MI210 181 TFLOPS 不含稀疏性系数,这使得 FP16/BF16 行中一个是稠密数据,旁边三个是稀疏数据。MI210 没有 TF32 模式,因此该行显示为破折号。

关于 AMD Instinct MI210 服务器的常见问题

获取有关部署和运行 MI210 GPU 加速裸金属服务器的常见问题解答,适用于训练、推理和高性能计算应用。

什么是 AMD Instinct MI210?哪些工作负载受益最大?

AMD Instinct MI210 是一款基于第二代 CDNA™ 架构的企业级计算 GPU,专为计算而非图形处理而优化。它擅长深度学习训练与推理、科学模拟、计算流体动力学、分子建模以及需要大规模并行处理能力的数据分析。如果您正在为语言模型选择硬件,这个问题有专门的页面——请参阅 LLM 托管。

MI210 与 MI250 和 MI250X 有何不同?

MI250 和 MI250X 是为专用百亿亿次平台打造的 OAM 模块,不在我们的产品目录中。MI210 将相同的第二代 CDNA™ 架构带入标准 PCIe 4.0 卡,配备 64 GB HBM2e,因此它可以安装在与我们其他 GPU 选项相同的 Xeon Scalable 和 EPYC 服务器中。

AMD Instinct 服务器的典型部署时间是多久?

已上架并配备 MI210 的机器在付款验证后约 30 分钟内交付。当我们安装库存中的显卡时,需要 4 到 24 小时;需要采购的显卡则需要五到十个工作日,付款前会告知您具体情况。所有 AMD Instinct 服务器均支持即时重装操作系统,无需提交支持工单,从而实现快速迭代。网络基础设施针对持续高吞吐量工作负载和低延迟连接进行了优化。

哪些软件框架和工具支持 AMD Instinct GPU?

AMD Instinct 加速器运行于 ROCm(Radeon Open Compute)之上,这是一个开源 GPU 计算平台,支持 PyTorch、TensorFlow、JAX、ONNX Runtime 及其他主流 ML 框架。ROCm 包含 HIP(异构计算可移植性接口),可轻松移植 CUDA 代码,还提供针对线性代数、FFT、随机数生成和深度神经网络优化的库。通过 Docker 和 Kubernetes 提供完整的容器支持,可实现生产级 AI/ML 部署。

MI210 提供怎样的内存?

MI210 搭载 64 GB 带 ECC 的 HBM2e(高带宽内存),提供 1,638 GB/s 的内存带宽。这一容量支持大型数据集和内存密集型 HPC 工作负载,无需频繁在主机与加速器之间搬运内存数据。系统内存和 NVMe 存储在订单表单中单独配置,因此它们可独立于加速器进行扩展。