Módulos aceleradores Google Coral e Hailo-8 M.2

Servidores dedicados Coral Edge TPU & Hailo-8

Dois módulos de inferência M.2, oferecidos como opção em cartuchos Moonshot de locação exclusiva. Eles pontuam redes pequenas e quantizadas em int8 junto aos dados — e não treinam nem servem grandes modelos de linguagem, portanto esta página não dirá que o fazem.
Ver os cartuchos

O trabalho para o qual um acelerador M.2 é realmente dimensionado:

Detecção e classificação

Detecção de objetos quadro a quadro, classificação de imagens e estimativa de pose são a carga de trabalho nativa aqui. Redes da família SSD-MobileNet e YOLO, já quantizadas em int8 e construídas para o silício, retornam em milissegundos sem que os dados jamais saiam da sua máquina.

Pontuação contínua, baixo consumo

Cada módulo consome alguns watts, de modo que um fluxo de câmera ou sensor pode ser pontuado ininterruptamente enquanto o Xeon por trás dele executa sua aplicação real. Essa transferência de carga é o objetivo central da peça: a aritmética se move, o host permanece livre.

Modelos de linguagem vivem em outro lugar

Nenhum dos módulos comporta um modelo medido em bilhões de parâmetros, quantizado ou não, e nada nesta página finge o contrário. Descobrir o que um determinado modelo exige é uma questão para hospedagem de LLM; as placas discretas que respondem a isso têm preços em servidores dedicados com GPU.

Acelerador Coral M.2

O Google classifica a Edge TPU do Coral em 4 TOPS em inteiros de 8 bits, com consumo de cerca de dois watts. Essa classificação é do próprio Google, repetida aqui conforme publicada — não fizemos nossos próprios benchmarks da peça.


O que ela proporciona na prática: modelos TensorFlow Lite, quantizados em int8 e passados previamente pelo compilador da Edge TPU, rodam no módulo em vez do processador. Uma rede ou compila para ele ou não compila — os modelos de visão estabelecidos compilam, e essa etapa de compilação é o verdadeiro preço de entrada.

Acelerador Coral

Módulo Hailo-8 M.2 2280

A classificação da própria Hailo para o Hailo-8 é de até 26 TOPS em inteiros de 8 bits; repetimos o número conforme o fabricante publica, sem um benchmark próprio. É a mais potente das duas opções, e a que se deve marcar quando uma rede da classe Coral deixa de ser suficiente.


Uma rede chega do TensorFlow ou ONNX por meio do Dataflow Compiler da Hailo, e o resultado compilado é servido pelo HailoRT no sistema operacional que você escolheu. Como o Coral, ele acelera redes neurais e nada mais — não é computação de uso geral sobressalente.

Módulo Hailo-8
Uma caixa de seleção, não um plano

Nenhum dos aceleradores é um produto por si só. Cada um é uma linha de opção no configurador de um cartucho, com preço ali ao lado da máquina que o carrega — nenhum valor é digitado nesta página, porque o formulário de pedido contém o valor atual.

Dois cartuchos host

O slot utiliza hardware HPE Moonshot: o m710x em um Xeon E3-1585L v5 de quatro núcleos, ou o m510 em Xeon D — oito núcleos como o D-1548, dezesseis como o D-1587. Escolha primeiro o host e depois adicione o módulo a ele.

Seu até o driver

Bare metal de locação exclusiva com root. A pilha do fornecedor — o runtime da Edge TPU para o Coral, o HailoRT para o Hailo-8 — é instalada por você, no seu sistema operacional, nas versões que você fixar. Nada atualiza a máquina pelas suas costas.

Quando int8 deixa de ser suficiente

O passo além de um módulo M.2 é uma placa discreta, não dois módulos. Cada placa que instalamos está listada com sua máquina em servidores dedicados com GPU; mais de uma placa — ou mais de uma máquina — é território de HPC.

Escolha um cartucho, marque o módulo.

Configure a cartridge