Ferramentas
Guias

Referência de computação de IA

Referência

Taxa de transferência de aceleradores de IA (FLOPS/TOPS), formatos de precisão e definições de unidades de computação.

100% no cliente Sem backend

Unidades de computação

Formatos de precisão

Tipos de acelerador

Hardware

Nome Fabricante Arquitetura Memória Largura de banda FP16/BF16 (TF) FP8 (TF) INT8 (TOPS)

Os valores são PICOS TEÓRICOS (densos) das fichas técnicas do fabricante. A taxa sustentada no mundo real é menor e difere entre treinamento e inferência. FLOPS e TOPS medem operações diferentes e não são diretamente comparáveis.

Nesta página

O que é uma referência de hardware de computação para IA?#

Quando você lê que uma GPU entrega “1979 TFLOPS” ou que um chip tem “192 GB de memória”, esses números só significam algo quando você conhece as regras por trás deles: em que precisão numérica a cifra foi medida, se inclui esparsidade estruturada, se é vazão de vírgula flutuante (TFLOPS) ou de inteiros (TOPS), e que largura de banda a memória de fato fornece. Os fornecedores publicam números de manchete na sua configuração mais lisonjeira; sem uma referência que declare as condições, dois chips não podem ser comparados com honestidade.

Esta página é essa referência. Reúne quatro coisas que um engenheiro de ML ou comprador de infraestrutura de fato precisa, lado a lado: o glossário de unidades de computação (o que FLOPS, TFLOPS, TOPS e MAC realmente significam), os formatos de precisão numérica (do FP64 ao INT4, em ordem típica de vazão), os tipos de acelerador (CPU, GPU, TPU, NPU, LPU, MAU) e uma tabela de hardware de chips específicos com a capacidade de memória, a largura de banda de memória e a vazão de pico densa em FP16, FP8 e INT8 — cada cifra verificada contra a ficha técnica do fornecedor, com a ressalva exata registrada quando um número poderia enganar.

Como usar#

  1. Pesquise em tudo. A única caixa de Pesquisa no topo filtra as quatro seções ao mesmo tempo por nome, fornecedor, nó de processo ou especificação — digitar H100, NVIDIA, 192gb ou 4.8tb/s estreita a tabela de hardware.
  2. Leia as quatro seções.
    • Unidades de computação — os símbolos com prefixo SI (de FLOP a EFLOPS, além de TOPS e MAC) com os seus expoentes de base 10, para que você consiga converter entre eles.
    • Formatos de precisão — FP64, FP32, TF32, FP16, BF16, FP8, INT8, INT4, cada um com a sua largura em bits e o caso de uso típico, ordenados aproximadamente pela vazão ascendente num tensor core moderno.
    • Tipos de acelerador — a distinção de uma linha entre CPU, GPU, TPU, NPU, LPU e MAU.
    • Tabela de hardware — nome, fornecedor, processo, memória (GB), largura de banda de memória (TB/s) e vazão densa de FP16 / FP8 / INT8, com uma nota de ressalva por chip.
  3. Confie nas células vazias. Onde uma célula está vazia em vez de zero, a cifra não pôde ser verificada como um pico denso — a nota explica o porquê (a MI300X da AMD publica picos esparsos, então o denso é cerca de metade). É mais honesto deixar em branco do que imprimir um número com uma condição oculta.

Principais funcionalidades#

  • Apenas picos densos, com esparsidade destacada. As cifras da NVIDIA são densas (sem esparsidade estruturada 2:4); a nota lembra que os números de manchete frequentemente dobram quando a esparsidade é ativada. Sem inflação silenciosa de “com esparsidade”.
  • TFLOPS e TOPS mantidos à parte. O glossário afirma claramente que TOPS (a família OPS) não é diretamente comparável a TFLOPS (a família FLOPS) — uma confusão que os fornecedores exploram com prazer.
  • Todas as quatro precisões em ordem de vazão. Veja num relance que FP8 aproximadamente dobra o FP16 e INT8 aproximadamente dobra o BF16, numa dada arquitetura — a razão económica da existência da quantização.
  • Memória e largura de banda, não apenas computação. Para inferência de modelos de linguagem grandes, capacidade e largura de banda de memória costumam importar mais do que o pico de FLOPS, então são colunas de primeira classe.
  • Fontes citadas pelo nome, não por link. Cada cifra nomeia a ficha técnica ou a página de produto de onde veio, sem URL externa, para que você verifique contra a documentação do próprio fornecedor.

Exemplo prático#

Compare a linha da NVIDIA através de três gerações usando a tabela de hardware. Pesquise NVIDIA e você obtém as linhas A100, H100 e H200 juntas:

ChipMemóriaLargura de bandaFP16 densoFP8 densoINT8 denso
A100 80GB SXM80 GB2.0 TB/s312 TFLOPS624 TOPS
H100 SXM580 GB3.35 TB/s989 TFLOPS1979 TFLOPS1979 TOPS
H200 SXM141 GB4.8 TB/s989 TFLOPS1979 TFLOPS1979 TOPS

Duas coisas saltam à vista. Primeiro, o salto do H100 para o H200 não adicionou computação nenhuma — ambos compartilham o die de computação GH100; o H200 é uma atualização de memória para HBM3e, quase dobrando a capacidade (80 → 141 GB) e a largura de banda (3.35 → 4.8 TB/s). Para uma carga de inferência de LLM limitada por memória, isso é uma vitória real maior do que mais FLOPS teria sido. Segundo, a A100 não tem coluna FP8 — FP8 é um recurso da geração Hopper, então chips pré-Hopper simplesmente não o têm.

Depois puxe as linhas da AMD e do Google. A MI300X mostra a maior memória (192 GB) e largura de banda (5.3 TB/s) de qualquer chip listado, mas as suas células FP16/FP8/INT8 estão intencionalmente em branco, com a nota explicando que a AMD publica picos com esparsidade estruturada (1307 FP16 esparso, 2614 INT8 esparso) e o denso é cerca de metade — imprimir o número esparso ao lado do denso da NVIDIA seria uma comparação enganosa. As linhas TPU mostram uma convenção diferente novamente: o TPU v4 reporta BF16 igual a INT8 em 275 por chip, enquanto o v5e otimizado para custo dobra o INT8 para 393 contra 197 BF16.

FAQ#

TFLOPS versus TOPS — são a mesma coisa?#

Não, e confundir os dois é a armadilha de ficha técnica mais comum. TFLOPS mede operações de vírgula flutuante por segundo (a família FLOPS, prefixos de base 10: MFLOPS, GFLOPS, TFLOPS, PFLOPS). TOPS mede operações de inteiro ou genéricas por segundo (a família OPS) e é o que você costuma ver cotado para inferência quantizada em INT8. Como a operação subjacente difere, o número de TOPS de um chip não é diretamente comparável ao seu número de TFLOPS — e um MAC (uma operação de multiplicar-acumular) é convencionalmente contado como dois FLOPs, o que é parte do motivo pelo qual os números de TOPS dos fornecedores às vezes parecem contar duplicado.

Por que as células de computação da MI300X estão em branco?#

Porque a AMD publica a sua vazão de pico com esparsidade estruturada ativada (por exemplo, 1307 FP16 TFLOPS esparso), enquanto esta tabela reporta picos densos para manter todos os chips comparáveis. A MI300X densa é cerca de metade da cifra esparsa, mas um número denso limpo e verificado não está disponível de forma consistente, então a célula é deixada em branco em vez de imprimir um número com uma condição oculta de “esparso”. A memória e a largura de banda — 192 GB e 5.3 TB/s — estão verificadas e mostradas.

Qual é a diferença entre FP16 e BF16?#

Ambos têm 16 bits, mas gastam esses bits de forma diferente. FP16 tem mais precisão mas uma faixa numérica estreita; BF16 troca precisão pela mesma faixa do FP32. Essa faixa importa para o treinamento, onde gradientes podem variar muito em magnitude, e é por isso que o BF16 se tornou o formato padrão de treinamento em tensor cores modernos, embora ocupe a mesma largura em bits do FP16. A seção de formatos de precisão lista ambos com o seu uso típico.

O que “pico” significa — o meu modelo vai de fato atingir esses números?#

Quase nunca. Estes são picos teóricos — a vazão que o chip poderia sustentar se cada ciclo fosse perfeitamente utilizado sem stall de memória, o que cargas reais nunca alcançam. A vazão sustentada é sempre menor e depende do kernel, da arquitetura do modelo, do tamanho do lote e se a carga é limitada por memória ou por computação. Trate o pico como um limite superior para comparar arquiteturas, não como uma previsão da velocidade do seu modelo.