Herramientas
Guías

Referencia de cómputo de IA

Referencia

Rendimiento de aceleradores de IA (FLOPS/TOPS), formatos de precisión y definiciones de unidades de cómputo.

100 % del lado del cliente Sin backend

Unidades de cómputo

Formatos de precisión

Tipos de acelerador

Hardware

Nombre Fabricante Arquitectura Memoria Ancho de banda FP16/BF16 (TF) FP8 (TF) INT8 (TOPS)

Las cifras son PICOS TEÓRICOS (densos) de las hojas de datos del fabricante. El rendimiento real sostenido es menor y difiere entre entrenamiento e inferencia. FLOPS y TOPS miden operaciones distintas y no son directamente comparables.

En esta página

¿Qué es una referencia de hardware de cómputo para IA?#

Cuando lees que una GPU entrega «1979 TFLOPS» o que un chip tiene «192 GB de memoria», esos números solo significan algo una vez conoces las reglas que hay detrás: en qué precisión numérica se midió la cifra, si incluye sparsity estructurado, si se trata de rendimiento de coma flotante (TFLOPS) o de enteros (TOPS) y qué ancho de banda suministra de verdad la memoria. Los fabricantes publican cifras de cabecera en su configuración más favorecida; sin una referencia que indique las condiciones, dos chips no pueden compararse con honestidad.

Esta página es esa referencia. Reúne cuatro cosas que un ingeniero de ML o un comprador de infraestructura de verdad necesita, lado a lado: el glosario de unidades de cómputo (qué significan realmente FLOPS, TFLOPS, TOPS y MAC), los formatos de precisión numérica (de FP64 a INT4, en el orden típico de rendimiento), los tipos de acelerador (CPU, GPU, TPU, NPU, LPU, MAU) y una tabla de hardware de chips concretos con su capacidad de memoria, ancho de banda de memoria y rendimiento pico denso en FP16, FP8 e INT8. Cada cifra está verificada contra la hoja de datos del fabricante, con la salvedad exacta anotada cuando un número podría engañar.

Cómo se usa#

  1. Busca en todo. La única caja de búsqueda de arriba filtra las cuatro secciones a la vez por nombre, fabricante, nodo de proceso o especificación; escribir H100, NVIDIA, 192gb o 4.8tb/s estrecha la tabla de hardware.
  2. Lee las cuatro secciones.
    • Unidades de cómputo — los símbolos con prefijo SI (de FLOP a EFLOPS, más TOPS y MAC) con sus exponentes en base 10, para que puedas convertir entre ellos.
    • Formatos de precisión — FP64, FP32, TF32, FP16, BF16, FP8, INT8, INT4, cada uno con su ancho de bits y caso de uso típico, ordenados aproximadamente por rendimiento creciente en un tensor core moderno.
    • Tipos de acelerador — la distinción en una línea entre CPU, GPU, TPU, NPU, LPU y MAU.
    • Tabla de hardware — nombre, fabricante, proceso, memoria (GB), ancho de banda de memoria (TB/s) y rendimiento pico denso FP16 / FP8 / INT8, con una nota de salvedad por chip.
  3. Confía en los huecos. Donde una celda está vacía en vez de cero, la cifra no pudo verificarse como pico denso; la nota explica por qué (el MI300X de AMD publica picos sparse, así que el denso es aproximadamente la mitad). Es más honesto dejarla en blanco que imprimir un número con una condición oculta.

Características clave#

  • Solo picos densos, con el sparsity avisado. Las cifras de NVIDIA son densas (sin sparsity estructurado 2:4); la nota te recuerda que sus cifras de marketing de cabecera a menudo se duplican cuando se activa el sparsity. Sin inflación silenciosa de «con sparsity».
  • TFLOPS y TOPS mantenidos aparte. El glosario declara claramente que TOPS (la familia OPS) no es directamente comparable a TFLOPS (la familia FLOPS): una confusión que los fabricantes explotan encantados.
  • Las cuatro precisiones en orden de rendimiento. Se ve de un vistazo que FP8 duplica aproximadamente a FP16, y que INT8 duplica aproximadamente a BF16, en una arquitectura dada: la razón económica por la que existe la cuantización.
  • Memoria y ancho de banda, no solo cómputo. Para inferencia de modelos de lenguaje grandes, la capacidad de memoria y el ancho de banda suelen importar más que los FLOPS pico, así que son columnas de primera clase.
  • Fuentes citadas por nombre, no por enlace. Cada cifra nombra la hoja de datos o la página de producto de donde proviene, sin URL saliente, para que puedas verificar contra la documentación del propio fabricante.

Ejemplo práctico#

Compara la línea de NVIDIA a lo largo de tres generaciones usando la tabla de hardware. Busca NVIDIA y obtienes las filas A100, H100 y H200 juntas:

ChipMemoriaAncho de bandaFP16 densoFP8 densoINT8 denso
A100 80GB SXM80 GB2.0 TB/s312 TFLOPS624 TOPS
H100 SXM580 GB3.35 TB/s989 TFLOPS1979 TFLOPS1979 TOPS
H200 SXM141 GB4.8 TB/s989 TFLOPS1979 TFLOPS1979 TOPS

Dos cosas saltan a la vista. Primera, el salto del H100 al H200 no añadió cómputo: ambos comparten el die de cómputo GH100; el H200 es una actualización de memoria a HBM3e, que casi duplica capacidad (80 → 141 GB) y ancho de banda (3.35 → 4.8 TB/s). Para una carga de inferencia de LLM limitada por memoria, eso es una ganancia real mayor de lo que habría sido más FLOPS. Segunda, el A100 no tiene columna FP8: FP8 es una característica de la generación Hopper, así que los chips anteriores a Hopper simplemente no la tienen.

Luego saca las filas de AMD y Google. El MI300X muestra la mayor memoria (192 GB) y el mayor ancho de banda (5.3 TB/s) de cualquier chip listado, pero sus celdas FP16/FP8/INT8 están intencionadamente en blanco, con la nota explicando que AMD publica picos con sparsity estructurado (1307 FP16 sparse, 2614 INT8 sparse) y el denso es aproximadamente la mitad: imprimir el número sparse junto al denso de NVIDIA sería una comparación engañosa. Las filas TPU muestran otra convención diferente: el TPU v4 informa BF16 igual a INT8 en 275 por chip, mientras que el v5e, optimizado en coste, duplica INT8 a 393 frente a 197 BF16.

Preguntas frecuentes#

TFLOPS frente a TOPS: ¿son lo mismo?#

No, y confundirlos es la trampa más común de las hojas de especificaciones. TFLOPS mide operaciones en coma flotante por segundo (la familia FLOPS, prefijos en base 10: MFLOPS, GFLOPS, TFLOPS, PFLOPS). TOPS mide operaciones enteras o genéricas por segundo (la familia OPS) y es lo que sueles ver citado para inferencia cuantizada en INT8. Como la operación subyacente difiere, el número TOPS de un chip no es directamente comparable a su número TFLOPS; además, un MAC (una operación multiply-accumulate) se cuenta convencionalmente como dos FLOPs, lo que es parte de por qué las cifras TOPS de los fabricantes a veces parecen contar por duplicado.

¿Por qué las celdas de cómputo del MI300X están en blanco?#

Porque AMD publica su rendimiento pico con sparsity estructurado activado (por ejemplo, 1307 FP16 TFLOPS sparse), mientras que esta tabla informa picos densos para mantener cada chip comparable. El denso del MI300X es aproximadamente la mitad del sparse, pero un número denso limpio y verificado no está disponible de forma consistente, así que la celda se deja en blanco en vez de imprimir un número con una condición «sparse» oculta. La memoria y el ancho de banda (192 GB y 5.3 TB/s) sí están verificados y se muestran.

¿Cuál es la diferencia entre FP16 y BF16?#

Ambos son 16 bits, pero los gastan de forma diferente. FP16 tiene más precisión, pero un rango numérico estrecho; BF16 cambia precisión por el mismo rango que FP32. Ese rango importa para el entrenamiento, donde los gradientes pueden variar enormemente en magnitud, por lo que BF16 se ha convertido en el formato de entrenamiento por defecto en los tensor cores modernos aunque ocupe el mismo ancho de bits que FP16. La sección de formatos de precisión lista ambos con su uso típico.

¿Qué significa «pico»? ¿Alcanzará mi modelo estos números?#

Casi nunca. Son picos teóricos: el rendimiento que el chip podría sostener si cada ciclo se utilizara perfectamente sin esperas de memoria, lo que las cargas reales nunca logran. El rendimiento sostenido es siempre menor y depende del kernel, la arquitectura del modelo, el tamaño de batch y de si la carga está limitada por memoria o por cómputo. Trata el pico como un límite superior para comparar arquitecturas, no como una predicción de la velocidad de tu modelo.