Référence Compute IA
RéférenceDébit des accélérateurs IA (FLOPS/TOPS), formats de précision et définitions des unités de calcul.
Unités de calcul
Formats de précision
Types d'accélérateurs
Matériel
| Nom | Fabricant | Architecture | Mémoire | Bande passante | FP16/BF16 (TF) | FP8 (TF) | INT8 (TOPS) |
|---|
Les valeurs sont des PIC THÉORIQUES (denses) issus des fiches techniques des fabricants. Le débit réel soutenu est plus bas et diffère entre entraînement et inférence. FLOPS et TOPS mesurent des opérations différentes et ne sont pas directement comparables.
Sur cette page
Qu’est-ce qu’une référence du matériel de calcul IA ?#
Quand vous lisez qu’un GPU délivre « 1979 TFLOPS » ou qu’une puce a « 192 Go de mémoire », ces chiffres n’ont de sens qu’une fois connues les règles qui les sous-tendent : à quelle précision numérique la mesure a-t-elle été faite, inclut-elle la sparsité structurée, s’agit-il de débit en virgule flottante (TFLOPS) ou en entier (TOPS), et quelle bande passante la mémoire fournit-elle réellement. Les constructeurs publient des chiffres phares dans leur configuration la plus flatteuse ; sans une référence qui énonce les conditions, deux puces ne peuvent être comparées honnêtement.
Cette page est cette référence. Elle rassemble côte à côte quatre choses dont un ingénieur ML ou un acheteur d’infrastructure a réellement besoin : le glossaire des unités de calcul (ce que FLOPS, TFLOPS, TOPS et MAC signifient vraiment), les formats de précision numérique (de FP64 à INT4, dans l’ordre de débit type), les types d’accélérateurs (CPU, GPU, TPU, NPU, LPU, MAU) et une table de matériel de puces spécifiques avec leur capacité mémoire, leur bande passante mémoire et leur débit de crête dense en FP16, FP8 et INT8 — chaque chiffre vérifié contre la fiche technique du constructeur, avec la réserve exacte notée quand un nombre pourrait induire en erreur.
Comment l’utiliser#
- Recherchez à travers tout. La zone de recherche unique en haut filtre les quatre sections à la fois par nom, constructeur, nœud de gravure ou spécification — saisir
H100,NVIDIA,192gbou4.8tb/srestreint la table de matériel. - Lisez les quatre sections.
- Unités de calcul — les symboles à préfixe SI (FLOP jusqu’à EFLOPS, plus TOPS et MAC) avec leurs exposants en base 10, pour convertir entre eux.
- Formats de précision — FP64, FP32, TF32, FP16, BF16, FP8, INT8, INT4, chacun avec sa largeur de bits et son cas d’usage type, ordonnés à peu près par débit croissant sur un tensor core moderne.
- Types d’accélérateurs — la distinction en une ligne entre CPU, GPU, TPU, NPU, LPU et MAU.
- Table de matériel — nom, constructeur, gravure, mémoire (Go), bande passante mémoire (To/s) et débit dense FP16 / FP8 / INT8, avec une note de réserve par puce.
- Faites confiance aux cases vides. Là où une case est vide plutôt qu’à zéro, le chiffre n’a pas pu être vérifié comme une crête dense — la note explique pourquoi (la MI300X d’AMD publie des crêtes creuses, donc le dense vaut environ la moitié). Il est plus honnête de la laisser vide que d’imprimer un nombre avec une condition cachée.
Caractéristiques principales#
- Crêtes denses uniquement, avec la sparsité signalée. Les chiffres NVIDIA sont denses (sans sparsité structurée 2:4) ; la note vous rappelle que leurs chiffres marketing phares doublent souvent quand la sparsité est activée. Pas d’inflation silencieuse « avec sparsité ».
- TFLOPS et TOPS maintenus à part. Le glossaire énonce clairement que les TOPS (la famille OPS) ne sont pas directement comparables aux TFLOPS (la famille FLOPS) — une confusion que les constructeurs exploitent volontiers.
- Les quatre précisions dans l’ordre de débit. Voyez d’un coup d’œil que FP8 double à peu près FP16, et INT8 double à peu près BF16, sur une architecture donnée — la raison économique de l’existence de la quantification.
- Mémoire et bande passante, pas seulement le calcul. Pour l’inférence des grands modèles de langage, la capacité mémoire et la bande passante comptent souvent plus que le débit de crête en FLOPS, donc ce sont des colonnes de premier rang.
- Sources citées par leur nom, pas par lien. Chaque chiffre nomme la fiche technique ou la page produit dont il provient, sans URL sortante, pour que vous puissiez vérifier auprès de la documentation du constructeur lui-même.
Exemple commenté#
Comparez la gamme NVIDIA à travers trois générations via la table de matériel. Cherchez NVIDIA et vous obtenez les lignes A100, H100 et H200 ensemble :
| Puce | Mémoire | Bande passante | FP16 dense | FP8 dense | INT8 dense |
|---|---|---|---|---|---|
| A100 80GB SXM | 80 Go | 2,0 To/s | 312 TFLOPS | — | 624 TOPS |
| H100 SXM5 | 80 Go | 3,35 To/s | 989 TFLOPS | 1979 TFLOPS | 1979 TOPS |
| H200 SXM | 141 Go | 4,8 To/s | 989 TFLOPS | 1979 TFLOPS | 1979 TOPS |
Deux choses sautent aux yeux. Premièrement, le bond du H100 au H200 n’a ajouté aucun calcul — les deux partagent la puce de calcul GH100 ; le H200 est une évolution mémoire vers la HBM3e, doublant presque la capacité (80 → 141 Go) et la bande passante (3,35 → 4,8 To/s). Pour une charge d’inférence LLM limitée par la mémoire, c’est un gain réel plus important que ne l’auraient été des FLOPS supplémentaires. Deuxièmement, l’A100 n’a pas de colonne FP8 — le FP8 est une fonctionnalité de génération Hopper, donc les puces antérieures ne l’ont tout simplement pas.
Faites ensuite apparaître les lignes AMD et Google. La MI300X affiche la plus grande mémoire (192 Go) et bande passante (5,3 To/s) de toutes les puces listées, mais ses cellules FP16/FP8/INT8 sont intentionnellement vides, la note expliquant qu’AMD publie des crêtes avec sparsité structurée (1307 FP16 creux, 2614 INT8 creux) et que le dense vaut environ la moitié — imprimer le chiffre creux à côté du dense de NVIDIA serait une comparaison trompeuse. Les lignes TPU montrent encore une autre convention : le TPU v4 signale un BF16 égal à l’INT8 à 275 par puce, tandis que le v5e optimisé en coût double l’INT8 à 393 contre 197 en BF16.
FAQ#
TFLOPS contre TOPS — est-ce la même chose ?#
Non, et les confondre est le piège de fiche technique le plus courant. Les TFLOPS mesurent les opérations en virgule flottante par seconde (la famille FLOPS, préfixes en base 10 : MFLOPS, GFLOPS, TFLOPS, PFLOPS). Les TOPS mesurent les opérations entières ou génériques par seconde (la famille OPS) et c’est ce qu’on voit généralement cité pour l’inférence quantifiée INT8. Comme l’opération sous-jacente diffère, le chiffre TOPS d’une puce n’est pas directement comparable à son chiffre TFLOPS — et un MAC (une multiplication-accumulation) est compté conventionnellement comme deux FLOP, ce qui explique en partie pourquoi les chiffres TOPS des constructeurs semblent parfois compter double.
Pourquoi les cellules de calcul de la MI300X sont-elles vides ?#
Parce qu’AMD publie son débit de crête avec sparsité structurée activée (par exemple 1307 TFLOPS FP16 creux), alors que cette table signale des crêtes denses pour garder toutes les puces comparables. Le dense de la MI300X vaut environ la moitié du chiffre creux, mais un nombre dense propre et vérifié n’est pas constamment disponible, donc la case reste vide plutôt que d’imprimer un nombre avec une condition cachée « creuse ». La mémoire et la bande passante — 192 Go et 5,3 To/s — sont vérifiées et affichées.
Quelle est la différence entre FP16 et BF16 ?#
Tous deux font 16 bits, mais ils les dépensent différemment. Le FP16 a plus de précision mais une plage numérique étroite ; le BF16 troque de la précision contre la même plage que le FP32. Cette plage compte pour l’entraînement, où les gradients peuvent varier fortement en ampleur, ce qui explique pourquoi le BF16 est devenu le format d’entraînement par défaut sur les tensor cores modernes même s’il occupe la même largeur de bits que le FP16. La section des formats de précision liste les deux avec leur usage type.
Que signifie « crête » — mon modèle atteindra-t-il réellement ces chiffres ?#
Presque jamais. Ce sont des crêtes théoriques — le débit que la puce pourrait soutenir si chaque cycle était parfaitement utilisé sans attente mémoire, ce que les charges réelles n’atteignent jamais. Le débit soutenu est toujours inférieur et dépend du noyau, de l’architecture du modèle, de la taille de lot et du fait que la charge soit limitée par la mémoire ou par le calcul. Traitez la crête comme une borne supérieure pour comparer des architectures, pas comme une prédiction de la vitesse de votre modèle.