AI-Compute-Referenz
ReferenzDurchsatz von AI-Beschleunigern (FLOPS/TOPS), Genauigkeitsformate und Definitionen der Recheneinheiten.
Recheneinheiten
Genauigkeitsformate
Beschleunigertypen
Hardware
| Name | Hersteller | Architektur | Speicher | Bandbreite | FP16/BF16 (TF) | FP8 (TF) | INT8 (TOPS) |
|---|
Die Werte sind THEORETISCHE SPITZENWERTE (dense) aus den Datenblättern der Hersteller. Der anhaltende reale Durchsatz ist niedriger und unterscheidet sich zwischen Training und Inferenz. FLOPS und TOPS messen unterschiedliche Operationen und sind nicht direkt vergleichbar.
Auf dieser Seite
Was ist eine AI-Compute-Hardware-Referenz?#
Wenn Sie lesen, dass eine GPU „1979 TFLOPS“ liefert oder ein Chip „192 GB Speicher“ hat, sagen diese Zahlen erst etwas, wenn Sie die Regeln dahinter kennen: bei welcher numerischen Genauigkeit die Zahl gemessen wurde, ob sie strukturierte Sparsity enthält, ob es sich um Gleitkomma-Durchsatz (TFLOPS) oder Ganzzahl-Durchsatz (TOPS) handelt und welche Bandbreite der Speicher tatsächlich liefert. Hersteller veröffentlichen Spitzenzahlen in ihrer schmeichelhaftesten Konfiguration; ohne eine Referenz, die die Bedingungen angibt, lassen sich zwei Chips nicht ehrlich vergleichen.
Diese Seite ist diese Referenz. Sie versammelt vier Dinge, die ein ML-Ingenieur oder Infrastruktur-Käufer tatsächlich braucht, Seite an Seite: das Glossar der Recheneinheiten (was FLOPS, TFLOPS, TOPS und MAC tatsächlich bedeuten), die numerischen Genauigkeitsformate (FP64 bis INT4, in typischer Durchsatz-Reihenfolge), die Beschleuniger-Typen (CPU, GPU, TPU, NPU, LPU, MAU) und eine Hardware-Tabelle spezifischer Chips mit ihrer Speicherkapazität, Speicherbandbreite und dichtem Spitzendurchsatz bei FP16, FP8 und INT8 — jede Figur gegen das Hersteller-Datenblatt verifiziert, mit dem genauen Vorbehalt notiert, wenn eine Zahl irreführen könnte.
Verwendung#
- Über alles suchen. Das einzige Feld Beschleuniger, Hersteller, Formate suchen… oben filtert alle vier Abschnitte zugleich nach Name, Hersteller, Prozess-Knoten oder Spezifikation —
H100,NVIDIA,192gboder4.8tb/seinzutippen, verengt die Hardware-Tabelle. - Lesen Sie die vier Abschnitte.
- Recheneinheiten — die SI-präfixierten Symbole (FLOP bis EFLOPS, plus TOPS und MAC) mit ihren Basis-10-Exponenten, sodass Sie zwischen ihnen umrechnen können.
- Genauigkeitsformate — FP64, FP32, TF32, FP16, BF16, FP8, INT8, INT4, jedes mit seiner Bitbreite und seinem typischen Anwendungsfall, grob nach steigendem Durchsatz auf einem modernen Tensor-Core geordnet.
- Beschleunigertypen — der einzeilige Unterschied zwischen einer CPU, GPU, TPU, NPU, LPU und MAU.
- Hardware-Tabelle — Name, Hersteller, Architektur, Speicher (GB), Speicherbandbreite (TB/s) und dichter FP16-/FP8-/INT8-Durchsatz, mit einer Vorbehalt-Notiz pro Chip.
- Vertrauen Sie den Leerstellen. Wo eine Zelle leer statt null ist, ließ sich die Zahl nicht als dichter Spitzenwert verifizieren — die Notiz erklärt warum (AMDs MI300X veröffentlicht Sparse-Spitzen, daher ist Dense etwa die Hälfte). Es ist ehrlicher, sie leer zu lassen, als eine Zahl mit versteckter Bedingung zu drucken.
Hauptfunktionen#
- Nur Dense-Spitzen, mit Sparsity ausgewiesen. NVIDIA-Zahlen sind Dense (ohne 2:4-strukturierte Sparsity); die Notiz erinnert Sie daran, dass sich ihre Marketing-Spitzenzahlen oft verdoppeln, wenn Sparsity aktiviert wird. Keine stille „mit Sparsity“-Inflation.
- TFLOPS und TOPS getrennt gehalten. Das Glossar stellt schlicht, dass TOPS (die OPS-Familie) nicht direkt mit TFLOPS (der FLOPS-Familie) vergleichbar ist — eine Verwechslung, die Hersteller gerne ausnutzen.
- Alle vier Genauigkeiten in Durchsatz-Reihenfolge. Sehen Sie auf einen Blick, dass FP8 FP16 etwa verdoppelt und INT8 BF16 etwa verdoppelt, auf einer gegebenen Architektur — der wirtschaftliche Grund, warum Quantisierung existiert.
- Speicher und Bandbreite, nicht nur Compute. Für Large-Language-Model-Inferenz sind Speicherkapazität und Bandbreite oft wichtiger als Spitzen-FLOPS, daher sind sie erstklassige Spalten.
- Quellen namentlich genannt, nicht verlinkt. Jede Zahl nennt das Datenblatt oder die Produktseite, aus dem sie stammt, ohne ausgehende URL, sodass Sie gegen die eigene Dokumentation des Herstellers verifizieren können.
Ausführliches Beispiel#
Vergleichen Sie die NVIDIA-Linie über drei Generationen anhand der Hardware-Tabelle. Suchen Sie NVIDIA und Sie erhalten die A100-, H100- und H200-Zeilen zusammen:
| Chip | Speicher | Bandbreite | FP16 Dense | FP8 Dense | INT8 Dense |
|---|---|---|---|---|---|
| A100 80GB SXM | 80 GB | 2.0 TB/s | 312 TFLOPS | — | 624 TOPS |
| H100 SXM5 | 80 GB | 3.35 TB/s | 989 TFLOPS | 1979 TFLOPS | 1979 TOPS |
| H200 SXM | 141 GB | 4.8 TB/s | 989 TFLOPS | 1979 TFLOPS | 1979 TOPS |
Zwei Dinge springen ins Auge. Erstens: Der Sprung H100 zu H200 brachte kein Compute — beide teilen das GH100-Compute-Die; der H200 ist ein Speicher-Refresh auf HBM3e, der die Kapazität fast verdoppelt (80 → 141 GB) und die Bandbreite (3.35 → 4.8 TB/s). Für eine speicher-gebundene LLM-Inferenz-Workload ist das ein größerer realer Gewinn, als es mehr FLOPS gewesen wären. Zweitens: Die A100 hat keine FP8-Spalte — FP8 ist ein Feature der Hopper-Generation, sodass Pre-Hopper-Chips es schlicht nicht haben.
Rufen Sie dann die AMD- und Google-Zeilen auf. Die MI300X zeigt den größten Speicher (192 GB) und die größte Bandbreite (5.3 TB/s) aller gelisteten Chips, aber ihre FP16-/FP8-/INT8-Zellen sind absichtlich leer, wobei die Notiz erklärt, dass AMD strukturiert-Sparse-Spitzen veröffentlicht (1307 FP16 Sparse, 2614 INT8 Sparse) und Dense etwa die Hälfte ist — die Sparse-Zahl neben NVIDIAs Dense zu drucken wäre ein irreführender Vergleich. Die TPU-Zeilen zeigen erneut eine andere Konvention: TPU v4 meldet BF16 gleich INT8 mit 275 pro Chip, während der kostenoptimierte v5e INT8 auf 393 gegenüber 197 BF16 verdoppelt.
FAQ#
TFLOPS versus TOPS — ist das dasselbe?#
Nein, und sie zu verwechseln ist die häufigste Spec-Sheet-Falle. TFLOPS misst Gleitkomma-Operationen pro Sekunde (die FLOPS-Familie, Basis-10-Präfixe: MFLOPS, GFLOPS, TFLOPS, PFLOPS). TOPS misst Ganzzahl- oder generische Operationen pro Sekunde (die OPS-Familie) und ist, was Sie normalerweise für INT8-quantisierte Inferenz zitiert sehen. Da sich die zugrunde liegende Operation unterscheidet, ist die TOPS-Zahl eines Chips nicht direkt mit seiner TFLOPS-Zahl vergleichbar — und ein MAC (eine Multiplikation mit Addition) wird konventionell als zwei FLOP gezählt, was Teil davon ist, warum Hersteller-TOPS-Zahlen manchmal doppelt zu zählen scheinen.
Warum sind die MI300X-Compute-Zellen leer?#
Weil AMD seinen Spitzen-Durchsatz mit strukturierter Sparsity aktiviert veröffentlicht (zum Beispiel 1307 FP16 TFLOPS Sparse), wohingegen diese Tabelle Dense-Spitzen meldet, um jeden Chip vergleichbar zu halten. Dense-MI300X ist etwa die Hälfte des Sparse-Werts, aber eine saubere, verifizierte Dense-Zahl ist nicht konsistent verfügbar, daher bleibt die Zelle leer statt eine Zahl mit versteckter „Sparse“-Bedingung zu drucken. Speicher und Bandbreite — 192 GB und 5.3 TB/s — sind verifiziert und werden gezeigt.
Was ist der Unterschied zwischen FP16 und BF16?#
Beide sind 16 Bit, aber sie geben diese Bits unterschiedlich aus. FP16 hat mehr Präzision, aber einen engen numerischen Bereich; BF16 tauscht Präzision gegen denselben Bereich wie FP32. Dieser Bereich ist wichtig fürs Training, wo Gradienten stark im Betrag variieren können, weshalb BF16 das Standard-Trainingsformat auf modernen Tensor-Cores geworden ist, obwohl es und FP16 dieselbe Bitbreite belegen. Der Präzisionsformat-Abschnitt listet beide mit ihrer typischen Verwendung.
Was bedeutet „Spitze“ — wird mein Modell diese Zahlen tatsächlich erreichen?#
Fast nie. Dies sind theoretische Spitzen — der Durchsatz, den der Chip aufrechterhalten könnte, wenn jeder Zyklus perfekt ausgelastet wäre ohne Speicher-Stillstände, was reale Workloads nie erreichen. Anhaltender Durchsatz ist stets niedriger und hängt vom Kernel, der Modellarchitektur, der Batch-Größe und davon ab, ob die Workload speicher- oder compute-gebunden ist. Behandeln Sie die Spitze als Obergrenze zum Vergleichen von Architekturen, nicht als Vorhersage der Geschwindigkeit Ihres Modells.