Справочник по AI-вычислениям
СправочникПропускная способность AI-ускорителей (FLOPS/TOPS), форматы точности и определения вычислительных единиц.
Единицы вычислений
Форматы точности
Типы ускорителей
Оборудование
| Название | Производитель | Архитектура | Память | Пропускная способность | FP16/BF16 (TF) | FP8 (TF) | INT8 (TOPS) |
|---|
Значения — ТЕОРЕТИЧЕСКИЙ ПИК (dense) из спецификаций производителей. Реальная sustained-производительность ниже и различается для обучения и вывода. FLOPS и TOPS измеряют разные операции и не сопоставимы напрямую.
На этой странице
Что такое справочник по AI-вычислительному железу?#
Когда вы читаете, что GPU даёт «1979 TFLOPS», а у чипа «192 ГБ памяти», эти цифры что-то значат лишь тогда, когда вы знаете стоящие за ними правила: в какой числовой точности измерялась цифра, включает ли она структурную разреженность, это пропускная способность с плавающей точкой (TFLOPS) или целочисленная (TOPS) и какую полосу пропускания даёт память. Вендоры публикуют заголовочные числа в самой выгодной конфигурации; без справочника, фиксирующего условия, два чипа нельзя сравнить честно.
Эта страница — такой справочник. Она собирает рядом четыре вещи, реально нужные ML-инженеру или покупателю инфраструктуры: глоссарий вычислительных единиц (что на деле значат FLOPS, TFLOPS, TOPS и MAC), форматы числовой точности (от FP64 до INT4, в типичном порядке пропускной способности), типы ускорителей (CPU, GPU, TPU, NPU, LPU, MAU) и таблицу железа по конкретным чипам с объёмом памяти, полосой памяти и плотным пиковым FP16, FP8 и INT8 — каждая цифра сверена по даташиту вендора, с точной оговоркой там, где число может ввести в заблуждение.
Как пользоваться#
- Ищите по всему разом. Едиственное поле Поиск ускорителей, производителей, форматов… сверху фильтрует все четыре секции одновременно по имени, вендору, техпроцессу или спецификации — ввод
H100,NVIDIA,192gbили4.8tb/sсужает таблицу железа. - Читайте четыре секции.
- Единицы вычислений — SI-префиксные символы (от FLOP до EFLOPS, плюс TOPS и MAC) с их показателями степени по основанию 10, поэтому между ними можно переводить.
- Форматы точности — FP64, FP32, TF32, FP16, BF16, FP8, INT8, INT4, каждый с битовой шириной и типичным случаем использования, упорядоченные примерно по растущей пропускной способности на современном тензорном ядре.
- Типы ускорителей — различие между CPU, GPU, TPU, NPU, LPU и MAU в одну строку.
- Оборудование — название, производитель, архитектура, память (GB), полоса памяти (TB/s) и плотная пропускная способность FP16 / FP8 / INT8 с оговоркой на чип.
- Доверяйте пустым ячейкам. Если ячейка пуста, а не ноль, — плотный пик для этой цифры не удалось подтвердить; заметка поясняет почему (AMD MI300X публикует разреженные пики, поэтому плотный примерно половина). Честнее оставить пусто, чем печатать число со скрытым условием.
Ключевые возможности#
- Только плотные пики, с указанием разреженности. Цифры NVIDIA плотные (без структурной разреженности 2:4); заметка напоминает, что их заголовочные маркетинговые числа часто удваиваются при включении разреженности. Никакого скрытого раздувания «со разреженностью».
- TFLOPS и TOPS держатся отдельно. Глоссарий прямолинейно заявляет, что TOPS (семейство OPS) не сопоставим напрямую с TFLOPS (семейство FLOPS) — путаницу, которую вендоры охотно эксплуатируют.
- Все четыре точности в порядке пропускной способности. С одного взгляда видно, что FP8 примерно вдвое превышает FP16, а INT8 примерно вдвое — BF16 на данной архитектуре: экономическая причина существования квантизации.
- Память и полоса, а не только вычисления. Для инференса больших языковых моделей объём памяти и полоса часто важнее пиковой FLOPS, поэтому они — полноправные колонки.
- Источники названы по имени, а не ссылкой. Каждая цифра называет даташит или продуктовую страницу, откуда она взята, без исходящей URL, чтобы вы могли сверить с собственной документацией вендора.
Разбор примера#
Сравните линейку NVIDIA в трёх поколениях через таблицу железа. Поищите NVIDIA, и вы получите строки A100, H100 и H200 вместе:
| Чип | Память | Полоса | FP16 плотн. | FP8 плотн. | INT8 плотн. |
|---|---|---|---|---|---|
| A100 80GB SXM | 80 GB | 2.0 TB/s | 312 TFLOPS | — | 624 TOPS |
| H100 SXM5 | 80 GB | 3.35 TB/s | 989 TFLOPS | 1979 TFLOPS | 1979 TOPS |
| H200 SXM | 141 GB | 4.8 TB/s | 989 TFLOPS | 1979 TFLOPS | 1979 TOPS |
Бросаются в глаза две вещи. Во-первых, переход от H100 к H200 не добавил вычислений — оба делят вычислительный кристалл GH100; H200 — это обновление памяти на HBM3e, почти удваивающее объём (80 → 141 GB) и полосу (3.35 → 4.8 TB/s). Для инференса LLM, ограниченного памятью, это больший реальный выигрыш, чем дополнительные FLOPS. Во-вторых, у A100 нет колонки FP8 — FP8 это особенность поколения Hopper, поэтому дочопперные чипы её просто не имеют.
Затем поднимите строки AMD и Google. MI300X показывает крупнейшие память (192 GB) и полосу (5.3 TB/s) из всех перечисленных чипов, но его ячейки FP16/FP8/INT8 намеренно пусты: заметка поясняет, что AMD публикует структурно-разрежные пики (1307 FP16 разреженный, 2614 INT8 разреженный), а плотный примерно половина, — напечатать разреженное число рядом с плотным NVIDIA было бы misleading-сравнением. Строки TPU снова показывают другую конвенцию: TPU v4 сообщает BF16, равный INT8, — 275 на чип, тогда как оптимизированный по стоимости v5e удваивает INT8 до 393 против 197 BF16.
FAQ#
TFLOPS против TOPS — это одно и то же?#
Нет, и путать их — самая частая ловушка спецификаций. TFLOPS измеряет операции с плавающей точкой в секунду (семейство FLOPS, префиксы по основанию 10: MFLOPS, GFLOPS, TFLOPS, PFLOPS). TOPS измеряет целочисленные или обобщённые операции в секунду (семейство OPS) и обычно то, что вы видите для INT8-квантованного инференса. Поскольку базовая операция различается, TOPS-число чипа напрямую не сопоставимо с его TFLOPS-числом, — а MAC (одно умножение с накоплением) по соглашению считается за две FLOP, что отчасти объясняет, почему вендорские цифры TOPS иногда кажутся задвоенными.
Почему ячейки вычислений MI300X пусты?#
Потому что AMD публикует пиковую пропускную способность со структурной разреженностью (например, 1307 FP16 TFLOPS разреженный), тогда как эта таблица сообщает плотные пики для сопоставимости всех чипов. Плотный MI300X — примерно половина разреженной цифры, но чистое, сверенное плотное число последовательно недоступно, поэтому ячейка оставлена пустой, а не печатает число со скрытым условием «разреженный». Память и полоса — 192 GB и 5.3 TB/s — сверены и показаны.
В чём разница между FP16 и BF16?#
Оба по 16 бит, но они расходуют биты по-разному. FP16 имеет больше точности, но узкий числовой диапазон; BF16 обменивает точность на тот же диапазон, что у FP32. Этот диапазон важен для обучения, где градиенты могут сильно меняться по величине, поэтому BF16 стал форматом обучения по умолчанию на современных тензорных ядрах, хотя с FP16 у него одна битовая ширина. Секция форматов точности перечисляет оба с типичным использованием.
Что значит «пиковый» — моя модель реально достигнет этих чисел?#
Почти никогда. Это теоретические пики — пропускная способность, которую чип мог бы поддерживать, если бы каждый цикл был идеально утилизирован без задержек памяти, чего реальные нагрузки не достигают. Sustained-производительность всегда ниже и зависит от ядра, архитектуры модели, размера батча и того, ограничена ли нагрузка памятью или вычислениями. Относитесь к пику как к верхней границе для сравнения архитектур, а не как к прогнозу скорости вашей модели.