Инструменты
Руководства

Справочник по AI-вычислениям

Справочник

Пропускная способность AI-ускорителей (FLOPS/TOPS), форматы точности и определения вычислительных единиц.

100 % на клиенте Без бэкенда

Единицы вычислений

Форматы точности

Типы ускорителей

Оборудование

Название Производитель Архитектура Память Пропускная способность FP16/BF16 (TF) FP8 (TF) INT8 (TOPS)

Значения — ТЕОРЕТИЧЕСКИЙ ПИК (dense) из спецификаций производителей. Реальная sustained-производительность ниже и различается для обучения и вывода. FLOPS и TOPS измеряют разные операции и не сопоставимы напрямую.

На этой странице

Что такое справочник по AI-вычислительному железу?#

Когда вы читаете, что GPU даёт «1979 TFLOPS», а у чипа «192 ГБ памяти», эти цифры что-то значат лишь тогда, когда вы знаете стоящие за ними правила: в какой числовой точности измерялась цифра, включает ли она структурную разреженность, это пропускная способность с плавающей точкой (TFLOPS) или целочисленная (TOPS) и какую полосу пропускания даёт память. Вендоры публикуют заголовочные числа в самой выгодной конфигурации; без справочника, фиксирующего условия, два чипа нельзя сравнить честно.

Эта страница — такой справочник. Она собирает рядом четыре вещи, реально нужные ML-инженеру или покупателю инфраструктуры: глоссарий вычислительных единиц (что на деле значат FLOPS, TFLOPS, TOPS и MAC), форматы числовой точности (от FP64 до INT4, в типичном порядке пропускной способности), типы ускорителей (CPU, GPU, TPU, NPU, LPU, MAU) и таблицу железа по конкретным чипам с объёмом памяти, полосой памяти и плотным пиковым FP16, FP8 и INT8 — каждая цифра сверена по даташиту вендора, с точной оговоркой там, где число может ввести в заблуждение.

Как пользоваться#

  1. Ищите по всему разом. Едиственное поле Поиск ускорителей, производителей, форматов… сверху фильтрует все четыре секции одновременно по имени, вендору, техпроцессу или спецификации — ввод H100, NVIDIA, 192gb или 4.8tb/s сужает таблицу железа.
  2. Читайте четыре секции.
    • Единицы вычислений — SI-префиксные символы (от FLOP до EFLOPS, плюс TOPS и MAC) с их показателями степени по основанию 10, поэтому между ними можно переводить.
    • Форматы точности — FP64, FP32, TF32, FP16, BF16, FP8, INT8, INT4, каждый с битовой шириной и типичным случаем использования, упорядоченные примерно по растущей пропускной способности на современном тензорном ядре.
    • Типы ускорителей — различие между CPU, GPU, TPU, NPU, LPU и MAU в одну строку.
    • Оборудование — название, производитель, архитектура, память (GB), полоса памяти (TB/s) и плотная пропускная способность FP16 / FP8 / INT8 с оговоркой на чип.
  3. Доверяйте пустым ячейкам. Если ячейка пуста, а не ноль, — плотный пик для этой цифры не удалось подтвердить; заметка поясняет почему (AMD MI300X публикует разреженные пики, поэтому плотный примерно половина). Честнее оставить пусто, чем печатать число со скрытым условием.

Ключевые возможности#

  • Только плотные пики, с указанием разреженности. Цифры NVIDIA плотные (без структурной разреженности 2:4); заметка напоминает, что их заголовочные маркетинговые числа часто удваиваются при включении разреженности. Никакого скрытого раздувания «со разреженностью».
  • TFLOPS и TOPS держатся отдельно. Глоссарий прямолинейно заявляет, что TOPS (семейство OPS) не сопоставим напрямую с TFLOPS (семейство FLOPS) — путаницу, которую вендоры охотно эксплуатируют.
  • Все четыре точности в порядке пропускной способности. С одного взгляда видно, что FP8 примерно вдвое превышает FP16, а INT8 примерно вдвое — BF16 на данной архитектуре: экономическая причина существования квантизации.
  • Память и полоса, а не только вычисления. Для инференса больших языковых моделей объём памяти и полоса часто важнее пиковой FLOPS, поэтому они — полноправные колонки.
  • Источники названы по имени, а не ссылкой. Каждая цифра называет даташит или продуктовую страницу, откуда она взята, без исходящей URL, чтобы вы могли сверить с собственной документацией вендора.

Разбор примера#

Сравните линейку NVIDIA в трёх поколениях через таблицу железа. Поищите NVIDIA, и вы получите строки A100, H100 и H200 вместе:

ЧипПамятьПолосаFP16 плотн.FP8 плотн.INT8 плотн.
A100 80GB SXM80 GB2.0 TB/s312 TFLOPS624 TOPS
H100 SXM580 GB3.35 TB/s989 TFLOPS1979 TFLOPS1979 TOPS
H200 SXM141 GB4.8 TB/s989 TFLOPS1979 TFLOPS1979 TOPS

Бросаются в глаза две вещи. Во-первых, переход от H100 к H200 не добавил вычислений — оба делят вычислительный кристалл GH100; H200 — это обновление памяти на HBM3e, почти удваивающее объём (80 → 141 GB) и полосу (3.35 → 4.8 TB/s). Для инференса LLM, ограниченного памятью, это больший реальный выигрыш, чем дополнительные FLOPS. Во-вторых, у A100 нет колонки FP8 — FP8 это особенность поколения Hopper, поэтому дочопперные чипы её просто не имеют.

Затем поднимите строки AMD и Google. MI300X показывает крупнейшие память (192 GB) и полосу (5.3 TB/s) из всех перечисленных чипов, но его ячейки FP16/FP8/INT8 намеренно пусты: заметка поясняет, что AMD публикует структурно-разрежные пики (1307 FP16 разреженный, 2614 INT8 разреженный), а плотный примерно половина, — напечатать разреженное число рядом с плотным NVIDIA было бы misleading-сравнением. Строки TPU снова показывают другую конвенцию: TPU v4 сообщает BF16, равный INT8, — 275 на чип, тогда как оптимизированный по стоимости v5e удваивает INT8 до 393 против 197 BF16.

FAQ#

TFLOPS против TOPS — это одно и то же?#

Нет, и путать их — самая частая ловушка спецификаций. TFLOPS измеряет операции с плавающей точкой в секунду (семейство FLOPS, префиксы по основанию 10: MFLOPS, GFLOPS, TFLOPS, PFLOPS). TOPS измеряет целочисленные или обобщённые операции в секунду (семейство OPS) и обычно то, что вы видите для INT8-квантованного инференса. Поскольку базовая операция различается, TOPS-число чипа напрямую не сопоставимо с его TFLOPS-числом, — а MAC (одно умножение с накоплением) по соглашению считается за две FLOP, что отчасти объясняет, почему вендорские цифры TOPS иногда кажутся задвоенными.

Почему ячейки вычислений MI300X пусты?#

Потому что AMD публикует пиковую пропускную способность со структурной разреженностью (например, 1307 FP16 TFLOPS разреженный), тогда как эта таблица сообщает плотные пики для сопоставимости всех чипов. Плотный MI300X — примерно половина разреженной цифры, но чистое, сверенное плотное число последовательно недоступно, поэтому ячейка оставлена пустой, а не печатает число со скрытым условием «разреженный». Память и полоса — 192 GB и 5.3 TB/s — сверены и показаны.

В чём разница между FP16 и BF16?#

Оба по 16 бит, но они расходуют биты по-разному. FP16 имеет больше точности, но узкий числовой диапазон; BF16 обменивает точность на тот же диапазон, что у FP32. Этот диапазон важен для обучения, где градиенты могут сильно меняться по величине, поэтому BF16 стал форматом обучения по умолчанию на современных тензорных ядрах, хотя с FP16 у него одна битовая ширина. Секция форматов точности перечисляет оба с типичным использованием.

Что значит «пиковый» — моя модель реально достигнет этих чисел?#

Почти никогда. Это теоретические пики — пропускная способность, которую чип мог бы поддерживать, если бы каждый цикл был идеально утилизирован без задержек памяти, чего реальные нагрузки не достигают. Sustained-производительность всегда ниже и зависит от ядра, архитектуры модели, размера батча и того, ограничена ли нагрузка памятью или вычислениями. Относитесь к пику как к верхней границе для сравнения архитектур, а не как к прогнозу скорости вашей модели.