AI 연산 참조
참고 자료AI 가속기 처리량(FLOPS/TOPS), 정밀도 포맷, 연산 단위 정의.
연산 단위
정밀도 포맷
가속기 유형
하드웨어
| 이름 | 제조사 | 아키텍처 | 메모리 | 대역폭 | FP16/BF16 (TF) | FP8 (TF) | INT8 (TOPS) |
|---|
수치는 제조사 데이터시트의 이론적 최고값(dense)입니다. 실제 지속 처리량은 더 낮으며 학습과 추론이 다릅니다. FLOPS와 TOPS는 서로 다른 연산을 측정하므로 직접 비교할 수 없습니다.
이 페이지에서
AI 연산 하드웨어 참조란?#
GPU가 “1979 TFLOPS”를 제공한다거나 칩에 “192 GB의 메모리”가 있다는 글을 읽을 때, 그 숫자는 뒤의 규칙을 알기 전까지는 의미가 없습니다. 그 수치가 어느 수치 정밀도에서 측정되었는지, 구조적 희소성을 포함하는지, 부동소수점 처리량(TFLOPS)인지 정수 처리량(TOPS)인지, 메모리가 실제로 공급하는 대역폭은 얼마인지. 벤더는 가장 유리한 구성으로 헤드라인 숫자를 발표합니다. 조건을 명시하는 참조가 없으면 두 칩을 정직하게 비교할 수 없습니다.
이 페이지가 그 참조입니다. ML 엔지니어나 인프라 구매자가 실제로 필요로 하는 네 가지를 나란히 모읍니다. 연산 단위 용어집(FLOPS, TFLOPS, TOPS, MAC이 실제로 무엇을 의미하는지), 수치 정밀도 포맷(FP64에서 INT4까지, 일반적인 처리량 순서로), 가속기 종류(CPU, GPU, TPU, NPU, LPU, MAU), 그리고 특정 칩들의 메모리 용량, 메모리 대역폭, FP16, FP8, INT8에서의 조밀 최대 처리량을 담은 하드웨어 표. 각 수치는 벤더 데이터시트와 교차 검증되었으며, 숫자가 오해를 일으킬 수 있을 때는 정확한 주의사항이 적혀 있습니다.
사용 방법#
- 모든 것을 걸쳐 검색하세요. 위쪽의 단일 검색 상자가 이름, 벤더, 공정 노드 또는 사양으로 네 섹션을 한꺼번에 필터링합니다.
H100,NVIDIA,192gb,4.8tb/s를 입력하면 하드웨어 표가 좁혀집니다. - 네 섹션을 읽으세요.
- 연산 단위 — SI 접두사가 붙은 기호(FLOP부터 EFLOPS까지, 그리고 TOPS와 MAC)를 10진 지수와 함께. 서로 변환할 수 있습니다.
- 정밀도 포맷 — FP64, FP32, TF32, FP16, BF16, FP8, INT8, INT4. 각각의 비트 폭과 일반적 사용 사례. 현대 텐서 코어에서 처리량이 오름차순으로 대략 정렬.
- 가속기 종류 — CPU, GPU, TPU, NPU, LPU, MAU의 한 줄 구분.
- 하드웨어 표 — 이름, 벤더, 공정, 메모리(GB), 메모리 대역폭(TB/s), 조밀 FP16 / FP8 / INT8 처리량. 칩마다 주의사항 메모.
- 빈칸을 신뢰하세요. 0이 아니라 빈칸인 셀은 조밀 최대값으로 검증할 수 없었다는 뜻입니다. 메모가 이유를 설명합니다(AMD의 MI300X는 희소 최대값을 발표하므로 조밀값은 대략 절반). 숨겨진 조건이 있는 숫자를 인쇄하기보다 빈칸으로 두는 것이 더 정직합니다.
주요 특징#
- 조밀 최대값만, 희소성은 명시. NVIDIA 수치는 조밀(2:4 구조적 희소성 없음)이며, 메모는 벤더의 헤드라인 마케팅 숫자가 희소성을 켜면 종종 두 배가 된다고 상기시킵니다. 조용한 “희소성 포함” 부풀리기가 없습니다.
- TFLOPS와 TOPS를 분리. 용어집은 TOPS(OPS 계열)가 TFLOPS(FLOPS 계열)와 직접 비교할 수 없다고 명확히 합니다. 벤더가 기꺼이 악용하는 혼란입니다.
- 처리량 순서의 네 정밀도 전부. 주어진 아키텍처에서 FP8은 FP16의 대략 두 배, INT8은 BF16의 대략 두 배라는 것을 한눈에 보세요. 양자화가 존재하는 경제적 이유입니다.
- 연산뿐 아니라 메모리와 대역폭. 대규모 언어 모델 추론에서는 메모리 용량과 대역폭이 최대 FLOPS보다 종종 더 중요하므로 1급 열입니다.
- 링크가 아닌 이름으로 인용된 출처. 모든 수치는 외부 URL 없이 출처 데이터시트 또는 제품 페이지 이름을 제시하므로, 벤더 자체 문서로 검증할 수 있습니다.
실제 예시#
하드웨어 표로 NVIDIA 라인을 세 세대에 걸쳐 비교해 보세요. NVIDIA를 검색하면 A100, H100, H200 행이 함께 나옵니다.
| 칩 | 메모리 | 대역폭 | FP16 조밀 | FP8 조밀 | INT8 조밀 |
|---|---|---|---|---|---|
| A100 80GB SXM | 80 GB | 2.0 TB/s | 312 TFLOPS | — | 624 TOPS |
| H100 SXM5 | 80 GB | 3.35 TB/s | 989 TFLOPS | 1979 TFLOPS | 1979 TOPS |
| H200 SXM | 141 GB | 4.8 TB/s | 989 TFLOPS | 1979 TFLOPS | 1979 TOPS |
두 가지가 눈에 띕니다. 첫째, H100에서 H200으로의 도약은 연산을 추가하지 않았습니다. 둘 다 GH100 연산 다이를 공유하며, H200은 HBM3e로의 메모리 리프레시입니다. 용량(80 → 141 GB)과 대역폭(3.35 → 4.8 TB/s)을 거의 두 배로 늘렸습니다. 메모리 바운드인 LLM 추론 워크로드에서 그것은 FLOPS가 더 늘어나는 것보다 더 큰 실제 이득입니다. 둘째, A100에는 FP8 열이 없습니다. FP8은 Hopper 세대 기능이므로 pre-Hopper 칩은 그냥 없습니다.
그 다음 AMD와 Google 행을 펼쳐 보세요. MI300X는 나열된 어떤 칩보다 가장 큰 메모리(192 GB)와 대역폭(5.3 TB/s)을 보여주지만, FP16/FP8/INT8 셀은 의도적으로 비어 있습니다. AMD가 구조적 희소 최대값(1307 FP16 희소, 2614 INT8 희소)을 발표하고 조밀은 대략 절반이라는 메모로 설명됩니다. 희소 숫자를 NVIDIA의 조밀 숫자 옆에 인쇄하면 오해를 일으키는 비교가 됩니다. TPU 행은 또 다른 관행을 보여줍니다. TPU v4는 칩당 275로 BF16이 INT8과 같다고 보고하고, 비용 최적화 v5e는 197 BF16 대비 INT8을 393으로 두 배로 합니다.
FAQ#
TFLOPS와 TOPS는 같은 건가요?#
아니요, 둘을 헷갈리는 것이 가장 흔한 스펙 시트 함정입니다. TFLOPS는 초당 부동소수점 연산을 측정합니다(FLOPS 계열, 10진 접두사: MFLOPS, GFLOPS, TFLOPS, PFLOPS). TOPS는 초당 정수 또는 일반 연산(OPS 계열)을 측정하며 INT8 양자화 추론에서 보통 인용되는 수치입니다. 기저 연산이 다르기 때문에 칩의 TOPS 숫자는 TFLOPS 숫자와 직접 비교할 수 없으며, MAC(곱하기-누적 1회)은 관행적으로 2 FLOP으로 계산되는데, 이것이 벤더 TOPS 수치가 때로 이중 계산되어 보이는 이유의 일부입니다.
MI300X 연산 셀이 왜 비어 있나요?#
AMD가 모든 칩을 비교 가능하게 유지하려는 이 표의 조밀 최대값과 달리 구조적 희소성을 켠 최대 처리량을 발표하기 때문입니다(예: 1307 FP16 TFLOPS 희소). 조밀 MI300X는 희소 수치의 대략 절반이지만, 깨끗하고 검증된 조밀 숫자가 일관되게 구할 수 없어서, 숨겨진 “희소” 조건이 있는 숫자를 인쇄하는 대신 셀을 비워 둡니다. 메모리와 대역폭(192 GB와 5.3 TB/s)은 검증되어 표시됩니다.
FP16과 BF16의 차이는?#
둘 다 16비트지만 비트를 쓰는 방식이 다릅니다. FP16은 더 많은 정밀도를 가지지만 좁은 수치 범위를 가지고, BF16은 정밀도를 희생하고 FP32와 같은 범위를 얻습니다. 그 범위가 훈련에서 중요합니다. 기울기가 크기가 크게 변할 수 있기 때문이며, 그래서 BF16이 FP16과 같은 비트 폭을 차지함에도 현대 텐서 코어의 기본 훈련 포맷이 되었습니다. 정밀도 포맷 섹션에 둘 다 일반적 사용과 함께 나열됩니다.
”최대”는 무슨 뜻인가요? 내 모델이 실제로 이 숫자에 도달하나요?#
거의 도달하지 않습니다. 이것은 이론적 최대값입니다. 모든 사이클이 메모리 정체 없이 완벽히 활용될 때 칩이 유지할 수 있는 처리량이며, 실제 워크로드는 결코 달성하지 못합니다. 지속 처리량은 항상 더 낮으며 커널, 모델 아키텍처, 배치 크기, 워크로드가 메모리 바운드인지 연산 바운드인지에 따라 달라집니다. 최대값은 아키텍처를 비교하기 위한 상한으로 취급하고, 모델의 속도 예측으로 취급하지 마세요.