AI কম্পিউট রেফারেন্স
রেফারেন্সAI অ্যাক্সেলারেটর থ্রুপুট (FLOPS/TOPS), নির্ভুলতা ফরম্যাট এবং কম্পিউট ইউনিট সংজ্ঞা।
কম্পিউট ইউনিট
নির্ভুলতা ফরম্যাট
অ্যাক্সেলারেটরের ধরন
হার্ডওয়্যার
| নাম | বিক্রেতা | আর্কিটেকচার | মেমরি | ব্যান্ডউইথ | FP16/BF16 (TF) | FP8 (TF) | INT8 (TOPS) |
|---|
সংখ্যাগুলি বিক্রেতার ডেটাশিট থেকে তাত্ত্বিক পিক (dense)। প্রকৃত স্থায়ী থ্রুপুট কম এবং প্রশিক্ষণ ও অনুমানের মধ্যে ভিন্ন। FLOPS এবং TOPS ভিন্ন অপারেশন পরিমাপ করে এবং সরাসরি তুলনীয় নয়।
এই পৃষ্ঠায়
AI কম্পিউট হার্ডওয়্যার রেফারেন্স কী?#
যখন আপনি পড়েন যে একটি GPU “1979 TFLOPS” সরবরাহ করে বা একটি চিপে “১৯২ GB মেমরি” আছে, সেই সংখ্যাগুলো তখনই কিছু অর্থ বহন করে যখন আপনি সেগুলোর পিছনের নিয়মগুলো জানেন: পরিসংখ্যানটি কোন সংখ্যাসূচক নির্ভুলতায় পরিমাপ করা হয়েছিল, এটি কাঠামোগত স্পার্সিটি অন্তর্ভুক্ত করে কিনা, এটি ফ্লোটিং-পয়েন্ট থ্রুপুট (TFLOPS) নাকি পূর্ণসংখ্যা থ্রুপুট (TOPS), এবং মেমরি প্রকৃতপক্ষে কী ব্যান্ডউইথ সরবরাহ করে। বিক্রেতারা তাদের সবচেয়ে সমতল কনফিগারেশনে শিরোনাম সংখ্যা প্রকাশ করে; এমন একটি রেফারেন্স ছাড়া যা শর্তগুলো বলে দেয়, দুটি চিপকে সৎভাবে তুলনা করা যায় না।
এই পৃষ্ঠাটি সেই রেফারেন্স। এটি চারটি জিনিস একত্রিত করে যা একজন ML প্রকৌশলী বা অবকাঠামো ক্রেতা পাশাপাশি প্রকৃতপক্ষে প্রয়োজন: কম্পিউট-ইউনিট গ্লসারি (FLOPS, TFLOPS, TOPS, এবং MAC আসলে কী অর্থ করে), সংখ্যাসূচক নির্ভুলতা ফরম্যাট (FP64 থেকে INT4, সাধারণ থ্রুপুট ক্রমানুসারে), অ্যাক্সেলারেটর ধরন (CPU, GPU, TPU, NPU, LPU, MAU), এবং নির্দিষ্ট চিপগুলোর একটি হার্ডওয়্যার টেবিল তাদের মেমরি ধারণক্ষমতা, মেমরি ব্যান্ডউইথ এবং FP16, FP8, এবং INT8-এ ডেন্স পিক থ্রুপুট সহ — প্রতিটি পরিসংখ্যান বিক্রেতার ডেটাশিটের বিপরীতে যাচাই করা, সঠিক সতর্কতা নোট করা যখন একটি সংখ্যা বিভ্রান্তিকর হতে পারে।
যেভাবে ব্যবহার করবেন#
- সবকিছু জুড়ে অনুসন্ধান করুন। উপরের একক অনুসন্ধান বাক্সটি নাম, বিক্রেতা, প্রসেস নোড বা স্পেক অনুযায়ী একসাথে চারটি বিভাগ ফিল্টার করে —
H100,NVIDIA,192gb, বা4.8tb/sটাইপ করা হার্ডওয়্যার টেবিলকে সংকুচিত করে। - চারটি বিভাগ পড়ুন।
- কম্পিউট ইউনিট — SI-প্রিফিক্সড প্রতীকগুলো (FLOP থেকে EFLOPS, সাথে TOPS এবং MAC) তাদের বেস-১০ সূচক সহ, যাতে আপনি সেগুলোর মধ্যে রূপান্তর করতে পারেন।
- নির্ভুলতা ফরম্যাট — FP64, FP32, TF32, FP16, BF16, FP8, INT8, INT4, প্রতিটির সাথে তার বিট প্রস্থ এবং সাধারণ ব্যবহারের ক্ষেত্রে, একটি আধুনিক টেনসর কোরে থ্রুপুট বৃদ্ধির ক্রম অনুযায়ী সাজানো।
- অ্যাক্সেলারেটরের ধরন — CPU, GPU, TPU, NPU, LPU, এবং MAU-এর মধ্যে এক-লাইন পার্থক্য।
- হার্ডওয়্যার টেবিল — নাম, বিক্রেতা, আর্কিটেকচার, মেমরি (GB), মেমরি ব্যান্ডউইথ (TB/s), এবং ডেন্স FP16 / FP8 / INT8 থ্রুপুট, প্রতি চিপে একটি সতর্কতা নোট সহ।
- ফাঁকা স্থানগুলোতে বিশ্বাস করুন। যেখানে একটি সেল শূন্যের বদলে খালি, পরিসংখ্যানটি একটি ডেন্স পিক হিসেবে যাচাই করা যায়নি — নোটটি কেন তা ব্যাখ্যা করে (AMD-এর MI300X স্পার্স পিক প্রকাশ করে, তাই ডেন্স প্রায় অর্ধেক)। একটি লুকানো শর্ত সহ একটি সংখ্যা মুদ্রণের চেয়ে এটি খালি রাখা বেশি সৎ।
প্রধান বৈশিষ্ট্য#
- শুধুমাত্র ডেন্স পিক, স্পার্সিটি স্পষ্ট। NVIDIA পরিসংখ্যান ডেন্স (২:৪ কাঠামোগত স্পার্সিটি ছাড়া); নোটটি আপনাকে মনে করিয়ে দেয় যে তাদের শিরোনাম বিপণন সংখ্যাগুলো প্রায়শই স্পার্সিটি চালু থাকলে দ্বিগুণ হয়। কোনো নীরব “স্পার্সিটি সহ” ফুলিয়ে দেওয়া নেই।
- TFLOPS এবং TOPS আলাদা রাখা। গ্লসারিটি সরলভাবে বলে যে TOPS (OPS পরিবার) TFLOPS-এর (FLOPS পরিবার) সাথে সরাসরি তুলনাযোগ্য নয় — এমন একটি বিভ্রম যা বিক্রেতারা খুশিতে শোষণ করে।
- থ্রুপুট ক্রমানুসারে সমস্ত চারটি নির্ভুলতা। এক নজরে দেখুন যে FP8 প্রায় FP16-কে দ্বিগুণ করে, এবং INT8 প্রায় BF16-কে দ্বিগুণ করে, একটি নির্দিষ্ট আর্কিটেকচারে — কোয়ান্টাইজেশনের অর্থনৈতিক কারণ।
- মেমরি এবং ব্যান্ডউইথ, শুধু কম্পিউট নয়। বৃহৎ-ভাষা-মডেল অনুমানের জন্য, মেমরি ধারণক্ষমতা এবং ব্যান্ডউইথ প্রায়ই পিক FLOPS-এর চেয়ে বেশি গুরুত্বপূর্ণ, তাই সেগুলো প্রথম-শ্রেণীর কলাম।
- উৎস নাম দ্বারা উদ্ধৃত, লিঙ্ক নয়। প্রতিটি পরিসংখ্যান ডেটাশিট বা প্রোডাক্ট পৃষ্ঠার নাম দেয় যেখান থেকে এটি এসেছে, কোনো আউটবাউন্ড URL ছাড়া, তাই আপনি বিক্রেতার নিজের ডকুমেন্টেশনের বিপরীতে যাচাই করতে পারেন।
বিস্তারিত উদাহরণ#
তিনটি প্রজন্ম জুড়ে NVIDIA লাইনের তুলনা করুন হার্ডওয়্যার টেবিল ব্যবহার করে। NVIDIA অনুসন্ধান করুন এবং আপনি A100, H100, এবং H200 সারিগুলো একসাথে পান:
| চিপ | মেমরি | ব্যান্ডউইথ | FP16 ডেন্স | FP8 ডেন্স | INT8 ডেন্স |
|---|---|---|---|---|---|
| A100 80GB SXM | 80 GB | 2.0 TB/s | 312 TFLOPS | — | 624 TOPS |
| H100 SXM5 | 80 GB | 3.35 TB/s | 989 TFLOPS | 1979 TFLOPS | 1979 TOPS |
| H200 SXM | 141 GB | 4.8 TB/s | 989 TFLOPS | 1979 TFLOPS | 1979 TOPS |
দুটি জিনিস লাফিয়ে ওঠে। প্রথমত, H100 থেকে H200 ঝাঁপ কোনো কম্পিউট যোগ করেনি — উভয়ই GH100 কম্পিউট ডাই শেয়ার করে; H200 হলো HBM3e-তে একটি মেমরি রিফ্রেশ, ধারণক্ষমতা (80 → 141 GB) এবং ব্যান্ডউইথ (3.35 → 4.8 TB/s) প্রায় দ্বিগুণ করা। একটি মেমরি-বাউন্ড LLM অনুমান ওয়ার্কলোডের জন্য, এটি আরও FLOPS-এর চেয়ে একটি বড় বাস্তব-বিশ্বের সাফল্য। দ্বিতীয়ত, A100-এর কোনো FP8 কলাম নেই — FP8 হলো একটি হপার-প্রজন্মের বৈশিষ্ট্য, তাই প্রি-হপার চিপগুলোর কাছে এটি নেই।
তারপর AMD এবং Google সারিগুলো আনুন। MI300X তালিকার যেকোনো চিপের চেয়ে বৃহত্তম মেমরি (১৯২ GB) এবং ব্যান্ডউইথ (৫.৩ TB/s) দেখায়, কিন্তু এর FP16/FP8/INT8 সেলগুলো ইচ্ছাকৃতভাবে খালি, নোটটি ব্যাখ্যা করে যে AMD কাঠামোগত-স্পার্স পিক প্রকাশ করে (1307 FP16 স্পার্স, 2614 INT8 স্পার্স) এবং ডেন্স প্রায় অর্ধেক — NVIDIA-এর ডেন্সের পাশে স্পার্স সংখ্যাটি মুদ্রণ একটি বিভ্রান্তিকর তুলনা হবে। TPU সারিগুলো আবার একটি ভিন্ন রীতি দেখায়: TPU v4 প্রতি চিপে 275-এ BF16-কে INT8-এর সমান রিপোর্ট করে, যখন খরচ-অপ্টিমাইজড v5e 197 BF16-এর বিপরীতে INT8-কে 393-এ দ্বিগুণ করে।
সাধারণ জিজ্ঞাসা#
TFLOPS বনাম TOPS — এগুলো কি একই জিনিস?#
না, এবং এগুলো বিভ্রান্ত করা সবচেয়ে সাধারণ স্পেক-শিট ফাঁদ। TFLOPS প্রতি সেকেন্ডে ফ্লোটিং-পয়েন্ট অপারেশন পরিমাপ করে (FLOPS পরিবার, বেস-১০ প্রিফিক্স: MFLOPS, GFLOPS, TFLOPS, PFLOPS)। TOPS প্রতি সেকেন্ডে পূর্ণসংখ্যা বা সাধারণ অপারেশন পরিমাপ করে (OPS পরিবার) এবং এটি আপনি সাধারণত INT8 কোয়ান্টাইজড অনুমানের জন্য উদ্ধৃত দেখেন। অন্তর্নিহিত অপারেশনটি ভিন্ন হওয়ায়, একটি চিপের TOPS সংখ্যা তার TFLOPS সংখ্যার সাথে সরাসরি তুলনাযোগ্য নয় — এবং একটি MAC (একটি গুণ-সংচয়) প্রচলিতভাবে দুটি FLOP হিসেবে গণনা করা হয়, যা কারণের অংশ যে বিক্রেতার TOPS পরিসংখ্যান কখনো কখনো দ্বি-গণনা করছে বলে মনে হয়।
কেন MI300X কম্পিউট সেলগুলো খালি?#
কারণ AMD তার পিক থ্রুপুট কাঠামোগত স্পার্সিটি সক্ষম অবস্থায় প্রকাশ করে (উদাহরণস্বরূপ, 1307 FP16 TFLOPS স্পার্স), যেখানে এই টেবিলটি প্রতিটি চিপকে তুলনাযোগ্য রাখতে ডেন্স পিক রিপোর্ট করে। ডেন্স MI300X প্রায় স্পার্স পরিসংখ্যানের অর্ধেক, কিন্তু একটি পরিষ্কার, যাচাইকৃত ডেন্স সংখ্যা ধারাবাহিকভাবে উপলব্ধ নয়, তাই সেলটি একটি লুকানো “স্পার্স” শর্ত সহ একটি সংখ্যা মুদ্রণের বদলে খালি রাখা হয়েছে। মেমরি এবং ব্যান্ডউইথ — ১৯২ GB এবং ৫.৩ TB/s — যাচাই করা এবং দেখানো হয়েছে।
FP16 এবং BF16-এর মধ্যে পার্থক্য কী?#
উভয়ই ১৬ বিট, কিন্তু তারা সেই বিটগুলো ভিন্নভাবে ব্যয় করে। FP16-এ আরও নির্ভুলতা আছে কিন্তু একটি সংকীর্ণ সংখ্যাসূচক পরিসর; BF16 নির্ভুলতার বিনিময়ে FP32-এর মতো একই পরিসর দেয়। সেই পরিসরটি প্রশিক্ষণের জন্য গুরুত্বপূর্ণ, যেখানে গ্রেডিয়েন্টগুলো মাত্রায় ব্যাপকভাবে পরিবর্তিত হতে পারে, যা কারণ BF16 আধুনিক টেনসর কোরে ডিফল্ট প্রশিক্ষণ ফরম্যাট হয়ে উঠেছে যদিও এটি এবং FP16 একই বিট প্রস্থ দখল করে। নির্ভুলতা-ফরম্যাট বিভাগটি উভয়কেই তাদের সাধারণ ব্যবহারের সাথে তালিকাভুক্ত করে।
“পিক” কী অর্থ — আমার মডেল কি সত্যিই এই সংখ্যাগুলোতে পৌঁছাবে?#
প্রায় কখনো নয়। এগুলো তাত্ত্বিক পিক — সেই থ্রুপুট যা চিপটি টিকিয়ে রাখতে পারবে যদি প্রতিটি চক্র কোনো মেমরি স্টল ছাড়াই নিখুঁতভাবে ব্যবহৃত হতো, যা বাস্তব ওয়ার্কলোড কখনো অর্জন করে না। স্থায়ী থ্রুপুট সর্বদা কম এবং কার্নেল, মডেল আর্কিটেকচার, ব্যাচ আকার, এবং ওয়ার্কলোডটি মেমরি- বা কম্পিউট-বাউন্ড কিনা তার উপর নির্ভর করে। পিকটিকে আর্কিটেকচার তুলনার জন্য একটি ঊর্ধ্ব সীমা হিসেবে বিবেচনা করুন, আপনার মডেলের গতির পূর্বাভাস হিসেবে নয়।