টুল
গাইড

AI কম্পিউট রেফারেন্স

রেফারেন্স

AI অ্যাক্সেলারেটর থ্রুপুট (FLOPS/TOPS), নির্ভুলতা ফরম্যাট এবং কম্পিউট ইউনিট সংজ্ঞা।

100% ক্লায়েন্ট-সাইড কোনো ব্যাকএন্ড নেই

কম্পিউট ইউনিট

নির্ভুলতা ফরম্যাট

অ্যাক্সেলারেটরের ধরন

হার্ডওয়্যার

নাম বিক্রেতা আর্কিটেকচার মেমরি ব্যান্ডউইথ FP16/BF16 (TF) FP8 (TF) INT8 (TOPS)

সংখ্যাগুলি বিক্রেতার ডেটাশিট থেকে তাত্ত্বিক পিক (dense)। প্রকৃত স্থায়ী থ্রুপুট কম এবং প্রশিক্ষণ ও অনুমানের মধ্যে ভিন্ন। FLOPS এবং TOPS ভিন্ন অপারেশন পরিমাপ করে এবং সরাসরি তুলনীয় নয়।

এই পৃষ্ঠায়

AI কম্পিউট হার্ডওয়্যার রেফারেন্স কী?#

যখন আপনি পড়েন যে একটি GPU “1979 TFLOPS” সরবরাহ করে বা একটি চিপে “১৯২ GB মেমরি” আছে, সেই সংখ্যাগুলো তখনই কিছু অর্থ বহন করে যখন আপনি সেগুলোর পিছনের নিয়মগুলো জানেন: পরিসংখ্যানটি কোন সংখ্যাসূচক নির্ভুলতায় পরিমাপ করা হয়েছিল, এটি কাঠামোগত স্পার্সিটি অন্তর্ভুক্ত করে কিনা, এটি ফ্লোটিং-পয়েন্ট থ্রুপুট (TFLOPS) নাকি পূর্ণসংখ্যা থ্রুপুট (TOPS), এবং মেমরি প্রকৃতপক্ষে কী ব্যান্ডউইথ সরবরাহ করে। বিক্রেতারা তাদের সবচেয়ে সমতল কনফিগারেশনে শিরোনাম সংখ্যা প্রকাশ করে; এমন একটি রেফারেন্স ছাড়া যা শর্তগুলো বলে দেয়, দুটি চিপকে সৎভাবে তুলনা করা যায় না।

এই পৃষ্ঠাটি সেই রেফারেন্স। এটি চারটি জিনিস একত্রিত করে যা একজন ML প্রকৌশলী বা অবকাঠামো ক্রেতা পাশাপাশি প্রকৃতপক্ষে প্রয়োজন: কম্পিউট-ইউনিট গ্লসারি (FLOPS, TFLOPS, TOPS, এবং MAC আসলে কী অর্থ করে), সংখ্যাসূচক নির্ভুলতা ফরম্যাট (FP64 থেকে INT4, সাধারণ থ্রুপুট ক্রমানুসারে), অ্যাক্সেলারেটর ধরন (CPU, GPU, TPU, NPU, LPU, MAU), এবং নির্দিষ্ট চিপগুলোর একটি হার্ডওয়্যার টেবিল তাদের মেমরি ধারণক্ষমতা, মেমরি ব্যান্ডউইথ এবং FP16, FP8, এবং INT8-এ ডেন্স পিক থ্রুপুট সহ — প্রতিটি পরিসংখ্যান বিক্রেতার ডেটাশিটের বিপরীতে যাচাই করা, সঠিক সতর্কতা নোট করা যখন একটি সংখ্যা বিভ্রান্তিকর হতে পারে।

যেভাবে ব্যবহার করবেন#

  1. সবকিছু জুড়ে অনুসন্ধান করুন। উপরের একক অনুসন্ধান বাক্সটি নাম, বিক্রেতা, প্রসেস নোড বা স্পেক অনুযায়ী একসাথে চারটি বিভাগ ফিল্টার করে — H100, NVIDIA, 192gb, বা 4.8tb/s টাইপ করা হার্ডওয়্যার টেবিলকে সংকুচিত করে।
  2. চারটি বিভাগ পড়ুন।
    • কম্পিউট ইউনিট — SI-প্রিফিক্সড প্রতীকগুলো (FLOP থেকে EFLOPS, সাথে TOPS এবং MAC) তাদের বেস-১০ সূচক সহ, যাতে আপনি সেগুলোর মধ্যে রূপান্তর করতে পারেন।
    • নির্ভুলতা ফরম্যাট — FP64, FP32, TF32, FP16, BF16, FP8, INT8, INT4, প্রতিটির সাথে তার বিট প্রস্থ এবং সাধারণ ব্যবহারের ক্ষেত্রে, একটি আধুনিক টেনসর কোরে থ্রুপুট বৃদ্ধির ক্রম অনুযায়ী সাজানো।
    • অ্যাক্সেলারেটরের ধরন — CPU, GPU, TPU, NPU, LPU, এবং MAU-এর মধ্যে এক-লাইন পার্থক্য।
    • হার্ডওয়্যার টেবিল — নাম, বিক্রেতা, আর্কিটেকচার, মেমরি (GB), মেমরি ব্যান্ডউইথ (TB/s), এবং ডেন্স FP16 / FP8 / INT8 থ্রুপুট, প্রতি চিপে একটি সতর্কতা নোট সহ।
  3. ফাঁকা স্থানগুলোতে বিশ্বাস করুন। যেখানে একটি সেল শূন্যের বদলে খালি, পরিসংখ্যানটি একটি ডেন্স পিক হিসেবে যাচাই করা যায়নি — নোটটি কেন তা ব্যাখ্যা করে (AMD-এর MI300X স্পার্স পিক প্রকাশ করে, তাই ডেন্স প্রায় অর্ধেক)। একটি লুকানো শর্ত সহ একটি সংখ্যা মুদ্রণের চেয়ে এটি খালি রাখা বেশি সৎ।

প্রধান বৈশিষ্ট্য#

  • শুধুমাত্র ডেন্স পিক, স্পার্সিটি স্পষ্ট। NVIDIA পরিসংখ্যান ডেন্স (২:৪ কাঠামোগত স্পার্সিটি ছাড়া); নোটটি আপনাকে মনে করিয়ে দেয় যে তাদের শিরোনাম বিপণন সংখ্যাগুলো প্রায়শই স্পার্সিটি চালু থাকলে দ্বিগুণ হয়। কোনো নীরব “স্পার্সিটি সহ” ফুলিয়ে দেওয়া নেই।
  • TFLOPS এবং TOPS আলাদা রাখা। গ্লসারিটি সরলভাবে বলে যে TOPS (OPS পরিবার) TFLOPS-এর (FLOPS পরিবার) সাথে সরাসরি তুলনাযোগ্য নয় — এমন একটি বিভ্রম যা বিক্রেতারা খুশিতে শোষণ করে।
  • থ্রুপুট ক্রমানুসারে সমস্ত চারটি নির্ভুলতা। এক নজরে দেখুন যে FP8 প্রায় FP16-কে দ্বিগুণ করে, এবং INT8 প্রায় BF16-কে দ্বিগুণ করে, একটি নির্দিষ্ট আর্কিটেকচারে — কোয়ান্টাইজেশনের অর্থনৈতিক কারণ।
  • মেমরি এবং ব্যান্ডউইথ, শুধু কম্পিউট নয়। বৃহৎ-ভাষা-মডেল অনুমানের জন্য, মেমরি ধারণক্ষমতা এবং ব্যান্ডউইথ প্রায়ই পিক FLOPS-এর চেয়ে বেশি গুরুত্বপূর্ণ, তাই সেগুলো প্রথম-শ্রেণীর কলাম।
  • উৎস নাম দ্বারা উদ্ধৃত, লিঙ্ক নয়। প্রতিটি পরিসংখ্যান ডেটাশিট বা প্রোডাক্ট পৃষ্ঠার নাম দেয় যেখান থেকে এটি এসেছে, কোনো আউটবাউন্ড URL ছাড়া, তাই আপনি বিক্রেতার নিজের ডকুমেন্টেশনের বিপরীতে যাচাই করতে পারেন।

বিস্তারিত উদাহরণ#

তিনটি প্রজন্ম জুড়ে NVIDIA লাইনের তুলনা করুন হার্ডওয়্যার টেবিল ব্যবহার করে। NVIDIA অনুসন্ধান করুন এবং আপনি A100, H100, এবং H200 সারিগুলো একসাথে পান:

চিপমেমরিব্যান্ডউইথFP16 ডেন্সFP8 ডেন্সINT8 ডেন্স
A100 80GB SXM80 GB2.0 TB/s312 TFLOPS624 TOPS
H100 SXM580 GB3.35 TB/s989 TFLOPS1979 TFLOPS1979 TOPS
H200 SXM141 GB4.8 TB/s989 TFLOPS1979 TFLOPS1979 TOPS

দুটি জিনিস লাফিয়ে ওঠে। প্রথমত, H100 থেকে H200 ঝাঁপ কোনো কম্পিউট যোগ করেনি — উভয়ই GH100 কম্পিউট ডাই শেয়ার করে; H200 হলো HBM3e-তে একটি মেমরি রিফ্রেশ, ধারণক্ষমতা (80 → 141 GB) এবং ব্যান্ডউইথ (3.35 → 4.8 TB/s) প্রায় দ্বিগুণ করা। একটি মেমরি-বাউন্ড LLM অনুমান ওয়ার্কলোডের জন্য, এটি আরও FLOPS-এর চেয়ে একটি বড় বাস্তব-বিশ্বের সাফল্য। দ্বিতীয়ত, A100-এর কোনো FP8 কলাম নেই — FP8 হলো একটি হপার-প্রজন্মের বৈশিষ্ট্য, তাই প্রি-হপার চিপগুলোর কাছে এটি নেই।

তারপর AMD এবং Google সারিগুলো আনুন। MI300X তালিকার যেকোনো চিপের চেয়ে বৃহত্তম মেমরি (১৯২ GB) এবং ব্যান্ডউইথ (৫.৩ TB/s) দেখায়, কিন্তু এর FP16/FP8/INT8 সেলগুলো ইচ্ছাকৃতভাবে খালি, নোটটি ব্যাখ্যা করে যে AMD কাঠামোগত-স্পার্স পিক প্রকাশ করে (1307 FP16 স্পার্স, 2614 INT8 স্পার্স) এবং ডেন্স প্রায় অর্ধেক — NVIDIA-এর ডেন্সের পাশে স্পার্স সংখ্যাটি মুদ্রণ একটি বিভ্রান্তিকর তুলনা হবে। TPU সারিগুলো আবার একটি ভিন্ন রীতি দেখায়: TPU v4 প্রতি চিপে 275-এ BF16-কে INT8-এর সমান রিপোর্ট করে, যখন খরচ-অপ্টিমাইজড v5e 197 BF16-এর বিপরীতে INT8-কে 393-এ দ্বিগুণ করে।

সাধারণ জিজ্ঞাসা#

TFLOPS বনাম TOPS — এগুলো কি একই জিনিস?#

না, এবং এগুলো বিভ্রান্ত করা সবচেয়ে সাধারণ স্পেক-শিট ফাঁদ। TFLOPS প্রতি সেকেন্ডে ফ্লোটিং-পয়েন্ট অপারেশন পরিমাপ করে (FLOPS পরিবার, বেস-১০ প্রিফিক্স: MFLOPS, GFLOPS, TFLOPS, PFLOPS)। TOPS প্রতি সেকেন্ডে পূর্ণসংখ্যা বা সাধারণ অপারেশন পরিমাপ করে (OPS পরিবার) এবং এটি আপনি সাধারণত INT8 কোয়ান্টাইজড অনুমানের জন্য উদ্ধৃত দেখেন। অন্তর্নিহিত অপারেশনটি ভিন্ন হওয়ায়, একটি চিপের TOPS সংখ্যা তার TFLOPS সংখ্যার সাথে সরাসরি তুলনাযোগ্য নয় — এবং একটি MAC (একটি গুণ-সংচয়) প্রচলিতভাবে দুটি FLOP হিসেবে গণনা করা হয়, যা কারণের অংশ যে বিক্রেতার TOPS পরিসংখ্যান কখনো কখনো দ্বি-গণনা করছে বলে মনে হয়।

কেন MI300X কম্পিউট সেলগুলো খালি?#

কারণ AMD তার পিক থ্রুপুট কাঠামোগত স্পার্সিটি সক্ষম অবস্থায় প্রকাশ করে (উদাহরণস্বরূপ, 1307 FP16 TFLOPS স্পার্স), যেখানে এই টেবিলটি প্রতিটি চিপকে তুলনাযোগ্য রাখতে ডেন্স পিক রিপোর্ট করে। ডেন্স MI300X প্রায় স্পার্স পরিসংখ্যানের অর্ধেক, কিন্তু একটি পরিষ্কার, যাচাইকৃত ডেন্স সংখ্যা ধারাবাহিকভাবে উপলব্ধ নয়, তাই সেলটি একটি লুকানো “স্পার্স” শর্ত সহ একটি সংখ্যা মুদ্রণের বদলে খালি রাখা হয়েছে। মেমরি এবং ব্যান্ডউইথ — ১৯২ GB এবং ৫.৩ TB/s — যাচাই করা এবং দেখানো হয়েছে।

FP16 এবং BF16-এর মধ্যে পার্থক্য কী?#

উভয়ই ১৬ বিট, কিন্তু তারা সেই বিটগুলো ভিন্নভাবে ব্যয় করে। FP16-এ আরও নির্ভুলতা আছে কিন্তু একটি সংকীর্ণ সংখ্যাসূচক পরিসর; BF16 নির্ভুলতার বিনিময়ে FP32-এর মতো একই পরিসর দেয়। সেই পরিসরটি প্রশিক্ষণের জন্য গুরুত্বপূর্ণ, যেখানে গ্রেডিয়েন্টগুলো মাত্রায় ব্যাপকভাবে পরিবর্তিত হতে পারে, যা কারণ BF16 আধুনিক টেনসর কোরে ডিফল্ট প্রশিক্ষণ ফরম্যাট হয়ে উঠেছে যদিও এটি এবং FP16 একই বিট প্রস্থ দখল করে। নির্ভুলতা-ফরম্যাট বিভাগটি উভয়কেই তাদের সাধারণ ব্যবহারের সাথে তালিকাভুক্ত করে।

“পিক” কী অর্থ — আমার মডেল কি সত্যিই এই সংখ্যাগুলোতে পৌঁছাবে?#

প্রায় কখনো নয়। এগুলো তাত্ত্বিক পিক — সেই থ্রুপুট যা চিপটি টিকিয়ে রাখতে পারবে যদি প্রতিটি চক্র কোনো মেমরি স্টল ছাড়াই নিখুঁতভাবে ব্যবহৃত হতো, যা বাস্তব ওয়ার্কলোড কখনো অর্জন করে না। স্থায়ী থ্রুপুট সর্বদা কম এবং কার্নেল, মডেল আর্কিটেকচার, ব্যাচ আকার, এবং ওয়ার্কলোডটি মেমরি- বা কম্পিউট-বাউন্ড কিনা তার উপর নির্ভর করে। পিকটিকে আর্কিটেকচার তুলনার জন্য একটি ঊর্ধ্ব সীমা হিসেবে বিবেচনা করুন, আপনার মডেলের গতির পূর্বাভাস হিসেবে নয়।