الأدوات
الأدلة

مرجع حوسبة الذكاء الاصطناعي

المراجع

إنتاجية مسرّعات الذكاء الاصطناعي (FLOPS/TOPS)، وصيغ الدقة، وتعريفات وحدات الحوسبة.

100% من جهة العميل بدون خادم خلفي

وحدات الحوسبة

صيغ الدقة

أنواع المسرّعات

العتاد

الاسم المصنّع البنية الذاكرة عرض النطاق FP16/BF16 (TF) FP8 (TF) INT8 (TOPS)

الأرقام هي ذروة نظرية (كثيفة) من أوراق بيانات المصنّع. الإنتاجية الواقعية المستدامة أقل وتختلف بين التدريب والاستدلال. FLOPS وTOPS تقيس عمليات مختلفة ولا يمكن مقارنتها مباشرة.

في هذه الصفحة

ما مرجع عتاد حوسبة الذكاء الاصطناعي؟#

حين تقرأ أنّ GPU يُقدِّم «1979 TFLOPS» أو أنّ شريحة بها «192 GB من الذاكرة»، فهذه الأرقام لا تعني شيئًا إلّا حين تعرف القواعد وراءها: أيّ دقّة عدديّة قِيسَت عندها، هل تشمل التجزئة البنيويّة (sparsity)، هل هي إنتاجية النقطة العائمة (TFLOPS) أم إنتاجية الأعداد الصحيحة (TOPS)، وما النطاق التردديّ الذي تُوفِّره الذاكرة فعلًا. ينشر البائعون الأرقام الرئيسيّة في أكثر إعداداتهم تملّقًا؛ بلا مرجع يذكر الشروط، لا يمكن مقارنة شريحتين بصدق.

هذه الصفحة ذلك المرجع. تجمع أربعة أشياء يحتاجها مهندس تعلّم آليّ أو مشري البنية التحتيّة فعلًا، جنبًا إلى جنب: مسرد وحدات الحوسبة (ماذا تعني FLOPS وTFLOPS وTOPS وMAC فعلًا)، وصيغ الدقّة العدديّة (من FP64 إلى INT4، بترتيب الإنتاجية النموذجيّ)، وأنواع المسرِّعات (CPU، GPU، TPU، NPU، LPU، MAU)، وجدول عتاد لرقاقات محدَّدة بسعة ذاكرتها، ونطاقها التردديّ، وذروة الإنتاجية الكثيفة عند FP16 وFP8 وINT8 — كلّ رقم مُتحقَّق against صحيفة بيانات البائع، مع التنبيه المحدَّد عندما يمكن أن يُضلِّل رقم.

كيف تستخدمها#

  1. ابحث عبر كلّ شيء. صندوق البحث المفرد في الأعلى يُرشِّح كلّ الأقسام الأربعة دفعة واحدة بالاسم أو البائع أو عقدة العملية أو المواصفات — كتابة H100 أو NVIDIA أو 192gb أو 4.8tb/s تُضيِّق جدول العتاد.
  2. اقرأ الأقسام الأربعة.
    • وحدات الحوسبة — الرموز ببادئات SI (من FLOP إلى EFLOPS، بالإضافة إلى TOPS وMAC) مع مرفوعاتها على أساس 10، كي تتمكّن من التحويل بينها.
    • صيغ الدقّة — FP64، FP32، TF32، FP16، BF16، FP8، INT8، INT4، كلّ بعرض بتّاته وحالة الاستخدام النموذجيّة، مُرتَّبة تقريبًا بإنتاجية متصاعدة على نواة tensor حديثة.
    • أنواع المسرِّعات — التمييز في سطر واحد بين CPU وGPU وTPU وNPU وLPU وMAU.
    • جدول العتاد — الاسم، البائع، العملية، الذاكرة (GB)، النطاق التردديّ للذاكرة (TB/s)، وإنتاجية FP16 / FP8 / INT8 الكثيفة، مع تنبيه لكلّ شريحة.
  3. ثق بالفراغات. حيث الخانة فارغة لا صفر، تعذّر التحقق من الرقم كذروة كثيفة — تُفسِّر الملاحظة السبب (MI300X من AMD تنشر قمم متفرّقة، فالكثيف نحو النصف). من الأصدق تركها فارغة من طباعة رقم بشرط خفيّ.

أبرز المزايا#

  • قمم كثيفة فقط، مع استدعاء التجزئة. أرقام NVIDIA كثيفة (بلا تجزئة بنيويّة 2:4)؛ تُذكِّرك الملاحظة أنّ أرقامها التسويقيّة الرئيسيّة تتضاعف غالبًا عند تفعيل التجزئة. لا تضخّم صامتة «مع تجزئة».
  • TFLOPS وTOPS مفصولان. يُصرِّح المسرد بوضوح أنّ TOPS (عائلة OPS) غير قابل للمقارنة مباشرةً مع TFLOPS (عائلة FLOPS) — التباس يستغلّه البائعون بسعادة.
  • كلّ الدققات الأربع بترتيب الإنتاجية. يُرى بنظرة أنّ FP8 تُضاعِف FP16 تقريبًا، وINT8 يُضاعف BF16 تقريبًا، على بنيان معيَّن — السبب الاقتصاديّ لوجود التكميم.
  • الذاكرة والنطاق التردديّ، لا الحوسبة فقط. لاستدلال نماذج اللغة الكبيرة، سعة الذاكرة والنطاق التردديّ تهمّان غالبًا أكثر من ذروة FLOPS، فهما عمودان من الدرجة الأولى.
  • مصادر مذكورة بالاسم، لا برابط. كلّ رقم يُسمّي صحيفة البيانات أو صفحة المنتج التي جاء منها، بلا URL خارجيّ، كي تتحقّق ضدّ توثيق البائع نفسه.

مثال عملي#

قارن خط NVIDIA عبر ثلاثة أجيال باستخدام جدول العتاد. ابحث NVIDIA فتحصل على صفوف A100 وH100 وH200 معًا:

الرقاقةالذاكرةالنطاق التردديّFP16 كثيفFP8 كثيفINT8 كثيف
A100 80GB SXM80 GB2.0 TB/s312 TFLOPS624 TOPS
H100 SXM580 GB3.35 TB/s989 TFLOPS1979 TFLOPS1979 TOPS
H200 SXM141 GB4.8 TB/s989 TFLOPS1979 TFLOPS1979 TOPS

أمران يقفزان. أولًا، قفزة H100 إلى H200 لم تُضِف أيّ حوسبة — كلاهما يتشارك قالب الحوسبة GH100؛ H200 تحديث ذاكرة إلى HBM3e، يُضاعف السعة تقريبًا (80 ← 141 GB) والنطاق التردديّ (3.35 ← 4.8 TB/s). لحمل استدلال LLM مقيَّد بالذاكرة، فهذا فوز واقعيّ أكبر من FLOPS إضافيّ. ثانيًا، A100 ليس لديه عمود FP8 — FP8 ميزة جيل Hopper، فالرقائق ما قبل Hopper ببساطة ليست لديها.

ثمّ اسحب صفوف AMD وGoogle. تُظهر MI300X أكبر ذاكرة (192 GB) ونطاق تردديّ (5.3 TB/s) بين كلّ الرقائق المُعدَّدة، لكنّ خانات FP16/FP8/INT8 فارغة عمدًا، مع ملاحظة تُفسِّح أنّ AMD تنشر قممًا بتجزئة بنيويّة (1307 FP16 متفرّق، 2614 INT8 متفرّق) والكثيف نحو النصف — طباعة الرقم المتفرّق بجوار الكثيف من NVIDIA ستكون مقارنة مُضلِّلة. تُظهر صفوف TPU اتفاقيّة مختلفة مجدَّدًا: تُعرِض TPU v4 تساوي BF16 لـ INT8 عند 275 لكلّ شريحة، بينما v5e المُحسَّن للتكلفة يُضاعف INT8 إلى 393 مقابل 197 BF16.

الأسئلة الشائعة#

TFLOPS مقابل TOPS — هل هما الشيء نفسه؟#

لا، والخلط بينهما أكثر فخاخ صحائف المواصفات. يقيس TFLOPS عمليّات النقطة العائمة في الثانية (عائلة FLOPS، بادئات على أساس 10: MFLOPS، GFLOPS، TFLOPS، PFLOPS). يقيس TOPS عمليّات الأعداد الصحيحة أو العمليّات العامّة في الثانية (عائلة OPS) وهو ما تراه عادةً مُقتبَسًا لاستدلال INT8 المُكمَّم. لأنّ العمليّة الكامنة تختلف، رقم TOPS لشريحة غير قابل للمقارنة مباشرةً برقم TFLOPS لها — و MAC (عملية ضرب-جمع واحدة) يُحسَب تقليديًّا كـ FLOP اثنين، وهو جزء من سبب أنّ أرقام TOPS للبائعين تبدو أحيانًا كأنّها تُعدّ مرّتين.

لماذا خانات حوسبة MI300X فارغة؟#

لأنّ AMD تنشر إنتاجيتها الذروة مع تفعيل التجزئة البنيويّة (مثلًا، 1307 FP16 TFLOPS متفرّق)، بينما يُعرِض هذا الجدول القمم الكثيفة لإبقاء كلّ شريحة قابلة للمقارنة. الكثيف لـ MI300X نحو نصف الرقم المتفرّق، لكنّ رقمًا كثيفًا نظيفًا مُتحقَّقًا منه غير متوفّر بثبات، فتُترَك الخانة فارغة بدل طباعة رقم بشرط «متفرّق» خفيّ. الذاكرة والنطاق التردديّ — 192 GB و5.3 TB/s — مُتحقَّق منها ومُظهرَة.

ما الفرق بين FP16 وBF16؟#

كلاهما 16 بت، لكنّهما ينفقان بتاتيهما بشكل مختلف. FP16 دقّة أكبر لكنّ مدى عدديّ ضيّق؛ يُقايض BF16 الدقّة مقابل المدى نفسه كـ FP32. ذلك المدى يهمّ للتدريب، حيث يمكن أن تتغيّر التدرّجات بشدّة في المقدار، ولهذا صار BF16 صيغة التدريب الافتراضيّة على نوى tensor الحديثة مع أنّه وFP16 يشغلان عرض البتّات نفسه. قسم صيغ الدقّة يُعدِّد كليهما مع استخدامهما النموذجيّ.

ماذا يعني «ذروة» — هل ستصل نموذجي لهذه الأرقام؟#

تقريبًا أبدًا. هذه قمم نظريّة — الإنتاجية التي يمكن للشريحة أن تُستمرّ بها لو استُغلَّت كلّ دورة بكمال مع توقّفات ذاكرة صفر، وهو ما لا تحقّقه أحمال العمل الحقيقية أبدًا. الإنتاجية المُستدامة دائمًا أقلّ وتعتمد على النواة، ومعماريّة النموذج، وحجم الدفعة، وما إذا كان الحمل مقيَّدًا بالذاكرة أو الحوسبة. عامل الذروة كحدّ أعلى لمقارنة المعماريّات، لا كتنبّؤ بسرعة نموذجك.