اختيار كرت شاشة لتشغيل الذكاء الاصطناعي يختلف عن اختيار بطاقة للألعاب. عدد الإطارات في الثانية أو قوة البطاقة النظرية بالتيرافلوب لا يخبرانك وحدهما بحجم النموذج اللغوي الذي تستطيع تشغيله.
في معظم حالات تشغيل النماذج اللغوية الكبيرة محليًا، تأتي سعة ذاكرة الفيديو VRAM في المرتبة الأولى، ثم سرعة نقل البيانات داخل الذاكرة، وبعد ذلك قوة المعالجة ودعم البرامج المستخدمة.
الإجابة المباشرة هي أن بطاقة RTX 5060 Ti بسعة 16 جيجابايت مناسبة للنماذج الصغيرة والمتوسطة، بينما لا تزال RTX 3090 بسعة 24 جيجابايت واحدة من أفضل الصفقات في سوق المستعمل. أما RTX 5090 بسعة 32 جيجابايت فهي أسرع بطاقة استهلاكية من NVIDIA، لكنها لا تشغل عادة نموذجًا من فئة 70B بتكميم 4-bit بالكامل داخل ذاكرة بطاقة واحدة.
من يحتاج إلى تشغيل نموذج 70B براحة على بطاقة واحدة سيحتاج غالبًا إلى بطاقة بسعة 48 جيجابايت على الأقل، والأفضل 80 أو 96 جيجابايت عندما يكون السياق طويلًا أو يوجد أكثر من مستخدم.
ما الذي يجعل كرت الشاشة مناسبًا للذكاء الاصطناعي؟
توجد أربعة أسئلة ينبغي الإجابة عنها قبل النظر إلى اسم البطاقة أو جيلها:
- ما حجم النموذج الذي تريد تشغيله؟
- ما درجة التكميم التي ستستخدمها؟
- ما طول السياق وعدد المستخدمين المتزامنين؟
- ما البرامج والمكتبات التي تعتمد عليها؟
قد تكون بطاقة أحدث وأسرع في الألعاب غير قادرة على تشغيل نموذج معين، بينما تنجح بطاقة أقدم لأنها تحتوي على ذاكرة أكبر.
1. سعة VRAM
يجب تحميل أوزان النموذج في الذاكرة حتى تعمل عمليات الاستدلال على البطاقة. عندما لا تكفي VRAM، يلجأ البرنامج إلى تحميل بعض الطبقات في ذاكرة النظام أو تنفيذ جزء من الحسابات على المعالج المركزي.
هذا الأسلوب يسمح بتشغيل النموذج تقنيًا، لكنه قد يخفض السرعة بشدة، خصوصًا إذا كان حجم البيانات المتبادلة بين البطاقة والذاكرة الرئيسية كبيرًا.
لذلك لا يكفي أن تسأل: هل يمكن تشغيل النموذج؟ السؤال الأدق هو: هل يمكن تحميل النموذج والسياق وذاكرة التخزين المؤقت داخل VRAM مع هامش أمان؟
2. عرض نطاق الذاكرة
عرض نطاق الذاكرة أو Memory Bandwidth يقيس كمية البيانات التي تستطيع البطاقة قراءتها من ذاكرتها خلال الثانية.
تستفيد النماذج اللغوية من النطاق المرتفع، خصوصًا أثناء توليد الرموز واحدًا بعد الآخر. ولهذا تتفوق بطاقة ذات ذاكرة سريعة أحيانًا على بطاقة تمتلك قدرة حسابية نظرية أعلى، ما دام النموذج يناسب ذاكرة البطاقتين.
على سبيل المثال، تصل RTX 5090 رسميًا إلى نحو 1.792 تيرابايت في الثانية، بينما تصل RTX 5060 Ti إلى 448 جيجابايت في الثانية. الفارق لا يحدد حجم النموذج، لكنه يؤثر في سرعة تشغيله بعد تحميله.
3. قوة المعالجة وأنواع الدقة
تلعب أنوية Tensor ودعم FP16 وBF16 وFP8 وFP4 دورًا مهمًا في الاستدلال والتدريب، لكنها لا تعوض نقص الذاكرة.
كما أن وجود دعم FP4 في بنية البطاقة لا يعني أن جميع البرامج والنماذج ستستخدمه تلقائيًا. يجب أن يدعم محرك الاستدلال ونوع النموذج والنواة البرمجية هذه الدقة حتى تتحقق الفائدة الفعلية.
4. النظام البرمجي
تتمتع NVIDIA بأوسع توافق بفضل CUDA ودعمها المباشر في PyTorch وTransformers وvLLM وTensorRT-LLM وUnsloth وعدد كبير من أدوات الذكاء الاصطناعي.
تقدم AMD بديلًا أكثر نضجًا مما كان عليه قبل سنوات عبر ROCm، مع دعم رسمي لبطاقات مثل RX 7900 XTX وRadeon AI PRO R9700. كما يدعم PyTorch بطاقات Intel Arc من خلال XPU، لكن توافق الأدوات والأداء ما زالا يختلفان من برنامج إلى آخر.

كيف غيّر التكميم متطلبات الذاكرة؟
التكميم أو Quantization هو تخفيض دقة تمثيل أوزان النموذج من 16-bit إلى 8-bit أو 4-bit، وأحيانًا إلى درجات أقل.
نظريًا، يحتاج نموذج يحتوي على 70 مليار معامل إلى قرابة 140 جيجابايت لتخزين أوزانه بصيغة FP16، لأن كل معامل يستهلك بايتين تقريبًا. عند استخدام 8-bit ينخفض حجم الأوزان إلى نحو 70 جيجابايت، بينما يقترب الحجم النظري عند 4-bit من 35 جيجابايت.
لكن الحجم الواقعي يكون أعلى من العملية الحسابية المباشرة، بسبب بيانات التكميم الإضافية، وبنية الملف، والطبقات غير المكممة، وذاكرة التشغيل، وKV Cache.
تدعم مكتبة Transformers طرقًا مثل AWQ وGPTQ وbitsandbytes، بينما ينتشر تنسيق GGUF مع llama.cpp وOllama لتشغيل النماذج محليًا بسهولة.
هل يحافظ 4-bit على 95% من جودة النموذج؟
لا توجد نسبة ثابتة يمكن تطبيقها على جميع النماذج.
قد يكون الفرق محدودًا في المحادثات العامة أو التلخيص، لكنه يصبح أوضح في البرمجة والاستدلال الرياضي واستخدام الأدوات واللغات الأقل تمثيلًا. كما تختلف النتيجة حسب طريقة التكميم والنموذج الأساسي والاختبار المستخدم.
لهذا يجب التعامل مع عبارات مثل «4-bit يحتفظ بـ95% من الجودة» بوصفها تبسيطًا تسويقيًا، وليس قاعدة علمية عامة.
الطريقة العملية هي تحميل نسخة Q4 جيدة، مثل Q4_K_M عند توفرها، ثم اختبارها على مهامك الفعلية قبل شراء العتاد أو اعتماد النموذج في العمل.
كم تحتاج من VRAM لكل حجم نموذج؟
الأرقام التالية تقديرية وتشمل أوزان النموذج أكثر مما تشمل جميع احتياجات التشغيل. يجب إضافة هامش للسياق وKV Cache والبرامج وعدد المستخدمين.
| حجم النموذج | FP16 تقريبي | 8-bit تقريبي | 4-bit تقريبي | VRAM عملية مقترحة |
|---|---|---|---|---|
| 7B–8B | 14–16 GB | 8–10 GB | 5–6 GB | 8–12 GB |
| 13B–14B | 26–30 GB | 15–18 GB | 9–11 GB | 12–16 GB |
| 27B–32B | 54–64 GB | 30–38 GB | 18–22 GB | 24–32 GB |
| 70B–72B | 140–144 GB | 75–85 GB | 40–48 GB | 48–80 GB |
| 100B–120B | 200–240 GB | 110–135 GB | 60–75 GB | 80–128 GB |
| 400B تقريبًا | أكثر من 800 GB | أكثر من 400 GB | 220–260 GB | 256 GB فأكثر |
تزيد ذاكرة KV Cache مع طول المحادثة وعدد الطلبات المتزامنة، وقد تتحول إلى واحد من أكبر مستهلكي الذاكرة في خوادم النماذج طويلة السياق. تؤكد وثائق Hugging Face أن هذه الذاكرة قد تشغل جزءًا كبيرًا من الذاكرة المتاحة وتصبح عنق زجاجة، خصوصًا عند زيادة طول السياق.
ملاحظة حول نماذج Mixture of Experts
قد يعلن نموذج من نوع MoE أن عدد المعاملات النشطة في كل رمز أقل بكثير من إجمالي معاملاته. هذا يخفض العمليات الحسابية في أثناء التوليد، لكنه لا يعني أن أوزان الخبراء غير النشطين تختفي من الذاكرة.
يجب عادة تحميل جميع أوزان النموذج أو توزيعها بين البطاقات، ولذلك يجب حساب الذاكرة اعتمادًا على إجمالي الأوزان، لا على عدد المعاملات النشطة وحده.
أفضل كروت الشاشة لتشغيل أنظمة الذكاء الاصطناعي في 2026
لا يوجد ترتيب واحد يناسب جميع المستخدمين. الترتيب التالي مبني على الاستخدام والسعة والتوافق البرمجي والقيمة، وليس على سرعة الألعاب.
1. Intel Arc B580

الذاكرة: 12 جيجابايت GDDR6
عرض النطاق: 456 جيجابايت/ثانية
السعر الرسمي عند الإطلاق: 249 دولارًا
الاستخدام المناسب: نماذج 7B و8B، وبعض نماذج 14B بتكميم 4-bit
توفر Arc B580 ذاكرة 12 جيجابايت بسعر منخفض، ما يجعلها مناسبة للتجربة وتشغيل المساعدات المحلية الخفيفة.
تحسن دعم Intel في PyTorch، وأصبحت سلسلة Arc B مدعومة ضمن مسار XPU. مع ذلك، قد تواجه اختلافات في التوافق بين SYCL وVulkan والبرامج التي صُممت أصلًا حول CUDA. لذلك تناسب البطاقة المستخدم الذي يقبل بعض الإعداد والتجربة أكثر من الشخص الباحث عن تجربة جاهزة بالكامل.
2. RTX 5060 Ti 16GB: أفضل بداية داخل منظومة NVIDIA
الذاكرة: 16 جيجابايت GDDR7
عرض النطاق: 448 جيجابايت/ثانية
السعر الرسمي: 429 دولارًا لنسخة 16 جيجابايت
الاستخدام المناسب: نماذج 7B و14B، وبعض النماذج الأكبر بتكميم قوي أو تحميل جزئي
توفر البطاقة مدخلًا حديثًا إلى CUDA مع 16 جيجابايت من الذاكرة ودعم بنية Blackwell.
هي مناسبة لمساعد برمجي محلي، أو نظام سؤال وجواب على مستندات، أو نموذج محادثة شخصي. لكنها ليست الخيار الأفضل لمن يخطط للانتقال قريبًا إلى نماذج 27B أو 32B، لأن سعة 16 جيجابايت ستصبح القيد الأساسي.
3. RTX 3090 24GB

الذاكرة: 24 جيجابايت GDDR6X
عرض النطاق: نحو 936 جيجابايت/ثانية
السوق: مستعملة، ولا يوجد سعر ثابت
الاستخدام المناسب: نماذج 27B و32B بتكميم 4-bit
رغم إطلاقها في 2020، ما تزال RTX 3090 من أكثر البطاقات جاذبية لتشغيل النماذج محليًا. تجمع بين 24 جيجابايت من الذاكرة، ونطاق ذاكرة مرتفع، ودعم CUDA، وإمكانية استخدام NVLink بين بطاقتين من الجيل نفسه.
ينبغي فحص البطاقة المستعملة بعناية، خصوصًا درجات حرارة الذاكرة وحالة المراوح ومصدر استخدامها السابق. كما تستهلك طاقة مرتفعة مقارنة بالبطاقات الأحدث.
للمطور الفردي الذي يريد تشغيل نماذج 32B دون دفع سعر بطاقة احترافية، تبقى RTX 3090 مرشحًا قويًا.
4. Radeon RX 7900 XTX

الذاكرة: 24 جيجابايت GDDR6
عرض النطاق: حتى 960 جيجابايت/ثانية
سعر الإطلاق الرسمي: 999 دولارًا
الاستخدام المناسب: نماذج تصل إلى فئة 32B بتكميم 4-bit
تقدم RX 7900 XTX سعة مماثلة لـRTX 3090 مع نطاق ذاكرة مرتفع. كما أصبح دعمها رسميًا ضمن إصدارات ROCm الحديثة على أنظمة Linux وWindows المدعومة.
تعمل البطاقة جيدًا مع أدوات مثل llama.cpp وOllama وPyTorch عبر ROCm، لكنها لا تزال تتطلب التأكد من دعم البرنامج المطلوب قبل الشراء. بعض الأدوات والنماذج المحسنة لـCUDA قد تحتاج إلى تعديلات أو لا تقدم الأداء نفسه على AMD.
5. Intel Arc Pro B60 24GB: سعة كبيرة بسعر فئة محطات العمل
الذاكرة: 24 جيجابايت GDDR6
عرض النطاق: 456 جيجابايت/ثانية
الاستخدام المناسب: نماذج 27B و32B، ومحطات العمل متعددة البطاقات
تمنح Arc Pro B60 مستخدمي Intel ضعف ذاكرة B580 تقريبًا، مع استهلاك طاقة وتصميمات موجهة لمحطات العمل.
الميزة الأساسية هي السعة، بينما يبقى عرض النطاق أقل من RTX 3090 وRX 7900 XTX. كما أن اختيارها يرتبط بمدى توافق الأدوات المستخدمة مع XPU وSYCL.
تسمح Intel ببناء أنظمة تحتوي على عدة بطاقات B60 والوصول إلى سعات مجمعة مرتفعة، لكن ذلك يحتاج إلى نظام مصمم للتبريد وخطوط PCIe وتوزيع النموذج.
6. Radeon AI PRO R9700: أفضل قيمة جديدة بسعة 32 جيجابايت
الذاكرة: 32 جيجابايت GDDR6
عرض النطاق: 640 جيجابايت/ثانية
السعر الرسمي المرجعي: 1,299 دولارًا
الاستخدام المناسب: نماذج 32B مع هامش جيد، والتطوير والاستدلال عبر ROCm
تمثل R9700 محاولة AMD المباشرة لاستهداف سوق الذكاء الاصطناعي المحلي ومحطات العمل. توفر 32 جيجابايت مع ECC على Linux، وتصميمًا مناسبًا للأنظمة متعددة البطاقات، ودعمًا رسميًا لمنصة ROCm.
هي أبطأ في عرض النطاق من RTX 5090، لكنها أقل تكلفة بكثير وفق الأسعار الرسمية، وتمنح السعة نفسها. لهذا قد تكون خيارًا منطقيًا للمستخدم الذي تتركز أعماله على Linux وPyTorch وROCm ولا يعتمد على أدوات CUDA الحصرية.
7. RTX 5090 32GB

الذاكرة: 32 جيجابايت GDDR7
عرض النطاق: 1.792 تيرابايت/ثانية
السعر الرسمي: يبدأ من 1,999 دولارًا
الاستخدام المناسب: أسرع تجربة لنماذج 7B حتى 32B، والتوليد المرئي، والتطبيقات المعتمدة على CUDA
تجمع RTX 5090 بين 32 جيجابايت من الذاكرة ونطاق مرتفع جدًا ودعم بنية Blackwell وFP4. وهي الاختيار الأسرع للمستخدم الذي يريد بطاقة استهلاكية واحدة ويعتمد على CUDA.
لكن يجب الانتباه إلى نقطتين:
أولًا، استهلاك الطاقة الرسمي للبطاقة يصل إلى 575 واط، وتوصي NVIDIA بمصدر طاقة قوي للنظام. ثانيًا، لا تحتوي البطاقة على NVLink، لذلك يعتمد الاتصال بين بطاقتين على PCIe.
هل تشغل RTX 5090 نموذج 70B؟
لا تكفي سعة 32 جيجابايت عادة لتحميل نموذج 70B كامل بتكميم Q4 الشائع، لأن أوزانه الواقعية تحتاج غالبًا إلى 40–48 جيجابايت قبل حساب KV Cache.
يمكن تشغيل النموذج بإحدى الطرق التالية:
- استخدام تكميم أقل من 4-bit، مثل بعض صيغ 3-bit أو 2-bit.
- تحميل جزء من الطبقات في ذاكرة النظام.
- توزيع النموذج بين بطاقتين.
- اختيار نموذج أصغر من فئة 32B أو نموذج MoE أكثر كفاءة حسابيًا.
لذلك فإن القول إن RTX 5090 تشغل نموذج 70B بتكميم Q4 بالكامل على بطاقة واحدة يحتاج إلى تحديد نسخة النموذج وصيغة التكميم، ولا يصح كقاعدة عامة.
ماذا عن السعر في يوليو 2026؟
السعر الرسمي يبدأ من 1,999 دولارًا، لكن تقارير السوق في منتصف يوليو 2026 رصدت أسعارًا تقترب من 4,000 دولار لبعض النسخ بسبب نقص الذاكرة وارتفاع الطلب. لذلك يجب الفصل بين MSRP والسعر المتاح فعليًا لدى المتاجر.
8. RTX PRO 6000 Blackwell 96GB

الذاكرة: 96 جيجابايت GDDR7 مع ECC
عرض النطاق: نحو 1.8 تيرابايت/ثانية
الاستخدام المناسب: نماذج 70B، السياقات الطويلة، تعدد المستخدمين، والتطوير الاحترافي
توفر RTX PRO 6000 ثلاثة أضعاف ذاكرة RTX 5090 مع نطاق قريب منها. ويمكنها تشغيل نموذج 70B بتكميم 4-bit أو 8-bit مع هامش أكبر للسياق، بحسب النسخة ومحرك الاستدلال.
كما أنها أبسط من إعداد بطاقتين استهلاكيتين، لأن النموذج يبقى داخل ذاكرة بطاقة واحدة ولا يحتاج إلى نقل متكرر للبيانات بين البطاقات.
المشكلة الأساسية هي السعر، إذ تجاوز تسعيرها الاحترافي 10 آلاف دولار خلال 2026، ما يجعلها مناسبة للشركات ومحطات العمل أكثر من المستخدم المنزلي. وتؤكد NVIDIA أن البطاقة تحتوي على 96 جيجابايت وموجهة للاستدلال وضبط النماذج محليًا.
9. A100 وH100 وH200: بطاقات الخوادم والإنتاج
NVIDIA A100 80GB
توفر نسخة A100 سعة 80 جيجابايت ونطاقًا يتجاوز 2 تيرابايت/ثانية، مع NVLink ودعم قوي للتدريب والاستدلال.
لا تزال مناسبة للخوادم المستعملة أو المستضافة، خصوصًا عندما تكون الذاكرة أهم من أحدث جيل حسابي. لكنها لا تحتوي على مزايا Hopper وBlackwell الحديثة.
NVIDIA H100 80GB
توفر H100 سعة 80 جيجابايت مع نطاق يصل إلى نحو 3 تيرابايت/ثانية في نسخ HBM3، وتتفوق في الأحمال المتزامنة وFP8 والتدريب.
قيمتها الحقيقية تظهر عند خدمة عدد كبير من المستخدمين أو تنفيذ عمليات تدريب واستدلال مكثفة، لا عند محادثة مستخدم واحد على جهاز مكتبي.
NVIDIA H200 141GB
تحتوي H200 على 141 جيجابايت من HBM3e ونطاق 4.8 تيرابايت/ثانية. تمنح هذه السعة هامشًا كبيرًا لنموذج 70B عند FP8 أو 8-bit، وللسياقات الطويلة وعدد أكبر من الطلبات.
أما تحميل نموذج 70B كامل بصيغة FP16 على بطاقة واحدة، فيبقى ضيقًا جدًا من الناحية العملية، لأن الأوزان وحدها تقترب من 140 جيجابايت قبل إضافة ذاكرة التشغيل وKV Cache.
10. NVIDIA B200

تحتوي B200 رسميًا على ذاكرة تصل إلى 180 جيجابايت HBM3e، وليس 192 جيجابايت كما تذكر بعض الجداول المنشورة، مع نطاق يصل إلى قرابة 8 تيرابايت/ثانية لكل بطاقة عند استنتاج مواصفات نظام DGX B200.
تستهدف البطاقة تدريب وتشغيل النماذج الكبيرة داخل خوادم HGX وDGX، ولا تباع عادة كخيار مكتبي تقليدي بسعر تجزئة ثابت.
يمكنها استضافة أوزان نموذج 70B بصيغة FP16 مع هامش أكبر من H200، إلى جانب قدرات FP4 وNVLink من الجيل الخامس.
بدائل ليست بطاقات رسوميات منفصلة
Mac Studio بمعالج M3 Ultra
تستخدم أجهزة Apple ذاكرة موحدة يشترك فيها المعالج المركزي ومعالج الرسوميات. ويمكن تجهيز Mac Studio بذاكرة تصل إلى 512 جيجابايت وبنطاق يبلغ 819 جيجابايت/ثانية.
هذا يسمح بتشغيل نماذج لا تناسب البطاقات الاستهلاكية التقليدية، مع استهلاك طاقة وضوضاء أقل من محطة عمل متعددة البطاقات.
لكن الذاكرة ليست كلها متاحة للنموذج، كما أن الأداء والتوافق يختلفان عن CUDA. ويظل Mac مناسبًا للمستخدم الذي يفضل السعة والهدوء وسهولة الجهاز أكثر من الوصول إلى أعلى سرعة أو أوسع توافق برمجي.
NVIDIA DGX Spark
يقدم DGX Spark ذاكرة موحدة بسعة 128 جيجابايت، ونطاقًا يبلغ 273 جيجابايت/ثانية، ومنظومة NVIDIA البرمجية داخل جهاز مكتبي صغير.
تقول NVIDIA إنه يستطيع اختبار وتشغيل نماذج تصل إلى 200 مليار معامل، وضبط نماذج تصل إلى 70 مليار معامل، لكن حجم النموذج المدعوم لا يساوي بالضرورة سرعة عالية في توليد الرموز. نطاق الذاكرة أقل بكثير من RTX 5090 وMac Studio M3 Ultra.
بلغ السعر المعروض في متجر NVIDIA الأمريكي 4,699 دولارًا خلال يوليو 2026. وهو مناسب للمطور الذي يحتاج إلى سعة كبيرة وبيئة NVIDIA متكاملة، مع قبول سرعة ذاكرة أقل من البطاقات المنفصلة عالية الأداء.
مواصفات ومميزات حاسوب NVIDIA DGX Spark الخارق للذكاء الاصطناعي
مقارنة مختصرة بين أفضل الخيارات
| الخيار | الذاكرة | عرض النطاق | أفضل استخدام | الملاحظة الأساسية |
|---|---|---|---|---|
| Intel Arc B580 | 12 GB | 456 GB/s | تجربة نماذج 7B و8B | رخيص، لكن التوافق يحتاج فحصًا |
| RTX 5060 Ti | 16 GB | 448 GB/s | نماذج 7B و14B | أفضل مدخل حديث إلى CUDA |
| RTX 3090 | 24 GB | 936 GB/s | نماذج 27B و32B | أفضل قيمة مستعملة غالبًا |
| RX 7900 XTX | 24 GB | 960 GB/s | نماذج 32B عبر ROCm | قيمة جيدة لمستخدمي AMD |
| Arc Pro B60 | 24 GB | 456 GB/s | محطات عمل قابلة للتوسع | سعة جيدة ونطاق متوسط |
| Radeon AI PRO R9700 | 32 GB | 640 GB/s | تطوير محلي عبر ROCm | أفضل بديل جديد بسعة 32 GB |
| RTX 5090 | 32 GB | 1.792 TB/s | أسرع استدلال استهلاكي | لا تكفي عادة لـ70B Q4 منفردة |
| RTX PRO 6000 | 96 GB | 1.8 TB/s | 70B والسياق الطويل | سعة ممتازة وسعر مرتفع |
| A100 80GB | 80 GB | +2 TB/s | خوادم وتدريب واستدلال | قيمة جيدة في سوق الخوادم |
| H200 | 141 GB | 4.8 TB/s | تشغيل إنتاجي طويل السياق | ذاكرة ضخمة وتكلفة مؤسسية |
| B200 | 180 GB | نحو 8 TB/s | مراكز البيانات والنماذج الكبرى | أعلى فئة مؤسسية |
هل يمكن دمج ذاكرة بطاقتين؟
لا تتحول بطاقتان بسعة 32 جيجابايت تلقائيًا إلى بطاقة واحدة بسعة 64 جيجابايت.
يجب أن يدعم البرنامج تقسيم النموذج باستخدام تقنيات مثل:
- Tensor Parallelism.
- Pipeline Parallelism.
- Model Sharding.
- تقسيم الطبقات في llama.cpp.
- Distributed Inference في vLLM.
يدعم vLLM التوازي على مستوى Tensor وPipeline، لكن الأداء يعتمد على الاتصال بين البطاقات وطوبولوجيا اللوحة الأم والمحرك المستخدم.
NVLink مقابل PCIe
تدعم RTX 3090 اتصال NVLink، بينما لا توفر RTX 4090 وRTX 5090 هذا الاتصال. تؤكد مواصفات RTX 5090 الرسمية أن NVLink غير مدعوم.
يمكن تشغيل بطاقتين RTX 5090 عبر PCIe وتقسيم نموذج 70B بينهما، لكن النتيجة لا تعني تضاعف الأداء. تعتمد الكفاءة على كمية تبادل البيانات وخطوط PCIe والمعالج واللوحة الأم.
كما تستهلك بطاقتا RTX 5090 ما يصل إلى 1,150 واط للبطاقات وحدها وفق القدرة الرسمية، قبل حساب المعالج والذاكرة والأقراص والمراوح. هذا يجعل محطة العمل المنزلية مكلفة من حيث مصدر الطاقة والتبريد والضوضاء.
هل تشتري البطاقة أم تستأجر GPU سحابيًا؟
لا توجد نسبة استخدام واحدة تحدد القرار لجميع الحالات.
يمكن حساب التكلفة التقريبية بهذه المعادلة:
تكلفة الامتلاك = سعر الجهاز + الكهرباء + التبريد + الصيانة – قيمة إعادة البيع
تكلفة الاستئجار = سعر الساعة × عدد ساعات الاستخدام × مدة المشروع
الشراء منطقي غالبًا عندما:
- تستخدم النموذج يوميًا.
- تحتاج إلى خصوصية البيانات.
- تريد تشغيل مساعد أو خادم داخلي باستمرار.
- تستخدم النموذج لأشهر أو سنوات.
- تستطيع إدارة الحرارة واستهلاك الكهرباء.
الاستئجار أكثر منطقية عندما:
- تستخدم نموذج 70B أو أكبر لساعات قليلة شهريًا.
- تحتاج إلى H100 أو H200 أو B200 لفترة محدودة.
- تنفذ تدريبًا أو اختبارًا مؤقتًا.
- لا تريد شراء خادم أو التعامل مع الصيانة.
- يتغير حجم النموذج المطلوب بين مشروع وآخر.
ينبغي أيضًا حساب تكلفة بقية النظام. شراء RTX 5090 لا يعني أن التكلفة النهائية تساوي سعر البطاقة؛ فقد تحتاج إلى مصدر طاقة وصندوق ولوحة أم وتبريد وذاكرة نظام أقوى.
تصحيحات مهمة على المقارنات المنتشرة
32 جيجابايت لا تعني تشغيل 70B بتكميم Q4 كامل
الحجم الواقعي لنموذج 70B بتكميم 4-bit يتجاوز عادة 32 جيجابايت، لذلك تحتاج RTX 5090 إلى تكميم أقوى أو تحميل جزئي أو بطاقة ثانية.
B200 تحتوي رسميًا على 180 جيجابايت
تذكر بعض المقالات سعة 192 جيجابايت، لكن دليل NVIDIA الخاص ببنية Blackwell يحدد سعة B200 حتى 180 جيجابايت.
ذاكرة البطاقات لا تندمج تلقائيًا
الوصول إلى 64 جيجابايت باستخدام بطاقتين 32 جيجابايت يحتاج إلى تقسيم النموذج، وقد تفقد جزءًا من الأداء بسبب الاتصال بين البطاقات.
جودة 4-bit ليست نسبة ثابتة
قد تكون ممتازة في نموذج ومهمة، وتظهر خسارة واضحة في نموذج آخر. الاختبار العملي أهم من النسبة العامة.
الأسعار الرسمية لا تعكس دائمًا السوق
بدأت RTX 5090 رسميًا من 1,999 دولارًا، بينما وصلت بعض أسعار السوق في يوليو 2026 إلى ضعف ذلك تقريبًا. كما ارتفع تسعير RTX PRO 6000 بصورة كبيرة بسبب الطلب على الذاكرة.
أفضل اختيار حسب نوع المستخدم
للمبتدئ والتجربة
اختر Intel Arc B580 عند توفر البرامج المناسبة، أو RTX 5060 Ti 16GB للحصول على توافق أسهل مع CUDA.
لمساعد برمجي محلي قوي
RTX 3090 مستعملة أو RX 7900 XTX مناسبتان لتشغيل نماذج 27B و32B بتكميم 4-bit.
لمن يريد بطاقة جديدة بسعة 32 جيجابايت
Radeon AI PRO R9700 تقدم قيمة جيدة لمستخدمي ROCm، بينما RTX 5090 تقدم سرعة أعلى وتوافقًا أوسع مع أدوات CUDA.
لمن يريد تشغيل نموذج 70B في المنزل
يمكن استخدام بطاقتين بسعة إجمالية مناسبة مع تقسيم النموذج، لكن يجب حساب الطاقة والتبريد وخطوط PCIe. البديل الأبسط هو بطاقة احترافية بسعة 80 أو 96 جيجابايت، إذا سمحت الميزانية.
لفريق صغير أو خادم داخلي
RTX PRO 6000 Blackwell أو A100 80GB توفران سعة مناسبة، مع اختلاف كبير في الجيل والسعر واستهلاك الطاقة.
للإنتاج المؤسسي
H100 وH200 وB200 خيارات خوادم، ويجب تقييمها على أساس عدد الطلبات المتزامنة وزمن الاستجابة وتكلفة كل مليون رمز، وليس سرعة محادثة واحدة.
زاوية ميتالسي
نرى أن سوق تشغيل الذكاء الاصطناعي محليًا انقسم إلى ثلاث فئات واضحة في 2026.
الفئة الأولى هي المستخدم الفردي، وهنا أصبحت سعة 24 جيجابايت نقطة التوازن الأهم. بطاقة مثل RTX 3090 قديمة في مقاييس الألعاب، لكنها ما تزال قوية في الذكاء الاصطناعي لأن الذاكرة تسمح بتشغيل نماذج 32B التي تقدم مستوى جيدًا في البرمجة والاستدلال.
الفئة الثانية هي المستخدم المحترف الذي يريد 32 جيجابايت. هنا لا تدور المنافسة حول السرعة وحدها، بل حول «ضريبة النظام البرمجي». تدفع أسعار NVIDIA جزءًا من قيمة CUDA والتوافق الواسع، بينما تحاول AMD تقديم ذاكرة أكبر مقابل سعر أقل من خلال R9700 وROCm.
الفئة الثالثة هي الفرق التي تحتاج إلى 70B وسياق طويل. هذه الفئة لا تستفيد كثيرًا من شراء بطاقة سريعة ذات ذاكرة غير كافية، لأن KV Cache وعدد المستخدمين يستهلكان الهامش سريعًا. لهذا تصبح بطاقة 80 أو 96 جيجابايت أكثر منطقية من بطاقتين استهلاكيتين في بعض البيئات، حتى لو بدا سعرها الأولي أعلى.
ما أغفلته كثير من التغطيات هو أن الاتجاه نحو الوكلاء الشخصيين وأنظمة RAG طويلة السياق سيرفع استهلاك الذاكرة حتى عندما يبقى حجم النموذج ثابتًا. النموذج الذي يعمل اليوم على بطاقة 24 جيجابايت في محادثة قصيرة قد يواجه حدود الذاكرة عند إضافة مستندات طويلة أو أدوات أو أكثر من مستخدم.
كما نعتقد أن المنافسة المقبلة لن تكون بين NVIDIA وAMD في قوة المعالجة فقط، بل بين ثلاثة نماذج للحوسبة المحلية:
- بطاقة منفصلة سريعة بذاكرة محدودة نسبيًا.
- محطة عمل بذاكرة موحدة كبيرة مثل Mac Studio وDGX Spark.
- خادم محلي أو مستضاف ببطاقات من فئة 80 جيجابايت فأكثر.
المستفيد الأكبر هو المطور الذي يحدد النموذج والبرنامج وطول السياق قبل شراء البطاقة. أما المتضرر فهو من يشتري اعتمادًا على رقم TOPS أو TFLOPS ثم يكتشف أن النموذج لا يناسب الذاكرة أو أن البرنامج لا يدعم البطاقة بصورة كاملة.
استنتاجنا هو أن أفضل استثمار للمستخدم الفردي ليس دائمًا أحدث بطاقة. بطاقة 24 جيجابايت بسعر مناسب قد تقدم قيمة أعلى من بطاقة أحدث بسعة 16 جيجابايت، بينما تتفوق بطاقة 32 جيجابايت الجديدة عندما تكون السرعة والتوافق البرمجي عاملين أساسيين. ابتداءً من فئة 70B، يجب الانتقال من التفكير في «كرت الشاشة» إلى التفكير في النظام كاملًا.
الخلاصة
أفضل كروت الشاشة لتشغيل أنظمة الذكاء الاصطناعي ليست البطاقات صاحبة أكبر أرقام تسويقية، بل البطاقات التي تحقق التوازن بين سعة الذاكرة وسرعتها ودعم البرامج والسعر.
للنماذج الصغيرة والمتوسطة، تكفي بطاقة بسعة 12 أو 16 جيجابايت. أما نماذج 27B و32B فتجعل 24 جيجابايت نقطة شراء أكثر أمانًا. وعند الانتقال إلى 70B، تصبح 48–96 جيجابايت الفئة العملية، بحسب التكميم والسياق وعدد المستخدمين.
RTX 3090 ما تزال صفقة قوية في المستعمل، وRTX 5090 هي أسرع بطاقة استهلاكية لمن يعتمد على CUDA، بينما تقدم Radeon AI PRO R9700 بديلًا بسعة 32 جيجابايت وسعر رسمي أقل. ولتشغيل 70B على بطاقة واحدة براحة، تتجه الخيارات نحو RTX PRO 6000 أو بطاقات مراكز البيانات.
ابدأ بالنموذج الذي تحتاجه، احسب ذاكرته بعد التكميم، أضف هامشًا للسياق، ثم اختر البطاقة. هذه الخطوات أكثر موثوقية من البدء باسم البطاقة ومحاولة تكييف العمل معها لاحقًا.
الأسئلة الشائعة
ما الحد الأدنى من VRAM لتشغيل نموذج ذكاء اصطناعي محليًا؟
يمكن تشغيل نماذج صغيرة من فئة 7B على 8 جيجابايت بعد التكميم، لكن 12 إلى 16 جيجابايت توفر تجربة أفضل وسياقًا أطول. نماذج 27B و32B تحتاج عادة إلى بطاقة 24 جيجابايت عند استخدام 4-bit.
هل تستطيع RTX 5090 تشغيل نموذج 70B؟
يمكنها تشغيل بعض نسخ 70B باستخدام تكميم أقل من 4-bit أو تحميل جزء من النموذج في ذاكرة النظام. أما نموذج 70B بتكميم Q4 الشائع فيحتاج عادة إلى أكثر من 32 جيجابايت، ولذلك لا يناسب ذاكرة RTX 5090 بالكامل على بطاقة واحدة.
هل ما تزال RTX 3090 مناسبة للذكاء الاصطناعي في 2026؟
نعم. سعة 24 جيجابايت وعرض النطاق المرتفع ودعم CUDA تجعلها مناسبة لنماذج تصل إلى فئة 32B بتكميم 4-bit. يجب التأكد من حالة البطاقة وحرارتها واستهلاكها للطاقة عند شرائها مستعملة.
هل NVIDIA أفضل من AMD لتشغيل النماذج اللغوية؟
NVIDIA أسهل من ناحية توافق البرامج بسبب CUDA. تقدم AMD قيمة جيدة في الذاكرة، وتحسن ROCm كثيرًا، لكنها تتطلب التأكد من دعم كل أداة ونموذج قبل الشراء.
هل يمكن استخدام Mac Studio بدل كرت شاشة NVIDIA؟
نعم، خصوصًا عندما تكون سعة الذاكرة أهم من السرعة القصوى. تستطيع أجهزة Mac Studio ذات الذاكرة الكبيرة تشغيل نماذج ضخمة، لكن الأداء والتوافق يختلفان عن CUDA، كما أن الذاكرة موحدة ومشتركة مع النظام.
المصادر:
- MillionMiner: “The Best GPUs for Running LLMs Locally in 2026: Ranked and Compared”
- NVIDIA: صفحة المواصفات الرسمية لبطاقة GeForce RTX 5090، بما يشمل ذاكرة 32GB GDDR7، ودعم NVLink، واستهلاك الطاقة.
- NVIDIA: إعلان عائلة RTX 5060، 15 أبريل 2025، بما يشمل سعر RTX 5060 Ti 16GB ومواصفاتها.
- NVIDIA: صفحات RTX 3090 وRTX 4090 الرسمية وأوراق Ampere وAda التقنية.
- NVIDIA: المواصفات الرسمية لبطاقة RTX PRO 6000 Blackwell Workstation Edition، بذاكرة 96GB GDDR7.
- NVIDIA: صفحات A100 وH100 وH200 الرسمية، وأوراق مواصفات الذاكرة وعرض النطاق.
- NVIDIA CUDA Documentation: دليل Blackwell Tuning Guide، موضحًا أن B200 تدعم ذاكرة تصل إلى 180GB.
- NVIDIA: مواصفات DGX B200، بما يشمل إجمالي الذاكرة وعرض النطاق في نظام من ثماني بطاقات.
- NVIDIA: مواصفات DGX Spark وصفحته الرسمية ومتجر NVIDIA، بما يشمل 128GB من الذاكرة الموحدة.
- AMD: المواصفات الرسمية لبطاقة Radeon RX 7900 XTX، بذاكرة 24GB ونطاق 960GB/s.
- AMD: المواصفات الرسمية لبطاقة Radeon AI PRO R9700 ومنصة Radeon AI PRO، بذاكرة 32GB ودعم ROCm.
- AMD ROCm: مصفوفات التوافق الرسمية لأنظمة Linux وWindows، بما يشمل RX 7900 XTX وبطاقات Radeon الحديثة.
- Intel: المواصفات الرسمية لبطاقات Arc B580 وArc Pro B60.
- PyTorch: دعم Intel GPU وArc B-Series ضمن PyTorch وXPU.
- Apple: المواصفات الرسمية لجهاز Mac Studio بمعالج M3 Ultra، بما يشمل نطاق الذاكرة 819GB/s وخيارات الذاكرة الموحدة.
- Hugging Face: وثائق Quantization وbitsandbytes وKV Cache وPagedAttention.
- vLLM: وثائق Parallelism and Scaling الخاصة بتقسيم النماذج وتشغيلها على أكثر من بطاقة.
- PC Gamer: متابعة أسعار كروت الشاشة في منتصف يوليو 2026، بما يشمل ارتفاع سعر RTX 5090 عن MSRP.
- Tom’s Hardware: تقرير يونيو 2026 حول ارتفاع تسعير RTX PRO 6000 Blackwell.

