
أفضل LLM محلي للبرمجة في أغسطس 2026، حسب VRAM: Qwen3-Coder 30B، gpt-oss-20b، Qwen 2.5 Coder 7B
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenجديدQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekجديدDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxجديدMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 2214 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
- tencentTencent: Hy32026-07-0642الذكاء59البرمجة
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232الذكاء42البرمجة
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226الذكاء39البرمجة
- anthropicAnthropic: Claude Sonnet 52026-06-3055الذكاء72البرمجة
- klingKling: Kling 3.0 Turbo2026-06-1757الذكاء52البرمجة57الرياضيات
أفضل نموذج LLM محلي للبرمجة في أغسطس 2026 يُحدَّد بواسطة VRAM لديك قبل أي شيء آخر. إذا كانت لديك بطاقة بسعة 24GB — مثل RTX 3090 أو 4090 — فقم بتشغيلQwen3-Coder-30B-A3B-Instruct: 30B معلمة إجمالية مع 3.3B فقط نشطة لكل رمز، ونافذة سياق تبلغ 262,144 رمزًا، وأفضل أرقام برمجة محلية شاملة يمكننا التحقق منها. على بطاقة 16GB يكون الخيار هوgpt-oss-20b، نموذج OpenAI من نوع Mixture-of-Experts برخصة Apache-2.0، والذي يعمل بالكامل على GPU بحجم ~14GB وبسرعة تبلغ حوالي 140 رمزًا في الثانية. على بطاقة 8GB يكون الخيار هوQwen2.5-Coder-7B، الحصان الموثوق بحجم ~4.7GB. بقية هذه الصفحة توضح الأسباب والأرقام المقاسة والمواقف المحددة التي يكون فيها كل من هذه الاختيارات خاطئًا.
ما الذي تصيبه الصفحة الأولى — وما الذي تتخطاه
تصنيف "أفضل نموذج لغوي محلي للبرمجة" في الوقت الحالي هو مزيج من قطعة واحدة مفيدة حقًا والكثير من قوة المجال. دليل Tembo (5 يونيو 2026) يحدد الشكل بشكل صحيح — فهو ينظم حسب فئات 8 جيجابايت / 12-16 جيجابايت / 24 جيجابايت ويستقر على عائلة Qwen Coder — لكنه لا ينشر أي نتائج قياس للنماذج المحلية، ولا أرقامًا للرموز في الثانية، ولا أحجامًا لنافذة السياق، ولا اختيارات Apple Silicon حسب الذاكرة. منصة تقييم على GitHub (gauravvij/local-llm-coding-eval) لديها أرقام حقيقية لكن بدون حكم نهائي وعملت على وحدة المعالجة المركزية فقط. أما الباقي فهي مقالات رأي لمؤلف واحد (XDA، Yahoo Tech) وقوائم رقيقة (apidog، Security Boulevard، SitePoint) تُصنَّف على أساس قوة المجال، وليس على أساس كونها مفيدة.
ما الذي يتجاهلونه جميعًا، مرتبًا حسب مقدار تكلفته عليك:
• الفجوة الوكيلية. إنشاء الكود ليس نفس مهارة قيادة وكيل عبر تعديل متعدد الملفات. الصفحة الأولى بالكاد تذكر هذا؛ إنه الفرق بين نموذج تحتفظ به ونموذج تقوم بإلغاء تثبيته.
• نوافذ السياق. تستهلك البرمجة الوكيلية التوكنات عند تحميل الملفات ومخرجات الاختبار. ادعاء "30B يتسع في 24GB" لا معنى له حتى تسأل في أي سياق يتسع.
• رياضيات التكميم. لا أحد يشرح أن التكميم بـ4-بت يتطلب تقريبًا عدد المعاملات بالغيغابايت، أو أن Q3 يمنحك ذاكرة VRAM على حساب أخطاء نحوية طفيفة.
• السرعة المقاسة. قلة من المقالات تنشر معدل الرموز في الثانية للنماذج التي توصي بها، والتي تفعل ذلك تختلف اختلافًا كبيرًا لأن السياق والتكميم يغيّران كل شيء.
• عندما يكون المحلي هو الخيار الخاطئ.اختبار ميداني عام 2026 على تطبيق Flutter من 15000 سطر (EPAM) لا يزال يُظهر أن النماذج المتطورة في السحابة تفوز بأصعب عمليات إعادة الهيكلة متعددة الخطوات. لا يخبرك أي من المقالات القائمة متى تتوقف.
حسابات VRAM التي تتجاهلها معظم المقالات القائمة
القاعدة العامة التي تجعل كل رقم آخر في هذه المقالة واضحة: عند تكميم 4-بت، يحتاج النموذج تقريبًا إلى عدد معلماته بالغيغابايت — 7B ≈ 5GB، 30B ≈ 18GB+، وذلك قبل احتساب النفقات الإضافية لذاكرة KV المؤقتة. Q4 هي النقطة المثالية للبرمجة؛ أما Q3 وما دونها فيوفّر ذاكرة الفيديو VRAM لكنه يُدخل أخطاءً نحوية خفية وملحوظة في القياس. وتزداد ذاكرة KV المؤقتة مع نافذة السياق لديك، ولهذا فإن عبارة "نموذج 30B يتسع في 24GB" صحيحة فقط عند سياق يتعين عليك تحديده فعليًا.
يغيّر نهج خليط الخبراء (Mixture-of-Experts) المعادلة الحسابية بطريقة تهمّ الاختيارين الرئيسيين أدناه. فإجمالي المعلمات يحدد حجم النموذج، بينما تحدد المعلمات النشطة سرعته. ولهذا السبب يبدو كلٌّ من Qwen3-Coder-30B-A3B (30B إجمالًا، 3.3B نشطة) وgpt-oss-20b (20.9B إجمالًا، 3.61B نشطة) أسرع بكثير مما يوحي به حجمه على القرص، ولهذا أيضًا يُعد DeepSeek V4 Flash — 284B إجمالًا، 13B نشطة — خيارًا غير مناسب للتشغيل المحلي، رغم أن واجهة برمجة التطبيقات (API) الخاصة به رخيصة.

ذاكرة فيديو بسعة 24 جيجابايت: Qwen3-Coder 30B
Qwen3-Coder-30B-A3B-Instruct هو أقوى أداة ترميز محلية شاملة يمكننا الإشارة إليها حالياً. تم إصداره في يوليو 2025 بواسطة فريق Qwen التابع لشركة Alibaba بموجب ترخيص Apache 2.0، وهو نموذج خليط من الخبراء (Mixture-of-Experts) بإجمالي 30 مليار معامل و3.3 مليار معامل نشط لكل رمز، مع نافذة سياق من 262,144 رمزاً، وحجم يشغل حوالي 17–20 جيجابايت بدقة 4-بت — مما يترك مساحة حقيقية على بطاقة 24 جيجابايت لذاكرة التخزين المؤقت KV التي تحتاجها جلسة ترميز طويلة.
{{1}}على منصة الاختبار المحلية المستقلة التي نثق بها أكثر{{/1}} ({{2}}gauravvij/local-llm-coding-eval، أربعة نماذج تعمل محليًا عبر Ollama على CPU{{/2}})، {{3}}سجّل qwen3-coder:30b نسبة 80% في توليد الكود، و77% في اختيار الأدوات، و80% في دقة الوكيل{{/3}} {{4}}— وهي النتيجة الأكثر توازنًا بين النماذج الأربعة، والنموذج الوحيد الذي أظهر قوة في المهام الثلاث جميعها في آنٍ واحد.{{/4}} {{5}}وتجمع أدوات التتبع الخارجية درجاته في SWE-bench Verified عند نحو 50.3، وAider Polyglot عند 66.2، وLiveCodeBench v6 عند 58.9{{/5}} {{6}}؛ فاعتبر تلك القيم أرقامًا مجمّعة وليست الأرقام الرسمية لـ Alibaba{{/6}} {{7}}، وهذا كل ما نشرته Qwen لهذا النموذج.{{/7}}
تتفاوت السرعة المقيسة اختلافًا واسعًا حسب العتاد. من أكثر البيانات المفيدة: إعداد TurboQuant المجتمعي يشغّلها على بطاقة RTX 3060 Ti بسعة 8GB بسرعة توليد تبلغ نحو 29 توكن/ثانية مع سياق كامل يبلغ 262K، كما قاس معيار oMLX إصدار MLX بدقة 4-bit على معالج M4 Pro (48GB) عند 73.6 توكن/ثانية بسياق 1K، لتنخفض إلى 13.5 توكن/ثانية عند 64K. أما على بطاقة بسعة 24GB في إعداد Ollama عادي، فينبغي أن تتوقع نطاق عشرات التوكنات في الثانية وليس المئات — وهذا هو الثمن مقابل تشغيل مبرمج شبه متطور على جهازك في المنزل.
التحذير الصادق: إنه ليس أسرع مبرمج محلي، ويوجد إصدار أحدث باسم Qwen3-Coder-Next موجَّه للاستخدام المستضاف وعبر سطر الأوامر بدلاً من التثبيتات المحلية المكممة. لكن بالنسبة للعمل الموجَّه بالوكلاء على نطاق المستودعات على بطاقة واحدة، فإن Qwen3-Coder-30B هو الخيار اليوم.
16 جيجابايت VRAM: gpt-oss-20b
على بطاقة سعتها 16 جيجابايت، الجواب هو gpt-oss-20b — وهو ليس قريبًا. صدر في 5 أغسطس 2025 بواسطة OpenAI بموجب ترخيص Apache 2.0، وهو نموذج Mixture-of-Experts بإجمالي 20.9 مليار معامل و3.61 مليار معامل نشط لكل رمز، ونافذة سياقية من 131,072 رمزًا، وإصداره الأصلي بكمية MXFP4 يبلغ حوالي 14 جيجابايت. تلك هي الحقيقة الحاسمة: يعمل 100% على وحدة معالجة الرسومات على بطاقة 16 جيجابايت، دون أي تسريب إلى ذاكرة النظام.
لماذا يُعد إبقاء النموذج على وحدة معالجة الرسومات (GPU) أكثر أهمية من أي معيار أداء: النموذج الذي يتسع في ذاكرة الفيديو (VRAM) أسرع بمقدار 3 إلى 11 مرة من النموذج الذي يلجأ إلى التفريغ (offload). سجّل معيار مستقل 139.93 رمزًا في الثانية لنموذج gpt-oss-20b على بطاقة RTX 4080 — أي ما يقارب 2.8 مرة من بديل كثيف بنفس حجم الذاكرة — ومنحه أحد المختبِرين في 2026 مؤشر ذكاء قدره 52.1، واصفًا إياه بأنه لا مثيل له في فئة 16 جيجابايت من حيث البرمجة الاحترافية وتصحيح الأخطاء. إنه نموذج ضيق الملاءمة، لذا شغّله بمفرده وأبقِ نافذة السياق متواضعة؛ فالجودة تتدهور عند الجزء العلوي من النافذة.
البديل الوكيلي على 16GB هو Devstral 24B (devstral-small-2:24b)، الذي يسجّل الرقم الوحيد المنشور في SWE-bench Verified بين المبرمجين المحليين من فئة 16GB — 46.8% — لكنه بطيء، وغالبًا ما يحتاج إلى تفريغ المعالج عند حوالي 18 رمزًا في الثانية. إذا كان عملك يتضمن تعديلات وكيلية متعددة الملفات ويمكنك تحمّل البطء، فإن Devstral يستحق مكانه؛ أما إذا كنت تريد السرعة إلى جانب الكود النظيف، فإن gpt-oss-20b هو الخيار الافتراضي الأفضل. نماذج 14B الكثيفة — Qwen3-Coder 14B أو Qwen2.5-Coder 14B بجودة Q5 — هي البدائل المريحة والرخيصة.
ذاكرة VRAM بحجم 8GB: Qwen 2.5 Coder 7B
على ذاكرة 8 جيجابايت، الإجابة الصادقة هي Qwen2.5-Coder-7B: 7B معاملات بحوالي 4.7 جيجابايت في Q4_K_M، سياق أصلي من 32,768 رمزًا قابلًا للتمديد نحو 128K، وأقوى نتائج معايير إكمال الأكواد في فئة 7B. إنه نموذج أقدم — أُصدر في نوفمبر 2024 — وهذا جيد، لأنه لا يوجد أحدث منه في نطاق 8 جيجابايت أزاحه من الصدارة. الاختبارات المجتمعية تضعه حوالي 50 رمزًا في الثانية على RTX 4060 أو 3070؛ اختبار مستقل على RTX 4060 في مارس 2026 قاس 28–35 رمزًا في الثانية، وهذا الفارق مدفوع بالكامل تقريبًا بإعدادات السياق.
ثلاثة أمور تهم على 8GB ولا تهم في غيرها. أولاً، حدد السياق عند 4–8K: ذاكرة التخزين المؤقت KV هي التي تسبب OOM على بطاقة 8GB، وليس الأوزان — أظهر أحد المعايير قفزة في السرعة من ~3.6 إلى ~37 توكن/ثانية فقط بسبب تحديد السياق. ثانيًا، تحقق باستخدام ollama ps أن النموذج يعمل 100% على وحدة معالجة الرسومات؛ أي مشاركة من وحدة المعالجة المركزية تعني انهيار السرعة. ثالثًا، Q4_K_M، وليس Q3 — أخطاء Q3 النحوية تكلفك أكثر مما توفره ذاكرة VRAM.
التطور الملحوظ في عام 2026 هو أن Qwen3-Coder-30B-A3B-Instruct يمكن الآن تشغيله ضمن 8GB عبر ضغط TurboQuant KV-cache — سجّل إعداد مجتمعي ~7.5GB و~29 توكن/ثانية على RTX 3060 Ti بسياق كامل يبلغ 256K. إنه يعمل، لكنه معقّد بما يكفي لدرجة أننا لا نوصي به كخيار افتراضي. إذا كنت تريد خيارًا أحدث وجاهزًا للاستخدام مباشرة، فإن Qwen3 8B (~5.2GB، وضع التفكير الهجين) هو خطوة صغيرة للأمام مقارنة بـ Qwen2.5-Coder-7B في الاستدلال العام بينما يظل متخلفًا قليلاً في الكود الخالص.

ماذا عن Apple Silicon؟
الذاكرة الموحدة تغيّر المعادلة في اتجاه واحد: السعة تزداد، وسرعة التوليد تنخفض. يمكن لشريحة M4 Pro بسعة 48GB تشغيل نماذج لا تستطيع بطاقة Windows بسعة 16GB تشغيلها، لكنها تولّد الرموز ببطء أكبر بكثير في السياقات الطويلة. الأرقام التي لدينا: إصدار MLX بدقة 4 بت من Qwen3-Coder-30B-A3B-Instruct استخدم 16.6GB عند سياق 1K و25.5GB عند 64K على M4 Pro، مع انخفاض التوليد من 73.6 رمزًا/ثانية إلى 13.5 مع نمو السياق (معيار oMLX). يناسب gpt-oss-20b بشكل مريح 16GB من الذاكرة الموحدة ويُعد اختيارًا ممتازًا لأجهزة Mac. إذا كنت تريد تعدد الوسائط على Apple Silicon،Gemma 4 إصدار 12B يعمل في حوالي 16GB من الذاكرة الموحدة بسياق 256K — وهو الخيار المحلي الأقوى إذا كان عملك البرمجي قريبًا من المستندات الغنية بالصور.
الأرقام المستقلة: توليد الكود ليس المهارة التي تهم
أوضح البيانات التي وجدناها هي معيار محلي واحد يستحق الاستشهاد به كاملاً. أجرى gauravvij/local-llm-coding-eval أربعة نماذج محلياً عبر Ollama، على وحدة المعالجة المركزية، دون سحابة — توليد الأكواد، واستدعاء الدوال، ومهمة وكيل متعددة الخطوات — مع نتائج تعارض حدس "الرقم الأكبر لتوليد الأكواد يفوز":
• Qwen3.6 27B (qwen3.6:27b، dense، ~17GB): 80.0% توليد الكود، 84.6% الأدوات، 100% وكيل — الأفضل في جميع المجالات.
• Qwen3.6 35B A3B (qwen3.6:35b-a3b، MoE، ~18GB): 70.0% لتوليد الكود، 84.6% للأدوات، 100% للوكيل.
• Qwen3-Coder-30B-A3B-Instruct (qwen3-coder:30b، MoE، ~17GB): 80.0% لتوليد الأكواد، 76.9% للأدوات، 80% للوكيل — الأكثر توازنًا.
• DeepSeek-Coder-V2 33B (deepseek-coder:33b, كثيف, ~18GB): 90.0% لتوليد الكود — الأفضل بين الأربعة — لكن 10% للوكيل, الأخير تمامًا في العمل متعدد الخطوات.
ذلك السطر الأخير هو الدرس كله. النموذج الذي يتصدر توليد الكود الصرف لكنه ينهار في مهام الوكيل هو النموذج الذي ستقوم بإلغاء تثبيته بعد أول حلقة "اقرأ هذا الملف، غيّر هذه الدالة، شغّل الاختبار". احكم على المبرمج المحلي حسب عمود الوكيل، وليس حسب عمود توليد الكود.

عندما يكون التشغيل محليًا هو القرار الخاطئ
المنهج المحلي أولاً هو الخيار الافتراضي الصحيح للخصوصية، والعمل دون اتصال، وانعدام التكلفة الحدية للرموز، والإكمال التلقائي حيث يكون زمن الاستجابة أكثر أهمية من الجودة القصوى. وهو الخيار الخاطئ في حالات محددة ومعروفة — وهذا هو القسم الذي يتخطاه الجميع:
• ما زالت أصعب الأعمال الوكيلية تتغلب عليك. اختبار ميداني أجرته EPAM عام 2026 على تطبيق Flutter من 15,000 سطر وجد أن نماذج الحدود السحابية (GPT-5.3-codex) ما زالت تتفوق على النماذج المحلية في أكثر عمليات إعادة الهيكلة تعقيدًا وتعددًا للخطوات. إذا كان يومك عبارة عن ثماني ساعات من إعادة هيكلة كود قديم، فإن النماذج المحلية ليست جاهزة بعد.
• احتياجات السياق لديك تتجاوز ما تستطيع بطاقتك حمله. وكيل برمجة يحمّل مستودعًا كاملًا سيتجاوز ذاكرة التخزين المؤقت KV التي يمكن لبطاقة 16GB حملها. سياق Qwen3-Coder-30B البالغ 256K هو السبب في فوزه بفئة 24GB — البطاقات الأصغر تخسر هذه اللعبة مبكرًا.
• لا يمكنك أن تظل تراقب العتاد. العتاد هو مال حقيقي: بطاقة 24GB هي في فئة $700–1,600، بالإضافة إلى الكهرباء والصيانة. عند حجم استخدام منخفض، يكون استدعاء API أرخص من استهلاك الطاقة.
• DeepSeek V4 Flash هو الدليل. بإجمالي 284 مليار معامل، تبلغ أوزان DeepSeek V4 Flash ذات الدقة 4-بت وحدها حوالي 140 جيجابايت — ليس نموذجًا يعمل على بطاقة استهلاكية، انتهى الأمر. تصميمه الذي يفعّل 13 مليار معامل هو بالضبط سبب سرعة واقتصادية واجهة برمجيته (API)، بتكلفة $0.15 / $0.29 لكل مليون توكن (MIT، سياق مليون). بالنسبة لهذا النموذج، "تشغيله محليًا" هو السؤال الخاطئ؛ واجهة البرمجة هي الأساس.
• تحتاج الفرق إلى الاتساق.إذا شغّل كلٌّ من أربعة مهندسين تكميمًا مختلفًا لنموذج مختلف، تصبح عبارة "يعمل على جهازي" خطرًا على البناء. تمنحك نقاط نهاية API المشتركة هدفًا حتميًا واحدًا.
إذا كنت تريد الإجابة من جهة واجهة برمجة التطبيقات (API) على هذا السؤال نفسه — أي نموذج برمجة سحابي هو الافتراضي عندما لا يكون المحلي هو الخيار الأنسب — فقد تناولناها بشكل منفصل في دليلنا لأفضل نموذج لغوي كبير للبرمجة، وتغطي مقالتنا عن وكلاء البرمجة بالذكاء الاصطناعي أدوات مثل Cline وOpenCode التي تعمل مع هذه النماذج المحلية.
كيفية اختبار البطاقة قبل شرائها
أرخص طريقة للحسم هي تشغيل استعلاماتك الخاصة قبل الالتزام بالعتاد. يسمح تطبيقا Ollama أو LM Studio بتشغيل أيٍّ من الخيارات الثلاثة في دقائق، والاختبار الذي يهم فعلًا هو ملفات مستودعك الحقيقية، وليس معيارًا مرجعيًا. يثبت الموجّه (Router) مكانته في القرار المجاور: عندما تقارن نموذجًا محليًا بالنماذج الحدودية المستضافة، تتيح لك نقطة نهاية واحدة تمرير نفس الاستعلام عبر الاثنين دون التبديل بين المفاتيح. على OrcaRouter، يُقدَّم DeepSeek V4 Flash بسعر مزوّده كما هو دون تغيير — $0.15 / $0.29 لكل مليون توكن، بهامش ربح 0% — مع تجاوز تلقائي للأعطال، مما يجعله معيارًا رخيصًا وصادقًا للإجابة عن: «هل نموذجي المحلي أفضل فعلًا من واجهة البرمجة بـ $0.15؟»
تحذير صريح واحد: لا يستضيف OrcaRouter كلاً من Qwen3-Coder-30B-A3B-Instruct أو gpt-oss-20b. إذا كان هدفك هو العمل دون اتصال بالإنترنت تمامًا، فإن جهاز التوجيه غير ذي صلة بك — قم بالاستضافة الذاتية وسينتهي الأمر. أما إذا كان هدفك هو مقارنة (A/B) نفس النموذج مفتوح الأوزان مقابل النماذج المتطورة قبل أن تنفق على بطاقة، فإن وظيفة جهاز التوجيه هي إجراء المقارنة، وليس الاستضافة.
الخلاصة
سعة VRAM هي ما يحدد اختيارك أولاً، وجودة النموذج ثانياً. على ذاكرة 24GB، شغّل Qwen3-Coder-30B-A3B-Instruct — وهو أقوى مبرمج محلي شامل، مع سياق 256K الذي تتطلبه الأعمال الوكيلية. وعلى ذاكرة 16GB، شغّل gpt-oss-20b — وهو النموذج النادر الذي يجمع بين السرعة والعمل الكامل على GPU. وعلى ذاكرة 8GB، شغّل Qwen2.5-Coder-7B مع إبقاء سياقك معتدلاً. قيّم أيّاً منها بحسب عمود الأداء الوكيلي لا عمود توليد الشيفرة، وتقبّل أن أصعب عمليات إعادة الهيكلة متعددة الملفات ما زالت حكراً على السحابة. الأرقام أعلاه سارية حتى 10 أغسطس 2026 — أعد التحقق من التشكيلة والأسعار المعلنة قبل أن تصرف أموالك، لأن هذا المجال يتحرك أسبوعياً.
