بطاقة عنوان تقول "أفضل نموذج لغوي محلي للترميز في أغسطس 2026" مع العنوان الفرعي "حسب ذاكرة الفيديو: Qwen3-Coder 30B بسعة 24GB · gpt-oss-20b بسعة 16GB · Qwen 2.5 Coder 7B بسعة 8GB"، وثلاث بلاطات معنونة: "24GB Qwen3-Coder 30B A3B أقوى مبرمج محلي شامل بسياق 256K"، و"16GB gpt-oss-20b ~140 tok/s يعمل بالكامل على GPU، Apache 2.0"، و"8GB Qwen 2.5 Coder 7B الحصان الموثوق ~4.7GB بجودة Q4"، على خلفية بيضاء مع تدرجات لونية زرقاء وسماوية وشعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Guides & Insights

أفضل LLM محلي للبرمجة في أغسطس 2026، حسب VRAM: Qwen3-Coder 30B، gpt-oss-20b، Qwen 2.5 Coder 7B

الكاتب

Jim Song

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أفضل نموذج LLM محلي للبرمجة في أغسطس 2026 يُحدَّد بواسطة VRAM لديك قبل أي شيء آخر. إذا كانت لديك بطاقة بسعة 24GB — مثل RTX 3090 أو 4090 — فقم بتشغيلQwen3-Coder-30B-A3B-Instruct: 30B معلمة إجمالية مع 3.3B فقط نشطة لكل رمز، ونافذة سياق تبلغ 262,144 رمزًا، وأفضل أرقام برمجة محلية شاملة يمكننا التحقق منها. على بطاقة 16GB يكون الخيار هوgpt-oss-20b، نموذج OpenAI من نوع Mixture-of-Experts برخصة Apache-2.0، والذي يعمل بالكامل على GPU بحجم ~14GB وبسرعة تبلغ حوالي 140 رمزًا في الثانية. على بطاقة 8GB يكون الخيار هوQwen2.5-Coder-7B، الحصان الموثوق بحجم ~4.7GB. بقية هذه الصفحة توضح الأسباب والأرقام المقاسة والمواقف المحددة التي يكون فيها كل من هذه الاختيارات خاطئًا.

ما الذي تصيبه الصفحة الأولى — وما الذي تتخطاه

تصنيف "أفضل نموذج لغوي محلي للبرمجة" في الوقت الحالي هو مزيج من قطعة واحدة مفيدة حقًا والكثير من قوة المجال. دليل Tembo (5 يونيو 2026) يحدد الشكل بشكل صحيح — فهو ينظم حسب فئات 8 جيجابايت / 12-16 جيجابايت / 24 جيجابايت ويستقر على عائلة Qwen Coder — لكنه لا ينشر أي نتائج قياس للنماذج المحلية، ولا أرقامًا للرموز في الثانية، ولا أحجامًا لنافذة السياق، ولا اختيارات Apple Silicon حسب الذاكرة. منصة تقييم على GitHub (gauravvij/local-llm-coding-eval) لديها أرقام حقيقية لكن بدون حكم نهائي وعملت على وحدة المعالجة المركزية فقط. أما الباقي فهي مقالات رأي لمؤلف واحد (XDA، Yahoo Tech) وقوائم رقيقة (apidog، Security Boulevard، SitePoint) تُصنَّف على أساس قوة المجال، وليس على أساس كونها مفيدة.

ما الذي يتجاهلونه جميعًا، مرتبًا حسب مقدار تكلفته عليك:

الفجوة الوكيلية. إنشاء الكود ليس نفس مهارة قيادة وكيل عبر تعديل متعدد الملفات. الصفحة الأولى بالكاد تذكر هذا؛ إنه الفرق بين نموذج تحتفظ به ونموذج تقوم بإلغاء تثبيته.

نوافذ السياق. تستهلك البرمجة الوكيلية التوكنات عند تحميل الملفات ومخرجات الاختبار. ادعاء "30B يتسع في 24GB" لا معنى له حتى تسأل في أي سياق يتسع.

رياضيات التكميم. لا أحد يشرح أن التكميم بـ4-بت يتطلب تقريبًا عدد المعاملات بالغيغابايت، أو أن Q3 يمنحك ذاكرة VRAM على حساب أخطاء نحوية طفيفة.

السرعة المقاسة. قلة من المقالات تنشر معدل الرموز في الثانية للنماذج التي توصي بها، والتي تفعل ذلك تختلف اختلافًا كبيرًا لأن السياق والتكميم يغيّران كل شيء.

عندما يكون المحلي هو الخيار الخاطئ.اختبار ميداني عام 2026 على تطبيق Flutter من 15000 سطر (EPAM) لا يزال يُظهر أن النماذج المتطورة في السحابة تفوز بأصعب عمليات إعادة الهيكلة متعددة الخطوات. لا يخبرك أي من المقالات القائمة متى تتوقف.

حسابات VRAM التي تتجاهلها معظم المقالات القائمة

القاعدة العامة التي تجعل كل رقم آخر في هذه المقالة واضحة: عند تكميم 4-بت، يحتاج النموذج تقريبًا إلى عدد معلماته بالغيغابايت — 7B ≈ 5GB، 30B ≈ 18GB+، وذلك قبل احتساب النفقات الإضافية لذاكرة KV المؤقتة. Q4 هي النقطة المثالية للبرمجة؛ أما Q3 وما دونها فيوفّر ذاكرة الفيديو VRAM لكنه يُدخل أخطاءً نحوية خفية وملحوظة في القياس. وتزداد ذاكرة KV المؤقتة مع نافذة السياق لديك، ولهذا فإن عبارة "نموذج 30B يتسع في 24GB" صحيحة فقط عند سياق يتعين عليك تحديده فعليًا.

يغيّر نهج خليط الخبراء (Mixture-of-Experts) المعادلة الحسابية بطريقة تهمّ الاختيارين الرئيسيين أدناه. فإجمالي المعلمات يحدد حجم النموذج، بينما تحدد المعلمات النشطة سرعته. ولهذا السبب يبدو كلٌّ من Qwen3-Coder-30B-A3B (30B إجمالًا، 3.3B نشطة) وgpt-oss-20b (20.9B إجمالًا، 3.61B نشطة) أسرع بكثير مما يوحي به حجمه على القرص، ولهذا أيضًا يُعد DeepSeek V4 Flash — 284B إجمالًا، 13B نشطة — خيارًا غير مناسب للتشغيل المحلي، رغم أن واجهة برمجة التطبيقات (API) الخاصة به رخيصة.

Card titled 'The VRAM math most listicles skip' with a rule box reading 'At 4-bit, a model needs roughly its parameter count in gigabytes, plus KV cache for your context window'. Three columns: 'Qwen3-Coder 30B' FP16 ~61GB, Q8 ~30GB, Q4 ~17-20GB, KV cache at 256K several GB extra; 'gpt-oss-20b' FP16 ~40GB, Q8 ~21GB, MXFP4 ~14GB, KV cache at 128K fits 16GB only at modest context; 'Qwen 2.5 Coder 7B' FP16 ~14GB, Q8 ~7GB, Q4 ~4.7GB, KV cache at 32K fits 8GB with headroom. A warning bar reads 'Q3 and below save VRAM but measurably introduce subtle syntax errors in code — Q4 is the coding sweet spot. MoE changes the math: total parameters set the footprint, active parameters set the speed.' with the OrcaRouter logo composited bottom-right.

ذاكرة فيديو بسعة 24 جيجابايت: Qwen3-Coder 30B

Qwen3-Coder-30B-A3B-Instruct هو أقوى أداة ترميز محلية شاملة يمكننا الإشارة إليها حالياً. تم إصداره في يوليو 2025 بواسطة فريق Qwen التابع لشركة Alibaba بموجب ترخيص Apache 2.0، وهو نموذج خليط من الخبراء (Mixture-of-Experts) بإجمالي 30 مليار معامل و3.3 مليار معامل نشط لكل رمز، مع نافذة سياق من 262,144 رمزاً، وحجم يشغل حوالي 17–20 جيجابايت بدقة 4-بت — مما يترك مساحة حقيقية على بطاقة 24 جيجابايت لذاكرة التخزين المؤقت KV التي تحتاجها جلسة ترميز طويلة.

{{1}}على منصة الاختبار المحلية المستقلة التي نثق بها أكثر{{/1}} ({{2}}gauravvij/local-llm-coding-eval، أربعة نماذج تعمل محليًا عبر Ollama على CPU{{/2}})، {{3}}سجّل qwen3-coder:30b نسبة 80% في توليد الكود، و77% في اختيار الأدوات، و80% في دقة الوكيل{{/3}} {{4}}— وهي النتيجة الأكثر توازنًا بين النماذج الأربعة، والنموذج الوحيد الذي أظهر قوة في المهام الثلاث جميعها في آنٍ واحد.{{/4}} {{5}}وتجمع أدوات التتبع الخارجية درجاته في SWE-bench Verified عند نحو 50.3، وAider Polyglot عند 66.2، وLiveCodeBench v6 عند 58.9{{/5}} {{6}}؛ فاعتبر تلك القيم أرقامًا مجمّعة وليست الأرقام الرسمية لـ Alibaba{{/6}} {{7}}، وهذا كل ما نشرته Qwen لهذا النموذج.{{/7}}

تتفاوت السرعة المقيسة اختلافًا واسعًا حسب العتاد. من أكثر البيانات المفيدة: إعداد TurboQuant المجتمعي يشغّلها على بطاقة RTX 3060 Ti بسعة 8GB بسرعة توليد تبلغ نحو 29 توكن/ثانية مع سياق كامل يبلغ 262K، كما قاس معيار oMLX إصدار MLX بدقة 4-bit على معالج M4 Pro (48GB) عند 73.6 توكن/ثانية بسياق 1K، لتنخفض إلى 13.5 توكن/ثانية عند 64K. أما على بطاقة بسعة 24GB في إعداد Ollama عادي، فينبغي أن تتوقع نطاق عشرات التوكنات في الثانية وليس المئات — وهذا هو الثمن مقابل تشغيل مبرمج شبه متطور على جهازك في المنزل.

التحذير الصادق: إنه ليس أسرع مبرمج محلي، ويوجد إصدار أحدث باسم Qwen3-Coder-Next موجَّه للاستخدام المستضاف وعبر سطر الأوامر بدلاً من التثبيتات المحلية المكممة. لكن بالنسبة للعمل الموجَّه بالوكلاء على نطاق المستودعات على بطاقة واحدة، فإن Qwen3-Coder-30B هو الخيار اليوم.

16 جيجابايت VRAM: gpt-oss-20b

على بطاقة سعتها 16 جيجابايت، الجواب هو gpt-oss-20b — وهو ليس قريبًا. صدر في 5 أغسطس 2025 بواسطة OpenAI بموجب ترخيص Apache 2.0، وهو نموذج Mixture-of-Experts بإجمالي 20.9 مليار معامل و3.61 مليار معامل نشط لكل رمز، ونافذة سياقية من 131,072 رمزًا، وإصداره الأصلي بكمية MXFP4 يبلغ حوالي 14 جيجابايت. تلك هي الحقيقة الحاسمة: يعمل 100% على وحدة معالجة الرسومات على بطاقة 16 جيجابايت، دون أي تسريب إلى ذاكرة النظام.

لماذا يُعد إبقاء النموذج على وحدة معالجة الرسومات (GPU) أكثر أهمية من أي معيار أداء: النموذج الذي يتسع في ذاكرة الفيديو (VRAM) أسرع بمقدار 3 إلى 11 مرة من النموذج الذي يلجأ إلى التفريغ (offload). سجّل معيار مستقل 139.93 رمزًا في الثانية لنموذج gpt-oss-20b على بطاقة RTX 4080 — أي ما يقارب 2.8 مرة من بديل كثيف بنفس حجم الذاكرة — ومنحه أحد المختبِرين في 2026 مؤشر ذكاء قدره 52.1، واصفًا إياه بأنه لا مثيل له في فئة 16 جيجابايت من حيث البرمجة الاحترافية وتصحيح الأخطاء. إنه نموذج ضيق الملاءمة، لذا شغّله بمفرده وأبقِ نافذة السياق متواضعة؛ فالجودة تتدهور عند الجزء العلوي من النافذة.

البديل الوكيلي على 16GB هو Devstral 24B (devstral-small-2:24b)، الذي يسجّل الرقم الوحيد المنشور في SWE-bench Verified بين المبرمجين المحليين من فئة 16GB — 46.8% — لكنه بطيء، وغالبًا ما يحتاج إلى تفريغ المعالج عند حوالي 18 رمزًا في الثانية. إذا كان عملك يتضمن تعديلات وكيلية متعددة الملفات ويمكنك تحمّل البطء، فإن Devstral يستحق مكانه؛ أما إذا كنت تريد السرعة إلى جانب الكود النظيف، فإن gpt-oss-20b هو الخيار الافتراضي الأفضل. نماذج 14B الكثيفة — Qwen3-Coder 14B أو Qwen2.5-Coder 14B بجودة Q5 — هي البدائل المريحة والرخيصة.

ذاكرة VRAM بحجم 8GB: Qwen 2.5 Coder 7B

على ذاكرة 8 جيجابايت، الإجابة الصادقة هي Qwen2.5-Coder-7B: 7B معاملات بحوالي 4.7 جيجابايت في Q4_K_M، سياق أصلي من 32,768 رمزًا قابلًا للتمديد نحو 128K، وأقوى نتائج معايير إكمال الأكواد في فئة 7B. إنه نموذج أقدم — أُصدر في نوفمبر 2024 — وهذا جيد، لأنه لا يوجد أحدث منه في نطاق 8 جيجابايت أزاحه من الصدارة. الاختبارات المجتمعية تضعه حوالي 50 رمزًا في الثانية على RTX 4060 أو 3070؛ اختبار مستقل على RTX 4060 في مارس 2026 قاس 28–35 رمزًا في الثانية، وهذا الفارق مدفوع بالكامل تقريبًا بإعدادات السياق.

ثلاثة أمور تهم على 8GB ولا تهم في غيرها. أولاً، حدد السياق عند 4–8K: ذاكرة التخزين المؤقت KV هي التي تسبب OOM على بطاقة 8GB، وليس الأوزان — أظهر أحد المعايير قفزة في السرعة من ~3.6 إلى ~37 توكن/ثانية فقط بسبب تحديد السياق. ثانيًا، تحقق باستخدام ollama ps أن النموذج يعمل 100% على وحدة معالجة الرسومات؛ أي مشاركة من وحدة المعالجة المركزية تعني انهيار السرعة. ثالثًا، Q4_K_M، وليس Q3 — أخطاء Q3 النحوية تكلفك أكثر مما توفره ذاكرة VRAM.

التطور الملحوظ في عام 2026 هو أن Qwen3-Coder-30B-A3B-Instruct يمكن الآن تشغيله ضمن 8GB عبر ضغط TurboQuant KV-cache — سجّل إعداد مجتمعي ~7.5GB و~29 توكن/ثانية على RTX 3060 Ti بسياق كامل يبلغ 256K. إنه يعمل، لكنه معقّد بما يكفي لدرجة أننا لا نوصي به كخيار افتراضي. إذا كنت تريد خيارًا أحدث وجاهزًا للاستخدام مباشرة، فإن Qwen3 8B (~5.2GB، وضع التفكير الهجين) هو خطوة صغيرة للأمام مقارنة بـ Qwen2.5-Coder-7B في الاستدلال العام بينما يظل متخلفًا قليلاً في الكود الخالص.

Scoreboard card titled 'Three picks, three VRAM tiers' with three columns. Left '24GB · Qwen3-Coder 30B': VRAM at 4-bit ~19GB Q4_K_M, Context 262,144 tokens, Speed measured ~29 t/s tight 8GB run; 50-90 t/s on 24GB, Released Jul 2025, License Apache 2.0, Best for agentic repo-scale work. Middle '16GB · gpt-oss-20b': VRAM ~14GB MXFP4, Context 131,072 tokens, Speed ~140 t/s RTX 4080, Released Aug 5 2025, License Apache 2.0, Best for speed plus clean code. Right '8GB · Qwen 2.5 Coder 7B': VRAM ~4.7GB Q4_K_M, Context 32,768 native (128K via YaRN), Speed ~50 t/s RTX 4060/3070, Released Nov 2024, License Apache 2.0, Best for autocomplete, offline, privacy. Footer reads 'Speeds are third-party measurements; all figures read Aug 10 2026.' with the OrcaRouter logo composited bottom-right.

ماذا عن Apple Silicon؟

الذاكرة الموحدة تغيّر المعادلة في اتجاه واحد: السعة تزداد، وسرعة التوليد تنخفض. يمكن لشريحة M4 Pro بسعة 48GB تشغيل نماذج لا تستطيع بطاقة Windows بسعة 16GB تشغيلها، لكنها تولّد الرموز ببطء أكبر بكثير في السياقات الطويلة. الأرقام التي لدينا: إصدار MLX بدقة 4 بت من Qwen3-Coder-30B-A3B-Instruct استخدم 16.6GB عند سياق 1K و25.5GB عند 64K على M4 Pro، مع انخفاض التوليد من 73.6 رمزًا/ثانية إلى 13.5 مع نمو السياق (معيار oMLX). يناسب gpt-oss-20b بشكل مريح 16GB من الذاكرة الموحدة ويُعد اختيارًا ممتازًا لأجهزة Mac. إذا كنت تريد تعدد الوسائط على Apple Silicon،Gemma 4 إصدار 12B يعمل في حوالي 16GB من الذاكرة الموحدة بسياق 256K — وهو الخيار المحلي الأقوى إذا كان عملك البرمجي قريبًا من المستندات الغنية بالصور.

الأرقام المستقلة: توليد الكود ليس المهارة التي تهم

أوضح البيانات التي وجدناها هي معيار محلي واحد يستحق الاستشهاد به كاملاً. أجرى gauravvij/local-llm-coding-eval أربعة نماذج محلياً عبر Ollama، على وحدة المعالجة المركزية، دون سحابة — توليد الأكواد، واستدعاء الدوال، ومهمة وكيل متعددة الخطوات — مع نتائج تعارض حدس "الرقم الأكبر لتوليد الأكواد يفوز":

Qwen3.6 27B (qwen3.6:27b، dense، ~17GB): 80.0% توليد الكود، 84.6% الأدوات، 100% وكيل — الأفضل في جميع المجالات.

Qwen3.6 35B A3B (qwen3.6:35b-a3b، MoE، ~18GB): 70.0% لتوليد الكود، 84.6% للأدوات، 100% للوكيل.

Qwen3-Coder-30B-A3B-Instruct (qwen3-coder:30b، MoE، ~17GB): 80.0% لتوليد الأكواد، 76.9% للأدوات، 80% للوكيل — الأكثر توازنًا.

DeepSeek-Coder-V2 33B (deepseek-coder:33b, كثيف, ~18GB): 90.0% لتوليد الكود — الأفضل بين الأربعة — لكن 10% للوكيل, الأخير تمامًا في العمل متعدد الخطوات.

ذلك السطر الأخير هو الدرس كله. النموذج الذي يتصدر توليد الكود الصرف لكنه ينهار في مهام الوكيل هو النموذج الذي ستقوم بإلغاء تثبيته بعد أول حلقة "اقرأ هذا الملف، غيّر هذه الدالة، شغّل الاختبار". احكم على المبرمج المحلي حسب عمود الوكيل، وليس حسب عمود توليد الكود.

Benchmark card titled 'The independent local benchmark — agentic skill is the real gap' with four columns. 'qwen3.6:27b dense ~17GB': Codegen 80.0%, Tools 84.6%, Agent 100%. 'qwen3.6:35b-a3b MoE ~18GB': Codegen 70.0%, Tools 84.6%, Agent 100%. 'qwen3-coder:30b MoE ~17GB': Codegen 80.0%, Tools 76.9%, Agent 80%. 'deepseek-coder:33b dense ~18GB': Codegen 90.0%, Tools 84.6%, Agent 10%. Footer reads 'deepseek-coder:33b tops codegen yet collapses on agent tasks — codegen alone overrates a local coder. All four ran locally via Ollama, CPU-only, no cloud (gauravvij/local-llm-coding-eval, GitHub). On a 15k-LOC refactor, cloud frontier still wins (EPAM field test, 2026).' with the OrcaRouter logo composited bottom-right.

عندما يكون التشغيل محليًا هو القرار الخاطئ

المنهج المحلي أولاً هو الخيار الافتراضي الصحيح للخصوصية، والعمل دون اتصال، وانعدام التكلفة الحدية للرموز، والإكمال التلقائي حيث يكون زمن الاستجابة أكثر أهمية من الجودة القصوى. وهو الخيار الخاطئ في حالات محددة ومعروفة — وهذا هو القسم الذي يتخطاه الجميع:

ما زالت أصعب الأعمال الوكيلية تتغلب عليك. اختبار ميداني أجرته EPAM عام 2026 على تطبيق Flutter من 15,000 سطر وجد أن نماذج الحدود السحابية (GPT-5.3-codex) ما زالت تتفوق على النماذج المحلية في أكثر عمليات إعادة الهيكلة تعقيدًا وتعددًا للخطوات. إذا كان يومك عبارة عن ثماني ساعات من إعادة هيكلة كود قديم، فإن النماذج المحلية ليست جاهزة بعد.

احتياجات السياق لديك تتجاوز ما تستطيع بطاقتك حمله. وكيل برمجة يحمّل مستودعًا كاملًا سيتجاوز ذاكرة التخزين المؤقت KV التي يمكن لبطاقة 16GB حملها. سياق Qwen3-Coder-30B البالغ 256K هو السبب في فوزه بفئة 24GB — البطاقات الأصغر تخسر هذه اللعبة مبكرًا.

لا يمكنك أن تظل تراقب العتاد. العتاد هو مال حقيقي: بطاقة 24GB هي في فئة $700–1,600، بالإضافة إلى الكهرباء والصيانة. عند حجم استخدام منخفض، يكون استدعاء API أرخص من استهلاك الطاقة.

DeepSeek V4 Flash هو الدليل. بإجمالي 284 مليار معامل، تبلغ أوزان DeepSeek V4 Flash ذات الدقة 4-بت وحدها حوالي 140 جيجابايت — ليس نموذجًا يعمل على بطاقة استهلاكية، انتهى الأمر. تصميمه الذي يفعّل 13 مليار معامل هو بالضبط سبب سرعة واقتصادية واجهة برمجيته (API)، بتكلفة $0.15 / $0.29 لكل مليون توكن (MIT، سياق مليون). بالنسبة لهذا النموذج، "تشغيله محليًا" هو السؤال الخاطئ؛ واجهة البرمجة هي الأساس.

تحتاج الفرق إلى الاتساق.إذا شغّل كلٌّ من أربعة مهندسين تكميمًا مختلفًا لنموذج مختلف، تصبح عبارة "يعمل على جهازي" خطرًا على البناء. تمنحك نقاط نهاية API المشتركة هدفًا حتميًا واحدًا.

إذا كنت تريد الإجابة من جهة واجهة برمجة التطبيقات (API) على هذا السؤال نفسه — أي نموذج برمجة سحابي هو الافتراضي عندما لا يكون المحلي هو الخيار الأنسب — فقد تناولناها بشكل منفصل في دليلنا لأفضل نموذج لغوي كبير للبرمجة، وتغطي مقالتنا عن وكلاء البرمجة بالذكاء الاصطناعي أدوات مثل Cline وOpenCode التي تعمل مع هذه النماذج المحلية.

كيفية اختبار البطاقة قبل شرائها

أرخص طريقة للحسم هي تشغيل استعلاماتك الخاصة قبل الالتزام بالعتاد. يسمح تطبيقا Ollama أو LM Studio بتشغيل أيٍّ من الخيارات الثلاثة في دقائق، والاختبار الذي يهم فعلًا هو ملفات مستودعك الحقيقية، وليس معيارًا مرجعيًا. يثبت الموجّه (Router) مكانته في القرار المجاور: عندما تقارن نموذجًا محليًا بالنماذج الحدودية المستضافة، تتيح لك نقطة نهاية واحدة تمرير نفس الاستعلام عبر الاثنين دون التبديل بين المفاتيح. على OrcaRouter، يُقدَّم DeepSeek V4 Flash بسعر مزوّده كما هو دون تغيير — $0.15 / $0.29 لكل مليون توكن، بهامش ربح 0% — مع تجاوز تلقائي للأعطال، مما يجعله معيارًا رخيصًا وصادقًا للإجابة عن: «هل نموذجي المحلي أفضل فعلًا من واجهة البرمجة بـ $0.15؟»

تحذير صريح واحد: لا يستضيف OrcaRouter كلاً من Qwen3-Coder-30B-A3B-Instruct أو gpt-oss-20b. إذا كان هدفك هو العمل دون اتصال بالإنترنت تمامًا، فإن جهاز التوجيه غير ذي صلة بك — قم بالاستضافة الذاتية وسينتهي الأمر. أما إذا كان هدفك هو مقارنة (A/B) نفس النموذج مفتوح الأوزان مقابل النماذج المتطورة قبل أن تنفق على بطاقة، فإن وظيفة جهاز التوجيه هي إجراء المقارنة، وليس الاستضافة.

الخلاصة

سعة VRAM هي ما يحدد اختيارك أولاً، وجودة النموذج ثانياً. على ذاكرة 24GB، شغّل Qwen3-Coder-30B-A3B-Instruct — وهو أقوى مبرمج محلي شامل، مع سياق 256K الذي تتطلبه الأعمال الوكيلية. وعلى ذاكرة 16GB، شغّل gpt-oss-20b — وهو النموذج النادر الذي يجمع بين السرعة والعمل الكامل على GPU. وعلى ذاكرة 8GB، شغّل Qwen2.5-Coder-7B مع إبقاء سياقك معتدلاً. قيّم أيّاً منها بحسب عمود الأداء الوكيلي لا عمود توليد الشيفرة، وتقبّل أن أصعب عمليات إعادة الهيكلة متعددة الملفات ما زالت حكراً على السحابة. الأرقام أعلاه سارية حتى 10 أغسطس 2026 — أعد التحقق من التشكيلة والأسعار المعلنة قبل أن تصرف أموالك، لأن هذا المجال يتحرك أسبوعياً.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube