
Clef مقابل Gemma 4 12B: جهاز قرار بـ64 ألف توكن في مواجهة نموذج عام بـ256 ألف توكن
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 219 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
الرقم الأكثر فائدة في مقارنة بين Clef وGemma 4 12B ليس درجة معيارية. إنه 65,536 مقابل 256,000 — نوافذ السياق. Cloudflare/clef هو نموذج قرار متعدد الوسائط بـ 27 مليار معلمة، مُدرَّب لاحقًا من Qwen3.8-27B، يقرأ حالة ومخططًا لأسئلة مُنمّطة ويعيد احتمالًا لكل إجابة مسموح بها في تمريرة واحدة غير انحدارية ذاتيًا. Gemma 4 12B — نقطة التفتيش الموحّدة، google/gemma-4-12B-it — هو نموذج المورّد الخالي من المُرمِّز من أي إلى أي، البالغ 11.95 مليار معلمة، الذي صدر في صيف 2026، والذي يولّد نصًا عبر نافذة من 256,000 رمزًا في أكثر من 140 لغة. ضع مجلدًا من العقود أمام كليهما وستنفد سعة نموذج القرار أسرع بأربع مرات، لأن سقفه موثّق عند 65,536 رمزًا بينما سقف النموذج العام 256,000. هذا التفاوت ليس حاشية. لفئة كاملة من أعمال التوجيه — المستندات الطويلة، والمحادثات الملصقة، والنماذج متعددة الصفحات — فإنه يحسم الاختيار قبل أن تُناقش الدقة حتى.
إذن، هذه ليست صفحة عن أيّ النموذجين أفضل. إنها صفحة عن المحورين اللذين يختلفان فيهما حقاً: مقدار الحالة التي يمكن لكل منهما الاحتفاظ بها، وشكل الإجابة التي يكون كل منهما قادراً فعلياً على إنتاجها. وكل ما عدا ذلك إما رقم من مورّد لم يكرره أحد، وإما مقارنة لا تعني ما تبدو عليه.
ما هو كل واحد منها، في فقرة واحدة لكل منها
Clef هو نموذج قرار بحجم 27B من Cloudflare، منشور بموجب Apache-2.0 مع الأوزان على Hugging Face ونقطة نهاية مستضافة على Workers AI. جمّدت Cloudflare العمود الفقري Qwen3.8-27B بما في ذلك مُرمِّز الرؤية الخاص به، وألحقت رأس مخطط مشتركًا بالإضافة إلى مُهايِئات منخفضة الرتبة برتبة 256، ودرّبته باستخدام إنتروبيا تقاطعية مع تنعيم التسميات لإجابات مخطط صالحة إلى جانب خسارة Brier لشحذ المعايرة. أنت تزوّد الحالة — نصًا أو JSON أو صورًا أو إطارات فيديو — ومن سؤال واحد إلى 64 سؤالًا مسمّى، كل منها من النوع منطقي (صواب/خطأ، مع إرجاع احتمال الصواب)، اختيار (من خيارين إلى 26 خيارًا مسمّى) أو درجة (من مستويين إلى 26 مستوى مرتبًا). ما يعود هو توزيع لكل سؤال ولا شيء آخر. لا يوجد مسار لتوليد النصوص على الإطلاق.
Gemma 4 12B نموذج عام يولّد النص. وهو خالٍ من المشفّر: فبدلاً من أبراج رؤية أو صوت منفصلة، تُسقَط بقع الصور الخام والموجات الصوتية مباشرةً في فضاء تضمين النموذج اللغوي عبر طبقات خطية خفيفة الوزن، وهذا ما يسمح له باستقبال النص والصورة والفيديو والصوت دون خط معالجة خاص بكل نمط. لديه أوضاع تفكير قابلة للتهيئة، واستدعاء دوال أصلي، ومفردات بحجم 262K، ومخطط انتباه هجين يتناوب بين انتباه النافذة المنزلقة بحجم 1,024 رمزًا وانتباه عالمي كامل. وهو مرخّص بموجب Apache-2.0 إلى جانب شروط الاستخدام الخاصة بالمورّد، وهو نقطة الحفظ التي يقصدها معظم الناس عندما يقولون "شغّل هذا الحجم محليًا".
شيء واحد يجب قوله بوضوح قبل المضي قدمًا: لا يمثل أي من النموذجين مسارًا على OrcaRouter. يُرجع كتالوجنا خطأ 404 لـ cloudflare/clef ولنقطة التحقق 12B في العائلة نفسها، ولا ينبغي قراءة أي شيء في هذا المقال كادعاء توفر من جانبنا. ما نحمل بالفعل من عائلة Gemma هو الحجمين الأكبرين، وتظهر أسعارهما أدناه.

قائمة الخيارات هي واجهة، ولها نمط فشل.
الفرق البنيوي بين هذين هو ما يحدث للمُدخل الذي لا يتناسب.
• الإخراج — يعيد Clef احتمالًا لكل خيار معلن، وهذه الخيارات فقط. ويعيد Gemma 4 12B نصًا مولَّدًا.
• رفض — ليس لدى Clef خيار "لا شيء مما سبق" إلا إذا كتبت واحدًا في المعايير بنفسك. يمكن لـ Gemma 4 12B وصف حالة لا تناسب أيًا مما سألت عنه.
• نمط الفشل — خطأ Clef صامت: اختيار واثق داخل مخططك، دون رفع أي استثناء، ودون تفعيل أي فرع احتياطي. أما خطأ النموذج العام فيكون عادةً صاخبًا: نصٌّ لا يمكن تحليله.
• قابلية الاختبار — مجموعة خيارات ثابتة تجعل المكوّن قابلاً لإعادة الإنتاج ورخيص التدقيق. أما النص الحر فيجعله مرناً ومكلفاً في التحقق.
أرقام Clef الخاصة بمسألة الرفض تلك هي أضعف الأرقام التي تنشرها. على CLINC150 مع معالجة خارج النطاق — كشف النوايا حيث تكون إحدى الإجابات الصحيحة "هذا لا ينتمي إلى أي فئة" — يسجل النموذج 27B درجة 97.4 في macro-F1، وهو الأفضل في جدول Cloudflare والسبب في الاهتمام بـ 27B بدلًا من شقيقه 9B، الذي يسجل 66.8 على المعيار نفسه. فجوة قدرها ثلاثون نقطة بين نموذجين بُنيَا من الوصفة نفسها تقول إن سلوك خارج النطاق هو ما يشتريه توسّع ما بعد التدريب، وهو ما تعتمد عليه بصمت معظم خطوط أنابيب التوجيه. التخفيف الذي توثقه Cloudflare هو سؤال ثانٍ في المخطط — أضف حقل noul الذي يسأل عما إذا كانت الحالة تناسب أصلًا، ثم ضع له عتبة — وهذا ينجح، وهو مهمتك أنت لا مهمة النموذج.
مصدر الأرقام يهم أكثر مما تقوله
كل رقم من أرقام Clef في هذا المقال مصدره Cloudflare: بطاقة نموذجها، أو منشور إطلاقها، أو تشغيلها لـ Decision Index. المجموعة نفسها هي مجموعة Cloudflare الخاصة، ولوحة الصدارة التي تستضيف النتائج هي أيضاً لوحة Cloudflare الخاصة. أي أنه مورّد يقيس منتجه على عتاد يتحكم به في مواجهة منافس يحاكي واجهته البرمجية (API) عن قصد. ولم يُعِد أي طرف ثالث إنتاج أي من ذلك، وهذا المقال لن يتظاهر بغير ذلك.
عمود Gemma 4 12B هو نوع مختلف من الأدلة. تنشر بطاقة المورّد الخاصة به MMLU Pro 77.2% وGPQA Diamond 78.8% وAIME 2026 بدون أدوات عند 77.5% وLiveCodeBench v6 عند 72.0%. ويُدرج Artificial Analysis، وهو متتبع مستقل، تكوين الاستدلال عند Intelligence Index قدره 14.18 مع سعر مدرج $0.10 / $0.30 لكل مليون رمز، وسرعة إخراج وسيطية مقاسة تبلغ نحو 113 رمزًا في الثانية — وتشير صفحته الخاصة إلى أن هذه الأرقام تعتمد على عبء العمل والعتاد.
القراءة الصادقة تقول إن العمودين غير قابلين للمقارنة على الإطلاق. أحدهما مجموعة اختبارات لجودة القرار خاصة بمورّد، يديرها المورّد نفسه؛ والآخر مزيج من معايير قياس المورّد وتقييم مستقل لنموذج عام. أما أن يُقتبس 97.4 إلى جانب 77.2 وكأنهما عمودان في الجدول نفسه، فسيكون أشد ما يمكن أن تُضلِّل به هذه الصفحة قارئها.
زمن الاستجابة هو المكان الوحيد الذي يمكن فيه على الأقل مناقشة الاثنين بالوحدات نفسها، وحتى هناك تتراكم التحفظات. تُبلغ Cloudflare عن Clef عند وسيط قدره 209.3 ms و p95 قدره 238.6 ms، مقاسَين على بنيتها التحتية الخاصة. تقيس Artificial Analysis زمن أول جزء لدى 12B عند نحو 2.4 ثانية في إعداد استدلالي، وهو يتضمن ميزانية تفكير لا يمتلكها نموذج القرار. إن تمريرة غير انحدارية ذاتيًا عند 209 ms مقابل بداية توليد عند 2.4 ثانية هي فرق معماري حقيقي — تمريرة أمامية واحدة مقابل حلقة فك ترميز — وهي أقوى حجة يملكها Clef ليكون في مسار ساخن. وهو أيضًا، عند 27B، نموذج يحتاج عتادًا من فئة H200 ليصل إلى ذلك الرقم، وتتقاضى Cloudflare 0.24 دولار لكل مليون رمز إدخال لتشغيله لك.

ما الذي يمنحك إياه فعليًا 64K من السياق
السياق هو حيث تصبح هذه المقارنة عملية، وحيث يفوز الخبير العام على الورق بفارق كبير.
• Clef — 65,536 رمزًا، وفقًا لصفحة نموذج Workers AI ومنشور الإطلاق؛ أداة الترميز المساعدة المضمَّنة تعيّن افتراضيًا max_length=16,384، وهي قيمة افتراضية وليست حدًّا أقصى، لكنها القيمة الافتراضية التي ستحصل عليها إذا استخدمت أداة التحميل كما هي مُوزَّعة.
• Gemma 4 12B — 256,000 توكن، وفقًا لبطاقة المورّد، مع انتباه نافذة منزلقة بحجم 1,024 توكنًا للحفاظ على انخفاض تكلفة السياق الطويل.
• الصور — يُقيِّم Clef الصورَ وإطارات الفيديو بشكل مشترك مع حالة النص عبر مُرمِّز الرؤية الموروث. يتلقّى Gemma 4 12B النص والصورة والفيديو والصوت عبر مساره الخالي من المُرمِّز.
• اللغات — لا تدّعي بطاقة Clef أي دعم متعدد اللغات؛ بينما Gemma 4 12B موثّق بأكثر من 140 لغة.
بالنسبة لتذكرة أو فاتورة أو لقطة شاشة معروضة، فإن 64 كيلوبايت مساحة سخية والفرق أكاديمي. أما بالنسبة لعقد من 200 صفحة تريد تصنيفه حقلًا بحقل، فالفرق هو كل الحجة: النموذج العام يستطيع استيعاب المستند، بينما نموذج القرار لا يستطيع. إجابة Clef على ذلك هي التقطيع، وتقطيع المستند قبل أن تقرر بشأنه يعني أنك اتخذت بالفعل قرارًا كان من المفترض أن يتخذه النموذج. هذا قيد حقيقي ويستحق أن يُذكر على أنه كذلك.
ما ستدفعه فعليًا، وأين
لا يوجد أي من الطرازين في الكتالوج الخاص بنا، لذا تنقسم مسألة السعر إلى ثلاثة اتجاهات.
• Clef — 0.24 دولار لكل مليون توكن إدخال على Workers AI من Cloudflare، أو استضافته ذاتيًا من أوزان Apache-2.0؛ وقد قِيست زمن الاستجابة المنشور من Cloudflare على وحدة H200 واحدة مع torch 2.11 وtransformers 5.10.2، وتشير عمليات التكميم المجتمعية التي ظهرت خلال يومين إلى أنه يمكن تصغيره أكثر مع بعض التكلفة على الدقة لم يقسها أحد.
• Gemma 4 12B — لا يوجد مسار مستضاف هنا على الإطلاق. عليك بجلب أوزان BF16 بحجم 24 GB تقريبًا وتشغيلها بنفسك، أو اللجوء إلى منصة طرف ثالث. لا يوجد سعر لكل رمز يمكننا ذكره.
• البديل الموجَّه — Gemma 4 26B A4B، وهو مزيج خبراء يبلغ إجمالي معاملاته 25.2B ومعاملاته النشطة 3.8B، مُدرَج على OrcaRouter بسعر $0.06 لكل مليون رمز إدخال و$0.33 لكل مليون رمز إخراج، مع سياق من 262,144 رمزًا. أما Gemma 4 31B، الشقيق الكثيف متعدد الوسائط ذو التفكير القابل للتهيئة واستدعاء الدوال الأصلي، فهو مُدرَج بسعر $0.13 و$0.38. كلاهما على مفتاح واحد مع سعر قائمة المزوّد مُمرَّر دون أي هامش لكل رمز و تجاوز الفشل التلقائي عبر المزوّدين.
هذا السطر الأخير هو النسخة الصادقة من مشاركتنا في هذه المقارنة. إذا كنت بحاجة إلى نموذج عام يقرأ مستندًا طويلًا ويكتب جملة، فإن الطريق الرخيص إلى ذلك هو أحد أحجام Gemma 4 التي نقدمها فعليًا، وتكلفته لكل مليون رمز أقل من استضافة نموذج 12B ذاتيًا على وحدات GPU مستأجرة. وإذا كنت بحاجة إلى قرار محدود في المسار الساخن، فإن وسيط زمن الاستجابة لدى Clef، البالغ 209 مللي ثانية، هو خاصية معمارية حقيقية، وأقرب شيء إليه في كتالوجنا هو Jev 1.13 من TypeSafe — النموذج الذي قاست Cloudflare أداءه ونسخت منه تنسيق الإرسال — بسعر $0.042 لكل مليون رمز إدخال ضمن سياق من 65,536 رمزًا، ويُقدَّم عبر POST /v1/systemone الشكل نفسه. ولأن الاثنان متوافقان على مستوى API خلف محوّل رفيع، فإن تجريب Clef في مواجهة النموذج القائم هو تجربة وليست عملية ترحيل، وتبقى التجربة رخيصة عندما يكون الطرفان قابلين للوصول عبر نقطة نهاية واحدة.

القرار، المُعلَن بوصفه قرارًا
اختر Clef عندما تكون الإجابات قابلة للعد، وتتسع الحالة في 64K، ويقع القرار في مسار حساس لزمن الاستجابة، وتكون مستعدًا لتحمل مسؤولية الفئة المتبقية بنفسك. إن 97.4 لنموذج 27B في اكتشاف النوايا خارج النطاق هي السبب وراء دفعك مقابل استخدامه بدلاً من النموذج الشقيق 9B، وشكله الثابت للمخرجات هو ما يجعل المكوّن قابلاً للتدقيق دون محلل.
اختر Gemma 4 12B عندما يكون الإدخال طويلاً، أو عندما تكون الوسيطة صوتًا أو فيديو، أو عندما تحتاج الإجابة إلى أن تكون نصًا نثريًا، أو عندما لا تكون الفئات معروفة بعد — لأن «فرز هذه الكومة إلى أي مجموعات منطقية» طلبٌ لا يستطيع نموذج اتخاذ قرار قبوله، وليس طلبًا يتعامل معه على نحو سيئ. إنه نموذج عام يقف خلفه تقييم مستقل، وبالنسبة إلى العمل المفتوح، فإن ذلك يستحق أكثر من جدول يقدمه مورّد.
وكن متشككًا في مجموعتي الأرقام كلتيهما للسبب الذي تكرره هذه المقالة مرارًا: لم تتم إعادة إنتاج Cloudflare بشكل مستقل على أي شيء، وتلك البطاقة هي جدول المعايير الخاص بالبائع نفسه. الرقم الوحيد المثير للاهتمام حقًا في الزوج — ما إذا كان رأس المخطط بحجم 27B يحافظ فعلًا على درجته 97.4 الخاصة بما خارج النطاق على بيانات لم يُدرَّب عليها — هو بالضبط الرقم الذي لا يستطيع أي من البائعين حسمه، ويستطيع طرف ثالث حسمه.
