
Tiny Aya Base 32K مقابل Tiny Aya En-Thinker: الأصل والفرع، ليسا منافسين
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 لكل مليون رمز
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
مستودعان على Hugging Face، بأربع شظايا safetensors لكل منهما، وتتطابق أحجام الشظايا إلى البايت — 1,998,698,496 / 1,996,494,056 / 1,996,494,088 / 708,852,792. Tiny Aya Base 32K و Tiny Aya En-Thinker ليسا إجابتي مختبرين مختلفين عن السؤال نفسه. إنهما نفس معمارية Cohere2 بحجم 3.35B في مرحلتين مختلفتين، وبطاقة النموذج الخاصة بـ Cohere Labs تقول ذلك صراحةً: نقطة التحقق الأساسية "تُستخدم كنموذج أساسي لـ Tiny Aya L2-Thinker و Tiny Aya En-Thinker."
هذا يجعل التأطير المعتاد للمواجهة المباشرة خاطئًا. أنت لا تختار بين نموذجين متنافسين متعددي اللغات بحجم 3B. أنت تختار بين نقطة بداية ونموذج مكتمل — والسؤال المثير للاهتمام هو ما الذي حققته فعلاً خطوة التدريب اللاحق بينهما، وما تكلفته، وما إذا كان أي منهما قابلاً للاستخدام لما في ذهنك بالنظر إلى أن كليهما يخضع للترخيص غير التجاري نفسه ولا يملك أي منهما معيارًا منشورًا واحدًا.
الجملة الواحدة التي تحسم العلاقة
عادةً ما يتعين على مقال "vs" أن يستنتج العلاقة بين نقطتي حفظ من البنية وأعداد المعلمات. هنا لا يتعين عليك ذلك.
تذكر بطاقة Tiny Aya Base 32K الأمر بوضوح، ويستحق قراءة متأنية بسبب موضع الجملة — لا في حاشية، بل في ملخّص النموذج، بين وصف نقطة الحفظ واعتمادات المطوّرين:
"هذا نموذج أساسي مُدرَّب مسبقًا ولم يخضع للضبط الدقيق بالتعليمات أو المحاذاة مع التفضيلات. تُستخدم نقطة التفتيش هذه كنموذج أساسي لـ Tiny Aya L2-Thinker و Tiny Aya En-Thinker."
ما يجعل ذلك يستحق فقرة هو التناقض الذي يكشفه. بطاقة En-Thinker نفسها لا تذكر Base 32K. سطرها الختامي يوجّه القراء إلى "tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker" — وtiny-aya-base هو نقطة التحقق الخاصة بشهر فبراير، الموثّقة بسياق 8K، وليس المتغيّر 32K الذي يقول إنه النموذج الأب لـ En-Thinker. يدّعي En-Thinker سياق 32K على بطاقته الخاصة. لا يمكن أن يُدرَّب نموذج تدريبًا لاحقًا ليصل إلى نافذة أوسع أربع مرات من النافذة التي دُرِّب عليها مسبقًا. لذا لم يكن من الممكن أن يكون النموذج الأساس 8K هو الجواب أبدًا، وادعاء النموذج الأساس 32K يتوافق مع الحساب حيث لا تتفق إشارة En-Thinker نفسه.
التفسير الأرجح عادي: تم رفع Base 32K في 8 سبتمبر 2026، ستة أيام بعد Thinkers، لذا كُتبت بطاقة En-Thinker قبل وجود أصله ولم تُحدَّث منذ ذلك الحين. هذا استدلال من الطوابع الزمنية، وليس تصريحًا من بائع — لكنه القراءة التي تتطلب أقل عدد من الافتراضات، ويعني أن أحدث مستند في العائلة هو الأكثر إفادة.

بُعدًا بُعدًا
كل ما يلي هو ما تذكره البطاقتان، بعد إزالة التكرار — كلتاهما 3.35B، وBF16، ونصيتان فقط، وCohere2ForCausalLM، وCC-BY-NC-4.0، ومقيّدتا الوصول، وغير مُختبَرتين بمعايير.
• المرحلة — Tiny Aya Base 32K هو نموذج أساسي مُدرَّب مسبقًا، «غير مُضبَط بالتعليمات ولا مُتوافِق مع التفضيلات»؛ أما Tiny Aya En-Thinker فقد دُرِّب لاحقًا على بيانات استدلال متعددة اللغات، مع مسارات استدلال بالإنجليزية.
• قالب الدردشة — لا يتضمن Base 32K أي chat_template.jinja على الإطلاق؛ أما En-Thinker فيتضمن واحدًا، وتخصّص بطاقته قسمًا كاملًا لكيفية عرضه لجولات المحادثة.
• نمط التلقين — مثال Base 32K نفسه هو الإكمال (prompt = "عاصمة إسبانيا هي")؛ يتوقع En-Thinker apply_chat_template() مع قائمة رسائل.
• وضع الاستدلال — لا يمتلك Base 32K وضع استدلال؛ En-Thinker ثنائي الوضع، ويضيف /think افتراضيًا ويُصدر أثر تفكير باللغة الإنجليزية، أو /no_think مع enable_thinking=False للحصول على إجابة مباشرة.
• نطاق اللغات — تدّعي بطاقة Base 32K التدريب على أكثر من 70 لغة وتسمّي 67 منها صراحةً؛ بينما يغطي En-Thinker «44 لغة بالإضافة إلى الإنجليزية» مع مسارات استدلال بالإنجليزية، ليمتد إلى أكثر من 20 لغة إضافية من خلال بيانات تعليمات إضافية غير استدلالية.
• البصمة المعمارية — متطابقة. نفس أحجام الشظايا الأربعة، ونفس عدد المعاملات، ونفس طول ملف الإعداد.
• السياق — إدخال 32 ألفًا إضافةً إلى الإخراج على كلتا البطاقتين. لا يمكن التحقق من أيٍّ منهما: كلا الإعدادين محجوبان خلف بوابة الترخيص.
• معايير الأداء — لا توجد أي منها على أيٍّ من البطاقتين. ولا يوجد أي تقييم من جهات خارجية لأيٍّ من النموذجين.
• الزخم — يُظهر Base 32K صفر تنزيلات وإعجابًا واحدًا؛ ويُظهر En-Thinker سبعة تنزيلات وإعجابين. ولا يظهر أيٌّ منهما في كتالوج مزوّد استدلال.
ما الذي حقّقته خطوة ما بعد التدريب
ثلاثة أمور، كلها سلوكية وليست بنيوية.
الأول هو واجهة قابلة للاستخدام. إن نقطة تحقق بلا قالب محادثة ليست نموذجًا توجّه إليه المطالبات؛ بل نموذج تُكمل عليه. كل محادثة تجريها مع Base 32K يجب أن تحوّلها إلى نص بنفسك، وبطاقة النموذج تقول ذلك صراحةً: "ينبغي أن تستخدم المطالبات إكمال النص بدلًا من قالب محادثة. يُوصى بتدريب لاحق إضافي قبل نشره كمساعد محادثة." وقد اتخذ En-Thinker ذلك القرار نيابةً عنك بالفعل، وصولًا إلى تخطيط الرموز.
الثاني هو الاستدلال كمفتاح تبديل. أوضاع En-Thinker/think و/no_think تتيح الأوزان نفسها إما إنتاج سلسلة تفكير مرئية بين وسوم التفكير أو الإجابة مباشرة، كما توثّق البطاقة تمرير كتلة تفكير سابقة مرة أخرى إلى المحادثة كدور مساعد. هذا أثر بعد التدريب — لا يوجد شيء في نقطة تحقق أساسية يستجيب له.
الثالث هو الرهان التصميمي في قلب En-Thinker: أن الاستدلال يحدث بالإنجليزية حتى عندما يكون السؤال والجواب بلغة أخرى. تذكر البطاقة صراحةً أن هذا يميّزه عن Tiny Aya L2-Thinker، «الذي يفكّر باللغة نفسها التي يكون بها التوجيه». أما ما إذا كان التخطيط بلغة عالية الموارد والرد بلغة منخفضة الموارد يساعد فعلاً، فهي مسألة بحثية مفتوحة، وEn-Thinker موجود ليتمكن الناس من اختباره لا لحسمه. وBase 32K، إذ لا يملك أي وضع للاستدلال على الإطلاق، يلتزم الصمت إزاء السؤال — وهذا تحديدًا ما يجعله الضابط المناسب لأي شخص يحاول الإجابة عنه.

ما تكلفة خطوة ما بعد التدريب؟
الإجابة الصادقة هي أنه لا يمكن لأحد أن يحدد ذلك كميًا، لأن أيًا من النموذجين لم يُقيَّم على أي شيء. لكن البطاقتين معًا تلمحان إلى أين تكمن المقايضة، وهي ليست حيث قد تتوقع.
لا يتعلق الأمر بتغطية اللغات. إن نطاق الاستدلال الضيق لدى En-Thinker، الممتد إلى 44+ لغة بالإضافة إلى الإنجليزية، هو خاصية من خصائص بيانات التدريب على الاستدلال الخاصة به، وتقول البطاقة إن التغطية تمتد إلى أكثر من 20 لغة إضافية "عبر بيانات إرشادية إضافية غير استدلالية" — لذا يظل النموذج يتعامل معها، لكن من دون مسار التفكير. كما أنها ليست نافذة السياق؛ فكلاهما يقول 32K.
إنه اتساع السلوك. تسرد بطاقة Base 32K «التدريب المسبق المستمر، وضبط التعليمات، والبحث في النمذجة اللغوية متعددة اللغات وطويلة السياق» بوصفها استخدامات مقصودة، مع تسمية توليد النصوص متعدد اللغات، والتلخيص، والترجمة، والتكيّف عبر اللغات جميعها تطبيقات لاحقة. أما بطاقة En-Thinker فأضيق نطاقًا: «الرياضيات، والعلوم، ومهام الاستدلال العامة، فضلًا عن اتباع التعليمات والتوليد المفتوح متعدد اللغات». إن نقطة تفتيش مُدرَّبة تدريبًا لاحقًا ذات رأي بطريقة ليست عليها نقطة تفتيش أساسية، والقيد الذي تشير إليه بطاقة Base 32K — «مهام الاستدلال بسلسلة التفكير مثل الرياضيات متعددة اللغات أضعف نسبيًا» — هو بالضبط الضعف الذي سعى التدريب اللاحق إلى إصلاحه.
إذن، تُقرأ العائلة بوصفها تقسيمًا للعمل لا منافسةً. فالقاعدة واسعة وغير مكتملة؛ وEn-Thinker ضيّق ومكتمل؛ ونص بطاقة القاعدة نفسه يسمّيه بما هو عليه — الركيزة التي شُكّل منها كِلا الـThinkers.
الترخيص هو القيد الذي يُلزم فعليًا
كلا النموذجين مرخّصان بموجب CC-BY-NC-4.0 مع طبقة إضافية من سياسة الاستخدام المقبول الخاصة بـ Cohere Labs، وكلاهما يقع خلف نفس البوابة التي تطلب منك قبول الشروط والتسجيل قبل تنزيل الملفات، وكلاهما يوجّه الأسئلة التجارية إلى Cohere Sales.
يستحق هذا الذكر قبل أي مقارنة تقنية، لأنه يحسم السؤال لجزء كبير من القراء. إذا كانت الخطة منتجًا تجاريًا، فلا تُعد أي من نقطتي الحفظ مرشحًا دون محادثة مع Cohere، ولا يغيّر ذلك أي قدر من سلوك السياق الطويل أو مرونة وضع الاستدلال. أما حين يكون السياق غير التجاري مقبولًا فعلًا — عمل أكاديمي، أو بحث داخلي، أو إطار اختبار مرجعي، أو مقارنة بنموذجك الخاص — فإن الترخيص غير ذي صلة، والخيار التقني هو القرار كله.
لم يتم قياس أداء أي منهما. إليك كيفية الاختيار على أي حال.
غياب الأرقام حقيقي، ولن يُحلّ بقراءة أكثر تمعّنًا. كلتا البطاقتين لا تقدّمان أي ادعاءات أداء، ولا تُدرج أي لوحة صدارة أيًّا من النموذجين، ولا يقف خلف أيٍّ منهما مزوّد استدلال — بمعنى أن لا مزوّد نشر معدّل الإنتاجية أو التسعير الذي يحلّ عادةً محلّ معيار قياس. ما يمكنك فعله هو أن تنتقد البنية، حيث الأدلة متينة.
• اختر Tiny Aya Base 32K إذا كنت تنوي التدريب. التدريب المسبق المستمر، أو الضبط بالتعليمات، أو التكيّف مع مجال معيّن فوق نموذج متعدد اللغات بحجم 3.35B هو ما تقول البطاقة إنه مخصص له، والبدء من نقطة تحقق أساسية يعني أنك لا تصارع تدريبًا لاحقًا لم تختره. كما تدعم نافذة 32K أبحاث السياق الطويل التي لم تستطع قاعدة فبراير 8K دعمها.
• اختر Tiny Aya En-Thinker إذا كنت ترغب في إدخال مطالبة اليوم. فهو الوحيد من بين الاثنين الذي سيجري محادثة، والوحيد الذي يمتلك وضع استدلال على الإطلاق.
• اختر كليهما إذا كان السؤال علميًا لا عمليًا. فهذا الزوج مقارنة مضبوطة — البنية نفسها، والحجم نفسه، والنافذة نفسها، ويختلف في الأساس في ما إذا كان التدريب اللاحق قد حدث أم لا — لطرح سؤال ما إذا كانت آثار الاستدلال بالإنجليزية تحسّن الإجابات متعددة اللغات. هذا هو السؤال الذي أُطلق En-Thinker ليتيح للناس استقصاءه، ونموذجه الأب هو أنظف خط أساس.

ملاحظة عملية واحدة عند تقييم أيّ منهما: فهما نقطتا تفتيش بحثيتان غير مُثبتتين وبلا سجل نشر، كما أن تنزيل BF16 بحجم 6.7 GB إضافةً إلى وقت GPU يمثل تكلفة حقيقية تُنفق على نموذج لم يُشغَّل مستقلًا قط. إن إجراء تلك المقارنة عبر نقطة نهاية واحدة بدلًا من تهيئة الأوزان لكل مرشح أرخص — إذ يحمل OrcaRouter 195 نموذجًا خلف واجهة API واحدة مع هامش ربح 0% على أسعار قوائم المزوّدين وتحويل تلقائي عند الفشل بين المزوّدين، لذا فإن نقطة تفتيش بحثية تختبرها فقط لا تستقر أبدًا على مسار إنتاجي. Tiny Aya ليس عليه ونحن لا نستضيفه؛ المقصود فقط أن النماذج التي ستختبره مقابلها هي في الغالب عليه.
ما الذي سيحسم هذا؟
هناك شيئان؛ نشرهما رخيص على Cohere Labs، وإنتاجهما مكلف لأي جهة أخرى.
الأول هو معيار — أي معيار. تقييم استدلال واحد متعدد اللغات يتم تشغيله على كلا نقطتي التحقق من شأنه أن يحول العائلة بأكملها من "مذكور في البطاقة" إلى "مقيس"، وسيجيب فوراً على ما إذا كان تصميم التفكير بالإنجليزية يتفوق على النموذج نفسه بدون تدريب لاحق، وهو السؤال البحثي الذي يقوم عليه الإصدار.
الثاني هو ملف إعداد. ادعاء 32K على كلتا البطاقتين غير قابل للتحقق طالما أن المستودعات مقيدة، والفرق بين تدريب مسبق حقيقي لسياق طويل وامتداد ترميز موضعي مطبّق على نقطة حفظ 8K كبير عمليًا رغم أن كليهما ينتج نموذجًا يقبل 32K رمزًا. فتح ملفي الإعداد سيسد تلك الفجوة بطريقة لا يمكن لأي نص تسويقي أن يفعلها.
حتى ذلك الحين، الإجابة الدقيقة عن سؤال «Tiny Aya Base 32K أو Tiny Aya En-Thinker» هي أن المقارنة حقيقية لكن المنافسة ليست كذلك. الأوزان نفسها، والنافذة نفسها، والترخيص نفسه، والصمت نفسه من كل من لم يُنزّلهما — أحدهما فقط لديه قالب الدردشة ووسوم التفكير، أما الآخر فهو ما صُنع منه.
