بطاقة عنوان بأسلوب مخطط لـ «Tiny Aya Base 32K مقابل Tiny Aya En-Thinker». توجد بطاقتان مستديرتان جنبًا إلى جنب، يربط بينهما من اليسار إلى اليمين سهم مُعنون بـ «التدريب اللاحق». البطاقة اليسرى، «Tiny Aya Base 32K»، تحمل السطرين «قاعدة مُدرَّبة مسبقًا» و«لا يوجد قالب محادثة»؛ أما البطاقة اليمنى، «Tiny Aya En-Thinker»، فتحمل «مُدرَّبة لاحقًا» و«وضع التفكير مُضمَّن». ويظهر سطر متمركز تحتهما: «البنية نفسها بحجم 3.35B، والنافذة نفسها 32K». شعار OrcaRouter مُركَّب في الزاوية السفلية اليمنى.
Guides & Insights

Tiny Aya Base 32K مقابل Tiny Aya En-Thinker: الأصل والفرع، ليسا منافسين

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

مستودعان على Hugging Face، بأربع شظايا safetensors لكل منهما، وتتطابق أحجام الشظايا إلى البايت — 1,998,698,496 / 1,996,494,056 / 1,996,494,088 / 708,852,792. Tiny Aya Base 32K و Tiny Aya En-Thinker ليسا إجابتي مختبرين مختلفين عن السؤال نفسه. إنهما نفس معمارية Cohere2 بحجم 3.35B في مرحلتين مختلفتين، وبطاقة النموذج الخاصة بـ Cohere Labs تقول ذلك صراحةً: نقطة التحقق الأساسية "تُستخدم كنموذج أساسي لـ Tiny Aya L2-Thinker و Tiny Aya En-Thinker."

هذا يجعل التأطير المعتاد للمواجهة المباشرة خاطئًا. أنت لا تختار بين نموذجين متنافسين متعددي اللغات بحجم 3B. أنت تختار بين نقطة بداية ونموذج مكتمل — والسؤال المثير للاهتمام هو ما الذي حققته فعلاً خطوة التدريب اللاحق بينهما، وما تكلفته، وما إذا كان أي منهما قابلاً للاستخدام لما في ذهنك بالنظر إلى أن كليهما يخضع للترخيص غير التجاري نفسه ولا يملك أي منهما معيارًا منشورًا واحدًا.

الجملة الواحدة التي تحسم العلاقة

عادةً ما يتعين على مقال "vs" أن يستنتج العلاقة بين نقطتي حفظ من البنية وأعداد المعلمات. هنا لا يتعين عليك ذلك.

تذكر بطاقة Tiny Aya Base 32K الأمر بوضوح، ويستحق قراءة متأنية بسبب موضع الجملة — لا في حاشية، بل في ملخّص النموذج، بين وصف نقطة الحفظ واعتمادات المطوّرين:

"هذا نموذج أساسي مُدرَّب مسبقًا ولم يخضع للضبط الدقيق بالتعليمات أو المحاذاة مع التفضيلات. تُستخدم نقطة التفتيش هذه كنموذج أساسي لـ Tiny Aya L2-Thinker و Tiny Aya En-Thinker."

ما يجعل ذلك يستحق فقرة هو التناقض الذي يكشفه. بطاقة En-Thinker نفسها لا تذكر Base 32K. سطرها الختامي يوجّه القراء إلى "tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker" — وtiny-aya-base هو نقطة التحقق الخاصة بشهر فبراير، الموثّقة بسياق 8K، وليس المتغيّر 32K الذي يقول إنه النموذج الأب لـ En-Thinker. يدّعي En-Thinker سياق 32K على بطاقته الخاصة. لا يمكن أن يُدرَّب نموذج تدريبًا لاحقًا ليصل إلى نافذة أوسع أربع مرات من النافذة التي دُرِّب عليها مسبقًا. لذا لم يكن من الممكن أن يكون النموذج الأساس 8K هو الجواب أبدًا، وادعاء النموذج الأساس 32K يتوافق مع الحساب حيث لا تتفق إشارة En-Thinker نفسه.

التفسير الأرجح عادي: تم رفع Base 32K في 8 سبتمبر 2026، ستة أيام بعد Thinkers، لذا كُتبت بطاقة En-Thinker قبل وجود أصله ولم تُحدَّث منذ ذلك الحين. هذا استدلال من الطوابع الزمنية، وليس تصريحًا من بائع — لكنه القراءة التي تتطلب أقل عدد من الافتراضات، ويعني أن أحدث مستند في العائلة هو الأكثر إفادة.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-base-32K. The page is licence-gated, and the card summary states Model Size 3.35B and Context Length 32K (input + output), followed by the line 'This checkpoint is used as the base model for Tiny Aya L2-Thinker and Tiny Aya En-Thinker' and 'For the 8K release, see tiny-aya-base.' The tags row includes long-context and 46 languages, and the Inference Providers panel reads 'This model isn't deployed by any Inference Provider.'

بُعدًا بُعدًا

كل ما يلي هو ما تذكره البطاقتان، بعد إزالة التكرار — كلتاهما 3.35B، وBF16، ونصيتان فقط، وCohere2ForCausalLM، وCC-BY-NC-4.0، ومقيّدتا الوصول، وغير مُختبَرتين بمعايير.

• المرحلة — Tiny Aya Base 32K هو نموذج أساسي مُدرَّب مسبقًا، «غير مُضبَط بالتعليمات ولا مُتوافِق مع التفضيلات»؛ أما Tiny Aya En-Thinker فقد دُرِّب لاحقًا على بيانات استدلال متعددة اللغات، مع مسارات استدلال بالإنجليزية.

• قالب الدردشة — لا يتضمن Base 32K أي chat_template.jinja على الإطلاق؛ أما En-Thinker فيتضمن واحدًا، وتخصّص بطاقته قسمًا كاملًا لكيفية عرضه لجولات المحادثة.

• نمط التلقين — مثال Base 32K نفسه هو الإكمال (prompt = "عاصمة إسبانيا هي")؛ يتوقع En-Thinker apply_chat_template() مع قائمة رسائل.

• وضع الاستدلال — لا يمتلك Base 32K وضع استدلال؛ En-Thinker ثنائي الوضع، ويضيف /think افتراضيًا ويُصدر أثر تفكير باللغة الإنجليزية، أو /no_think مع enable_thinking=False للحصول على إجابة مباشرة.

• نطاق اللغات — تدّعي بطاقة Base 32K التدريب على أكثر من 70 لغة وتسمّي 67 منها صراحةً؛ بينما يغطي En-Thinker «44 لغة بالإضافة إلى الإنجليزية» مع مسارات استدلال بالإنجليزية، ليمتد إلى أكثر من 20 لغة إضافية من خلال بيانات تعليمات إضافية غير استدلالية.

• البصمة المعمارية — متطابقة. نفس أحجام الشظايا الأربعة، ونفس عدد المعاملات، ونفس طول ملف الإعداد.

• السياق — إدخال 32 ألفًا إضافةً إلى الإخراج على كلتا البطاقتين. لا يمكن التحقق من أيٍّ منهما: كلا الإعدادين محجوبان خلف بوابة الترخيص.

• معايير الأداء — لا توجد أي منها على أيٍّ من البطاقتين. ولا يوجد أي تقييم من جهات خارجية لأيٍّ من النموذجين.

• الزخم — يُظهر Base 32K صفر تنزيلات وإعجابًا واحدًا؛ ويُظهر En-Thinker سبعة تنزيلات وإعجابين. ولا يظهر أيٌّ منهما في كتالوج مزوّد استدلال.

ما الذي حقّقته خطوة ما بعد التدريب

ثلاثة أمور، كلها سلوكية وليست بنيوية.

الأول هو واجهة قابلة للاستخدام. إن نقطة تحقق بلا قالب محادثة ليست نموذجًا توجّه إليه المطالبات؛ بل نموذج تُكمل عليه. كل محادثة تجريها مع Base 32K يجب أن تحوّلها إلى نص بنفسك، وبطاقة النموذج تقول ذلك صراحةً: "ينبغي أن تستخدم المطالبات إكمال النص بدلًا من قالب محادثة. يُوصى بتدريب لاحق إضافي قبل نشره كمساعد محادثة." وقد اتخذ En-Thinker ذلك القرار نيابةً عنك بالفعل، وصولًا إلى تخطيط الرموز.

الثاني هو الاستدلال كمفتاح تبديل. أوضاع En-Thinker/think و/no_think تتيح الأوزان نفسها إما إنتاج سلسلة تفكير مرئية بين وسوم التفكير أو الإجابة مباشرة، كما توثّق البطاقة تمرير كتلة تفكير سابقة مرة أخرى إلى المحادثة كدور مساعد. هذا أثر بعد التدريب — لا يوجد شيء في نقطة تحقق أساسية يستجيب له.

الثالث هو الرهان التصميمي في قلب En-Thinker: أن الاستدلال يحدث بالإنجليزية حتى عندما يكون السؤال والجواب بلغة أخرى. تذكر البطاقة صراحةً أن هذا يميّزه عن Tiny Aya L2-Thinker، «الذي يفكّر باللغة نفسها التي يكون بها التوجيه». أما ما إذا كان التخطيط بلغة عالية الموارد والرد بلغة منخفضة الموارد يساعد فعلاً، فهي مسألة بحثية مفتوحة، وEn-Thinker موجود ليتمكن الناس من اختباره لا لحسمه. وBase 32K، إذ لا يملك أي وضع للاستدلال على الإطلاق، يلتزم الصمت إزاء السؤال — وهذا تحديدًا ما يجعله الضابط المناسب لأي شخص يحاول الإجابة عنه.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-en-thinker, also licence-gated. The tags row reads Text Generation, Transformers, Safetensors, 46 languages, cohere2, aya, reasoning, tiny-aya, conversational and License: cc-by-nc-4.0, and the safetensors panel additionally shows a Chat template entry. The summary describes a 3.35 billion parameter multilingual reasoning model trained with English reasoning traces for 44 languages plus English, and the card lists Model Size 3.35B and Context Length 32K (input + output). The closing line points readers to tiny-aya-global, tiny-aya-base and tiny-aya-l2-thinker, and the sidebar shows 7 downloads last month and 'This model isn't deployed by any Inference Provider.'

ما تكلفة خطوة ما بعد التدريب؟

الإجابة الصادقة هي أنه لا يمكن لأحد أن يحدد ذلك كميًا، لأن أيًا من النموذجين لم يُقيَّم على أي شيء. لكن البطاقتين معًا تلمحان إلى أين تكمن المقايضة، وهي ليست حيث قد تتوقع.

لا يتعلق الأمر بتغطية اللغات. إن نطاق الاستدلال الضيق لدى En-Thinker، الممتد إلى 44+ لغة بالإضافة إلى الإنجليزية، هو خاصية من خصائص بيانات التدريب على الاستدلال الخاصة به، وتقول البطاقة إن التغطية تمتد إلى أكثر من 20 لغة إضافية "عبر بيانات إرشادية إضافية غير استدلالية" — لذا يظل النموذج يتعامل معها، لكن من دون مسار التفكير. كما أنها ليست نافذة السياق؛ فكلاهما يقول 32K.

إنه اتساع السلوك. تسرد بطاقة Base 32K «التدريب المسبق المستمر، وضبط التعليمات، والبحث في النمذجة اللغوية متعددة اللغات وطويلة السياق» بوصفها استخدامات مقصودة، مع تسمية توليد النصوص متعدد اللغات، والتلخيص، والترجمة، والتكيّف عبر اللغات جميعها تطبيقات لاحقة. أما بطاقة En-Thinker فأضيق نطاقًا: «الرياضيات، والعلوم، ومهام الاستدلال العامة، فضلًا عن اتباع التعليمات والتوليد المفتوح متعدد اللغات». إن نقطة تفتيش مُدرَّبة تدريبًا لاحقًا ذات رأي بطريقة ليست عليها نقطة تفتيش أساسية، والقيد الذي تشير إليه بطاقة Base 32K — «مهام الاستدلال بسلسلة التفكير مثل الرياضيات متعددة اللغات أضعف نسبيًا» — هو بالضبط الضعف الذي سعى التدريب اللاحق إلى إصلاحه.

إذن، تُقرأ العائلة بوصفها تقسيمًا للعمل لا منافسةً. فالقاعدة واسعة وغير مكتملة؛ وEn-Thinker ضيّق ومكتمل؛ ونص بطاقة القاعدة نفسه يسمّيه بما هو عليه — الركيزة التي شُكّل منها كِلا الـThinkers.

الترخيص هو القيد الذي يُلزم فعليًا

كلا النموذجين مرخّصان بموجب CC-BY-NC-4.0 مع طبقة إضافية من سياسة الاستخدام المقبول الخاصة بـ Cohere Labs، وكلاهما يقع خلف نفس البوابة التي تطلب منك قبول الشروط والتسجيل قبل تنزيل الملفات، وكلاهما يوجّه الأسئلة التجارية إلى Cohere Sales.

يستحق هذا الذكر قبل أي مقارنة تقنية، لأنه يحسم السؤال لجزء كبير من القراء. إذا كانت الخطة منتجًا تجاريًا، فلا تُعد أي من نقطتي الحفظ مرشحًا دون محادثة مع Cohere، ولا يغيّر ذلك أي قدر من سلوك السياق الطويل أو مرونة وضع الاستدلال. أما حين يكون السياق غير التجاري مقبولًا فعلًا — عمل أكاديمي، أو بحث داخلي، أو إطار اختبار مرجعي، أو مقارنة بنموذجك الخاص — فإن الترخيص غير ذي صلة، والخيار التقني هو القرار كله.

لم يتم قياس أداء أي منهما. إليك كيفية الاختيار على أي حال.

غياب الأرقام حقيقي، ولن يُحلّ بقراءة أكثر تمعّنًا. كلتا البطاقتين لا تقدّمان أي ادعاءات أداء، ولا تُدرج أي لوحة صدارة أيًّا من النموذجين، ولا يقف خلف أيٍّ منهما مزوّد استدلال — بمعنى أن لا مزوّد نشر معدّل الإنتاجية أو التسعير الذي يحلّ عادةً محلّ معيار قياس. ما يمكنك فعله هو أن تنتقد البنية، حيث الأدلة متينة.

• اختر Tiny Aya Base 32K إذا كنت تنوي التدريب. التدريب المسبق المستمر، أو الضبط بالتعليمات، أو التكيّف مع مجال معيّن فوق نموذج متعدد اللغات بحجم 3.35B هو ما تقول البطاقة إنه مخصص له، والبدء من نقطة تحقق أساسية يعني أنك لا تصارع تدريبًا لاحقًا لم تختره. كما تدعم نافذة 32K أبحاث السياق الطويل التي لم تستطع قاعدة فبراير 8K دعمها.

• اختر Tiny Aya En-Thinker إذا كنت ترغب في إدخال مطالبة اليوم. فهو الوحيد من بين الاثنين الذي سيجري محادثة، والوحيد الذي يمتلك وضع استدلال على الإطلاق.

• اختر كليهما إذا كان السؤال علميًا لا عمليًا. فهذا الزوج مقارنة مضبوطة — البنية نفسها، والحجم نفسه، والنافذة نفسها، ويختلف في الأساس في ما إذا كان التدريب اللاحق قد حدث أم لا — لطرح سؤال ما إذا كانت آثار الاستدلال بالإنجليزية تحسّن الإجابات متعددة اللغات. هذا هو السؤال الذي أُطلق En-Thinker ليتيح للناس استقصاءه، ونموذجه الأب هو أنظف خط أساس.

A two-column scoreboard titled 'Tiny Aya Base 32K vs Tiny Aya En-Thinker — the scoreboard'. Both columns use the same six labels. The 'Tiny Aya Base 32K' column reads 'Stage: Pretrained base', 'Chat template: none', 'Reasoning mode: none', 'Languages: 70+ claimed', 'Benchmarks: none published' and 'Providers: none'. The 'Tiny Aya En-Thinker' column reads 'Stage: Post-trained SFT', 'Chat template: included', 'Reasoning mode: thinking mode', 'Languages: 44 + English', 'Benchmarks: none published' and 'Providers: none'. A footer reads 'Both cards stated by Cohere Labs; neither model has any independent benchmark.' The OrcaRouter logo is composited in the bottom-right corner.

ملاحظة عملية واحدة عند تقييم أيّ منهما: فهما نقطتا تفتيش بحثيتان غير مُثبتتين وبلا سجل نشر، كما أن تنزيل BF16 بحجم 6.7 GB إضافةً إلى وقت GPU يمثل تكلفة حقيقية تُنفق على نموذج لم يُشغَّل مستقلًا قط. إن إجراء تلك المقارنة عبر نقطة نهاية واحدة بدلًا من تهيئة الأوزان لكل مرشح أرخص — إذ يحمل OrcaRouter 195 نموذجًا خلف واجهة API واحدة مع هامش ربح 0% على أسعار قوائم المزوّدين وتحويل تلقائي عند الفشل بين المزوّدين، لذا فإن نقطة تفتيش بحثية تختبرها فقط لا تستقر أبدًا على مسار إنتاجي. Tiny Aya ليس عليه ونحن لا نستضيفه؛ المقصود فقط أن النماذج التي ستختبره مقابلها هي في الغالب عليه.

ما الذي سيحسم هذا؟

هناك شيئان؛ نشرهما رخيص على Cohere Labs، وإنتاجهما مكلف لأي جهة أخرى.

الأول هو معيار — أي معيار. تقييم استدلال واحد متعدد اللغات يتم تشغيله على كلا نقطتي التحقق من شأنه أن يحول العائلة بأكملها من "مذكور في البطاقة" إلى "مقيس"، وسيجيب فوراً على ما إذا كان تصميم التفكير بالإنجليزية يتفوق على النموذج نفسه بدون تدريب لاحق، وهو السؤال البحثي الذي يقوم عليه الإصدار.

الثاني هو ملف إعداد. ادعاء 32K على كلتا البطاقتين غير قابل للتحقق طالما أن المستودعات مقيدة، والفرق بين تدريب مسبق حقيقي لسياق طويل وامتداد ترميز موضعي مطبّق على نقطة حفظ 8K كبير عمليًا رغم أن كليهما ينتج نموذجًا يقبل 32K رمزًا. فتح ملفي الإعداد سيسد تلك الفجوة بطريقة لا يمكن لأي نص تسويقي أن يفعلها.

حتى ذلك الحين، الإجابة الدقيقة عن سؤال «Tiny Aya Base 32K أو Tiny Aya En-Thinker» هي أن المقارنة حقيقية لكن المنافسة ليست كذلك. الأوزان نفسها، والنافذة نفسها، والترخيص نفسه، والصمت نفسه من كل من لم يُنزّلهما — أحدهما فقط لديه قالب الدردشة ووسوم التفكير، أما الآخر فهو ما صُنع منه.