
Tiny Aya Base 32K לעומת Tiny Aya En-Thinker: הורה וילד, לא יריבים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 לכל 1M טוקנים
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
שני מאגרי Hugging Face, ארבעה קטעי safetensors בכל אחד, וגדלי הקטעים תואמים במדויק עד הבית — 1,998,698,496 / 1,996,494,056 / 1,996,494,088 / 708,852,792. Tiny Aya Base 32K וגם Tiny Aya En-Thinker אינם שתי תשובות של מעבדות שונות לאותה שאלה. הם אותה ארכיטקטורת Cohere2 בגודל 3.35B בשני שלבים שונים, וכרטיס המודל של Cohere Labs עצמו אומר זאת במפורש: הצ'קפוינט הבסיסי "משמש כמודל הבסיס עבור Tiny Aya L2-Thinker ו-Tiny Aya En-Thinker."
זה הופך את המסגור הרגיל של השוואה ראש בראש לשגוי. אתה לא בוחר בין שני מודלים רב-לשוניים מתחרים מסוג 3B. אתה בוחר בין נקודת פתיחה למודל מוגמר — והשאלה המעניינת היא מה שלב הפוסט-אימון שביניהם באמת השיג, וכמה זה עלה, והאם אחד מהם שמיש למה שיש לך בראש, בהינתן ששניהם כפופים לאותו רישיון לא מסחרי ולאף אחד מהם אין אפילו מדד אחד שפורסם.
המשפט האחד שמכריע את מערכת היחסים
בדרך כלל בפיסת "vs" צריך להסיק את הקשר בין שתי נקודות ביקורת מתוך הארכיטקטורה ומספרי הפרמטרים. כאן אין צורך בכך.
הכרטיס של Tiny Aya Base 32K קובע זאת בבירור, וכדאי לקרוא אותו בעיון בגלל מקומו של המשפט — לא בהערת שוליים, אלא בסיכום המודל, בין תיאור ה-checkpoint לקרדיטים של המפתחים:
"זהו מודל בסיסי מאומן מראש ולא עבר כוונון הוראות או התאמה להעדפות. צ'קפוינט זה משמש כמודל הבסיס עבור Tiny Aya L2-Thinker ו-Tiny Aya En-Thinker."
מה שהופך את זה לראוי לפסקה הוא חוסר העקביות שהוא חושף. הכרטיס של En-Thinker עצמו אינו מזכיר את Base 32K. שורת הסיום שלו מפנה את הקוראים אל ״tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker״ — וtiny-aya-base הוא ה-checkpoint של פברואר, שתועד עם קונטקסט של 8K, ולא הווריאנט של 32K שטוען שהוא ההורה של En-Thinker. En-Thinker טוען ל-32K בכרטיס שלו. לא ניתן לאמן מודל מחדש על חלון רחב פי ארבעה מהחלון שבו הוא אומן מראש. אז הבסיס של 8K מעולם לא היה אמור להיות התשובה, והטענה של הבסיס של 32K מתאימה לחשבון, בעוד שההפניה של En-Thinker עצמו לא.
ההסבר הסביר הוא פשוט: Base 32K הועלה ב-8 בספטמבר 2026, שישה ימים לאחר ה-Thinkers, ולכן הכרטיס של En-Thinker נכתב לפני שההורה שלו התקיים, ולא עודכן מאז. זוהי מסקנה מתזמונים, לא הצהרת ספק — אבל זו הקריאה שדורשת את מספר ההנחות הקטן ביותר, ומשמעותה היא שהמסמך החדש ביותר במשפחה הוא האינפורמטיבי ביותר.

מימד אחר מימד
כל מה שלמטה הוא מה ששני הכרטיסים מציינים, בניכוי הכפילות — שניהם 3.35B, BF16, טקסט בלבד, Cohere2ForCausalLM, CC-BY-NC-4.0, עם גישה מוגבלת (gated), וללא מדדי benchmark.
• שלב — Tiny Aya Base 32K הוא בסיס מאומן מראש, "לא מכוונן להוראות או מיושר להעדפות"; Tiny Aya En-Thinker מאומן לאחר מכן על נתוני חשיבה רב־לשוניים עם עקבות חשיבה באנגלית.
• תבנית צ'אט — Base 32K אינה כוללת chat_template.jinja כלל; En-Thinker כוללת אחת, והכרטיס שלה מקדיש קטע שלם לאופן שבו היא מעבדת פניות.
• סגנון הנחיה — הדוגמה של Base 32K היא השלמה (prompt = "The capital of Spain is"); En-Thinker מצפה ל-apply_chat_template() עם רשימת הודעות.
• מצב חשיבה — ל-Base 32K אין מצב חשיבה; En-Thinker הוא דו-מצבי, מוסיף /think כברירת מחדל ופולט עקבות חשיבה באנגלית, או /no_think עם enable_thinking=False לתשובה ישירה.
• היקף שפות — הכרטיס של Base 32K טוען לאימון על 70+ שפות ומפרט 67 במפורש; En-Thinker מכסה "44 שפות ועוד אנגלית" עם שרשורי חשיבה באנגלית, ומתרחב לעוד 20+ באמצעות נתוני הוראה נוספים שאינם שרשורי חשיבה.
• טביעת רגל ארכיטקטונית — זהה. אותם ארבעה גדלי shard, אותו מספר פרמטרים, אותו אורך קובץ תצורה.
הקשר — 32K קלט ועוד פלט בשני הכרטיסים. אף אחד מהם אינו ניתן לאימות: שתי התצורות נמצאות מאחורי שער הרישיון.
• מדדים — אין באף כרטיס. לא קיימת הערכה של צד שלישי לאף אחד מהמודלים.
• תנופה — Base 32K מציג אפס הורדות ולייק אחד; En-Thinker מציג שבע הורדות ושני לייקים. אף אחד מהם לא מופיע בקטלוג של ספק הסקה.
מה שקנה שלב הפוסט-אימון
שלושה דברים, כולם התנהגותיים ולא מבניים.
הראשון הוא ממשק שמיש. צ'ק-פוינט ללא תבנית צ'אט אינו מודל שמנחים אותו; הוא {{1}}מודל שממשיכים אותו{{/1}}. כל שיחה שיש לך עם Base 32K עליך להמיר לטקסט בעצמך, והכרטיס אומר זאת במפורש: "{{2}}ההנחיות צריכות להשתמש בהשלמת טקסט במקום בתבנית צ'אט. מומלץ לבצע אימון המשך (post-training) לפני פריסתו כעוזר שיחתי.{{/2}}" En-Thinker כבר קיבל את ההחלטה הזו בשבילך, עד לפריסת הטוקנים.
השני הוא הסקה כמתג. אצל En-Thinker, /think ו/no_think הם מצבים שמאפשרים לאותם משקלים או ליצור שרשרת חשיבה גלויה בין תגי חשיבה או להשיב ישירות, והכרטיס מתעד העברה של בלוק חשיבה קודם בחזרה אל השיחה בתור תור של עוזר. זהו ארטיפקט פוסט-אימון — אין דבר בנקודת ביקורת בסיסית שמגיב לכך.
השלישי הוא ההימור העיצובי במרכזו של En-Thinker: שהחשיבה מתרחשת באנגלית גם כשהשאלה והתשובה בשפה אחרת. הכרטיס מבהיר שזה מה שמבדיל אותו מ-Tiny Aya L2-Thinker, "שחושב באותה שפה כמו ההנחיה." האם תכנון בשפה עתירת משאבים ומענה בשפה דלת משאבים אכן מועיל היא שאלת מחקר פתוחה, ו-En-Thinker קיים כדי לאפשר לאנשים לבדוק זאת ולא כדי להכריע בה. Base 32K, ללא מצב חשיבה כלל, אינו נוקט עמדה בשאלה — וזו בדיוק הסיבה שהוא קבוצת הביקורת הנכונה עבור כל מי שמנסה לענות עליה.

מה עלה שלב הפוסט-אימון
התשובה הכנה היא שאיש אינו יכול לכמת זאת, משום שאף אחד מהמודלים לא הוערך על שום דבר. אבל שני הכרטיסים יחד רומזים היכן נמצא האיזון, וזה לא היכן שהייתם מצפים.
זה לא עניין של כיסוי שפות. היקף החשיבה הצר של En-Thinker, המכסה 44+ שפות כולל אנגלית, הוא תכונה של נתוני אימון החשיבה, ובכרטיס כתוב שהכיסוי מתרחב ל-20+ שפות נוספות "באמצעות נתוני הוראה נוספים שאינם חשיבה" — כך שהמודל עדיין מטפל בהן, רק ללא מסלול החשיבה. זה גם לא חלון ההקשר; שניהם טוענים ל-32K.
מדובר ברוחב התנהגותי. כרטיס המודל של Base 32K מציין "המשך אימון מראש, כיוונון הוראות, ומחקר על מודלים רב-לשוניים ובעלי הקשר ארוך" כשימושים מיועדים, כאשר יצירת טקסט רב-לשונית, תקצור, תרגום והתאמה בין-לשונית כולן מוגדרות כיישומים במורד הזרם. הכרטיס של En-Thinker צר יותר: "משימות מתמטיקה, מדע וחשיבה כללית, וכן מעקב אחר הוראות ויצירה רב-לשונית פתוחה." נקודת ביקורת מאומנת לאחר אימון היא בעלת עמדה מובהקת באופן שנקודת ביקורת בסיסית אינה כזו, והמגבלה שכרטיס Base 32K מסמן — "משימות חשיבה שרשרת-מחשבה כגון מתמטיקה רב-לשונית חלשות יחסית" — היא בדיוק החולשה שהאימון שלאחר מכן נועד לתקן.
אז המשפחה מתפרשת כחלוקת עבודה ולא כתחרות. הבסיס רחב ולא גמור; En-Thinker צר וגמור; וטקסט קלף הבסיס עצמו קורא לזה בשמו — המצע שממנו עוצבו שני ה-Thinkers.
הרישיון הוא האילוץ שבאמת מחייב.
שני המודלים זמינים תחת רישיון CC-BY-NC-4.0, עם מדיניות השימוש המקובל של Cohere Labs נוספת על כך, שניהם נמצאים מאחורי אותו שער שמבקש ממך לקבל את התנאים ולהירשם לפני הורדת קבצים, ושניהם מפנים שאלות מסחריות ל-Cohere Sales.
כדאי להצהיר זאת לפני כל השוואה טכנית, משום שהוא מכריע את השאלה עבור חלק ניכר מהקוראים. אם התוכנית היא מוצר מסחרי, אף אחת מנקודות הביקורת אינה מועמדת ללא שיחה עם Cohere, ושום כמות של התנהגות בהקשר ארוך או גמישות במצב חשיבה לא תשנה זאת. במקום שבו שימוש לא-מסחרי הוא באמת מתאים — עבודה אקדמית, מחקר פנימי, מערך benchmark, השוואה מול המודל שלך — הרישיון אינו רלוונטי והבחירה הטכנית היא ההחלטה כולה.
אף אחד מהם לא נבדק ב-benchmark. הנה איך לבחור בכל זאת.
היעדר המספרים הוא אמיתי, וקריאה זהירה יותר לא תפתור אותו. שני הכרטיסים לא מציגים שום טענות ביצועים, אף לוח תוצאות לא כולל אף אחד מהמודלים, ולאף אחד מהם אין ספק אינפרנס מאחוריו — כלומר, אף ספק לא פרסם את התפוקה או התמחור שבדרך כלל משמשים תחליף לבנצ'מרק. מה שאפשר לעשות הוא להתמקד במבנה, שבו הראיות מוצקות.
• בחרו ב-Tiny Aya Base 32K אם אתם מתכוונים לאמן. המשך אימון מקדים, כוונון הוראות, או התאמה לתחום על גבי מודל רב-לשוני בגודל 3.35B הוא מה שכרטיס המודל אומר שהוא מיועד לו, והתחלה מנקודת בסיס משמעותה שאינכם נאבקים ב-post-training שלא בחרתם. חלון ה-32K גם תומך במחקר עם הקשר ארוך, מה שבסיס ה-8K של פברואר לא יכול היה.
• בחר ב‑Tiny Aya En‑Thinker אם ברצונך להזין הנחיה היום. זהו היחיד מבין השניים שמנהל שיחה, והיחיד שיש לו מצב חשיבה בכלל.
• בחר בשניהם אם השאלה היא מדעית ולא מעשית. הצמד הוא השוואה מבוקרת — אותה ארכיטקטורה, אותו גודל, אותו חלון, שונים בעיקר בשאלה האם בוצע אימון-לאחר — לבדיקת השאלה האם עקבות חשיבה באנגלית משפרות תשובות רב-לשוניות. זו השאלה ש-En-Thinker שוחרר כדי לאפשר לאנשים לחקור, וההורה שלו עצמו הוא קו הבסיס הנקי ביותר.

הערה מעשית אחת לגבי הערכת כל אחד מהם: הן נקודות ביקורת מחקריות לא מוכחות ללא היסטוריית פריסה, והורדה של 6.7 GB בפורמט BF16 בתוספת זמן GPU היא עלות אמיתית להשקיע במודל שמעולם לא הופעל באופן עצמאי. הרצת ההשוואה דרך נקודת קצה אחת במקום להעלות משקלים לכל מועמד היא זולה יותר — OrcaRouter מחזיק 195 מודלים דרך API אחד עם תוספת של 0% על מחירי הספקים ומעבר אוטומטי בין ספקים, כך שנקודת ביקורת מחקרית שאתם רק בודקים לעולם לא יושבת על נתיב ייצור. Tiny Aya לא עליו ואנחנו לא מארחים אותו; הנקודה היא רק שהמודלים שהייתם בודקים אותו נגדםבעיקר נמצאים.
מה יפתור את זה?
שני דברים, ושניהם זולים עבור Cohere Labs לפרסם, ויקרים עבור כל אחד אחר להפיק.
הראשון הוא benchmark — כל benchmark. ריצת הערכה אחת של חשיבה רב-לשונית על שני הצ'קפוינטים הייתה הופכת את כל המשפחה מ"מוצהר בכרטיס" ל"נמדד", ומיד הייתה עונה על השאלה האם העיצוב החושב באנגלית מנצח את אותו מודל ללא אימון משלים — שהיא שאלת המחקר שסביבה בנוי השחרור.
השני הוא קובץ הגדרות. הטענה לגבי 32K בשני הכרטיסים אינה ניתנת לאימות כל עוד המאגרים חסומים, וההבדל בין ריצת פרה-אימון אמיתית בעלת הקשר ארוך לבין הרחבת positional-encoding המוחלת על checkpoint של 8K הוא גדול בפועל, גם אם שתי הגישות מייצרות מודל שמקבל 32K טוקנים. פתיחת שני קבצי ההגדרות תסגור את הפער הזה בדרך ששום פרסום שיווקי לא יכול.
עד אז, התשובה המדויקת ל-{{1}}"Tiny Aya Base 32K או Tiny Aya En-Thinker"{{/1}} היא שההשוואה אמיתית, אבל התחרות לא. {{2}}אותם משקלים, אותו חלון, אותו רישיון, אותה שתיקה מכל מי שלא הוריד אותם{{/2}} — {{3}}לאחד מהם פשוט יש את תבנית הצ'אט ואת תגי החשיבה{{/3}}, והשני הוא מה שהוא נוצר ממנו.
