
North Small Translate 1.0 לעומת NLLB-200: 50 שפות מול 200
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 לכל 1M טוקנים
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
המודל החדש יותר מכסה רבע מהשפות. North Small Translate 1.0, אשר Cohere תיעדה בהערות השחרור שלה ב-9 בספטמבר 2026, מתרגם בין אנגלית ל-49 שפות אחרות. NLLB-200, משפחת No Language Left Behind שמטא השיקה ביולי 2022, מכסה 200 שפות. אילו מספר השפות היה כל ההשוואה, זה היה מאמר קצר, אבל זה לא כך: שני המודלים הם מכונות שונות שנבנו למשימות שונות, והפער של ארבע שנים ביניהם מתבטא בדרכים שאין להן שום קשר לכמה שפות מופיעות ברשימה. בהמשך מפורט במה כל אחד מהם באמת טוב, מה העלות להריץ אותם, ולאן הרישוי מפנה אותך.
מספר הכיסוי, בכנות
מאתיים מול חמישים הוא אמיתי, וזו הסיבה היחידה המצוטטת ביותר לשמור את NLLB-200 בסטאק. Meta אימנה אותו על יותר מ-18 מיליארד זוגות משפטים עם דגש מפורש על שפות דלות-משאבים, והוא מתרגם ישירות בין כל זוג שפות במקום לעבור דרך האנגלית כציר — בחירה תכנונית שחשובה מאוד, למשל, מבנגלית לטמילית, שבה מערכת שמתבססת על ציר אנגלי מאבדת איכות פעמיים.
מה שהמספר מסתיר הוא שהחפיפה בין שתי הרשימות היא החלק המועיל מבחינה מסחרית. חמישים השפות של North Small Translate 1.0 כוללות גרמנית, צרפתית, ספרדית, פורטוגזית, איטלקית, הולנדית, פולנית, צ'כית, יפנית, קוריאנית, סינית מפושטת ומסורתית, ערבית, עברית, הינדי, בנגלית, טמילית, טלוגו, תאית, טורקית, וייטנאמית, אינדונזית, מלאית, רוסית ואוקראינית — השפות שמהוות את הרוב המכריע של נפח הלוקליזציה הארגונית. NLLB-200 מכסה את כולן גם כן, ובנוסף עוד כ-150 שפות ש-North Small Translate 1.0 אינו נוגע בהן כלל. אז השאלה אינה איזו רשימה ארוכה יותר. השאלה היא אם בתעבורה שלך יש שפות שרק אחד מהשניים תומך בהן.
שתי מכונות שונות
פער הארכיטקטורה הוא החלק שקובע מה אפשר לבנות. הצ'קפוינט הגדול ביותר ששוחרר של NLLB-200 הוא מודל תערובת-מומחים בעל שער דליל (sparsely gated mixture-of-experts) של כ-54.5 מיליארד פרמטרים, והאחים הצפופים שלו פועלים ב-3.3B, 1.3B, ועד ל-600M מזוקק. כולם מודלים מסוג מקודד-מפענח (encoder-decoder) של רצף-לרצף (sequence-to-sequence) בשושלת M2M-100: אתה מוסר למקטען (tokenizer) מקטע מקור, והוא מחזיר מקטע מתורגם. אין תבנית צ'אט, אין הנחיית מערכת, אין מבנה רב-תורי, והצ'קפוינטים ששוחררו בנויים סביב תרגום ברמת המקטע: כרטיס המודל של Meta עצמה מציין שהמודל אומן עם אורכי קלט שאינם עולים על 512 טוקנים, ומזהיר שרצפים ארוכים יותר נפגעים. התקציב המשולב של המקטען עבור מקור ויעד הוא 1,024 טוקנים. הכרטיס של NLLB-200 מתאר אותו גם כמודל מחקרי שלא שוחרר לפריסה בייצור, ומציין שהוא אינו מיועד לתרגום מסמכים — ההבחנה שמבדילה אותו בצורה החדה ביותר ממה ש-Cohere בנתה.
North Small Translate 1.0 הוא הצורה ההפוכה. זהו MoE דליל עם מפענח בלבד, בעל 218 מיליארד פרמטרים בסך הכל ו-25 מיליארד פעילים לכל טוקן, 128 מומחים עם שמונה פעילים פלוס מומחים משותפים, ותשומת לב שמחליפה שכבות חלון הזזה (חלון 4,096, RoPE) עם שכבות תשומת לב גלובליות שאין להן הטמעות מיקום. הוא פועל מאחורי תבנית צ'אט עם הוראת מערכת ברירת מחדל, והחלון שלו הוא 16K טוקנים של קלט ו-16K טוקנים של פלט. תקציב הפלט הזה הוא הרמז: זהו מודל שנבנה כדי לקבל מסמך ולהחזיר מסמך, לא מודל שנבנה כדי לקבל משפט.
• סה״כ פרמטרים — North Small Translate 1.0: 218B MoE (25B פעילים) לעומת NLLB-200: 54.5B MoE מוביל, 600M–3.3B צפוף
• ארכיטקטורה — MoE סיבתי מבוסס-מפענח בלבד עם תבנית צ'אט לעומת seq2seq מסוג מקודד-מפענח ללא תבנית צ'אט
• הקשר — 16K קלט ו-16K פלט לעומת רמת סגמנט, תקציב טוקנייזר של 1,024 טוקנים בסך הכול
• שפות — 50 (אנגלית + 49) לעומת 200
• זוגות ישירים — דירוג ממוקד באנגלית לעומת כל-לכל ללא ציר אנגלי
• רישיון — CC BY-NC 4.0 לעומת CC BY-NC 4.0
• טביעת רגל מינימלית — 1×B200 ב-W4A16, 2×B200 ב-FP8 לעומת ~37GB VRAM ב-4-bit עבור ה-54B, 600M פועל בכל מקום
• הוכרז — 9 בספטמבר 2026 (המשקולות מוגבלות ב-Hugging Face מאז 14 באוגוסט) לעומת יולי 2022

מה עדיין בבעלות NLLB-200
שלושה דברים, והם לא סנטימנטליים. הראשון הוא הזנב הארוך: אם אתה צריך אורומו, תיגריניה, או כל אחת מכ-150 השפות שנמצאות מחוץ לרשימה של North Small Translate 1.0, ההחלטה כבר התקבלה. השני הוא טביעת רגל בקצה הקטן — הצ'קפוינט המזוקק של 600M צבר 1.4 מיליון הורדות ורץ על חומרה שאפילו לא תטען את המשקולות של Cohere, מה שהופך אותו ליחיד מבין השניים שמתאים לפריסה מבודדת מרשת או לפריסת קצה בלי טריקי קוונטיזציה. השלישי הוא בגרות: ל-NLLB-200 יש ארבע שנים של כלי עבודה, פורקים לקוונטיזציה וסיפורי מלחמה מהייצור מאחוריו, ובנוסף מאמר Nature שעבר ביקורת עמיתים מיוני 2024, שמתאר כיצד הוא נבנה. Cohere פרסמה הודעת שחרור.
העסקה בכיוון ההפוך היא קונקרטית באותה מידה. כרטיס המודל של NLLB-200 מתאר אותו כמודל מחקרי שלא שוחרר לפריסה בייצור, והצ'קפוינט הדגל שלו בגודל 54B הוא כבד משקל — כ-350GB של אחסון, ובסדר גודל של 108–120GB של VRAM כדי להריץ אותו ללא דחיסה. Meta אינה מוכרת נקודת קצה מתארחת של NLLB. הרצה שלו בקנה מידה היא הבעיה שלך, והיא בעיה אמיתית.
מלכודת הרישוי משני הצדדים
זה החלק שמפתיע אנשים, מכיוון ששני המודלים נושאים את אותו רישיון, והוא לא זה שרוב הצוותים מניחים. גם NLLB-200 וגם North Small Translate 1.0 משוחררים תחת רישיון Creative Commons Attribution-NonCommercial 4.0. אף אחד מהם אינו שמיש במוצר מסחרי כפי שפורסם. ההגבלה הלא-מסחרית של NLLB-200 הייתה שנויה במחלוקת עד כדי כך שקיים פרויקט קהילתי בשם Open-NLLB במיוחד כדי לנסות ליצור נגזרת שמישה מסחרית, מה שמתנגש ישירות ברישיון שממנו היא נגזרת. המסלול של Cohere נקי יותר: לקנות רישיון מסחרי ולפרוס דרך Model Vault, כאשר משקולות ה-FP8 חינמיות ב-Hugging Face לעבודה לא-מסחרית בלבד.
ישנה אסימטריה אחת שראויה לציון. Cohere מריצה את North Small Translate 1.0 בשכבה החינמית של Chat V2 API שלה, בחינם עבור מפתחות ניסיון וייצור עד להגעה למגבלות הקצב — כך שתוכלו להריץ הערכה אמיתית בעלות אפס ולחתום על משהו רק אם תעלו לפרודקשן. NLLB-200 נותן לכם משקלים ותו לא.

פריסה של כל אחד מהם
North Small Translate 1.0 מגיע בשלוש נקודות ביקורת — BF16, FP8 ו-NVFP4 W4A16 — עם חומרה מינימלית מפורסמת לכל אחת: ארבעה B200 או שמונה H100 עבור BF16, שני B200 או ארבעה H100 עבור FP8, ו-B200 בודד או שני H100 עבור W4A16. ההגשה עוברת דרך vLLM עם cohere_melody>=0.9.0, ו-Cohere ממליצה על פענוח חמדני (greedy decoding), בהתאמה לתצורת הייצור שלה. הפלט עטוף בסמנים <|START_TEXT|> ו-<|END_TEXT|> שאינם רשומים כאסימונים מיוחדים, כך ש-skip_special_tokens=True נאיבי ישאיר אותם בפלט שלך.
NLLB-200 נפרס דרך הנתיבים הסטנדרטיים של transformers או fairseq, עם סבילות רחבה בהרבה לחומרה קטנה, מאחר שצ'קפוינטים מזוקקים בגודל 600M ו-1.3B הם אלה שרוב האנשים מריצים בפועל. ה-MoE בגודל 54B הוא זה שדורש תכנון.
שאלת הניתוב שהמפגש הזה בעצם מייצג
לא North Small Translate 1.0 ולא NLLB-200 נמצאים בקטלוג של OrcaRouter היום, כך שזה לא מאמר על בחירה של אחד מהמדף שלנו. בכל זאת כדאי לתת שם לצורת הבעיה, כי "מודל אחד לשפות מהדרג הראשון, ואחר לזנב הארוך" הוא מדיניות ניתוב — ומדיניות ניתוב היא מסוג הדברים שצריכים לחיות בקונפיגורציה ולא בקוד האפליקציה. ה-DSL לניתוב של OrcaRouter מבטא בדיוק זאת כ-YAML בתוספת כללי CEL, כך שכלל לזוג שפות יכול לשלוח זוגות אירופיים למודל אחד ולעבור למודל חלופי כאשר זוג אינו נתמך, ושרשראות גיבוי משמעותן שספק במעלה הזרם שמתחיל להחזיר שגיאות לא יהפוך להשבתה שלך. זה מפתח אחד ואינטגרציה אחת על פני קטלוג של יותר מ-200 מודלים במחיר המחירון של הספק עם תוספת של 0%, במקום חוזה עם ספק שני עבור כל מודל תרגום שתחליט לנסות.

לאיזה אחד כדאי לך לפנות
אם אסטרטגיית התוכן שלכם נוגעת בשפות שמחוץ לחמישים השפות של Cohere, הישארו עם NLLB-200 והתייחסו לכך כמוחלט — שום מידה של מודרניות ארכיטקטונית לא מפצה על שפה חסרה. אם אתם מבצעים לוקליזציה ארגונית לשפות ש-Cohere ציינה, עובדים בתוך מסמך ולא בתוך משפט, ואתם מוכנים לקנות רישיון מסחרי, North Small Translate 1.0 הוא המודל בעל היכולת הגבוהה יותר בכל ממד שהתיעוד מציין, עם הסתייגות חשובה: הראיה היחידה לאיכותו היא נתון ספק יחיד שלא שוחזר. אם אתם עושים אב־טיפוס ואין לכם תקציב, מסלול החינם של Cohere הופך את ההערכה הזו לכמעט בחינם, וזו נקודת פתיחה טובה יותר מזו של NLLB-200, שבה המחיר של לגלות את התשובה הוא שכירות GPU.
הדרך המועילה להחזיק את שתי העובדות בו-זמנית: NLLB-200 הוא המודל שמגיע לשפות שאיש אחר לא מגיע אליהן, והוא נבנה ב-2022 עבור תרגום מחקרי ברמת משפט. North Small Translate 1.0 הוא המודל שעושה פחות שפות טוב יותר, והוא נבנה ב-2026 עבור מסמכים. הבחירה ביניהם אינה באמת שיפוט איכות. זו שאלה של אילו שפות אתה בעצם משחרר.
