כרטיס הירו להתמודדות שכותרתה "North Small Translate 1.0 מול NLLB-200" עם כותרת המשנה "50 שפות מול 200", מעל שני כרטיסים: North Small Translate 1.0 (218B MoE / 25B פעילים, 2026, חלון הקשר של 16K) ו-NLLB-200 (54.5B MoE ספינת דגל, 2022, 200 שפות).
Guides & Insights

North Small Translate 1.0 לעומת NLLB-200: 50 שפות מול 200

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

המודל החדש יותר מכסה רבע מהשפות. North Small Translate 1.0, אשר Cohere תיעדה בהערות השחרור שלה ב-9 בספטמבר 2026, מתרגם בין אנגלית ל-49 שפות אחרות. NLLB-200, משפחת No Language Left Behind שמטא השיקה ביולי 2022, מכסה 200 שפות. אילו מספר השפות היה כל ההשוואה, זה היה מאמר קצר, אבל זה לא כך: שני המודלים הם מכונות שונות שנבנו למשימות שונות, והפער של ארבע שנים ביניהם מתבטא בדרכים שאין להן שום קשר לכמה שפות מופיעות ברשימה. בהמשך מפורט במה כל אחד מהם באמת טוב, מה העלות להריץ אותם, ולאן הרישוי מפנה אותך.

מספר הכיסוי, בכנות

מאתיים מול חמישים הוא אמיתי, וזו הסיבה היחידה המצוטטת ביותר לשמור את NLLB-200 בסטאק. Meta אימנה אותו על יותר מ-18 מיליארד זוגות משפטים עם דגש מפורש על שפות דלות-משאבים, והוא מתרגם ישירות בין כל זוג שפות במקום לעבור דרך האנגלית כציר — בחירה תכנונית שחשובה מאוד, למשל, מבנגלית לטמילית, שבה מערכת שמתבססת על ציר אנגלי מאבדת איכות פעמיים.

מה שהמספר מסתיר הוא שהחפיפה בין שתי הרשימות היא החלק המועיל מבחינה מסחרית. חמישים השפות של North Small Translate 1.0 כוללות גרמנית, צרפתית, ספרדית, פורטוגזית, איטלקית, הולנדית, פולנית, צ'כית, יפנית, קוריאנית, סינית מפושטת ומסורתית, ערבית, עברית, הינדי, בנגלית, טמילית, טלוגו, תאית, טורקית, וייטנאמית, אינדונזית, מלאית, רוסית ואוקראינית — השפות שמהוות את הרוב המכריע של נפח הלוקליזציה הארגונית. NLLB-200 מכסה את כולן גם כן, ובנוסף עוד כ-150 שפות ש-North Small Translate 1.0 אינו נוגע בהן כלל. אז השאלה אינה איזו רשימה ארוכה יותר. השאלה היא אם בתעבורה שלך יש שפות שרק אחד מהשניים תומך בהן.

שתי מכונות שונות

פער הארכיטקטורה הוא החלק שקובע מה אפשר לבנות. הצ'קפוינט הגדול ביותר ששוחרר של NLLB-200 הוא מודל תערובת-מומחים בעל שער דליל (sparsely gated mixture-of-experts) של כ-54.5 מיליארד פרמטרים, והאחים הצפופים שלו פועלים ב-3.3B, 1.3B, ועד ל-600M מזוקק. כולם מודלים מסוג מקודד-מפענח (encoder-decoder) של רצף-לרצף (sequence-to-sequence) בשושלת M2M-100: אתה מוסר למקטען (tokenizer) מקטע מקור, והוא מחזיר מקטע מתורגם. אין תבנית צ'אט, אין הנחיית מערכת, אין מבנה רב-תורי, והצ'קפוינטים ששוחררו בנויים סביב תרגום ברמת המקטע: כרטיס המודל של Meta עצמה מציין שהמודל אומן עם אורכי קלט שאינם עולים על 512 טוקנים, ומזהיר שרצפים ארוכים יותר נפגעים. התקציב המשולב של המקטען עבור מקור ויעד הוא 1,024 טוקנים. הכרטיס של NLLB-200 מתאר אותו גם כמודל מחקרי שלא שוחרר לפריסה בייצור, ומציין שהוא אינו מיועד לתרגום מסמכים — ההבחנה שמבדילה אותו בצורה החדה ביותר ממה ש-Cohere בנתה.

North Small Translate 1.0 הוא הצורה ההפוכה. זהו MoE דליל עם מפענח בלבד, בעל 218 מיליארד פרמטרים בסך הכל ו-25 מיליארד פעילים לכל טוקן, 128 מומחים עם שמונה פעילים פלוס מומחים משותפים, ותשומת לב שמחליפה שכבות חלון הזזה (חלון 4,096, RoPE) עם שכבות תשומת לב גלובליות שאין להן הטמעות מיקום. הוא פועל מאחורי תבנית צ'אט עם הוראת מערכת ברירת מחדל, והחלון שלו הוא 16K טוקנים של קלט ו-16K טוקנים של פלט. תקציב הפלט הזה הוא הרמז: זהו מודל שנבנה כדי לקבל מסמך ולהחזיר מסמך, לא מודל שנבנה כדי לקבל משפט.

סה״כ פרמטרים — North Small Translate 1.0: 218B MoE (25B פעילים) לעומת NLLB-200: 54.5B MoE מוביל, 600M–3.3B צפוף

ארכיטקטורה — MoE סיבתי מבוסס-מפענח בלבד עם תבנית צ'אט לעומת seq2seq מסוג מקודד-מפענח ללא תבנית צ'אט

הקשר — 16K קלט ו-16K פלט לעומת רמת סגמנט, תקציב טוקנייזר של 1,024 טוקנים בסך הכול

שפות — 50 (אנגלית + 49) לעומת 200

זוגות ישירים — דירוג ממוקד באנגלית לעומת כל-לכל ללא ציר אנגלי

רישיון — CC BY-NC 4.0 לעומת CC BY-NC 4.0

טביעת רגל מינימלית — 1×B200 ב-W4A16, 2×B200 ב-FP8 לעומת ~37GB VRAM ב-4-bit עבור ה-54B, 600M פועל בכל מקום

הוכרז — 9 בספטמבר 2026 (המשקולות מוגבלות ב-Hugging Face מאז 14 באוגוסט) לעומת יולי 2022

Two-column scoreboard comparing North Small Translate 1.0 and NLLB-200 across six rows: Parameters 218B MoE / 25B active vs 54.5B MoE flagship; Context 16K in / 16K out vs segment-level, 1,024 tokens; Languages 50 vs 200; Direct pairs English-centric tiering vs any-to-any no pivot; License CC BY-NC 4.0 vs CC BY-NC 4.0; Minimum hardware 1x B200 at W4A16 vs 600M distilled, any GPU.

מה עדיין בבעלות NLLB-200

שלושה דברים, והם לא סנטימנטליים. הראשון הוא הזנב הארוך: אם אתה צריך אורומו, תיגריניה, או כל אחת מכ-150 השפות שנמצאות מחוץ לרשימה של North Small Translate 1.0, ההחלטה כבר התקבלה. השני הוא טביעת רגל בקצה הקטן — הצ'קפוינט המזוקק של 600M צבר 1.4 מיליון הורדות ורץ על חומרה שאפילו לא תטען את המשקולות של Cohere, מה שהופך אותו ליחיד מבין השניים שמתאים לפריסה מבודדת מרשת או לפריסת קצה בלי טריקי קוונטיזציה. השלישי הוא בגרות: ל-NLLB-200 יש ארבע שנים של כלי עבודה, פורקים לקוונטיזציה וסיפורי מלחמה מהייצור מאחוריו, ובנוסף מאמר Nature שעבר ביקורת עמיתים מיוני 2024, שמתאר כיצד הוא נבנה. Cohere פרסמה הודעת שחרור.

העסקה בכיוון ההפוך היא קונקרטית באותה מידה. כרטיס המודל של NLLB-200 מתאר אותו כמודל מחקרי שלא שוחרר לפריסה בייצור, והצ'קפוינט הדגל שלו בגודל 54B הוא כבד משקל — כ-350GB של אחסון, ובסדר גודל של 108–120GB של VRAM כדי להריץ אותו ללא דחיסה. Meta אינה מוכרת נקודת קצה מתארחת של NLLB. הרצה שלו בקנה מידה היא הבעיה שלך, והיא בעיה אמיתית.

מלכודת הרישוי משני הצדדים

זה החלק שמפתיע אנשים, מכיוון ששני המודלים נושאים את אותו רישיון, והוא לא זה שרוב הצוותים מניחים. גם NLLB-200 וגם North Small Translate 1.0 משוחררים תחת רישיון Creative Commons Attribution-NonCommercial 4.0. אף אחד מהם אינו שמיש במוצר מסחרי כפי שפורסם. ההגבלה הלא-מסחרית של NLLB-200 הייתה שנויה במחלוקת עד כדי כך שקיים פרויקט קהילתי בשם Open-NLLB במיוחד כדי לנסות ליצור נגזרת שמישה מסחרית, מה שמתנגש ישירות ברישיון שממנו היא נגזרת. המסלול של Cohere נקי יותר: לקנות רישיון מסחרי ולפרוס דרך Model Vault, כאשר משקולות ה-FP8 חינמיות ב-Hugging Face לעבודה לא-מסחרית בלבד.

ישנה אסימטריה אחת שראויה לציון. Cohere מריצה את North Small Translate 1.0 בשכבה החינמית של Chat V2 API שלה, בחינם עבור מפתחות ניסיון וייצור עד להגעה למגבלות הקצב — כך שתוכלו להריץ הערכה אמיתית בעלות אפס ולחתום על משהו רק אם תעלו לפרודקשן. NLLB-200 נותן לכם משקלים ותו לא.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

פריסה של כל אחד מהם

North Small Translate 1.0 מגיע בשלוש נקודות ביקורת — BF16, FP8 ו-NVFP4 W4A16 — עם חומרה מינימלית מפורסמת לכל אחת: ארבעה B200 או שמונה H100 עבור BF16, שני B200 או ארבעה H100 עבור FP8, ו-B200 בודד או שני H100 עבור W4A16. ההגשה עוברת דרך vLLM עם cohere_melody>=0.9.0, ו-Cohere ממליצה על פענוח חמדני (greedy decoding), בהתאמה לתצורת הייצור שלה. הפלט עטוף בסמנים <|START_TEXT|> ו-<|END_TEXT|> שאינם רשומים כאסימונים מיוחדים, כך ש-skip_special_tokens=True נאיבי ישאיר אותם בפלט שלך.

NLLB-200 נפרס דרך הנתיבים הסטנדרטיים של transformers או fairseq, עם סבילות רחבה בהרבה לחומרה קטנה, מאחר שצ'קפוינטים מזוקקים בגודל 600M ו-1.3B הם אלה שרוב האנשים מריצים בפועל. ה-MoE בגודל 54B הוא זה שדורש תכנון.

שאלת הניתוב שהמפגש הזה בעצם מייצג

לא North Small Translate 1.0 ולא NLLB-200 נמצאים בקטלוג של OrcaRouter היום, כך שזה לא מאמר על בחירה של אחד מהמדף שלנו. בכל זאת כדאי לתת שם לצורת הבעיה, כי "מודל אחד לשפות מהדרג הראשון, ואחר לזנב הארוך" הוא מדיניות ניתוב — ומדיניות ניתוב היא מסוג הדברים שצריכים לחיות בקונפיגורציה ולא בקוד האפליקציה. ה-DSL לניתוב של OrcaRouter מבטא בדיוק זאת כ-YAML בתוספת כללי CEL, כך שכלל לזוג שפות יכול לשלוח זוגות אירופיים למודל אחד ולעבור למודל חלופי כאשר זוג אינו נתמך, ושרשראות גיבוי משמעותן שספק במעלה הזרם שמתחיל להחזיר שגיאות לא יהפוך להשבתה שלך. זה מפתח אחד ואינטגרציה אחת על פני קטלוג של יותר מ-200 מודלים במחיר המחירון של הספק עם תוספת של 0%, במקום חוזה עם ספק שני עבור כל מודל תרגום שתחליט לנסות.

Screenshot of the facebook/nllb-200-distilled-600M model card on Hugging Face showing the cc-by-nc-4.0 license tag and 196 languages tag, 1,420,772 downloads last month and 970 likes, the model tree with 152 adapters, 380 finetunes and 29 quantizations, and the Intended Use section describing NLLB-200 as a research model for single sentence translation among 200 languages that is not released for production deployment and was trained with input lengths not exceeding 512 tokens.

לאיזה אחד כדאי לך לפנות

אם אסטרטגיית התוכן שלכם נוגעת בשפות שמחוץ לחמישים השפות של Cohere, הישארו עם NLLB-200 והתייחסו לכך כמוחלט — שום מידה של מודרניות ארכיטקטונית לא מפצה על שפה חסרה. אם אתם מבצעים לוקליזציה ארגונית לשפות ש-Cohere ציינה, עובדים בתוך מסמך ולא בתוך משפט, ואתם מוכנים לקנות רישיון מסחרי, North Small Translate 1.0 הוא המודל בעל היכולת הגבוהה יותר בכל ממד שהתיעוד מציין, עם הסתייגות חשובה: הראיה היחידה לאיכותו היא נתון ספק יחיד שלא שוחזר. אם אתם עושים אב־טיפוס ואין לכם תקציב, מסלול החינם של Cohere הופך את ההערכה הזו לכמעט בחינם, וזו נקודת פתיחה טובה יותר מזו של NLLB-200, שבה המחיר של לגלות את התשובה הוא שכירות GPU.

הדרך המועילה להחזיק את שתי העובדות בו-זמנית: NLLB-200 הוא המודל שמגיע לשפות שאיש אחר לא מגיע אליהן, והוא נבנה ב-2022 עבור תרגום מחקרי ברמת משפט. North Small Translate 1.0 הוא המודל שעושה פחות שפות טוב יותר, והוא נבנה ב-2026 עבור מסמכים. הבחירה ביניהם אינה באמת שיפוט איכות. זו שאלה של אילו שפות אתה בעצם משחרר.