כרטיס Hero שכותרתו "North Small Translate 1.0 vs Hy-MT2" עם כתובית "שני מתרגמי MoE, פער ראיות אחד", מעל שני כרטיסים: North Small Translate 1.0 (218B MoE / 25B פעילים, נתון WMT26 אחד ללא שם) ו-Hy-MT2-30B-A3B (30B MoE / 3B פעילים, מאמר, בנצ'מרק, Apache 2.0).
Guides & Insights

North Small Translate 1.0 לעומת Hy-MT2: שני מתרגמי MoE, פער ראיות אחד

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שתי המשפחות הללו נבנו על אותו הימור — שרשת תערובת-מומחים דלילה שעברה אימון-המשך לתרגום גוברת על מודל לשימוש כללי שמתבקש לתרגם — והן הגיעו אליו מכיוונים מנוגדים. Hy-MT2, משפחת התרגום בת שלושת המודלים של Tencent Hunyuan, שבראשה עומד Hy-MT2-30B-A3B מסוג MoE, שוחררה בקוד פתוח ב-21 במאי 2026 תחת Apache 2.0 עם דוח טכני, בנצ'מרק בקוד פתוח וטבלת השוואה מלאה. North Small Translate 1.0, מתרגם ה-MoE של Cohere עם 218 מיליארד פרמטרים ו-25 מיליארד פרמטרים פעילים, תועד בהערת שחרור מתאריך 9 בספטמבר 2026, והראיות לאיכותו מסתכמות במספר בודד בלי שום מדד מצורף לו. הארכיטקטורות מתחרזות. התיעוד לא, וההבדל הזה הוא הדבר המועיל ביותר להבנה לפני שבוחרים באחד מהם.

משפחה אחת, שלושה גדלים מול מודל גדול אחד

Hy-MT2 אינו מודל בודד אלא טווח: מודל צפוף 1.8B לעבודה על המכשיר, מודל צפוף 7B ל-GPU בודד, ו-30B-A3B MoE כדגל הספינה עם שלושה מיליארד פרמטרים פעילים לכל טוקן. כל השלושה הם Apache 2.0, ללא הגבלות, ומשוחררים יחד עם כיווּננים של FP8, GGUF, 2-bit ו-1.25-bit, בתוספת מַדְדָן המעקב אחר הוראות IFMTBench ומאמר נלווה. Tencent מדווחת שהמשפחה מתרגמת בין 33 שפות ועוד חמש שפות מיעוטים וניבים.

North Small Translate 1.0 הוא נקודה בודדת במרחב הגדלים, וגדולה: 218 מיליארד פרמטרים בסך הכול, 25 מיליארד פעילים, 128 מומחים עם שמונה מופעלים לכל טוקן בתוספת מומחים משותפים, וקשב המתחלף ביחס 3:1 בין שכבות חלון הזזה (חלון 4,096, RoPE) לשכבות גלובליות שאינן נושאות הטמעות מיקום. החלון שלו הוא 16K קלט ו-16K פלט באנגלית ובעוד 49 שפות, כאשר ערבית ספרותית מודרנית, גרמנית, צרפתית, יפנית, קוריאנית, רוסית ואוקראינית מוגדרות כרמה ראשונה. יש לציין שהצורה אינה חדשה — ב-Command A+ של Cohere ממאי 2026 נעשה שימוש באותה תצורה של 218B/25B — מה שהופך זאת לפוסט-טריין מתמחה בתרגום של ליבה קיימת ולא לארכיטקטורה חדשה.

פרמטרים — North Small Translate 1.0: ‏218B סה״כ / 25B פעילים לעומת Hy-MT2-30B-A3B: ‏30B סה״כ / 3B פעילים, עם דגמי dense אחים בגודל 1.8B ו-7B

הקשר — 16K נכנס ו-16K יוצא לעומת חלון עבודה של 8K, התצורה מצהירה על עד 262,144 פוזיציות

שפות — 50 (אנגלית + 49) לעומת 33 ועוד 5 שפות מיעוטים וניבים

רישיון — CC BY-NC 4.0, מסחרי דרך Model Vault לעומת Apache 2.0, ללא הגבלת גישה

עדויות שפורסמו — נתון WMT26 אחד ללא שם, דיווח ספק לעומת דוח טכני, בנצ׳מרק פתוח, ותוצאות מזוהות על FLORES-200, WMT25 GEMBA ו-XCOMET-XXL

הגשה — vLLM עם cohere_melody>=0.9.0, פענוח חמדני מומלץ לעומת transformers, vLLM, SGLang ו-llama.cpp

הוכרז — 9 בספטמבר 2026 (המשקולות מוגבלות ב-Hugging Face מאז 14 באוגוסט) לעומת 21 במאי 2026

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-30B-A3B across six rows: Parameters 218B MoE / 25B active vs 30B MoE / 3B active; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Evidence one unnamed WMT26 figure vs FLORES-200 93.85 and GEMBA 84.34; Technical report none published vs arXiv paper and IFMTBench. Footer notes all figures are vendor-reported by Tencent and Cohere and none is independently reproduced.

פער הראיות הוא הסיפור האמיתי

ההשחרור של Tencent הגיע עם קבלות. יש מאמר ב-arXiv, בנצ'מרק שהחברה כתבה והוציאה כקוד פתוח במיוחד כדי למדוד היענות להוראות תרגום, וטבלת תוצאות שמציינת את שמות מתחריה. FLORES-200 מאנגלית ל-X מציב את 30B-A3B ב-93.85, לעומת Gemini 3.1 Pro עם 94.42 ו-GPT-5.5 עם 94.16. מדד GEMBA מתקופת WMT25 מציב אותו ב-84.34 — הציון הגבוה ביותר בהשוואה של Tencent עצמה, ומקדים את GPT-5.5 עם 83.41 ו-83.29 בשני המצבים שלו, Gemini 3.1 Pro עם 82.23, DeepSeek-V4-Pro עם 81.99 ו-Kimi K2.6 עם 81.68. XCOMET-XXL מציב אותו ב-62.89, מאחורי דגם האח שלו בגודל 7B. ב-IFMTBench הוא מגיע ל-85.7% בהיענות להוראות בסך הכול, עם תת-ציון של 91.94% שנמצא במרחק מאית נקודה מ-Gemini 3.1 Pro, ותת-ציון נפרד, 85.55%, שבו הוא מוביל על פני דגם Gemini 3.1 Pro באופן מוחלט.

כל אחד מאלה הוא מדידה של Tencent עצמה, ואף אחד מהם לא שוחזר באופן בלתי תלוי. אבל יש להם שמות, הם ניתנים להשוואה, והם ניתנים להפרכה — קורא יודע בדיוק איזה מבחן להריץ כדי להתווכח.

הערת השחרור של Cohere מציעה נתון אחד: WMT26 83.60, העולה ל-84.36 תחת מה שהיא מכנה זרימת עבודה לתרגום סוכנית ורב-מעברית. אף מטריקה לא מוזכרת בשמה בשום מקום בכרטיס המודל או בתיעוד. לא פורסם דף תוצאות WMT26 עבור המודל הזה. קורפוס האימון, מספר הטוקנים וצינור הנתונים אינם מגולים, בעוד שהדוח הטכני של Command A Translate מ-2025 תיאר בפירוט טכניקת סינון לפי רמת קושי. אין בכל זה עדות למודל גרוע יותר. זה מעיד על פחות ראיות, וזה דבר אחר — וחשוב בדיוק באותה מידה כשאתה מחליט מה להעלות לפרודקשן.

אמת המידה המשותפת שאף צד לא פרסם בפועל

יש נקודת מגע אמיתית אחת בין השניים, והיא ראויה לפסקה משום שזהו המקום היחיד שבו יכולה להתקיים השוואה הוגנת. Tencent היא שותפה של WMT26, ומממנת משימת תרגום כתוביות וידאו עם פרסים במימון Hunyuan. המספר המפורסם היחיד של Cohere הוא נתון של WMT26. כך ששני הארגונים נמצאים בתוך אותו מחזור הערכה של 2026, והמדד היחיד שבו אפשר להכריע בעימות ראש בראש הוא בדיוק זה שבו רק אחד מהם פרסם משהו — ופרסם אותו בלי לנקוב בשם המדד.

זהו הפער שכדאי לשים לב אליו. אם Cohere תצמיד שם מדד ל-83.60, או אם דפי התוצאות של WMT26 יכללו מערכת North Small Translate, ההשוואה הופכת לאמיתית. עד אז, הצבת מספרי FLORES-200 ו-GEMBA של Tencent מול הנתון חסר התווית של Cohere מ-WMT26 תהיה פבריקציה מחופשת לניתוח.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

רישיון ופריסה

Hy-MT2 הוא Apache 2.0 ללא חסימות: שימוש מסחרי, כיוונון עדין, נגזרות והפצה מחדש — הכול בלי צורך בשיחה. North Small Translate 1.0 הוא CC BY-NC 4.0, חינמי לשימוש לא־מסחרי, כאשר פריסה מסחרית מנותבת דרך Model Vault של Cohere במחיר שאינו מפורסם. עבור כל דבר שנשלח ללקוחות, ההבדל הזה מכריע את ההחלטה עוד לפני שקוראים את הבנצ'מרקים.

סיפור החומרה עוקב אחר אותו דפוס, אך במהופך. Hy-MT2 משתרע מבילד מכומת של 440MB שרץ על מכשיר נייד ועד ל-30B-A3B, ששלושת מיליארד הפרמטרים הפעילים שלו שומרים על מחשוב צנוע לכל טוקן ביחס לרמת האיכות שלו; סביבות הרצה מכסות את transformers, vLLM, SGLang ו-llama.cpp. המודל North Small Translate 1.0 מפרסם חומרה מינימלית לכל צ'קפוינט — ארבעה B200 או שמונה H100 עבור BF16, שני B200 או ארבעה H100 עבור FP8, B200 אחד או שני H100 עבור NVFP4 W4A16 — וממליץ על פענוח חמדני (greedy) כדי להתאים לייצור. היתרון המאזן של Cohere הוא שהמודל פועל במסלול החינמי של Chat V2 API שלה, בחינם עבור מפתחות ניסיון וייצור עד שמגיעים למגבלות הקצב, כך שלהעריך אותו לא עולה כלום.

האם כדאי לך לעבור, ואם כן — למה

שאלת המעבר היא באמת א-סימטרית כאן. מעבר מ-Hy-MT2 ל-North Small Translate 1.0 אינו שדרוג ביצועים שאתה יכול להצדיק כרגע — זהו הימור על מודל שהטענה הפומבית היחידה שלו היא מספר אחד, שנסחר כנגד משפחה עם דוח מפורסם ורישיון שניתן לפרוס. מה ששווה לעשות הוא להעריך: ניתן לקרוא למודל Cohere בחינם, הוא מכסה חמישים שפות כולל סט אירופי רחב יותר, ומספק לך 16K פלט בכל מעבר, מה שחלון העבודה של 8K של Hy-MT2 לא מספק.

ההערכה הזו היא המקרה שבו שכבת ניתוב מצדיקה את עצמה, כי התשובה הכנה עבור רוב מערכי העבודה הרב-לשוניים היא ששני המודלים נשארים.OrcaRouter מעמידה קטלוג של יותר מ-200 מודלים מאחורי מפתח אחד, כך שניסוי של מודל תרגום שני הוא שינוי תצורה ולא חוזה ספק שני או שינוי קוד — מפנים את אותו לקוח תואם OpenAI אל מזהה מודל אחר ומשווים על הטקסט שלכם. מחיר המחירון של הספק מועבר הלאה בתוספת של 0%, כך ששינוי מחיר אצל הספק מתארח אצלנו באותו יום בלי מרווח נוסף מעליו, ושרשראות מעבר-כשל (failover) משאירות את סביבת הייצור על המודל שכבר עובד בזמן שהמודל החדש נבחן. לא North Small Translate 1.0 ולא Hy-MT2 נמצאים בקטלוג שלנו היום, כך שזו אינה המלצה לקנות אף אחד מהם מאיתנו — זה הטיעון נגד קיבוע ההחלטה בקוד לפני שהרצתם את המבחן.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

פסק הדין

ה-Hy-MT2 של Tencent הוא הבחירה הבטוחה יותר, וזה ממש לא צמוד מבחינת הראיות: Apache 2.0, שלושה גדלים, מאמר, בנצ'מרק פתוח, ארבע חבילות הערכה בשם מפורש ושותפות WMT26. North Small Translate 1.0 של Cohere הוא המעניין יותר — 218 מיליארד פרמטרים של MoE ייעודי לתרגום מאחורי חלון פלט של 16K וחמישים שפות, מסלול הערכה חינמי, וציון 83.60 שאף אחד מחוץ ל-Cohere לא בדק.

אם אתה זקוק להחלטה ברבעון הזה, בחר במשפחה עם הקבלות. אם יש לך קורפוס ושבוע, העבר חלק ממנו דרך המסלול החינמי וגלה אם ה-83.60 חסר השם של Cohere אומר משהו על המסמכים שלך — כי זו שאלה שאף טבלה של ספק לא תענה לך עליה, והמספר היחיד ש-Cohere בחרה לפרסם הוא בדיוק זה שהיא סירבה לנקוב בשמו.