כרטיס Hero שכותרתו "North Small Translate 1.0 vs Hy-MT2-7B" עם כתובית המשנה "GPU אחד מול שני B200s", מעל שני כרטיסים: North Small Translate 1.0 (218B MoE / 25B פעילים, CC BY-NC 4.0) ו-Hy-MT2-7B (8B dense, כ-16GB VRAM, Apache 2.0).
Guides & Insights

North Small Translate 1.0 מול Hy-MT2-7B: מעבד גרפי אחד נגד שני B200

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ההתמודדות הצמודה ביותר בתרגום פתוח כרגע היא אולי גם הפחות מובנת מאליה. Hy-MT2-7B הוא הילד האמצעי במשפחת התרגום של Tencent Hunyuan, שפורסם כקוד פתוח תחת Apache 2.0 ב-21 במאי 2026, והוא רץ על RTX 4090 או A100 בודד בכ-16GB של VRAM. North Small Translate 1.0 הוא המתרגם מסוג sparse mixture-of-experts בעל 218 מיליארד פרמטרים של Cohere, המתועד בהערות ההפצה של החברה ב-9 בספטמבר 2026, עם פריסה מינימלית של שני B200 ב-FP8 או B200 אחד בצורת NVFP4 W4A16 שלו. שניהם מומחי תרגום. שניהם עדכניים. את אחד מהם אפשר להריץ מתחנת עבודה, והעובדה הבודדת הזו מעמידה את כל ההשוואה באור אחר — מפני שבנצ'מרק שבו היו רוצים ביותר להיבחן בתנאים שווים פשוט אינו קיים.

התחל עם המעטפה, לא עם הציונים

עלות הפריסה היא הממד שמכריע את רוב האינטגרציות האמיתיות, וכאן שני המודלים אינם קרובים זה לזה. Hy-MT2-7B הוא מודל HunYuanDenseV1 צפוף של כשמונה מיליארד פרמטרים עם בילדים מפורסמים של FP8 ו-GGUF, בתוספת גרסאות MLX 8-bit קהילתיות ל-Apple silicon. הערות הפריסה של Tencent מפרטות את transformers 5.6.0 ואילך, vLLM, SGLang ו-llama.cpp כסביבות ריצה נתמכות, והנחיות ההסקה מגבילות את היצירה ל-8,192 טוקנים למרות שהתצורה מכריזה על עד 262,144 פוזיציות. כרטיס GPU מודרני יחיד לצרכנים או לתחנות עבודה מספיק לכך.

North Small Translate 1.0 הוא סוג שונה של אובייקט. 218B הפרמטרים הכוללים שלו, שמתוכם 25B פעילים, מפוצלים על פני 128 מומחים עם שמונה פעילים לכל טוקן בתוספת מומחים משותפים, ו-Cohere מפרסמת חומרה מינימלית עבור כל אחד משלושת הצ'קפוינטים שלה: ארבעה B200 או שמונה H100 עבור BF16, שני B200 או ארבעה H100 עבור FP8, B200 אחד או שני H100 עבור גרסת ה-NVFP4 W4A16. ההגשה פועלת דרך vLLM עם cohere_melody>=0.9.0, ו-Cohere ממליצה על פענוח חמדני כדי להתאים לייצור. הפלט נושא <|START_TEXT|> וגם <|END_TEXT|> המהווים מרקרים שאינם רשומים כטוקנים מיוחדים.

צורה — North Small Translate 1.0: 218B סה"כ / 25B פעילים MoE דליל, 128 מומחים לעומת Hy-MT2-7B: צפוף, בערך 8B

הקשר — 16K נכנס ו-16K יוצא לעומת חלון עבודה של 8K, התצורה מצהירה על עד 262,144 פוזיציות

חומרה מינימלית — 1×B200 ב-W4A16, 2×B200 או 4×H100 ב-FP8 לעומת GPU יחיד בדרגת RTX 4090 בכ-16GB

פורמטים שפורסמו — BF16, FP8, NVFP4 W4A16 לעומת הבסיס, FP8, GGUF, ובנוסף MLX 8-bit קהילתי

שפות — 50 (אנגלית + 49) לעומת 33 שפות ועוד 5 שפות מיעוטים וניבים

רישיון — CC BY-NC 4.0, מסחרי דרך Model Vault לעומת Apache 2.0, ללא הגבלת גישה

איכות מדווחת — WMT26 83.60, מדד ללא שם, דיווח ספק לעומת טבלאות ספקים מזוהים בשם על FLORES-200, WMT25 GEMBA, XCOMET-XXL ו-IFMTBench

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

בעיית הבנצ'מרק

הנה הליבה הכנה של ההתמודדות הזו: איננו יכולים לדרג את שני המודלים האלה זה מול זה, וכל מי שאומר אחרת ממציא מספר. Tencent פרסמה ארבע הערכות נקובות בשם. בתרגום מאנגלית ל-X ב-FLORES-200, ה-7B מציג 93.52, מאחורי 94.42 של Gemini 3.1 Pro ו-94.16 של GPT-5.5, אך קרוב מספיק כדי להיות משמעותי. במדד GEMBA הסמוך ל-WMT25 הוא מקבל 82.24, לעומת 84.34 של 30B-A3B ו-83.41 של GPT-5.5. ב-XCOMET-XXL הוא מוביל על הכול בטבלת ההשוואה של Tencent עם 63.86 — לפני Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro ו-Kimi K2.6. בציון ביצוע ההוראות של IFMTBench הוא מגיע ל-83.14%. כל אלה הם המספרים של Tencent עצמה, אף אחד מהם לא שוחזר באופן בלתי תלוי, והם עדיין הרבה יותר ממה ש-Cohere הציעה.

Cohere פרסמה נתון בודד: ציון WMT26 של 83.60, שעולה ל-84.36 בתהליך עבודה סוכני רב-מעברי. שום מדד אינו נקוב בשם בכרטיס המודל או בהודעת ההשקה, ולא פורסם דף תוצאות WMT26 כלשהו עבור המודל הזה. אי-הסימטריה הזו אינה הוכחה שהמודל של Cohere חלש יותר או חזק יותר. משמעותה היא שההשוואה שהקורא רוצה ביותר — אותו מבחן, אותו מדד, שני המודלים — אינה ניתנת לביצוע על סמך ראיות פומביות, ופער של ארבע נקודות בתוך שני הנתונים של Cohere עצמה (מ-83.60 ל-84.36) כבר גדול מרוב הפערים בטבלה של Tencent.

שפות והמסמך הארוך

North Small Translate 1.0 מכסה חמישים שפות ווריאנטים של לוקאל, כאשר ערבית ספרותית מודרנית, גרמנית, צרפתית, יפנית, קוריאנית, רוסית ואוקראינית מסווגות כדרג ראשון, והיא מקבלת ופולטת 16,000 טוקנים בשני הצדדים. Hy-MT2-7B מכסה שלושים ושלוש שפות ועוד חמש שפות מיעוטים וניבים, כולל טיבטית, אויגורית וקנטונזית. אף אחת מהרשימות אינה קבוצת-על של האחרת — Tencent מגיעה לקנטונזית ולאויגורית, Cohere מגיעה למכלול רחב יותר של לוקאלים אירופיים — ולכן פריסה רב-לשונית עשויה לגלות שהיא זקוקה לשתיהן רק משיקולי כיסוי.

חלון הפלט הוא ההבדל השקט יותר. שישה-עשר אלף אסימונים של פלט פירושם מסמך נהלים מלא במעבר אחד, עם מינוח ורגיסטר עקביים לכל אורכו, משום שהמודל ראה את כולו. חלון של 8K אינו כזה, ופתרון העבודה משפט-אחר-משפט מחזיר בדיוק את בעיות העקביות חוצת-המקטעים שבנצ'מרקים לעמידה בהוראות תרגום כמו IFMTBench נבנו כדי למדוד.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

הרישיון, שוב, קובע יותר מהטבלה

North Small Translate 1.0 הוא תחת רישיון CC BY-NC 4.0. המשקלים חופשיים לעבודה לא-מסחרית, ופריסה מסחרית עוברת דרך Model Vault של Cohere תחת רישיון נרכש ללא מחיר מפורסם. ‏Hy-MT2-7B הוא תחת Apache 2.0 וללא חסימה — שימוש מסחרי, כיוונון עדין ונגזרות כולם מותרים בלי צורך בשיחה. עבור מוצר מסחרי, סדר הפעולות מתבקש מעצמו: ‏Hy-MT2-7B ניתן לפריסה כבר היום והמודל של Cohere ניתן להערכה כבר היום, ואף שורת בנצ'מרק לא משנה את הסדר הזה.

היתרון המפצה של Cohere הוא השכבה החינמית. North Small Translate 1.0 פועל בשכבה החינמית של Chat V2, חינם הן עבור מפתחות ניסיון והן עבור מפתחות ייצור עד להגעה למגבלות הקצב, כך שהערכה אינה עולה דבר מלבד זמן. ל-Hy-MT2-7B יש API מסחרי מתארח — Tencent תמחרה את השכבה המתארחת של המשפחה בכ-0.044 דולר למיליון טוקני קלט ו-0.177 דולר למיליון טוקני פלט — ואירוח עצמי על ה-GPU שלך הוא המסלול החינמי באמת.

מה בעצם מרמז "multi-pass"

ההחלטה של Cohere לפרסם גם 83.60 וגם 84.36 היא הפרט המאלף ביותר בהערת השחרור שלה, כי היא אומרת שהחברה מאמינה שזרימת עבודה עדיפה על קריאה בודדת. זה אותו הימור ש-Tencent עשתה במנגנון אחר: ה-30B-A3B המוביל שלה מנצח ב-GEMBA וב-XCOMET בעוד Gemini 3.1 Pro מנצח ב-FLORES-200, מה שאומר שהמערכת הטובה ביותר אינה מודל אחד אלא פאנל. מיזוג המודלים של OrcaRouter מריץ כמה מודלים כפאנל ומתאים את תשובותיהם בתוך קריאה אחת, שזו הגרסה ברמת הפלטפורמה של רעיון הריבוי-מעברים ששתי הספקיות רודפות אחריו — והוא משתלב עם צד הניתוב, שבו מפתח אחד מכסה קטלוג של יותר מ-200 מודלים במחיר המחירון של הספק עם 0% תוספת, כך ששינוי מחיר של ספק מגיע לצד שלנו באותו יום ולא בחידוש החוזה הבא.

המסגור הזה גם פותר את בעיית הראיות שאיתה נפתח המאמר הזה. כששני ספקים מפרסמים מבחני ביצועים שאינם חופפים ולאף אחד מהם אין הערכה בלתי תלויה, הדרך לבחור היא לא לסמוך על טבלה, אלא להריץ את שניהם על המסמכים שלך ולתת לאי-ההסכמה להתגלות בטקסט אמיתי — וזה בדיוק הייעוד של פאנל ושל שרשרת מעבר לגיבוי.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

איזה מהם, ומתי

אם אתה צריך מודל תרגום שרץ על חומרה שכבר בבעלותך, במוצר מסחרי, בלי שיחה על רישוי, Hy-MT2-7B מנצח בזכות המעטפת לבדה — והתוצאות שמפרסם הספק שלו, אף שלא שוחזרו, הן לכל הפחות בעלות שם, ברות השוואה וקרובות לחזית. אם אתה מתרגם מסמכים ארוכים לחמישים השפות של Cohere, זקוק ל-16K של פלט עקבי בכל מעבר, ויש לך או תקציב של שני B200 או נכונות להריץ את ההערכה בשכבה החינמית של Cohere לפני שתחליט, North Small Translate 1.0 הוא המכונה היכולה יותר בכל ציר שנחשף.

מה שאף אחד מהמודלים לא עושה הוא לבטל את הצורך בבדיקה. Cohere נתנה לך מספר אחד בלי שם ודרך חינמית לבדוק אותו. Tencent נתנה לך טבלה והורדה בגודל של GPU. ה-83.60 הוא הבטחה, לא תוצאה — והמקום היחיד שבו ההבטחה הזו מוכרעת הוא בקורפוס שלך.