
North Small Translate 1.0 מול Hy-MT2-7B: מעבד גרפי אחד נגד שני B200
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 לכל 1M טוקנים
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
ההתמודדות הצמודה ביותר בתרגום פתוח כרגע היא אולי גם הפחות מובנת מאליה. Hy-MT2-7B הוא הילד האמצעי במשפחת התרגום של Tencent Hunyuan, שפורסם כקוד פתוח תחת Apache 2.0 ב-21 במאי 2026, והוא רץ על RTX 4090 או A100 בודד בכ-16GB של VRAM. North Small Translate 1.0 הוא המתרגם מסוג sparse mixture-of-experts בעל 218 מיליארד פרמטרים של Cohere, המתועד בהערות ההפצה של החברה ב-9 בספטמבר 2026, עם פריסה מינימלית של שני B200 ב-FP8 או B200 אחד בצורת NVFP4 W4A16 שלו. שניהם מומחי תרגום. שניהם עדכניים. את אחד מהם אפשר להריץ מתחנת עבודה, והעובדה הבודדת הזו מעמידה את כל ההשוואה באור אחר — מפני שבנצ'מרק שבו היו רוצים ביותר להיבחן בתנאים שווים פשוט אינו קיים.
התחל עם המעטפה, לא עם הציונים
עלות הפריסה היא הממד שמכריע את רוב האינטגרציות האמיתיות, וכאן שני המודלים אינם קרובים זה לזה. Hy-MT2-7B הוא מודל HunYuanDenseV1 צפוף של כשמונה מיליארד פרמטרים עם בילדים מפורסמים של FP8 ו-GGUF, בתוספת גרסאות MLX 8-bit קהילתיות ל-Apple silicon. הערות הפריסה של Tencent מפרטות את transformers 5.6.0 ואילך, vLLM, SGLang ו-llama.cpp כסביבות ריצה נתמכות, והנחיות ההסקה מגבילות את היצירה ל-8,192 טוקנים למרות שהתצורה מכריזה על עד 262,144 פוזיציות. כרטיס GPU מודרני יחיד לצרכנים או לתחנות עבודה מספיק לכך.
North Small Translate 1.0 הוא סוג שונה של אובייקט. 218B הפרמטרים הכוללים שלו, שמתוכם 25B פעילים, מפוצלים על פני 128 מומחים עם שמונה פעילים לכל טוקן בתוספת מומחים משותפים, ו-Cohere מפרסמת חומרה מינימלית עבור כל אחד משלושת הצ'קפוינטים שלה: ארבעה B200 או שמונה H100 עבור BF16, שני B200 או ארבעה H100 עבור FP8, B200 אחד או שני H100 עבור גרסת ה-NVFP4 W4A16. ההגשה פועלת דרך vLLM עם cohere_melody>=0.9.0, ו-Cohere ממליצה על פענוח חמדני כדי להתאים לייצור. הפלט נושא <|START_TEXT|> וגם <|END_TEXT|> המהווים מרקרים שאינם רשומים כטוקנים מיוחדים.
• צורה — North Small Translate 1.0: 218B סה"כ / 25B פעילים MoE דליל, 128 מומחים לעומת Hy-MT2-7B: צפוף, בערך 8B
• הקשר — 16K נכנס ו-16K יוצא לעומת חלון עבודה של 8K, התצורה מצהירה על עד 262,144 פוזיציות
• חומרה מינימלית — 1×B200 ב-W4A16, 2×B200 או 4×H100 ב-FP8 לעומת GPU יחיד בדרגת RTX 4090 בכ-16GB
• פורמטים שפורסמו — BF16, FP8, NVFP4 W4A16 לעומת הבסיס, FP8, GGUF, ובנוסף MLX 8-bit קהילתי
• שפות — 50 (אנגלית + 49) לעומת 33 שפות ועוד 5 שפות מיעוטים וניבים
• רישיון — CC BY-NC 4.0, מסחרי דרך Model Vault לעומת Apache 2.0, ללא הגבלת גישה
• איכות מדווחת — WMT26 83.60, מדד ללא שם, דיווח ספק לעומת טבלאות ספקים מזוהים בשם על FLORES-200, WMT25 GEMBA, XCOMET-XXL ו-IFMTBench

בעיית הבנצ'מרק
הנה הליבה הכנה של ההתמודדות הזו: איננו יכולים לדרג את שני המודלים האלה זה מול זה, וכל מי שאומר אחרת ממציא מספר. Tencent פרסמה ארבע הערכות נקובות בשם. בתרגום מאנגלית ל-X ב-FLORES-200, ה-7B מציג 93.52, מאחורי 94.42 של Gemini 3.1 Pro ו-94.16 של GPT-5.5, אך קרוב מספיק כדי להיות משמעותי. במדד GEMBA הסמוך ל-WMT25 הוא מקבל 82.24, לעומת 84.34 של 30B-A3B ו-83.41 של GPT-5.5. ב-XCOMET-XXL הוא מוביל על הכול בטבלת ההשוואה של Tencent עם 63.86 — לפני Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro ו-Kimi K2.6. בציון ביצוע ההוראות של IFMTBench הוא מגיע ל-83.14%. כל אלה הם המספרים של Tencent עצמה, אף אחד מהם לא שוחזר באופן בלתי תלוי, והם עדיין הרבה יותר ממה ש-Cohere הציעה.
Cohere פרסמה נתון בודד: ציון WMT26 של 83.60, שעולה ל-84.36 בתהליך עבודה סוכני רב-מעברי. שום מדד אינו נקוב בשם בכרטיס המודל או בהודעת ההשקה, ולא פורסם דף תוצאות WMT26 כלשהו עבור המודל הזה. אי-הסימטריה הזו אינה הוכחה שהמודל של Cohere חלש יותר או חזק יותר. משמעותה היא שההשוואה שהקורא רוצה ביותר — אותו מבחן, אותו מדד, שני המודלים — אינה ניתנת לביצוע על סמך ראיות פומביות, ופער של ארבע נקודות בתוך שני הנתונים של Cohere עצמה (מ-83.60 ל-84.36) כבר גדול מרוב הפערים בטבלה של Tencent.
שפות והמסמך הארוך
North Small Translate 1.0 מכסה חמישים שפות ווריאנטים של לוקאל, כאשר ערבית ספרותית מודרנית, גרמנית, צרפתית, יפנית, קוריאנית, רוסית ואוקראינית מסווגות כדרג ראשון, והיא מקבלת ופולטת 16,000 טוקנים בשני הצדדים. Hy-MT2-7B מכסה שלושים ושלוש שפות ועוד חמש שפות מיעוטים וניבים, כולל טיבטית, אויגורית וקנטונזית. אף אחת מהרשימות אינה קבוצת-על של האחרת — Tencent מגיעה לקנטונזית ולאויגורית, Cohere מגיעה למכלול רחב יותר של לוקאלים אירופיים — ולכן פריסה רב-לשונית עשויה לגלות שהיא זקוקה לשתיהן רק משיקולי כיסוי.
חלון הפלט הוא ההבדל השקט יותר. שישה-עשר אלף אסימונים של פלט פירושם מסמך נהלים מלא במעבר אחד, עם מינוח ורגיסטר עקביים לכל אורכו, משום שהמודל ראה את כולו. חלון של 8K אינו כזה, ופתרון העבודה משפט-אחר-משפט מחזיר בדיוק את בעיות העקביות חוצת-המקטעים שבנצ'מרקים לעמידה בהוראות תרגום כמו IFMTBench נבנו כדי למדוד.

הרישיון, שוב, קובע יותר מהטבלה
North Small Translate 1.0 הוא תחת רישיון CC BY-NC 4.0. המשקלים חופשיים לעבודה לא-מסחרית, ופריסה מסחרית עוברת דרך Model Vault של Cohere תחת רישיון נרכש ללא מחיר מפורסם. Hy-MT2-7B הוא תחת Apache 2.0 וללא חסימה — שימוש מסחרי, כיוונון עדין ונגזרות כולם מותרים בלי צורך בשיחה. עבור מוצר מסחרי, סדר הפעולות מתבקש מעצמו: Hy-MT2-7B ניתן לפריסה כבר היום והמודל של Cohere ניתן להערכה כבר היום, ואף שורת בנצ'מרק לא משנה את הסדר הזה.
היתרון המפצה של Cohere הוא השכבה החינמית. North Small Translate 1.0 פועל בשכבה החינמית של Chat V2, חינם הן עבור מפתחות ניסיון והן עבור מפתחות ייצור עד להגעה למגבלות הקצב, כך שהערכה אינה עולה דבר מלבד זמן. ל-Hy-MT2-7B יש API מסחרי מתארח — Tencent תמחרה את השכבה המתארחת של המשפחה בכ-0.044 דולר למיליון טוקני קלט ו-0.177 דולר למיליון טוקני פלט — ואירוח עצמי על ה-GPU שלך הוא המסלול החינמי באמת.
מה בעצם מרמז "multi-pass"
ההחלטה של Cohere לפרסם גם 83.60 וגם 84.36 היא הפרט המאלף ביותר בהערת השחרור שלה, כי היא אומרת שהחברה מאמינה שזרימת עבודה עדיפה על קריאה בודדת. זה אותו הימור ש-Tencent עשתה במנגנון אחר: ה-30B-A3B המוביל שלה מנצח ב-GEMBA וב-XCOMET בעוד Gemini 3.1 Pro מנצח ב-FLORES-200, מה שאומר שהמערכת הטובה ביותר אינה מודל אחד אלא פאנל. מיזוג המודלים של OrcaRouter מריץ כמה מודלים כפאנל ומתאים את תשובותיהם בתוך קריאה אחת, שזו הגרסה ברמת הפלטפורמה של רעיון הריבוי-מעברים ששתי הספקיות רודפות אחריו — והוא משתלב עם צד הניתוב, שבו מפתח אחד מכסה קטלוג של יותר מ-200 מודלים במחיר המחירון של הספק עם 0% תוספת, כך ששינוי מחיר של ספק מגיע לצד שלנו באותו יום ולא בחידוש החוזה הבא.
המסגור הזה גם פותר את בעיית הראיות שאיתה נפתח המאמר הזה. כששני ספקים מפרסמים מבחני ביצועים שאינם חופפים ולאף אחד מהם אין הערכה בלתי תלויה, הדרך לבחור היא לא לסמוך על טבלה, אלא להריץ את שניהם על המסמכים שלך ולתת לאי-ההסכמה להתגלות בטקסט אמיתי — וזה בדיוק הייעוד של פאנל ושל שרשרת מעבר לגיבוי.

איזה מהם, ומתי
אם אתה צריך מודל תרגום שרץ על חומרה שכבר בבעלותך, במוצר מסחרי, בלי שיחה על רישוי, Hy-MT2-7B מנצח בזכות המעטפת לבדה — והתוצאות שמפרסם הספק שלו, אף שלא שוחזרו, הן לכל הפחות בעלות שם, ברות השוואה וקרובות לחזית. אם אתה מתרגם מסמכים ארוכים לחמישים השפות של Cohere, זקוק ל-16K של פלט עקבי בכל מעבר, ויש לך או תקציב של שני B200 או נכונות להריץ את ההערכה בשכבה החינמית של Cohere לפני שתחליט, North Small Translate 1.0 הוא המכונה היכולה יותר בכל ציר שנחשף.
מה שאף אחד מהמודלים לא עושה הוא לבטל את הצורך בבדיקה. Cohere נתנה לך מספר אחד בלי שם ודרך חינמית לבדוק אותו. Tencent נתנה לך טבלה והורדה בגודל של GPU. ה-83.60 הוא הבטחה, לא תוצאה — והמקום היחיד שבו ההבטחה הזו מוכרעת הוא בקורפוס שלך.
