
North Small Translate 1.0 לעומת Hy-MT2-1.8B: 218GB של מודל מול 440MB
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 לכל 1M טוקנים
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
אחד מאלה נכנס לטלפון. Hy-MT2-1.8B, מודל התרגום על-גבי המכשיר של Tencent Hunyuan, שפורסם בקוד פתוח תחת Apache 2.0 ב-21 במאי 2026, מתכווץ ל-440 מגה-בייט תחת כימות 1.25-ביט של AngelSlim ורץ על סיליקון טלפונים של Apple, Qualcomm ו-MediaTek. North Small Translate 1.0, מודל ה-mixture-of-experts בעל 218 מיליארד פרמטרים ש-Cohere תיעדה בהערות השחרור שלו ב-9 בספטמבר 2026, מגיע עם סט משקולות FP8 בסדר גודל של 218 ג'יגה-בייט ודורש לפחות שני B200s. זה בערך פי חמש מאות אחסון עבור אחד מהם, והשאלה המעניינת היא לא איזה מהם טוב יותר — אלא לשם מה כל אחד מהם מיועד באמת, ואיזה רישיון מאפשר לך להפיץ אותו.
פער בגודל אינו פער באיכות
מפתה לפרש את 218B לעומת 1.8B כדירוג ישיר של יכולות. זה לא כך, משתי סיבות. הראשונה היא ש-North Small Translate 1.0 הוא מודל תערובת מומחים דליל שבו רק 25 מיליארד פרמטרים פעילים לכל טוקן, כך שהחישוב לכל טוקן נמצא בליגה שונה ממספר הפרמטרים. השנייה היא ששני המודלים עברו אופטימיזציה אל מול מטרות שונות: ה-1.8B של Tencent נבנה להיות קטן מספיק כדי לפעול באופן לא מקוון על מכשיר נייד, והמודל של Cohere נבנה להחזיק מסמך שלם בהקשר ולתרגם אותו כיחידה אחת.
ההבדל הזה ניכר בחלונות ההקשר. התצורה של Hy-MT2-1.8B מצהירה על עד 262,144 פוזיציות, אך הנחיות האינפרנס של Tencent עצמה מגבילות את היצירה ל-8,192 טוקנים — חלון העבודה המעשי הוא 8K. North Small Translate 1.0 מתעד 16K קלט ו-16K פלט, שזה כפול מחלון הקלט, וחשוב יותר — 16K מלאים של פלט. אם יחידת העבודה שלכם היא מדריך שירות, תקציב הפלט הזה הוא התכונה. אם יחידת העבודה שלכם היא הודעת צ'אט, הוא חסר כל חשיבות.
• סה״כ פרמטרים — North Small Translate 1.0: 218B MoE, 25B פעילים לעומת Hy-MT2-1.8B: 1.8B dense
• הקשר — 16K קלט ו-16K פלט לעומת חלון עבודה של 8K (התצורה מצהירה על עד 262,144 מיקומים; ההנחיות של Tencent אומרות 8,192)
• שפות — 50 (אנגלית + 49) לעומת 33 שפות ועוד 5 שפות מיעוטים וניבים
• רישיון — CC BY-NC 4.0, מסחרי דרך Model Vault לעומת Apache 2.0, ללא הגבלת גישה
• נפח מכומת — FP8 ~218GB, NVFP4 W4A16 ~109GB לעומת 440MB ברמת 1.25 סיביות; גם FP8 ו-GGUF פורסמו
• חומרה מינימלית — 2×B200 או 4×H100 ב-FP8 לעומת מכשיר נייד

מה Tencent בעצם שחררה ב-1.8B
ה-1.8B הוא הקטן ביותר במשפחה בת שלושה מודלים — 1.8B, 7B ו-30B-A3B MoE, מודל הדגל — כולם שוחררו יחד עם בנצ'מרק נלווה בשם IFMTBench שמודד עמידה בהוראות תרגום ולא איכות תרגום גולמית. Tencent סיפקה קוונטיזציות FP8, GGUF, 2-ביט ו-1.25-ביט לצד משקולות הבסיס, וגרסת ה-1.25-ביט היא זו שמפיקה את הנתון 440MB והאצת הסקה מוצהרת של פי 1.5 לעומת הדור הקודם Hy-MT1.5. ההגשה נתמכת באמצעות transformers 5.6.0 ואילך, vLLM, SGLang ו-llama.cpp, כאשר מסלול ה-GGUF תלוי בקרנל STQ ששולב ב-llama.cpp. הדגימה המומלצת היא temperature 0.7, top_p 0.6, top_k 20, repetition penalty 1.05, ואין system prompt כברירת מחדל — ההפך מהגישה של Cohere.
הוא גם, שלא כמו North Small Translate 1.0, מודל שאימוצו ניכר לעין. המאגר ב-Hugging Face הורד יותר מ-23,000 פעמים וצבר כ-1,200 לייקים. המאגר הראשי של Cohere הציג 26 הורדות ואפס לייקים בזמן כתיבת שורות אלו.
הרישיון הוא ההבדל החד יותר
זה החלק שאמור להכריע ביותר פריסות מאשר טבלת הבנצ'מרק. Hy-MT2-1.8B הוא Apache 2.0 ללא הגבלת גישה — שימוש מסחרי, כיוונון עדין, יצירות נגזרות, הפצה מחדש, הכול מותר. North Small Translate 1.0 הוא CC BY-NC 4.0: המשקלים חופשיים לשימוש לא מסחרי, ופריסה מסחרית מחייבת רכישת רישיון דרך Cohere's Model Vault, שעבורו לא מפורסם מחיר.
במילים פשוטות: אם אתם בונים מוצר, המודל של Tencent הוא זה שאפשר לשחרר היום בלי שיחה, וזה של Cohere הוא זה שאפשר רק להעריך. האסימטריה הזו לא הופכת את המודל של Cohere לגרוע יותר, אבל היא משנה את סדר הפעולות — אתם מעריכים את של Cohere, ואת של Tencent אפשר לפרוס.
הראיות לאיכות הן א-סימטריות, ושני הצדדים מדווחים על ידי ספקים.
לאף אחד מהמודלים אין הערכה בלתי תלויה מאחוריו, אז התייחסו לכל מספר כאן כאל טענה של היצרן שלו. ההבדל הוא בכמה היצרנים שמו על השולחן. Tencent פרסמה טבלת השוואה מלאה ודו"ח טכני: בתרגום מאנגלית ל-X ב-FLORES-200, Hy-MT2-1.8B רושם 90.00 לעומת 94.42 של Gemini 3.1 Pro ו-94.16 של GPT-5.5 — מאחור במידה מתונה אחרי מודלי החזית אך בתוך כמה נקודות, ממודל שנכנס לטלפון. בציון הכולל של IFMTBench למעקב אחר הוראות, ה-1.8B מגיע ל-69.36%, הרחק מאחורי ה-30B-A3B האח שלו עם 85.7% ו-Gemini 3.1 Pro עם 89.08%, שזו הקריאה הכנה של הפשרה: המודל הזעיר עוקב אחר הוראות עיצוב ומינוח באמינות הרבה פחותה מזו שבה הוא מתרגם.
Cohere פרסמה נתון אחד — ציון WMT26 של 83.60, שעולה ל-84.36 עם תהליך עבודה סוכני רב-מעברי — בלי שם מדד מצורף ובלי דף תוצאות WMT26 שכנגדו אפשר לבדוק אותו. זו אינה השוואה שאנו יכולים לערוך. אי אפשר להעמיד מספר אחד חסר שם מול טבלה של בנצ'מרקים בעלי שמות, ולהעמיד פנים אחרת יהיה הדבר המטעה ביותר שהמאמר הזה יכול לעשות.

המשקל הנגדי של טנסנט הוא שהמספרים שלה מגיעים ממקום שקרוא יכול לבדוק. מאגר Hy-MT2 מפרסם את סקירת המשפחה, שלושת גדלי המודלים וסביבות ההרצה שכל אחד מהם תומך בהן לצד טבלת הבנצ'מרקים — וזה מה שמאפשר בכלל לבדוק את נתוני FLORES-200 ו-IFMTBench, וזה מה שהופך את המספר היחיד חסר־השם של Cohere לבולט לעומת זאת.

כמה עולה להתקשר לכל אחד מהם
ל‑1.8B של Tencent יש API מסחרי מתארח שהושק באוגוסט 2026, במחיר של בערך $0.044 למיליון טוקנים בקלט ו‑$0.177 למיליון טוקנים בפלט — זול במונחים מוחלטים, ובתמחור לפי טוקן. המודל של Cohere פועל בשכבה החינמית של Chat V2, בחינם עבור מפתחות ניסיון וייצור עד שמגיעים למגבלות הקצב, כך שעלות ההערכה היא אפס אבל עלות הייצור היא חוזה שעליכם לנהל משא ומתן. אירוח עצמי הופך את החשבון לחלוטין: 440MB במכשיר נייד לעומת שני B200s, וזה הבדל הנמדד בסדרי גודל ולא באחוזים.
הסיבה ששווה לציין את הפער הזה בטקסט על פלטפורמת ניתוב היא שהשכבה הזולה והשכבה היקרה אינן מתחרות — הן שני מצבים במפל, ומפלים הם בדיוק מה שנתב נועד לעשות. OrcaRouter מעבירה את מחיר המחירון של הספקים הלאה בתוספת רווח של 0%, כך שהורדת מחיר של ספק בנקודת קצה לתרגום מתארח נכנסת לתוקף אצלנו באותו יום בלי מרווח מתווך שצריך לנהל עליו משא ומתן מחדש, ושרשראות מעבר-כשל מאפשרות למודל קטן יותר לספוג את עיקר התעבורה בעוד מודל כבד יותר מקבל את הבקשות שהקטן נכשל בהן. נסו קודם את הזול, והסלימו במקרים הקשים, ותנו לשכבת הניתוב להחזיק במדיניות במקום בקוד היישום שלכם.
איזה אחד כדאי לך לבחור
אם התרגום שלך מתבצע במכשיר, במצב לא מקוון, במסגרת תקציב אחסון לכל מגהבייט, או בתוך מוצר מסחרי שאינו מעוניין לנהל משא ומתן על רישיון, Hy-MT2-1.8B הוא התשובה ו-North Small Translate 1.0 לא נמצא במרוץ. אם יחידת העבודה שלך היא מסמך ארוך באחת מחמישים השפות ש-Cohere תומכת בהן, אם אתה זקוק ל-16K של פלט במעבר אחד, ואם רישיון מסחרי הוא משהו שהארגון שלך מוכן לקנות, אז המודל של Cohere הוא המכונה היכולה יותר בכל ממד שנחשף — עם ההסתייגות שאיכותו נשענת על נתון יחיד שלא שוחזר.
ועבור רוב הצוותים התשובה הכנה היא גם וגם, בסדר הזה: המודל של 440MB עושה את העבודה השגרתית בעלות זניחה, המודל של 218B מטפל במסמכים החשובים, וההחלטה איזו בקשה הולכת לאן היא כלל ניתוב ולא שכתוב. הפער בין שני המודלים האלה אינו פער שיש לסגור. זהו ספקטרום שיש להשתמש בו.
