כרטיס Hero שכותרתו "North Small Translate 1.0 vs Hy-MT2-1.8B" עם כתובית המשנה "218GB של מודל לעומת 440MB", מעל שני כרטיסים: North Small Translate 1.0 (218B MoE, מינימום 2x B200) ו-Hy-MT2-1.8B (1.8B dense, 440MB, פועל על מכשיר נייד) עם סמל טלפון בקו מתאר.
Guides & Insights

North Small Translate 1.0 לעומת Hy-MT2-1.8B: 218GB של מודל מול 440MB

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

אחד מאלה נכנס לטלפון. Hy-MT2-1.8B, מודל התרגום על-גבי המכשיר של Tencent Hunyuan, שפורסם בקוד פתוח תחת Apache 2.0 ב-21 במאי 2026, מתכווץ ל-440 מגה-בייט תחת כימות 1.25-ביט של AngelSlim ורץ על סיליקון טלפונים של Apple, Qualcomm ו-MediaTek. North Small Translate 1.0, מודל ה-mixture-of-experts בעל 218 מיליארד פרמטרים ש-Cohere תיעדה בהערות השחרור שלו ב-9 בספטמבר 2026, מגיע עם סט משקולות FP8 בסדר גודל של 218 ג'יגה-בייט ודורש לפחות שני B200s. זה בערך פי חמש מאות אחסון עבור אחד מהם, והשאלה המעניינת היא לא איזה מהם טוב יותר — אלא לשם מה כל אחד מהם מיועד באמת, ואיזה רישיון מאפשר לך להפיץ אותו.

פער בגודל אינו פער באיכות

מפתה לפרש את 218B לעומת 1.8B כדירוג ישיר של יכולות. זה לא כך, משתי סיבות. הראשונה היא ש-North Small Translate 1.0 הוא מודל תערובת מומחים דליל שבו רק 25 מיליארד פרמטרים פעילים לכל טוקן, כך שהחישוב לכל טוקן נמצא בליגה שונה ממספר הפרמטרים. השנייה היא ששני המודלים עברו אופטימיזציה אל מול מטרות שונות: ה-1.8B של Tencent נבנה להיות קטן מספיק כדי לפעול באופן לא מקוון על מכשיר נייד, והמודל של Cohere נבנה להחזיק מסמך שלם בהקשר ולתרגם אותו כיחידה אחת.

ההבדל הזה ניכר בחלונות ההקשר. התצורה של Hy-MT2-1.8B מצהירה על עד 262,144 פוזיציות, אך הנחיות האינפרנס של Tencent עצמה מגבילות את היצירה ל-8,192 טוקנים — חלון העבודה המעשי הוא 8K. ‏North Small Translate 1.0 מתעד 16K קלט ו-16K פלט, שזה כפול מחלון הקלט, וחשוב יותר — 16K מלאים של פלט. אם יחידת העבודה שלכם היא מדריך שירות, תקציב הפלט הזה הוא התכונה. אם יחידת העבודה שלכם היא הודעת צ'אט, הוא חסר כל חשיבות.

סה״כ פרמטרים — North Small Translate 1.0: 218B MoE, 25B פעילים לעומת Hy-MT2-1.8B: 1.8B dense

הקשר — 16K קלט ו-16K פלט לעומת חלון עבודה של 8K (התצורה מצהירה על עד 262,144 מיקומים; ההנחיות של Tencent אומרות 8,192)

שפות — 50 (אנגלית + 49) לעומת 33 שפות ועוד 5 שפות מיעוטים וניבים

רישיון — CC BY-NC 4.0, מסחרי דרך Model Vault לעומת Apache 2.0, ללא הגבלת גישה

נפח מכומת — FP8 ~218GB, NVFP4 W4A16 ~109GB לעומת 440MB ברמת 1.25 סיביות; גם FP8 ו-GGUF פורסמו

חומרה מינימלית — 2×B200 או 4×H100 ב-FP8 לעומת מכשיר נייד

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-1.8B across six rows: Parameters 218B MoE / 25B active vs 1.8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Footprint about 218GB at FP8 vs 440MB at 1.25-bit; Minimum hardware 2x B200 vs a handset. Footer notes Hy-MT2 figures are vendor-reported by Tencent and Cohere's WMT26 83.60 is unaudited with an unnamed metric.

מה Tencent בעצם שחררה ב-1.8B

ה-1.8B הוא הקטן ביותר במשפחה בת שלושה מודלים — 1.8B, 7B ו-30B-A3B MoE, מודל הדגל — כולם שוחררו יחד עם בנצ'מרק נלווה בשם IFMTBench שמודד עמידה בהוראות תרגום ולא איכות תרגום גולמית. Tencent סיפקה קוונטיזציות FP8, GGUF, 2-ביט ו-1.25-ביט לצד משקולות הבסיס, וגרסת ה-1.25-ביט היא זו שמפיקה את הנתון 440MB והאצת הסקה מוצהרת של פי 1.5 לעומת הדור הקודם Hy-MT1.5. ההגשה נתמכת באמצעות transformers 5.6.0 ואילך, vLLM, SGLang ו-llama.cpp, כאשר מסלול ה-GGUF תלוי בקרנל STQ ששולב ב-llama.cpp. הדגימה המומלצת היא temperature 0.7, top_p 0.6, top_k 20, repetition penalty 1.05, ואין system prompt כברירת מחדל — ההפך מהגישה של Cohere.

הוא גם, שלא כמו North Small Translate 1.0, מודל שאימוצו ניכר לעין. המאגר ב-Hugging Face הורד יותר מ-23,000 פעמים וצבר כ-1,200 לייקים. המאגר הראשי של Cohere הציג 26 הורדות ואפס לייקים בזמן כתיבת שורות אלו.

הרישיון הוא ההבדל החד יותר

זה החלק שאמור להכריע ביותר פריסות מאשר טבלת הבנצ'מרק. Hy-MT2-1.8B הוא Apache 2.0 ללא הגבלת גישה — שימוש מסחרי, כיוונון עדין, יצירות נגזרות, הפצה מחדש, הכול מותר. North Small Translate 1.0 הוא CC BY-NC 4.0: המשקלים חופשיים לשימוש לא מסחרי, ופריסה מסחרית מחייבת רכישת רישיון דרך Cohere's Model Vault, שעבורו לא מפורסם מחיר.

במילים פשוטות: אם אתם בונים מוצר, המודל של Tencent הוא זה שאפשר לשחרר היום בלי שיחה, וזה של Cohere הוא זה שאפשר רק להעריך. האסימטריה הזו לא הופכת את המודל של Cohere לגרוע יותר, אבל היא משנה את סדר הפעולות — אתם מעריכים את של Cohere, ואת של Tencent אפשר לפרוס.

הראיות לאיכות הן א-סימטריות, ושני הצדדים מדווחים על ידי ספקים.

לאף אחד מהמודלים אין הערכה בלתי תלויה מאחוריו, אז התייחסו לכל מספר כאן כאל טענה של היצרן שלו. ההבדל הוא בכמה היצרנים שמו על השולחן. Tencent פרסמה טבלת השוואה מלאה ודו"ח טכני: בתרגום מאנגלית ל-X ב-FLORES-200, ‏Hy-MT2-1.8B רושם 90.00 לעומת 94.42 של Gemini 3.1 Pro ו-94.16 של GPT-5.5 — מאחור במידה מתונה אחרי מודלי החזית אך בתוך כמה נקודות, ממודל שנכנס לטלפון. בציון הכולל של IFMTBench למעקב אחר הוראות, ה-1.8B מגיע ל-69.36%, הרחק מאחורי ה-30B-A3B האח שלו עם 85.7% ו-Gemini 3.1 Pro עם 89.08%, שזו הקריאה הכנה של הפשרה: המודל הזעיר עוקב אחר הוראות עיצוב ומינוח באמינות הרבה פחותה מזו שבה הוא מתרגם.

Cohere פרסמה נתון אחד — ציון WMT26 של 83.60, שעולה ל-84.36 עם תהליך עבודה סוכני רב-מעברי — בלי שם מדד מצורף ובלי דף תוצאות WMT26 שכנגדו אפשר לבדוק אותו. זו אינה השוואה שאנו יכולים לערוך. אי אפשר להעמיד מספר אחד חסר שם מול טבלה של בנצ'מרקים בעלי שמות, ולהעמיד פנים אחרת יהיה הדבר המטעה ביותר שהמאמר הזה יכול לעשות.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

המשקל הנגדי של טנסנט הוא שהמספרים שלה מגיעים ממקום שקרוא יכול לבדוק. מאגר Hy-MT2 מפרסם את סקירת המשפחה, שלושת גדלי המודלים וסביבות ההרצה שכל אחד מהם תומך בהן לצד טבלת הבנצ'מרקים — וזה מה שמאפשר בכלל לבדוק את נתוני FLORES-200 ו-IFMTBench, וזה מה שהופך את המספר היחיד חסר־השם של Cohere לבולט לעומת זאת.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

כמה עולה להתקשר לכל אחד מהם

ל‑1.8B של Tencent יש API מסחרי מתארח שהושק באוגוסט 2026, במחיר של בערך $0.044 למיליון טוקנים בקלט ו‑$0.177 למיליון טוקנים בפלט — זול במונחים מוחלטים, ובתמחור לפי טוקן. המודל של Cohere פועל בשכבה החינמית של Chat V2, בחינם עבור מפתחות ניסיון וייצור עד שמגיעים למגבלות הקצב, כך שעלות ההערכה היא אפס אבל עלות הייצור היא חוזה שעליכם לנהל משא ומתן. אירוח עצמי הופך את החשבון לחלוטין: 440MB במכשיר נייד לעומת שני B200s, וזה הבדל הנמדד בסדרי גודל ולא באחוזים.

הסיבה ששווה לציין את הפער הזה בטקסט על פלטפורמת ניתוב היא שהשכבה הזולה והשכבה היקרה אינן מתחרות — הן שני מצבים במפל, ומפלים הם בדיוק מה שנתב נועד לעשות. OrcaRouter מעבירה את מחיר המחירון של הספקים הלאה בתוספת רווח של 0%, כך שהורדת מחיר של ספק בנקודת קצה לתרגום מתארח נכנסת לתוקף אצלנו באותו יום בלי מרווח מתווך שצריך לנהל עליו משא ומתן מחדש, ושרשראות מעבר-כשל מאפשרות למודל קטן יותר לספוג את עיקר התעבורה בעוד מודל כבד יותר מקבל את הבקשות שהקטן נכשל בהן. נסו קודם את הזול, והסלימו במקרים הקשים, ותנו לשכבת הניתוב להחזיק במדיניות במקום בקוד היישום שלכם.

איזה אחד כדאי לך לבחור

אם התרגום שלך מתבצע במכשיר, במצב לא מקוון, במסגרת תקציב אחסון לכל מגהבייט, או בתוך מוצר מסחרי שאינו מעוניין לנהל משא ומתן על רישיון, Hy-MT2-1.8B הוא התשובה ו-North Small Translate 1.0 לא נמצא במרוץ. אם יחידת העבודה שלך היא מסמך ארוך באחת מחמישים השפות ש-Cohere תומכת בהן, אם אתה זקוק ל-16K של פלט במעבר אחד, ואם רישיון מסחרי הוא משהו שהארגון שלך מוכן לקנות, אז המודל של Cohere הוא המכונה היכולה יותר בכל ממד שנחשף — עם ההסתייגות שאיכותו נשענת על נתון יחיד שלא שוחזר.

ועבור רוב הצוותים התשובה הכנה היא גם וגם, בסדר הזה: המודל של 440MB עושה את העבודה השגרתית בעלות זניחה, המודל של 218B מטפל במסמכים החשובים, וההחלטה איזו בקשה הולכת לאן היא כלל ניתוב ולא שכתוב. הפער בין שני המודלים האלה אינו פער שיש לסגור. זהו ספקטרום שיש להשתמש בו.