
Tencent Hy-MT2-7B לעומת Tencent Hy-MT2-1.8B: הבחירה האיכותית בצד השרת או מתרגם של 440MB בכל טלפון
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
Tencent Hy-MT2-7B ו-Tencent Hy-MT2-1.8B הם שני הקצוות של אותה משפחה, ששוחררו יחד כקוד פתוח ב-21 במאי 2026, ושניהם הפכו זמינים לקריאה דרך ממשקי API מתארחים השבוע — ה-7B בסביבות 19 באוגוסט וה-1.8B יום לאחר מכן, כל אחד מהם מוגש על ידי Tencent Cloud. הם לא מתחרים במובן הרגיל, כי בקושי יש חפיפה במטרותיהם. ה-7B הוא הבחירה האיכותית: מודל צפוף שרץ על GPU יחיד או דרך API במחיר של 0.074 דולר למיליון אסימוני קלט ו-0.295 דולר למיליון אסימוני פלט. ה-1.8B הוא הבחירה למכשיר: מודל מכווץ ל-440 מגה-בייט שרץ על טלפון, לגמרי לא מקוון, במחיר של 0.044 / 0.177 דולר למיליון במסלול ה-API. אם אתם בוחרים ביניהם, התשובה נקבעת בעיקר לפי המקום שבו התרגום צריך להתרחש — ורק משנית לפי benchmarks, שקרובים הרבה יותר ממה שמרמז פער הפרמטרים של פי ארבעה.
התשובה בשורה אחת
בחר ב-7B כאשר התרגום מתרחש במרכז נתונים ואתה רוצה את האיכות הטובה ביותר לכל דולר שרת — על API או על GPU יחיד מסוג A100. בחר ב-1.8B כאשר התרגום חייב להתבצע על מכשיר, במצב לא מקוון, או בעלות הנמוכה ביותר האפשרית לטוקן. אם שניהם חיים באותו ענן והתקציב אינו הגורם המכריע, ה-7B מנצח באיכות. אם התוכן סודי, מוסדר, או צריך לעבוד ללא רשת, ה-1.8B הוא היחיד מבין השניים שיכול.
מפרטים, זה לצד זה
• פרמטרים — 7B צפוף לעומת 1.8B צפוף.
• טביעת רגל מכומתת — FP8 ו-GGUF יורדים לכמה GB לעומת 440MB באמצעות קוונטיזציה של AngelSlim 1.25-bit.
• FLORES-200 (XX⇔XX) — 86.89 לעומת 79.77 במדד XCOMET-XXL, בערך 97.9% לעומת 89.9% מהציון של Gemini 3.1 Pro (Think), לפי דיווח היצרן.
• WMT25 — 7B: 63.86/71.21/82.24; 1.8B עוקף את ממשקי ה-API המסחריים של מיקרוסופט ודואובאו בכל שלושת המדדים.
• DomainMTBench (GEMBA) — 92.79 לעומת 91.08, לפי דיווח היצרן.
• מחיר API — $0.074 / $0.295 לעומת $0.044 / $0.177 ל-1M טוקנים (קלט/פלט).
• הקשר — שניהם 8,192 טוקנים.
• פריסה — A100 / RTX 4090 יחיד או API בענן, לעומת שבבים מובנים במכשיר של Apple, Qualcomm ו-MediaTek, ללא חיבור לרשת.

פער האיכות אמיתי אך צר יותר מפער הגודל
כל האמור להלן הוא הערכה עצמית של Tencent, שלא שוחזרה. ב-FLORES-200, ה-7B מקדים את ה-1.8B בשמונה נקודות XCOMET (86.89 לעומת 79.77), וזה הפער שעליו מבוסס המיצוב של "מאוזן" לעומת "מותאם למכשיר". אבל ב-DomainMTBench — מדד תרגום התחומים המכסה פיננסים, פוליטיקה וחינוך — ה-1.8B נוחת במרחק 1.7 נקודות GEMBA מה-7B (91.08 לעומת 92.79). והביצועים של ה-1.8B מול שאר העולם הם הפרט שממשיך להפתיע: Tencent מדווחת שהוא מביס את ממשקי ה-API המסחריים לתרגום של Microsoft ושל Doubao בכל שלושת מדדי WMT25, ומתעלה על Tower-Plus-72B, מודל שגדול ממנו פי ארבעים. אז בטקסט תחומי רגיל, המודל הקטן קרוב בהרבה לאחיו הגדול, הרבה יותר ממה שהיחס של פי ארבעה בפרמטרים היה מרמז. יתרונו האמיתי של ה-7B מתגלה בזנב התרגום הכללי ובהנחיות קשות, שבהן ההובלה שלו ב-FLORES וציוני המשימות המורכבות הגבוהים יותר ב-IFMTBench יוצרים הפרש ברור בין השניים.
פיצול הפריסה
ה-7B דורש תשתית — או API ענן או GPU יחיד ברמת A100, עם הפעולות הרגילות הנלוות. ה-1.8B, בגודל 440MB עם קוונטיזציה של 1.25-bit של AngelSlim, רץ על אותם שבבים כמו אפליקציית טלפון טיפוסית, מהיר פי 1.5 מהדור הקודם Hy-MT1.5, ואינו צריך רשת כלל. זה הופך פרטיות מתכונה לברירת מחדל: עבור חוזים, רשומות רפואיות או כל דבר מוסדר, הנתונים לעולם לא עוזבים את המכשיר, וזו תכונה ששום מחיר לפי טוקן לא יכול לקנות בצד השרת. הפשרה ניכרת בתרגום כללי בסגנון FLORES, שבו היכולת הנוספת של ה-7B באה לידי ביטוי — ובכל הוראה מורכבת מספיק כדי להעמיד את הציון 83.14 של ה-1.8B ב-IFMTBench מול התקרה הגבוהה יותר של ה-7B.

מתמטיקת העלות
בשכבת ה-API שני הדגמים זולים; ה-1.8B זול יותר. במחיר של $0.044 / $0.177 לעומת $0.074 / $0.295 למיליון, הדגם הקטן פועל בכ-40% מתחת ל-7B בשני צדדי החשבון — בקצב יציב של מיליון טוקני פלט ביום, מדובר בכ-$70 ליום לעומת $118. במכשיר עצמו, ה-1.8B עולה אפס לכל טוקן, וזה המספר שמכריע כל השוואת שרתים בהיקף גדול. הטיעון הנגדי של ה-7B אינו המחיר אלא מרווח הראש: אם הקורפוס שלך נוטה לטכני, משפטי או עתיר הוראות, מרווח האיכות של ה-7B הוא בדיוק הדבר שמתבטא בפחות תרגומים חוזרים — ותרגומים חוזרים הם עלות היחידה האמיתית בתרגום מכונה מקצועי.

ניתוב שני הגדלים
אף אחד מהמודלים אינו בקטלוג של OrcaRouter נכון לכתיבת שורות אלו, ולכן המסגור הכנה הוא ששניהם מסופקים דרך הענן של Tencent עצמה וכמה פלטפורמות צד-שלישי. ההשוואה עדיין מלמדת את לקח הניתוב שסביבו בנוי הבלוג הזה: כאשר שני מודלים חופפים ביכולות אך נבדלים במחיר ובזמן השהיה, הפריסה הרציונלית אינה "לבחור אחד" אלא "לנתב לפי עומס עבודה" — את הנתח בעל הנפח הגבוה והקושי הנמוך למודל הקטן והזול, ואת הנתח הקשה למודל האיכות, עם מעבר אוטומטי כך שהשבתה באחד מהם לעולם לא עוצרת את צינור העבודה. זה בדיוק התבנית ש-DSL הניתוב של OrcaRouter מרכיב על פני 200+ המודלים שאנו נושאים, כאשר מחיר המחירון של כל ספק מועבר במעבר ב-0% מרווח. אם משפחת התרגום של Tencent תצטרף לקטלוג, היא תהיה השוכרת הטבעית הבאה.
פסק הדין
אם התרגום מתבצע במרכז הנתונים שלך, קח את Tencent Hy-MT2-7B — דרך ה-API אם אתה רוצה אפס תפעול, על GPU יחיד אם אתה רוצה בעלות מלאה — ותפסיק לקרוא. אם התרגום חייב להתבצע על מכשיר, במצב לא מקוון, או תחת דרישת סודיות, קח את Tencent Hy-MT2-1.8B וטביעת הרגל של 440MB מנצחת בהגדרה. המקרה הקשה היחיד באמת הוא עומס עבודה בענן בהיקף בינוני, שבו גם האיכות של ה-7B וגם המחיר של ה-1.8B מוצדקים. שם, אל תחליט על סמך מבחני ספקים: פער ה-GEMBA המדווח הוא מתחת לשתי נקודות, אז הריץ את שניהם על טקסט תחומי משלך ותן לנתונים שלך לבחור.
