{{1}}כרטיס כותרת ראשי עבור 'Tencent Hy-MT2-7B לעומת Tencent Hy-MT2-1.8B'{{/1}} {{2}}עם כתובית המשנה 'הבחירה האיכותית בצד השרת או מתרגם של 440MB בכל טלפון'{{/2}} {{3}}המציג אייקון שרת ואייקון סמארטפון עם מאזניים ביניהם, שבב של 440MB, ושתי תוויות שמות דגמים,{{/3}} {{4}}עם לוגו OrcaRouter בפינה הימנית התחתונה.{{/4}}
Guides & Insights

Tencent Hy-MT2-7B לעומת Tencent Hy-MT2-1.8B: הבחירה האיכותית בצד השרת או מתרגם של 440MB בכל טלפון

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Tencent Hy-MT2-7B ו-Tencent Hy-MT2-1.8B הם שני הקצוות של אותה משפחה, ששוחררו יחד כקוד פתוח ב-21 במאי 2026, ושניהם הפכו זמינים לקריאה דרך ממשקי API מתארחים השבוע — ה-7B בסביבות 19 באוגוסט וה-1.8B יום לאחר מכן, כל אחד מהם מוגש על ידי Tencent Cloud. הם לא מתחרים במובן הרגיל, כי בקושי יש חפיפה במטרותיהם. ה-7B הוא הבחירה האיכותית: מודל צפוף שרץ על GPU יחיד או דרך API במחיר של 0.074 דולר למיליון אסימוני קלט ו-0.295 דולר למיליון אסימוני פלט. ה-1.8B הוא הבחירה למכשיר: מודל מכווץ ל-440 מגה-בייט שרץ על טלפון, לגמרי לא מקוון, במחיר של 0.044 / 0.177 דולר למיליון במסלול ה-API. אם אתם בוחרים ביניהם, התשובה נקבעת בעיקר לפי המקום שבו התרגום צריך להתרחש — ורק משנית לפי benchmarks, שקרובים הרבה יותר ממה שמרמז פער הפרמטרים של פי ארבעה.

התשובה בשורה אחת

בחר ב-7B כאשר התרגום מתרחש במרכז נתונים ואתה רוצה את האיכות הטובה ביותר לכל דולר שרת — על API או על GPU יחיד מסוג A100. בחר ב-1.8B כאשר התרגום חייב להתבצע על מכשיר, במצב לא מקוון, או בעלות הנמוכה ביותר האפשרית לטוקן. אם שניהם חיים באותו ענן והתקציב אינו הגורם המכריע, ה-7B מנצח באיכות. אם התוכן סודי, מוסדר, או צריך לעבוד ללא רשת, ה-1.8B הוא היחיד מבין השניים שיכול.

מפרטים, זה לצד זה

פרמטרים — 7B צפוף לעומת 1.8B צפוף.

טביעת רגל מכומתת — FP8 ו-GGUF יורדים לכמה GB לעומת 440MB באמצעות קוונטיזציה של AngelSlim 1.25-bit.

FLORES-200 (XX⇔XX) — 86.89 לעומת 79.77 במדד XCOMET-XXL, בערך 97.9% לעומת 89.9% מהציון של Gemini 3.1 Pro (Think), לפי דיווח היצרן.

WMT25 — 7B: 63.86/71.21/82.24; 1.8B עוקף את ממשקי ה-API המסחריים של מיקרוסופט ודואובאו בכל שלושת המדדים.

DomainMTBench (GEMBA) — 92.79 לעומת 91.08, לפי דיווח היצרן.

מחיר API — $0.074 / $0.295 לעומת $0.044 / $0.177 ל-1M טוקנים (קלט/פלט).

הקשר — שניהם 8,192 טוקנים.

פריסה — A100 / RTX 4090 יחיד או API בענן, לעומת שבבים מובנים במכשיר של Apple, Qualcomm ו-MediaTek, ללא חיבור לרשת.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B — the scoreboard'. Left column Hy-MT2-7B: Params 7B dense; FLORES-200 86.89; DomainMTBench GEMBA 92.79; API price $0.074 / $0.295; Deployment GPU or API; Best for quality in the cloud. Right column Hy-MT2-1.8B: Params 1.8B dense; FLORES-200 79.77; DomainMTBench GEMBA 91.08; API price $0.044 / $0.177; Deployment 440MB on-device; Best for offline and edge. Footer: Figures vendor-reported, unreproduced.

פער האיכות אמיתי אך צר יותר מפער הגודל

כל האמור להלן הוא הערכה עצמית של Tencent, שלא שוחזרה. ב-FLORES-200, ה-7B מקדים את ה-1.8B בשמונה נקודות XCOMET (86.89 לעומת 79.77), וזה הפער שעליו מבוסס המיצוב של "מאוזן" לעומת "מותאם למכשיר". אבל ב-DomainMTBench — מדד תרגום התחומים המכסה פיננסים, פוליטיקה וחינוך — ה-1.8B נוחת במרחק 1.7 נקודות GEMBA מה-7B (91.08 לעומת 92.79). והביצועים של ה-1.8B מול שאר העולם הם הפרט שממשיך להפתיע: Tencent מדווחת שהוא מביס את ממשקי ה-API המסחריים לתרגום של Microsoft ושל Doubao בכל שלושת מדדי WMT25, ומתעלה על Tower-Plus-72B, מודל שגדול ממנו פי ארבעים. אז בטקסט תחומי רגיל, המודל הקטן קרוב בהרבה לאחיו הגדול, הרבה יותר ממה שהיחס של פי ארבעה בפרמטרים היה מרמז. יתרונו האמיתי של ה-7B מתגלה בזנב התרגום הכללי ובהנחיות קשות, שבהן ההובלה שלו ב-FLORES וציוני המשימות המורכבות הגבוהים יותר ב-IFMTBench יוצרים הפרש ברור בין השניים.

פיצול הפריסה

ה-7B דורש תשתית — או API ענן או GPU יחיד ברמת A100, עם הפעולות הרגילות הנלוות. ה-1.8B, בגודל 440MB עם קוונטיזציה של 1.25-bit של AngelSlim, רץ על אותם שבבים כמו אפליקציית טלפון טיפוסית, מהיר פי 1.5 מהדור הקודם Hy-MT1.5, ואינו צריך רשת כלל. זה הופך פרטיות מתכונה לברירת מחדל: עבור חוזים, רשומות רפואיות או כל דבר מוסדר, הנתונים לעולם לא עוזבים את המכשיר, וזו תכונה ששום מחיר לפי טוקן לא יכול לקנות בצד השרת. הפשרה ניכרת בתרגום כללי בסגנון FLORES, שבו היכולת הנוספת של ה-7B באה לידי ביטוי — ובכל הוראה מורכבת מספיק כדי להעמיד את הציון 83.14 של ה-1.8B ב-IFMTBench מול התקרה הגבוהה יותר של ה-7B.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-1.8B (captured August 23 2026) showing the model name and the on-device positioning with 33-language support and the 440MB AngelSlim quantization claim.

מתמטיקת העלות

בשכבת ה-API שני הדגמים זולים; ה-1.8B זול יותר. במחיר של $0.044 / $0.177 לעומת $0.074 / $0.295 למיליון, הדגם הקטן פועל בכ-40% מתחת ל-7B בשני צדדי החשבון — בקצב יציב של מיליון טוקני פלט ביום, מדובר בכ-$70 ליום לעומת $118. במכשיר עצמו, ה-1.8B עולה אפס לכל טוקן, וזה המספר שמכריע כל השוואת שרתים בהיקף גדול. הטיעון הנגדי של ה-7B אינו המחיר אלא מרווח הראש: אם הקורפוס שלך נוטה לטכני, משפטי או עתיר הוראות, מרווח האיכות של ה-7B הוא בדיוק הדבר שמתבטא בפחות תרגומים חוזרים — ותרגומים חוזרים הם עלות היחידה האמיתית בתרגום מכונה מקצועי.

A generated infographic titled 'The deployment fork' with two branches: a cloud-server card labelled 'Hy-MT2-7B — server: one GPU or the API, $0.074 / $0.295' and a smartphone card labelled 'Hy-MT2-1.8B — on-device: 440MB, offline, free per token', with the footer 'Same family, released May 21 2026; both now API-callable.'

ניתוב שני הגדלים

אף אחד מהמודלים אינו בקטלוג של OrcaRouter נכון לכתיבת שורות אלו, ולכן המסגור הכנה הוא ששניהם מסופקים דרך הענן של Tencent עצמה וכמה פלטפורמות צד-שלישי. ההשוואה עדיין מלמדת את לקח הניתוב שסביבו בנוי הבלוג הזה: כאשר שני מודלים חופפים ביכולות אך נבדלים במחיר ובזמן השהיה, הפריסה הרציונלית אינה "לבחור אחד" אלא "לנתב לפי עומס עבודה" — את הנתח בעל הנפח הגבוה והקושי הנמוך למודל הקטן והזול, ואת הנתח הקשה למודל האיכות, עם מעבר אוטומטי כך שהשבתה באחד מהם לעולם לא עוצרת את צינור העבודה. זה בדיוק התבנית ש-DSL הניתוב של OrcaRouter מרכיב על פני 200+ המודלים שאנו נושאים, כאשר מחיר המחירון של כל ספק מועבר במעבר ב-0% מרווח. אם משפחת התרגום של Tencent תצטרף לקטלוג, היא תהיה השוכרת הטבעית הבאה.

פסק הדין

אם התרגום מתבצע במרכז הנתונים שלך, קח את Tencent Hy-MT2-7B — דרך ה-API אם אתה רוצה אפס תפעול, על GPU יחיד אם אתה רוצה בעלות מלאה — ותפסיק לקרוא. אם התרגום חייב להתבצע על מכשיר, במצב לא מקוון, או תחת דרישת סודיות, קח את Tencent Hy-MT2-1.8B וטביעת הרגל של 440MB מנצחת בהגדרה. המקרה הקשה היחיד באמת הוא עומס עבודה בענן בהיקף בינוני, שבו גם האיכות של ה-7B וגם המחיר של ה-1.8B מוצדקים. שם, אל תחליט על סמך מבחני ספקים: פער ה-GEMBA המדווח הוא מתחת לשתי נקודות, אז הריץ את שניהם על טקסט תחומי משלך ותן לנתונים שלך לבחור.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube