כרטיס כותרת ראשי עבור 'ל-Tencent Hy-MT2-7B יש כעת API מתארח' עם כותרת המשנה 'מה משנה מתרגם בעלות $0.295 למיליון פלט', המציג אייקון שירות ענן, גליף תרגום, קו מחבר API, ותג מחיר עם הכיתוב $0.074 / $0.295 לכל 1M טוקנים, ועם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

ל-Tencent Hy-MT2-7B יש כעת API מתארח: מה משנה מתרגם במחיר $0.295 למיליון טוקני פלט

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Tencent Hy-MT2-7B, מודל התרגום בקוד פתוח של Tencent Hunyuan שפורסם ב-21 במאי 2026, הפך השבוע לזמין דרך API מתארח: בסביבות 19 באוגוסט 2026, מודל ה-7B הצפוף הושק בנקודת הקצה המתארחת של Tencent Cloud במחיר של 0.074 דולר למיליון טוקני קלט ו-0.295 דולר למיליון טוקני פלט, עם חלון הקשר של 8,192 טוקנים. הוא לא הגיע לבד — Tencent Hy-MT2-1.8B ו-Tencent Hy-MT2-30B-A3B עלו על אותו backend בתוך יום. המשקלים נמצאים ב-Hugging Face וב-ModelScope כבר שלושה חודשים; מה שחדש הוא שצוות יכול כעת לקרוא למודל בלי לשכור GPU, בלי לבנות llama.cpp מקוד המקור, או בלי לספק את ערכת הכלים של 1.25-bit-on-device. עבור עומס עבודה של תרגום, זהו ההבדל בין ניסוי להחלטה מוצרית.

מה בדיוק שוחרר

הנקודה המסחרית היא של Tencent Cloud עצמה, חשופה דרך ה-API של הספק וכמה פלטפורמות צד שלישי. שלושת הגדלים רצים כל אחד בהקשר של 8K עם השלמות של 4,096 אסימונים; כל השלושה מקבלים פלט מובנה באמצעות סכמת JSON בשדה response_format שלהם, ואף אחד מהם לא מיישם קריאת פונקציות. המפרט המעשי, בשורה אחת לכל ממד:

Tencent Hy-MT2-7B — $0.074 קלט / $0.295 פלט לכל מיליון טוקנים, הקשר של 8,192, דחוס ~7B, תומך בפלט מובנה, ללא קריאות כלים.

Tencent Hy-MT2-1.8B — $0.044 לקלט / $0.177 לפלט לכל 1M טוקנים, הקשר 8,192, 1.8B דחוס, ללא קריאות לכלים.

Tencent Hy-MT2-30B-A3B — $0.074 קלט / $0.295 פלט לכל מיליון טוקנים, הקשר 8,192, MoE 30B סה״כ / 3B פעילים, תומך בפלט מובנה, ללא קריאות כלים.

נקודת המחיר המרכזית היא קצב הפלט של 7B: מתחת לשלוש עשיריות סנט לאלף טוקני פלט, עבור מודל שטנסנט טוענת שמתמודד בכבוד מול מודלים גדולים בסדר גודל. תרגום הוא אחד ממעט עומסי העבודה של LLM שבהם טוקני הפלט הם כמעט כל החשבון, ולכן מחיר הפלט הוא המספר שקובע אם פייפליין כדאי בהיקפים גדולים.

A single-column scoreboard titled 'Tencent Hy-MT2-7B — the scoreboard' listing six rows: Params dense 7B; Price $0.074 / $0.295 per 1M; Context 8,192 tokens; FLORES-200 86.89 (~97.9% of Gemini 3.1 Pro Think); WMT25 63.86 / 71.21 / 82.24; License Apache-2.0, with the footer 'All figures vendor-reported; API price as listed Aug 2026.'

המודל שמאחורי נקודת הקצה

Hy-MT2 היא משפחת ה"חשיבה המהירה" של Tencent: במקום להשקיע שרשורי חשיבה ארוכים על כל משפט, היא תוכננה להגיב כמו מתרגם מקצועי — להתעכב כאשר המקור מעורפל, ולפעול במהירות כאשר אינו. ה-7B הוא האמצע המאוזן של המשפחה, מודל צפוף ברישיון Apache-2.0, המכסה 33 שפות ועוד חמישה זוגות של שפות מיעוט וניבים סיניים (ביניהם טיבטית, קזחית, מונגולית, אויגורית וקנטונזית). מה שמבדיל אותו מ-LLM כללי שעושה תרגום הוא היכולת לעקוב אחר הוראות: הוא ישמור על מונח במילון מונחים לאורך מסמך, יחיל סגנון מוגדר, ישאיר תוחמים ומפתחות JSON ללא שינוי, ויקבל הוראות התאמה אישית בשפה פשוטה. Tencent שחררה את IFMTBench, מדד פתוח בדיוק למיומנות הזו, לצד המשקלים, והממשק לצרכן — מיני-התוכנית Tencent Hy Translate, עם אפליקציות iOS ו-Android בדרך — בנוי על המשפחה הזו.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-7B (captured August 23 2026) showing the model name, Apache-2.0 license, and the family description covering 33 languages plus five minority-language and dialect pairs.

המספרים, עם הכוכבית המצורפת

הכל להלן הוא הערכה עצמית של Tencent, שפורסמה בכרטיס המודל ובדוח הנלווה; שום חלק ממנה לא שוכפל באופן בלתי תלוי נכון למועד כתיבת שורות אלה. במסלול התרגום הכללי XX⇔XX של FLORES-200, המודל בעל 7B משיג ציון 86.89 XCOMET-XXL, ש-Tencent מעריכה כשווה ערך לכ-97.9% מ-Gemini 3.1 Pro (Think). במצב "חשיבה מהירה" שלו, נטען שהוא עוקף מודלים כלליים בקוד פתוח, כולל DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B ו-Gemma4-26B-A4B. ב-WMT25 הציונים שלו משתפרים בכל המדדים לעומת הדור הקודם — 63.86/71.21/82.24 לעומת 61.59/68.85/75.91 של Hy-MT1.5-7B, כשהשיפור הגדול ביותר הוא ב-GEMBA — וב-DomainMTBench (פיננסים, פוליטיקה, חינוך) הוא רושם 94.92 XCOMET / 92.79 GEMBA. יכולת מעקב ההוראות שלו היא התחום שבו הוא נבדל בצורה הבולטת ביותר ממודלי תרגום מלפני שנה: 89.73 פשוט / 72.67 מורכב / 83.14 סה"כ ב-IFMTBench.

מה משנה API מתארח עבור צנרת תרגום

אירוח עצמי של ה-7B הוא באמת קל, ככל שהדברים האלה הולכים — הוא רץ על A100 יחיד או RTX 4090, וקיימים builds של FP8 ו-GGUF מכומתים. אבל "קל לאירוח עצמי" זה לא "אפס תפעול." נתיב ה-GGUF תלוי כיום ב-llama.cpp עם ליבת STQ של Tencent, נתיב ה-FP8 דורש את המחסנית המתאימה, ומישהו צריך לפקח על זה. נקודת קצה מתארחת מסירה את כל זה מהשולחן: אין GPU, אין בניית קרנל, אין תכנון קיבולת, ומחיר per-token שהוא קבוע ללא קשר לניצול. עבור צוות שמעבד מיליוני משפטים מתורגמים ביום, היכולת לחזות זאת חשובה יותר מאשר ה-benchmark הראשי — וזו הסיבה שהשבוע הזה חשוב יותר מההשקה במאי.

A screenshot of the Tencent Cloud techpedia page for Hy-MT2 (captured August 23 2026, English) showing the header 'Hy-MT2: High-Performance Multilingual Translation Model', the 2026-05-21 publication date, and a summary line about translating across 33 languages.

שאלת הניתוב שאף אחד עוד לא שואל

מכיוון שהמודל בן שלושה ימים בלבד בצד ה-API, הדרך הריאלית לאמץ אותו היא הדרך שבה מאמצים כל ספק חדש לגמרי: לשים אותו מאחורי כלל ניתוב עם failover אוטומטי, כך שנקודת קצה שלא נבדקה לעולם לא תוכל להפיל נתיב ייצור, ולתת לנפח התעבורה להחליט אם הוא ראוי למשבצת קבע. זה בדיוק התבנית ש-DSL הניתוב של OrcaRouter מרכיב על פני יותר מ-200 המודלים שאנחנו כן נושאים — וכדאי להיות מדויקים כאן: Tencent Hy-MT2-7B לא נמצא בקטלוג של OrcaRouter נכון לכתיבת שורות אלה, אז זה לא סיפור של "תתקשרו דרכנו". מה שכן רלוונטי הוא מודל התמחור. OrcaRouter מעביר את מחירון כל ספק כפי שהוא עם 0% תוספת, כך שכשספק מוריד את התעריף, ההורדה פעילה בפלטפורמה באותו היום. עבור עומס עבודה של תרגום בהיקף גדול, השאלה שצריך לשאול על כל נקודת קצה היא לא "מה המחיר בפורטל היום" אלא "מהו המחירון האמיתי לכל token שהספק גובה, והאם משהו יושב ביני לבינו". במחיר של $0.295/M לפלט, Tencent Hy-MT2-7B הפך את השאלה הזאת למעניינת.

מה לצפות בהמשך

שלושה דברים נובעים מהשבוע הזה. ראשית, האחים 1.8B ו-30B-A3B ניתנים כעת לקריאה באותה מידה, כך שההחלטה על "איזה גודל" היא שאלת API אמיתית ולא החלטה של אירוח עצמי (למשפחה יש דפי השוואה משלה, אבל הגרסה הקצרה היא: 1.8B למכשיר ולשכבה הזולה ביותר, 30B-A3B לתחומים ברמה מקצועית, 7B באמצע). שנית, השותפות של Tencent ב-WMT26 מציעה פרסים לצוותים המשתמשים במודלי Hy-MT במשימות תרגום מכונה כללי ותרגום כתוביות וידאו — איתות שטנסנט מתכוונת שמשפחה זו תהיה ברירת המחדל הפתוחה לתרגום ב-MT תחרותי. שלישית, אפליקציות ה-iOS וה-Android עם הסקה על המכשיר, אם הן ישוגרו כפי שהוכרז, יהפכו את ה-1.8B למודל התרגום הפתוח המותקן ביותר בעולם. ה-API המארח הוא החלק שהשתנה השבוע; המסלול של המשפחה נקבע במאי.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube