
ל-Tencent Hy-MT2-7B יש כעת API מתארח: מה משנה מתרגם במחיר $0.295 למיליון טוקני פלט
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
Tencent Hy-MT2-7B, מודל התרגום בקוד פתוח של Tencent Hunyuan שפורסם ב-21 במאי 2026, הפך השבוע לזמין דרך API מתארח: בסביבות 19 באוגוסט 2026, מודל ה-7B הצפוף הושק בנקודת הקצה המתארחת של Tencent Cloud במחיר של 0.074 דולר למיליון טוקני קלט ו-0.295 דולר למיליון טוקני פלט, עם חלון הקשר של 8,192 טוקנים. הוא לא הגיע לבד — Tencent Hy-MT2-1.8B ו-Tencent Hy-MT2-30B-A3B עלו על אותו backend בתוך יום. המשקלים נמצאים ב-Hugging Face וב-ModelScope כבר שלושה חודשים; מה שחדש הוא שצוות יכול כעת לקרוא למודל בלי לשכור GPU, בלי לבנות llama.cpp מקוד המקור, או בלי לספק את ערכת הכלים של 1.25-bit-on-device. עבור עומס עבודה של תרגום, זהו ההבדל בין ניסוי להחלטה מוצרית.
מה בדיוק שוחרר
הנקודה המסחרית היא של Tencent Cloud עצמה, חשופה דרך ה-API של הספק וכמה פלטפורמות צד שלישי. שלושת הגדלים רצים כל אחד בהקשר של 8K עם השלמות של 4,096 אסימונים; כל השלושה מקבלים פלט מובנה באמצעות סכמת JSON בשדה response_format שלהם, ואף אחד מהם לא מיישם קריאת פונקציות. המפרט המעשי, בשורה אחת לכל ממד:
• Tencent Hy-MT2-7B — $0.074 קלט / $0.295 פלט לכל מיליון טוקנים, הקשר של 8,192, דחוס ~7B, תומך בפלט מובנה, ללא קריאות כלים.
• Tencent Hy-MT2-1.8B — $0.044 לקלט / $0.177 לפלט לכל 1M טוקנים, הקשר 8,192, 1.8B דחוס, ללא קריאות לכלים.
• Tencent Hy-MT2-30B-A3B — $0.074 קלט / $0.295 פלט לכל מיליון טוקנים, הקשר 8,192, MoE 30B סה״כ / 3B פעילים, תומך בפלט מובנה, ללא קריאות כלים.
נקודת המחיר המרכזית היא קצב הפלט של 7B: מתחת לשלוש עשיריות סנט לאלף טוקני פלט, עבור מודל שטנסנט טוענת שמתמודד בכבוד מול מודלים גדולים בסדר גודל. תרגום הוא אחד ממעט עומסי העבודה של LLM שבהם טוקני הפלט הם כמעט כל החשבון, ולכן מחיר הפלט הוא המספר שקובע אם פייפליין כדאי בהיקפים גדולים.

המודל שמאחורי נקודת הקצה
Hy-MT2 היא משפחת ה"חשיבה המהירה" של Tencent: במקום להשקיע שרשורי חשיבה ארוכים על כל משפט, היא תוכננה להגיב כמו מתרגם מקצועי — להתעכב כאשר המקור מעורפל, ולפעול במהירות כאשר אינו. ה-7B הוא האמצע המאוזן של המשפחה, מודל צפוף ברישיון Apache-2.0, המכסה 33 שפות ועוד חמישה זוגות של שפות מיעוט וניבים סיניים (ביניהם טיבטית, קזחית, מונגולית, אויגורית וקנטונזית). מה שמבדיל אותו מ-LLM כללי שעושה תרגום הוא היכולת לעקוב אחר הוראות: הוא ישמור על מונח במילון מונחים לאורך מסמך, יחיל סגנון מוגדר, ישאיר תוחמים ומפתחות JSON ללא שינוי, ויקבל הוראות התאמה אישית בשפה פשוטה. Tencent שחררה את IFMTBench, מדד פתוח בדיוק למיומנות הזו, לצד המשקלים, והממשק לצרכן — מיני-התוכנית Tencent Hy Translate, עם אפליקציות iOS ו-Android בדרך — בנוי על המשפחה הזו.

המספרים, עם הכוכבית המצורפת
הכל להלן הוא הערכה עצמית של Tencent, שפורסמה בכרטיס המודל ובדוח הנלווה; שום חלק ממנה לא שוכפל באופן בלתי תלוי נכון למועד כתיבת שורות אלה. במסלול התרגום הכללי XX⇔XX של FLORES-200, המודל בעל 7B משיג ציון 86.89 XCOMET-XXL, ש-Tencent מעריכה כשווה ערך לכ-97.9% מ-Gemini 3.1 Pro (Think). במצב "חשיבה מהירה" שלו, נטען שהוא עוקף מודלים כלליים בקוד פתוח, כולל DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B ו-Gemma4-26B-A4B. ב-WMT25 הציונים שלו משתפרים בכל המדדים לעומת הדור הקודם — 63.86/71.21/82.24 לעומת 61.59/68.85/75.91 של Hy-MT1.5-7B, כשהשיפור הגדול ביותר הוא ב-GEMBA — וב-DomainMTBench (פיננסים, פוליטיקה, חינוך) הוא רושם 94.92 XCOMET / 92.79 GEMBA. יכולת מעקב ההוראות שלו היא התחום שבו הוא נבדל בצורה הבולטת ביותר ממודלי תרגום מלפני שנה: 89.73 פשוט / 72.67 מורכב / 83.14 סה"כ ב-IFMTBench.
מה משנה API מתארח עבור צנרת תרגום
אירוח עצמי של ה-7B הוא באמת קל, ככל שהדברים האלה הולכים — הוא רץ על A100 יחיד או RTX 4090, וקיימים builds של FP8 ו-GGUF מכומתים. אבל "קל לאירוח עצמי" זה לא "אפס תפעול." נתיב ה-GGUF תלוי כיום ב-llama.cpp עם ליבת STQ של Tencent, נתיב ה-FP8 דורש את המחסנית המתאימה, ומישהו צריך לפקח על זה. נקודת קצה מתארחת מסירה את כל זה מהשולחן: אין GPU, אין בניית קרנל, אין תכנון קיבולת, ומחיר per-token שהוא קבוע ללא קשר לניצול. עבור צוות שמעבד מיליוני משפטים מתורגמים ביום, היכולת לחזות זאת חשובה יותר מאשר ה-benchmark הראשי — וזו הסיבה שהשבוע הזה חשוב יותר מההשקה במאי.

שאלת הניתוב שאף אחד עוד לא שואל
מכיוון שהמודל בן שלושה ימים בלבד בצד ה-API, הדרך הריאלית לאמץ אותו היא הדרך שבה מאמצים כל ספק חדש לגמרי: לשים אותו מאחורי כלל ניתוב עם failover אוטומטי, כך שנקודת קצה שלא נבדקה לעולם לא תוכל להפיל נתיב ייצור, ולתת לנפח התעבורה להחליט אם הוא ראוי למשבצת קבע. זה בדיוק התבנית ש-DSL הניתוב של OrcaRouter מרכיב על פני יותר מ-200 המודלים שאנחנו כן נושאים — וכדאי להיות מדויקים כאן: Tencent Hy-MT2-7B לא נמצא בקטלוג של OrcaRouter נכון לכתיבת שורות אלה, אז זה לא סיפור של "תתקשרו דרכנו". מה שכן רלוונטי הוא מודל התמחור. OrcaRouter מעביר את מחירון כל ספק כפי שהוא עם 0% תוספת, כך שכשספק מוריד את התעריף, ההורדה פעילה בפלטפורמה באותו היום. עבור עומס עבודה של תרגום בהיקף גדול, השאלה שצריך לשאול על כל נקודת קצה היא לא "מה המחיר בפורטל היום" אלא "מהו המחירון האמיתי לכל token שהספק גובה, והאם משהו יושב ביני לבינו". במחיר של $0.295/M לפלט, Tencent Hy-MT2-7B הפך את השאלה הזאת למעניינת.
מה לצפות בהמשך
שלושה דברים נובעים מהשבוע הזה. ראשית, האחים 1.8B ו-30B-A3B ניתנים כעת לקריאה באותה מידה, כך שההחלטה על "איזה גודל" היא שאלת API אמיתית ולא החלטה של אירוח עצמי (למשפחה יש דפי השוואה משלה, אבל הגרסה הקצרה היא: 1.8B למכשיר ולשכבה הזולה ביותר, 30B-A3B לתחומים ברמה מקצועית, 7B באמצע). שנית, השותפות של Tencent ב-WMT26 מציעה פרסים לצוותים המשתמשים במודלי Hy-MT במשימות תרגום מכונה כללי ותרגום כתוביות וידאו — איתות שטנסנט מתכוונת שמשפחה זו תהיה ברירת המחדל הפתוחה לתרגום ב-MT תחרותי. שלישית, אפליקציות ה-iOS וה-Android עם הסקה על המכשיר, אם הן ישוגרו כפי שהוכרז, יהפכו את ה-1.8B למודל התרגום הפתוח המותקן ביותר בעולם. ה-API המארח הוא החלק שהשתנה השבוע; המסלול של המשפחה נקבע במאי.
