כרטיס כותרת ראשי עבור 'Tencent Hy-MT2-7B לעומת Tencent Hy-MT2-30B-A3B' עם כתובית המשנה 'נקודת האיזון הצפופה או דגל ה-MoE באותו מחיר', המציג שתי סמלי ערימת מודלים עם סימן שוויון ביניהם ושני תגי מחיר זהים המסומנים $0.074 / $0.295, עם לוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Tencent Hy-MT2-7B לעומת Tencent Hy-MT2-30B-A3B: נקודת האיזון הצפופה או ספינת הדגל של MoE במחיר זהה

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הנה ההפתעה שבלב המפגש הזה: Tencent Hy-MT2-7B, מודל צפוף עם 7B פרמטרים, ו-Tencent Hy-MT2-30B-A3B, דגל תערובת המומחים עם 30 מיליארד פרמטרים בסך הכול וכ-3 מיליארד פעילים, שניהם הפכו זמינים לקריאה דרך ממשקי API מתארחים השבוע — ה-7B בסביבות 19 באוגוסט 2026, וה-30B-A3B יום לאחר מכן, שניהם מסופקים על ידי Tencent Cloud — במחיר זהה לחלוטין: $0.074 למיליון טוקינים בקלט ו-$0.295 למיליון טוקינים בפלט. המשפחה שוחררה כקוד פתוח יחד ב-21 במאי 2026, כך שאף אחד מהמודלים אינו חדש; מחיר ה-API הזהה הוא מה שהופך את ההשוואה הזו למוזרה באמת. בדרך כלל המודל הגדול יותר עולה יותר, ושוקלים את הפרמיה מול הרווח. כאן דגל הדגל אינו עולה תוספת לכל טוקן, וההחלטה מצטמצמת לשאלה אחת: מה, אם בכלל, ה-7B מוותר בכך שהוא צפוף וקטן?

הפתעת המחיר הזהה

שוויון המחיר של ה-30B-A3B הוא עסקת ה-MoE שעושה את עבודתה. הארכיטקטורה שלו מכילה 30B של ידע מאוחסן אך מפעילה רק כ-3B לכל טוקן, ולכן Tencent Cloud יכולה לשרת אותו באותו תעריף לכל טוקן כמו את ה-7B — אותם $0.074 / $0.295, אותו הקשר של 8,192 טוקנים, אותה תמיכה בפלט מובנה, אותה מגבלת אי-קריאת פונקציות. ב-API, המודל ה"מקצועי" אינו יקר יותר. המלכוד עובר למקום אחר: לטביעת הרגל בזיכרון, למורכבות ההגשה ולהשהיה, שבהן לעיצוב הצפוף והפשוט יותר של ה-7B יש יתרונות מבניים שמחיר לכל טוקן אינו יכול לבטא.

מפרטים, זה לצד זה

ארכיטקטורה — דנס ~7B לעומת MoE 30B סה"כ / ~3B פעילים.

מחיר API — $0.074 / $0.295 לעומת $0.074 / $0.295 לכל 1M אסימונים (זהה).

הקשר — שניהם 8,192 טוקנים.

מיצוב — אזור אופטימלי מאוזן לעומת דגל ברמה מקצועית.

FLORES-200 — 7B: 86.89 XCOMET-XXL, ≈97.9% מ-Gemini 3.1 Pro (Think); 30B-A3B: הציון הטוב ביותר של המשפחה בתרגום כללי (הנתונים מדווחים על ידי היצרן).

השוואת Deep​Seek / K​imi — שניהם מביסים את DeepSeek-V4-Pro ואת Kimi K2.6 במצב חשיבה מהירה, לפי דיווח הספק.

טביעת רגל — A100 / RTX 4090 יחיד לעומת משקלים בסדר גודל של 30B (מבנה מקוונטט בסדר גודל של 18GB על הדיסק ויותר ב-VRAM).

ברירות מחדל להסקה — temp 0.7, top_p 0.6, top_k 20 לעומת temp 0.7, top_p 1.0, top_k -1.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B — the scoreboard'. Left column Hy-MT2-7B: Architecture dense 7B; API price $0.074 / $0.295; FLORES-200 86.89; Context 8,192; Footprint single GPU; Role balanced sweet spot. Right column Hy-MT2-30B-A3B: Architecture MoE 30B / 3B active; API price $0.074 / $0.295; FLORES-200 tops the family; Context 8,192; Footprint data-center VRAM; Role professional-grade. Footer: Prices identical as listed Aug 2026; figures vendor-reported.

איפה ה-30B-A3B באמת מנצח

טנסנט ממקמת את ה-30B-A3B כחבר בדרגה מקצועית במשפחה, והראיות שהיא מפרסמת תומכות בתווית הזו עבור סוג מסוים של טקסט. על חומר כבד בדומיין — סעיפים משפטיים, טקסט רפואי, תיעוד טכני — קו ה-GEMBA שלו ב-DomainMTBench הוא החזק במשפחה, מדווח על כ-99% מקו הבסיס של Gemini 2.5 Pro, וציון התרגום הכללי שלו עולה על זה של ה-7B בעקומת ה-FLORES של המשפחה עצמה. ה-27B הרדום הזה של ידע נוסף הוא בדיוק סוג היכולת שמופיעה כאשר משפט נושא טרמינולוגיה צפופה במקום פרוזה רגילה: סעיף "השיפוי יעמוד בתוקף לאחר סיום ההתקשרות" בחוזה לא מכביד יותר מדי על מודל 7B, אבל מסמך M&A מלא עם מילון מונחים כן. ה-30B-A3B הוא גם ההימור הבטוח ביותר עבור זוגות שפות מסינית לשפות מיעוטים (טיבטית, אויגורית, מונגולית), שם טנסנט מדווחת על המספרים הטובים ביותר שלה.

איפה שה-7B בכל זאת מנצח

היתרונות של ה-7B הם תפעוליים, והם אמיתיים. {{1}}ראשית, אירוח עצמי: ה-7B נכנס על A100 יחיד או RTX 4090 ויש לו את הכיסוי הרחב ביותר של מסגרות — {{2}}Transformers, vLLM, SGLang, ו-llama.cpp דרך GGUF — כולם נבדקו. {{/2}}{{/1}}{{3}}ה-30B-A3B, אפילו בגרסה מכווצת, דורש VRAM בהיקף של מרכז נתונים, ופחות אנשים העבירו אותו דרך מערכות ייצור מובילות. {{/3}}{{4}}שנית, השהיה ופשטות השרת: 7B צפוף קל יותר לשמור על חום, והדגימה המומלצת שלו קרובה יותר לפענוח סטנדרטי. {{/4}}{{5}}שלישית, ב-API, המחיר הזהה אומר שה-7B עולה בדיוק אותו דבר לכל טוקן כמו הדגם המוביל — {{/5}}{{6}}אז הסיבה היחידה לבחור במודל הקטן יותר היא שבטקסט כללי נקי, פער האיכות דק מכדי להבחין בו. {{/6}}{{7}}ה-7B כבר מגיע לכ-97.9% מ-Gemini 3.1 Pro (Think) על FLORES-200; {{/7}}{{8}}הנקודות הנוספות של הדגם המוביל יושבות על גבי עקומה שבה כל נקודה נוספת קשה יותר לראייה בפועל. {{/8}}

הפער, נמדד בכנות

הכל בשני הסעיפים האחרונים הוא הערכה עצמית של Tencent, והדרך הכנה לקרוא אותה היא ששני המודלים קרובים מספיק בתרגום רגיל כך שהקורפוס שלך הוא זה שמכריע. בטקסט נקי כללי, הציון של ה-7B — כ-97.9% מזה של Gemini — אומר שהפער של דגם הדגל נמדד בשברים קטנים של XCOMET: אמיתי בלוח תוצאות, קשה להרגיש אותו בפניית תמיכה. בטקסט תחומי צפוף ובזוגות שפות מיעוטים, היתרונות המדווחים של דגם הדגל ב-GEMBA וב-FLORES הם בדיוק המקום שבו מתרגם מקצועי (אדם או מודל) מרוויח את שכרו, והמקום שבו תרגום חוזר הוא היקר ביותר. אין מדד עצמאי לאף אחד מהמודלים נכון למועד כתיבת שורות אלה; הדבר היחיד ששני כרטיסי הספקים מסכימים עליו הוא שכל גודל מביס את DeepSeek-V4-Pro ואת Kimi K2.6 במצב החשיבה המהירה של המשפחה.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-30B-A3B (captured August 23 2026) showing the MoE architecture (30B total / 3B active), Apache-2.0 license, and the professional-grade positioning.

ניתוב המשפחה

אף אחד מהמודלים אינו בקטלוג של OrcaRouter נכון לכתיבת שורות אלה, ולכן שניהם מסופקים דרך הענן של Tencent עצמה וכמה פלטפורמות של צד שלישי. הלקח המעשי הוא עדיין זה של הניתוב. מכיוון שמחירי ה-API זהים, זהו מקרה קלאסי לניתוב עומסי עבודה ולא לבחירה במודל יחיד: שלחו את מנת התרגום הכללי בנפח גבוה ל-7B ואת המנה הצפופה, כבדת-התחום, ל-30B-A3B, עם failover אוטומטי כך שקפיצת חביון בנקודת הקצה של MoE לעולם לא עוצרת את ה-pipeline. זו התבנית ש-DSL הניתוב של OrcaRouter מרכיב על פני 200+ המודלים שאנו אכן מציעים — שיגור משוקלל-עלות, מחיר מחירון הספק המועבר בתוספת 0% — והיא מתאימה למשפחה הזו יותר מאשר לרוב המשפחות, משום שהספק תמחר את שתי הדרגות כך שהחלוקה ניטרלית מבחינה כלכלית.

פסק הדין

במחירי API זהים, התשובה המוגדרת כברירת מחדל היא ה-7B: אותה עלות לטוקן, פשוט יותר לאירוח עצמי, ובמרחק שערה מטקסט כללי. קחו את ה-30B-A3B כשהקורפוס צפוף מבחינה מקצועית — משפטי, רפואי, טכני, או תרגום לשפות מיעוטים — שם היתרון התחומי המדווח של הדגם המוביל שווה את טביעת הרגל הגדולה יותר ואת זמן ההשהיה. ואם עומס העבודה שלכם הוא תערובת של שניהם, אל תבחרו: נתבו את החלק הכללי ל-7B ואת החלק הקשה לדגם המוביל. זה לא פשרה בין השניים; זו הדרך היחידה לקבל את שניהם במחיר שטנסנט קבעה.

A generated infographic titled 'Same price, different model' with two identical cards both labelled '$0.074 / $0.295 per 1M tokens': one 'Dense 7B — simpler to serve, near-flagship on clean text', the other 'MoE 30B-A3B — 30B knowledge, 3B active, professional domains', with the footer 'The MoE bargain: bigger model, same per-token cost.'

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube