
GPT-6 Astra לעומת Tencent HY4 Preview: לאחד המודלים יש מסלול ביקורת, ולאחר יש טבלת בנצ'מרק
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Tencent HY4 Preview ו-GPT-6 Astraהם שני המסלולים הזולים ביותר לקידוד סוכני בסמוך לחזית הזמינים היום אם תקראו את המספרים של הספקים עצמם, והם שני המודלים הפחות ברי-השוואה בדרג הזה אם תקראו את המספרים של אחרים. Tencent HY4 Preview שוחרר והופץ כקוד פתוח ב-28 באוגוסט 2026 ברישיון Apache 2.0, במחיר של $0.834 למיליון טוקני קלט ו-$2.501 למיליון טוקני פלט, עם ארכיטקטורת תערובת מומחים בת 770 מיליארד פרמטרים, חלון הקשר שחוצה מיליון טוקנים, ותקרת פלט של 64,000 טוקנים. GPT-6 Astra זמין באופן כללי מאז 3 בספטמבר 2026 במחיר של $10.00 ו-$50.00, עם חלון של 1,050,000 טוקנים ופלט מרבי של 128,000. החוזקות של Astra מגובות בשמונה הערכות צד שלישי שפורסמו; החוזקות של HY4 Preview מגובות בהרצות טרמינל, הרצות קריאה לכלים והרצות הערכה עיוורת של Tencent עצמה, ובשום דבר אחר. האסימטריה הזו לא אומרת שהמודל הזול יותר חלש יותר. פירוש הדבר שאחת משתי ההשוואות האלה ניתנת לבדיקה ובאחרת יש להאמין, וההחלטות המעשיות שונות בהתאם.
מה ששחרור Apache 2.0 בעצם נותן לך
הרישיון הוא החלק בהתמודדות הזו שטבלת מחירים אינה יכולה לבטא. Tencent HY4 Preview אינו טיזר מתארח עם מיתוג של משקולות פתוחות — המשקולות ניתנות להורדה מ-Hugging Face, GitHub, ModelScope ו-GitCode, מה שאומר שהמודל שורד כל החלטה ש-Tencent תקבל לגבי התמחור שלה, נקודת הקצה שלה, או העניין המתמשך שלה לשרת אותו.
• ארכיטקטורה — 770B פרמטרים סה"כ, 49B פעילים לכל טוקן, 78 שכבות, 256 מומחים מנותבים ועוד מומחה משותף אחד, ושכבת חיזוי רב-טוקנים מקורית לפענוח ספקולטיביbr /> • מאפייני שירות — 54.6 טוקני פלט לשנייה וזמן חציוני של 6.26 שניות עד לטוקן הראשון, כפי שנמדד בנתיבים של OrcaRouter על פני חלון מתגלגל של שבעה ימיםbr /> • הקשר ותקרה — חלון של 1,048,576 טוקנים מול פלט מקסימלי של 64,000 טוקניםbr /> • משטח קלט — טקסט בלבד; ללא תמונה, ללא קובץ, ללא אודיוbr /> • שליטה בחשיבה — שלוש רמות: גבוהה, נמוכה וללא, כאשר גבוהה היא ברירת המחדל, בתוספת המלצת דגימה מתועדת של temperature 0.9 ו-top_p 1.0br /> • אמינות — שיעור שגיאות של 2.8% על פני אותו חלון של שבעה ימים, לעומת 10.3% בנתיב Astra
צמד המספרים האחרון הוא הדבר הישים ביותר בעמוד הזה, וזה סוג של נתון שאף ספק לא מפרסם על המודל שלו. ציוני הבנצ'מרק העצמאיים של Astra גבוהים יותר, והנתיב של Astra כושל בערך בבקשה אחת מתוך עשר במהלך השבוע האחרון, בעוד שמודל ללא ציונים עצמאיים כלל כושל באחת מתוך שלושים וחמש. אף אחד מהנתונים אינו הצהרה על המודלים עצמם — שיעורי שגיאה מודדים את הנתיב, את מגבלות הקצב ואת האפסטרים, לא את המשקלים — אבל אלו המספרים שמערכת ייצור חווה בפועל.

היכן שניתן להצליב את המספרים של טנסנט עם אלה של מישהו אחר
זה, ככל שהעדויות המפורסמות מלמדות, הזדמנות יוצאת דופן באמת: גם ל-Astra וגם ל-HY4 Preview יש נתון של Terminal-Bench 2.1, ורק אחד מהם מדווח על ידי הספק.
• Terminal-Bench 2.1, בהפעלה של מסוף אמיתי — GPT-6 Astra 88.4, בהערכה עצמאית; Tencent HY4 Preview 85.4, לפי דיווח היצרןbr /> • קריאה לכלים — Astra 41.4 ב-τ²-Banking, בהערכה עצמאית; HY4 Preview 74.1 ב-Toolathlon-Verified, לפי דיווח היצרן, במבחן אחרbr /> • הנדסת תוכנה — HY4 Preview 64.3 ב-DeepSWE, עלייה מ-28.0 בקודמו Hy3, לפי דיווח היצרןbr /> • משימות סוכנים — HY4 Preview 37.1 pass@1 ב-APEX-Agents, לפי דיווח היצרןbr /> • העדפת בני אדם — ממוצע של 2.99 מתוך 4.00 על פני 203 משימות הנדסה שנדורגו על ידי 163 מומחים, בהרצת היצרן, לעומת GLM-5.3 עם 2.92 ו-Kimi K3 עם 2.94br /> • מדד עצמאי — GPT-6 Astra 54.7 במדד האינטליגנציה ו-96.1 ב-GPQA Diamond, מצד שלישי; אין מדד מקביל ל-HY4 Preview
השורה של Terminal-Bench היא זו שכדאי להתעכב עליה. פער של 3 נקודות בין 88.4 עצמאי ל-85.4 כפי שדווח על ידי הספק נמצא היטב בתוך הטווח שמערכת בדיקה שונה, שלד שונה או טמפרטורת דגימה שונה יכולים להפיק, מה שאומר שהקריאה הכנה אינה "Astra טובה בשלוש נקודות" אלא "המודל בעל המשקולות הפתוחות הזול ביותר בדרג זה טוען לשוויון, והטענה היא לכל הפחות סבירה". הניסוח של Tencent עצמה זהיר בנקודה זו: הוא מתאר את DeepSWE כ"מצמצם בהדרגה את הפער" ולא כסוגר אותו, והטענה הנקייה היחידה שלו לשוויון — התיקו ב-Terminal-Bench עם מודל סגור מוביל מספק אחר — היא בדיוק הטענה שהזקוקה ביותר למדידה שנייה.
יש גם שינוי שכדאי להכיר, מפני שהוא מזיז את הכלכלה ולא את הציונים. ב-7 בספטמבר 2026 Tencent הכניסה אופטימיזציה לבילד התצוגה המקדימה החי, שלדבריה מפחיתה סבבי הסקה וצריכת טוקנים לכל משימה בעבודה מורכבת. מכיוון שהמודל מחייב לפי טוקנים, צריכה של פחות טוקנים לכל משימה שהושלמה מוזילה את עלות המשימה, אף שתעריף הטוקן לא השתנה. גודל החיסכון הזה הוא מדידה של Tencent עצמה, ואף אחד מחוץ ל-Tencent לא שחזר אותה — אבל המנגנון אמיתי, וזו הסיבה שתצוגה מקדימה ששוחררה באוגוסט יכולה להיות זולה יותר באופן מהותי להפעלה באוקטובר ממה שפרסום ההשקה שלה רמז.
תקרת 64,000 הטוקנים היא המפרט שקובע את הפריסות
באמצע גיליון המפרט נמצאת המגבלה שנושכת ראשונה, והיא אינה איכות. התפוקה המקסימלית של HY4 Preview היא 64,000 טוקנים לעומת 128,000 של Astra, במודל שמטרתו המוצהרת היא סוכני קידוד ושרשראות ארוכות של שימוש בכלים. קובץ שנוצר, פאץ' מרובה קבצים, דוח מובנה ארוך — אלה התפוקות שנתקלות בתקרה, ובהרצת סוכן הכשל אינו תשובה קצת פחות טובה, אלא תשובה קטועה שהצינור הסובב חייב לזהות ולטפל בה.
שני המודלים צורכים בערך מיליון טוקנים של קלט, כך שמקרה קריאת המסמכים הוא באמת תיקו. ההבדל הוא כולו בצד היצירה, והוא פי שניים ולא שגיאת עיגול. הוסיפו לכך את ההבדל במשטח הקלט — Astra מקבל תמונות וקבצים, HY4 Preview הוא טקסט בלבד — והתמונה שמצטיירת היא חלוקת עבודה נקייה ולא דירוג: המודל במשקלים פתוחים עבור לולאות סוכנים של טקסט נכנס וטקסט יוצא, שבהן התוצר הוא קריאה לכלי או diff, והמודל הסגור עבור כל דבר שצריך להסתכל על משהו או לכתוב משהו ארוך.
מה מניב פי 20 מקצב התפוקה, שורה אחר שורה
מחיר קלט — Tencent HY4 Preview $0.834 ל-1M לעומת GPT-6 Astra $10.00, בערך פי 12br /> • מחיר פלט — HY4 Preview $2.501 ל-1M לעומת Astra $50.00, בערך פי 20br /> • קלט במטמון — HY4 Preview $0.042 ל-1M לעומת Astra $1.00, בערך פי 24br /> • מדרגת בקשה ארוכה — Astra מתמחרת מחדש את כל הבקשה מעל 272,000 אסימוני קלט ל-$20.00 ול-$75.00; לכרטיס של HY4 Preview אין מדרגה מקבילהbr /> • תעריף קלט אפקטיבי על פרומפט של 400,000 אסימונים — HY4 Preview ללא שינוי ב-$0.834 לעומת Astra $20.00, בערך פי 24br /> • עלות למיליון אסימונים של לולאת סוכן רגילה, ביחס 4:1 בין קלט לפלט — HY4 Preview כ-$1.17 לעומת Astra כ-$18.00br /> • עלות של חודש של 100 מיליון אסימונים באותו יחס — HY4 Preview כ-$117 לעומת Astra כ-$1,800
שורת הקלט השמור במטמון היא זו שמתנהגת הכי גרוע מבחינת התרחבות עבור הצד היקר, מכיוון שלולאות סוכנים שולחות מחדש את אותו פרומפט מערכת ואותה קידומת שיחה בכל תור. ב-$0.042 לעומת $1.00, הטוקנים הזולים ביותר של לולאה ארוכה זולים פי 24 במודל של Tencent, וזה בדיוק עומס העבודה שבו הבדל קטן לכל טוקן מצטבר הכי מהר. עלות לפי משימה, המדד שיכריע בכך בצורה נקייה, כלל אינה מפורסמת על ידי Tencent — כך שהדרך היחידה לקבל את המספר שחשוב היא להריץ את שני המודלים דרך מערך המשימות שלך ולקרוא את אובייקט השימוש.

מה נתב מוסיף כאן, כשיש בידינו את שיעורי השגיאה
שני המודלים נמצאים בקטלוג של OrcaRouter — tencent/hy4-preview ו-openai/gpt-6-astra — מאחורי נקודת קצה אחת תואמת OpenAI, כל אחד לפי תעריף המחירון של הספק עצמו, כפי שהוא, עם 0% תוספת. הפרט האחרון חשוב בזוג הזה יותר מאשר ברוב המקרים, משום שתעריף המחירון של המודל של Tencent מפורסם ביואן: נתוני הדולר שלמעלה הם השער המומר שאתם רואים בפועל, ולא מרווח של מפיץ משנה, ואם Tencent משנה את המחיר, השינוי נכנס לתוקף כאן באותו היום ולא בחידוש החוזה הבא.
ה-DSL של הניתוב הוא המקום שבו שני המודלים מפסיקים להיות חלופות. הכלל הטבעי לזוג הזה הוא הסלמה על הפלט: לשלוח את הלופ למודל הזול, וכאשר תגובה חוזרת קטועה מול תקרת 64,000 הטוקנים או נכשלת בבדיקת הסכימה שלך, לנסות שוב את אותו שלב מול openai/gpt-6-astra, שיש לו פי שניים מקום בפלט. מעבר אוטומטי לגיבוי הוא החצי השני של הטיעון, והוא אינו תיאורטי כאשר אחד משני המסלולים מחזיר שגיאות באחת מכל עשר בקשות בשבוע האחרון — ריצת סוכן ארוכה המוצמדת למודל בודד מתה יחד עם ההקשר המצטבר שלה, ואף אחד מהמודלים האלה אינו זול מספיק כדי להריץ מחדש מההתחלה בטעות.

מה ישנה את ההשוואה הזו?
שלושה דברים, לפי סדר ההשפעה שלהם על זה. הערכה בלתי תלויה של HY4 Preview — המודל פומבי כבר שישה שבועות, אין לו אינדקס של צד שלישי, אין מספר Terminal-Bench משוחזר ואין נתון עלות לכל משימה, וההערכה העיוורת היחידה שבוצעה על ידי הספק היא נתוני העדפת האדם היחידים שקיימים. עלות מפורסמת לכל משימה שהושלמה עבור שני המודלים, שתחליף כל יחס במאמר הזה במספר אחד. והחלטה של Tencent בנוגע להסקה של צד שלישי, מכיוון שמשקולות Apache 2.0 יכולות להיות מוגשות על ידי כל אחד, וברגע שמארחים מתחרים יעמידו את HY4 Preview, המחיר בצד הזול של ההשוואה הזו הופך לשוק ולא לרשימה.
עד אז, הסיכום השימושי צר יותר מפוסט ההשקה של כל אחד מהספקים ויותר כן מלוח תוצאות: GPT-6 Astra הוא המודל שטענות היכולת שלו נבדקו, עם תקרת פלט כפולה ומסלול שנכשל בבקשה אחת מכל עשר. Tencent HY4 Preview הוא המודל שטענות היכולת שלו לא נבדקו, עם ארכיטקטורה מפורסמת, רישיון פתוח, שליש מהמחיר ושיעור שגיאות נמוך בהרבה באותו חלון זמן. אם העבודה שלך היא קלט טקסט, פלט טקסט ונכנסת בתוך 64,000 אסימונים מיוצרים, המודל הזול יותר אינו פשרה — הוא התשובה הנכונה, ושביל הביקורת הוא הדבר היחיד שאתה מוותר עליו.
הכלל הטבעי עבור הצמד הזה הוא הסלמה בפלט: שלח את הלולאה למודל הזול, וכאשר תגובה חוזרת קטועה אל מול תקרת 64,000 הטוקנים או נכשלת בבדיקת הסכימה שלך, נסה שוב את השלב הזה מול openai/gpt-6-astra , שיש לו מקום פלט כפול.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
