כרטיס הירו שנוצר שכותרתו Claude Sonnet 5.5 מול Tencent HY4 Preview, עם כותרת משנה ששתי המעבדות מוכרות את חשבון הטוקנים, עם שלושה כרטיסי נתונים: מחיר פלט לכל 1M $10.00 מול $2.50, משקולות סגורות מול Apache 2.0, ומהירות פלט נמדדת 138.7 מול 22.3 טוקנים לשנייה, עם כותרת תחתונה שקוראת מחיר ומהירות של Tencent HY4 Preview לפי הקטלוג של OrcaRouter, רשימת ספקים 6 / 18 יואן למיליון; Claude Sonnet 5.5 לפי Anthropic.
Guides & Insights

Claude Sonnet 5.5 מול Tencent HY4 Preview: שתי המעבדות מוכרות את חשבון הטוקנים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שתי השקות, בהפרש של שישה שבועות, שמבטיחות את אותה הבטחה במילים שונות. טענת הספק היא שClaude Sonnet 5.5, שהושק ב-28 בספטמבר 2026, עולה "עד 30% פחות למשימה" מ-Claude Sonnet 5 בתעריפים זהים לטוקן. הטענה השנייה היא שהאופטימיזציה מ-7 בספטמבר לגרסה המתארחת של Tencent HY4 Preview, שהושקה לראשונה כקוד פתוח ב-28 באוגוסט 2026, מקצצת בסבבי החשיבה ובצריכת הטוקנים למשימה באותה איכות משימה. אף אחד מהספקים לא העלה או הוריד מחיר כדי לבסס את הטענה הזו. שניהם אומרים לך שהטוקנים הם המוצר עכשיו, והחלק המעניין בהתמודדות הזו הוא שרק אחת משתי הטענות ניתנת לבדיקה מול נתון מפורסם של טוקנים למשימה — מפני שרק לאחד משני המודלים האלה יש מדידה בלתי תלויה שמולה אפשר לבדוק אותה.

האסימטריה הזו אינה ביקורת על ט​נסנט. ל-HY4 Preview אין עמוד מודל ב-Artificial Analysis, אין ציון Intelligence Index עצמאי, ואין נתון עלות-למשימה מאף צד שלישי. מה שכן יש לו הוא טבלת בנצ'מרקים מטעם הספק — Terminal-Bench 2.1 עם 85.4, DeepSWE 64.3, הערכה עיוורת פנימית על פני 203 משימות הנדסיות שבה הוא הגיע לממוצע של 2.99 מול GLM-5.3 עם 2.92 ו-Kimi K3 עם 2.94 — והופעת בכורה פומבית שנבחרה בהצבעת קהל בלוח המובילים של WebDev Arena, שבו ט​נסנט מדווחת שהוא מתמקם בסביבות המקום החמישי בסך הכול ושלישי מבין המודלים עם משקלים פתוחים. כל אלה הם אותות אמיתיים. אף אחד מהם אינו עלות למשימה, מה שאומר שהמספר המדויק ששתי הספקיות מתחרות עליו אינו זמין בכל הנוגע ל-HY4 Preview.

מה שכל צד בפועל סיפק

Tencent HY4 Preview הוא תערובת מומחים בעלת 770 מיליארד פרמטרים, עם 49 מיליארד פעילים לכל טוקן, 78 שכבות, 256 מומחים מנותבים ועוד מומחה משותף אחד, שכבת MTP מקורית לפענוח ספקולטיבי, וחלון הקשר שחוצה מיליון טוקנים. הוא מיועד לטקסט בלבד מעצם תכנונו — Tencent בנתה אותו עבור סוכני קידוד, שימוש מורכב בכלים ועבודת פרודוקטיביות, ולא עבור תמונות — וברירת המחדל שלו היא הסקה כבדה, עם שלוש רמות ניתנות להגדרה (גבוהה, נמוכה, ללא) והגדרת דגימה מומלצת על ידי הספק של טמפרטורה 0.9 ו-top_p 1.0. המשקלים הם תחת Apache 2.0 וניתנים להורדה מ-Hugging Face, GitHub, ModelScope ו-GitCode. Tencent ציינה במקור שני חספוסים בתצוגה המקדימה, הקדשת זמן רב מהנדרש לחשיבה ואימות יתר של עבודתה, והעדכון מ-7 בספטמבר מכוון בדיוק לאלה.

Claude Sonnet 5.5 הוא המודל השני מדור 5.5 של A​nthropic, וזה שהיא מציבה כשילוב הטוב ביותר של מהירות ואינטליגנציה בהיצע. מיליון טוקנים של הקשר, 128,000 טוקני פלט באופן סינכרוני ו-300,000 ב-Message Batches API, קלט טקסט, תמונה וקבצים, חשיבה מסתגלת במאמץ ניתן לבחירה, חתך ידע של יוני 2026, אפס שימור נתונים זמין כבר מההשקה, ורצפת פרישה של 28 בספטמבר 2027. לוח התעריפים לא זז מ-Claude Sonnet 5: $2.00 למיליון קלט, $10.00 למיליון פלט, $0.20 לקריאות מטמון ו-$2.50 לכתיבות מטמון. משקולות סגורות, Anthro​pic API וכן Bedrock, Goo​gle Cloud ו-Microsoft Foundry.

הציבו את השניים זה כנגד זה והעמדות כמעט סימטריות:

• מחיר — Claude Sonnet 5.5 $2.00 לקלט / $10.00 לפלט למיליון לעומת Tencent HY4 Preview $0.83 לקלט / $2.50 לפלט בקטלוג שלנו, לפי מחירון ספק של ¥6 / ¥18

• קריאות מטמון — Claude Sonnet 5.5 $0.20 למיליון לעומת Tencent HY4 Preview $0.042 למיליון בקטלוג שלנו

• משקולות — Claude Sonnet 5.5 סגור לעומת Tencent HY4 Preview ברישיון Apache 2.0, ניתן להורדה

• הקשר — Sonnet 5.5 עם 1,000,000 טוקנים לעומת Tencent HY4 Preview עם 1,048,576 טוקנים, למעשה זהים

• פלט מקסימלי — Claude Sonnet 5.5 ‏128,000 סינכרוני, 300,000 ב-Batches לעומת Tencent HY4 Preview ‏64,000 בקטלוג שלנו

• מודאליות קלט — Claude Sonnet 5.5 טקסט, תמונה וקובץ לעומת Tencent HY4 Preview טקסט בלבד

• ציונים בלתי־תלויים — מדד האינטליגנציה 56 של Claude Sonnet 5.5 במחיר $7.60 למשימה, מהדורה v4.3.2 לעומת Tencent HY4 Preview — לא פורסם

• מהירות פלט נמדדת — Claude Sonnet 5.5 ‏138.7 טוקנים/שנייה לעומת Tencent HY4 Preview ‏22.3 טוקנים/שנייה בתעבורה שלנו

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Tencent HY4 Preview, the scoreboard, with six matched rows: output price $10.00 vs $2.50, cache read $0.20 vs $0.042, context window 1,000,000 vs 1,048,576 tokens, maximum output 128K and 300K on Batches vs 64K, input modality text, image and file vs text only, and weights closed vs Apache 2.0, with a footer reading Tencent HY4 Preview price per OrcaRouter's catalogue, vendor list 6 / 18 yuan per million; no independent scores published. Claude Sonnet 5.5 per Anthropic.

הטענה ששתי המעבדות מעלות, ומדוע אחת מהן ניתנת לבדיקה

"30% פחות לכל משימה" של Anthropic ו"פחות סבבי הסקה, צריכת טוקנים נמוכה יותר" של Tencent הם אותו פרויקט הנדסי המתואר משני כיוונים: לגרום למודל להוציא פחות טוקנים בהגיעו לאותה תשובה. Anthropic מבהירה במפורש שהתעריפים לא השתנו, מה שאומר שכל חיסכון לכל משימה חייב לנבוע ממספרי הטוקנים — ולוח הדירוג העצמאי מאפשר לראות את צורת הבעיה ולא את גודל התיקון. Claude Sonnet 5.5 מייצר 410 מיליון טוקני פלט במהלך הערכת Intelligence Index, לעומת 117 מיליון עבור MiniMax M3 ו-77 מיליון עבור Grok 4.5. זהו מודל עתיר מילים, כפי שנמדד בלוח שמפרסם את המספר. יהיה מה שיהיה השיפור של 30% לעומת Claude Sonnet 5, הוא מיושם על בסיס עצום מאוד.

עבור HY4 Preview הנתון המקביל אינו קיים באופן פומבי. הערת האופטימיזציה של T​encent עצמה היא התיאור היחיד שלו, והיא מציינת את התוצאה בלי מספר: פחות סבבים, פחות טוקנים בקלט ובפלט, אותה איכות, מאומתת באמצעות מדדי בנצ'מרק והערכה אנושית במעבר כפול. זוהי טענה של ספק במובן הקפדני — נאמרת, סבירה, לא משוחזרת — והיא מסומנת ככזו כאן. אימוץ מודל תצוגה מקדימה על סמך טענת הספק בדבר כלכלת טוקנים, כשכלכלת הטוקנים היא בדיוק הדבר שאי אפשר למדוד מבחוץ, הוא בדיוק ההימור ששחרור תצוגה מקדימה מבקש שתעשה.

עוד פרט מטריד שכדאי להכיר לפני שמישהו מתכנן אופטימיזציה באירוח עצמי סביב האופטימיזציה הזו. השינוי של Tencent מ-7 בספטמבר חל על הבנייה ש-Tencent מגישה בנקודות הקצה של עצמה. תמונת המצב בקוד הפתוח לא רועננה — התאריך האחרון של שינוי במאגר Hugging Face הוא עדיין 28 באוגוסט — כך שהעתק באירוח עצמי של המשקולות מריץ את התנהגות החשיבה הארוכה יותר המקורית שאותה סימנו הערות התצוגה המקדימה. הגרסה המותאמת והגרסה הניתנת להורדה אינן אותו ארטיפקט.

המקום שבו המשקולות הפתוחות כן משתלמות הוא אותו מקום שבו הן תמיד משתלמות: פריסה שלא יכולה לקרוא ל-API. מודל עם 770 מיליארד פרמטרים ו-49 מיליארד פעילים הוא החלטה של מרכז נתונים ולא של תחנת עבודה, כך שזה לא הסיפור ברמת המחשב הנייד שמודל של 30 מיליארד פרמטרים מספר — אבל עבור קונה שזקוק למודל בתוך ההיקף שלו, Apache 2.0 בקנה מידה כזה הוא אפשרות ש-Claude Sonnet 5.5 אינו מציע בשום מחיר.

לנסות תצוגה מקדימה בלי להמר עליה כנתיב ייצור

מודלי תצוגה מקדימה הם המקרה שבו ניתוב מפסיק להיות אופטימיזציית עלויות והופך לבקרת סיכונים. הסיבה לשים גרסת תצוגה מקדימה מאחורי נתב במקום לקרוא לה ישירות היא שתצוגה מקדימה מוגדרת על ידי האפשרות שהיא משתנה לך מתחת לרגליים, ושני הדברים שאתה רוצה מהשכבה שלפניה הם פיצול באחוזים ומשהו שיתפוס את הכשלים.

זו הצורה ש-OrcaRouter מספק: נקודת קצה אחת תואמת OpenAI המכסה יותר מ-200 מודלים, מחיר המחירון של הספק מועבר הלאה ללא תוספת, מעבר אוטומטי между ספקים במעלה הזרם, ו-DSL לניתוב להרכבת קריאות מכמה מודלים. Tencent HY4 Preview ניתן לניתוב כאן כבר היום בתור tencent/hy4-preview במחיר של $0.83 לקלט ו-$2.50 לפלט למיליון טוקנים, עם קריאות מטמון ב-$0.042 על פני חלון של 1,048,576 טוקנים — אותו בילד, בתעריף של הספק, נגיש מהמפתח שאתם כבר משתמשים בו לכל שאר הפריטים בקטלוג. גם Claude Sonnet 5 ניתן לניתוב כאן, בתעריפים של Anthropic — $2.00 ו-$10.00, וכך זה מאז 30 ביוני; הוא שותף גיבוי מובן מאליו בזמן שמודל בן יומו צובר ראיות מפרודקשן.

OrcaRouter model page for tencent/hy4-preview, dated 2026-08-28, showing the Tools, JSON and Reasoning badges, a 1M-token context window, text-only input, $0.83 input and $2.50 output per million tokens, a p50 time to first token of 3.71 s, and 372.4K tokens of recent traffic.

Claude Sonnet 5.5 עצמו אינו בקטלוג שלנו. הוא הושק אתמול, הנתיב אליו הוא ה-API של Anthropic עצמה, והעמוד הזה לא עומד לרמוז אחרת — הנקודה בעצת הניתוב היא שהדרך הבטוחה להריץ דרג חדש לגמרי בפרודקשן היא לתת לו נתח תעבורה עם משהו מוכח מאחוריו, וזה עובד רק כששני קצוות ההסדר נמצאים במקום שאפשר להגיע אליו ממקום אחד. HY4 Preview מעביר כאן 372 אלף טוקנים של תעבורה בשבוע, וכך נראית תצוגה מקדימה בת יומיים לפני שמישהו התחייב אליה; Claude Sonnet 5 מעביר 7.9 מיליון בשבוע מאז 30 ביוני, וזה ההבדל בין מועמד לרצפה.

OrcaRouter model page for anthropic/claude-sonnet-5, dated 2026-06-30, showing a 1M-token context window, 128K maximum output, text, image and file input, $2.00 input and $10.00 output per million tokens, a p50 time to first token of 4.87 s, and 7.9M tokens of recent traffic.

לאן הכסף באמת הולך

לפי תעריפים בלבד, HY4 Preview זול פי ארבעה בפלט מאשר Claude Sonnet 5.5 וכמעט פי חמישה זול יותר בקריאות מטמון, והוא תואם את החלון. בצד הנמדד, Claude Sonnet 5.5 מייצר פלט פי שישה מהר יותר בתעבורה שלנו — 138.7 טוקנים לשנייה לעומת 22.3 — פער מהסוג שהופך יתרון תעריפי של פי ארבעה ליתרון קטן בהרבה בזמן שעון, ולעיתים להפסד, ברגע שלוקחים בחשבון תורים.

בין שתי העובדות הללו ההחלטה נשענת על ארבע שאלות שרק הקורא יכול לענות עליהן. האם העבודה זקוקה לתמונה או לקובץ בפרומפט? HY4 Preview הוא טקסט בלבד וזה מסיים את הדיון. האם הוא צריך להשלים משימת תוכנה רב-שלבית, שבה ציון Terminal-Bench 2.1 של HY4 Preview הוא 85.4, מספר של T​encent עצמה ולא משוחזר? אז סטטוס התצוגה המקדימה הוא הסיכון שאתה מקבל, והאופטימיזציה של 7 בספטמבר שווה בדיקה חוזרת ולא אמון. האם עומס העבודה חייב לרוץ בתוך ההיקף שלך? אז משקולות Apache 2.0 הן העובדה המכריעה. והאם רמת היכולת המשולבת חשובה יותר מאשר התעריף? אז 56 שנמדד באופן עצמאי של Claude Sonnet 5.5 הוא המספר לשקול, במחיר של $7.60 למשימת Index, עם הסתייגות שלא קיים נתון מקביל בצד של T​encent להשוות אליו.

מה ששתי ההשקות באמת מדגימות הוא שהחזית כבר עברה הלאה מכרטיסי תעריפים. שתי מעבדות, בהפרש של שישה שבועות, הוציאו מודלים והובילו עם צריכת טוקנים לפי משימה ולא עם מחיר למיליון, וההשלכה המעשית לקונה היא שהמספר השימושי כבר לא נמצא בעמוד התמחור של אף אחד מהספקים. זהו מספר הטוקנים שעומס העבודה שלך מפיק, כפי שנמדד בשני המודלים, וזהו הנתון היחיד במאמר הזה שאף אחד מהספקים לא יכול לתת לך.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית