כרטיס כותרת שעליו כתוב GPT-6 Astra מול Solar Pro 4, עם כיתוב המשנה 'שתים עשרה נקודות אינדקס, חלון 512K בצד אחד, ויחס מחירים שמשתנה ביום ראשון', מעל איור שנוצר של שתי מכונות קובייה זוהרות עם תגי מחיר בתחתיתן
Guides & Insights

GPT-6 Astra נגד Solar Pro 4: שתים עשרה נקודות אינדקס ויחס מחיר שמשתנה ביום ראשון

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

בשתי ההערכות העצמאיות שנערכו בנפרד והמשותפות לזוג הזה, GPT-6 Astraמוביל את Solar Pro 4בפער ניכר בידע כללי ובפער צר יותר בתחום שבו הדגמים משמשים בפועל. Artificial Analysis מציב את GPT-6 Astra על 54.7 במדד התבונה שלו ועל 96.1 ב-GPQA Diamond; אותו מעריך מציב את Solar Pro 4 על 42 ועל 86.8. בעבודה סוכנית הפער מצטמצם לאחת עשרה נקודות ושש נקודות ב-Terminal-Bench 2.1 וב-τ²-Banking. בינתיים, לסיפור המחיר יש מועד סיום שכמעט איש לא קישר אליו: המבצע הנוכחי של Solar Pro 4 מסתיים ב-00:00 UTC ביום ראשון, 11 באוקטובר 2026, ואז הדגם עובר מ-0.09$ ל-0.15$ למיליון טוקני קלט ומ-0.36$ ל-0.60$ למיליון טוקני פלט. אז השאלה שההשוואה הזו צריכה לענות עליה אינה איזה דגם טוב יותר. היא האם פער יכולת של כ-12.5 נקודות מצדיק בין פי 42 לפי 139 משיעור הפלט, והתשובה לכך היא מאפיין של עומס העבודה שלך ולא של אף אחד מהדגמים.

כרטיסי התעריפים, כולל זה שמשתנה בסוף השבוע הזה

מחיר המחירון של Solar Pro 4 הוא $0.30 לקלט, $0.06 לקלט במטמון ו-$1.20 לפלט למיליון טוקנים, ו-Upstage מפעילה אותו מתחת למחיר המחירון ברציפות מאז ההשקה. לוח התעריפים בעמוד התמחור של Upstage עצמה מפורש, כך שאין צורך לנחש לפי איזה מספר לתקצב:

• מבצע Upstage עד 11 באוקטובר 2026, 00:00 UTC — ‏$0.09 קלט, $0.018 במטמון, $0.36 פלט לכל מיליון טוקניםbr /> • מבצע Upstage מ-11 באוקטובר 2026 ואילך — ‏$0.15 קלט, $0.03 במטמון, $0.60 פלט לכל מיליון טוקנים, מוצג ללא תאריך סיום, כלומר יש לתקצב בהתאםbr /> • מחיר המחירון של Upstage — ‏$0.30 קלט, $0.06 במטמון, $1.20 פלט לכל מיליון טוקניםbr /> • GPT-6 Astra עד 272,000 טוקני קלט — ‏$10.00 קלט, $1.00 במטמון, $12.50 כתיבה למטמון, $50.00 פלט לכל מיליון טוקניםbr /> • GPT-6 Astra מעל 272,000 טוקני קלט — ‏$20.00 קלט, $2.00 במטמון, $25.00 כתיבה למטמון, $75.00 פלט לכל מיליון טוקנים, מיושם על הבקשה כולה ברגע חציית הסף

בקריאה כיחסים, כלומר פי 11 בקלט ופי 5.6 בפלט בתעריפים שלאחר המבצע של Solar Pro 4, פי 33 ופי 42 לעומת מחיר המחירון שלו, ופי 111 ופי 139 אם שני המודלים נמדדים לפי נתוני המבצע של היום. הפער כה גדול משום ששני צדי השבר נעים: הכרטיס של Astra נמצא בפסגת השוק ו-Solar Pro 4 נמצא כעת קרוב לתחתיתו.

כללי ההקשר הארוך הם השורה האחרת שכדאי לקרוא פעמיים, משום שהם אינם סימטריים. הסף של Astra עומד על 272,000 טוקנים, והכלל שלו הוא תמחור מחדש של הבקשה כולה — כל טוקן בבקשה ארוכה מחויב בפי שניים בקלט ובפי 1.5× בפלט, לא רק הטוקנים שמעבר לגבול. הכרטיס של Upstage אינו כולל שלב מקביל, כך שבקשה של 400,000 טוקנים ל-Solar Pro 4 מחויבת בדיוק באותו תעריף לכל טוקן כמו בקשה של 4,000 טוקנים. אם הפרומפטים שלך עוברים באופן שגרתי את רף רבע מיליון הטוקנים, תעריף הקלט האפקטיבי של Astra הוא $20.00 ולא $10.00, והפער שאתה משלם מתרחב בדיוק בעומס העבודה שבו מתחרה מודל עם הקשר של 512K.

מאין מגיע הפער של שתים עשרה נקודות

לשני המודלים יש נתונים מצד שלישי, מה שהופך את ההשוואה הזו לקלה יותר מרוב ההשוואות ברמה הזו. הדפוס בשניהם עקבי: השיפורים של Solar Pro 4 לעומת קודמו שלו התרכזו במשימות אייג'נטיות, ושם הוא הכי קרוב ל-Astra.

• מדד האינטליגנציה — GPT-6 Astra 54.7, Solar Pro 4 42br /> • GPQA Diamond, מדע ברמת תואר שני — Astra 96.1, Solar Pro 4 86.8br /> • Terminal-Bench 2.1, הפעלת מסוף אמיתי — Astra 88.4, Solar Pro 4 75.1br /> • τ²-Banking, שימוש בכלים בניגוד למדיניות — Astra 41.4, Solar Pro 4 35.0br /> • שליפה מהקשר ארוך, AA-LCR — Astra 80.7, Solar Pro 4 71br /> • עלות הרצת משימת הערכה ממוצעת — Astra $0.0516, Solar Pro 4 בין $0.0039 ל-$0.0155br /> • זמן שעון לכל משימת הערכה — Astra כ-8.6 דקות, במודל שמחזיר כ-70 טוקנים לשנייה

שורת עלות-המשימה היא זו שממסגרת מחדש את הטיעון. הרצת משימת הערכה קשה אחת על Solar Pro 4 עולה בין ארבעה לשלושה-עשר סנט, בהתאם למדרגת המבצע שחלה, לעומת חמישה סנט ב-Astra בתעריפים הרגילים. "פי ארבעים ושתיים ממחיר התפוקה" ו"פי שלושה-עשר מהעלות למשימה" הן שתיהן הצהרות נכונות על אותו זוג מודלים, והשנייה היא המספר שמופיע בחשבונית. ההבדל הוא ש-Astra, לפי המדידות של Artificial Analysis, מגיעה לתשובה שלה בפחות טוקנים ממה שקודמו של Solar Pro 4 עשה — 43,000 טוקני פלט למשימה — והיא עדיין המודל היקר יותר לסיים איתו משימה, רק ממש לא קרוב לפי 42 יותר.

שתי הסתייגויות לגבי הטור של Solar Pro 4. הוא איטי יותר מ-Astra בזמן קיר לכל משימה, אף שהוא משתמש בפחות טוקנים, וציוני הביצועים האג'נטיים שפורסמו שלו מגיעים עם פרט ספציפי שכדאי להכיר: בהערכה של קודמו הוא שיפר את ציון היושר שלו בעיקר בכך שסירב לענות, כשניסה לענות על 41% מהשאלות לעומת 92% של Pro 3. עבור סוכן שצריך לפעול, סירוב הוא לעיתים קרובות טוב יותר מתשובה שגויה שנאמרת בביטחון — אבל זה משנה איך קוראים כל השוואת שיעורי הצלחה.

Comparison card with two columns. GPT-6 Astra: Intelligence Index 54.7, $10.00/$50.00 per 1M, long-context tier $20.00/$75.00 above 272K in, cached input $1.00, 1,050,000 context and 128,000 max output, Terminal-Bench 2.1 88.4. Solar Pro 4: Intelligence Index 42, promotion $0.09/$0.36 to 11 October 2026, then $0.15/$0.60, list $0.30/$1.20, 512,000 context and 128,000 max output, Terminal-Bench 2.1 75.1

ההשוואה שאף אחד מכרטיסי הספקים לא נותן לך

שורות הבנצ'מרק שלמעלה מותאמות: כל צד הריץ את אותה הערכה. השורות החסרות הן המעניינות, מפני ששני הספקים חלוקים בדעתם לגבי מה לפרסם.

• מאמץ החשיבה — Astra חושפת חמש רמות בעלות שם (low, medium, high, xhigh, max); Solar Pro 4 מתעדת פרמטר reasoning_effort עם לפחות הגדרה medium, והחומר של Upstage על הסולם דלbr /> • ארכיטקטורה — מספר הפרמטרים של Astra אינו נחשף; גם מספר הפרמטרים של Solar Pro 4 אינו נחשף, כך שאף צד לא מציע את גילוי כלכלת ההגשה שאחיהם הזולים יותר מציעיםbr /> • התנהגות בהקשר ארוך תחת עומס — Astra מפרסמת סף עלות וציון שליפה מתועד; Upstage מפרסמת את החלון ואינה מפרסמת הערכת שליפה משלהbr /> • משטח הקלט — Astra מקבלת טקסט, תמונה וקובץ; Solar Pro 4 היא מודל טקסטbr /> • תקרת המודאליות — 128,000 אסימוני פלט מקסימליים בשני הצדדים, וזה מקום יוצא דופן שבו מודל זול מגיע לשוויון, והוא המפרט השימושי ביותר בגיליון של Solar Pro 4 לעבודת יצירה ארוכה

הגדרת מאמץ החשיבה חשובה יותר ממה שהיא נראית. מודל שמאפשר לך להנמיך את תקציב החשיבה הוא מודל שהמחיר האפקטיבי שלו לבקשה קלה נמוך בהרבה מהמחיר הרשמי שלו, מפני שאתה משלם על פחות טוקנים של חשיבה בעבודה שלא זקוקה להם. שני הספקים חושפים את הפרמטר; אף אחד מהם אינו מפרסם מה עולות הרמות בטוקנים, מה שאומר שהדרך היחידה למצוא את המכפיל האמיתי בין שני המודלים האלה היא למדוד אותו על התעבורה שלך.

Text card headed 'Cost per token is not cost per finished task' with rows: average evaluation task $0.0516 on GPT-6 Astra and $0.0039-$0.0155 on Solar Pro 4; input $0.09 vs $10.00 per 1M; output $0.36 vs $50.00 per 1M; roughly 8.6 minutes wall clock per task on GPT-6 Astra

נקודת האיזון, בפשטות

התעלם לרגע מנקודות המדד והשאר את עומס העבודה קבוע. אם היישום שלך הוא חילוץ, סיווג, סיכום או פלט מובנה עבור מסמכים של עד חצי מיליון טוקנים, Solar Pro 4 עושה את העבודה בקצב ש-Astra לא יכולה להתקרב אליו, והוא בכלל לא זקוק לסולם החשיבה — שום הבדל איכות סביר במשימת חילוץ JSON אינו שווה פי 42 בעלות הפלט. אם היישום שלך הוא סוכן ארוך-טווח שמתכנן, קורא לכלים, מתאושש משלב שנכשל וחייב לסיים, הפער של 11 נקודות ב-Terminal-Bench והפער של 6 נקודות ב-τ²-Banking הם המספרים שמנבאים אם הוא יסיים, והרצת סוכן שנכשלה עולה את מלוא מחיר ההרצה בתוספת הניסיון החוזר.

המקרה הקשה באמת הוא האמצעי: משימות הסקה קצרות, קשות ובניסיון יחיד, שבהן היתרון של Astra ב-GPQA גדול והעלות לכל משימה עדיין רק כמה סנטים. שם הגורם המכריע אינו מחירון התעריפים אלא מספר הטוקנים — והמדידה היחידה שעונה על כך היא להריץ את הפרומפטים שלך דרך שני המודלים ולקרוא את נתוני השימוש. זה גם המקרה שבו הורדת מחיר מכה הכי חזק, כי המודל הזול הוא זה שנבחן מול היקר, ותנודה של 67% בתעריף של המודל הזול משנה את החשבון של המבחן בין יום שני להיום.

Text card headed 'Which tier gets your traffic' with rows mapping extraction and summarisation to Solar Pro 4, single-shot hard reasoning to GPT-6 Astra decided on tokens per answer, long-horizon agent runs to GPT-6 Astra on Terminal-Bench 2.1 88.4 vs 75.1, and prompts beyond 272K tokens to either with Astra repricing the whole request to $20.00/$75.00

מדוע זו החלטת ניתוב ולא הזמנת רכש

GPT-6 Astra נמצא בקטלוג של OrcaRouter בתור openai/gpt-6-astra במחירי המחירון של OpenAI עצמה, מועברים הלאה עם 0% תוספת, וזו כל הסיבה שהשוואה כמו זו מסתכמת בכלל ולא בחוזה. משפחת Solar של Upstage היא מקרה אחר, והאמירה הישרה היא זו שאנחנו תמיד משתמשים בה: OrcaRouter לא מנתב שום מודל של Upstage, כך ש-Solar Pro 4 אינו זמין כאן — הוא מגיע מה-API של Upstage עצמה ומכמה פלטפורמות של צד שלישי, ולוח המחירים שלמעלה הוא שלהם ולא שלנו.

מה שתפקידו של נתב בצימוד הזה הוא למעשה פיצול השכבות. המודל הזול והמודל היקר יושבים מאחורי נקודת קצה אחת תואמת OpenAI, כלל ניתוב שולח את תעבורת החילוץ לשכבה המתאימה לה, ומעבר כשל אוטומטי מקדם קריאה למודל החזק יותר כשהזול יותר נכשל או מחזיר פלט שהמנתח שלך דוחה. המנגנון האחרון הזה הוא התשובה המעשית לסיכון הניתוב השגוי שהשוואה הזו יוצרת: מצב הכשל היקר אינו בחירת המודל הלא נכון, אלא בחירת המודל הלא נכון ושלם על כך פעמיים.

מה לעשות לפני יום ראשון

אם Solar Pro 4 הוא מועמד לסטאק שלכם, זהו השבוע הזול ביותר שיהיה לכם כדי לבחון אותו. תעריף המבצע בתוקף עד 00:00 UTC ב-11 באוקטובר, והתעריף שאחרי המבצע — 0.15$ ו-0.60$ — כבר נמוך בשליש ממחיר המחירון, והראיות שפרסם המודל עצמו — מספרי Terminal-Bench ו-τ²-Banking — מתארות עבודה שתוכלו לשחזר על מערך המשימות שלכם בתוך אחר צהריים. הריצו את שני המודלים על אותם פרומפטים, החזיקו את הגדרות החשיבה קבועות, ותעדו טוקנים לכל משימה שהושלמה ולא טוקנים לכל קריאה. המספר שיתקבל הוא היחס היחיד שחשוב, והוא לא יהיה 42×. ואז החליטו, בידיעה שאם הצד הזול מנצח, המחיר שבחנתם בו אותו פג ביום ראשון — ואם הצד היקר מנצח, שתים עשרה וחצי נקודות המדד הן מה שאתם משלמים עליו.

GPT-6 Astra נמצא בקטלוג של OrcaRouter בתור openai/gpt-6-astraבתעריפי המחירון של OpenAI עצמה, ומועבר הלאה עם תוספת של 0%.