כרטיס כותרת ראשי עבור GPT-6 Astra לעומת Qwen3.8-Max עם כתובית המשנה 'שני מוצרי דגל סוכניים והאותיות הקטנות מתחת לכל אחד', שבבי סטטוס המציגים 'AA Intelligence 61 לעומת 58', 'מחיר מחירון $10 / $50 לעומת $2 / $6' ו-'ARC-AGI-3: 99.9% ספק לעומת 62.7% רתמה נייטרלית', כותרת תחתונה עם תאריך השקה, ולוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

GPT-6 Astra נגד Qwen3.8-Max: שתי ספינות דגל סוכניות והאותיות הקטנות שמתחת לכל אחת

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ספטמבר 2026 מביא עמו שני סיפורי "דגל סוכני" (agentic flagship), ולשניהם גיבורים משותפים: GPT-6 Astra ו-Qwen3.8-Max. OpenAI השיקה את GPT-6 Astra ב-3 בספטמבר, וטוענת שזהו המודל הטוב בעולם לשימוש במחשב, הנדסת תוכנה, מדע ואבטחת סייבר; Qwen3.8-Max של עליבאבא (Alibaba), הזמין מאז 3 באוגוסט, הוא דגל הסוכנות של המעבדה הסינית החזקה ביותר — זו ש-Artificial Analysis מדרגת בין המובילות בתחום במדד הסוכנות שלה, והמתחרה הקרובה ביותר מהמערכת האקולוגית הפתוחה לטענות העבודה האוטונומית של קו החזית. שניהם חזקים באמת, ושניהם נמכרים עם מספרי כותרת שמתכווצים תחת בדיקה מדוקדקת: התוצאה 99.9% של OpenAI במבחן ARC-AGI-3 צונחת ל-62.7% כאשר ARC Prize מריצה מערך בדיקה ניטרלי משלה; והברק הסוכני של Qwen3.8-Max מגיע עם רגרסיית הזיות (hallucination) שנמדדה באופן בלתי תלוי, ועם הרגל לבזבז 64 סבבים ומעל דולר על משימות שקודמו סיים ב-14. זוהי השוואה בין שני מודלים — וגם בין שתי דרכים לקרוא benchmark.

שתי הכותרות

ההצעה של OpenAI עבור GPT-6 Astra היא רוחב ואוטונומיה: מודל אחד שמפעיל דפדפן, כותב ומתקן קוד, מריץ ניתוח מדעי, ובאופן ייחודי – מוצא פגיעויות אבטחה חדשות מספיק טוב עד ש-OpenAI דירגה את המודל כולו כ"קריטי" במסגרת ה-Preparedness Framework והגבילה את ההגדרות המסוגלות ביותר לשותפים מאומתים. חומרי ההשקה מצהירים על 100% מושלם ב-ExploitBench, על 97.6% ב-FrontierMath Tier 4, על 96.0% ב-GPQA Diamond ועל ציון רוויה ב-ARC-AGI-3. ההצעה של Alibaba עבור Qwen3.8-Max צרה יותר אך ממוקדת: סוס עבודה אייג'נטי ב-$2/$6 שמשיג ציונים בראש או בסמוך לראש של מדדי הערכה אייג'נטיים עצמאיים, כשהמשקלים הבסיסיים פורסמו (תחת רישיון מותאם אישית) במקום להיות נעולים בקופסה שחורה.

מה אומר לוח התוצאות העצמאי

Artificial Analysis מעניקה כרגע ל-GPT-6 Astra (מקס) ציון אינטליגנציה 61 — דירוג 8 מתוך 202 המודלים שהיא עוקבת אחריהם — ול-Qwen3.8-Max ציון אינטליגנציה 58, דירוג 24. הפער של שלוש הנקודות קטן יותר מפער המחירים וקטן יותר מההבטחות השיווקיות של כל אחת מהספקיות; במדד הסוכני (agentic) הנפרד של AA, Qwen3.8-Max רושם 58 שהציבו אותו בשורה אחת עם הטובים ביותר בחזית הקניינית, בעוד ש-AA עדיין אינה מפרסמת מדד סוכני עבור GPT-6 Astra כלל. הקריאה הכנה: באינטליגנציה מדודה טהורה, השניים הם שכנים קרובים, והמסגור של "המודל האינטליגנטי ביותר בעולם" בחומרי ההשקה של OpenAI אינו מה שההערכה הבלתי-תלויה של AA מראה.

אינטליגנציה — GPT-6 Astra (max): AA Intelligence 61, דירוג #8/202. Qwen3.8-Max: AA Intelligence 58, דירוג #24/202; AA Agentic 58.

מחיר מחירון — GPT-6 Astra: $10.00 / $50.00 למיליון, $1.00 קריאות מטמון, פי 2 על קלט מעבר ל-272K טוקנים. Qwen3.8-Max: $2.00 / $6.00 למיליון, $0.25 קריאות מטמון.

הקשר / פלט — GPT-6 Astra: 1.05M קלט / 128K פלט. Qwen3.8-Max: 1M קלט / ~128K פלט.

עדויות סוכניםGPT-6 Astra: ARC-AGI-3 99.9% (במסגרת הבדיקה של OpenAI) לעומת 62.7% (במסגרת הבדיקה הסטנדרטית של ARC Prize); WANDR 0.682 בעלות $11.98 למשימה (לפי דיווח של Perplexity). Qwen3.8-Max: AA GDPval 1,739 Elo ב-64 סיבובים למשימה (בערך $1.14 למשימה); Code Arena WebDev — מקום ראשון עם 1,691 Elo.

דגלים אדומים עצמאיים — GPT-6 Astra: עדיין לא בבורר של ChatGPT, API בשלב ביניים, ויתור על יכולת הניטור. Qwen3.8-Max: רגרסיית ההזיות של AA-Omniscience מ-23% ל-40% לעומת הדור הקודם.

משקלים — GPT-6 Astra: קנייני. Qwen3.8-Max: checkpoint מסדרת Max (Qwen3.8-2.4T-A95B) זמין לציבור תחת רישיון מותאם אישית מאז 12 באוגוסט; AA עדיין מציגה את מודל הדגל המתארח כקנייני.

Two-column comparison scoreboard for GPT-6 Astra vs Qwen3.8-Max. GPT-6 Astra column: AA Intelligence 61 (#8 of 202), AA Agentic not yet published, list price $10.00/$50.00, context/output 1.05M/128K, headline score ARC-AGI-3 99.9% on OpenAI's provider-adapter harness, independent caveat 62.7% on ARC Prize's standard harness. Qwen3.8-Max column: AA Intelligence 58 (#24 of 202), AA Agentic 58, list price $2.00/$6.00, context/output 1M/~128K, headline score GDPval 1,739 Elo on Artificial Analysis runs, independent caveat hallucination regression from 23% to 40% per AA-Omniscience.

האותיות הקטנות, עם הערות

קחו קודם את הנתון של ARC-AGI-3, כי הוא הדוגמה הברורה ביותר לאופן שבו מספר יכול להיות גם נכון וגם מטעה. OpenAI מדווחת על 99.9% עבור GPT-6 Astra ברתמת הבדיקה שלה המותאמת-לספק — הגדרה שמכווננת למודל. ARC Prize, הארגון שמתחזק את המדד, הריץ את GPT-6 Astra על רתמת הבדיקה התקנית הנייטרלית מבחינת ספק ומדד 62.7%. שני הציונים הם ברמה הגבוהה ביותר; איש מהם אינו 99.9% על רתמה שיצרן המודל אינו שולט בה. אותה זהירות נדרשת גם לגבי ציון ה-WANDR של Perplexity, 0.682 — הגבוה ביותר ש-Perplexity תיעדה, אבל הוא נמדד על ידי חברה שבו-זמנית משלבת את GPT-6 Astra במוצריה שלה, ולכן יש לה אינטרס מסחרי בו. כדאי לתת שם לדפוס הזה: המספרים המרשימים ביותר של OpenAI כולם מגיעים מרתמות בדיקה ש-OpenAI או שותפיה שולטים בהן, והמספר העצמאי היחיד — Intelligence 61 של AA — הוא רק מצוין.

האותיות הקטנות של Qwen3.8-Max פועלות בכיוון ההפוך: החוזקות שלו נמדדות באופן בלתי תלוי, וגם החולשה שלו נמדדת באופן בלתי תלוי. ציון ה-GDPval של 1,739 Elo הוא אותנטי — אבל ריצות של Artificial Analysis מראות ש-Qwen3.8-Max מגיע אליו באמצעות 64 סבבים ועלות של כ-1.14 דולר למשימה, לעומת 14 סבבים ו-0.53 דולר לדור הקודם. זהו מס מאמץ: המודל קונה את תקרת הסוכנות שלו באמצעות טוקנים של חשיבה, וזה חשוב לכל מי שמשלם לכל טוקן. והערכת ה-Omniscience של AA מדדה נסיגה בהזיות מ-23% ל-40% לעומת דור Qwen הקודם — דגל בלתי תלוי אמיתי בדיוק עבור עומסי העבודה האוטונומיים ורב-השלביים שבהם תשובה שגויה ובטוחה בעצמה היא היקרה ביותר. מודל שמדבר את עצמו לתוך שגיאות במשך 64 סבבים אינו בהכרח בטוח יותר לשחרר מאשר מודל שהיצרן שלו מודה שיכולת הניטור שלו ירדה.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max) showing an Intelligence Index of 61 ranked #8 of 202, Cost ranked #86 of 202 with $10.00 input and $50.00 output per million tokens and a 90% cache discount, a $1.67 cost per Intelligence Index task, and a summary describing the model as among the leaders in intelligence but expensive for its class.

מחיר, פריסה, והדרך הכנה לבחור

מבחינת מחיר אין תחרות: Qwen3.8-Max ב-$2.00 / $6.00 למיליון הוא חמישית ממחיר הקלט של GPT-6 Astra ושמינית ממחיר הפלט שלה, עם חלון קונטקסט של 1M tokens שאינו כולל את תוספת המחיר של Astra עבור פרומפטים ארוכים. מבחינת יכולת פריסה, ל-Qwen3.8-Max יש יתרון נוסף השבוע — הוא זמין לקריאה היום, והוא פעיל ב-OrcaRouter במחיר המחירון של Alibaba, מועבר ב-0% markup עם failover אוטומטי. GPT-6 Astra, שעדיין בהשקה ועדיין אינו ניתן לבחירה ב-ChatGPT עבור רוב המשתמשים נכון ל-4 בספטמבר, זמין דרך ה-API של OpenAI ופלטפורמות הענן המרכזיות, בעוד הגישה מתרחבת. הדפוס המעשי עבור צוות שבונה צינורות agentic הוא להניח את עומס העבודה על המודל שאפשר לקרוא לו היום, ולהתייחס לאחר כ-benchmark למעקב. אם רוצים להעריך טענות "agentic" במקום לסמוך עליהן, שכבת ניתוב היא הכלי: Qwen3.8-Max, Kimi K3, Grok 4.6 ו-200+ מודלים נוספים נמצאים מאחורי מפתח אחד ב-OrcaRouter, וה-DSL לניתוב יכול לחבר כמה מהם לכדי קריאה אחת — כך שתוכלו להריץ את מערך המשימות שלכם מול המתחרים ולקרוא את התוצאות בעצמכם במקום לבחור בין האותיות הקטנות של שני ספקים.

שתי שאלות שהמפגש הזה ממשיך להעלות

מדוע OpenAI מדווחת על 99.9% ב-ARC-AGI-3 בעוד ש-ARC Prize מודדת 62.7%? משום שאלה לא אותם מבחנים. רתמת ה-provider-adapter של OpenAI היא גרסה של הביצ'מרק שהוגדרה לאופן שבו GPT-6 Astra נקרא בייצור; הרתמה הסטנדרטית של ARC Prize היא תצורה ניטרלית שנועדה להשוות כל מודל בצורה הוגנת. התוצאה 62.7% היא זו שמכלילה ל״מה קורה אם אני קורא למודל הזה בעצמי״, והיא עדיין הציון הטוב ביותר ש-ARC Prize רשמה על הרתמה הזו.

האם המשקלים של Qwen3.8-Max פתוחים? חלקית, עם הסתייגות רישיון. עליבאבא פרסמה את נקודת הבקרה מדרגת Max, Qwen3.8-2.4T-A95B, ב-12 באוגוסט תחת רישיון מותאם אישית — המשקלים ניתנים להורדה, אבל זו לא הפתיחות בסגנון Apache-2.0 של ה-Qwen3.8-27B הקטן יותר, ו-Artificial Analysis עדיין מציגה את הדגם המרכזי המאוחסן כקנייני. אם הדרישה שלך היא "אני יכול להריץ את הדגם המדויק שאני משלם עליו", ההבחנה הזו חשובה; אם הדרישה שלך היא "אני יכול לבדוק את הארכיטקטורה ולאחסן בעצמי גרסה קרובה", Qwen3.8-Max עומד בדרישה ו-GPT-6 Astra לא.

התובנה

בחרו ב-GPT-6 Astra אם אתם זקוקים לדברים הספציפיים שרק הוא מעניק כיום — עבודת אבטחה התקפית, חשיבה מדעית חלוצית, המשימות האוטונומיות הקשות ביותר בשימוש במחשב — והארגון שלכם יכול לעמוד בתנאי הסף שלו ולהרשות לעצמו את מחירו. בחרו ב-Qwen3.8-Max אם אתם רוצים מודל סוכן (agentic) מהשורה הראשונה שתוכלו לפרוס בפועל כבר השבוע ב-$2/$6, כשהמשקלים (weights) משמשים נתיב מילוט ועם רגרסיית הזיות שאתם יודעים כעת שצריך לבדוק. הלקח הרחב יותר הוא האותיות הקטנות עצמן: בספטמבר 2026 שתי ספינות הדגל ה"סוכניות" המובילות נמכרות עם מספרי כותרת שאף יצרן אינו שולט בהם במלואם, והקונה הרציונלי קורא את מתקן הבדיקה (harness), סופר את הסבבים, ומריץ משימות משלו לפני שבוחר צד.

Screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing the $2.00 per 1M input and $6.00 per 1M output prices, and Alibaba listed as the provider with the model's flagship reasoning and agentic positioning.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית