
GPT-6.1 Sol מול Claude Opus 5.5: פער אמיתי, בחלוקה לא אחידה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 143 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 293 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
הפער של 5.8 נקודות בין Claude Opus 5.5 ל-GPT-6.1 Sol במדד Artificial Analysis Intelligence Index הוא הגדול ביותר מבין כל זוג במערך הזה, ובשונה מרובם הוא לא ייסגר בשינוי הגדרה. Claude Opus 5.5, שהושק ב-22 בספטמבר 2026 ובתעריף של 4.00 דולר למיליון טוקני קלט ו-20.00 דולר למיליון טוקני פלט, משיג 57.6. GPT-6.1 Sol, שהושק ב-29 בספטמבר 2026 בתעריף של 2.00 ו-10.00 דולר, משיג 51.8. Claude Opus 5.5 הוא המודל בעל הניקוד הגבוה יותר, בפער שגדול מזה שמפריד בין רוב מודלי החזית זה מזה, והוא עולה פי 8.3 יותר לכל משימה כדי להגיע לשם — 5.98 דולר לעומת 0.72 דולר. עד כה המודל היקר פשוט מנצח, וזו הגרסה הכי פחות מעניינת של ההשוואה הזאת. מה שהופך אותה לשווה קריאה הוא ש-5.8 הנקודות לא מפוזרות באופן שווה על פני מכלול המבחנים: על הציר היחיד שמכריע את רוב העבודה עם מסמכים ארוכים וסשנים ארוכים, שני המודלים נמצאים בטווח של שתי נקודות זה מזה.
שניהם דגמי דגל באותו תא שוק: חלונות הקשר בדרגת 1M, תקרות פלט של 128K, קלט טקסט, תמונה וקבצים, חשיבה מורחבת בצד אחד וסולם מאמץ בן חמישה שלבים בצד השני. Claude Opus 5.5 מחליף את Claude Opus 5 וממוקם לעבודת הסקה, קידוד ועבודה סוכנית בטווח ארוך תובענית; GPT-6.1 Sol נמצא בדרגה אחת מתחת ל-GPT-6 Astra וממוקם לקידוד סוכני, שימוש במחשב ועבודה מקצועית עתירת מסמכים. הם מכוונים לאותם תפקידים. המדידה אומרת שהם לא טובים באותה מידה בכולם.
איפה 5. הנקודות באמת נמצאות
מדד מורכב מסתיר את מרכיביו. חלץ את ההערכות הבודדות, והפער מפסיק להיראות כמו פער ומתחיל להיראות כמו פרופיל.
• המבחן האחרון של האנושות — Claude Opus 5.5 61.4% לעומת GPT-6.1 Sol 52.9%, פער של 8.5 נקודות בהסקה מופשטת
• SciCode — Claude Opus 5.5 66.9% לעומת GPT-6.1 Sol 54.2%, פער של 12.7 נקודות בקוד ברמת מחקר
• שליפה בהקשר ארוך — Claude Opus 5.5 עם 84.7% לעומת GPT-6.1 Sol עם 83.0%, פער של 1.7 נקודות בשליפת עובדות מקלט ארוך
• Terminal-Bench 4.0 — Claude Opus 5.5 59.6% לעומת נתון של Sol שלא פורסם באותה מהדורה
• חלון הקשר — GPT-6.1 Sol 1,050,000 טוקנים לעומת Claude Opus 5.5 1,000,000 טוקנים, עם תקרת פלט של 128,000 טוקנים בשניהם
• עלות לכל משימת אינדוקס — Claude Opus 5.5 $5.98 לעומת GPT-6.1 Sol $0.72
ההתפלגות היא הסיפור. כאשר המשימה היא הסקה מופשטת — שאלת בחינה קשה, בעיית קידוד ברמת מחקר ללא תשובה קיימת להעתיק — Claude Opus 5.5 נמצא בבירור בחזית, ופער של 12.7 נקודות ב-SciCode אינו רעש. כאשר המשימה היא למצוא את הקטע הנכון בקלט ארוך מאוד ולהשתמש בו, שני המודלים שווים למעשה, ו-GPT-6.1 Sol מחזיק בעמדה זו עם 50,000 טוקנים נוספים של קיבולת. חלק גדול מעבודת ה-LLM בייצור הוא מהסוג השני: מענה מוגבר באחזור, סקירת חוזים והגשות, ניתוח לוגים ותמלילים, סקירת קוד על מאגר גדול. עבודה זו נמדדת לפי הסעיף השלישי, לא לפי השניים הראשונים, ובסעיף זה הפרמיה קונה 1.7 נקודות.
קריאה כנה של שורות האינדקס
שתי הסתייגויות צריכות להופיע לצד המספרים האלה ולא בתחתית העמוד.
התצורות שונות. Artificial Analysis מציגה בגרף את Claude Opus 5.5 בתצורת "Max, Default Fallback" ואת GPT-6.1 Sol במאמץ מקסימלי. אלו הן ההגדרות החזקות ביותר שכל אחד מהמודלים מתפרסם בהן, מה שהופך את ההשוואה להוגנת, אך זו השוואה בין שתי תקרות ולא בין שתי ברירות מחדל של גרסאות משוחררות. ברירות המחדל של Claude Opus 5.5 עצמו ב-API מתארח עשויות להיות שונות מההרצה שתועדה בגרף, וברירת המחדל של המאמץ אצל GPT-6.1 Sol היא בינונית.
השורה של Terminal-Bench ריקה במכוון בצד אחד. הנתון של 59.6% של Claude Opus 5.5 מגיע מהגרסה של Artificial Analysis שבה הוא פורסם; הנתון המקביל של GPT-6.1 Sol אינו זמין בגרסה תואמת. ציטוט של מספר מהרצה אחרת של אותו מבחן יהיה השוואה כוזבת, והמהלך ההוגן הוא להשאיר את התא ריק במקום למלא אותו במשהו שקרוב לנכון.
הפטפטנות פועלת כאן באותו כיוון שבו פעלה נגד האחים הזולים יותר: Claude Opus 5.5 פולט 260M טוקנים בפלט בסוויטת המדדים לעומת 67M של GPT-6.1 Sol, פער של פי 3.9 בתעריף שכבר גבוה פי שניים. מכאן מגיע יחס של פי 8.3 למשימה, כשכרטיס התעריפים מציג פי 2 בקלט ופי 2 בפלט. הפרמיה אינה פי 8.3 מפני שהמודל עולה פי 8.3 — היא פי 8.3 מפני שהוא עולה פי 2 וחושב פי 3.9 יותר זמן.
הטיעון בעד תשלומו
אם העבודה שלך דומה לשתי הנקודות הראשונות, החישוב פשוט והוא נוטה לטובת Claude Opus 5.5. פער של 12.7 נקודות בקוד מדעי ברמת מחקר, או 8.5 נקודות בחשיבה מופשטת קשה, הוא ההבדל בין סוכן שסוגר טיקט ללא השגחה לבין אחד שזקוק לאדם בכל צעד שלישי. קידוד סוכני על פני בסיס קוד גדול הוא עומס העבודה ששני הספקים מציינים ראשון, והוא עומס העבודה שבו הפער הוא הרחב ביותר. לשלם $5.98 במקום $0.72 למשימה כדי להימנע מהרצה כושלת שעולה למהנדס עשרים דקות הוא לא החלטה גבולית.
יש טיעון שני שאינו עוסק בציונים כלל. Claude Opus 5 בן חמישה עשר ימים, והוא יצר גוף של הערכות, ביקורות ופריסות מצד צדדים שלישיים שאין למודל בן שמונה ימים. עבור מסלול ייצור, לבגרות של הידע הסובב יש ערך שהמדד אינו מתמחר.
התיק נגד, והמספר שמכריע אותו
הטיעון הנגדי הוא שורת ההקשר הארוך. אם הצורה הדומיננטית של התעבורה שלך היא "קלט גדול, תשובה קצרה" — והרי עבור המון צוותים זה כך — אז הציר שעליו מחייבים אותך אינו הציר שאתה צורך. באחזור הקשר ארוך שני המודלים מרוחקים זה מזה ב־1.7 נקודות ביחס מחירים של פי 8.3, והמודל הזול יותר מחזיק בחלון הגדול יותר. זה המקרה שבו הפרמייה אמיתית, מדודה, ומושקעת ביכולת שעומס העבודה לעולם אינו מפעיל.
המספר המכריע, אם כך, אינו המדד. הוא שיעור המשימות שלכם שנראות כמו SciCode ולא כמו זכירה. צוותים שיכולים לענות על השאלה הזו מתוך הלוגים שלהם צריכים לענות עליה מתוך הלוגים שלהם; ערכת מבחנים היא פרוקסי לתמהיל של עבודות, והתמהיל הוא המשתנה.
שניהם על מקש אחד, וזה מה שהופך את השאלה לכזו שאפשר לענות עליה


Claude Opus 5.5 נמצא ב-OrcaRouter במחיר $4.00 / $20.00 משלו, עם קריאות מטמון ב-$0.20. GPT-6.1 Sol נמצא ב-OrcaRouter ב-$2.00 / $10.00, ועולה ל-$4.00 / $15.00 מעל 272,000 טוקנים בפרומפט, עם קריאות מטמון ב-$0.10. שניהם במחיר המחירון של הספק, בלי שום תוספת, במפתח אחד ובחשבון אחד.
זה חשוב יותר מהרגיל בשילוב הזה, מפני ששני המודלים אינם תחליפים — הם החלטת ניתוב. שלחו את עבודת המסמכים הארוכים והנפח הגבוה אל GPT-6.1 Sol, השאירו את עבודת ההסקה הקשה ושינוי הקוד על Claude Opus 5.5, ושניהם פועלים מאחורי אותה נקודת קצה עם אותם פרטי הזדהות. אם נתיב מתדרדר, מעבר כשל אוטומטי מעביר את הקריאה במקום לגרום לה להיכשל, ומכיוון שהניתוב הוא הצהרתי ניתן לבטא אותו לפי סוג משימה במקום לפי יישום. בדיקת הפיצול היא שינוי תצורה, לא הגירה.
הדבר האחרון שראוי לומר הוא על חיי המדף של השוואה הזו. שני המודלים בני ימים או שבועות. ל-GPT-6.1 Sol פורסמה קונפיגורציה עצמאית אחת; ל-Claude Opus 5.5 גם אחת. הרצה בודדת לכל מודל היא תמונת מצב, ואופן הכשל המעניין אינו שאחד המספרים הללו שגוי — אלא שקונפיגורציה במאמץ בינוני, או מעריך שני, משרטטים מחדש את הפרופיל. עד אז, הקריאה הניתנת להגנה היא זו שהמרכיבים מספקים: פער מכריע בהיסק קשה ובקוד מחקרי, פער קטן בעבודה עם הקשר ארוך, וחשבון של פי 8.3 שצריך להיות מוצדק על ידי אותו חלק מעומס העבודה שלכם שדומה לראשון.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
