
GPT-6.1 Sol מול GPT-6 Luna: שלוש עשרה נקודות מדד, פי עשרה מהכסף, ושתי הערכות שבהן זה לא מחזיק
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
OpenAI שחררה את GPT-6.1 Sol ב-29 בספטמבר 2026, שבוע אחרי שGPT-6 Luna הגיעה ב-22 בספטמבר באותו סבב מצגות מפתח. הן שני הקצוות של אותו דור: Luna היא השכבה הזולה, Sol היא שכבת הביניים שמעליה, ו-GPT-6 Astra יושבת מעל שתיהן. פער המחירים בין השתיים הוא בסדר גודל — 0.10 ו-0.50 דולר למיליון טוקנים לעומת 2.00 ו-10.00, קלט במטמון 0.01 לעומת 0.10 — ופער היכולות בלוח העצמאי הוא 13.7 נקודות במדד האינטליגנציה, 51.8 לעומת 38.1 במאמץ החשיבה המרבי. פי עשרה כסף תמורת שלוש עשרה נקודות הוא בערך שער החליפין הגרוע ביותר בהרכב הנוכחי של OpenAI. מה שהופך את ההשוואה לראויה לכתיבה הוא שאלת ארבעים הדולרים שבאה בעקבותיה: אילו שלוש עשרה נקודות?
שני המודלים, והשבוע שביניהם
GPT-6 Luna הוא המודל הקטן של דור GPT-6 — זה ש-OpenAI מתארת כמיועד לעבודה בנפח גבוה ורגישה להשהיה: סיווג, חילוץ, ניתוב, סיכום בכמות גדולה, הלולאה הפנימית של סוכן. הוא כולל חלון הקשר של 1,050,000 טוקנים ותקרת פלט של 128,000 טוקנים, מקבל טקסט, תמונות וקבצים כקלט, ושומר על סולם המאמץ המלא בעל שש הדרגות כולל ללא, שדרגת 6.1 השמיטה. כרטיס התעריפים הוא הסיבה לקיומו: $0.10 בקלט ו-$0.50 בפלט למיליון טוקנים, קלט במטמון ב-$0.01 וכתיבות למטמון ב-$0.125, עם מדרגת הקשר ארוך מעל 272,000 טוקני קלט ל-$0.20, $0.75 ו-$0.02 במטמון.
GPT-6.1 Sol הוא רענון בדרג הביניים ששוחרר שבוע לאחר מכן. אותו חלון, אותה תקרת פלט, אותן מודאליות קלט, נקודת חיתוך ידע של 30 באפריל 2026 לעומת זו של Luna, וסולם מאמץ שמתחיל בנמוך כי ללא ומינימלי נדחים על הסף. הוא מתומחר ב-$2.00 וב-$10.00 עם קלט במטמון ב-$0.10 — פי עשרים מתעריף הקלט של Luna ופי עשרים מתעריף הפלט שלה, עם שורת מטמון יקרה פי עשרה לכל פגיעה.
שניהם במבצע, שניהם זמינים ב-ChatGPT Work וב-Codex כמו גם ב-API, ושניהם ניתנים להפעלה דרך אותו מפתח מצדנו. שום דבר בשילוב הזה לא מחייב לבחור.
מה בעצם קונות שלוש עשרה נקודות מדד
הציון המשולב הוא הנתון הפחות אינפורמטיבי בהשוואה, משום שהוא ממצע על פני משימות שמתנהגות באופן שונה מאוד. כאשר מדרגים הערכה אחר הערכה במאמץ החשיבה המרבי ב-Artificial Analysis v4.3.2, הצורה היא פיצול ולא שיפוע:
• AA-LCR v1.1, הסקה בהקשר ארוך — GPT-6 Luna 0.833 לעומת GPT-6.1 Sol 0.830. Luna מקדימה בפער שולי.
• SciCode — GPT-6 Luna 0.546 לעומת GPT-6.1 Sol 0.542. שוב למעשה באותה רמה, ושוב המודל הזול יותר לכאורה מוביל.
• Terminal-Bench 4.0 — GPT-6 Luna 0.126 לעומת GPT-6.1 Sol 0.561. פער של 43 נקודות; שני המודלים נמצאים בליגות שונות בעבודה בטרמינל.
• המבחן האחרון של האנושות — GPT-6 Luna 0.385 לעומת GPT-6.1 Sol 0.529.
• AutomationBench-AA — GPT-6 Luna 0.532 לעומת GPT-6.1 Sol 0.649.
• GDPval-AA v2.1 — GPT-6 Luna Elo 1437.1 לעומת GPT-6.1 Sol Elo 1575.1, פער Elo של 138 נקודות בעבודת ידע מקצועית.
• GDP.pdf — GPT-6 Luna 0.228 לעומת GPT-6.1 Sol 0.310.
• CritPt — GPT-6 Luna 0.194 לעומת GPT-6.1 Sol 0.317.
• AA-Omniscience — GPT-6 Luna 0.65 לעומת GPT-6.1 Sol 41.5. בסולם שבו אפס פירושו מספר זהה של תשובות נכונות ושגויות, Luna נמצאת על קו המים ו-Sol נמצאת משמעותית מעליו.
• MMMU-Pro — GPT-6 Luna 0.797 לעומת GPT-6.1 Sol 0.860.
• עלות לכל משימת אינדוקס, בנפרד — GPT-6 Luna $0.068 לעומת GPT-6.1 Sol $0.72; פער של פי עשרה בערך לטובת המודל הזול
• אסימוני פלט בהרצת האינדקס — GPT-6 Luna 144 מיליון לעומת GPT-6.1 Sol 67 מיליון, לעומת חציון קטגוריה של 100 מיליון עבור Luna וכ-81 מיליון עבור Sol
שתיים מתוך עשר הערכות הן תיקו לטובת המודל הזול. שמונה הולכות למודל היקר, ובשש מתוך אותן שמונה הפער אינו שולי. זו הקריאה הכנה של שלוש עשרה הנקודות: זה אינו גרדיאנט איכות אחיד; אלו שתי יכולות — ביצוע סוכני מתמשך ואמינות עובדתית — שבהן לונה פשוט אינה מאותו סוג של מודל, ואמצע רחב שבו ההבדל אמיתי אך קטן מספיק כדי להיות בלתי נראה במערך ההערכה שלך.
תוצאת AA-LCR מצריכה הסתייגות אחת, מפני שזה המספר שמחמיא ל-Luna יותר מכול. הסקה בהקשר ארוך בציון 0.833 היא ציון חזק, ושתי המודלים נמצאים במרחק של פחות מחצי נקודה זה מזה, אבל המבחן מודד אחזור והסקה על קלטים ארוכים, ולא את היכולת לפעול לאורך סשן ארוך. הפער ב-Terminal-Bench 4.0 הוא איך נראית "פעולה לאורך סשן ארוך" כשהיא מקבלת ציון, והוא רוחב 43 נקודות.

האריתמטיקה של עלות לכל משימה, והיכן שהיא מפסיקה להיות נכונה
Artificial Analysis מתמחרת כל הרצת אינדקס לפי צריכת טוקנים שנמדדה, כך שנתון העלות אינו הסקה מתוך מחירון. הרצת GPT-6 Luna עלתה $0.068 למשימה; הרצת GPT-6.1 Sol עלתה $0.72. היחס הוא פי 10.7, שהוא מעט גרוע יותר מיחס המחירים הנומינלי של פי עשרים רק משום ש-Luna יצרה 144 מיליון טוקני פלט בהרצה, לעומת 67 מיליון של Sol — המודל הזול פטפטן יותר מפי שניים, והוא מכרסם ביתרון של עצמו. אף על פי כן, סדר הדירוג אינו צמוד, ובנטל עבודה של תשובות קצרות הפער היה מתרחב: פחות נפח פלט משמעו שקנס הפטפטנות של Luna מצטמצם בעוד יתרון המחיר שלה נשאר קבוע.
המקום שבו החשבון מפסיק להיות נכון הוא בכל עומס עבודה שהאינדקס אינו דומה לו. אם המשימה שלך היא עריכה בקנה מידה של מאגר קוד שדורשת להחזיק עשרים קריאות לכלים בקוהרנטיות, מודל ב-0.07 דולר שנכשל במשימה עולה לך את כל לולאת הניסיונות החוזרים ועוד את זמן השעון, ומודל ב-0.72 דולר שמסיים בפעם אחת זול יותר. מסגור ההשקה של GPT-6.1 Sol עצמו בנוי כולו על הרעיון הזה — עלות לכל שהושלמה משימה — וזו המסגרת הנכונה: ההשוואה הרלוונטית היא לא הטוקן, אלא העלות הצפויה לכל תוצאה, ובמשימות שלונה אינה מסוגלת להשלים, הציפייה הזו אינה חסומה.
שני פרטים מבניים מחדדים את הגבול. ראשית, מדרגת ההקשר הארוך: שני המודלים מתומחרים מחדש מעל 272,000 אסימוני קלט — Luna ל-$0.20 ול-$0.75, ו-Sol ל-$4.00 ול-$15.00 — כך שהפער המוחלט דווקא מתרחב בגבול במקום להצטמצם, אבל התעריף המתומחר מחדש של Luna עדיין נמוך בסדר גודל מהתעריף הרגיל של Sol. שנית, וקל לפספס: סולם המאמץ אינו באותה צורה. Luna מקבל none; Sol לא. מפל ניתוב שמפנה תחילה ל-Sol ונופל בחזרה ל-Luna בשגיאה או בפסק זמן אסור לו להעביר את reasoning.effort של הבקשה ללא שינוי, משום שתצורה חוקית במודל אחד מחזירה שגיאה במודל האחר. זהו עניין של שכבת הניתוב, ולא של איכות המודל, וזה בדיוק מסוג הדברים שנקודת קצה אחת עם כלל ניתוב אמורה לספוג.
הרצת שניהם היא העיקר, לא גידור.
שני המודלים נמצאים ב-OrcaRouter במחירי המחירון של OpenAI עצמה ללא כל תוספת: GPT-6 Luna ב-$0.10 ו-$0.50 עם קלט במטמון ב-$0.01, GPT-6.1 Sol ב-$2.00 ו-$10.00 עם קלט במטמון ב-$0.10, ומדרגת 272,000 הטוקנים בכל אחד מועברת בדיוק כפי שהספק מציין אותה. מכיוון שהפלטפורמה מעבירה את מחיר המחירון של הספק הלאה במקום להוסיף עליו, יחס של פי עשרים במאמר זה הוא היחס שאתם משלמים בפועל, בשני הצדדים.

הסיבה שחשובה כאן במיוחד היא שהזוג הזה הוא מפל שממתין להיכתב. מסווג, ראוטר, עבודת חילוץ בכמות גדולה וסוכן קידוד בקנה מידה של מאגר קוד לא שייכים לאותו מודל, ופער המחירים רחב מספיק כך שבחירה שגויה בכל כיוון היא יקרה — פי עשרים יותר מדי לכל קריאה בכיוון אחד, ומשימה כושלת בכיוון האחר. מפתח אחד, שני מודלים, וכלל שמפנה תעבורה קלה ל-Luna ומסלים ל-Sol כשסוג המשימה משתנה או כשהפלט של Luna נכשל בבדיקה, הוא שינוי תצורה בצד שלנו ולא חוזה עם ספק שני. מעבר אוטומטי בעת כשל מכסה את המקרה שבו אחד מהשניים נמצא במצב ירוד, וזה עבור מודל שיצא לפני שמונה ימים הוא עדיין אפשרות ריאלית.

ההחלטה, במעבר אחד
• סיווג, חילוץ, ניתוב, סיכום בכמות גדולה, לולאות פנימיות של סוכנים — GPT-6 Luna, ואפשר להפסיק לקרוא. במחיר של $0.10/$0.50 עם קריאה מהמטמון בעלות של סנט אחד, שלוש עשרה נקודות מדד ביכולת כללית אינן שוות פי עשרה מהחשבונית בעבודה שבה התשובה קצרה וניתנת לבדיקה.
• קידוד בהיקף מאגר, סוכני מסוף, ביצוע רב-שלבי — GPT-6.1 Sol. הפער של 43 נקודות ב-Terminal-Bench 4.0 הוא הטיעון כולו; זו היכולת שבעבורה משלמים את המחיר.
• שאלות בעבודת ידע שבהן תשובה שגויה עולה ביוקר — GPT-6.1 Sol, על הפערים ב-AA-Omniscience וב-GDPval-AA. ציון האמינות העובדתית של Luna נמצא על קו המים.
• קלטים ארוכים עם תשובה קצרה שנוצרה — GPT-6 Luna. הוא מבצע הסקה על הקשר ארוך ברמה זהה לזו של מודל שעולה פי עשרים ממנו, והעונש על אריכות הדברים שלו בהיקף של 144 מיליון טוקנים אף פעם לא זוכה להזדמנות לחול.
• כל דבר שכבר מוגדר כ־none — הישארו על Luna, או תקצבו את השינוי. המדרגה הזו לא קיימת ב-GPT-6.1 Sol.
• משטחים רגישים להשהיה — GPT-6 Luna, לפי המדידות של הלוח עצמו: 129.4 אסימוני פלט לשנייה ו-100 שניות עד למקטע הראשון, לעומת 59.7 ו-332 של Sol.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
