
Gemini 4 Argon לעומת GPT-6 Sol: חמישית מהמחיר, פי ארבעה מהחשבון
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 219 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
הרץ את מערך המדדים של Artificial Analysis על Gemini 4 Argon והוא מחייב $2,407. הרץ את אותו מערך על GPT-6 Sol והוא מחייבת $1,546. אותו אינדקס, אותן משימות, אותו שבוע. לשני המודלים מחירי מחירון זהים — $2.00 למיליון טוקני קלט ו-$10.00 למיליון טוקני פלט, כאשר Argon הוא תעריף היכרות מוצהר מ-Google ו-Sol הוא התעריף הקבוע של OpenAI — ובכל זאת העלות הסופית של ביצוע עבודה זהה שונה ב-56%, לטובת המודל שציון שלו נמוך בחמש נקודות. הפער הזה הוא כל הסיבה שההשוואה הזו שווה כתיבה, ואין לו שום קשר לכרטיס התעריפים.
גוגל הכריזה על Gemini 4 Argon ב-30 בספטמבר 2026, וכינתה אותו העידן הבא של אינטליגנציה חזיתית, במחיר של $2 לקלט ו-$10 לפלט עם קלט במטמון בהנחה של 95%, ומושק למגיני סייבר מהימנים דרך תוכנית Fairwind. GPT-6 Sol זמין באופן כללי מאז 22 בספטמבר 2026, כאשר OpenAI השיקה את השכבה האמצעית של סדרת GPT-6 במחיר של $2 לקלט ו-$10 לפלט עם הנחת מטמון של 90%. אחד מהם ניתן לקנייה היום בנקודת קצה תואמת OpenAI, והשני אינו ניתן לקנייה על ידי אף אחד מחוץ לקבוצה בעלת שם, וזו ההסתעפות המעשית במאמר זה. אבל היפוך העלויות לעיל נשאר תקף גם אם תניח את הזמינות לחלוטין בצד, וההבנה מדוע היא החלק המועיל.
ההיפוך, בניסוח פשוט
Artificial Analysis מפרסמת גם Intelligence Index וגם דיווח חשבונאי של מה שעלה להריץ את המדד הזה. כשקוראים אותם יחד, הם אומרים את הדבר הבא:
• מדד האינטליגנציה — Gemini 4 Argon 52.6 מול GPT-6 Sol 47.5. פער של חמש נקודות, שנמדד כאשר Argon תועד בהגדרת המאמץ high שלו ו-Sol ב־max, כך שההשוואה נדיבה כלפי Sol ולא כלפי Argon.
• מחיר מחירון למיליון טוקנים — זהה. $2.00 בקלט / $10.00 בפלט בשניהם. קריאות מטמון הן ההבדל היחיד: $0.10 ב-Argon, $0.20 ב-Sol.
• עלות לכל משימת אינדקס — Gemini 4 Argon $1.99 לעומת GPT-6 Sol $1.05. Argon עולה בערך פי שניים לכל משימה למרות שהעלות שלו זהה לכל טוקן.
• עלות הרצת החבילה המלאה — Gemini 4 Argon $2,407 לעומת GPT-6 Sol $1,546.
• מהירות פלט שנמדדה — GPT-6 Sol 77.0 אסימונים לשנייה לעומת Gemini 4 Argon 48.9, פער של פי 1.6 שמתבטא גם בהשהיה וגם בהוצאות.
יש שורה אחת ברשימה הזו שמסבירה את כל האחרות, והיא לא המחיר. היא מספר הטוקנים. במשימות של האינדקס עצמו, Gemini 4 Argon יצר בערך 561,000 טוקני פלט לכל משימה; GPT-6 Sol יצר בערך 282,000. Argon חושב פי שניים זמן כדי לענות על אותה שאלה, ובתעריף זהה לכל טוקן זה בדיוק פי שניים בחשבון.

מדוע הטוקנים הם המחיר
זהו התיקון שכדאי להפנים לפני שמישהו מקצה תקציב להגירה, כי האינטואיציה נעה בכיוון הלא נכון. כאשר מודל מתומחר באותו מחיר כמו המתחרה שלו וצורך פי שניים טוקני פלט כדי לסיים, המחיר לטוקן אינו המחיר. המחיר הוא המחיר לטוקן כפול מספר הטוקנים שהמודל מחליט להוציא, והגורם השני הזה הוא תכונה של המודל, לא של המחירון.
השוליים משתנים מאוד בין משימה למשימה, מה שמחמיר את המצב — אי אפשר להחיל מכפיל אחיד ולהמשיך הלאה:
• Terminal-Bench 4.0 — Argon: 165,330 אסימוני פלט למשימה לעומת 97,372 של Sol. Argon עולה כאן $6.78 למשימה לעומת $4.00 של Sol, אף ש-Argon משיג 57.1% לעומת 43.9% של Sol.
• CritPt — Argon 109,533 טוקנים לעומת 31,848 של Sol. יחס טוקנים של פי 3.4 במשימה שבה Sol למעשה זוכה לציון גבוה יותר, 30.9% לעומת 27.1%.
• GDPval — Argon עם 74,571 אסימונים לעומת 41,567 של Sol, בעלות של $1.82 למשימה לעומת $1.32.
• Omniscience — יחס טוקנים של 938 מול 2,662 כאשר Argon ביתרון, בעלות של $0.010 למשימה לעומת $0.027 של Sol. משפחת המשימות היחידה שבה הכיוון מתהפך.
• חשיבה בהקשר ארוך — Argon 2,197 אסימונים לעומת 954 של Sol, והמשימה היחידה במערך שבה Sol מנצח בבירור בניקוד, 83.7% מול 79.7%.
CritPt הוא המקרה המאלף. מודל ששורף פי שלושה וחצי טוקנים כדי להפיק תשובה מעט גרועה יותר על אותה שאלה אינו סיפור של יכולת; זה סיפור של הרגלי הוצאות. ההיסק של Argon ארוך, ובחלק מצורות המשימה האורך הזה מתורגם לניקוד ובאחרות הוא פשוט מתורגם לדולרים. ה-52.6 של המדד וה-47.5 של Sol הם הנתון המצטבר, ונתונים מצטברים מסתירים בדיוק את זה.
מאיפה בעצם מגיעות חמש הנקודות
כיוון שפער המדד ופער העלות מצביעים לכיוונים מנוגדים, כדאי לדעת אילו משימות מניעות כל אחד מהם.
• Terminal-Bench 4.0 — Gemini 4 Argon 57.1% לעומת GPT-6 Sol 43.9%. הניצחון הבודד הגדול ביותר של Argon, ומשפחת המשימות הקרובה ביותר לקידוד סוכני ארוך טווח.
• ידיעת הכול — Gemini 4 Argon 42.4 לעומת GPT-6 Sol 27.1. פער של חמישה־עשר נקודות בכיסוי עובדתי, הפער היחסי הגדול ביותר בחבילת הבדיקות.
• AutomationBench-AA — Gemini 4 Argon 77.5% לעומת GPT-6 Sol 61.6%.
• SciCode — Gemini 4 Argon 61.8% לעומת GPT-6 Sol 57.6%.
• המבחן האחרון של האנושות — Gemini 4 Argon 57.1% לעומת GPT-6 Sol 47.9%.
• GDPval — Gemini 4 Argon 1,611 לעומת GPT-6 Sol 1,487.
• ApexAgents / AA-Briefcase — GPT-6 Sol עם 1,482.78 Elo לעומת 1,493.84 של Argon, פער של 11 נקודות שנמצא בתוך רווחי הסמך שפורסמו ויש לקרוא לו תיקו.
• חשיבה בהקשר ארוך — GPT-6 Sol 83.7% לעומת Gemini 4 Argon 79.7%. הניצחון הברור היחיד של Sol.
• CritPt — GPT-6 Sol 30.9% לעומת Gemini 4 Argon 27.1%. Sol מנצח שוב, בפער דחוק.
אז התמונה היא לא "Argon טוב יותר". היא ש-Argon טוב יותר בשני הדברים שחומרי ההשקה שלו שמו בחזית — ביצוע משימות עסקיות מקצה לקצה והנדסת תוכנה לטווח ארוך — ו-Sol ברמה שווה או מקדים אותו בסולם החשיבה בעל הנופך האקדמי ובשמירה על קוהרנטיות לאורך הקשר ארוך. עבור קורא שסביבת העבודה שלו היא צינור אחזור עם פרומפט של 400K טוקנים, Sol הוא בו-זמנית גם המודל הטוב יותר וגם הזול יותר, וזו עמדה יוצאת דופן ונוחה להיות בה.
ההבדלים במפרט שמחזיקים מעמד מעבר לדיון הבנצ'מרק
• פלט מקסימלי — Gemini 4 Argon 1,000,000 טוקנים במסלול בודד, שגוגל מתארת כגדול ביותר בתעשייה וכעלייה ממגבלת 64K של הדור הקודם. GPT-6 Sol 128,000 טוקנים.
• חלון הקשר — כרטיס הספק של GPT-6 Sol מציין בערך 1,050,000 אסימונים; זה של Argon מציין 1,000,000. Artificial Analysis מדדה את Sol ב-872,000 אסימונים באמצעות ההרנס שלה, וזו מדידת הרנס ולא נתון של כרטיס — התייחס לכרטיס כמפרט ולמספר ההרנס כאל מה שהמעריך הפעיל בפועל.
• מודאליות קלט — שתיהן מקבלות טקסט, תמונות וקבצים. חומר ההשקה של Argon נשען גם על הבנת וידאו ארוך, שבו Google טוענת ל-91.7% ב-LVBench ומתארת זאת כחזית הטכנולוגיה; זהו נתון מדווח על ידי הספק, ואף לוח עצמאי עדיין לא משחזר אותו.
• קלט וידאו — Soft. Artificial Analysis מציג את Argon בתרשים עם קלט וידאו מושבת ומזכיר וידאו במפורש בהשקה, בעוד שהכרטיס של Sol אינו מפרט וידאו כלל. אם הווידאו הוא רכיב קריטי בפייפליין שלך, אף אחד מהכרטיסים לא מכריע את הסוגיה, וכדאי לבדוק לפני שאתה מתכנן ארכיטקטורה.
• מאמץ הסקה — Sol חושף מאמץ ניתן להגדרה (מ'ללא' עד 'מקסימום', 'בינוני' כברירת מחדל) ב-API ותויג במקסימום. Argon תויג בגבוה; אף אחד לא פרסם את אותה סוללת מבחנים בהגדרה הגבוהה ביותר שלו.
תקרת הפלט של מיליון טוקנים היא זו שיכולה באמת לשנות ארכיטקטורה ולא תקציב. כל מה שאתם מפצלים כיום לתריסר קריאות משורשרות כדי להישאר מתחת לתקרה של 128K — ערכת טלאים מרובת קבצים, דוח ביקורת מלא, מסמך ארוך במעבר אחד — הופך לקריאה אחת, עם פחות מקומות שבהם לולאת סוכן יכולה לאבד מצב. האם זה שווה פי שניים מהעלות לכל משימה — תלוי לחלוטין בשאלה אם יש לכם עומס עבודה כזה. אם יש, סביר להניח שזה שווה את זה. אם הקריאות שלכם הן מסוג "סווג והחזר", זה כסף שמתבזבז על מרווח שאף אחד לא ימלא.
הגדרת המאמץ שאיש לא השתווה לה, ולמה זה חשוב
הסתייגות אחת ראויה לפסקה משלה, משום שהיא יוצאת נגד הקריאה של פער המדד בן חמש הנקודות כהבדל טהור ביכולות. Artificial Analysis מציגה בתרשים את Gemini 4 Argon בהגדרה שלה גבוהה למאמץ חשיבה, ואת GPT-6 Sol ב-מקסימלית. אלה אינם אותה דרגה בשני הסולמות, וכיוון אי-ההתאמה מעניין: Sol הורץ בהגדרה היקרה ביותר שלו ו-Argon בהגדרה בינונית.
שתי קריאות עוקבות והנתונים לא יכולים להבדיל ביניהן. או ש-Argon במקסימום יקבל ציון גבוה מ-52.6 — אבל גם ישרוף יותר מ-561,000 טוקנים למשימה ויעלה יותר מ-$1.99 — או שהוא יקבל ציון דומה בערך, מה שאומר שחוגת המאמץ לא עושה הרבה בסוויטה הזו. אין הרצה שפורסמה שמכריעה את זה. כל מי שמצטט 52.6 כתקרה של Argon מצטט תצורה, לא מודל, והתצורה היא זו שהספק בחר לפרסם ראשונה.
אותו היגיון חל על 47.5 של Sol, אלא בכיוון ההפוך: max נמצא בראש הסולם שלו, כך שהנתון קרוב יותר לתקרה מאשר לרצפה. קרב הוגן במאמץ שווה יכול לצמצם את הפער, ויכול גם להפוך את השוואת העלויות, מכיוון שהטוקנים שmax שורף הם הטוקנים שעולים 10 דולר למיליון.
פיצול הזמינות, אשר קובע את התשובה בפועל
Gemini 4 Argon אינו זמין באופן כללי. בהודעה של Google נאמר שהוא נפרס בהדרגה לקבוצה של מגני סייבר מהימנים במסגרת Fairwind Program, שהחברה מעורבת בתהליך ההתנדבותי של ממשלת ארה״ב לגישה למודל לפני שחרורו, ושגישה כללית למפתחים, לארגונים ולצרכנים תגיע „בהקדם האפשרי”, החל מלקוחות API בתשלום ומנויי Google AI Ultra. אין מזהה מודל, אין נקודת קצה, אין מכסה ואין תאריך. הוא אינו נמצא באף API ציבורי, כולל שלנו — בדקו בקטלוג והוא מחזיר 404, כי הוא עדיין לא קיים שם.
GPT-6 Sol הוא מוצר שניתן לקרוא לו. ב-OrcaRouter הוא openai/gpt-6-sol, באותה נקודת קצה תואמת OpenAI כמו שאר יותר מ-200 המודלים בקטלוג, במחיר המחירון של OpenAI המועבר הלאה עם אפס תוספת, כך שה-$2/$10 שלמעלה והצעד של הקשר ארוך של 272,000 טוקנים ל-$4/$15 הם מה שאתם משלמים בפועל ולא מה שכרטיס תעריפים טוען. מעבר אוטומטי בין ספקים מכסה את המקרה שבו המסלול מדרדר באמצע הריצה, וה-DSL לניתוב מאפשר לאפליקציה אחת לשלוח את תעבורת הסיווג הזולה שלה למודל קטן יותר ואת תעבורת החשיבה הקשה שלה ל-Sol בלי SDK נוסף.

ההסדר האחרון הוא התשובה הכנה להשוואה הזו עבור רוב הצוותים. הטיעון העלותי בעד Argon הוא אמיתי, אך הוא מותנה בעומס עבודה שבו עבודת סוכנים ארוכת טווח שולטת; הטיעון העלותי נגדו אמיתי בכל עומס עבודה אחר; ובכל מקרה לא תוכלו לקנות אותו החודש. המהלך הזול הוא לבנות עכשיו את רתמת ההערכה — הפרומפטים שלכם, הניקוד שלכם, בהרצה מול Sol בכמה הגדרות מאמץ — כך שכאשר Argon יגיע ללקוחות API בתשלום, תהיה לכם תשובה מדודה לשאלה שכל השאר יענו עליה מלוח דירוג.
מה יפתור את זה?
שלושה דברים, לפי כמה הם ישנו את ההכרעה. זמינות כללית של Argon במחיר אמיתי, שאינו מחיר היכרות — המילה "היכרות" משמעה ש-$2/$10 יכולים לזוז, והרצף של Google עצמה מציב לקוחות API בתשלום ראשונים, כך שהתעריף הראשון שיפורסם לאחר ההשקה הוא זה שכדאי לעקוב אחריו. הרצה שפורסמה של Artificial Analysis של Argon בהגדרת המאמץ הגבוהה ביותר שלו, שתאמר אם 52.6 הוא תקרה או במרחק שערה ממנה. ושחזור בלתי תלוי אחד של הנתון של DeepSWE v1.1 — Google טוענת ל-77.9% וקוראת לכך שיא חדש; זה מדווח על ידי הספק ולא שוחזר מחוץ ל-Google נכון להיום.
עד אז הפיצול נקי ומעט אירוני. GPT-6 Sol הוא המודל המאומת יותר, המהיר יותר, הזול יותר לכל משימה מוגמרת, וזה שאפשר להפעיל כבר היום אחר הצהריים. Gemini 4 Argon הוא המודל עם הניקוד הגבוה יותר בלוח שהספק שלו בחר לפרסם, בערך פי שניים יקר יותר לשימוש בפועל, ועדיין לא למכירה. הבחירה ביניהם אינה שיפוט לגבי יכולת. זה שיפוט לגבי איזה משני המשפטים האלה מתאר את החודש שלך.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
