
המדרגה של Argon ב-Gemini 4 בסולם Gemini 4 — ולמה אין G4 Ultra
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 221 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
התשובה הקצרה לשאלה שהחלה את המאמר הזה היא ש-Gemini 4 Argon הוא המודל המוביל של Google ולא השכבה העליונה שלה, מפני שהשכבה שמעליו עוד אינה קיימת — ואולי לא בצורה שאיש מצפה לה. Google פרסמה בדיוק מודל אחד של Gemini 4, בשם Argon, והעמוד היחיד שהוא של צד ראשון בדומיין שלה בנתיב /models/gemini/ultra/ אינו עמוד מודל כלל: הוא מפנה מחדש לתוכניות המנוי של Google AI. ההפניה הזו היא העובדה השימושית ביותר במאמר הזה, וניתן לבדוק אותה בשורה אחת מהטרמינל. כל השאר כאן עוסק בשאלה היכן Argon באמת נמצא ברגע שמפסיקים לקרוא את המחיר שלו כתווית של שכבה ומתחילים לקרוא אותו כמספר.
שני דברים נכונים בו-זמנית, וקל להתבלבל ביניהם. Argon הוא ה-Gemini המסוגל ביותר שקיים, ו-Argon אינו מודל ברמת החזית. הוא מוביל כל מודל Google ששוחרר, בפער רחב מספיק כדי שההשוואה אינה באמת השוואה, והוא נוחת במדד ה-Intelligence Index של Artificial Analysis בתוך שבריר נקודה משני דגמי דגל מתחרים, שאף הם נמצאים חמש נקודות שלמות מאחורי המוביל הנוכחי. Google תימחרה אותו כאילו הוא נמצא מדרגה אחת מתחת לחזית, והמדידה הבלתי תלויה מסכימה. אז המחיר אינו החלטת שיווק שממעיטה בערכו של המודל. זו הצהרה מדויקת על המודל.
זהו מאמר של "מה שאנחנו יודעים עד כה". Gemini 4 Argon הוכרז ב-30 בספטמבר 2026 בפוסט של Google DeepMind המיוחס ל-Koray Kavukcuoglu, והוא מושק תחילה לקבוצת מגיני סייבר נקובת שם דרך Fairwind Program של Google — לא למפתחים, לא לארגונים, לא לצרכנים, ולא לאף אחד עם כרטיס אשראי. אין לו מזהה מודל ב-Gemini API, אין נקודת קצה, ואין מחיר מפורסם לפי טוקן שאפשר לחייב בגינו. אין עבורו מזהי מודל, תפוקה ואמינות שנמדדו בתעבורה אמיתית, ומשמעות הדבר היא שהמדידה שלהלן היא הרצת בנצ'מרק של מעבדה אחת ולא יותר מכך. כאשר מספר מגיע מ-Google, הוא מסומן כשל Google; כאשר הוא מגיע מ-Artificial Analysis, הוא מסומן כשלהם. אין לראות בדברים כאן טענה ש-Argon הוא מוצר שניתן לרכוש.
הסולם שגוגל בפועל שחררה, כפי שנקרא מהדפים שלה
הדרך המהירה ביותר לענות על "מה מקומו של Argon בסדרת Gemini 4" היא להפסיק לשאול על הסדרה ולהתחיל לרשום את הדגמים שגוגל מפרסמת עבורם דפים. סדרה היא מושג שיווקי; דף הוא עובדה. הנה אל מה מתפענחים הנתיבים של צד ראשון נכון ל-1 באוקטובר 2026.
• deepmind.google/models/gemini/pro/ מחזיר 200 והכותרת שלו היא "Gemini 3.1 Pro — Google DeepMind". המשבצת Pro באתר של Google עצמה היא עדיין מודל מדור 3.1.
• deepmind.google/models/gemini/flash/ מחזיר 200 והכותרת שלו היא "Gemini 3.8 Flash — Google DeepMind". משבצת ה-Flash זזה שלוש פעמים — 3.5, 3.6, 3.7, 3.8 — בעוד שמשבצת ה-Pro לא זזה כלל.
• deepmind.google/models/gemini/argon/ מחזיר 404. Argon לא מקבל נתיב לפי דגם. ביתו הוא עמוד המשפחה בכתובת deepmind.google/models/gemini/, שם Google מציבה את הדגם שאיתו היא מובילה כעת.
• deepmind.google/gemini/ultra/ מחזיר 302 ונוחת על one.google.com/about/google-ai-plans/, עמוד המינויים לצרכנים. כך גם לגבי הנתיב הישן יותר deepmind.google/technologies/gemini/ultra/. "Ultra" בנתיב המודלים של Google הוא שכבת חיוב, לא צ'קפוינט.
• deepmind.google/models/gemini/nano/ מחזיר 301 לעמוד משפחת Gemini. אין גם משבצת Nano כעמוד דגם עצמאי.
• deepmind.google/models/gemini/model-cards/ — האינדקס ש-Google מתחזקת של כל כרטיס מודל שפרסמה — אינו כולל רשומה עבור Argon ואינו כולל רשומה עם “Gemini 4” בשם. שורות ה-Gemini החדשות ביותר בו הן 3.8 Flash, 3.8 Audio, 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite ו-3.1 Pro. אינדקס כרטיסי המודלים הוא המסמך המתעדכן באיטיות הרבה ביותר בקבוצה הזו, ולכן השתיקה שלו אינה ראיה ש-Argon לעולם לא יהיה לו כרטיס; היא ראיה שהניירת טרם הדביקה את ההכרזה.
• deepmind.google/models/, אינדקס המודלים, מציג את "Gemini 4 Argon" ככרטיס הדגל עם הסלוגן "העידן הבא שלנו של בינה בחזית", ממש מעל "Gemini 3.8 Flash — הטוב ביותר להתמודדות עם משימות סוכניות מורכבות בקנה מידה". שני כרטיסי Gemini, בהפרש של דור אחד, בסדר הזה.
אם מחברים את אלה יחד, צורת הסולם אינה דו-משמעית. במשטח המודלים הציבורי של Google יש כיום רשומה אחת בשלב Gemini 4, רשומה אחת בשלב Gemini 3.8, שלב Pro מיושן שלושה וחצי דורות אחורה, ומעל כל אלה אין דבר. המילה "Ultra" בדומיין של Google מובילה למנוי. אין דף Gemini 4 Pro, אין דף Gemini 4 Flash, אין דף Gemini 4 Ultra, ואין כרטיס מודל של Gemini 4. Google הכריזה על מודל, לא על משפחה.
האם קיים Gemini 4 Ultra? הראיות, ומה היה מפריך זאת
זה ראוי לסעיף משל עצמו, מפני שזה החלק בשאלה שסביר ביותר שיקבל תשובה שונה בעוד שבוע, ומפני שלתשובה הכנה יש חיי מדף.
הראיות השליליות הן ספציפיות ולא מעורפלות. הפניה 302 בנתיב Ultra לעמוד תוכניות המנוי אינה אות רך; זוהי הפניה שצוות האינטרנט של גוגל עצמו הגדיר. כמה דפוסי URL של blog.google עבור פוסט על Gemini 4 Ultra מחזירים 404 — נתיב המוצרים, נתיב המודלים והמחקר של innovation-and-ai, ונתיב ההכרזה הרגיל. לשם Ultra יש תקדים כאן, והתקדים פועל נגד Gemini 4 Ultra. ההכרזה המקורית של גוגל על Gemini הציגה את Gemini 1.0 כ"ממוטב לשלושה גדלים שונים: Ultra, Pro ו-Nano", כאשר Gemini Ultra תואר כ"המודל הגדול והיכולתי ביותר שלנו". פוסט השקה שמציין שלושה גדלים הוא איך נראית הכרזה על משפחה. הפוסט של Argon מציין מודל אחד ואף לא דגמי אחים כלל. בהמשך גוגל הפסיקה להשתמש בשם הדגם Ultra לטובת דרגות מספריות, והעבירה את המילה לצד המנויים של העסק, שם היא משמשת כעת כשם תוכנית הצרכנים הבכירה. עמוד דגם שמפנה לעמוד תוכניות הוא איך נראה שם דגם שהוצא משימוש כשהאתר השיווקי נוקה סביבו.
כמו כן, אין בהכרזה שום דבר שמבטיח אח גדול יותר. פוסט ההשקה של Argon מתאר את Argon כ"מודל החזית החדש שלנו" ומתאר את הפריסה המדורגת, את עבודת אמצעי ההגנה ואת הפריסות הפנימיות, ומסתיים. הוא אינו אומר "הראשון במשפחת Gemini 4", אינו מספק תצוגה מקדימה ל-Pro או ל-Ultra, ואינו נוקב בשם של יורש. המסגור של גוגל עצמה מתייחס ל-Argon כדבר עצמו, ולא כאל הקטן.
מה שיפריך את המסקנה קל לאמירה וכדאי לשים לב אליו, כי כל אחד מאלה היה הופך אותה בתוך יום.
• 200 בכתובת deepmind.google/models/gemini/ultra/ שמציגה עמוד מודל ולא עמוד תוכניות, או נתיב צאצא חדש models/gemini/ שמופיע לצד pro ו-flash.
• שורה של Gemini 4 Ultra שמופיעה באינדקס כרטיסי המודלים, וזו הדרך שבה גוגל מאשרת היסטורית שמודל קיים כארטיפקט מתועד.
• מזהה מודל שני ב-API של Gemini במרחב השמות gemini-4-*. ל-Argon אין כרגע אף אחד, כך שמזהה Pro או Ultra יהיה העדות הראשונה לכך שהמשפחה אמיתית.
• רשומה ברשימת המודלים של Artificial Analysis, או טבלת בנצ'מרק בעמוד המשפחה עם עמודה רביעית. שניהם עוקבים אחר ההשקות של Google מקרוב מספיק כדי להיות מוקדמים.
• פוסט הכרזה של Google I/O, Cloud Next או DeepMind שמשתמש במילה "family" בנוגע ל-Gemini 4. הפוסט של Argon לא.
עד שלפחות אחד מהדברים האלה יקרה, כתבה שטוענת ש-Gemini 4 Ultra בדרך היא תחזית שלבושה בבגדי דיווח. התייחסו אליה בהתאם, כולל כשהיא מגיעה מאיתנו.

קריאת סולם המחירים כהצהרת מדרג
התמחור הוא החלק היחיד בכך ש-Google פרסמה במכוון, עם הערת שוליים, והוא ההצהרה הברורה ביותר על כוונת השכבות בכל ההשקה. מחיר ההיכרות של Argon הוא $2 למיליון אסימוני קלט ו-$10 למיליון אסימוני פלט, כשקלט במטמון בהנחה של 95%, והערת השוליים הראשונה של Google עצמה אומרת שאחרי תקופת היכרות שהיא לא הצליחה להגדיר, "המחיר של $4 למיליון אסימוני קלט ו-$20 למיליון אסימוני פלט יחול."
קרא את שני הזוגות האלה מול השדה, וטענת הרמה נכתבת מעצמה.
• $4 / $20 הוא מחיר המחירון של Claude Opus 5.5. התעריף של Google לאחר תקופת ההשקה עבור Argon נופל בדיוק על המחירון של מוביל החזית הנוכחי, עבור מודל שנמדד חמש נקודות מאחוריו.
• $2 / $10 הוא רצועת המבצעים שבה נמצאים גם GPT-6 Sol וגם Claude Sonnet 5.5. תעריף ההיכרות של Argon הוא אותו $2 / $10, מה שמציב את תמחור ההשקה של Argon באותה רצועה כמו Sol מדרג ביניים ולא ברצועת החזית.
• $10 / $50 הוא המחיר שבו נמצאים גם Claude Fable 5.1 וגם GPT-6 Astra. Argon הוא חמישית ממחיר הקלט של Fable 5.1 וחמישית ממחיר הפלט שלה, והציון שלו נמצא במרחק של 0.8 ממנה.
• $0.75 / $3.75 זה Gemini 3.8 Flash. Argon הוא פי 2.7 מזה בקלט ופי 2.7 בפלט — עלייה מדורגת ונקייה, לא זינוק תלול.
אז Google תמחרה את Argon כמודל שמקומו מתחת ל-$10/$50 ומעל $0.75/$3.75, כשהוא עתיד להתייצב על $4/$20. שום דבר בסולם הזה לא אומר "חזית". הוא אומר "צמרת רצועת הביניים, עם מספר כותרת שיתייצב באותו תעריף שהמוביל גובה היום, תמורת פחות יכולת". זו בחירה מסחרית מוצדקת. זה לא התמחור של מודל שממוקם שני דרגים מעל כל דבר.
נקודה מבנית אחת שכדאי לזכור: מדרגת המחיר של Argon היא מדרגה אמיתית, שמוגדרת בהערת שוליים, וללא תאריך. משפחות Sonnet 5.5 ו-GPT-6 עושות משהו דומה עם מדרגות הקשר ארוך, ו-Sol עולה ל-$4/$15 מעבר ל-272K. המדרגה של Argon היא לפי זמן, לא לפי אורך הקשר — אותו $2/$10 חל על כל חלון ה-1M, ורק לוח השנה משנה את התעריף. זה מבנה יוצא דופן, והוא הופך כל השוואת עלויות מול Argon לתרגיל של שתי עמודות: איזו תקופה, ואיזה שימוש.
היכן Argon ניצב מול המתחרים, לפי המספרים שקיימים
ל-Artificial Analysis הייתה מדידה של Gemini 4 Argon שהייתה זמינה מהר מספיק כדי שזו תהיה ההערכה הבלתי־תלויה היחידה הזמינה. בגרסה העדכנית ל-1 באוקטובר — v4.3.2 — Argon משיג 52.56 במדד ה-Intelligence Index, כשהוא מוגדר במאמץ חשיבה גבוה. המודלים שסביבו אינם מדגם אקראי של התחום.
• Claude Opus 5.5 עומד על 57.62, כפי שנמדד במאמץ מקסימלי עם גיבוי. זה חמש נקודות ומשהו מעל Argon, וזה ראש הטבלה כרגע.
• Claude Fable 5.1 עומד על 53.35, כפי שנמדד במאמץ מרבי עם מנגנון גיבוי. Argon מפגר אחריו ב־0.79.
• GPT-6 Astra נמצא ב-52.67, נמדד במקסימום. Argon מפגר אחריו ב-0.11.
• Claude Sonnet 5.5 עומד על 55.98, גם מקסימום עם fallback. זהו מודל בדרג ביניים שמקבל ציון גבוה יותר מ-Argon ב-3.4 נקודות, וזה המספר שאמור להדאיג כל מי שנאחז בטענה ש״Gemini 4 Argon הוא המודל השני בטיבו בעולם״.
• GPT-6 Sol עומד על 47.63, כשהוא נמדד במקסימום, על חלון הקשר של 872K. Argon מקדים אותו ב-4.9.
• Gemini 3.8 Flash נמצא ב-40.93 במאמץ גבוה. Argon מקדים אותו ב-11.6.
• Gemini 3.1 Pro Preview עומד על 29.72. Argon מקדים אותו ב-22.8, וזה ההצהרה הברורה ביותר עד כמה שכבת ה-Pro שגוגל משחררת פיגרה אחרי המחקר שלה עצמה.
שלושה דברים נובעים מהרשימה הזו. ראשית, Argon נמצא באותה רמה כמו שני המתחרים, Fable 5.1 ו-Astra, ובבירור מאחורי שני מודלים של Anthropic — Opus 5.5, ובאופן מביך יותר, Sonnet 5.5. שנית, הפער בין Argon למודל הטוב ביותר ש-Google השיקה הוא הזינוק הבין-דורי הגדול ביותר בהרכב הנוכחי, ובפער ניכר. שלישית, הניסוח של הסיגנל ש"החזית מקדימה לפחות בשני דרגים" נכון במהותו אך מעט לא מדויק בגיאומטריה: יש דרג מודלים אחד שברור שמקדים את Argon (Opus 5.5 ב-57.6) ומודל שני בדרג זול יותר שגם הוא מקדים אותו (Sonnet 5.5 ב-56.0), וזו בעיה חדה יותר מלהיות שתי שליבות למטה בסולם ש-Argon נמצא עליו בפועל.
ההצגה של השוואת המחירים בשאלה המקורית — "המחירים מרמזים שזו המקבילה שלהם ל-Sol/Sonnet" — מתבררת כנכונה בערך לגבי מחיר ההשקה וכזו שטועה לגבי המחיר הסופי. Argon נפתח בתעריף של Sol ו-Sonnet 5.5 ומתייצב בתעריף של Opus 5.5. הוא מתומחר כמודל בדרג הביניים ששואף להפוך לכזה שמתומחר כמודל חזית, אך במדידה אינו עומד באף אחד מהשניים.
תמונת העלות לכל משימה היא המקום שבו Argon הוא החזק ביותר ושבו סיפור השכבות מקבל ממד שני. במשימת Index, Argon עולה $1.99 ופולט 142,374 טוקנים של פלט. Opus 5.5 עולה $5.98 ופולט 338,099. Sonnet 5.5 עולה $7.62 עבור 599,849. Fable 5.1 עולה $7.63 עבור 187,455. Astra עולה $3.26 עבור 68,691. Gemini 3.8 Flash עולה $1.24 עבור 154,230. Argon היא הדרך הזולה ביותר לקנות ציון הקרוב לחזית, והוא זול ממודל ה-Flash שמעליו בציון בפחות מדולר למשימה.
הגדרות המאמץ הן הכוכבית על כל האמור לעיל, והתחום אינו מדווח עליהן באופן אחיד. Argon נמדד ברמת high; Opus 5.5 ו-Fable 5.1 ו-Sonnet 5.5 ברמת max עם fallback; Astra ו-Sol ברמת max. הרצת מאמץ high והרצת מאמץ max אינן אותה מדידה, וסולם המאמץ של Anthropic עצמה מזיז מודל בכמה נקודות בין הגדרות. אם Argon, כשנמדד במאמץ max, משיג ציון משמעותית מעל 52.6, טיעון הדירוג משתנה. איש עדיין לא פרסם את אותה הרצה.
מה טוענת הטבלה של גוגל עצמה, ובמה היא שונה מהטבלה העצמאית
עמוד משפחת Gemini מכיל טבלת ביצועים שנכתבה על ידי Google עם ארבעה טורים — Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 — ותשע עשרה שורות בנצ'מרק. זו מערכת הטענות המפורטת ביותר ש-Google פרסמה עבור מודל זה, והיא כולה מדווחת על ידי הספק. קריאתה למול ה-Index העצמאי מאלפת בדיוק משום שהשניים אינם מסכימים לגבי צורת התחום.
• בטבלה של גוגל, Argon מנצח ב-13 מתוך 19 שורות באופן מוחלט או חולק את המקום הראשון, כולל Vals Index Knowledge work עם 68.9, AutomationBench עם 51.3, Harvey’s Legal Agent Benchmark עם 19.6, DeepSWE v1.1 עם 77.9, LABBench 2 עם 88.8, GraphWalks עם 99.7 לטווח ≤128K ו-84.2 לטווח 256K–1M, Agent’s Last Exam עם 39.5, LVBench עם 91.7 ו-Chartography עם 71.6.
• Claude Opus 5.5 מנצח בשורות שנקראות כמו הנדסה מתמשכת: FrontierSWE v2 ב-62.3 לעומת 55.0 של Argon, Terminal-bench 4.0 ב-66.4 לעומת 57.4, Terminal-Bench Science 0.1 ב-63.3 לעומת 57.6, ו-PostTrainBench ב-49.3 לעומת 45.3.
• GPT-6 Astra משיג 68.1 ב-Terminal-Bench Science 0.1 ו-72.6 בתת-הקבוצה הלא-מקוונת של OSWorld-2.0, ומשתווה ל-Argon ב-CWE-bench v1 עם 68.0. Claude Fable 5.1 מפסיד בכל שורה למעט תיקו משותף ב-Vibe Code Bench.
• באינדקס העצמאי, הסדר הוא Opus 5.5 ראשון, אחריו Sonnet 5.5, אחריו Fable 5.1, ואחר כך Argon ו-Astra למעשה באותה רמה. בטבלה של Google אין כלל עמודה של Sonnet 5.5, וזו ההשמטה המשמעותית ביותר בה: ארבעת העמודות של הטבלה נבחרו, והמודל שמדורג מעל Argon באינדקס במחיר נמוך יותר אינו ביניהן.
שום דבר מזה לא הופך את הטבלה של Google ללא ישרה. טבלאות בנצ'מרק של ספקים הן נבחרות, לא מדגמיות, וכך גם בכל מעבדה. זה הופך אותה לטענה ולא למדידה, וזה אומר שאי אפשר להכריע בשאלת הדרגה ממנה. המקום היחיד שבו הטבלה באמת נושאת משקל עבור המאמר הזה הוא בשלילה: תשע עשרה שורות, ארבע עמודות, ואין עמודה חמישית ל-Ultra.

הדבר האחד בנוגע ל-Argon שהוא בכלל לא שאלת דירוג
כל טיעון בדבר דרגות שלעיל מניח ש-Argon הוא מודל שתוכל בסופו של דבר לקרוא לו. כדאי להפריד זאת משאלת המיצוב, כי לשני הדברים יש תשובות שונות ורק אחד מהם עוסק ביכולת.
מגבלת טוקני הפלט של Argon היא מיליון טוקנים, עלייה מ-64K, ו-Google מצהירה על כך ישירות. זו תקרת פלט, לא חלון הקשר. ההבחנה חשובה כי השניים מבולבלים כל הזמן בסיקור ההשקה הזו, וכי מגבלת פלט של 1M היא טענה הנדסית שונה מחלון הקשר של 1M — הראשונה עוסקת בכמה זמן מסלול בודד יכול לרוץ, והשנייה בכמה אפשר לתת למודל בבת אחת. Google הייתה מפורשת לגבי מגבלת הפלט ושתקה לגבי חלון ההקשר. Artificial Analysis מתעד 1,000,000 טוקנים גם עבור ההקשר של Argon, אבל זהו שדה של העוקב ולא הצהרה של Google, אז התייחסו לשני המספרים ככאלה שמגיעים מחדרים שונים למרות שהם נראים זהים.
מה שבאופן חד-משמעי אינו זמין הוא גישה. Argon אינו זמין באופן כללי, הוא אינו נמצא ב-Gemini API תחת שום מזהה, והוא אינו נמצא בשום קטלוג של צד שלישי. הוא זמין למגיני סייבר מאומתים דרך Fairwind Program ולמהנדסים של Google עצמה, והשלב הבא ש-Google מכנה — "החל מלקוחות API בתשלום ומנויי Google AI Ultra" — אין לו תאריך. לא תוכל לבצע בנצ'מרק על המודל עם עומס העבודה שלך. לכן כל מספר במאמר זה הוא מדידה של מישהו אחר של מודל שאינך יכול להשתמש בו.
מה יגרום ל-Argon לעלות דרגה אחת?
שיפוט דירוג הוא תמונת מצב, ויש בערך חמישה דברים שישנו את זה, לפי סדר גס של מידת חשיבותם.
• ריצה שנמדדה באופן עצמאי במאמץ מרבי. Argon הוא כיום מדידת מאמץ גבוה של 52.56. סולמות המאמץ של Anthropic עצמה מזיזים מודל בכמה נקודות בין הגדרות, ואם המודל של Google מתנהג באופן דומה במאמץ מרבי, מיקומו האמיתי של Argon מול Fable 5.1 ו-Astra טוב יותר ממה שהמאמר הזה אומר. זהו השינוי היחיד בעל הסבירות הגבוהה ביותר.
• מקור מדידה שני. טראקר אחד הוא מדידה אחת. מעבדה עצמאית שנייה שתדרג את Argon בהרנס שלה תעשה יותר עבור טענת הדירוג מאשר כל שורת בנצ'מרק נוספת מ-Google.
• Gemini 4 Pro. אם Google תפתח את דרגת ה-Pro של דור ה-4 מתחת ל-Argon, המערך הופך למשפחה עם צורה, מעמדו של Argon מפסיק להיות ״היחיד״ ומתחיל להיות ״הפסגה מבין שלושה״, וכל טיעון בכתבה הזו על משפחה חסרה צריך להיכתב מחדש. שווה לעקוב אחריו, והוא קרוב יותר משאלת ה-Ultra.
• מחיר שאינו עולה מדרגה. אם תקופת ההיכרות פשוט לא תפוג לעולם — גוגל לא הגדירה מתי היא מסתיימת — המחיר האפקטיבי בייצוב של Argon הוא $2/$10 ולא $4/$20, והיתרון שלו בעלות למשימה לעומת Opus 5.5 מתרחב מבערך פי 3 לבערך פי 6. זהו אירוע מסחרי, לא אירוע של יכולת, אבל זה משנה איך נראית החלטת רכש.
• כרטיס מודל, כרטיס מערכת או עמוד מתודולוגיית הערכה של Argon. טבלת הביצועים מפנה לעמוד מתודולוגיה בדומיין של Google; כרטיס מודל מלא היה מכניס לתיעוד את חלון ההקשר, את תצורת הפריסה ואת מעטפת הבטיחות, והיה הארטיפקט הראשון שמאפשר למישהו מחוץ לקוהורט Fairwind לבדוק את המספרים של Google במקום לקרוא אותם.
לעומת זאת, הדבר שסביר ביותר שיוריד את Argon אינו בנצ'מרק כלל. אלא הדיווח של Bloomberg מ-30 בספטמבר, שציטט עובדי Google בעלי גישה למודל שאמרו שהוא מתפקד פחות טוב בעבודה אמיתית ממה שהציונים שלו מרמזים. הטענה הזו אינה מאומתת בידי איש מחוץ ל-Google, והיא אינה מדידה, אבל היא מהסוג של טענות שבנצ'מרק בלתי תלוי שני או יאשר או יחסל. עד אז היא נותרת בתיעוד כהאשמה עם כלי תקשורת מזוהה ומקורות אנונימיים, והיא שייכת לדיון על הדירוג, מפני שמודל שהפער שלו בין הביצועים בבנצ'מרק לביצועים בשטח שנוי במחלוקת לא ניתן לקדם אותו על סמך בנצ'מרקים בלבד.
מה זה אומר אם אתם בוחרים מודל החודש
אם מפשיטים מהטיעון המיצובי, התמונה המעשית פשוטה דיה כדי שפסקה אחת תספיק לה. Gemini 4 Argon הוא ה-Gemini הטוב ביותר שגוגל בנתה, והוא אינו זמין לכם, ולכן מודלי Google שאפשר לבחור ביניהם בפועל היום הם אלה שכבר שוחררו: Gemini 3.8 Flash, שמודד 40.93 במדד במחיר 0.75$/3.75$, ו-Gemini 3.1 Pro Preview, שמודד 29.72 במחיר 2$/12$. אם אתם צריכים Gemini עכשיו, זו הבחירה האמיתית, ו-Argon אינו ביניהם.
אם אתם בוחרים בין ספקים שונים ולא בתוך Google, שום דבר בהכרזה של Argon לא משנה את ההחלטה של היום. בראש ה-Index נמצא Claude Opus 5.5 עם 57.62, כאשר Claude Sonnet 5.5 עם 55.98 נמצא קרוב מאחוריו בחמישית מהתעריף על קלט ובחצי על פלט. ל-Gemini 4 Argon עם 52.56 אין מסלול לאפליקציה שלכם, כך שהוא אינו מועמד, טוב ככל שיהיה הציון בסופו של דבר.

OrcaRouter הוא API יחיד מול יותר מ-200 מודלים עם מחירי המחירון של הספקים שמועברים הלאה ללא תוספת מחיר ומעבר אוטומטי בין ספקים בעת כשל, מה שאומר שההחלטה להחליף מודל אינה מחייבת לשנות שום תשתית: המזהה בגוף הבקשה הוא כל השינוי. מודלי Google בקטלוג שלנו היום הם אלה ש-Google השיקה בפועל — google/gemini-3.8-flash, google/gemini-3.6-flash, google/gemini-3.5-flash וgoogle/gemini-3.1-pro-preview. Gemini 4 Argon אינו אחד מהם, ולא יהיה כל עוד אין לו מזהה מודל ציבורי ואין לו לוח תעריפים מפורסם, כך שאיש לא צריך לייחס טענת ניתוב למשהו מהאמור לעיל. כשגוגל תציע את Argon דרך API עם מזהה, זה יהפוך לשאלת ניתוב. עד אז, הגרסה הכנה של תשובת OrcaRouter היא שהיא עדיין אינה חלה, והדבר המועיל שהקטלוג עושה עבור ההחלטה המסוימת הזו הוא לאפשר לך לתמחר את המודלים שאפשר באמת לקרוא להם זה לצד זה בלי לפתוח ארבעה חשבונות כדי לגלות.
השורה התחתונה
Gemini 4 Argon הוא ספינת הדגל של Google, אך לא החזית שלה. הציון שלו במדד v4.3.2 של Artificial Analysis במאמץ גבוה הוא 52.56 — באותה רמה כמו Claude Fable 5.1 ו-GPT-6 Astra, חמש נקודות מאחורי Claude Opus 5.5, ומאחורי Claude Sonnet 5.5, מודל זול יותר ממעבדה מתחרה. Google תמחרה אותו ב-$2/$10 במחיר היכרות, כשהמחיר עולה ל-$4/$20, מה שממקם את התעריף הסופי שלו בדיוק על זה של Claude Opus 5.5 עבור יכולת פחותה באופן מדיד. היתרון של 11.6 נקודות שלו על Gemini 3.8 Flash הוא הפער הבין-דורי הרחב ביותר בהיצע של Google עצמה, והוא הראיה החזקה ביותר לכך שדור Gemini 4 הוא קפיצת מדרגה אמיתית ולא מיתוג מחדש.
בשאלה שהציתה את כל זה: אין Gemini 4 Ultra. נתיב ה-Ultra של Google בדומיין שלה מפנה לעמוד תוכניות מנוי, אינדקס כרטיסי המודלים אינו מכיל רשומת Gemini 4 כלל, כל תבנית URL של הכרזה לפוסט על Gemini 4 Ultra מחזירה 404, ופוסט ההשקה מכריז על מודל אחד בלי להבטיח משפחה. זהו ממצא אמיתי וזו ראיה ממקור ראשון ולא הסקה, אבל זו גם עובדה עם זמן מחצית חיים קצר — תגובת 200 אחת בנתיב אחד הופכת אותה, ודרגת ה-Pro של דור Gemini 4 היא זו שסביר יותר שתופיע ראשונה.
שתי הסתייגויות שכדאי לקחת מהכתבה הזו. כל מספר של Argon כאן הוא מדידה שמישהו אחר עשה של מודל שאיש מחוץ לקבוצת מגני סייבר מאומתת אינו יכול לקרוא לו, והטבלה של Google עצמה בת תשע עשרה שורות היא הצהרה ולא מדידה — שימושית במה שהיא, ואינה תחליף ל-Index העצמאי. והכרעה ההוגנת בשאלת הרמה היא זמנית: Argon נמדד במאמץ גבוה, לא במקסימום, והרצה במאמץ מקסימלי היא הדרך הזולה ביותר האפשרית לכך שהכתבה הזו תהיה שגויה.
השוואות במאמר הזה4
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
