
Gemini 4 Argon ב-FrontierSWE: הוא צועק "אאוריקה!", ואז מדרג את שיעורי הבית של עצמו
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 261 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- xAISpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
ל-Gemini 4 Argon יש בעיית אישיות, וזה הדבר המעניין ביותר שמישהו אמר על המודל מאז ש-Google הכריזה עליו ב-2026-09-30. בבנצ'מרק FrontierSWE לאופק ארוך במיוחד, המודל שסיים שלישי — אחרי GPT-6 Astra ו-Claude Opus 5.5 — הותיר על מעריכיו רושם בלתי נשכח: המילה האהובה עליו היא "Eureka!", והוא מבלה חלק ניכר מתקציב המשימה בן עשרים השעות בקשות קיצונית במיוחד כלפי עצמו. זו תצפית סמוכה־להדלפה, ממקור יחיד, של מפעיל בנצ'מרק, לא טענה של ספק ולא הערת שחרור, וכדאי לדייק לגבי מה היא כן ומה היא לא אומרת לך. לאף אחד משלושת המודלים לעיל אין תאריך GA עבור Argon המצורף אליו; התצפית עוסקת בהתנהגות בתוך מערכת הרצה, והמספרים שמגיעים איתה הם המדידה הבלתי־תלויה הראשונה של Argon בבנצ'מרק ש-Google לא מפעילה בעצמה.
מהי בעצם ההערה "אאוריקה!"
המקור הוא פוסט מאת @nrehiew_, מהנדס העוסק בהערכת מודלים, שפורסם ב-2026-09-30, ומצטט את הכרזת Gemini 4 Argon של סונדאר פיצ'אי. תוכן הדברים הוא שלוש טענות: Argon הוא המודל המשעשע ביותר שהם העריכו ב-FrontierSWE; המילה האהובה עליו היא "Eureka!"; והוא ביקורתי מאוד כלפי עצמו. המפרסם מתאר אותו כשיפור גדול לעומת דגמי Gemini קודמים, תוך שמירה על אותה אישיות, ומכנה אותו מרשים.
קרא את זה בקפידה, כי קל לפרש זאת יתר על המידה. זוהי התרשמות של מעריך אחד מצפייה בטרייסים של סוכנים, לא תוצאה מדורגת, לא מדד מפורסם, ולא משהו ש-Proximal Labs — שבונים ומפעילים את FrontierSWE — שמו עליו את שמם כממצא. אין עמודת "ביקורת עצמית" בלוח המובילים. מה שהופך את ההערה לראויה לכתיבה אינו שהיא סמכותית; אלא שהיא הקריאה האיכותית היחידה שמישהו מחוץ ל-Google הציע על Argon, ומכיוון שהמודל אינו זמין באופן כללי, טרייסים כמו אלה הם כיום הדרך היחידה לראות את הדבר מתנהג.
זה גם נוגע בשאלה אמיתית לכל מי שמתכנן להפעיל את Argon כסוכן. ריצות קידוד בטווח ארוך הן בעיקר בעיית ניהול תקציב: מודל שמפריע לעצמו כדי לשקול מחדש, שמדרג את העבודה הביניימית של עצמו, ומכריז על פריצות דרך, הוא מודל שמוציא טוקנים על תהליך. אם זה יתרון או נטל תלוי לחלוטין בשאלה אם הביקורת העצמית מתכנסת או נכנסת ללופ. מעריך יחיד שאומר "מרשים" הוא נקודת נתונים, לא תשובה.
FrontierSWE v2, ולמה המקום השלישי הוא הסיפור האמיתי
FrontierSWE אינו מסוג הבנצ'מרק שאפשר לקרוא ממנו מספר כותרת. הוא נבנה על ידי Proximal Labs ומתואר במאגר שלהם כבנצ'מרק לסוכני קידוד בעלי אופק ארוך במיוחד, שבוחן מימוש, הנדסת ביצועים ומחקר ML. גרסה 2 יצאה בספטמבר 2026 עם 21 משימות חדשות בנוסף לסט המקורי, ובסך הכול 34, והיא מצפה שסוכן ימשיך לעבוד עד עשרים שעות. הכול מופעל דרך ההרנס של Proximal עצמה, proximus, שנבנה על mini-swe-agent ומוסיף דחיסת הקשר, ראייה וכלי הגשה מפורש. הניקוד הוא mean@5 — הממוצע של חמישה ניסיונות לכל משימה — כאשר רצועת אי-הוודאות המדווחת נפרשת מהממוצע של הריצה הגרועה ביותר של כל משימה ועד לממוצע של הריצה הטובה ביותר שלה.
המתודולוגיה הזו חשובה לקריאה כנה של השורה של Argon:
• ניקוד — Gemini 4 Argon 55.0% mean@5, ±9.9, לעומת GPT-6 Astra 65.5% ו-Claude Opus 5.5 62.3%
• פיזור — טווח הריצות של Argon נע בין 44.5% (worst@5) ל-64.3% (best@5), טווח שחופף לטווח 52.0%–71.5% של Opus 5.5 בקצה העליון, אך אינו חופף כלל לטווח 55.1%–73.0% של Astra.
• עלות לניסוי — Argon $129.36, Opus 5.5 $98.87, Astra $1,029.65
• זמן שעון קיר לכל ניסוי — Argon 10.6 שעות, Opus 5.5 14.2 שעות, Astra 12.1 שעות
הדבר הראשון שאתה שם לב אליו הוא ש-Argon במקום השלישי, והיא לא קרובה למקום השני בניקוד. הדבר השני — זה שאמור להכריע אם אכפת לך — הוא שבנצ'מרק הזה Argon נשלטת באופן מוחלט על ידי Claude Opus 5.5. Opus 5.5 קיבל ניקוד גבוה יותר (62.3% לעומת 55.0%) ועלה פחות לכל ניסוי ($98.87 לעומת $129.36). אין כאן ציר שבו Argon מנצחת. היתרון היחיד שלה הוא זמן: 10.6 שעות לעומת 14.2 של Opus 5.5, וזה ממשי אם אתה משלם על זמן שעון ולא על טוקנים, וחסר חשיבות אם אתה משלם לפי תקציב לכל ניסוי.
ללוח התוצאות של Proximal עצמו יש הערת שוליים לצד השורה של Argon שכל מי שמצטט את המספר הזה צריך לחזור עליה: "Gemini 4 Argon: שיעור פגיעות המטמון נמוך בהרבה בגלל הגדרה שאינה בסביבת ייצור." כלומר, המעריכים מסמנים שהריצו את Argon מחוץ לתצורה שבה פריסת ייצור הייתה משתמשת, מה שמנפח את העלות שלו, וככל הנראה גם את השהיה שלו. זוהי הסתייגות מנתון העלות במיוחד, וזו הסיבה שיש לקרוא את $129.36 כגבול עליון ולא כמחירון.
המספר שהתרשים של גוגל עצמה לא מציג
כאן איסוף המקורות הופך למעניין באמת, וכאן רוב הכתבות על התוצאה הזו ישגו. פוסט ההכרזה של Google כולל תרשים בנצ'מרק עם שורה של FrontierSWE v2. בשורה הזו כתוב: GPT-6 Astra 65.5%, Claude Fable 5.1 56.3%, Claude Opus 5.5 62.3%. Gemini 4 Argon לא מופיע בה. לוח הדירוג החי של Proximal מציג את Astra ב-65.5% ואת Opus 5.5 ב-62.3% — אותם נתונים — אבל מציב את Claude Fable 5.1 ב-56.5%, ולא ב-56.3%, ומציין את Gemini 4 Argon ב-55.0%.
הסיבה להשמטה אינה מסתורית, וגוגל עצמה אומרת זאת: ההערות המתודולוגיות הנלוות לחבילת ההערכה שלה קובעות כי תוצאות FrontierSWE מדווחות מהלוח הציבורי הרשמי של Proximal. גוגל לא חישבה בעצמה את המבחן הזה. היא מצטטת את אותו צד שלישי שאנחנו מצטטים, והנתון היחיד של Argon שאותו צד שלישי מפרסם הוא 55.0%. לכן הקריאה הישרה היא שציון ה-FrontierSWE של Argon הוא מדידה עצמאית באמת — Proximal הריצו אותו, בהארנס שלהם, על המשימות שלהם — ושהוא ממקם את Argon מאחורי שני מתחרים.
כל השאר בגרף של Google מדווח על ידי הספק וצריך לתייג אותו כך בראש שלך: Argon 63.1% ב-Vals Index לעומת 67.0% של Opus 5.5, 41.4% ב-AutomationBench לעומת 42.5% של Opus 5.5, 89.6% ב-Vibe Code Bench לעומת 90.3% עבור גם Astra וגם Opus 5.5, 87.5% ב-LVBench לעומת 83.7%, 68.0% ב-CWE-bench v1 לעומת 67.0% של Opus 5.5. אלה ההרצות של Google של ההערכות הנבחרות של Google. שורת FrontierSWE היא היחידה בתמונה הזו שקורא יכול לבדוק באופן עצמאי, וזו בדיוק הסיבה לכך שהתוצאה במקום השלישי נושאת משקל רב יותר מדפוס התיקו או הניצחון הקל סביבה.
מה ש-Artificial Analysis אומרת, באופן עצמאי
FrontierSWE היא עדשה אחת. Artificial Analysis היא האחרת, והיא מסכימה עם צורת הסיפור. במדד Intelligence Index v4.3.2 שלהם, Gemini 4 Argon בתצורת החשיבה הגבוהה שלו משיג ציון 52.56 — נמדד באופן עצמאי על החומרה שלהם, לא דווח על ידי Google — במחיר מחירון של $2.00 למיליון טוקני קלט ו-$10.00 למיליון טוקני פלט, עם הנחה של 95% על קלט שמור במטמון. המדידה שלהם מציבה את העלות של משימת אינדקס בודדת על $1.99.
ההשוואה שחשובה היא אותה השוואה שהפיק FrontierSWE. Claude Opus 5.5 בתצורה הגבוהה שלו מקבל ציון גבוה יותר במדד, 53.58, בעלות נמוכה יותר לכל משימה, 1.82$. שני מעריכים בלתי תלויים, המשתמשים במשימות שונות ובהרנסים שונים, מציבים את Argon מאחורי Opus 5.5 הן באיכות והן בעלות. זה אות עקבי ולא תוצר בנצ'מרק בודד, והוא הדבר החזק ביותר שאפשר לומר כעת על הכלכלה של Gemini 4 Argon.

הוכרז, לא שוחרר — ולמה המסגור הזה אינו בגדר פדנטיות
אין מזהה מודל בשם Gemini 4 Argon. הגישה נפרסת בהדרגה דרך תוכנית Fairwind למגני סייבר שעברו סינון, לצד פתיחה מדורגת ללקוחות API בתשלום ולמנויי Google AI Ultra, ללא תאריך זמינות כללית שפורסם. הפוסט של גוגל הוא הכרזה על מודל ועל מערכת של הערכות, ולא השקה של נקודת קצה שאפשר לפנות אליה. אם קראת סיקור שתיאר זאת כהשקה, הרי שהסיקור הזה מקדים את העובדות.
להבחנה הזו יש השלכות מעשיות על כל מי שקורא את הנתון של FrontierSWE. ההערכה הורצה מול מודל שהיה ל-Proximal גישה אליו במסגרת איזשהו הסדר; היא מספרת לך מה המודל מסוגל לעשות, לא מה שאתה יכול לקבל. היא גם אומרת שלנתוני הביצועים יש זמן מחצית חיים קצר מהרגיל. מודל שעדיין לא ב-GA יכול עדיין להשתנות — הגדרות פענוח, הנחיות מערכת, ברירות מחדל לשימוש בכלים ותשתית בטיחותית עדיין מכווננים, והסיבה המוצהרת לכך ששיעור הפגיעות במטמון של Argon היה נמוך היא בדיוק שהמעריכים לא הריצו תצורת ייצור. צפה ש-55.0% וה-$129.36 יזוזו.
מה היה משנה את התמונה הזאת: מזהה מודל מפורסם עם מחירון, תאריך GA, הרצה חוזרת של FrontierSWE בהגדרות פרודקשן, ומעריך בלתי תלוי שני שמשחזר את תוצאת המקום השלישי. עד שלפחות שני הראשונים מביניהם יהיו קיימים, התייחס לכל מספר של Argon — כולל הטובים שבגרף של Google עצמה — כאל זמני.

קריאת האישיות היא החלק שיתיישן הכי טוב
לציוני בנצ'מרק של מודל טרום-GA יש חיי מדף הנמדדים בשבועות. לתצפית ההתנהגותית אין. עבודת סוכנים בטווח ארוך היא המקום שבו האופי של המודל באמת מתגלה, כי תקציב של עשרים שעות עם 34 משימות הוא חבל ארוך מספיק כדי שנטיותיו של מודל ילכו ויצטברו: איך הוא מתאושש מגישה כושלת, האם הוא עוצר כדי לתכנן מחדש, האם הוא מצליח להבחין בין בעיה קשה לבין פנייה שגויה. מעריך שצופה בהרבה מהעקבות האלה ומתאר מודל כבעל ביקורת עצמית ונוטה לקרוא בהתרגשות כשמשהו עובד מתאר מודל שמחצין את הנמקתו לגבי ההתקדמות של עצמו. זו השערה לגבי הסיבה לכך שהריצות של Argon התפרסו מ-44.5% ל-64.3% — טווח רחב יותר מזה של Opus 5.5 — והיא ניתנת לבדיקה ברגע שניתן יהיה להפעיל את המודל.
החצי השני של ההערה הוא החלק שצריך לפקפק בו. "שיפור גדול לעומת הג'מיני הקודמים" הוא השוואה למודלים שמעולם לא קיבלו ציון בבנצ'מרק הזה תחת רתמת הבדיקות הזו, ולכן אי אפשר לבדוק אותה מול טבלת הדירוג כלל. זה רושם, ויש להתייחס אליו ככזה, יהיה האדם שמציע אותו מהימן ככל שיהיה.

לאן זה משאיר אותך אם אתה באמת צריך סוכן לטווח ארוך היום
אי אפשר לקרוא ל-Gemini 4 Argon, ולכן השאלה המעשית אינה Argon מול משהו אחר — אלא איזה מודל עליך להריץ עבור העבודה שעליה נבחן Argon. הדירוג של FrontierSWE עצמו עונה על כך: GPT-6 Astra בראש הטבלה עם 65.5%, אך במחיר של $1,029.65 לכל ניסוי, בערך פי עשרה מהעלות של שני המודלים שמתחתיו, בעוד Claude Opus 5.5 מספק 62.3% תמורת $98.87. הבחירה המשתלמת במבחן הזה היא Opus 5.5, והוא גם המודל שהביס את Argon ב-Artificial Analysis בעלות נמוכה יותר לכל משימה.
שני המודלים האלה, ורוב עשרת המובילים של הלוח — ובהם GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp ו-Muse Spark 1.2 — ניתנים לניתוב דרך ה-API היחיד של OrcaRouter לצד יותר מ-200 אחרים — מפתח אחד, 0% תוספת מחיר, כך שמחיר המחירון של הספק הוא מה שאתם משלמים, והורדת מחיר מצד ספק נכנסת לתוקף אצלנו באותו היום. התכונה האחרונה שווה יותר מהרגיל במודל שלפני השקה כללית: אם התמחור של Argon ישתנה בין עכשיו להשקה, מה שהערת השוליים על המטמון שאינו לייצור מרמזת שייתכן, שום דבר באינטגרציה שלכם לא משתנה כשזה יקרה. מעבר אוטומטי בין שרתים (failover) הוא החלק הנוסף שמתאים למקרה הספציפי הזה — מודל לא מוכר שאיש עוד לא מיפה את אופני הכשל שלו הוא בדיוק מה שאתם לא רוצים על נתיב ייצור יחיד ומקודד קשיח.
כדי להבהיר דבר אחד: Gemini 4 Argon אינו בקטלוג שלנו. חיפוש מול ה-API הציבורי שלנו למודלים עבור google/gemini-4-argon מחזיר "model not found", וגם אף אחד אחר לא מארח אותו — הגישה אליו מוגבלת מאחורי תוכנית Fairwind של Google ללא מזהה מודל שפורסם. כשהוא יהפוך לזמין לקריאה, ננתב אותו, ונתוני FrontierSWE שלמעלה הם הסיבה לצפות ליום הזה במקום להמתין לו. המודלים שהוא הפסיד להם כבר נמצאים שם.
מה לצפות
האותות שהיו הופכים את זה מ'מה שאנחנו יודעים עד כה' להחלטה הם ספציפיים. מזהה מודל שפורסם והמחירון שלו. תאריך זמינות כללית. הרצה חוזרת של FrontierSWE תחת הגדרות ייצור, אשר תכריע אם העלות של $129.36 לניסוי היא תעריף אמיתי או ארטיפקט של תצורת המטמון שסומנה על ידי Proximal. וּבאופן אידיאלי, מעריך שני שמפרסם עקבות Argon כך שתצפית ה'אאוריקה!' תפסיק להיות מדגם בגודל 1.
עד אז, הסיכום הכנה הוא מצומצם וכדאי להחזיק בו: Gemini 4 Argon הוכרז, הוא אקספרסיבי באופן יוצא דופן בעקבות סוכן ארוכי טווח לפי מעריך אחד, ובמבחן העצמאי היחיד שאנחנו יכולים לבדוק הוא סיים שלישי אחרי שני מודלים — שאחד מהם ניצח אותו בניקוד ובעלות בו־זמנית.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
