כרטיס כותרת הירו עם הכיתוב "Gemini 4 Argon לעומת Claude Opus 5.5 — הפיצול בבנצ'מרק", עם רצועת תאריכים עם הכיתוב "Argon הוכרז 2026-09-30" ו-"Opus 5.5 שוחרר 2026-09-22", תג עם הכיתוב "Argon: פיילוט מוגדר, לא זמינות כללית", ושורת פוטר עם הכיתוב "נתוני Argon כפי שדווחו על ידי הספק; נתוני האינדקס של שני המודלים לפי Artificial Analysis."
Guides & Insights

Gemini 4 Argon נגד Claude Opus 5.5: הפיצול בבנצ'מרקים שאיש לא ציפה לו

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Gemini 4 Argon ו-Claude Opus 5.5 חלוקים בדעתם לגבי מי טוב יותר, והמחלוקת אינה רעש. במדד Intelligence Index של Artificial Analysis השניים מרוחקים זה מזה בחמש נקודות לטובת Opus 5.5. במדד Vals Index — לוח ההשפעה הכלכלית המשוקלל לפי תמ"ג — Gemini 4 Argon ניצב במקום הראשון ו-Claude Opus 5.5 ניצב במקום השלישי, אחרי גם Argon וגם Claude Sonnet 5.5. שני הלוחות מדדו את אותם שני מודלים באותו שבוע. זה כל המאמר: איזה מהם כדאי לכם לבחור תלוי בשאלה אם העבודה שלכם נראית יותר כמו שאלת בחינה או כמו יום שלישי במשרד עורכי דין, ובשאלה אם יש לכם גישה ל-API של Argon בכלל, שנכון להיום כמעט לאף אחד אין.

גוגל הכריזה על Gemini 4 Argon ב-30 בספטמבר 2026 בפוסט של DeepMind המיוחס ל-Koray Kavukcuoglu, סמנכ"ל בכיר ב-Google DeepMind וארכיטקט ה-AI הראשי. Anthropic שחררה את Claude Opus 5.5 שמונה ימים קודם לכן, ב-22 בספטמבר 2026. אחת מהן היא גרסת GA שאפשר לפנות אליה כבר אחר הצהריים. האחרת היא פריסה מדורגת לקבוצה מוגדרת בשם של מגיני סייבר בתוספת המהנדסים של גוגל עצמה, עם כוונה מוצהרת להגיע אל "לקוחות API בתשלום ומנויי Google AI Ultra" ברגע שמנגנוני הבטיחות יהיו מוכנים, וללא תאריך מצורף לכך.

התשובה בשורה אחת, לפני הפירוט

אם אתה זקוק להסקה כללית מדודה מהטובות ביותר כיום, ואתה זקוק לה במפתח פרודקשן, Claude Opus 5.5 זמין ב-OrcaRouter כבר עכשיו, ו-Gemini 4 Argon אינו נמצא באף API ציבורי. אם אתה בונה עבור סוכנים פיננסיים, משפטיים, מיסויים או סוכני קוד שמקבלים ציון לפי תפוקה כלכלית לדולר, המספרים של Argon טובים יותר, ומחירו לכל משימה הוא חמישית מזה של Opus 5.5 בלוח היחיד שמודד בדיוק את זה. אם אתה עוסק בהגנת סייבר לתשתיות קריטיות, ל-Argon יש תוכנית שאפשר להגיש אליה בקשה, והתשובה עשויה להיות כן.

מהיכן מגיע כל מספר למעשה

שני לוחות מדדים, שתי מתודולוגיות, וראוי להיות מדויקים לגבי מה הוא מה, משום ששני המחנות יצטטו זה מעל ראשו של זה במשך חודשים.

• Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5 עם 57.6 ו-Gemini 4 Argon עם 52.6, שניהם נלקחו מ-Artificial Analysis ב-2026-09-30. זהו מדד משולב של עשר הערכות, שמכוון בכוונה להיות כללי מבחינת המשימות, והוא הלוח שרוב האנשים מצטטים בתור "הדירוג".

• מדד Vals, עודכן ב-2026-09-29 — Gemini 4 Argon ראשון עם 68.90% (±0.97), Claude Sonnet 5.5 שני עם 67.04% (±0.92), Claude Opus 5.5 שלישי עם 66.97% (±0.89). Vals נותן משקל למשימות פיננסים, קידוד, משפט ומיסים לפי חלקו של כל סקטור בתמ"ג האמריקאי, כך שמודל בינוני בחידות אך מצוין בסקירת חוזים ובעבודה עם גיליונות אלקטרוניים מקבל ציון גבוה כאן.

פער AA של חמש נקודות הוא אמיתי והוא אינו קטן. פער Vals של שתי נקודות הוא גם אמיתי, ועם רווחי הסמך שמודפסים בלוח המובילים, 68.90 ±0.97 של Argon מול 66.97 ±0.89 של Opus 5.5 הוא הפרש של בערך 1.5 שגיאות תקן — טוב יותר מהטלת מטבע, אך רחוק מלהכריע. אף אחד מהלוחות אינו שגוי. הם מודדים משימות שונות.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, Vals Index 68.90% (rank 1), price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, throughput 48.9 tok/s. Claude Opus 5.5 reads: AA Intelligence Index 57.6, Vals Index 66.97% (rank 3), price $4 / $20, cost per index task $5.98, output ceiling 128K tokens, throughput 92.2 tok/s. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis on 2026-09-30.

הסתייגות אחת בנוגע לתצורה, והיא פועלת נגד קריאת פער ה-AA כהשוואת מודלים טהורה. Artificial Analysis מציגה בתרשים את Gemini 4 Argon בהגדרת המאמץ הגבוה שלו, ואת Claude Opus 5.5 ב"הסקה אדפטיבית, מאמץ מרבי, ברירת מחדל". אלה אינן אותה נקודה בשני סולמות המאמץ, ולכן הכותרת של 57.6 מול 52.6 אינה השוואה שקולה בתקציבי הסקה מותאמים. זה המספר ששני העמודים מפרסמים, וזה המספר שכדאי לצטט אם אתה הוגן כלפי Anthropic, אבל זה לא ניסוי מבוקר.

העלות לכל משימה היא המקום שבו הפער נעשה לא נוח

Artificial Analysis גם מפרסמת דיווח חשבונאי על מה שעלה להריץ את חבילת המדדים שלה, וכאן שני המודלים אינם קרובים זה לזה.

• עלות לכל משימת אינדקס — Gemini 4 Argon $1.99 לעומת Claude Opus 5.5 $5.98.

• עלות הרצת כל חבילת האינדקס — Gemini 4 Argon $2,407 לעומת Claude Opus 5.5 $8,708.

• מחיר מחירון למיליון טוקנים — Gemini 4 Argon $2 קלט / $10 פלט (תעריף ההיכרות המוצהר של Google, כשקלט שמור במטמון בהנחה של 95%, כלומר $0.10) לעומת Claude Opus 5.5 $4 קלט / $20 פלט.

• תפוקה — Gemini 4 Argon 48.9 אסימוני פלט לשנייה, האסימון הראשון לאחר 2.79 שניות; Claude Opus 5.5 92.2 אסימוני פלט לשנייה אך השהיית אסימון ראשון של 702 שניות על אותה ערכת בדיקה, וזהו מס החשיבה המורחבת שמתגלה בגלוי.

• עלות Vals לכל הרצה — Gemini 4 Argon ‏$15.68 לעומת Claude Opus 5.5 ‏$32.14 על אותה קבוצת משימות משוקללת לפי תמ״ג.

יש פרט מטריד שראוי לסמן ולא להחליק עליו: לוח הדירוג של Vals מפרט את התעריפים של Argon כ-4$ לקלט / 20$ לפלט, בעוד שההודעה של Google מציינת 2$ לקלט / 10$ לפלט לתקופת ההיכרות. הפרשנות הסבירה ביותר היא ש-Vals מציג תעריף מחירון סטנדרטי ו-Google מציג תעריף מבצעי, אבל זו הסקה ולא הצהרה שפורסמה על ידי מי מהצדדים. אם התקציב שלך תלוי במספר הזה, שאל את Google.

מה Argon טוען ומה נבדק

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst reading that Gemini 4 Argon delivers frontier performance in complex workflows across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

הפוסט של גוגל עמוס בנתונים, וכל אחד מהם מדווח על ידי הספק. לא הצלחתי למצוא אף אחד מהם ששוחזר באופן עצמאי, והלוחות העצמאיים שלמעלה מודדים דברים שונים מאלה שגוגל בחרה להבליט. מובא כטענותיה של גוגל עצמה:

• DeepSWE v1.1 — 77.9%, המתואר כרף חדש של מצוינות בהנדסת תוכנה ארוכת טווח בעולם האמיתי.

• הבנת וידאו ארוך — LVBench — 91.7%, מתואר כברמה המתקדמת ביותר.

• AutomationBench (הבנצ'מרק של Zapier למשימות עסקיות מקצה לקצה) — מקום #1 עם 51.3%.

• תיקון פגיעויות ב-CWE-bench v1 — מקום ראשון במשותף עם 68%, בהתבסס על התוצאה של Gemini 3.8 Flash Cyber בלוח v0.

• Gray Swan Indirect Prompt Injection — מתואר כמוביל, ללא נתון שפורסם בפוסט.

• Vals Finance Agent v2 ו-Harvey's Legal Agent Benchmark — מתוארים כמובילים, ובדומה לכך ללא מספר מודפס בהודעה.

שתי משפחות הטענות שכן זוכות לתמיכה בלתי תלויה הן אלה שכדאי לסמוך עליהן ביותר: Vals מאשרת את מיקום האינדקס עם נתון וטווח, ו-Artificial Analysis מאשרת אינדקס של 52.6 ואת המחיר. אנקדוטות הפרודוקטיביות הפנימיות — שיפור של 40% לעומת קו בסיס שפורסם בתת-שגרה קוונטית, יותר מ-300 TiB של זיכרון ששוחררו ברחבי הצי של Google על ידי סוכני Argon — הן תוצאות פנימיות של החברה ללא בדיקה חיצונית, ויש לקרוא אותן ככאלה.

מה זה Opus 5.5, אם חיית מתחת לאבן

Claude Opus 5.5 הוא דגם הדגל של Anthropic: הקשר של 1M טוקנים, פלט מקסימלי של 128K, קלט מולטימודלי בטקסט, תמונה וקובץ, חשיבה מורחבת, שימוש בכלים ופלטים מובנים. הוא החליף את Claude Opus 5 ב-2026-09-22, והכותרת הבולטת של ההשקה שלו הייתה, אפשר לטעון, הורדת המחיר — הדרגה ירדה ולא עלתה, במחיר של $4/$20 עם קריאות מהמטמון ב-$0.20. הוא ניתן לניתוב ב-OrcaRouter כבר היום בדיוק בתעריף הזה, ומחיר המחירון של הספק מועבר הלאה עם אפס תוספת, ושינוי מחיר של ספק מגיע לצד שלנו באותו היום שבו הוא מגיע לצד שלהם.

בציונים ברמת המשימה שיש לשני המודלים, התמונה היא נדנדה אמיתית ולא ניצחון מוחץ:

• Terminal-Bench 4.0 — Claude Opus 5.5 59.6% לעומת Gemini 4 Argon 57.1%.

• SciCode — Claude Opus 5.5 66.9% לעומת Gemini 4 Argon 61.8%.

• המבחן האחרון של האנושות — Claude Opus 5.5 61.4% לעומת Gemini 4 Argon 57.1%.

• חשיבה בהקשר ארוך — Claude Opus 5.5 84.7% לעומת Gemini 4 Argon 79.7%.

• CritPt — Claude Opus 5.5 31.7% לעומת Gemini 4 Argon 27.1%.

• יודע-כל — Claude Opus 5.5 46.4 לעומת Gemini 4 Argon 42.4.

• GDPval — Claude Opus 5.5 1,846 לעומת Gemini 4 Argon 1,611.

• AutomationBench-AA — Gemini 4 Argon 77.5% לעומת Claude Opus 5.5 69.5%. זהו ציון המשימה היחיד ראש-בראש שבו Argon מנצח בבירור, והיא גם משפחת המשימות הקרובה ביותר למה שה-Vals Index מתגמל.

אז הדפוס עקבי: Opus 5.5 מוביל בסולם החשיבה בעל הנופך האקדמי, ו-Argon מוביל בביצוע משימות מקצה לקצה. זה כבר לא סתירה בין שני הלוחות. זה אותו ממצא, מבוטא פעמיים.

היכולת שאף אחד לא משווה לפיה

תקרת הפלט של Gemini 4 Argon היא 1,000,000 טוקנים בפלט בודד, לעומת 64K בדור הקודם. הפלט של Claude Opus 5.5 מוגבל ל-128K. לשניהם חלון הקשר של 1 טוקן, אך הקשר ופלט הם תקציבים שונים, וזהו הזינוק הגדול ביותר במפרט בודד בהכרזה.

האם זה משנה תלוי לחלוטין במה שאתה מריץ. תקרת פלט של 128K היא נדיבה עבור צ'אט, סקירת קוד, חילוץ מובנה וצעדי סוכן. היא קיר קשה עבור יצירת סט תיקוני מיגרציה שלם, דוח ביקורת מלא, או מסמך ארוך במעבר אחד — זרימות העבודה ש-Google בחרה להמחיש איתן את ההשקה. אם הצינור שלך משרשר עשרים קריאות כדי להישאר מתחת לתקרה, התקרה של Argon תחסוך לך השהיה וקוד תזמור. אם לא, אתה משלם על מרווח שלא תשתמש בו.

זמינות היא המשתנה המכריע, לא איכות

זהו החלק בהשוואה שאין לו מדד מצורף, והוא חשוב יותר מכולם.

Gemini 4 Argon אינו זמין באופן כללי. הפוסט של Google אומר שהוא מושק למגני סייבר מהימנים דרך תוכנית Fairwind, שהחברה מעורבת בתהליך הגישה המרצון של ממשלת ארה״ב למודלים לפני שחרורם, ושגישה רחבה יותר למפתחים, לארגונים ולצרכנים תגיע "בהקדם האפשרי", החל מלקוחות API בתשלום ומנויי Google AI Ultra. אין מזהה מודל, אין נקודת קצה, אין מכסה מפורסמת ואין תאריך. הוא אינו נמצא בקטלוג שלנו והוא גם אינו נמצא ב-API הציבורי של אף אחד אחר, כך שדף תמחור עבור Argon עדיין אינו קיים.

Claude Opus 5.5 יוצא היום. ב-OrcaRouter הוא anthropic/claude-opus-5.5, נגיש דרך אותה נקודת קצה תואמת OpenAI כמו יותר מ-200 המודלים האחרים בקטלוג, עם מעבר אוטומטי בין ספקים כשנתיב אחד נחלש, וגם DSL לניתוב למקרים שבהם רוצים לשלוח חלק מהתעבורה ל-Opus 5.5 ואת השאר למקום אחר באותו מפתח. בלי חוזה נוסף, בלי SDK נוסף.

A capture of the OrcaRouter model page for Anthropic: Claude Opus 5.5, showing the Anthropic provider, a release date of 2026-09-22, a 1,000,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $4.00 input / $20.00 output per million tokens with cache reads at $0.20 and cache writes at $5.00.

ההמלצה המעשית לחודש הקרוב אינה זוהרת: לבנות על Opus 5.5, לשמור את שם המודל בערך קונפיגורציה ולא במחרוזת מילולית, ולהעמיד מודל זול מאחורי נתיב הניסיונות החוזרים כך שזינוק בהשהיה בריצת טוקן ראשון של 702 שניות לא יגרור איתו את המוצר שלך לקריסה. הנקודה האחרונה אינה תיאורטית — השהיית הטוקן הראשון של Opus 5.5 בהרנס של AA היא אחת עשרה דקות, ואם זה ארטיפקט של ההרנס או שהמודל באמת חושב יותר זמן מכל דבר שלפניו, תקציב הפסק הזמן שלך צריך להיקבע לפי המספר, לא לפי השיווק.

מה היה משנה את פסק הדין הזה?

שלושה דברים, לפי סדר הסבירות. זמינות כללית של Argon עם מחיר מפורסם, מה שהיה הופך את טיעון העלות למיידי לביצוע ומה שהיה בוחן אם $2/$10 שורד מפגש עם תעבורה אמיתית. הרצה עצמאית ובת-שחזור של DeepSWE v1.1 ו-CWE-bench v1 מחוץ ל-Google, אשר או תאשר את טענות הספק או תנפץ אותן. או קונפיגורציה של Argon ב-Artificial Analysis בהגדרת המאמץ הגבוהה ביותר שלו, אשר תכריע אם פער חמש הנקודות במדד הוא הבדל ביכולת או תוצר לוואי של הגדרות מאמץ.

עד שאחד מאלה יגיע, הסיכום הישר הוא ש-Opus 5.5 הוא המודל המאומת יותר ו-Argon היא הטענה במחיר הטוב יותר. איזה מהם תוכל להשתמש בו היום בפועל אינו החלטה צמודה.

Claude Opus 5.5 זמין כעת ב-OrcaRouter במחיר המחירון של הספק וללא תוספת, לצד שאר הקטלוג — אם ברצונך לבחון אותו מול עומס העבודה שלך ולא מול לוח תוצאות, anthropic/claude-opus-5.5 הוא המזהה שיש לקרוא לו, והחלפה במודל אחר מאוחר יותר היא שינוי של שורה אחת באותו מפתח.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית