כרטיס כותרת ראשי עבור "Qwen 4 Max vs Gemini 3.1 Pro" עם כותרת משנה "ספינת הדגל שלא הוכרזה מול התצוגה המקדימה שלא הסתיימה", שלושה תגים מעוגלים עם הכיתוב "תצוגה מקדימה מאז 19 בפברואר 2026", "הקשר של 1,048,576 טוקנים" ו"26.3% אחזור ב-1M", שורת כותרת תחתונה עם הכיתוב "Alibaba הודיעה ב-22 בספטמבר 2026; Google הציגה תצוגה מקדימה ב-19 בפברואר 2026", והלוגו של OrcaRouter בפינה הימנית התחתונה.
Engineering & Research

Qwen 4 Max מול Gemini 3.1 Pro: דגם הדגל שלא הוכרז לעומת התצוגה המקדימה שלא הסתיימה מעולם

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

רוב ההשוואות מציבות מוצר שכבר שוחרר מול מוצר שכבר שוחרר. זו שונה: Qwen 4 Max הוצג בתצוגה מקדימה בכנס Yunqi בהאנגג'ואו ב-22 בספטמבר 2026, בלי תאריך שחרור, בלי מחיר ובלי משקולות, ו-Gemini 3.1 Pro נמצא בתצוגה מקדימה מאז 19 בפברואר 2026 ועדיין בתצוגה מקדימה — שבעה חודשים לאחר מכן, בלי תאריך זמינות כללית שהוכרז ובלי תאריך כיבוי בטבלת ההתיישנות שלו. אף אחד מהמודלים בהשוואה הזו אינו מוצר מגובש. זו אינה סיבה לדלג על ההשוואה. זו ההשוואה עצמה, וזה הדבר היחיד בה שהוא באמת אינפורמטיבי.

שבעה חודשים של תצוגה מקדימה

תווית של תצוגה מקדימה אמורה להיות מצב זמני. Gemini 3.1 Pro מחזיק בה כעת לאורך שלושה מהדורות Flash של אותה מעבדה, כולל Gemini 3.8 Flash ב-2 בספטמבר 2026, שאותו Google מתארת כדגם ה-Flash האינטליגנטי ביותר שלה. במדדים המשולבים הבלתי־תלויים, אותו דגם מקבל כעת ציון גבוה יותר מ-3.1 Pro. לסדרת Pro של Google אין חבר חדש יותר: אין Gemini 3.8 Pro, ודור 3.5 Pro נדחה ולפי הדיווחים הונח בצד. ההשפעה המעשית היא שהדגם הנושא את השם Pro אינו עוד הדגם בעל הציון הגבוה ביותר מבית היצרנית שלו.

טקסט המגבלה של גוגל עצמה בערך בקטלוג מייעץ לתכנן את הפסקת התצוגה המקדימה, שזו הדרך הכנה לקרוא את הסטטוס. תצוגה מקדימה ללא תאריך GA וללא תאריך השבתה מהווה מודל שאפשר לבנות עליו אבל אי אפשר לתכנן סביבו.

הצד של Qwen הוא תמונת מראה עם הסימן הפוך. Qwen 4 Max לא נמצא בתצוגה מקדימה ארוכה; הוא טרום-תצוגה מקדימה, כששום דבר לא פורסם כלל. שני מצבי הכשל הפוכים: Gemini 3.1 Pro הוא נקודת קצה אמיתית שקיומה לטווח ארוך אינו מוגדר, ו-Qwen 4 Max הוא פריט מוגדר במפת דרכים ללא נקודת קצה.

A two-column scoreboard titled "Qwen 4 Max vs Gemini 3.1 Pro - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Long-context retrieval not published; Independent score none exists. Right column Gemini 3.1 Pro: Status preview since Feb 19 2026; Input price $2.00 per 1M tokens; Output price $12.00 per 1M tokens; Context window 1,048,576 tokens; Long-context retrieval 26.3% at 1M tokens; Independent score 30 on index v4.3.2. Footer reads "Gemini 3.1 Pro pricing and vendor-reported retrieval from Google; index v4.3.2 published September 19 2026.", with the OrcaRouter logo bottom-right.

ההשוואה, ונתון ההקשר הארוך שמכריע אותה

המפרט של Gemini 3.1 Pro ציבורי ומפורט. זה של Qwen 4 Max ריק. מה ששווה להתעכב עליו הוא שורה אחת בעמודה של Gemini, מפני שזה מסוג המספרים שמצוטטים ולא צריך לצטט:

• סטטוס — Gemini 3.1 Pro בתצוגה מקדימה מאז 19 בפברואר 2026, לעומת Qwen 4 Max שהוכרז ב-22 בספטמבר 2026 ללא תאריך

• מחיר קלט — Gemini 3.1 Pro‏ $2.00 לכל 1M טוקנים עד לפרומפט של 200K ו-$4.00 מעליו, לעומת Qwen 4 Max שלא פורסם

• מחיר פלט — Gemini 3.1 Pro $12.00 ל-1M עד 200K ו-$18.00 ומעלה, לעומת Qwen 4 Max שלא פורסם

• קלט במטמון — Gemini 3.1 Pro‏ $0.20 לכל 1M בקריאת מטמון, לעומת Qwen 4 Max שלא פורסם

• הקשר — Gemini 3.1 Pro 1,048,576 אסימונים, לעומת Qwen 4 Max שלא פורסם

• תקרת פלט — Gemini 3.1 Pro 65,536 טוקנים, לעומת Qwen 4 Max לא פורסם

• מודאליות — קלט טקסט, תמונה, וידאו, אודיו ו-PDF עם פלט טקסט ב־Gemini 3.1 Pro, לעומת Qwen 4 Max, שלא פורסם

• בקרת הסקה — רמות חשיבה נמוכה, בינונית וגבוהה ב-Gemini 3.1 Pro, לעומת Qwen 4 Max שלא פורסם

• אחזור בהקשר ארוך — Gemini 3.1 Pro: ‏MRCR v2 כפי שדווח על ידי הספק בשיעור 84.9 אחוזים בממוצע על פני שמונה מחטים ב־128K, אך 26.3 אחוזים במצב נקודתי של מיליון טוקנים, לעומת Qwen 4 Max שלא דווח דבר

• ציונים שדווחו על ידי הספק — Gemini 3.1 Pro SWE-bench Verified 80.6 אחוז, GPQA Diamond 94.3 אחוז, ARC-AGI-2 77.1 אחוז, Humanity's Last Exam 44.4 אחוז ללא כלים, לעומת Qwen 4 Max לא דווח דבר

• ציון עצמאי — Gemini 3.1 Pro 30 ב-Artificial Analysis Intelligence Index v4.3.2, לעומת Qwen 4 Max שלא קיימת עבורו הערכה עצמאית

השורה הזו של הקשר ארוך היא זו שכדאי לקחת מכאן. חלון הקשר של 1,048,576 אסימונים הוא מספר שיווקי; שליפה של 26.3 אחוזים בהגדרה של מיליון אסימונים היא מה שאותו ספק מדווח כאשר הוא מודד את הקצה הרחוק של אותו חלון. שני הנתונים מגיעים מגוגל, מה שהופך את הפער לאמירה על המודל ולא על המעריך. אם עומס העבודה שלך תלוי במציאת עובדה הקבורה קרוב לקצה של פרומפט של מיליון אסימונים, נתון ההקשר הכותרתי לא אומר לך שום דבר שימושי, והשורה הזו אומרת לך כמעט הכל.

המדד זז, המודל לא

Gemini 3.1 Pro הושק ב-19 בפברואר 2026 עם 57 ב-Artificial Analysis Intelligence Index, הראשון בתחום. לפי עדכון המדד v4.3.2, שפורסם ב-19 בספטמבר 2026, הוא מציג 30. שום דבר במודל לא השתנה בין שני התאריכים האלה. הסרגל נבנה מחדש, והוא נבנה מחדש ארבעה ימים לפני ההכרזה של Alibaba על Qwen 4.

הצירוף מקרים הזה שווה יותר מהמספרים עצמם. שלושה מבין ארבעת המודלים בקבוצת ההשוואות הזו — Gemini 3.1 Pro, Claude Opus 5 ו-Qwen 3.8, דגם הדגל — קיבלו ציונים עצמאיים שזזו תחת אותה רוויזיה, ובכל אחד מהמקרים התזוזה הייתה גדולה מספיק כדי להפוך דירוג. כל השוואה שנכתבת החודש ומצטטת ערך מדד בודד בלי לציין את הרוויזיה משווה ציונים שנלקחו עם סרגלים שונים, והשגיאה לא תהיה נראית לקורא.

עבור Qwen 4 Max התוצאה היא שהיעד ממשיך לזוז. כאשר Alibaba תפרסם בסופו של דבר, הציון שיש לנצח במדד הזה יהיה מה שהגרסה הנוכחית קובעת באותו יום, והגרסה השתנתה לפחות פעם אחת בשבוע האחרון.

A screenshot of the OrcaRouter page for Gemini 3.1 Pro in its cost-estimator view (English UI), showing a monthly token volume of 10M against a sample summarisation prompt, an estimated $50.00 per month falling to $43.70 with prompt caching at list price, a cost per request of $0.006040, a note that the estimate uses base-tier rates and that actual token counts depend on the provider's tokenizer, and a PERFORMANCE panel for the last 7 days reading p50 time-to-first-token 10.00 s, output speed 632 tok/s and an error rate of 77.5%, above a 7-day latency trend chart running 09-16 to 09-22.

מה אומרים המספרים התפעוליים, כולל המספר הלא נוח

Gemini 3.1 Pro ניתן לניתוב ב-OrcaRouter בתור google/gemini-3.1-pro-preview, כשהוא נושא את התגים Flagship ו-Featured ללא באנר טרום-השקה, במחיר המחירון של גוגל של $2.00 ו-$12.00 למיליון טוקנים עם 0% תוספת. הניתוב עצמו הוא ישר — התעריף שבדף הוא התעריף שגוגל מפרסמת. גם את הנתונים התפעוליים על פני שבעת הימים עד 22 בספטמבר כדאי להציג ולא להשמיט: p50 של זמן עד לטוקן הראשון של 10.00 שניות, מהירות פלט של כ-632 טוקנים לשנייה, ושיעור שגיאות של 77.5 אחוזים לאורך החלון. שיעור השגיאות הזה אינו הערת שוליים. עבור מודל בדרגת preview ללא תאריך GA, זהו המספר הרלוונטי ביותר להחלטה בעמוד, והשוואה שמצטטת את המחיר בלי זה מוכרת במקום ליידע.

אותו קטלוג כולל קרוב ל-200 מודלים בנקודת קצה אחת תואמת OpenAI, עם מעבר אוטומטי לספק חלופי (failover) ושפת ניתוב DSL, וזהו המנגנון שהופך שיעור שגיאות כזה למשהו שאפשר לשרוד ולא לקטלני: ניתן להעביר מסלול ספק שנפגע אל ספק חלופי במקום להפיל אותו. משפחת Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash ו-Qwen3.8-27B — יושבת על אותה נקודת קצה כמו Gemini 3.1 Pro Preview, כך שההחלפה שהמאמר הזה באמת עוסק בה, זו שאפשר לבצע כבר היום, היא שינוי במדיניות ניתוב ולא פרויקט הגירה. Qwen 4 Max אינו נמצא בקטלוג, וגם לא אף דגם של Qwen 4; כשהוא ישוחרר, שם הוא יופיע.

ההחלטה, כפי שהיא

אף אחד מהמודלים כאן אינו מוצר שאפשר להתחייב לו, והעצה הכנה היא להתייחס לשניהם בהתאם. ניתן להפעיל את Gemini 3.1 Pro היום במחיר מפורסם, עם חלון הקשר מפורסם ומסלול הערכה ציבורי, כולל חולשת האחזור בקצה המרוחק של אותו חלון; הוא גם גרסת תצוגה מקדימה שהספק שלה אומר לך להיערך להוצאה משימוש, ופועל בשיעור שגיאות שלא היה מתקבל על הדעת בתלות בסביבת ייצור. ל-Qwen 4 Max אין אף אחת מהבעיות האלה, מפני שאין לו אף אחד מהמאפיינים האלה.

אם אתה צריך מודל עכשיו, הבחירה אינה בין שני אלה. היא בין Gemini 3.1 Pro לבין דגם הדגל של Qwen שזמין כעת, ועל פי הראיות הקיימות זו החלטה בין איכות אחזור בהקשר ארוך לבין תעריף קלט של $2.00 עם משקלים מפורסמים. אם אתה יכול לחכות, עקוב אחר שני דברים ולא אחר אחד: כרטיס המודל של Qwen 4 Max, ותאריך זמינות כללית ל-Gemini 3.1 Pro. מה שיגיע ראשון יגיד לך איזו משתי מפות הדרכים הללו עליבאבא וגוגל באמת מתעדפות.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית