
Gemini 3.1 Pro מול Qwen3.8-27B: תצוגה מקדימה של שבעה חודשים מול צ'קפוינט שניתן להוריד
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ב-18 בספטמבר 2026, משתמשים בפורום המפתחים ל-AI של הספק עצמו החלו לדווח שGemini 3.1 Pro נעלם מבורר המודלים של AI Studio — כולל חשבונות בתשלום, וזאת חרף ניקויי מטמון וחלונות גלישה בסתר. השרשור שבו התבקש הספק לומר אם מדובר ב"באג או בכוונה" היה עדיין פעיל ב-21 בספטמבר. אין הודעת הפסקת תמיכה, אין נתיב הגירה, ואין תגובת צוות. בינתיים Qwen3.8-27B, שאותו הוציאה המעבדה בקוד פתוח ב-14 באוגוסט תחת Apache 2.0, לא ניתן לקחת מאף אחד שהוריד אותו. חוסר הסימטריה הזה — לא פער הבנצ'מרקים, שהוא אמיתי אך מתון — הוא מה שהעימות הזה באמת תלוי בו, ולכן שני המודלים לא באמת מתחרים על אותו מקום אף שטבלאות ההשוואה מציבות אותם זה לצד זה.
להלן ההשוואה הישירה על המספרים שקיימים, כאשר כל אחד מהם מסומן: נתוני Artificial Analysis מתיעודים שנלקחו ב-23 בספטמבר 2026, כרטיס המודל של Alibaba עצמה, פוסט ההשקה של Google, וטלמטריית הניתוב שלנו, נשמרים בנפרד לאורך כל הדרך. היכן שלא נמדד דבר, העמוד הזה אומר זאת במקום לנחש.
מה קרה השבוע, ומה זה אומר ומה זה לא אומר
הדיווחים ספציפיים והם מגיעים מהפורום של גוגל עצמה ולא מהבלוג של מתחרה. שרשור שכותרתו "Gemini 3.1 Pro חסר ב-AI Studio מאז 2026-09-18 — באג או מכוון?" מתאר משתמשים בתשלום שמאבדים את המודל ללא הודעה, תמיכת Google One שמציעה שלבי פתרון תקלות לא קשורים, ועמוד הסטטוס של גוגל שלא מראה שום תקלה. שרשור שני, "מודל Gemini 3.1 Pro Preview אינו זמין ב-AI Studio לבניית אפליקציה," מרכז את אותה תלונה, כולל ממשתמש שעוזר הקידוד שלו נבנה על ה-Preview במשך חודשים ושאומר ש-Flash "מייצר זבל" על בסיס הקוד שלו.
שלוש הסתייגויות כנות. מדובר בהיעלמות מקונסולת המפתחים, לא בהשבתת API מאושרת: Gemini 3.1 Pro עדיין רשום וניתן לניתוב בקטלוג שלנו, שם הוא העביר 94.7 מיליון טוקנים בשבעת הימים האחרונים. זה מדווח על ידי משתמשים — גוגל לא אמרה דבר, כך שאף אחד מחוץ לגוגל לא יכול להבחין בין "הוצאה שקטה משימוש" לבין "בעיית קיבולת" לבין "באג בקונסולה". והתזמון לא מחמיא בהתחשב בכך שהמודל הזה נמצא בתצוגה מקדימה מאז 19 בפברואר 2026 — שבעה חודשים, בלי תאריך GA שפורסם, בעוד גוגל הוציאה סולם של דגמי Flash מתחתיו. בנפרד, GitHub Copilot הוציאה את Gemini 3.1 Pro משירות ב-1 בספטמבר 2026 עם הודעה מוקדמת של 30 יום, שזה אירוע אחר ולא קשור, אבל הוא מצביע לאותו כיוון: נקודת קצה בתצוגה מקדימה בלי התחייבות ל-GA היא תלות שמותר לך להיות מודאג ממנה.
מספר אחד מהצד שלנו ראוי להציב לצד ההקשר הזה, כי איננו יכולים להסביר אותו ומעדיפים לומר זאת. הטלמטריה שלנו בת שבעת הימים על ערך הקטלוג של Gemini 3.1 Pro מראה שיעור שגיאות של 80.5%; הדגמים הסמוכים שבדקנו באותו בוקר — Qwen3.8-Max, Claude Fable 5.1 — עומדים על 5.9% ו-6.9%. איננו יודעים אם זו אותה בעיה שהפורום מדווח עליה, שבוע רע עבור ספק אחד במעלה הזרם, או תוצר לוואי של מכשור המדידה. התייחסו לכך כאל סיבה להריץ בדיקת קנרית לפני שאתם מתחייבים, ולא כאל פסק דין על הדגם.
אותו סרגל, שני ציונים שונים
זה החלק שרוב דפי ההשוואה טועים בו, ולכן כדאי להקפיד עליו. Artificial Analysis מדרגת את שני המודלים האלה לפי Intelligence Index v4.3.2. תיעדנו את שני הדפים ב-23 בספטמבר 2026, ושניהם נושאים את אותה רוויזיה — כך שבניגוד לרוב הטענות על מדדים בין-מודליים, הטענה הזו מבוססת על תמונת מצב זהה, והפער אמיתי.
• Qwen3.8-27B (xhigh) — מדד אינטליגנציה 33.7
• Gemini 3.1 Pro Preview — מדד הבינה 29.7
Qwen מוביל בפער של ארבע נקודות בסרגל הנוכחי. השאלה הקשה יותר היא מה זה אומר, מפני שהסרגל עצמו זז לפחות שלוש פעמים השנה. בפברואר, Artificial Analysis פרסמה מאמר שכינה את Gemini 3.1 Pro Preview "המוביל החדש ב-AI", בפער של ארבע נקודות מ-Claude Opus 4.6, וסיקור העיתונות מאותה תקופה דיווח על ציון 57 במה שהיה אז Index v4.0. ב-v4.3.2 זה 29.7. Artificial Analysis הכריזה על v4.3 ב-7 בספטמבר 2026, ארבעה ימים אחרי v4.2, והעדכון החליף את Terminal-Bench 2.1 ב-Terminal-Bench 4.0 הקשה בהרבה עם 66 משימות, והחליף את τ³-Banking ב-AutomationBench-AA. החוזקות של Gemini 3.1 Pro מפברואר היו בהערכות שהמדד החדש הוציא משימוש או שינה את משקלן. אז: המודל לא נעשה גרוע יותר, המבחן כן. אבל אם אתה בוחר מודל היום, המספר של היום הוא זה שאפשר לפעול לפיו בפועל, והמספר של היום מטה לטובת Qwen.
במקום שבו השניים באמת מתפצלים
ציונים מצטברים מסתירים את צורת ההבדל, והצורה היא החלק השימושי. כל נתון שלהלן מגיע מאותה לכידה מ-23 בספטמבר של דפי v4.3.2 של Artificial Analysis עבור שני המודלים, באותה רוויזיה.
• הסקה וידע — Gemini מוביל בבירור. GPQA Diamond 94.1 מול 90.5; Humanity's Last Exam 47.0 מול 33.9; SciCode 58.7 מול 46.6; CritPt 17.7 מול 5.4.
• משימות תעסוקתיות מהעולם האמיתי — Qwen מוביל, ובפער גדול. GDPval מנורמל: 45.4% לעומת 13.8%.
• בנקאות ועסקאות סוכניות — Qwen מוביל. τ-Banking 48.0 לעומת 21.4 של Gemini.
• שימוש בכלים אג'נטיים בבנצ'מרק כללי — Gemini מוביל במקום שבו Qwen לא נמדד. τ²-Bench 95.6 עבור Gemini; אין נתון עבור Qwen3.8-27B.
• עבודת טרמינל — צמוד, ושניהם גרועים במדד החדש. Terminal-Bench 2.1: Qwen 79.8, Gemini 73.8. Terminal-Bench 4.0: Qwen 5.6%, Gemini 4.0% — שניהם חד-ספרתיים.
• כיול — הפער החד ביותר בכל אחד מהעמודים. ב-AA-Omniscience, ג'מיני משיג 31.9 עם דיוק של 54.9% ושיעור הזיות של 50.9%; קוון משיג −10.0 עם דיוק של 15.6% ושיעור הזיות של 30.3%. ג'מיני יודע יותר וממציא יותר ממחצית מהזמן; קוון מסרב לעתים קרובות לענות ומזייף בערך בשליש מהתשובות שהוא כן נותן.
• הקשר ארוך — שוויון מוחלט באחזור בהקשר ארוך, 82.0 לכל אחד. באחזור רב-מודלי בהקשר ארוך, Qwen 21.7% לעומת Gemini 15.6%.
קראו את הרשומות "לא נמדד" כפי שהן. ל-Gemini אין נתון מנורמל של GDPval-AA שפורסם מול 45.4% של Qwen, ול-Qwen אין נתון של τ²-Bench, IFBench, Terminal-Bench Hard או ITBench-SRE מול 77.1, 53.8 ו-30.3 של Gemini. כל אחד מהחללים האלה הוא מקום שטבלת סיכום הייתה שותלת בו בשקט מנצח.

הפער שמכריע תקציבים: אותה עלות להרצת האינדקס
Qwen3.8-27B זול באופן דרמטי לכל טוקן. לפי נתוני השוק ש-Artificial Analysis מפרסמת, הוא $0.50 למיליון קלט ו-$3.00 למיליון פלט, עם הנחת מטמון של 80% ותעריף משולב ביחס 7:2:1 של $0.47. Gemini 3.1 Pro Preview הוא $2.00 ו-$12.00 — פי ארבעה ממחיר הקלט ופי ארבעה ממחיר הפלט — עם הנחת מטמון של 90% ותעריף משולב של $1.74.
ואז המספר שאף אחד לא מפרסם: החשבונאות של Artificial Analysis עצמה מעמידה את העלות של הרצת כל ה-Intelligence Index על $1,310.21 עבור Gemini 3.1 Pro Preview ו-$1,335.92 עבור Qwen3.8-27B. Qwen לא זול יותר להרצה. הוא יקר יותר במעט מאוד, מפני שהוא מבלה יותר זמן בדרך לשם. מתוך חשבון הפלט של Qwen, $512.36 היו אסימוני חשיבה לעומת $82.51 של תשובה ממשית; אצל Gemini, $691.82 היו חשיבה לעומת $113.08 של תשובה. מחיר לכל אסימון הוא תעריף, לא חשבון.
עוד שתי עובדות תמחור שטבלאות השוואה משמיטות. ראשית, המחיר של Gemini 3.1 Pro מדורג לפי גודל הקלט של כל בקשה: $2.00/$12.00 עד 200K אסימוני קלט, ואז $4.00/$18.00 מעל זה, כאשר קריאות מהמטמון מוכפלות מ-$0.20 ל-$0.40. חלון ההקשר של מיליון אסימונים הוא אמיתי, אבל 800,000 האסימונים האחרונים שבו עולים פי שניים. שנית, הרשומה בקטלוג שלנו עבור Qwen3.8-27B — מוגשת block-FP8, מגדל הראייה בדיוק מלא — מפרטת $0.40 לקלט ו-$4.21 לפלט, עם מחיר זול יותר לקלט ויקר יותר לפלט מאשר נתון השוק שלמעלה, ואינה מפרסמת כלל תעריף לאסימונים במטמון. ספקים שונים, פיצול שונה. בדקו את התעריף שלפיו תחויבו בפועל.
שני המודלים נגישים דרך מפתח OrcaRouter אחד במחיר המחירון של הספק עם 0% תוספת, כך ששינוי מחיר של ספק מגיע אלינו באותו יום ולא אחרי מחזור תמחור מחדש — מה שחשוב יותר מהרגיל כשאחד מהשניים נמצא על גבול מדרגה של 200K טוקנים.
השהיה: הטוקן הראשון המהיר ביותר שייך למודל האיטי יותר
זהו צמד המספרים המטעה ביותר בכל ההשוואה, והוא גם זה שסביר ביותר שקורא יפעל לפיו באופן שגוי.
• זמן עד לצ׳אנק הראשון — Qwen 4.04 שנ׳ לעומת Gemini 28.37 שנ׳. Qwen נראה מהיר פי שבעה.
• זמן עד לתשובה בפועל — Gemini 28.37s לעומת Qwen 52.52s. Gemini מנצחת בפער של פי 1.8 בקירוב, מכיוון ש-Qwen מבלה 48.48 שניות בחשיבה בין המקטע הראשון לטוקן התשובה הראשון.
• מהירות פלט — Gemini 116.5 טוקנים לשנייה לעומת Qwen 41.3. Gemini מהיר פי 2.8 ברגע שהוא מתחיל לכתוב, לעומת חציון השוואתי ש-Artificial Analysis מציבה על 95.4 טוקנים לשנייה. העמוד של Qwen עצמו מכנה זאת "איטי במיוחד".
אם המוצר שלך מזרים טוקן ראשון למשתמש, זמן האחזור הכותרתי של Qwen הוא שקר שתספר לעצמך פעם אחת. אם המוצר שלך ממתין לתשובה מלאה, Gemini הוא המודל המהיר יותר. שני הנתונים הם מדידות של Artificial Analysis; שניהם נלקחו בהגדרת המאמץ xhigh של Qwen, שהיא ברירת המחדל של כרטיס המודל.
ברירת המחדל הזו היא תלונה חיה בקרב מתרגלים, וכרטיס המודל חצי-מודה בכך. Qwen3.8-27B חושף פרמטר reasoning_effort עם שלוש רמות — xhigh (ברירת המחדל, "למשימות מורכבות הדורשות ניתוח יסודי"), medium, ו-low. כתיבות קהילתיות עד ספטמבר מדווחות ש-xhigh מייצר שלבי חשיבה ארוכים מאוד וממליצות לרדת ל-medium או low ולהגביל את תקציב החשיבה. הכרטיס של Alibaba עצמה מזהיר שבעבודה סוכנית עם מספר סבבים, הורדת המאמץ "לא תמיד מקצרת את זמן השלמת המשימה הכולל" — שזו אמירה כנה עבור כרטיס מודל, ואזהרה שהתיקון המובן מאליו אינו תמיד התיקון.
הקשר: 1M לעומת 262K, ומה שנכנס בפועל
Gemini 3.1 Pro מציע חלון הקשר של 1,000,000 טוקנים עם פלט מרבי של 65,536 טוקנים. Qwen3.8-27B מכיל 262,144 טוקנים באופן מקורי, ניתן להרחבה ל-1,000,000 באמצעות YaRN scaling, כאשר מומלץ להקצות בתוכו תקציבים נפרדים: תוכן חשיבה של עד 262,144 ותגובה סופית של עד 131,072.
שתי הערות שוליים כנות. טבלת המפרט של Artificial Analysis מציינת את החלון של Qwen כ-256,000, בעוד שטקסט השאלות הנפוצות שלה עצמה אומר 260K וכרטיס המודל אומר 262,144 — אלה הבדלי עיגול של אותו מספר, אבל צטטו 262,144 כי זה מה שהכרטיס אומר. וההרחבה ל-1M היא טכניקת סקיילינג, לא אותו דבר כמו חלון מיליון טוקנים נייטיבי: אחזור הקשר ארוך ב-1M במודל מורחב YaRN אינו מה שנתון 82.0 AA-LCR מודד. אף אחד לא פרסם ציון אחזור הקשר של 1M עבור Qwen3.8-27B. התייחסו לחלון של Gemini כאל זה עם ההתנהגות הנמדדת באורך מלא, ולחלון של Qwen כאל זה שעליכם לבדוק בעצמכם לפני שתעצבו סביבו — וזכרו שמעבר ל-200K טוקנים בקלט, המחיר של Gemini מוכפל.
עבודה סוכנית וקריאה לכלים
זה המקום שבו ההתמודדות באמת לא מוכרעת, ושבו יהיה קל ושגוי להמציא מנצח. ל-Qwen3.8-27B יש ציונים אג'נטיים מדודים שחסרים ל-Gemini, ולהיפך.
הטיעון של Qwen נשען על נתון עצמאי חזק ונתון ספק חזק. הנתון העצמאי הוא τ-Banking עם 48.0 מול 21.4 של Gemini — יותר מכפול, על אותה גרסה, במדד העוסק בשימוש רב-שלבי בכלים בסביבת בנקאות. הנתון של הספק הוא הכרטיס של Alibaba עצמה, שמפרט OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9, CoWorkBench 70.7, JobBench 33.4 ו-Agents' Last Exam 20.4 Pass@1. אלה ההערכות של Alibaba, שלא הורצו מחדש על ידי אף אחד אחר, והן נמצאות בדיוק בקטגוריות שבהן תוצאת GDPval שנמדדה באופן עצמאי (45.4% מנורמל מול 13.8%) מצביעה לאותו כיוון.
המקרה של Gemini הוא שיש לו את המספר הסוכני המוחלט הגבוה היחיד בהשוואה — τ²-Bench 95.6 — ול-Qwen אין ציון τ²-Bench בכלל. יש לו גם IFBench 77.1 עבור מעקב אחר הוראות, עוד ריק בצד של Qwen. ויש לו רקורד ייצור של שבעה חודשים, דבר שלשחרור במשקולות פתוחות בן חמישה שבועות אין.
שובר השוויון אינו ציון, הוא הטופולוגיה שלך. היתרון הסוכני של Qwen נמדד על בנצ'מרקים שבהם המודל פועל בתוך מערכת תוכנה גדולה וקיימת שהוא לא עיצב. זה של Gemini נמדד על בנצ'מרקים שבהם המודל צריך לפעול לפי הוראות בדיוק לאורך זמן רב. אלה כישורים שונים ושניהם אמיתיים.

קידוד
כתיבת קוד מתפצלת באותו אופן, ולכן לשאלה "מה עדיף בקוד" אין כאן תשובה חד-משמעית. Gemini מובילה בצד המחשוב המדעי — SciCode 58.7 לעומת 46.6 — ומדד AA Coding Index שלה, 68.8 בעמוד הקטלוג שלנו, נמצא בתוך שגיאת עיגול מ-68.1 של Qwen, והרבה בתוך כל רווח סמך שראוי לצטט. בעבודה טרמינלית סוכנית השתיים קרובות במדד הישן יותר, Qwen 79.8 לעומת Gemini 73.8 ב-Terminal-Bench 2.1, ואין ביניהן הבחנה במדד החדש יותר, שבו שתיהן צונחות לספרות בודדות.
הכרטיס של Alibaba טוען להרבה יותר — SWE-bench Pro 61.7, LiveCodeBench v6 90.3, QwenSWEBench 79.0 — אבל אלה מדווחים על ידי הספק, ובהערות השוליים של הכרטיס נכתב ש-SWE-bench Pro ו-QwenSWEBench הורצו ב-Claude Code harness, שאינו ה-harness שבו היה משתמש המספר של מתחרה. האמירה הבטוחה היא שבמדד הקידוד היחיד שדגמי שתי המעבדות נמדדו עליו על ידי צד שלישי, השניים מופרדים בארבע נקודות ב-Terminal-Bench 2.1 וב-1.6 נקודות ב-Terminal-Bench 4.0, ושניהם גרועים במדד הקשה יותר.
משקולות פתוחות לעומת נקודת קצה לתצוגה מקדימה
זהו הציר שעליו השתיים אינן בנות השוואה כלל, והוא זה בעל ההשלכה המעשית הגדולה ביותר.
Qwen3.8-27B הוא ברישיון Apache 2.0, עם 27B פרמטרים צפופים, 64 שכבות, בשילוב היברידי של Gated DeltaNet בקשב ליניארי וקשב מלא ביחס של בערך 3:1 — העיצוב שהופך חלון של 262K לבר-הגשה בעלות סבירה. זה רץ. בכימות ל-4 ביט זה נכנס בכ-17GB, כלומר GPU צרכני אחד; מערכת אקולוגית שלמה של דחיסה צמחה סביבו בתוך חמישה שבועות, מקוונטי Dynamic V3 של Unsloth, כולל גרסת 1 ביט שלדברי Unsloth רצה ב-8GB בכ-77% מהדיוק המקורי, ועד ל-Ternary Bonsai 2 27B של PrismML באמצע ספטמבר. אפשר לכוונן אותו, אפשר לבקר אותו, ואפשר להריץ אותו על מחשב נייד כשהרשת מנותקת.
Gemini 3.1 Pro הוא נקודת קצה סגורה בתצוגה מקדימה, בן שבעה חודשים, ללא תאריך GA, כרטיס דגם שמזהיר במפורש שתצוגות מקדימות עלולות להיות חסרות את היציבות, הזמינות והתמיכה של מהדורה יציבה, וכרגע — נכון לשבוע הזה — קונסולת מפתחים שנראה שהוא עזב בשקט. אי אפשר להוריד אותו, אי אפשר לנעול גרסה, ואי אפשר לעשות failover לעצמך.
אם אתה רוצה את תשובת הניתוב הכנה ולא פסק דין: קיומו של ה-checkpoint הפתוח הוא מה שהופך את התלות ב-Gemini לכזו שאפשר לשרוד. הצב את Qwen3.8-27B מאחורי מסלול מקומי או באירוח עצמי כמסלול הגיבוי, השאר את Gemini 3.1 Pro במסלול הראשי לעבודה עתירת ההיסק שהוא טוב בה באופן מדיד, והצב את שניהם מאחורי נקודת קצה אחת עם failover אוטומטי, כך שהיעלמות שקטה מהקונסולה של מישהו אחר תהיה תקרית ששכבת הניתוב שלך סופגת ולא השבתה שהמשתמשים שלך רואים. זה לא פיץ׳ למוצר — זו התצורה היחידה שבה החדשות של השבוע לא יעלו לך בסוף שבוע.
בחר ב-Gemini 3.1 Pro אם
• העבודה הקשה ביותר שלך היא חשיבה עתירת ידע ולא שימוש בכלים לטווח ארוך — זה מוביל את GPQA Diamond מ-94.1 ל-90.5, את Humanity's Last Exam מ-47.0 ל-33.9, את SciCode מ-58.7 ל-46.6 ואת CritPt מ-17.7 ל-5.4.
• אתם זקוקים לקלטים ארוכים באמת. חלון של מיליון טוקנים מדוד, שהתנהגות הריקול שלו נבדקה באריכות, עדיף על חלון של 262K שהורחב באמצעות טכניקה — בתנאי שאתם יכולים לחיות עם הכפלת המחיר מעבר ל-200K טוקנים בקלט.
• זמן עד להשלמת תשובה חשוב יותר מזמן עד לאסימון הראשון, ואתה רוצה 116.5 אסימונים לשנייה ולא 41.3.
• יש לך צורך ברב-מודאליות רחבה כיום: קלט אודיו, קבצים, תמונות, טקסט ווידאו לעומת טקסט, תמונה ווידאו של Qwen.
• אתה מוכן לקבל את הסיכון שבתצוגה המקדימה, ויש לך חלופה בשליטתך.
בחר ב-Qwen3.8-27B אם
• הסוכנים שלך פועלים בתוך מערכות קיימות גדולות — τ-Banking מ-48.0 ל-21.4 ו-GDPval מ-45.4% ל-13.8% מנורמל הם שני היתרונות הגדולים ביותר של מודל בודד בכל מקום בהשוואה הזו.
• אתה זקוק לכך שתשובה תהיה כנה ולא בטוחה בעצמה. שיעור הזיות של 30.3% לעומת 50.9% של Gemini הוא סוג אחר של מוצר.
• רישוי או דרישות מיקום נתונים שוללים API סגור, או שאתה צריך לבצע כוונון עדין על הנתונים שלך.
• אתם רוצים חיוב לפי טוקן ברבע מזה של Gemini, ומקבלים שתבזבזו את ההפרש על טוקני חשיבה — עלות הרצת האינדקס זהה בשניהם.
• אתה מוכן לכוונן את reasoning_effort מטה מ-xhigh, ברירת המחדל שלו, במקום לשחרר אותו כפי שהוא.
מה שלא הצלחנו לאמת
למען הפרוטוקול, ומכיוון שדף השוואה אינו טוב יותר מהחללים הריקים שבו: לא פורסמה הערכה עצמאית עבור Qwen3.8-27B במאמץ הסקה מופחת, ולכן היחס בין המהירות לאיכות שלו, כאשר רמת המאמץ היא בינונית ונמוכה, אינו נמדד. לא קיים ציון שליפת הקשר ארוך עבור תצורת ה-1M המורחבת ב-YaRN. ל-Gemini 3.1 Pro אין ציון מנורמל מפורסם של GDPval-AA, ול-Qwen3.8-27B אין כזה עבור τ²-Bench, IFBench או ITBench-SRE. ואף אחד — כולל Google — לא אמר מדוע Gemini 3.1 Pro עזב את הבורר של AI Studio ב-18 בספטמבר. נעדכן דף זה כאשר מי מאלה ישתנה.

השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
