
Mercury 2.5 Preview לעומת Gemini 3.1 Pro: שתי תצוגות מקדימות, בהפרש של שישה חודשים
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0259אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0258אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0166אינטליגנציה82כתיבת קוד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
שני המודלים בקרב הזה נושאים את המילה "preview" בשמם, ושם מסתיים הדמיון. Mercury 2.5 Preview ו-Gemini 3.1 Pro הם שניהם מודלי חשיבה (reasoning) שאפשר לקרוא להם מ-API כבר היום, אבל הם previews בשני קצוות מנוגדים של חייהם. Gemini 3.1 Pro, מודל החשיבה הדגל, נמצא ב-preview מאז 19 בפברואר 2026 — עם שישה חודשים של הערכות עצמאיות, מיקומים בלוחות תוצאות ציבוריים ותעבורת production מאחוריו, עם Artificial Analysis Intelligence Index של 57 בהשקה, קלט מולטימודלי על פני טקסט, תמונה, אודיו ווידאו, קונטקסט של 1M טוקנים, ומחיר של $2.00 / $12.00 למיליון טוקנים. Mercury 2.5 Preview, מודל הדיפוזיה של Inception ששוחרר ב-31 באוגוסט 2026, הוא בן יומיים: מודל טקסט בלבד עם קונטקסט של 256K, תפוקה מוצהרת של 1,107 טוקנים בשנייה, מחיר רשימה של $0.20 / $0.75 (כ-$0.04 / $0.15 בהנחה עד 8 בספטמבר), ואף לא מדד עצמאי אחד. לקרוא לשניהם "preview" מסתיר את השאלה האמיתית: כמה שווה יתרון פתיחה של שישה חודשי ראיות כנגד דרך מהירה ביסודה לייצור טקסט.
מה כל מודל הוא בפועל
Gemini 3.1 Pro הוא מודל דגל סגור ורב-מודאלי, המיועד להסקה לשימוש כללי. הוא קורא טקסט, תמונות, אודיו ווידאו, מתמודד עם חלון הקשר של 1M טוקנים עם תקרת פלט של 64K, ומכוונן באופן דינמי את עומק ההסקה שלו — הספק מתאר ארבע דרגות של עוצמת הסקה שמתגברות עם מורכבות המשימה. מספרי ההשקה שלו — ARC-AGI-2: 77.1%, GPQA Diamond: 94.3%, SWE-bench Verified: 80.6%, Terminal-Bench 2.0: 68.5% — מדווחים על ידי הספק, אך הם נשענים על שישה חודשים של ביקורת בלתי-תלויה, כולל מדידה חוזרת שערך Artificial Analysis בסולם מדד מחמיר יותר, שבו מגיע המודל לכ־46.5. מדידה חוזרת שכזו היא בדיוק מה שמודל בוגר זוכה לו: הוא נבחן בעוצמה כה גדולה, עד שהמדד סביבו נעשה מחמיר יותר. Mercury 2.5 Preview הוא מודל דיפוזיה — הוא מייצר ומחדד טוקנים במקביל, במקום אחד-אחד — עם הסקה הניתנת לכיוונון, קריאות כלים מקבילות ו-JSON תואם-סכמה, והוא נבנה עבור עומסי העבודה ש-Inception מונה ככאלה שהשהייה בהם מצטברת: סוכני חיפוש, צינורות קול וסוכני משנה לקוד. כל טענת איכות שמיוחסת לו, כולל קפיצה של יותר מעשר נקודות לעומת Mercury 2, היא של הספק בלבד, ואף צד שלישי לא מדד אותו.

ניגוד המפרט
• מחיר — Mercury 2.5 Preview: $0.20 / $0.75 לכל 1M קלט/פלט, ~$0.04 / $0.15 מחיר היכרות עד 8 בספטמבר. Gemini 3.1 Pro: $2.00 / $12.00 לכל 1M, עולה ל-$4.00 / $18.00 מעל 200K קלט.
• הקשר / פלט — Mercury 2.5 Preview: 256K הקשר. Gemini 3.1 Pro: 1M הקשר, 64K פלט מקסימלי.
• קלטים — Mercury 2.5 Preview: טקסט בלבד. Gemini 3.1 Pro: טקסט, תמונה, אודיו, וידאו, קובץ.
• ארכיטקטורה — Mercury 2.5 Preview: LLM מבוסס דיפוזיה, יצירת טוקנים במקביל. Gemini 3.1 Pro: אוטורגרסיבי, עומק חשיבה דינמי.
• מהירות — Mercury 2.5 Preview: 1,107 tokens/sec (לפי הצהרת החברה). Gemini 3.1 Pro: אין טענת דגל דומה.
• ראיות — Mercury 2.5 Preview: דיווח ספק בלבד. Gemini 3.1 Pro: AA Index 57 בהשקה (46.5 בסולם החדש) בתוספת רקורד ארוך של הערכה בלתי תלויה.

הפער הרב-מודאלי הוא ההבדל המכריע.
עבור רוב היישומים השוואה זו מוכרעת לפני שמחירים או מדדי ביצועים נכנסים לתמונה, מכיוון ש-Mercury 2.5 Preview אינו יכול לראות. Gemini 3.1 Pro קורא צילומי מסך, דיאגרמות, אודיו ווידאו — זה המודל שאתה מפנה אליו קובץ PDF, תרשים, הקלטת פגישה או ממשק משתמש כשאתה רוצה תשובה על משהו שאינו כבר טקסט. Mercury 2.5 Preview הוא טקסט-בלבד בתכנון; מודל שפת דיפוזיה שמייצר טקסט במקביל אין לו מסלול קלט תמונה או אודיו כלל. עבור יישום כבד-מסמכים, סוכן ראייה, או כל מוצר מולטימודלי, Gemini 3.1 Pro הוא המועמד היחיד כאן, נקודה. האילוץ של Mercury 2.5 Preview לטקסט בלבד אינו הערת שוליים; הוא הגבול שמחליט עבור אילו עומסי עבודה המודל בכלל כשיר.
שישה חודשים של בדיקות לעומת יומיים
על בסיס הראיות, זו אינה תחרות, וחשוב לומר במפורש מדוע. Gemini 3.1 Pro נבדק ביסודיות על ידי מעבדות עצמאיות במשך שישה חודשים; הציון שלו נקבע, נמדד מחדש ועורר ויכוחים — וכך נראית מהימנות של מודל. ל-Mercury 2.5 Preview יש מקור מידע יחיד — היצרן שלו — והמקור הזה טוען לקפיצת אינטליגנציה של יותר מעשר נקודות לעומת Mercury 2 ולשוויון עם השכבה האופטימלית מבחינת עלות של מודלי החזית. ייתכן ששתי ההצהרות נכונות. אף אחת מהן לא אושרה על ידי גורם מחוץ ל-Inception, והמודל חדש מדי מכדי שזה יהיה בלתי צפוי. האסימטריה אינה בכך שאחד טוב יותר; היא בכך שאחד ניתן לדעת, והשני — עדיין לא.
המקום שבו מהירותו של מרקורי באמת מנצחת
הטיעון הכנה עבור Mercury 2.5 Preview הוא צר, מבוסס-טקסט בלבד, ואמיתי. יצירת טוקנים מקבילה משנה את המתמטיקה של ההשהיה באופן שאף מודל אוטורגרסיבי — כולל Gemini 3.1 Pro — לא יכול לעקוב אחריו, משום שמודל אוטורגרסיבי הוא סדרתי מעצם בנייתו. עבור צינור קולי, האירוניה היא שהקלט והפלט הם אודיו, אבל החשיבה ביניהם היא טקסט: שכבה מהירה של ניתוח טקסט היא בדיוק מה שגורם לסוכן קולי להרגיש מגיב. עבור סוכן חיפוש המבצע קריאות כלים חוזרות ונשנות, ועבור סוכן קידוד המשגר השלמות קטנות רבות לכל משימה, ההשהיה לכל קריאה מצטברת למהירות נתפסת. במחיר ההשקה — קלט $0.04, פלט $0.15 — Mercury 2.5 Preview זול בערך פי 80 מתעריף הפלט הסטנדרטי של Gemini 3.1 Pro, מה שהופך אותו לא רק למהיר יותר, אלא לסוג עלות אחר עבור ניתוח טקסט בהיקף גדול. המלכוד שחייב לנסוע עם כל אחד מהמשפטים האלה: המהירות היא מוצהרת, שוויון האיכות הוא מוצהר, ואין שום מדידה בלתי תלויה.
תמחור: פרמיום ההקשר הארוך של Gemini מול הטיזר של Mercury
במחירון של Gemini 3.1 Pro יש פרט שכדאי לדעת לפני שמשווים את המספרים הבולטים: בקשות שעוברות 200K אסימוני קלט עולות במדרגה מ-$2.00 / $12.00 ל-$4.00 / $18.00 למיליון. במודל עם קונטקסט של 1M, תוספת המחיר הזו עבור קונטקסט ארוך אינה מקרה קצה — היא המחיר של שימוש בפועל בחלון שהמודל מפורסם בזכותו. ל-Mercury 2.5 Preview אין מדרגה כזו, וסביר שקונטקסט ה-256K שלו לא יגיע לעיתים קרובות לתחום הקונטקסט הארוך. אבל המחיר הנמוך של Mercury הוא פיתוי שתוקפו יפוג ב-8 בספטמבר, בעוד שזה של Gemini הוא תעריף יציב שפורסם רשמית. כשמשווים, השוו את מחיר המחירון של Mercury — $0.20 / $0.75 — מול התעריף הרגיל של Gemini, ולא מול המחיר המוזל: ההנחה היא התמריץ לנסות, לא המחיר שלפיו צריך לתכנן.
החלטת הניתוב
שני הדגמים ניתנים לניתוב כבר היום, וזה משנה את האופן שבו כדאי להתייחס לכל אחד מהם. Gemini 3.1 Pro מופיע ב-OrcaRouter בשם google/gemini-3.1-pro-preview, במחיר הרשימה של הספק, עם 0% תוספת, כך שהתעריף הסטנדרטי ותעריף ההקשר הארוך עולים בדיוק מה שהספק מפרסם, לצד יותר מ-200 מודלים אחרים תחת מפתח API אחד. תגית Preview היא בדיוק הדבר שצריך לעקוף במקום להמר עליו — פאנל שיעור השגיאות בעמוד המודל קיים מסיבה, ו-failover אוטומטי פירושו שתגובה מושפלת של Preview מנותבת לספק שני בלי שינוי בקוד. Mercury 2.5 Preview עדיין לא זמין ב-OrcaRouter; Inception מציעה אותו דרך ה-API שלה ובכמה פלטפורמות של צד שלישי. מודל בן יומיים שלא ניתן עדיין להעמיד אותו מאחורי failover הוא מועמד לבדיקות, לא תלות ייצורית. ביום שבו ספק יוסיף אותו לרשימה, אותו מעבר מחיר יחול והנחת ההשקה תופיע כאן כבר באותו יום — ואז ההשוואה הזו הופכת לכלל ניתוב, לא להחלטה.
המסקנה הכנה היא ששתי התצוגות המקדימות האלה עונות על שאלות שונות. Gemini 3.1 Pro עונה על השאלה "על איזה מודל עליי לבנות את המוצר שלי היום?" — הוא רב-מודאלי, בעל חלון הקשר ארוך, יציב, ונבדק באופן עצמאי, במחיר שמשקף את כל זה. Mercury 2.5 Preview עונה על השאלה "כמה מהר יכולה הנמקת־טקסט להגיע פיזית?" — וארכיטקטורת המהירות שלו, הדבר המעניין ביותר במודל, ממתינה למעבדה עצמאית שתאשר אם האיכות שמתלווה אליה אמיתית. אם עומס העבודה שלך הוא רב-מודאלי או דורש הקשר ארוך, הבחירה כבר נעשתה. אם הוא מבוסס טקסט בלבד, עם חביון מצטבר ורגיש למחיר, Mercury 2.5 Preview הוא ההימור שכדאי לעקוב אחריו — וה-8 בספטמבר הוא התאריך שבו כדאי לבחון אותו בהשוואה.

