
GPT-6 נגד DeepSeek V4 Pro: אחד שאפשר לשכור מכל אחד, ואחד שאפשר לקחת הביתה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
יש בדיוק דבר אחד שאפשר לעשות עם DeepSeek V4 Pro שאי אפשר לעשות עם GPT-6 Sol: לקחת אותו הביתה. DeepSeek V4 Pro הוא דגל מסוג mixture-of-experts ברישיון MIT — 1.6 טריליון פרמטרים בסך הכול, 49 מיליארד פעילים לכל טוקן — שיצא לאור ב-13 באוגוסט 2026, וה-checkpoint שלו ניתן להורדה. GPT-6 Sol הוא משקולות סגורות, שהושק על ידי OpenAI ב-22 בספטמבר 2026, ונכון ל-7 באוקטובר 2026 הוא גם המודל שנמצא מתחת למסלולים בתשלום של ההשקה העולמית של ChatGPT ביותר מ-1.2 מיליארד משתמשים שבועיים.
כל השאר בהשוואה הזאת הוא עניין של באיזה מכשיר מדידה אתה קורא. בלוח התעריפים השניים רחוקים זה מזה פי ארבעה. לפי מה שזה באמת עלה כדי לייצר תשובה מוגמרת בחבילת ההערכה העצמאית, הם רחוקים זה מזה פי 1.55. ב-Intelligence Index השורות נראות רחוקות זו מזו בשש עשרה נקודות, ולפי המתודולוגיה המתועדת של המעריך עצמו, אין לגרוע ביניהן כלל. לפענח איזה מבין שלושת המספרים האלה אמור להנחות החלטה — זו כל העבודה, והתשובה שונה בהתאם לשאלה אם אתה בוחר ספק או בוחר קובץ.
מהו כל מודל, בפסקה אחת לכל אחד
GPT-6 Sol הוא שכבת הביניים בקו GPT-6 של OpenAI — מתחת לספינת הדגל GPT-6 Astra, ומעל ל-GPT-6 Luna החסכוני — עם חלון הקשר של 1,050,000 טוקנים, תקרת פלט של 128,000 טוקנים, קלט טקסט, תמונה וקבצים, תמיכה מובנית בקריאת כלים, פלטים מובנים, ומאמץ חשיבה שניתן לבחור בחמש רמות, מ־low ועד max. זוהי השכבה שאליה OpenAI מנתבת את ChatGPT Plus, Pro, Business ו-Enterprise, ומחירה עומד על $2.00 למיליון טוקני קלט ו-$10.00 למיליון טוקני פלט, עם שכבת הקשר ארוך שמתמחרת מחדש את כל הבקשה ב-$4.00 ו-$15.00 ברגע שהפרומפט עובר 272,000 טוקני קלט.
DeepSeek V4 Pro הוא דגם דגל טקסטואלי בלבד עם חלון של 1,048,576 טוקנים ופלט מקסימלי של 384,000 טוקנים — פי שלושה מהתקרה של GPT-6 Sol — וללא ראייה בשום מחיר. התיעוד של ה-API של DeepSeek עצמה מפרט אותו ב-$0.66 למיליון טוקני קלט ו-$1.98 למיליון טוקני פלט בשעות שיא, ובשעות שפל מוחצים ל-$0.33 ו-$0.99, עם פגיעות מטמון ב-$0.022 בשעות שפל. שעות השיא הן 01:00–04:00 ו-06:00–10:00 UTC בימי חול; כל השאר, כולל סופי שבוע וחגים ציבוריים בסין, נחשב לשעות שפל.
שלושת המטרים
התחל עם זה שמצוטט ביותר, כי הוא זה שמצוטט לרוב בלי ההקשר שלו. Artificial Analysis מעניקה ל-DeepSeek V4 Pro ציון 36.0 ול-GPT-6 Sol ציון 47.6 במדד Intelligence Index v4.3.2. אחת עשרה וחצי נקודות הן פער מהסוג שמסיים השוואה.
זה לא צריך, והמעריך אומר זאת בעצמו. Artificial Analysis משווה מודלים עם משקולות פתוחות רק כנגד מודלים אחרים עם משקולות פתוחות באותו גודל, עם הגבול ב-150 מיליארד פרמטרים, ומודלים קנייניים כנגד מודלים קנייניים בטווח מחירים ביחס משולב של 3:1 בין קלט לפלט. אלה שתי קבוצות השוואה שונות שמייצרות שני סולמות שונים. 36 ו-47.6 יושבים בשורות סמוכות באותה טבלה אינם השוואה ראש בראש, והמהלך הכנה הוא לומר זאת במקום לחסר אחד מהשני ולקרוא לזה יכולת.

שני המטרים הניתנים להשוואה אומרים משהו שימושי יותר:
• מחיר משוקלל ביחס 3:1 — GPT-6 Sol 4.00$ לכל 1M לעומת DeepSeek V4 Pro 0.99$ בתעריפי שיא, או 0.50$ בשעות שפל; פער של פי 4 עד פי 8 בהתאם למועד ההרצה
• עלות לכל משימת אינדקס שהושלמה — GPT-6 Sol 1.04$ לעומת DeepSeek V4 Pro 0.67$; פער של פי 1.55
• אסימוני פלט שנוצרו בכל הסוויטה — GPT-6 Sol 76.8M לעומת DeepSeek V4 Pro 162.9M, כך שהמודל כותב פי 2.1 יותר כדי לסיים את אותה עבודה
• פלט מקסימלי — DeepSeek V4 Pro 384,000 אסימונים לעומת GPT-6 Sol 128,000; תקרה של פי 3
• קלט מולטימודלי — GPT-6 Sol מקבל טקסט, תמונות וקבצים לעומת DeepSeek V4 Pro טקסט בלבד
• משקולות — DeepSeek V4 Pro ברישיון MIT וניתן להורדה לעומת GPT-6 Sol סגור

השורות הרביעית והחמישית מסבירות את השורה השנייה. פער של 4× בכותרת שמצטמצם ל-1.55× בעבודה אמיתית הוא מה שקורה כשהמודל הזול יותר הוא גם המילולי יותר: DeepSeek V4 Pro הפיק 2.1× טוקני פלט מאשר GPT-6 Sol באותו סט הערכה. מילוליות היא מכפיל עלות שלעולם לא מופיע בדף מחירים, והוא המספר היחיד שהכי פחות קוראים בהתמודדות הזו.
היכן שהמודל הפתוח באמת מנצח
שני מקומות, ושניהם מבניים ולא שוליים.
תקרת הפלט היא הראשונה. 384,000 טוקנים לעומת 128,000 הם הבדל של פי שלושה, והוא קובע קטגוריות שלמות של עבודה: יצירת תוצר מובנה גדול בקריאה אחת, כתיבת מסמך ארוך בלי שרשור, והפקת ריפקטור גדול בתגובה אחת. GPT-6 Sol לא יכול לעשות זאת בשום מחיר, כי המגבלה אינה דרגת חיוב — היא המקסימום של המודל.
שימוש בכלים אייג'נטיים הוא השני, לפי מדידה אחת ספציפית. DeepSeek V4 Pro משיג 96.2% ב־τ²-Bench, הערכת השימוש בכלים אייג'נטיים, וזה הנתון ש־DeepSeek מציגה בראש הכרטיס שלה. זה גם המספר שערך הקטלוג של המודל ב־OrcaRouter חוזר עליו, וזו הגרסה של הטענה שהקוראים שלנו עצמם יפגשו. הנתון הדומה של GPT-6 Sol ב־τ²-Bench אינו מפורסם באותו לוח, אז יש להתייחס להשוואה כאל כיוונית: במדד היחיד ש־DeepSeek בחרה להציג בכותרת, המודל הפתוח נמצא בראש התחום, והמודל הסגור לא הציב מספר באותה עמודה.
ולזה של הבעלות, שהוא בכלל לא מדד. צ'קפוינט MIT להורדה אומר שאתם יכולים להריץ את המודל על החומרה שלכם, להחזיק בקשה מחוץ לרשת של כל אחד אחר, לכוונן אותו, לנעוץ גרסה ולדעת שהיא עדיין תהיה שם בעוד שלוש שנים. אף ספק לא יכול להוציא אותו משימוש, לתמחר אותו מחדש או להוריד אותו ממחירון. עבור סוג מסוים של קונים — תעשיות מפוקחות, כל מי שמוגבל במיקום הנתונים, כל מי שכבר נכווה מסגירתו של מודל — זה שווה יותר מאחת עשרה נקודות מדד.
היכן ש-GPT-6 Sol מנצח, וזה לא רק המדד
Terminal-Bench 4.0 הוא השורה הפחות מחמיאה בכרטיס של DeepSeek V4 Pro: 14.1% לעומת 43.9% של GPT-6 Sol. זה לא הבדל של עיגול ספרות, והוא מצביע על פרופיל אמיתי — המודל הפתוח חזק בתזמור כלים רב-תורי וחלש בעבודת טרמינל לטווח ארוך, זו שסוכני קידוד מודרניים בנויים ממנה. אם עומס העבודה שלך הוא סוכן שצריך להחזיק סשן shell יציב למשך עשרים דקות, הערכה בודדת זו מנבאת את החוויה שלך טוב יותר מאשר המדד המשולב.
מולטימודאליות היא השנייה. DeepSeek V4 Pro הוא טקסט־נכנס, טקסט־יוצא. GPT-6 Sol קולט תמונות וקבצים, וזה לא סתם תיבת סימון ברשימת תכונות — עבודה מקצועית עמוסת מסמכים פירושה צילומי מסך, עמודים סרוקים, תרשימים וקובצי PDF, ומודל טקסטואלי בלבד לא יכול להיכנס לקטגוריה הזאת בכלל.
הדבר השלישי הוא מה שקרה השבוע. GPT-6 נחת בלשונית Chat של ChatGPT עבור Plus, Pro, Business ו-Enterprise ב-7 באוקטובר, כאשר Free ו-Go הגיעו בעקבותיו מ-8 באוקטובר, כשהוא נושא יכולת ש-OpenAI מכנה Intelligent UI — תשובות שמרכיבות טקסט, גרפיקה, תרשימים, טפסים ופקדים ניתנים להקשה לכל שאלה, במקום להסתמך כברירת מחדל על פרוזה. זהו משטח, לא תכונת API, והוא אינו משנה אף שורה בקוד האינטגרציה שלכם. מה שכן משתנה הוא ברירת המחדל הסביבתית: המודל שהצוות שלכם כבר מחזיק פתוח בלשונית דפדפן הוא כעת GPT-6, ועבודת אב-טיפוס נודדת לעבר המודל שאליו אפשר להגיע בלי מפתח. על פי דיווח הספק וללא שחזור, OpenAI גם טוענת ש-GPT-6 ב-Extra High מתחיל להשיב במהירות של GPT-5.6 ב-Medium, ושהגרסה GPT-6 Instant מתחילה להשיב 44% מוקדם יותר בשאלות המבוססות על חיפוש.
להריץ אחד, או להריץ את שניהם
הסיבה לכך שהצירוף המסוים הזה קל יותר לגידור מאשר רוב הצירופים היא ששני המודלים יושבים על אותו קטלוג. OrcaRouter מנתב את GPT-6 Sol ואת DeepSeek V4 Pro — יחד עם יותר מ-200 מודלים אחרים — דרך נקודת קצה אחת תואמת OpenAI במפתח אחד, בתוספת של 0% מעל מחיר המחירון של הספק. העברת המחיר הזו היא מה שהופך את מבנה שעות השיא/שעות השפל לקריא ולא למסתורי: ההפחתה בחצי בשעות השפל של DeepSeek היא של הספק, אנחנו לא נוגעים בה, וכשספק מתמחר מחדש, השינוי פעיל כאן באותו יום.
זה גם המקום שבו החלטת חלון השיא הופכת להחלטת ניתוב. התעריף של DeepSeek V4 Pro מחוץ לשעות השיא הוא מחצית מתעריף השיא, וחלונות השיא הם שעות UTC קבועות. כדאי לתזמן משימת אצווה שיכולה לזוז סביבם, וכדאי להרחיק מהם מסלול רגיש להשהיה. כששני המודלים מאחורי מפתח אחד, הפיצול הוא קונפיגורציה ולא חוזה ספק שני: נתבו עבודה בכמות גדולה ופלט ארוך ל-DeepSeek V4 Pro מחוץ לשיא, נתבו את התעבורה הרב-מודלית ועתירת החשיבה ל-GPT-6 Sol, ותנו למעבר כשל אוטומטי לכסות מגבלת קצב בכל צד במקום לגלות אותה בסביבת הייצור.

מה שלמעשה הייתי עושה
אם אתם זקוקים לתמונות, לקבצים או לציון חשיבה פורצת דרך ואתם קונים API, GPT-6 Sol הוא התשובה ואחת-עשרה נקודות האינדקס הן ברובן לא לעניין — שער המולטימודאלי מכריע את הכף לפני שהבנצ'מרקים מקבלים זכות הצבעה. אם אתם זקוקים לפלט של 384,000 טוקנים, לרישיון שאפשר להחזיק, לפריסה מקומית, או לעלות הנמוכה ביותר לכל משימה שהושלמה בלוח, DeepSeek V4 Pro מנצח ופער האינדקס הוא קבוצת ההשוואה של מישהו אחר.
מה שלא הייתי עושה הוא לקרוא ל־36 מול 47.6 כפער ביכולות ולקנות על סמך זה. המדדים בני־ההשוואה — $0.67 מול $1.04 למשימה, ופער מילוליות של פי 2.1 שמסתתר בתוך פער כותרת של פי 4 — מספרים סיפור מדויק יותר משורות האינדקס, והם אלה שמופיעים בחשבונית.
הדבר הבא שכדאי לעקוב אחריו הוא אם DeepSeek יסגור את הפער ב-Terminal-Bench ברענון של V4 Pro, מפני שזו המדידה היחידה שבה המודל הפתוח נראה באמת מאחור ולא כאילו קיבל ציון שונה. GPT-6, מצדו, פשוט הפסיק להיות בחירה והפך לברירת מחדל, וקשה להתווכח עם ברירות מחדל גם כשהבנצ'מרק אומר אחרת.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
