כרטיס כותרת ראשי להשוואה 'Grok 4.6 לעומת DeepSeek V4 Pro', עם כותרת משנה 'מלחמת מחירים בחזית, שנוהלה בהפרש של 24 שעות,' ועם תג 'השוואה · אוגוסט 2026'.
Guides & Insights

Grok 4.6 מול DeepSeek V4 Pro: מלחמת מחירים בחזית, בהפרש של 24 שעות

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני מודלים מתקדמים הושקו בהפרש של 24 שעות זה מזה, והפער בין גיליונות המחירים שלהם הוא הרחב ביותר שהדור הזה ייצר. Grok 4.6 הושק ב-12 באוגוסט 2026 במחיר של 2 דולר למיליון טוקני קלט ו-6 דולר למיליון פלט. DeepSeek V4 Pro — הגרסה הרשמית והפרודקשנית של דגם הדגל של DeepSeek, גרסה DeepSeek-V4-Pro-0813 — הגיע ב-13 באוגוסט 2026 במחיר של 3 יואן למיליון טוקני קלט שאינם בקאש (cache-miss) ו-6 יואן למיליון פלט, שהם בערך 0.42 דולר ו-0.85 דולר. אותה קטגוריה, אותן שאיפות סוכנותיות, הבדל בסדר גודל במחיר. זו לא השוואה בין שני מפרטים; זו השוואה בין שתי אסטרטגיות לגבי מה צריך לעלות מודל בצורת סוכן, ושתיהן הושקו השבוע.

הקטע הזה מציב את שני גיליונות המחירים זה לצד זה, בוחן את טענות ה-benchmark של כל ספק כשהתווית של הספק עליהן, ומחשב מה הפער עולה בפועל על עומס עבודה אמיתי — כי על הנייר המודלים האלה קרובים יותר ביכולות מאשר בפילוסופיה, וההבדל במחיר למשימה הוא המקום שבו מתקבלת ההחלטה.

התזמון הוא הנקודה

העובדה ששני הדגמים נחתו באותו חלון זמן של 48 שעות אינה תאונה של לוחות שנה. Grok 4.6 הוא ההסבה הסוכנית (agentic refit) של SpaceXAI לתשתית ה-1.5T שלה — רענון פוסט-אימון ששם דגש כבד על למידת חיזוק בקידוד, בעבודת קרנל וב-CAD, ומתומחר כדלק למוצרי Cursor ו-Grok Bot שבבעלות החברה. DeepSeek V4 Pro הוא מיסוד של תצוגה מקדימה שהגדירה בשקט מחדש את משמעות המונח "agentic" בשבריר מהמחיר, וכעת משופר לכלכלת הסוכנים: הערות השחרור של DeepSeek למבנה 0813 נפתחות ביכולות סוכן משופרות משמעותית, מוסיפות תמיכה ב-Responses API ובאינטגרציית Codex, ושומרות על מצבי החשיבה (ברירת מחדל) ואי-החשיבה, על פלט JSON, על קריאות לכלים ועל פורמט ה-API של Anthropic. שתי חברות שונות מאוד הגיעו במקביל למסקנה שהשוק שחשוב בסוף 2026 הוא סוכנים — ותמחרו את כניסתן לארנקים שונים מאוד.

שני דפי המחירים, זה לצד זה

Grok 4.6 — $2.00 / $6.00 / $0.50 (קלט במטמון) למיליון טוקנים, קונטקסט של 500K, תוספת של $4 / $12 / $1 מעל כ-200K טוקני קלט, וגרסה מהירה יותר במחיר כפול מהתעריף הבסיסי.

DeepSeek V4 Pro — ¥3.00 (≈$0.42) עבור קלט שאינו בקאש (cache-miss), ¥0.025 (≈$0.0035) עבור קלט בקאש, ו-¥6.00 (≈$0.85) עבור פלט למיליון טוקנים, עם חלון קונטקסט של מיליון טוקנים ועד 384K טוקני פלט. אחיו הזול יותר, V4 Flash, עולה ¥1 / ¥2.

אפילו מול Grok 4.6 — שכבר הוא ה-API החזיתי הזול ביותר בדורו — DeepSeek V4 Pro זול בערך פי חמישה בקלט של פספוס מטמון ופי שבעה בפלט, והוא מביא חלון הקשר גדול פי 2 ופלט מקסימלי גדול בהרבה לאותה רמת מחיר. השניים אינם מתחרים על המחיר; D​eepSeek קבע חד-צדדית רף חדש, וגרוק הוא כעת האופציה הפרימיום באותו משפט. המסגור הזה חשוב, כי המסגור הקודם — “Grok 4.6 הוא דגם החזית הזול” — היה נכון ליום אחד בדיוק.

Two-column scoreboard: Grok 4.6 AA Index 61 (independent), $2/$6, 500K context, DeepSWE v1.1 65.9% (vendor), Terminal-Bench 26% (v3.0), cache-hit input $0.50 vs DeepSeek V4 Pro AA Index none yet, ≈$0.42/$0.85, 1M context, DeepSWE 62.7% (vendor), Terminal-Bench 87.9% (v2.1), cache-hit input ≈$0.0035.

מה DeepSeek V4 Pro באמת שיפר

מספרי ההשקה של DeepSeek הם הדרמטיים ביותר מכיוון שהם נמדדים מול התצוגה המקדימה של עצמו, והקפיצה מהתצוגה המקדימה לגרסה הרשמית היא עצומה. בהערכות של הספק עצמו:

DeepSWE — 62.7% בגרסת השחרור, עלייה מ-12.8% בגרסת התצוגה המקדימה — ציון אופק ארוך בהנדסת תוכנה שהיצרן ממקם בין 58.0% של Opus 4.8 לבין 70.0% של Claude Fable 5.

Cybergym — 83.3%, עלייה מ-52.7%, ועוקפת במעט את Fable 5 (83.1%) ומנצחת את Opus 4.8 (78.3%).

Terminal Bench 2.1 — 87.9%, בהפרש של נקודה מ-88.0% של Fable 5 ומקדים את ה-85.0% של Opus 4.8.

AutomationBench (public) — 31.8%, עלייה מ-12.8%, מקדים את שניהם: Fable 5 (29.1%) ו-Opus 4.8 (27.2%).

Toolathlon-Verified, NL2Repo, DSBench-FullStack ו-DSBench-Hard — 74.1%, 61.5%, 71.1% ו-67.2% בהתאמה, המרוכזים בקטגוריית Opus 4.8 / Fable 5 או בסמוך לה.

כל אחד מאלה הוא דיווח של D​eepSeek על חבילת ההערכה של D​eepSeek עצמו. הכיוון אינו משתמע לשני פנים — גרסת התצוגה המקדימה לא הייתה מוכנה ללולאות סוכן בסביבת ייצור, והגרסה הסופית טוענת שכן — אבל התווית הכנה היא שאף מעבדה עצמאית לא נתנה ציון ל-DeepSeek V4 Pro עדיין, והמודלים שנגדם הוא נבחן אינם נקובים בשם על ידי גורם חיצוני.

מה Grok 4.6 עונה עם

המדד של Grok 4.6 שונה במהותו: הוא היחיד מבין השניים עם לוח תוצאות עצמאי. Artificial Analysis מדדה אותו על 61 ב-Intelligence Index שלה — בשוויון עם GPT-5.6 Sol, לפני Kimi K3 (60) — עוד לפני ש-DeepSeek V4 Pro אפילו הושק. טבלת הספקים שלו טוענת להובלה של 65.9% ב-DeepSWE v1.1 ו-69.9% ב-CursorBench v3.2, עם נקודת תורפה שמודים בה בגלוי של 26% ב-Terminal-Bench v3.0. אלה דיווחים של xAI, ואף אחד מהם לא שוחזר באופן עצמאי נכון ל-13 באוגוסט.

לפערי הגרסאות יש חשיבות כשמנסים להשוות בין השניים ישירות. הציון 87.9 של D​eepSeek הוא ב-Terminal Bench 2.1; ה-26% של Grok הוא ב-v3.0 הקשה יותר — מבחנים שונים, ולכן "D​eepSeek מוחצת את Grok במסופים" אינה טענה כנה, וגם "Grok מוביל ב-DeepSWE" אינה כנה, בלי לציין ששתי הספקיות הריצו גרסאות הערכה שונות ושאף אחד מהמספרים אינו של צד שלישי. מה שאפשר להשוות הוא הממד הבלתי-תלוי: ל-Grok 4.6 יש כרטיס ניקוד מאומת אחד, ל-DeepSeek V4 Pro אין עדיין אף אחד, ולצורך החלטת הפקה, האסימטריה הזו היא בעצמה מידע.

Screenshot of the Artificial Analysis page for Grok 4.6 (high) scoring 61 — the independent scorecard DeepSeek V4 Pro does not yet have.

העלות הכוללת של ריצת סוכן ארוכה

קחו משימת סוכן מציאותית — קריאה והסקת מסקנות על פני 500K טוקנים של הקשר, כתיבת 100K טוקנים של פלט, שהיא רפקטורינג בינוני או צינור עיבוד מסמכים ארוך, בתוך חלונות ההקשר של שני המודלים:

Grok 4.6 — 0.5M קלט ב-$2 = $1.00, ועוד 0.1M פלט ב-$6 = $0.60. סה״כ: $1.60.

DeepSeek V4 Pro — קלט של 0.5M cache-miss במחיר ¥3 = ¥1.50, בתוספת פלט של 0.1M במחיר ¥6 = ¥0.60. סה״כ: ¥2.10, בערך $0.29.

זה פער של פי 5.5 על אותה משימה נומינלית, לפני כל יתרון מטמון — וחלון ה-1M של D​eepSeek יחד עם פלט מקסימלי של 384K פירושו שהמשימה נכנסת במעבר יחיד, בעוד שחלון ה-500K של Grok 4.6 עשוי לחייב שניים. המלכוד שמונע מזה להיות תשובה של שורה אחת הוא עלות החשיבה והסיכון: מצב החשיבה של D​eepSeek מופעל כברירת מחדל, כך שכל בקשה משלמת על רצף חשיבה מלא גם כשלא רוצים אחד, והביטחון של הספק עצמו בבנצ'מרק לא אומת על ידי אף גורם בלתי תלוי. זול לטוקן עם חשיבה תמידית עדיין זול למשימה בתעריפים האלה, אבל "זול" ו"מאומת" הם טענות שונות, ורק אחד מהמודלים האלה נושא את השנייה.

מי צריך לבחור איזה

ההחלטה היא פחות "מה עדיף" מאשר "איזה פרופיל סיכון מתאים לעומס העבודה":

נפח גבוה, מוגבל בעלויות, ומוכן לשאת מספרים לא מאומתים — DeepSeek V4 Pro הוא המשחק של רצפת המחיר. ההקשר של 1M והפלט של 384K הופכים אותו למועמד החזק יותר להקשר ארוך ולעיבוד אצווה, ותעריף הקלט המאוחסן במטמון של ¥0.025 הופך צינורות עתירי שליפה לכמעט חינם. פשוט עשו הערכות משלכם, כי אף אחד עצמאי לא עשה זאת.

עומק אייג'נטי עם כרטיס ניקוד עצמאי, במערכת אקולוגית תואמת OpenAI — הציון 61 של Grok 4.6 מאומת, מגמת אמות המידה שלו בקידוד ובמשימות אייג'נטיות עקבית, והחולשה הסופית ידועה מראש. זמן ה-42 שניות עד לטוקן הראשון הוא המחיר שמשלמים עבור האיכות המאומתת.

Screenshot of the OrcaRouter model page for Grok 4.6, the pass-through endpoint where both models sit behind one key at provider list price.

תנועה מעורבת — זהו מקרה של ניתוב, לא של בחירה. ב-OrcaRouter, שני המודלים יושבים מאחורי מפתח אחד בתמחור pass-through של רשימת הספקים — כך שה-¥3/¥6 של DeepSeek נשארים ¥3/¥6 בחשבונית, וה-$2/$6 של Grok 4.6 נשארים $2/$6, עם אפס תוספת על שניהם. כלל ניתוב יכול לשלוח את העבודה עתירת-ההקשר, כבולת-העלות, ל-DeepSeek V4 Pro, ואת העבודה הסוכנותית המאומתת ל-Grok 4.6, לפצל את התנועה לפי בקשה עד שההערכה שלך תקבע את הפיצול, ולהסתמך על מעבר אוטומטי אם התנהגותו של מי מהספקים בשבוע הראשון סותרת את נתוני ההשקה שלו. עבור זוג מודלים בני יום אחד, בקצוות מנוגדים של מלחמת מחירים, היכולת להשוות את שניהם על עומס העבודה שלך — ולהפוך את הפיצול ללא שינוי קוד — אינה עניין של נוחות. זוהי הדרך היחידה המוצדקת לאמץ כל אחד מהם.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube