כרטיס גיבור מיוצר עבור GPT-6.1 Sol לעומת DeepSeek V4 Pro שכותרתו 'שלושה מטרים, שלוש תשובות שונות', עם שלושה כרטיסי מדדים המציגים 'מחיר משולב פי 4', 'עלות לכל משימת אינדקס פי 1.07' ו'אינדקס בינה 16 נקודות', שורה המציגה 'אחד הוא קנייני ורואה תמונות. אחד הוא ברישיון MIT עם משקלות פתוחות וטקסט בלבד.', כותרת תחתונה המציינת 'מחירים לפי OpenAI ו-DeepSeek; נתוני אינדקס ועלות-לכל-משימה לפי Artificial Analysis, אשר משווה בין מודלים עם משקלות פתוחות למודלים קנייניים בקבוצות עמיתים שונות.', ואת הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

GPT-6.1 Sol מול DeepSeek V4 Pro: שלושה מדדים, שלוש תשובות שונות

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שאל עד כמה רחוקים GPT-6.1 Sol ו-DeepSeek V4 Pro זה מזה, והתשובה הכנה היא שזה תלוי באיזה מדד אתה קורא, ושלושת המדדים חלוקים יותר מכפי שרוב השוואות המודלים חלוקות על הכול. במחיר למיליון טוקנים, במשוקלל ביחס 3:1 של קלט לפלט, הם $4.00 לעומת $0.99 — פי ארבעה. במה שזה עלה בפועל להריץ את אותה חבילת הערכה, הם $0.72 לעומת $0.67 למשימה — שבעה אחוזים. במדד Artificial Analysis Intelligence Index הם 51.8 לעומת 36 — שישה עשר נקודות, וזה נשמע מכריע עד שאתה בודק מול איזה מודל הושווה כל מספר, מפני שהמתודולוגיה של אותו מעריך מציבה את שני המודלים בליגות שונות. GPT-6.1 Sol שוחרר ב-29 בספטמבר 2026 במחיר $2.00 לקלט ו-$10.00 לפלט עם חלון של 1,050,000 טוקנים. DeepSeek V4 Pro הוא דגם דגל מסוג mixture-of-experts ברישיון MIT, 1.6 טריליון פרמטרים עם 49 מיליארד פעילים, שוחרר ב-13 באוגוסט 2026 במחיר $0.66 ו-$1.98 עם חלון של 1,048,576 טוקנים. האחד הוא מודל טקסט שאפשר להוריד. האחר רואה תמונות. להבין לפי איזה משלושת המדדים אתה באמת צריך לנווט — זו כל העבודה.

שורת האינדקס אינה ההשוואה כפי שהיא נראית

התחל במספר שמצטטים אותו הכי הרבה, כי דווקא אותו הכי הרבה פעמים מצטטים לא נכון.

Artificial Analysis מפרסמת את המתודולוגיה שלה לצד לוח הדירוג שלה, ושתי שורות בה חשובות כאן. מודלים עם משקלים פתוחים, כך נכתב, מושווים רק למודלים אחרים עם משקלים פתוחים מאותה מחלקת גודל — זעירים, קטנים, בינוניים, גדולים, כשהגבול הוא 150 מיליארד פרמטרים. מודלים קנייניים מושווים לעומת זאת על פני טווח מחירים, ביחס משוקלל של 3:1 בין קלט לפלט. אלה שתי קבוצות השוואה שונות. DeepSeek V4 Pro 0813 הוא בעל משקלים פתוחים — כך נכתב בשאלות הנפוצות של המעריך עצמו, והוא מפנה למשקלים המפורסמים — ועם 1.6 טריליון פרמטרים בסך הכול הוא נופל למחלקה הגדולה של המשקלים הפתוחים. GPT-6.1 Sol הוא קנייני והוא מדורג מול מודלים בטווח המחירים של עצמו.

לכן, 51.8 ו-36 שיושבים בשורות סמוכות באותה טבלה אינם השוואה ישירה. הם ציון מול קבוצת עמיתים אחת וציון מול קבוצה אחרת, וזו בדיוק הסיבה לכך שנתוני העלות לכל משימה ניתנים להשוואה ואילו מספרי האינדקס הגולמיים אינם. אם אתה רוצה לדעת אם DeepSeek V4 Pro טוב עבור מודל שניתן להוריד, 36 הוא המספר שעונה על כך. אם אתה רוצה לדעת איך הוא מתמודד מול מודל חזית מתארח, עמודת האינדקס לא תגיד לך, וזה מקרה שבו המהלך הישר הוא לומר זאת במקום לחסר 36 מ-51.8 ולקרוא לזה פער.

מה ניתן להשוות באופן נקי: כרטיסי המחיר, מגבלות ההקשר והפלט, רשימות המודאליות, והעלות של הרצת אותה חבילת הערכה — כי הנתון האחרון הוא חישוב של עבודה זהה, לא ציון.

מה אומרים המונים הגולמיים

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, credited to DeepSeek and dated 2026-04-24, showing the model identifier, text-only input with tools, JSON and reasoning, a 1M-token context window with a 384K maximum output, and a rate row reading $0.66 input and $1.98 output per million tokens alongside a 1.92-second median latency and a 1030.7M seven-day traffic figure.

• מחיר קלט — GPT-6.1 Sol ‏$2.00 לעומת DeepSeek V4 Pro ‏$0.66 למיליון טוקנים

• מחיר פלט — GPT-6.1 Sol $10.00 לעומת DeepSeek V4 Pro $1.98, עולה ל-$1.32 ול-$3.96 בתוך שני חלונות UTC של ארבע שעות בימי חול

• קריאה מהמטמון — GPT-6.1 Sol ‏$0.10 לעומת DeepSeek V4 Pro ‏$0.022 למיליון טוקנים; שניהם משתמשים במטמון, והצד הזול זול פי 4.5 פעם נוספת

• עלות לכל משימת אינדקס — GPT-6.1 Sol $0.72 לעומת DeepSeek V4 Pro $0.67

• טוקני פלט שנפלטו בסוויטת האינדקס — GPT-6.1 Sol 67M לעומת DeepSeek V4 Pro 160M

• פלט מקסימלי — DeepSeek V4 Pro 384,000 טוקנים לעומת GPT-6.1 Sol 128,000 טוקנים

• מודאליות — GPT-6.1 Sol מקבל טקסט, תמונות וקבצים; DeepSeek V4 Pro מקבל טקסט בלבד

השורות הרביעית והחמישית הן הזוג המעניין. DeepSeek V4 Pro פולט פי 2.4 טוקנים על אותה חבילת בדיקות ובכל זאת מסיים בזול יותר ב-7% לכל משימה, כי תעריף הפלט שלו הוא חמישית מזה של GPT-6.1 Sol. כך נראה מודל מונחה-מחיר כשמודדים פלט ולא תעריף: הפטפטנות אמיתית, והיא לא מוחקת את היתרון. חלון הזמנים הוא הכוכבית. שני בלוקים של ארבע שעות בימי חול — 40 מתוך 168 השעות בשבוע — מכפילים את התעריף הנקוב ל-1.32$ ו-3.96$, והתוספת הזו חלה על אותם טוקנים שאחרת היו הזולים ביותר בכל אחד מהכרטיסים.

מה שהדגם הזול יותר לא עושה

שלושה דברים, וכל אחד מהם הוא גבול מוחלט ולא פשרה.

הוא לא רואה. DeepSeek V4 Pro הוא טקסט-נכנס, טקסט-יוצא. בלי צילומי מסך, בלי PDF סרוקים, בלי קריאת גרפים, בלי תרשים בתוך פנייה. תרחישי שימוש במחשב ותהליכי עבודה עתירי מסמכים — בדיוק סוגי העומסים ש-GPT-6.1 Sol ממוצב עבורם — יורדים מהפרק בכל מחיר. אם הצינור שלך כבר מפנה תמונות למודל ראייה, זו אינה בעיה; אם לא, זהו האילוץ המכריע.

אין לו קצב שחרורים שאפשר לתכנן לפיו. השם "deepseek-v4-pro" ממופה לבנייה 0813 מאז אוגוסט, וההגעה לשם לא עברה בשקט: הספק הודיע על הוצאת הבנייה משימוש ב-14 בספטמבר, ביטל את ההודעה יומיים לפני המועד, והמשיך להגיש את ה-API עם חיוב ללא שינוי. הקטלוג שלנו עצמו עדיין מציג אותו כדגלון הספינה עם אותו חלון הקשר, אותה תקרת פלט ואותו מגבלת מקבילות. ספק שיכול לבטל הוצאת גרסה משימוש בתוך יומיים יכול גם להימנע מכך; המסקנה התפעולית אינה שהמודל אינו יציב אלא שהשם הוא מצביע, והצמדת ההתנהגות למזהה בנייה ולא לשם נתיב היא הביטוח הזול.

הוא אינו נושא עמו את הידע הסובב. GPT-6.1 Sol בן שמונה ימים וכבר פורסמה עבורו תצורה עצמאית אחת; ל-DeepSeek V4 Pro יש היסטוריית הערכה ארוכה יותר ובסיס מתרגלים גדול בהרבה, כולל מחסנית הגשה שפורסמה ועבודת תפוקה של צד שלישי. עבור פריסה באחסון עצמי, מכלול החומר הזה שווה יותר משורת האינדקס, כי זה מה שאתה מתייעץ איתו כשהמודל מתנהג באופן מוזר על החומרה שלך ולא על בנצ'מרק.

כשהמונה הזול פי ארבעה הוא המונה הלא נכון

אם המודל הזול היה פשוט גרוע יותר בכל דבר, זה היה מאמר קצר. העובדה המביכה היא ששניהם במרחק של 7% זה מזה לכל משימה על עבודה זהה, ובמרחק של פי 2.4 זה מזה בכמות שהם כותבים כדי להגיע לשם. משמעות הדבר היא שמדד האסימונים המשולבים — זה שאומר פי 4 — מודד הבדל שאת רובו אינכם משלמים, משום שהוא מתמחר תערובת אסימונים שאולי לעולם לא תשלחו. ומדד האינדקס, זה שאומר 16 נקודות, מודד בין שתי קבוצות עמיתים ולא ניתן לחסר אותו.

אז החלוקה המעשית אינה "מודל חזית לעבודה קשה, מודל זול לעבודה קלה". היא חלוקה לפי מודאליות וחלוקה לפי נפח. כל דבר שיש בו תמונה עובר ל-GPT-6.1 Sol, וכך גם כל דבר שבו התשובה קצרה והחשיבה היא החלק היקר — חמש רמות המאמץ שלו, מ-low ועד max, כאשר medium היא ברירת המחדל, מאפשרות לך לקנות חשיבה בלי לקנות פרוזה, והקלט השמור במטמון שלו במחיר $0.10 הופך פרומפט חוזר וארוך לזול. כל דבר שהוא טקסט בלבד, בנפח גבוה וסובלני לתשובה ארוכה יותר — סיווג, חילוץ, סיכום, יצירה בכמות מול תקציב פלט של 384,000 טוקנים — הולך ל-DeepSeek V4 Pro, באופן אידיאלי מחוץ לשני חלונות ה-UTC.

שניהם על מקש אחד, והפיצול הוא שורת קונפיגורציה

שני המודלים נמצאים ב-OrcaRouter בתעריפים המפורסמים של הספקים שלהם, בלי שום תוספת: GPT-6.1 Sol ב-$2.00 / $10.00, עם מעבר ל-$4.00 / $15.00 מעל 272,000 אסימוני פרומפט, ו-DeepSeek V4 Pro ב-$0.66 / $1.98, כששני חלונות הזמן מועברים כפי שמפורט. מפתח אחד, חשבונית אחת, ונקודת קצה אחת תואמת OpenAI לשניהם.

זו הסיבה שהפיצול שלעיל שווה לתעד במקום להתווכח עליו. פיצול מודאליות ניתן לבטא ככלל ניתוב, כך שבקשות הנושאות תמונות עוברות למודל הראייה והטקסט הרב עובר לזול מבלי לשנות את היישום; אם נתיב נפגע, מעבר כשל מעביר את הקריאה במקום להכשיל אותה. ומכיוון ששניהם על אותה נקודת קצה, השוואת המחירים שבאמת חשובה — שלך, על התעבורה שלך, בתמהיל הטוקנים שלך — יכולה להיות מופקת מהחשבוניות שלך ולא מהממוצע של חבילת בנצ'מרק.

A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window, 128,000 max output tokens, an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.A generated scoreboard titled 'GPT-6.1 Sol vs DeepSeek V4 Pro — the scoreboard' showing two columns on six shared rows: input price $2.00 against $0.66 per million tokens; output price $10.00 against $1.98; cache read $0.10 against $0.022; cost per index task $0.72 against $0.67; maximum output 128,000 against 384,000 tokens; modalities text, image and file against text only. A footer reads 'Prices per OpenAI and DeepSeek as listed on OrcaRouter; cost-per-task figures per Artificial Analysis, whose index compares open-weights and proprietary models in different peer groups.'

המסקנה, בשורה אחת, היא שהקריאה הזולה פי ארבעה היא זו שכדאי שלא לתת בה אמון, והקריאה של שבעה אחוזים היא זו שכדאי לבדוק. פי ארבעה הוא מה שהמדד המשוקלל אומר על תערובת טוקנים שאולי לא תשלחו. שבעה אחוזים הם מה שעלתה אותה הערכה בשניהם, והיא מגיעה עם פער מילוליות מובנה של פי 2.4. שש עשרה הנקודות אמיתיות, והן גם חוצות שתי קבוצות עמיתים, והמגבלה שבפועל מכריעה את רוב הפריסות של הצמד הזה אינה מספר בכלל: אחד מהמודלים האלה יכול לקרוא צילום מסך, והאחר לא.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית