כרטיס כותרת ראשי שנוצר עבור 'GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol' עם כיתוב עליון 'אותם משקלים. שכבת שירות שונה.' ושני כרטיסים: משמאל 'GPT-5.6 Sol Ultrafast' שמפרט חומרה: פרוסות Cerebras, מהירות: עד 750 tok/s, מחיר: טרם פורסם; מימין 'GPT-5.6 Sol' שמפרט חומרה: אשכולות GPU, מהירות: סטנדרטית, מחיר: $4.00 / $20.00; פוטר 'שניהם מריצים את הצ'קפוינט הזהה של GPT-5.6 Sol.' לוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

GPT-5.6 Sol Ultrafast לעומת GPT-5.6 Sol: אותם משקלים, שכבת שירות שונה

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

GPT-5.6 Sol Ultrafast אינו מודל חדש, וזה אינו סיפור השקה. הספק הכריז על המצב ב-13 באוגוסט 2026, ובאותו היום הופיע הערך ultrafast בסכימת ה-OpenAPI הציבורית של החברה, בתוך התיאור ServiceTierResponses של המפרט — שמגדיר את היקף השכבה, לפי הניסוח שלו עצמו, כמוגבל לנקודת הקצה gpt-5.6-sol ומסמן אותה כמוגנת בבקרת גישה. מה שהחזיר את הדף הזה לתור שלנו הוא דבר קטן וממוקד יותר: ב-25 בספטמבר 2026, קומיט fe4f7a1 הרחיב את הערך הזה לשתי רשימות ערכים נוספות, לפרמטר שכבת השירות ברמת הבקשה ולשדה מדיניות שכבת השירות של הסוכן. שישה שבועות לאחר ההכרזה, השכבה עדיין ברשימת המתנה, עדיין אין לה מחיר מפורסם, והיא כעת מחווטת לתוך יותר משטח ה-API ממה שהיא יכולה לשרת בפועל. GPT-5.6 Sol Ultrafast ו-GPT-5.6 Sol הם אותו מודל; הדבר היחיד שההשוואה הזו יכולה להכריע הוא מי שולט במצביע ומי אמר לך מהי העלות.

אז ההתמודדות שבכותרת היא יוצאת דופן. GPT-5.6 Sol Ultrafast ו-GPT-5.6 Sol הם אותו מודל. אותם משקלים, אותו צ'קפוינט, אותה התנהגות חשיבה, אותו חלון הקשר של 1.05 מיליון טוקנים, אותו פלט מקסימלי של 128K, אותן תשובות. הניסוח של OpenAI עצמה הוא "יותר עבודה שימושית לשנייה", לא מודל חכם יותר. הדבר היחיד ששונה בין שתי העמודות של ההשוואה הזו הוא איך הטוקנים נוצרים ומה שם המסלול בגוף הבקשה שלך — מה שהופך אותה לניסוי הבקרה הנקי ביותר בהיצע הנוכחי, וגם לזו שהכי קשה לקנות לפיה, כי לאחד משני המסלולים אין מחיר מפורסם בכלל.

מה בעצם השתנה השבוע

הראיה לשינוי מספטמבר היא קומיט, לא פוסט בבלוג. OpenAI מתחזקת את openai-openapi, המאגר שמפרסם את הסכימה הניתנת לקריאה על ידי מכונה של ה-API שלה, וקומיט fe4f7a1 — מתאריך 2026-09-25 — מוסיף את ultrafast לשתי מניינות: מדיניות שכבת השירות המשויכת לסוכנים, והשדה ברמת הבקשה שהמפרט מתאר כ"שכבת השירות המשמשת לבקשות מודל". זו הרחבה, לא הופעת בכורה: לפני הקומיט הזה שתי הרשימות הציגו auto, default, flex, priority, fast, ושכבת השירות כבר הייתה בסכימה מאז 13 באוגוסט. הקומיט ראוי לציון בגלל השדה שאליו הוא הגיע — שדה המדיניות שסוכן מוגדר איתו, שהוא משטח שונה מדריסה ברמת בקשה.

התיאור החשוב הוא מהקומיט מ-13 באוגוסט, לא מהקומיט הזה, והוא ההצהרה הספציפית ביותר ש-OpenAI פרסמה על השכבה בכל מקום. לצד הערך החדש, במפרט נכתב: "אם הוגדר ל-'ultrafast', הבקשה תעובד באמצעות שכבת שירות Ultrafast Processing עם בקרת גישה. שכבה זו זמינה כעת עבור gpt-5.6-sol; תגובה שתוגש דרכה תציג service_tier=ultrafast."

קראו את המשפט הזה פעמיים, כי הוא מכריע שתי שאלות שדף ההשוואה הזה היה אחרת נאלץ לגמגם לגביהן. הדרגה מוגבלת למודל אחד — מודל הדגל GPT-5.6 Sol ושום דבר אחר במערך — והיא מבוקרת-גישה ולא פתוחה, מה שמתאים לניסוח של OpenAI לתצוגה מקדימה ברשימת המתנה. היא גם אומרת לכם איך תדעו שקיבלתם אותה: התגובה מחזירה בחזרה איזו דרגה למעשה שירתה את הבקשה, כך שנסיגה לעיבוד סטנדרטי גלויה בגוף התגובה במקום משהו שעליכם להסיק מזמן השהיה. אותו תיאור מופיע הן בסכימות Responses הסטנדרטיות והן בסכימות Beta Responses, וכך מאז 13 באוגוסט.

A screenshot of the GitHub commit page for openai/openai-openapi commit fe4f7a1 by openai-openapi-publisher[bot], titled "Add 'ultrafast' service tier option to improve request speed", showing the diff adding "ultrafast" to the enum lists after "fast" and a new x-enumDescription reading "Uses the ultrafast service tier."

אות שני, חלש יותר, הגיע למחרת. דיווח מ-26 בספטמבר מתאר בורר Speed חדש — Fast, Standard ו-Ultrafast — שמגיע ל-Responses API Playground, כאשר זמינות רחבה יותר של Ultrafast צפויה לאחר כנס המפתחים DevDay של OpenAI. לא ראינו את הבורר בעצמנו ו-OpenAI לא פרסמה הודעת פריסה, לכן יש להתייחס לכך כדיווח ממקור יחיד ולא כתכונה שכבר שוחררה. החלקים הניתנים לבדיקה היום הם שני המקומות בסכימה הציבורית והעובדה שלא הופיעה טבלת תעריפים עבור המסלול.

מה שלא השתנה חשוב באותה מידה. עדיין אין מחיר ל-Ultrafast. עמוד התמחור של OpenAI, כפי שנקרא ב-27 בספטמבר, מכיל את ארבע הלשוניות שהיו בו קודם — Standard, Batch, Flex ו-Fast — והמחרוזת "ultrafast" אינה מופיעה בו בשום מקום. הגישה עדיין מתוארת כתצוגה מקדימה מוגבלת ללקוחות נבחרים, שתתרחב ככל שהקיבולת גדלה. השכבה נמצאת בחוזה ומחוץ לרשימת המחירים בעת ובעונה אחת, וזהו תיאור כנה של המצב.

שתי הרמות, זו לצד זו

כיוון ששום יכולת אינה מבדילה בין השניים, ההשוואה מצטמצמת כמעט כולה להגשה ולחיוב. כל שורה שלהלן מציגה את שני הצדדים בשורה אחת.

• מודל — GPT-5.6 Sol Ultrafast מריץ את אותו GPT-5.6 Sol checkpoint בדיוק כמו עיבוד GPT-5.6 Sol standard, אותו checkpoint, ללא דיסטילציה, ללא הקטנת גודל.

• תפוקת פלט — עד 750 אסימוני פלט בשנייה, עד פי 14 מהסטנדרט, לפי הודעת OpenAI מ-13 באוגוסט, לעומת עיבוד סטנדרטי של GPT-5.6 Sol באשכולות GPU, שהוא הנתון שמולו נמדד פי 14.

• חומרה — שבבים בקנה מידה של פרוסה של Cerebras, עם משקלים השוכנים ב-SRAM שעל השבב, המוצר הראשון של שותפות המחשוב של OpenAI עם Cerebras מינואר 2026, שלפי הדיווחים שווה כ-10 מיליארד דולר לאורך שלוש שנים, לעומת אינפרנס קונבנציונלי ב-GPU, שבו חלק ניכר מהזמן מוקדש להעברת משקלים בין הזיכרון למחשוב.

• מחיר — לא פורסם נכון ל-27 בספטמבר 2026 לעומת 4.00 $ לקלט / 20.00 $ לפלט למיליון טוקנים, התעריף המבצעי הנוכחי של OpenAI, ובנוסף 0.40 $ למיליון עבור קלט שמור במטמון.

• זמינות — תצוגה מקדימה מוגבלת ברשימת המתנה ללקוחות נבחרים לעומת המסלול המוגדר כברירת מחדל, שניתן לקרוא לו על ידי כל מי שיש לו מפתח API.

• התשובות שאתה מקבל בחזרה — זהות, באופן עקרוני מול זהות, באופן עקרוני; אם הן נבדלות זו מזו על אותו פרומפט, זהו ממצא, לא תכונה.

A generated two-column scoreboard titled 'GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol — the scoreboard'. Left column 'GPT-5.6 Sol Ultrafast': Checkpoint same as Sol, Serving hardware Cerebras wafers, Output speed up to 750 tok/s, Speed vs standard up to 14x, Price not published, Access waitlisted preview. Right column 'GPT-5.6 Sol': Checkpoint same as Sol, Serving hardware GPU clusters, Output speed standard processing, Speed vs standard 1x baseline, Price $4.00 / $20.00, Access open to any API key. Footer sourcing line; OrcaRouter logo bottom-right.

טענת המהירות, והתקרה עליה

מספר הכותרת הוא פי 14 ומגיעה לו אותה תשומת הלב שמקבל שאר העמוד הזה. OpenAI מציינת עד 750 אסימונים לשנייה לעומת עיבוד סטנדרטי — נתון תפוקה עבור פלט אסימונים, ולא טענה שכל בקשה מסתיימת פי 14 מהר יותר. זמן מקצה לקצה כולל גם עיבוד קלט ואת החשיבה של המודל עצמו, שאף אחד מהם לא נדחס באותו יחס על ידי החומרה בקנה מידה של פרוסת סיליקון. לכן החברה מתייגת את פי 14 כמקסימום ולא כמדידה.

ההשוואות שפורסמו מבוססות על דיווחי ספקים משני צידי הטבלה, ואחת מהן משתרעת על פני סטאקים של שני ספקים. ריצת Humanity's Last Exam של 2,500 שאלות מדווחת כמסתיימת תוך 11 שעות ו-11 דקות ב-Ultrafast לעומת 78 שעות ו-27 דקות עבור Claude Fable 5, עם דיוק דומה — כלומר, OpenAI ו-Cerebras מספרים לנו על בנצ'מרק שכולל מודל של מתחרה, וסיקור עצמאי של ההשקה ציטט השוואת מהירות יצירה צרה יותר של בערך פי 11 באותה ריצה, בעוד שהנתונים של Cerebras עצמה מרמזים על פי 7 בקירוב בזמן הבדיקה הכולל. הפער בין פי 14, פי 11 ופי 7 אינו סתירה; זה מה שקורה כששלושה גורמים מודדים חלקים שונים של עומס עבודה אחד. Cerebras מדווחת בנפרד על פי 5.6 מקצה לקצה ב-GDP-Val ללא אובדן איכות מדיד. דבר מכל זה לא שוחזר על ידי צד שלישי.

במחירון יש חור

כאן זה המקום שבו שתי המדרגות מפסיקות להיות סימטריות. ל-GPT-5.6 Sol יש ארבעה כרטיסי תעריף פומביים, ו-Ultrafast אינו אחד מהם.

• GPT-5.6 Sol סטנדרטי — $4.00 / $20.00 למיליון טוקנים, עם קלט במטמון ב-$0.40 ושכבת הקשר ארוך ב-$8.00 / $30.00 כאשר הקלט עובר כ-272 אלף טוקנים.

• מצב מהיר — $8.00 / $40.00, בדיוק כפול מהתעריף הסטנדרטי. זוהי הרמה ששמה שונה מ-Priority processing ב-30 ביולי 2026, וה-API מקבל גם service_tier: "priority" וגם service_tier: "fast". היא מספקת מהירות פלט של עד פי 2.5 בערך.

• Batch ו-Flex — $2.00 / $10.00, הנחה קבועה של 50% מהמחיר הרגיל בתמורה לתזמון גמיש יותר.

• Ultrafast — אין מחירון. לא חלל שמילאנו בניחוש; חלל ש-OpenAI השאירה.

השורה הזו של Fast-mode היא היחידה שמשמשת כתקדים אמיתי לתמחור Ultrafast, והיא מדכדכת לכל מי שמתכנן תקציב: שכבת המהירות היחידה ש-OpenAI בפועל הצמידה לה מספר עולה בדיוק פי שניים מהתעריף הסטנדרטי, עבור מהירות של פי שניים וחצי. Ultrafast היא הבטחת מהירות גדולה יותר, הנשענת על חומרה נדירה יותר — קיבולת הווייפרים של Cerebras אינה מצרך מדף — ולכן כיוון הפרמיה בסופו של דבר אינו מוטל בספק. גודלה כן. עד שיהיה מחירון רשמי, כל נתון של "מחיר GPT-5.6 Sol Ultrafast" שתראו מצוטט במקום כלשהו הוא הסקה של מישהו, כולל כל הסקה משלנו.

איך בעצם היית קורא לזה

שינוי הסכימה אומר לך את הצורה של הקריאה הסופית. אם השכבה עוקבת אחרי הדפוס של האחרים, היא מגיעה כשדה נוסף בבקשה שאתה כבר שולח: אתה שומר על המודל gpt-5.6-sol, שומר על הפרומפט שלך, ומוסיף את בורר השכבה — באותה דרך שבה Fast mode נבחר היום על ידי החלפת priority ב-fast. שום דבר בניתוח התגובה שלך לא משתנה, כי שום דבר במודל לא משתנה. זה כל היתרון של שכבת שירות לעומת החלפת מודל, והסיבה שלדף השוואה כמו זה יש כל כך מעט מה להשוות.

מה שאי אפשר לעשות היום הוא לקרוא לזה. ערך ה-enum קיים; הקיבולת שמאחוריו אינה קיימת, עבור רוב החשבונות. לכן השאלה המעשית לשבועות הקרובים אינה איזו משתי השכבות לבחור — אלא מה להריץ בזמן שהבחירה אינה זמינה.

זו שאלה שער (gateway) עונה עליה טוב יותר מרשימת המתנה. השכבה הסטנדרטית של המודל פעילה ב-OrcaRouter ממש עכשיו בתור openai/gpt-5.6-sol, ומוגשת בתעריף של הספק עצמו עם אפס תוספת מחיר על טוקנים, דרך נקודת הקצה התואמת ל-OpenAI בכתובת api.orcarouter.ai/v1 — כך שהתעריפים הפרומוציוניים של OpenAI, 4$ / 20$, ומדרגת ההקשר הארוך שלהם, 8$ / 30$, מועברים הלאה כמו שהם ולא מתומחרים מחדש על ידינו, וכל שינוי בהם נוחת בצד שלנו באותו יום שבו הוא נוחת בצד של OpenAI. אותו מפתח נושא יותר מ-200 מודלים, וזה חשוב כאן יותר מהרגיל: מכיוון שאי אפשר להגדיר service_tier: "ultrafast" ולקבל תשובה, הדרך לקנות השהיה היום היא לנתב את העבודה אחרת — לשלוח את הקריאות האינטראקטיביות למודל בקטלוג שעומד ברף האיכות שלכם הכי מהר, ולהשאיר את אצוות הלילה במסלול הזול ביותר שעובר. כשתיפתח השכבה, הראוטר הוא המקום שבו תהפכו את המתג, ועד אז זה ההבדל בין רשימת המתנה לבין תוכנית.

A screenshot of OrcaRouter's own model page for OpenAI GPT-5.6 Sol at /models/openai/gpt-5.6-sol, showing the live catalogue entry with the openai/gpt-5.6-sol identifier, Vision, Tools, JSON and Reasoning capabilities, the byline 'by OpenAI - 2026-07-09', code samples, pricing, performance and public benchmark sections listed on-page.

איזה מהם שייך לפרודקשן?

התעלמו לרגע מהמילה "versus", כי אין כאן שום החלטת איכות לקבל. אם אתם מייעלים לפי עלות לכל טוקן, התשובה היא GPT-5.6 Sol הסטנדרטי, ומסלול ה-Batch בהנחה של 50% הוא התשובה לכל דבר שיכול לחכות. אם אתם מייעלים לפי כמה זמן אדם יושב מול ספינר, Ultrafast הוא התשובה ברגע שאפשר להשיג אותו — ועומסי העבודה ש-OpenAI מציינת עבור התצוגה המקדימה ממחישים בדיוק למה: תגובה לאירועים עם לוגים ו-diffs פתוחים בתקלה חיה, בדיקות הונאה מול נתונים משתנים, שיחות תמיכה שבהן חצי שנייה של שקט נתפסת כמוצר שבור, ולולאות מחקר שבעבר רצו במשך הלילה נדחסות לסשן עבודה.

הסימן המסגיר הוא צורת גרף הבקשות שלך, לא הגודל של הפרומפט שלך. יצירה ארוכה אחת מרוויחה 14× על הנייר ופחות מכך בפועל, מפני שעיבוד קלט והסקה אינם נדחסים ביחס הזה. ארבעים קריאות כלים עוקבות מאחורי פעולה אחת גלויה למשתמש מרוויחות משהו הרבה יותר קרוב למכפיל המלא, מפני שכל אחד מסבבי ההלוך-חזור האלה הוא השהיה שהמשתמש יושב וממתין לה. אם עומס העבודה שלך נראה כמו השני, הדרגה מכוונת אליך; אם הוא נראה כמו הראשון, המסלול הרגיל ממילא היה מספיק.

שני דברים שכדאי לשים לב אליהם, ואף אחד מהם אינו שמועה שאנחנו יכולים להכריע בה מכאן. ראשית, כרטיס התעריפים: שכבה פרימיום בלי מחיר אי אפשר לתקצב, והתקדים של Fast-mode מרמז שהיא לא תהיה קטנה. שנית, האם רשימת ההמתנה באמת מוסרת סביב DevDay כפי שדווח — כי ערך service_tier שרוב החשבונות לא יכולים להשתמש בו הוא תיעוד, לא זמינות, וההבדל בין השניים הוא ההבדל בין תוכנית להבטחה.