
GPT-5.6 Sol Ultrafast: מהירות פי 14, 750 Tok/s — CS-4 לפי הדיווחים כ-1,300, אין עדיין מחיר
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B Uncensored (Aggressive)2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
GPT-5.6 Sol Ultrafast mode is the hardware-accelerated serving tier for the flagship — the same full GPT-5.6 Sol model run on Cerebras wafer-scale chips instead of GPU clusters, delivering up to 14× the speed of standard processing and up to 750 output tokens per second on the tier OpenAI announced in August. On 2026-08-18, Cerebras unveiled the next-generation CS-4 system that this tier grows onto, and an early, unverified report claims GPT-5.6 Sol on CS-4 already serves roughly 1,300 tokens per second. It is not a smaller model and not a distillation: only the hardware and scheduling changed, and the intelligence is preserved. What it does not yet have is a price — as of 2026-08-19, Ultrafast is a limited API preview with no published rate card, so the number you can actually budget against today is the standard tier on the live GPT-5.6 Sol model page: $5 per million input tokens and $30 per million output, passed through at zero markup. This article covers what the mode is, how fast the numbers really are — including the new CS-4 hardware and what is still unverified — what it costs (including the honest "no price yet" answer), and what to do until it reaches general availability.
מה זה בעצם מצב Ultrafast
Ultrafast היא שכבה לשרתים, לא מודל חדש. OpenAI הכריזה עליה ב-13 באוגוסט 2026 כמוצר הראשון של שיתוף הפעולה החישובי מינואר 2026 עם יצרנית השבבים Cerebras — עסקה שדווחה בכ-10 מיליארד דולר על פני שלוש שנים. בעוד שהרצה רגילה של GPT‑5.6 Sol רצה על אשכולות GPU ומבזבזת חלק ניכר מזמנה בהעברת משקלים בין זיכרון לחישוב, Ultrafast טוענת את משקלי המודל לתוך 44 GB של SRAM על‑גבי השבב בקנה מידה של רקיק של Cerebras; מודל בגודל של Sol משתרע על פני מספר רקיקים בשכבות, כך שהמשקלים יושבים במקום שבו מתבצע החישוב. התוצאה היא תקרת תפוקה שנקבעת על ידי הסיליקון, לא על ידי רוחב הפס של הזיכרון.
The hardware story moved on 2026-08-18. At its Supernova event, Cerebras unveiled the CS-4, the next-generation rack-scale system built on its Nexus platform — three Wafer-Scale Engine chips per rack, up to 2× the token-generation speed of the prior CS-3, and, per Cerebras, more than 1,000 tokens per second on models above 10 trillion parameters. Those are Cerebras's claims for a system in early access, not yet generally available. Since the unveiling, a single post on X claims CS-4 already serves GPT-5.6 Sol at roughly 1,300 tokens per second — consistent in direction with Cerebras's own numbers, but confirmed by nobody so far. Treat it as an early signal: plausible, unverified, and worth re-checking before you plan capacity around it.
החלק שחשוב לקוד שלך: מזהה המודל, המשקלים, התנהגות החשיבה והפלט זהים לחלוטין ל-GPT-5.6 Sol הרגיל. OpenAI ממסגרת את Ultrafast כ"יותר עבודה שימושית בשנייה" ולא כמדרגת איכות, והתצוגה המקדימה מריצה את הדגם המלא — המהירות לא נובעת מהחלפה לדגם זול יותר. מה שמשתנה הוא כמה מהר יוצאים הטוקנים.
אל תבלבל את Ultrafast עם ה-fast mode הקיים. Fast mode הוא שכבה נפרדת הניתנת לרכישה על חומרה סטנדרטית: עד פי 2.5 בערך במהירות הפלט, בפרמיה של פי 2 לכל טוקן ($10 קלט / $60 פלט ל-1M), ללא שינוי באיכות. Ultrafast הוא דבר אחר — חומרת Cerebras, עד פי 14, ולעת עתה ללא מחיר כלל.
כמה מהר — המספרים שחשובים

הנתון הראשי הוא 14×, והוא דורש הגדרה. OpenAI אומרת ש-Ultrafast מייצר עד 750 טוקני פלט בשנייה, לעומת העיבוד הסטנדרטי של GPT-5.6 Sol. זהו מדד תפוקה עבור טוקני פלט, ולא טענה גורפת שהכול רץ פי 14 מהר יותר — זמן הבקשה מקצה לקצה כולל גם עיבוד קלט ואת החשיבה של המודל עצמו, ולכן 14× מוגדר כמקסימום.
• קצב פלט מקסימליעד 750 אסימוני פלט בשנייה, לפי הודעת OpenAI (2026-08-13).
• לעומת עיבוד רגיל — עד פי 14 מהיר יותר, לפי אותה הודעה; השיפור בפועל משתנה בהתאם לאורך הקלט וסוג המשימה.
• Humanity's Last Exam, 2,500 שאלות — OpenAI/Cerebras מדווחים ש-GPT-5.6 Sol Ultrafast סיים תוך 11 שעות ו-11 דקות, לעומת 78 שעות ו-27 דקות עבור Claude Fable 5, עם דיוק דומה. דיווח ספק, וההשוואה משתרעת על ערימות החומרה של שני ספקים — יש לקרוא זאת כהכוונה, לא כפסיקה סופית.
• GDP-Val, מקצה לקצה — Cerebras מדווחת על מהירות גבוהה פי 5.6 בסך הכול, ללא אובדן איכות מדיד. כמו כן, מדובר בדיווח עצמי של הספק.
• קו בסיס של מצב מהירשכבת המהירות הקיימת הניתנת לרכישה מגיעה למקסימום של בערך פי 2.5 במהירות הפלט, תמורת פרמיית מחיר של פי 2.
• CS-4, the next hardware — Cerebras claims the CS-4 rack delivers more than 1,000 tokens per second on models above 10 trillion parameters, up to 2× CS-3's token generation. An unverified community report puts GPT-5.6 Sol on CS-4 at ~1,300 tokens per second — same direction, not yet confirmed by OpenAI or Cerebras.
One caution before you quote the 14×: independent coverage of the launch cites an ~11× generation-speed comparison against Claude Fable 5, while Cerebras's own figures imply ~7× for total test time on the same run — the difference is which portion of a workload you measure. The same discipline applies to the CS-4 speed signal: the ~1,300-token/s figure started as a single X post, and neither OpenAI nor Cerebras has confirmed it. All of these are vendor or community numbers announced this week, and none are independently verified yet. Treat them as claims, not benchmark verdicts.
מה זה עולה — והפער הכנה

Here is the state of the price question on 2026-08-19, stated plainly: Ultrafast has no published price. OpenAI has not announced one, and the preview does not appear on any public rate card. Reports that early-access slots are bundled or free are speculation, not policy — and until OpenAI prices the tier, any "GPT-5.6 Sol Ultrafast cost" number you find elsewhere is a guess.
מה שניתן לתמחר היום הוא שאר קו ה-GPT-5.6 Sol, מאומת מול התעריפים שפרסמה OpenAI ב-2026-08-18:
• Standard GPT-5.6 Sol — $5.00 קלט / $30.00 פלט לכל 1M טוקנים. קו הבסיס שתוכלו לקרוא לו כבר עכשיו.
• מצב מהיר — $10.00 / $60.00, פרמיה של פי 2 עבור מהירות פלט של עד בערך פי 2.5. הדבר הכי קרוב לדרגת מהירות שאפשר ממש לקנות.
• קריאת מטמון פרומפט — $0.50 ל-1M (90% הנחה על קלט חדש); כתיבות מטמון מחויבות ב-$6.25 ל-1M.
• שכבת ההקשר הארוך — קלטים שמעבר לכ-272K טוקנים מחויבים ב-$10.00 / $45.00.
• Batch API — $2.50 / $15.00, הנחה קבועה של 50% עם זמן אספקה של כ-24 שעות.
לצורך הקשר לגבי הפרמיה הצפויה: מצב מהיר קבע תקדים של 2× מהתעריף הרגיל עבור מהירות של 2.5×. אם Ultrafast ילך בעקומה דומה, הוא יהיה הרבה מעל התעריף הרגיל של $5 / $30 — והפרשנויות סביב התצוגה המקדימה מצפות בדיוק לכך, מכיוון שקיבולת הפרוסים של Cerebras היא נדירה ויקרה. אבל פרמיה צפויה היא לא מחיר. תכנן לפי Sol הרגיל או מצב מהיר עד שיהיה כרטיס תעריפים.
איך להשתמש בזה — מציאות התצוגה המקדימה
גישה היא הפער הכנה השני. Ultrafast זמין דרך OpenAI API לקבוצה נבחרת של לקוחות על בסיס רשימת המתנה, הוכרז ב-2026-08-13, כאשר OpenAI אומרת שהגישה תתרחב "ככל שהקיבולת תגדל". אין תאריך זמינות כללי. קבוצות התצוגה המקדימה שהוכרזו הן קידוד, מסחר, מחקר פיננסי, תמיכה ועומסי עבודה אינטראקטיביים אחרים — צוותים שהסוכנים שלהם מבצעים קריאות רבות לכל בקשה ושבהם זמן ההשהיה של התגובה הוא הצוואר בקבוק. Jane Street, Rogo ו-Podium הן בין הבודקים המוקדמים שצוינו.
דפוס השימוש שהיא מיועדת לו: תגובה לאירועים (קריאת לוגים, traces ו-diffs בזמן שהתקלה פעילה), מחקר פיננסי ואיתור הונאות על נתונים בזרימה, תמיכת לקוחות בזמן אמת וקול (שבו חצי שנייה של שקט נתפסת כשיבוש), קופת מסחר אלקטרוני, ודחיסת אצוות מחקר ליליות לסשנים אינטראקטיביים. אם עומס העבודה שלך הוא צ'אט חד-סיבובי, ה-14× חשוב הרבה פחות מאשר בלולאת סוכן של 40 קריאות.
מה אתה יכול לעשות היום — התשובה המעשית

בעוד ש-Ultrafast נמצא בתצוגה מקדימה, ה-GPT-5.6 Sol המלא זמין כבר עכשיו — וב-OrcaRouter התעריף הסטנדרטי מסופק במחיר הספק עם $0 תוספת לכל token, תחת מזהה המודל openai/gpt-5.6-sol דרך נקודת הקצה התואמת OpenAI בכתובת api.orcarouter.ai/v1. אם כבר יש לך לקוח OpenAI, ההעברה היא שינוי של כתובת הבסיס ומזהה המודל; שום דבר אחר. אותו מפתח ואותה נקודת קצה תומכים ביותר מ-200 מודלים, כך ש-Sol יושב לצד GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5, והמודלים עם המשקלים הפתוחים שהיית משווה אליהם את Sol — ואתה יכול לנתב לפי רמת קושי במקום לשלב כל אחד מחדש.
שני פרטים ספציפיים של OrcaRouter ראויים לציון בדף מהירות. BYOK: אתם מביאים מפתח OpenAI משלכם, ו-OpenAI מחייבת אתכם ישירות בתעריפים שלה — OrcaRouter מוסיף $0 לכל טוקן ושומר על מגבלות הקצב והאשראי של הספק שלכם. Guardrails: PII Shield ומדיניות התוכן פועלים לפני החיוב, כך שבקשה חסומה מחזירה 400 נקי ולעולם אינה מחויבת, ו-Agent Firewall מדרגת קריאות של כלים ושל MCP לפני שהן מבוצעות. כאשר — ואם — Ultrafast יגיע לזמינות כללית במחיר שכדאי לנתב, חיבורו לאותה נקודת קצה הוא שינוי של מזהה הדגם; התצורה שאתם בונים היום תמשיך לעבוד.
הגבול הכנה — כאשר Ultrafast אינו התשובה
ארבעה מקומות שבהם סיפור ה־14× אינו מחזיק מעמד, אז אל תתכננו או תתקצבו לפי מספר שלא נקבע סופית:
14× הוא מקסימום, לא הבטחה. מדובר בתקרת קצב פלט על חומרה של Cerebras; השהייה מקצה לקצה עדיין כוללת עיבוד קלט, זמן החשיבה של המודל, והרשת שלך. הנחיה שדורשת הרבה חשיבה יכולה לבלות את רוב זמן השעון שלה בחשיבה, שם התאוצה הבולטת מתכווצת.
It has no price and no GA date. As of 2026-08-19 you cannot buy Ultrafast — only request preview access, and the CS-4 hardware behind it is in early access rather than generally available. Budget against standard Sol ($5 / $30) or fast mode ($10 / $60), and treat any Ultrafast price you see online as unverified.
The benchmarks are vendor-reported. The 11-hour HLE run and the 5.6× GDP-Val figure are OpenAI/Cerebras numbers from the announcement; independent estimates range from roughly 7× to 11× depending on what's measured. Add the CS-4 speed signal to that list: the ~1,300-token/s figure for GPT-5.6 Sol on CS-4 comes from a single X post and has no independent confirmation. None of these are independently verified yet.
זה לא יתקן צוואר בקבוק שאין לך.אם הסוכנים שלך איטיים בגלל התזמור שלך, השהיית כלים, או פרומפטים כבדי קלט, מסלול פלט מהיר יותר משפיע על זנב ההשהיה רק במעט. החלטת התאמת הדרגה — GPT-5.6 Sol ב-$5 / $30 לעומת GPT-5.6 Terra ב-$2 / $12 לעומת GPT-5.6 Luna ב-$0.20 / $1.20 — עדיין משפיעה על החשבון שלך יותר מכל דרגת מהירות.
Bottom line. GPT-5.6 Sol Ultrafast is the fastest serving tier OpenAI has shipped for its flagship — the same weights on Cerebras hardware, up to 14× throughput and 750 output tokens per second on the announced tier. Cerebras's new CS-4 (unveiled 2026-08-18) reportedly pushes GPT-5.6 Sol toward ~1,300 tokens per second, but that figure is a single unverified X post. As of 2026-08-19, Ultrafast is a waitlist preview with no public price. If you are searching for a number to budget against, the honest answer is that there isn't one yet. Standard GPT-5.6 Sol at $5 / $30 is what you can call today, fast mode at $10 / $60 is the purchasable speed tier, and OrcaRouter passes both through at $0 markup on your own key. Build the routing now — and when Ultrafast gets a price and a date, it is one model-id change away.
עד ש-Ultrafast יקבל מחיר, ה-GPT-5.6 Sol המלא זמין ב-GPT-5.6 Sol on OrcaRouter ב-$5 / $30 למיליון טוקנים, ללא תוספת מחיר, מוכן למפתח משלך.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
