
GPT-6 Astra Ultrafast פועל על Blackwell: NVIDIA חושפת את החומרה שמאחורי פי 8
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 223 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
ב-1 באוקטובר 2026 פרסמה NVIDIA פוסט מאת Dion Harris שכותרתו "איך NVIDIA GPUs עוזרים להאיץ את GPT-6 Astra Ultrafast של OpenAI", והמשפט במרכזו הוא הפעם הראשונה שאחת משתי החברות אמרה על איזו חומרה רצה שכבת השירות: "GPT-6 Astra Ultrafast, שרץ על NVIDIA Blackwell GPUs, זמין כעת ב-OpenAI API ולמשתמשי ChatGPT Work ו-Codex הזכאים." זו החדשה, והיא מצומצמת יותר ממה שהכותרת מרמזת. GPT-6 Astra, המודל, שוחרר ב-3 בספטמבר 2026. שכבת השירות Ultrafast מעליו הפכה לזמינה באופן נרחב ב-29 בספטמבר 2026. הטענה בדבר המהירות — יצירת טוקנים מהירה עד פי 8 מאשר במצב הסטנדרטי של Astra — הייתה כבר בת יומיים כאשר NVIDIA חזרה עליה.
מה שמעלה את השאלה שהפוסט באמת עונה עליה: לא "כמה מהר זה", אלא "של מי הסיליקון הזה".

שלושה דברים שהפוסט באמת הוסיף
הוצא את החזרה על הנאמר, והפוסט מ-1 באוקטובר מספק שלוש עובדות.
• החומרה — Blackwell. התיעוד של OpenAI עצמה ל-Ultrafast, שפורסם ב-30 בספטמבר, מתאר את מהירות הרמה, את תצורתה ואת מגבלות הקצב שלה, ואינו מזכיר שום GPU כלל. כך שהייחוס לשבב מבוסס על מקור יחיד — ספק החומרה. זה לא הופך אותו לשקרי; זה הופך אותו לטענה של ספק על הציוד של עצמו, וראוי לתייג אותה ככזו.
• שני מהנדסים בשמם — פיליפ טייה, ראש מערך האינפרנס של OpenAI, ואודאי רודאראג'ו, סמנכ״ל הטכנולוגיה של OpenAI לענייני מחשוב, ששניהם צוטטו בגלוי בשמם בשאלה ממה נבעה ההאצה.
• הקהל — "משתמשים זכאים של ChatGPT Work ו-Codex," שהוא רחב יותר מהמסגור של API בלבד שאיתו הושק המסלול. התיעוד של OpenAI עצמו עדיין אומר ש-Ultrafast עבור GPT-6 Astra "זמין לכל משתמשי ה-API במגבלות קצב נמוכות," וההסתייגות הזו של מגבלות נמוכות לא בוטלה באופן רשמי.
שני הציטוטים, ומדוע הם החלק המעניין
התרומה של טילט היא לולאה ולא בנצ'מרק. ההשקעה של NVIDIA בכלים ובתיעוד, הוא אומר, "אפשרה לנו להפוך את המודלים שלנו לטובים באופן יוצא דופן בתכנות", ואז Astra יכולה "להפוך את הידע הזה לקרנלים בעלי ביצועים גבוהים שהופכים את החומרה של NVIDIA לאטרקטיבית". רודאראג'ו בוטה יותר לגבי כיוון העבודה: "השתמשנו במודלים הפנימיים שלנו כדי לייעל את ההסקה על GPUs של NVIDIA".
בקריאה משותפת, זוהי טענה על פריסה ולא על יכולת: המודלים המובילים של OpenAI טובים כעת מספיק בכתיבת קרנלים של GPU עד כדי כך ש-OpenAI משתמשת בהם כדי לייעל את מחסנית ההגשה שלה. זה גם מתיישב עם הקטע היחיד בפוסט של NVIDIA שאינו עוסק בשבוע ההשקה בכלל — כותרת שנקראת "שיפור מתמיד בביצועים," בטענה שהסקה בפריסה נהיית מהירה יותר עם הזמן מכיוון ש-OpenAI ממשיכה לכוון את המודלים שלה לתוכנה של NVIDIA שעליה היא פועלת.
שום דבר מזה אינו מדידה. מדובר בשני מהנדסים שמתארים תהליך, שפורסם על ידי החברה שמכרה את ה-GPUs. הקריאה הכנה היא שהתהליך סביר, זול להאמין לו, ואינו ניתן להפרכה מבחוץ — וזה נכון גם לגבי כל מספר מהירות בסיפור הזה.
Blackwell כאן, Cerebras שם
הדבר השימושי ביותר שהפוסט הזה עושה הוא לחשוף פיצול שאיש לא הסביר. ב-13 באוגוסט 2026, OpenAI הציגה בתצוגה מקדימה דרג מהיר מעל מודל אחר — GPT-5.6 Sol שרץ "עד פי 14" מהר יותר — וציינה את Cerebras כשותפה שמאחורי זה, ותיארה חומרה בקנה מידה של פרוסה שמייצרת עד 750 טוקנים של פלט בשנייה. שבעה שבועות לאחר מכן, הדרג המהיר מעל Astra פועל על Blackwell, והמספר הוא פי 8.
שני דרגים מהירים, שתי תשובות חומרה, אחת מהן שותפה מומחית והאחרת הספקית הגדולה ביותר של החברה עצמה. אף אחד מהספקים לא פרסם השוואה בין שני נתיבי ההגשה, ואף מעריך בלתי תלוי לא מדד אף אחד מהם. שימו לב גם למה שהפוסט של NVIDIA עושה עם השם השני: "Rubin" מופיע פעם אחת, בתוך הציטוט של Tillet על מודלים שכותבים קרנלים עבור "מעבדי GPU של Blackwell ו-Rubin". זו אמירה על מה שהמודלים של OpenAI יכולים לתכנת, לא אמירה שמשהו מוגש על Rubin היום.
המספר ש-NVIDIA לא הדפיסה
יש נתון בסיפור הזה שאף חברה לא שמה לצד ה-8x, והוא זה שקובע אם צוות מפעיל את המסלול. מחירון Ultrafast המפורסם של OpenAI מפרט את gpt-6-astra במחיר $60.00 למיליון טוקני קלט, $6.00 קלט במטמון, $75.00 כתיבה למטמון ו-$300.00 פלט. אותו מודל במסלול הסטנדרטי הוא $10.00 ו-$50.00, עם קלט במטמון ב-$1.00 וכתיבה למטמון ב-$12.50. כל עמודה היא בדיוק פי שישה מהתעריף הסטנדרטי.
• המכפיל — פי 6.00 בקלט, בפלט, בקלט במטמון ובכתיבה למטמון. לא "עד". שש.
• התקרה — פי 8, הנתון ששני הספקים מצטטים בצירוף "עד" וללא תנאים מוצהרים.
• מה זה אומר — מכפיל המחיר נמצא מתחת למקרה הטוב ביותר המוצהר של המסלול עצמו. בתקרה העסקה משתלמת; בכל דבר מתחת ל-6x בתעבורה שלך, אתה משלם יותר לכל יחידת זמן שנחסכת ממה שהשיווק מרמז. ולכן המבחן המשמעותי היחיד של המסלול הזה הוא מדידה על הבקשות שלך.
• שלב ההקשר הארוך — מעל 272,000 אסימוני קלט, תעריפי Ultrafast הופכים ל-$120.00 עבור קלט ול-$450.00 עבור פלט, פי שישה מהתעריפים המדורגים של המסלול הסטנדרטי עצמו.
• האותיות הקטנות המבצעיות — OpenAI מתעדת סולם טוקנים לדקה של Ultrafast: 500,000 עבור דרגות שימוש 1 עד 3, 1,000,000 עבור דרגה 4 ו-5,000,000 עבור דרגה 5; Ultrafast תומך בשהות נתונים בארה"ב ובעיבוד גלובלי בלבד, ללא נקודת קצה לעיבוד אזורי באיחוד האירופי או באזור אחר שאינו ארה"ב; והתיעוד ממליץ על WebSockets עבור Ultrafast "במיוחד עבור יישומים סוכניים שמבצעים קריאות כלים רבות ברצף מהיר", ומזהיר ש"ללא חיבור מתמשך, תקורת הרשת עלולה להפחית את השיפורים בהשהיה."

הנקודה האחרונה היא זו שיש לפעול לפיה. צוות שמפעיל את הדרגה ומותיר מתחתיה HTTP לכל בקשה שילם פי שישה מהתעריף כדי להחזיר חלק מההאצה להקמת חיבור — דרך מתועדת وניתנת למניעה לבזבז את הכסף.
איך זה נראה מנקודת קצה אחת
GPT-6 Astra זמין ב-OrcaRouter בתור openai/gpt-6-astra: חלון הקשר של 1,050,000 טוקנים, עד 128,000 טוקני פלט, קלט טקסט, תמונה וקבצים, ומחיר המחירון של OpenAI מועבר ישירות במחיר $10.00 לקלט ו-$50.00 לפלט למיליון טוקנים, כשהוא עולה ל-$20.00 ו-$75.00 מעל 272,000 טוקני קלט. הבנצ'מרק הראשי בקטלוג שלו הוא 96.1 ב-GPQA Diamond.
שכבת ה-Ultrafast אינה נמצאת ב-OrcaRouter, והיא גם לא יכולה להיות: היא מאפיין של חשבון OpenAI עם בקרת גישה ולא מזהה מודל, ולכן openai/gpt-6-astra-ultrafast מחזיר model-not-found. אם תפעילו את השכבה, היא תחיה באינטגרציה הישירה שלכם עם OpenAI. מה שנקודת קצה עם יותר מ-200 מודלים עם 0% תוספת מחיר נותנת לכם במצב הזה הוא לא הנתיב המהיר — אלא השליטה. מכיוון שמחיר המחירון של הספק מועבר הלאה ולא מתומחר בתוספת, שינוי בתעריפי OpenAI נוחת בצד שלנו באותו יום שבו הוא נוחת אצלם, ומכיוון שנתיב Astra הסטנדרטי כבר קיים, הניסוי שמכריע את ההחלטה הזו הוא שורת קונפיגורציה אחת: אותו פרומפט, שכבה סטנדרטית, ומודל זול יותר לצידו, על אותו מפתח. זה הדבר הקרוב ביותר למדד השהיה שרוב הצוותים אי-פעם יריצו, והוא לא עולה דבר להקים.

מה שטרם נמדד
שלושה דברים ניתנים לבדיקה היום. השכבה קיימת, היא מופיעה בכרטיס התעריפים בדיוק פי שישה מהתעריף הרגיל, והחל מ-1 באוקטובר היא מיוחסת בפומבי ל-NVIDIA Blackwell GPUs.
דבר אחד אינו נכון: המכפיל על התעבורה שלך. שום ספק לא פרסם התפלגות השהיה עבור השכבה ברמת מקביליות מוצהרת, ואף צד שלישי לא שחזר את פי 8. אין גם בנצ'מרק שמשווה את Astra על Ultrafast ל-Astra ב-standard, ולא אמור להיות בנצ'מרק מחמיא כזה — מדובר באותו צ'קפוינט בנתיב מהיר יותר, לכן הגדרות זהות אמורות להפיק תשובות זהות במהירויות שונות. אם שני המסלולים שלך מתפצלים באותם פרומפטים, יש לך דיווח באג, לא פיצ'ר.
אז התמצית השימושית של ה-1 באוקטובר קטנה מכפי שההכרזה נשמעת. זה אותו דרג באותו מחיר עם אותה תקרת מהירות לא מאומתת, שכעת עוטה תווית חומרה. התווית הזו חשובה — היא מספרת לך על איזו סדרת מאיצים OpenAI מרחיבה את זה, והיא מספרת לך שסיפור הדרג המהיר עבר משותף מומחה לספק ה-GPU הגדול בתעשייה בתוך פחות מחודשיים. היא רק לא מספרת לך דבר על תקציב ההשהיה שלך, ואף פוסט לא יעשה זאת.
