
ה-Decisions API של OpenAI: GPT-6 Luna מפסיק לפטפט ובוחר תשובה אחת
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 393 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 209 tok/s
- OrcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- xAISpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
GPT-6 Luna שוחרר ב-22 בספטמבר 2026 כשלב הזול בסולם ה-GPT-6 של OpenAI. מה שחדש ב-29 בספטמבר הוא משימה עבורו שאין לה שום קשר לשיחה. ה-Decisions API של OpenAI מקבל שאלה שאתם כתבתם, רשימה סופית של תשובות שאתם מתירים, ופיסת הקשר — טקסט או תמונה — ומחזיר אחת מאותן תשובות. לא פרוזה. לא פסקה שצריך לפענח ולקוות לטוב. בחירה אחת, כך שכרטיס תמיכה עובר לאחד מחמישה תורים, תמונה נוחתת בקטגוריית מודרציה אחת, או שסוכן בוחר את המהלך הבא שלו מתוך מדיניות שהגדרתם. הוא הוכרז ב-DevDay 2026 והוא נמצא כעת בתצוגה מוקדמת מוגבלת, כש-OpenAI אומרת ששחרור נרחב מתוכנן בימים הקרובים.
רוב מה שצוות צריך לפני שהוא בונה על זה טרם פורסם. אין מחיר לכל קריאה, אין הגבלה מוצהרת על מספר התשובות המועמדות שבקשה יכולה להכיל, אין הצהרה בדבר האם אפשר לכוונן אותו על הנתונים שלך, ו—נכון ל-30 בספטמבר—אין לו שום ערך בשום מקום באינדקס תיעוד המפתחים, ביומן השינויים או בתיעוד ה-API של OpenAI עצמה. בדקנו את שלושתם. היכולת קיימת כיום בסיכום ה-DevDay של OpenAI ובמה שדובר של OpenAI אמר לכתבים ביום ההשקה. לכן המשך המאמר שומר על שלוש רמות נפרדות באופן גלוי: מה ש-OpenAI אישרה, מה שמדידה אחת מיום ההשקה טוענת, ומה שאיש אינו יכול לדעת עדיין.
מהי בעצם החלטה מוגבלת
שתי גישות קיימות עושות את העבודה הזו בצורה גרועה, וה-API של Decisions מכוון לפער ביניהן. הראשונה היא לתת פרומפט למודל צ'אט: אתה כותב הוראה מדויקת שמבקשת ממנו לבחור מרשימה, הוא כותב לך משפט, ואם יש לך מזל אתה יכול לקרוא הסתברויות טוקנים מתוך התגובה כדי לקבל משהו שדומה לציון ביטחון. זה עובד, זה שורף טוקנים, ומספר הביטחון הוא ניחוש גס. השנייה היא אימון מסווג קטן: מהיר, זול, והוא זקוק לנתונים מתויגים בתוספת ריצת אימון מחדש בכל פעם שקבוצת התוויות משתנה.
מודל החלטות יושב בין אלה. הוא מקבל תוויות חדשות בפרומפט — באותו אופן שבו פרומפט מקבל אותן — אך מחזיר ציון או בחירה שמפתח יכול להסתעף עליהם בלי לנתח אותם, וזו התכונה שהייתה למיין ולמודל צ'אט מעולם לא הייתה. OpenAI אינה חדשה לצורה הזו: ה-API של Moderation שלה מחזיר ציונים לפי קטגוריה ולא טקסט מזה שנים, עם הבדל אחד שחשוב כאן. הקטגוריות של Moderation הן של OpenAI. הקטגוריות של Decisions API הן שלך.
המגבלה היא המוצר, וכדאי להיות מדויקים לגבי מה היא כן נותנת ומה היא לא נותנת. מרחב פלט סופי פירושו שכל ערך מותר ידוע מראש, כך שהאפליקציה שלך יכולה לדחות תשובה שהיא לא הגדירה, להצמיד רמת הרשאה שונה לכל ענף, ולפנות לבן אדם כאשר הביטחון או ההקשר דלים. היא גם הופכת הערכה לא־מקוונת למעשית, כי לכל מקרה בדיקה יש מחלקת מטרה ועלות מדידה כשהוא שגוי. מה שהיא לא נותנת הוא נכונות. מודל מוגבל עדיין יכול לבחור תשובה תקפה אך שגויה, להיות מונחה על ידי הקשר מטעה, או לרשת את ההטיה של הקטגוריות שכתבת.
הטענה בדבר 150 אלפיות שנייה, והמספר ש-OpenAI לא פרסמה
OpenAI אומרת ש-Decisions API מקבל החלטות בערך פי עשרה מהר יותר מ-GPT-6 Luna דרך ה-API הרגיל — בסדר גודל של 150 מילישניות לעומת כ-1.6 שניות. הנתון הזה נמסר על ידי הספק ואינו משוחזר; אין מדידה בלתי תלויה שלו ביומיים שחלפו מאז ההשקה, והסיכום של OpenAI עצמה אומר רק "קבלת החלטות בזמן אמת". לנתון לא מתלווים התפלגות השהיה, אזור, גודל קלט, רמת מקביליות או הסכם רמת שירות.
נתוני התעבורה שלנו אינם תחליף לאותו מבחן, אבל הם מסבירים מדוע ההתפלגות החסרה חשובה. במהלך שבעת הימים עד 30 בספטמבר, GPT-6 Luna המוגש דרך נתיב chat-completions הרגיל של OrcaRouter מציג חציון של 699 מילישניות ו-p95 של 7.6 שניות על פני עומס עבודה של 3.23 טוקנים — פער של יותר מסדר גודל בין האמצע לזנב. זהו צורת בקשה שונה מהחלטה עם אילוצים, ולכן זה אינו השוואה לטענה של 150 ms. זו הסיבה לכך ש-p50 כותרתי בודד הוא המספר הלא נכון שסביבו מתכננים דדליין. אם אתם בודקים את התצוגה המקדימה, תעדו חציון, p95 ו-p99 בנפרד עבור קלטי טקסט ותמונה, כללו זמן רשת וניסיונות חוזרים, ומדדו את הדדליין שבאמת יש למוצר שלכם — החלטת ניתוב עבור תור אסינכרוני והחלטה שיושבת בין קליק לתשלום אינן חולקות תקציב השהיה.

תמחור: כמה עולה המודל הבסיסי, ולמה זה לא המחיר של ה-API
OpenAI לא פרסמה שום תעריף עבור Decisions API. כמו כן, אין זה בטוח להניח שתעריפי האסימונים של Luna חלים, מכיוון ש-Decisions API היא אריזה בפני עצמה — נקודת קצה שונה עם מגבלות שונות, ו-OpenAI אמרה שהיא תשתף פרטים נוספים "בהשקה רחבה". כל מי שמצטט לכם עלות לכל החלטה כרגע מסיק זאת.
מה שמפורסם הוא כרטיס התעריפים של המודל שעליו הוא מבוסס, כפי שנקרא מדף התמחור של OpenAI ב-30 בספטמבר 2026:
• קלט — $0.10 למיליון טוקנים, שהופך ל-$0.20 מעל 272,000 טוקני קלט
• פלט — $0.50 למיליון טוקנים, שהופך ל-$0.75 מעל 272,000 טוקני קלט
• קלט במטמון — $0.01 למיליון טוקנים; כתיבות למטמון מחויבות ב-$0.125, תוספת של 25% על התעריף שאינו במטמון
• עיבוד Batch ו-Flex — 50% מהתעריפים הרגילים; מצב Fast — פי 2 מהתעריפים החלים
קו ההקשר הארוך הוא זה שמכשיל אנשים, והוא עובד באותו אופן שבו הוא עובד בכל משפחת GPT-6: חצייה של 272,000 אסימוני קלט מתמחרת מחדש את כל הבקשה במדרג הגבוה יותר, ולא רק את העודף. API לקבלת החלטות שמעביר מסמך ארוך או סט תמונות גדול למודל הוא בדיוק סוג הקריאה שיכול לחצות את הקו הזה, וזה עוד דבר שמגבלות התצוגה המקדימה שלא פורסמו משאירות פתוח.
GPT-6 Luna במונחים של עצמה
אם מסירים את ה-API, המודל שמתחת הוא מודל חשיבה בתחתית משפחה בת שלוש דרגות — מתחת ל-GPT-6 Sol במחיר $2.00/$10.00 ול-GPT-6 Astra הדגלי במחיר $10.00/$50.00 — עם חלון הקשר של 1,050,000 טוקנים, תקרת פלט של 128,000 טוקנים, תאריך ידע עד 18 במאי 2026, ומאמץ החשיבה ניתן להגדרה על פני שישה ערכים מ-none עד max. הוא מקבל קלט טקסט ותמונה ומחזיר טקסט, ובתיעוד המפתחים של OpenAI עצמה ברירת המחדל של המאמץ היא medium. הסתייגות מעשית אחת מאותו עמוד, שאינה קשורה ל-Decisions API אך רלוונטית אם אתם מחברים את Luna כגיבוי: ב-Chat Completions, קריאה לפונקציות עובדת רק כשמאמץ החשיבה מוגדר ל-none. כלים בכל הגדרת מאמץ אחרת דורשים את Responses API.
מבחינת איכות, המספר העצמאי הוא מדד Intelligence Index של Artificial Analysis, שעומד על 37.3 עבור Luna במאמץ מרבי, לעומת 47.5 עבור GPT-6 Sol — פער של כעשרה נקודות, וזו הדרך ההוגנת לקרוא את פער המחיר של פי עשרים בקלט. אף אחד מהנתונים אינו אמירה על Decisions API, שמשימתה המצומצמת היא מדידה שונה לחלוטין ואין לה ציון מפורסם.

ג'ב, לאיה, והמסגור של "מערכת אחת"
ה-API של Decisions לא הגיע לשדה ריק. המודל של TypeSafe AI, Jev, שהושק ב-15 בספטמבר 2026 על ידי Diogo Almeida וזמין באופן כללי מאז 21 בספטמבר, הוא המודל שהפך את הקטגוריה הזו לקריאה למפתחים: הוא לא מייצר טקסט כלל, אלא מחזיר תשובות בעלות טיפוס עם ערכי ביטחון, במחיר של $0.042 למיליון טוקני קלט כשהפלט מחויב באפס. הבדיקה העצמאית הראשונה של Jev, שנערכה על ידי Every, ביצעה 777 שיפוטים על פני 37 מסמכים בפחות מ-0.7 שניות תמורת כרבע סנט לערך, ובדיקה שנייה מדדה חציון של 0.35 שניות לקטע לעומת 8.83 שניות עבור Claude Fable 5.1 במאמץ גבוה — בערך פי 25 מהר יותר בעלות של בערך 1/580, תוך איתור שישה מתוך שבעה פגמים שנשתלו בכוונה, בעוד Fable 5 איתר את כל השבעה. "טוב אבל לא מושלם" היה פסק הדין של Every, וזו הקריאה הנכונה בשורה אחת. Laya היא המשתתפת השלישית באותה צורה, מודל החלטות שעונה בלי לכתוב טוקן.
האם OpenAI בנתה את Decisions API בגלל Jev הוא בגדר ספקולציה. The New Stack, שדיווחה על כך ביום ההשקה, כינתה תגובה ל-TypeSafe "סבירה" וציינה ש-OpenAI כנראה מיהרה את ההכרזה לפני DevDay; OpenAI לא אמרה דבר כזה, והתזמון — הזמינות הכללית של Jev ב-21 בספטמבר, DevDay ב-29 בספטמבר — מרמז אך אינו ראיה. מה שכן אינו ספקולציה הוא ששני אלה עדיין אינם ניתנים להשוואה בציר שאכפת לקונים ממנו. Jev מפרסמת מחיר, מבנה לפי קריאה ותאריך GA. ה-Decisions API אינו מפרסם אף אחד מהשלושה.
היכן זה פועל, ומה לשמור חם לצידו
Decisions API היא האריזה של OpenAI עצמה. זה אינו מודל בקטלוג שלנו ואנחנו לא מנתבים אותו, כך שאם אתם רוצים את נקודת הקצה הספציפית הזו, OpenAI היא המקום שבו היא נמצאת. המודל שעליו היא בנויה הוא עניין אחר: GPT-6 Luna הוא נתיב פעיל ב-OrcaRouterבמחיר המחירון של OpenAI ללא כל תוספת — 0.10$ לקלט ו-0.50$ לפלט למיליון טוקנים, כשהמדרגה של מעל 272K נגבית ב-0.20$/0.75$ — ובשבעת הימים עד 30 בספטמבר הוא שירת דרכנו 3.23 מיליארד טוקנים בשיעור שגיאות של 0.18%.
זה משנה כיצד מפחיתים סיכון בפריוויו. הדרך השפויה לבדוק נקודת קצה של החלטה מוגבלת היא להשאיר את המסלול מבוסס-הפרומפט חם כגיבוי, מפני שפריוויו יכול לשנות מגבלות או תמחור בלי הודעה מוקדמת, והחלטה שיושבת על מסלול קריטי צריכה מקום לאן ללכת. השארת הגיבוי הזה על אותו מפתח כמו שאר המודלים שלך משמעה בלי חוזה שני ובלי שינוי קוד במסלול הגיבוי: API אחד ליותר מ-200 מודלים, עם מעבר אוטומטי לגיבוי בין ספקים כשאחד מהם מקרטע. ואם ההחלטה שלך היא צעד אחד בשרשרת ארוכה יותר, ה-DSL של הניתוב מרכיב מודלים לקריאה אחת, וזה בדיוק דפוס ה-orchestrator-plus-decider שסיקור Jev הנחיל — מודל גדול יותר מתכנן, ומודל קטן בוחר בכל צעד. את הדפוס הזה אפשר לבנות היום ממודלים שאנחנו מספקים; ה-Decisions API עצמו יישאר מחוץ לו עד ש-OpenAI תפתח אותו.
מי צריך לזוז, ומי צריך לחכות
אם הבעיה שלך היא משימת סיווג או ניתוב בנפח גבוה, שבה ענף שגוי הוא זול והפיך, התצוגה המקדימה שווה צורת בקשה וסט מתויג השבוע — היכולת אמיתית, האילוץ הוא שיפור אמיתי לעומת פענוח פרוזה, ותצוגה מקדימה היא הזמן הזול ביותר האפשרי ללמוד היכן נוחתות עלויות השגיאות שלה. אם ההחלטה שלך מאשרת כסף, שולחת הודעה ללקוח, או יושבת בין משתמש לתשלום, שום דבר השבוע לא משנה את החישוב שלך: אין מחיר מפורסם שעליו אפשר לבנות מודל, אין מגבלה מפורסמת לתכנן לפיה, אין SLA, ואין מילה אם אפשר לכוונן את הדבר על הנתונים שלך. ארבעת החסרים האלה הם מה ש"השקה רחבה" צריכה למלא, ועד ש-OpenAI תקרא להם בשם, הקריאה הכנה של Decisions API היא ממשק מבטיח עם שעון מהיר כפי שהספק הצהיר ובלי חשבון מצורף.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
