כרטיס כותרת ראשי עם הכיתוב 'OpenAI's Decisions API', עם כותרת משנה 'GPT-6 Luna מפסיק לשוחח ובוחר תשובה אחת', עם שלושה כרטיסים מעוגלים עם הכיתוב 'תשובה אחת מתוך רשימה שאתה מגדיר', 'לפי הצהרת הספק ~150 ms' ו'אין מחיר מפורסם עדיין', כותרת תחתונה עם הכיתוב 'נתוני OpenAI מדווחים על ידי הספק; אין עדיין מדידה עצמאית.', והלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

ה-Decisions API של OpenAI: GPT-6 Luna מפסיק לפטפט ובוחר תשובה אחת

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

GPT-6 Luna שוחרר ב-22 בספטמבר 2026 כשלב הזול בסולם ה-GPT-6 של OpenAI. מה שחדש ב-29 בספטמבר הוא משימה עבורו שאין לה שום קשר לשיחה. ה-Decisions API של OpenAI מקבל שאלה שאתם כתבתם, רשימה סופית של תשובות שאתם מתירים, ופיסת הקשר — טקסט או תמונה — ומחזיר אחת מאותן תשובות. לא פרוזה. לא פסקה שצריך לפענח ולקוות לטוב. בחירה אחת, כך שכרטיס תמיכה עובר לאחד מחמישה תורים, תמונה נוחתת בקטגוריית מודרציה אחת, או שסוכן בוחר את המהלך הבא שלו מתוך מדיניות שהגדרתם. הוא הוכרז ב-DevDay 2026 והוא נמצא כעת בתצוגה מוקדמת מוגבלת, כש-OpenAI אומרת ששחרור נרחב מתוכנן בימים הקרובים.

רוב מה שצוות צריך לפני שהוא בונה על זה טרם פורסם. אין מחיר לכל קריאה, אין הגבלה מוצהרת על מספר התשובות המועמדות שבקשה יכולה להכיל, אין הצהרה בדבר האם אפשר לכוונן אותו על הנתונים שלך, ו—נכון ל-30 בספטמבר—אין לו שום ערך בשום מקום באינדקס תיעוד המפתחים, ביומן השינויים או בתיעוד ה-API של OpenAI עצמה. בדקנו את שלושתם. היכולת קיימת כיום בסיכום ה-DevDay של OpenAI ובמה שדובר של OpenAI אמר לכתבים ביום ההשקה. לכן המשך המאמר שומר על שלוש רמות נפרדות באופן גלוי: מה ש-OpenAI אישרה, מה שמדידה אחת מיום ההשקה טוענת, ומה שאיש אינו יכול לדעת עדיין.

מהי בעצם החלטה מוגבלת

שתי גישות קיימות עושות את העבודה הזו בצורה גרועה, וה-API של Decisions מכוון לפער ביניהן. הראשונה היא לתת פרומפט למודל צ'אט: אתה כותב הוראה מדויקת שמבקשת ממנו לבחור מרשימה, הוא כותב לך משפט, ואם יש לך מזל אתה יכול לקרוא הסתברויות טוקנים מתוך התגובה כדי לקבל משהו שדומה לציון ביטחון. זה עובד, זה שורף טוקנים, ומספר הביטחון הוא ניחוש גס. השנייה היא אימון מסווג קטן: מהיר, זול, והוא זקוק לנתונים מתויגים בתוספת ריצת אימון מחדש בכל פעם שקבוצת התוויות משתנה.

מודל החלטות יושב בין אלה. הוא מקבל תוויות חדשות בפרומפט — באותו אופן שבו פרומפט מקבל אותן — אך מחזיר ציון או בחירה שמפתח יכול להסתעף עליהם בלי לנתח אותם, וזו התכונה שהייתה למיין ולמודל צ'אט מעולם לא הייתה. OpenAI אינה חדשה לצורה הזו: ה-API של Moderation שלה מחזיר ציונים לפי קטגוריה ולא טקסט מזה שנים, עם הבדל אחד שחשוב כאן. הקטגוריות של Moderation הן של OpenAI. הקטגוריות של Decisions API הן שלך.

המגבלה היא המוצר, וכדאי להיות מדויקים לגבי מה היא כן נותנת ומה היא לא נותנת. מרחב פלט סופי פירושו שכל ערך מותר ידוע מראש, כך שהאפליקציה שלך יכולה לדחות תשובה שהיא לא הגדירה, להצמיד רמת הרשאה שונה לכל ענף, ולפנות לבן אדם כאשר הביטחון או ההקשר דלים. היא גם הופכת הערכה לא־מקוונת למעשית, כי לכל מקרה בדיקה יש מחלקת מטרה ועלות מדידה כשהוא שגוי. מה שהיא לא נותנת הוא נכונות. מודל מוגבל עדיין יכול לבחור תשובה תקפה אך שגויה, להיות מונחה על ידי הקשר מטעה, או לרשת את ההטיה של הקטגוריות שכתבת.

הטענה בדבר 150 אלפיות שנייה, והמספר ש-OpenAI לא פרסמה

OpenAI אומרת ש-Decisions API מקבל החלטות בערך פי עשרה מהר יותר מ-GPT-6 Luna דרך ה-API הרגיל — בסדר גודל של 150 מילישניות לעומת כ-1.6 שניות. הנתון הזה נמסר על ידי הספק ואינו משוחזר; אין מדידה בלתי תלויה שלו ביומיים שחלפו מאז ההשקה, והסיכום של OpenAI עצמה אומר רק "קבלת החלטות בזמן אמת". לנתון לא מתלווים התפלגות השהיה, אזור, גודל קלט, רמת מקביליות או הסכם רמת שירות.

נתוני התעבורה שלנו אינם תחליף לאותו מבחן, אבל הם מסבירים מדוע ההתפלגות החסרה חשובה. במהלך שבעת הימים עד 30 בספטמבר, GPT-6 Luna המוגש דרך נתיב chat-completions הרגיל של OrcaRouter מציג חציון של 699 מילישניות ו-p95 של 7.6 שניות על פני עומס עבודה של 3.23 טוקנים — פער של יותר מסדר גודל בין האמצע לזנב. זהו צורת בקשה שונה מהחלטה עם אילוצים, ולכן זה אינו השוואה לטענה של 150 ms. זו הסיבה לכך ש-p50 כותרתי בודד הוא המספר הלא נכון שסביבו מתכננים דדליין. אם אתם בודקים את התצוגה המקדימה, תעדו חציון, p95 ו-p99 בנפרד עבור קלטי טקסט ותמונה, כללו זמן רשת וניסיונות חוזרים, ומדדו את הדדליין שבאמת יש למוצר שלכם — החלטת ניתוב עבור תור אסינכרוני והחלטה שיושבת בין קליק לתשלום אינן חולקות תקציב השהיה.

A single-column scoreboard titled 'GPT-6 Luna and the Decisions API - the scoreboard' with six rows: Decisions API price 'not published', candidate-answer limit 'not published', fine-tuning on your data 'no statement', stated decision latency '~150 ms vendor-reported', GPT-6 Luna input / output '$0.10 / $0.50 per 1M', and AA Intelligence Index at max effort '37.3', with a footer reading 'OpenAI figures vendor-reported; Index per Artificial Analysis; unpublished means blank, not zero.' and the OrcaRouter logo composited in the bottom-right corner.

תמחור: כמה עולה המודל הבסיסי, ולמה זה לא המחיר של ה-API

OpenAI לא פרסמה שום תעריף עבור Decisions API. כמו כן, אין זה בטוח להניח שתעריפי האסימונים של Luna חלים, מכיוון ש-Decisions API היא אריזה בפני עצמה — נקודת קצה שונה עם מגבלות שונות, ו-OpenAI אמרה שהיא תשתף פרטים נוספים "בהשקה רחבה". כל מי שמצטט לכם עלות לכל החלטה כרגע מסיק זאת.

מה שמפורסם הוא כרטיס התעריפים של המודל שעליו הוא מבוסס, כפי שנקרא מדף התמחור של OpenAI ב-30 בספטמבר 2026:

• קלט — $0.10 למיליון טוקנים, שהופך ל-$0.20 מעל 272,000 טוקני קלט
• פלט — $0.50 למיליון טוקנים, שהופך ל-$0.75 מעל 272,000 טוקני קלט
• קלט במטמון — $0.01 למיליון טוקנים; כתיבות למטמון מחויבות ב-$0.125, תוספת של 25% על התעריף שאינו במטמון
• עיבוד Batch ו-Flex — 50% מהתעריפים הרגילים; מצב Fast — פי 2 מהתעריפים החלים

קו ההקשר הארוך הוא זה שמכשיל אנשים, והוא עובד באותו אופן שבו הוא עובד בכל משפחת GPT-6: חצייה של 272,000 אסימוני קלט מתמחרת מחדש את כל הבקשה במדרג הגבוה יותר, ולא רק את העודף. API לקבלת החלטות שמעביר מסמך ארוך או סט תמונות גדול למודל הוא בדיוק סוג הקריאה שיכול לחצות את הקו הזה, וזה עוד דבר שמגבלות התצוגה המקדימה שלא פורסמו משאירות פתוח.

GPT-6 Luna במונחים של עצמה

אם מסירים את ה-API, המודל שמתחת הוא מודל חשיבה בתחתית משפחה בת שלוש דרגות — מתחת ל-GPT-6 Sol במחיר $2.00/$10.00 ול-GPT-6 Astra הדגלי במחיר $10.00/$50.00 — עם חלון הקשר של 1,050,000 טוקנים, תקרת פלט של 128,000 טוקנים, תאריך ידע עד 18 במאי 2026, ומאמץ החשיבה ניתן להגדרה על פני שישה ערכים מ-none עד max. הוא מקבל קלט טקסט ותמונה ומחזיר טקסט, ובתיעוד המפתחים של OpenAI עצמה ברירת המחדל של המאמץ היא medium. הסתייגות מעשית אחת מאותו עמוד, שאינה קשורה ל-Decisions API אך רלוונטית אם אתם מחברים את Luna כגיבוי: ב-Chat Completions, קריאה לפונקציות עובדת רק כשמאמץ החשיבה מוגדר ל-none. כלים בכל הגדרת מאמץ אחרת דורשים את Responses API.

מבחינת איכות, המספר העצמאי הוא מדד Intelligence Index של Artificial Analysis, שעומד על 37.3 עבור Luna במאמץ מרבי, לעומת 47.5 עבור GPT-6 Sol — פער של כעשרה נקודות, וזו הדרך ההוגנת לקרוא את פער המחיר של פי עשרים בקלט. אף אחד מהנתונים אינו אמירה על Decisions API, שמשימתה המצומצמת היא מדידה שונה לחלוטין ואין לה ציון מפורסם.

OpenAI's developer documentation page for the gpt-6-luna model, showing the model heading with compare and playground controls, the reasoning, speed and price tiles, the '$0.1 - $0.5' price range, text and image input with text output, a 1,050,000-token context window, a 128,000-token maximum output, a May 18 2026 knowledge cutoff, the note that reasoning.effort supports none, low, medium (default), high, xhigh and max, and the note that Chat Completions supports function calling only with reasoning effort set to none.

ג'ב, לאיה, והמסגור של "מערכת אחת"

ה-API של Decisions לא הגיע לשדה ריק. המודל של TypeSafe AI, Jev, שהושק ב-15 בספטמבר 2026 על ידי Diogo Almeida וזמין באופן כללי מאז 21 בספטמבר, הוא המודל שהפך את הקטגוריה הזו לקריאה למפתחים: הוא לא מייצר טקסט כלל, אלא מחזיר תשובות בעלות טיפוס עם ערכי ביטחון, במחיר של $0.042 למיליון טוקני קלט כשהפלט מחויב באפס. הבדיקה העצמאית הראשונה של Jev, שנערכה על ידי Every, ביצעה 777 שיפוטים על פני 37 מסמכים בפחות מ-0.7 שניות תמורת כרבע סנט לערך, ובדיקה שנייה מדדה חציון של 0.35 שניות לקטע לעומת 8.83 שניות עבור Claude Fable 5.1 במאמץ גבוה — בערך פי 25 מהר יותר בעלות של בערך 1/580, תוך איתור שישה מתוך שבעה פגמים שנשתלו בכוונה, בעוד Fable 5 איתר את כל השבעה. "טוב אבל לא מושלם" היה פסק הדין של Every, וזו הקריאה הנכונה בשורה אחת. Laya היא המשתתפת השלישית באותה צורה, מודל החלטות שעונה בלי לכתוב טוקן.

האם OpenAI בנתה את Decisions API בגלל Jev הוא בגדר ספקולציה. The New Stack, שדיווחה על כך ביום ההשקה, כינתה תגובה ל-TypeSafe "סבירה" וציינה ש-OpenAI כנראה מיהרה את ההכרזה לפני DevDay; OpenAI לא אמרה דבר כזה, והתזמון — הזמינות הכללית של Jev ב-21 בספטמבר, DevDay ב-29 בספטמבר — מרמז אך אינו ראיה. מה שכן אינו ספקולציה הוא ששני אלה עדיין אינם ניתנים להשוואה בציר שאכפת לקונים ממנו. Jev מפרסמת מחיר, מבנה לפי קריאה ותאריך GA. ה-Decisions API אינו מפרסם אף אחד מהשלושה.

היכן זה פועל, ומה לשמור חם לצידו

Decisions API היא האריזה של OpenAI עצמה. זה אינו מודל בקטלוג שלנו ואנחנו לא מנתבים אותו, כך שאם אתם רוצים את נקודת הקצה הספציפית הזו, OpenAI היא המקום שבו היא נמצאת. המודל שעליו היא בנויה הוא עניין אחר: GPT-6 Luna הוא נתיב פעיל ב-OrcaRouterבמחיר המחירון של OpenAI ללא כל תוספת — 0.10$ לקלט ו-0.50$ לפלט למיליון טוקנים, כשהמדרגה של מעל 272K נגבית ב-0.20$/0.75$ — ובשבעת הימים עד 30 בספטמבר הוא שירת דרכנו 3.23 מיליארד טוקנים בשיעור שגיאות של 0.18%.

זה משנה כיצד מפחיתים סיכון בפריוויו. הדרך השפויה לבדוק נקודת קצה של החלטה מוגבלת היא להשאיר את המסלול מבוסס-הפרומפט חם כגיבוי, מפני שפריוויו יכול לשנות מגבלות או תמחור בלי הודעה מוקדמת, והחלטה שיושבת על מסלול קריטי צריכה מקום לאן ללכת. השארת הגיבוי הזה על אותו מפתח כמו שאר המודלים שלך משמעה בלי חוזה שני ובלי שינוי קוד במסלול הגיבוי: API אחד ליותר מ-200 מודלים, עם מעבר אוטומטי לגיבוי בין ספקים כשאחד מהם מקרטע. ואם ההחלטה שלך היא צעד אחד בשרשרת ארוכה יותר, ה-DSL של הניתוב מרכיב מודלים לקריאה אחת, וזה בדיוק דפוס ה-orchestrator-plus-decider שסיקור Jev הנחיל — מודל גדול יותר מתכנן, ומודל קטן בוחר בכל צעד. את הדפוס הזה אפשר לבנות היום ממודלים שאנחנו מספקים; ה-Decisions API עצמו יישאר מחוץ לו עד ש-OpenAI תפתח אותו.

מי צריך לזוז, ומי צריך לחכות

אם הבעיה שלך היא משימת סיווג או ניתוב בנפח גבוה, שבה ענף שגוי הוא זול והפיך, התצוגה המקדימה שווה צורת בקשה וסט מתויג השבוע — היכולת אמיתית, האילוץ הוא שיפור אמיתי לעומת פענוח פרוזה, ותצוגה מקדימה היא הזמן הזול ביותר האפשרי ללמוד היכן נוחתות עלויות השגיאות שלה. אם ההחלטה שלך מאשרת כסף, שולחת הודעה ללקוח, או יושבת בין משתמש לתשלום, שום דבר השבוע לא משנה את החישוב שלך: אין מחיר מפורסם שעליו אפשר לבנות מודל, אין מגבלה מפורסמת לתכנן לפיה, אין SLA, ואין מילה אם אפשר לכוונן את הדבר על הנתונים שלך. ארבעת החסרים האלה הם מה ש"השקה רחבה" צריכה למלא, ועד ש-OpenAI תקרא להם בשם, הקריאה הכנה של Decisions API היא ממשק מבטיח עם שעון מהיר כפי שהספק הצהיר ובלי חשבון מצורף.

OrcaRouter's model page for openai/gpt-6-luna, showing the model name and OpenAI attribution dated 2026-09-22, capability pills for vision, tools, JSON and reasoning, the description of GPT-6 Luna as the fast cost-efficient model below GPT-6 Sol, the /v1/chat/completions route, a $0.10 input and $0.50 output rate per million tokens with a 699 ms p50 time to first token, a 1M-token context with 128K maximum output, and 3234.7M tokens of traffic.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית