OpenAI הורידה את מחירי ה-API של GPT-5.6: מה השתנה, למה, ואיך להשיג את זה
Guides & Insights

OpenAI הורידה את מחירי ה-API של GPT-5.6: מה השתנה, למה, ואיך להשיג את זה

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-30 ביולי 2026, OpenAI הורידה את מחירי ה-API של שני דגמי ה-GPT-5.6 בעלי העלות הנמוכה יותר שלה — תוך הפחתה חדה של השכבה הזולה ביותר וקיצוץ בשכבה הבינונית. שלושה שבועות לאחר מכן היא פנתה לדגם הדגל: ב-21 באוגוסט 2026, OpenAI הודיעה שמחירי ה-API של GPT-5.6 Sol יורדים ביותר מ-20% בשלושת החודשים הקרובים, בעוד החברה פועלת להריץ את המודל ביעילות רבה יותר. מאמר זה מסביר בדיוק מה השתנה בשני הסבבים, ההנדסה שמאחוריהם, כיצד המחירים החדשים משתווים לאלה של המתחרים, העלויות הנסתרות שכדאי לשים לב אליהן, כיצד לקצץ עוד יותר בחשבון שלכם — וכיצד המחירים הנמוכים כבר פעילים בOrcaRouter ברווח של 0%.

כל נתון להלן מסומן לפי מקור. התמחור הוא למיליון טוקנים (קלט / פלט). התעריפים של Luna ו-Terra משקפים את כרטיס התעריפים של OpenAI מיום 30 ביולי 2026, כפי שדווח בכלי תקשורת כולל Unite.AI; ההפחתה של Sol משקפת את ההכרזה של OpenAI מיום 21 באוגוסט 2026, עם מחירים לטוקן כפי שדווחו בכלי תקשורת כולל Runtimewire ו-Reuters. דפי מעבר המודלים של OrcaRouter מציגים את אותם מספרים; נתוני המתחרים מיוחסים. המחירים משתנים — יש לוודא לפני שבונים.

בקיצור. OpenAI הורידה את המחיר של GPT-5.6 Luna ל-$0.20 / $1.20 (מ-$1 / $6, הנחה של ~80%) ואת GPT-5.6 Terra ל-$2 / $12 (מ-$2.50 / $15, הנחה של ~20%) ב-30 ביולי. ב-21 באוגוסט היא הרחיבה את ההנחה לדגם הדגל: מחירי ה-API של GPT-5.6 Sol יורדים ביותר מ-20% לשלושת החודשים הקרובים — ל-$4 / $20 למיליון טוקנים מ-$5 / $30, לפי OpenAI — בזמן שקרדיטים מבוססי-טוקנים של Codex ו-ChatGPT Work קונים יותר, והשימוש במנוי נותר ללא שינוי. שני הישגי יעילות מימנו את קיצוץ המחירים ביולי: ליבות GPU שכתובות מחדש (עלות שרת נמוכה בכ-20%) ומודל טיוטת speculative-decoding שעוצב מחדש (ייצור טוקנים מהיר ב-15%+). אם אתה מנתב דרך נקודת קצה נייטרלית-ספקית ללא תוספת מחיר (0%) כמו OrcaRouter, התעריפים החדשים כבר פעילים — אותו מחיר, API אחד תואם OpenAI, עם כל דגם מתחרה לצידו כדי להשוות ולנתב ביניהם.

נקודות עיקריות

• GPT-5.6 Luna: כעת $0.20 / $1.20 ל-1M טוקנים, ירידה מ-$1 / $6 — קיצוץ של כ-80%.

• GPT-5.6 Terra: כעת $2 / $12, ירידה מ-$2.50 / $15 — קיצוץ של כ-20%.

• GPT-5.6 Sol (דגם הדגל): עכשיו $4 / $20 לשלושת החודשים הקרובים, במקום $5 / $30 — קיצוץ של מעל 20% שהוכרז ב-21 באוגוסט 2026.

קרדיטים מבוססי אסימונים של Codex ו-ChatGPT Work קונים יותר: קלט Sol יורד ל-100 קרדיטים ופלט ל-500 קרדיטים למיליון אסימונים (מ-125 / 750).

• המנויים ללא שינוי: השימוש הכלול ב-Plus, Pro ו-Business, מגבלות חמש השעות השבועיות ותעריפי האשראי הקודמים לא נפגעו.

• למה: OpenAI הציגה את שני הסבבים כדיבידנדים של יעילות — גרעיני GPU ייצור שנכתבו מחדש (כ-20% עלות שרת נמוכה יותר) בתוספת עיצוב מחדש של מודל טיוטה לפענוח ספקולטיבי (15%+ יעילות יצירת טוקנים), לפי פוסט הנדסה של OpenAI מ-29 ביולי.

• איך להשיג את זה: הקיצוצים כבר משתקפים ב-OrcaRouter (ללא תוספת מחיר) — Luna ב-$0.20 / $1.20, Sol ב-$4 / $20 — דרך נקודת קצה אחת תואמת OpenAI.

מה בדיוק השתנה?

משפחת GPT-5.6 של OpenAI פועלת כסולם דרגות: Luna (מהירה, הזולה ביותר), Terra (בינונית) ו-Sol (דגל). הקיצוץ ב-30 ביולי פגע בשתי הדרגות הזולות יותר. לפי כרטיס המחירים המדווח, GPT-5.6 Luna ירדה מ-$1 / $6 ל-$0.20 / $1.20 למיליון אסימוני קלט/פלט — הפחתה של כ-80% גם בקלט וגם בפלט — ו-GPT-5.6 Terra ירדה מ-$2.50 / $15 ל-$2 / $12, כ-20%. GPT-5.6 Sol, דגל הדגם שנבנה עבור החשיבה הקשה ביותר וקידוד סוכני, לא נגעו בו באותו יום — אבל ב-21 באוגוסט 2026 הכריזה OpenAI על קיצוץ זמני גם עבורו: מחירי ה-API יורדים ביותר מ-20% לשלושת החודשים הקרובים, ל-$4 למיליון אסימוני קלט ו-$20 למיליון אסימוני פלט, כשהקלט המאוחסן במטמון יורד מ-$0.50 ל-$0.40. באותה הודעה נאמר שהזיכויים שאתה קונה שווים יותר ב-Codex בתוכניות המבוססות על אסימונים, והשימוש הכלול במנוי שלך נשאר זהה.

התעריף הבסיסי לכל טוקן אינו הסיפור המלא. תמחור GPT-5.6 כולל גם דרגות אורך קלט (הקשרים ארוכים מאוד עוברים לתעריף גבוה יותר), הנחת מטמון להנחיות (קלט שמור במטמון זול בהרבה מקלט חדש), ואפשרות אצווה (משימות אסינכרוניות בהנחה). כל שלושתם ממשיכים לחול גם לאחר הקיצוץ, כך שהמחיר האפקטיבי עבור עומס עבודה כבד במטמון או באצווה יכול להיות נמוך עוד יותר. שים לב לדרגת ההקשר הארוך בכיוון ההפוך: הזנת הנחיות ענקיות יכולה להעלות אותך לדרגה גבוהה יותר.

שתי האופטימיזציות שמאחורי הקיצוץ

זו לא הייתה מחווה של מכירה בהפסד — OpenAI הציגה אותה כדיבידנד של יעילות. בפוסט הנדסי מ-29 ביולי 2026, חברי הצוות הטכני של OpenAI תיארו אופטימיזציות על פני שכבת ה-inference ורתמת הסוכן (agent harness) שמאחורי Codex ו-ChatGPT Work. שניים בולטים במיוחד. ראשית, שכתוב של GPU kernels על פני תשתית הייצור — כשסול (Sol), שרץ בתוך Codex, משמש לשכתב את הקרנלים של החברה עצמה — שלפי OpenAI קיצצו את עלויות השרת מקצה לקצה בכ-20%. שנית, מודל draft שעוצב מחדש ל-speculative decoding, שדווח כי שיפר את יעילות הפקת הטוקנים ביותר מ-15%. עלות שרת נמוכה יותר, שמתורגמת ללקוחות כמחירים נמוכים יותר בשכבות הנפח הגבוהות, היא הסיפור — וזו הצצה ללולאת משוב שכל התעשייה רודפת אחריה: שימוש במודלים מתקדמים כדי לייעל את התשתית שמשרתת אותם.

הודעת הקיצוץ ב-Sol שפורסמה ב-21 באוגוסט נושאת את אותו ניסוח. לפי OpenAI, ההפחתה — יותר מ-20% לשלושת החודשים הקרובים — מגיעה בזמן שהחברה הופכת את הפעלת המודל ליעילה יותר, והיא זמנית במפורש ולא איפוס מחירים קבוע.

כיצד המחירים החדשים משתווים

ההוזלה מכוונת ישירות לתחרות. לפי דיווח של Unite.AI, המחירים החדשים של Luna — $0.20 / $1.20 — נמוכים מאלה של Haiku 4.5 של Anthropic בכפי 5 בערך בקלט ופי 4 בערך בפלט, ו-Terra במחירים החדשים של $2 / $12 נופלת מתחת למחיר הסטנדרטי של Claude Sonnet 5 (שמדווח על $3 / $15 וייכנס לתוקף אחרי 31 באוגוסט 2026). בתחום המודלים פתוחי המשקל, Luna נמצאת כעת קרובה לרצפת ההיסק הזול שנקבעה על ידי סדרת V4 של DeepSeek ו-GLM-5.2 של Zhipu (בערך $1.20 / $4.10), כשהמדרגות של Qwen של אליבאבא ו-Gemini Flash של גוגל נמצאות באותו אזור. ההפחתה הזמנית של Sol ל-$4 / $20 שומרת על מודל הדגל הרבה מעל מדרגות הנפח שלו אך גוזמת מהפרמיה — וההפחתה בשליש באסימוני הפלט היא המשמעותית ביותר עבור עומסי עבודה עתירי פלט של סוכני AI. הסיקור של המהלך מציין שהוא מגיע בזמן ש-OpenAI מתמודדת עם תחרות גוברת מצד Anthropic ומודלים סיניים של בינה מלאכותית.

ההיסק ממשיך להיות זול יותר

במבט-על, הקיצוץ הזה משתלב במגמה רבת-שנים: העלות של רמת יכולות נתונה ירדה בחדות, דור אחרי דור, כשהמעבדות מפיקות יותר תפוקה מאותה חומרה. רמות התמחור הוותיקות יותר של OpenAI עצמה ממחישות את הירידה ההדרגתית לאורך זמן, וכל פריצת דרך ביעילות — קרנלים טובים יותר, פענוח ספקולטיבי, קשב זול יותר — נוטה להתבטא כהורדת מחיר בתוך חודשים. עבור הלקוחות, המשמעות המעשית היא לתכנן בהתאם לעולם שבו ההיסק נהיה זול יותר בקצב צפוי: לא להתחייב יתר על המידה לתמחור של מודל אחד, ולשמור על עלות מעבר נמוכה.

העלות הנסתרת שכדאי לשים לב אליה: אסימוני חשיבה

מודלי GPT-5.6 הם מודלי חשיבה, וזה מעצב את ההוצאה בעולם האמיתי. כאשר החשיבה מופעלת, המודל פולט אסימוני חשיבה פנימיים שמחויבים כפלט — כך שהעלות האפקטיבית של הפלט יכולה להיות גבוהה יותר ממה שהערכה נאיבית של "מילים בתשובה" מציעה, במיוחד עבור הנחיות קשות עם מאמץ חשיבה גבוה. הפתרון הוא לכוונן את מאמץ החשיבה לפי המשימה (נמוך או כבוי לקריאות פשוטות), להגביל את הפלט היכן שאפשר, ולמדוד את ניצול האסימונים בפועל במקום להניח. תעריף זול יותר לאסימון עוזר, אבל שליטה במספר האסימונים שאתה מייצר עוזרת יותר.

מה זה אומר למפתחים

אם אתם משתמשים ב-GPT-5.6 Luna או Terra לעבודה בהיקפים גדולים — סיווג, חילוץ, ניתוב, סוכנים קלים, צ׳אט — החשבון שלכם ירד, ובמקרים מסוימים ברובו, ללא צורך בשינוי קוד. זה הופך את דרגות הנפח לאטרקטיביות עוד יותר עבור עומסי עבודה רגישים לעלות ומצמצם את פער המחירים מול מודלים פתוחים זולים. גם התמחור של דגם הדגל השתנה, לפחות בינתיים: Sol ב-$4 / $20 לשלושת החודשים הקרובים מוריד את העלות של עבודה עתירת חשיבה ועבודה אג׳נטית בדרגה העליונה, וזיכויים מבוססי-טוקנים של Codex ו-ChatGPT Work מספיקים ליותר. זו עדיין בחירת פרימיום למשימות הקשות ביותר — רק זולה יותר מבעבר. התבנית המנצחת זהה: ניתוב לפי קושי — דרגות זולות (או מודלים פתוחים זולים) עבור 80% הקלים, ודגם הדגל רק במקום שבו הוא מצדיק את עלותו.

איך לקצץ עוד בחשבון שלך

הפחתת המחיר היא קרקע לבנייה, לא קו הסיום. המנופים הנוספים הגדולים ביותר: מטמון הנחיות (לעשות שימוש חוזר בהנחיית מערכת יציבה או בהקשר ארוך ולשלם את תעריף הקלט השמור במטמון הנמוך בהרבה); אפשרות ה-batch (הרצת משימות לא דחופות באופן אסינכרוני בהנחה); ניתוב לפי דרגה ומודל (שליחת כל בקשה למודל הזול ביותר שיכול לטפל בה, כולל מודלים פתוחים); ו-בקרת חשיבה (אל תשלמו עבור חשיבה עמוקה בקריאות טריוויאליות). בשילוב, אלה מקצצים בקביעות חשבונות אמיתיים הרבה יותר מכל שינוי תעריף בודד. כנקודת עיגון קונקרטית: ב-10 מיליון טוקנים בחודש עם נתח של 70% קלט, התעריפים החדשים של Luna מסתכמים בכ-5 דולר לחודש (כ-4.37 דולר עם שמירה במטמון); אותו נפח ב-Sol הוא כ-125 דולר לחודש — הטיעון הברור ביותר לניתוב לפי קושי.

איך לתפוס את המחירים הנמוכים מיד

הנה החלק שמחבר את כל זה. OrcaRouter גובה תוספת של 0% ומעביר את המחירים של הספקים ישירות, כך שההנחות של OpenAI כבר פעילות ב-OrcaRouter: GPT-5.6 Luna מציג $0.20 / $1.20, Terra $2 / $12, ו-GPT-5.6 Sol $4 / $20 בעמודות המודלים ממש עכשיו — אותם תעריפים כמו בכרטיס של OpenAI עצמה, נגישים דרך נקודת קצה אחת תואמת OpenAI לצד יותר מ-185 מודלים נוספים. אתם מקבלים את ההנחות ללא מיגרציה, ויכולים להשוות מחירים של Sol, Luna ו-Terra מול DeepSeek, GLM, Qwen, Gemini ו-Claude במקום אחד, ואז לנתב כל בקשה למודל הזול ביותר למשימה. יש גם מסלול חינמי ודף Offers לחיסכון נוסף.

הקיצוצים כבר פעילים ב-OrcaRouter: GPT-5.6 Luna במחיר $0.20 / $1.20 ו-GPT-5.6 Sol במחיר $4 / $20 למיליון טוקנים, ומועברים ב-0% תוספת.

תכנן מסלול לפי קושי וחסוך אפילו יותר

החשבון הזול ביותר אינו מודל אחד — אלא המודל הנכון לכל בקשה. מכיוון ש-OrcaRouter חושף את כל התחום דרך נקודת קצה אחת, אתה יכול לשלוח קריאות קלות ונפחיות ל-Luna או למודל פתוח זול, ולשמור את Sol או דגם דגל אחר לקשות, תוך מעבר באמצעות שינוי קונפיגורציה ולא אינטגרציה מחדש. הוזלת מחיר על Luna הופכת את האסטרטגיה של ניתוב לפי קושי לזולה עוד יותר, והנחת Sol הזמנית מורידה גם את עלות הקריאות הקשות — מבלי שתצטרך לשנות דבר בתשתית.

שאלות נפוצות

בכמה הורידה OpenAI את המחירים של GPT-5.6?

GPT-5.6 Luna ירדה מ-$1 / $6 ל-$0.20 / $1.20 למיליון טוקנים (כ-80%), ו-GPT-5.6 Terra מ-$2.50 / $15 ל-$2 / $12 (כ-20%). ב-21 באוגוסט 2026, OpenAI גם הורידה את המחיר של GPT-5.6 Sol מ-$5 / $30 ל-$4 / $20 לשלושת החודשים הבאים.

מתי נכנסה לתוקף הפחתת המחיר?

קיצוצי Luna ו-Terra נכנסו לתוקף ב-30 ביולי 2026, בכרטיס התעריפים שפורסם. OpenAI הודיעה על ההפחתה הזמנית של Sol ב-21 באוגוסט 2026, לשלושת החודשים הבאים.

מדוע OpenAI הורידה את המחירים?

OpenAI מייחסת את קיצוץ המחירים של יולי לאופטימיזציות הסקה — כתיבה מחדש של ליבות GPU בייצור (כ-20% נמוך יותר בעלות השירות) ומודל טיוטה מחודש לפענוח ספקולטיבי (יעילות ייצור טוקנים גבוהה ב-15%+) — לפי פוסט הנדסי מ-29 ביולי 2026. היא הציגה את קיצוץ המחיר של Sol באותה צורה, כצעד שנעשה בזמן שהמודל נעשה זול יותר להפעלה, בשוק עם תחרות גוברת.

האם הדגל (Sol) ירד במחיר?

כן — זמנית. הקיצוץ ב-30 ביולי הותיר את GPT-5.6 Sol במחיר של 5$ / 30$, אבל ב-21 באוגוסט 2026 הודיעה OpenAI על הפחתת מחיר של יותר מ-20% לשלושת החודשים הבאים, ל-4$ / 20$ למיליון טוקנים. גם קרדיטים מבוססי טוקנים של Codex ו-ChatGPT Work קונים יותר, בעוד השימוש במנוי נותר ללא שינוי.

איך המחירים החדשים משתווים ל-Anthropic ולמודלים פתוחים?

לפי הדיווחים, Luna כעת זולה מ-Haiku 4.5 של Anthropic בפי כ-5 על קלט / פי 4 על פלט, וטרה נמצאת מתחת למחיר הסטנדרטי של Claude Sonnet 5 (3$ / 15$). Luna גם ממוקמת קרוב לרצפת המחירים הזולה של מודלים פתוחים שנקבעה על ידי DeepSeek ו-GLM-5.2.

מה המלכוד עם אסימוני חשיבה?

GPT-5.6 הם מודלים של חשיבה; אסימוני חשיבה פנימיים מחויבים כפלט, כך שעלות הפלט האפקטיבית יכולה לחרוג מהערכה נאיבית. כוונן את מאמץ החשיבה והגבל את הפלט כדי לשלוט בכך.

איך אני משיג את המחירים הנמוכים החדשים?

הם כבר פעילים ב-API של OpenAI, ובתוספת של 0%, ב-OrcaRouter — שם GPT-5.6 Luna מציג $0.20 / $1.20 ו-GPT-5.6 Sol $4 / $20 — דרך נקודת קצה אחת תואמת OpenAI, ללא צורך בשינוי קוד.

השורה התחתונה

הקיצוץ של OpenAI ב-30 ביולי הפך את GPT-5.6 Luna ו-Terra לזולים בהרבה עבור עבודה בנפח גבוה, וההכרזה שלה ב-21 באוגוסט מרחיבה את הסיפור לדגם הדגל: GPT-5.6 Sol יורד ל-4$ / 20$ לשלושת החודשים הקרובים, בעוד שזיכיונות האסימונים של Codex קונים יותר והשימוש במנוי נותר ללא שינוי. שני הסבבים הם דיבידנדים של יעילות — שכתובים של קרנל ורווחים מפענוח ספקולטיבי מצד אחד, ושרת זול יותר להרצה מצד שני — ותגובה ברורה למלחמת מחירים אמיתית. נתבו לפי רמת קושי, הסתמכו על קאשינג ואצווה, ושלוט בטוקנים של חשיבה כדי לחסוך הכי הרבה. ובגלל ש-OrcaRouter מעבירה את תמחור הספקים במרווח של 0%, התעריפים הנמוכים כבר פעילים שם — Luna ב-0.20$ / 1.20$, Sol ב-4$ / 20$ — אותו מחיר, נקודת קצה אחת תואמת OpenAI, כל שדה המודלים במקום אחד. קחו את הקיצוצים בלי לשנות שורת קוד, ותנו לכל בקשה לבחור את המודל הזול ביותר שיכול לעשות את העבודה.