
GPT-5.6 Luna Max: איך מפתחים באמת משתמשים בו ב-Codex — ואיפה הוא נשבר
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 221 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
ב-1 באוגוסט החל קובץ הגדרה בן ארבע שורות להסתובב ב-X. הוא יוצר סוכן Codex בשם luna_worker, מגדיר את המודל שלו ל-gpt-5.6-luna, מגדיר את מאמץ החשיבה שלו ל-max, ומוסר לו את החצי המשעמם של העבודה שלך בעוד GPT-5.6 Sol שומר על התוכנית. תוך ימים, אותו מתכון פורסם מחדש באנגלית, בסינית, ביפנית, בקוריאנית, בספרדית ובערבית, ותוסף שנבנה על אותו רעיון חצה 1,300 כוכבי GitHub בארבעה ימים. זו גם, פחות או יותר ביום שבו הוא הפך לוויראלי, הדרך הלא נכונה לחבר אותו: מחבר התוסף הזה הוציא את GPT-5.6 Luna מהפרויקט שלו תוך 48 שעות, בפומבי, כי עמית אמר לו שזה לא עובד כתת-סוכן של Codex — ואז החזיר אותו יומיים אחר כך, מחובר בדרך שונה לחלוטין.
כל הקשת הסיפורית הזו התרחשה בתוך שבוע אחד, וזה הדבר הכי שימושי שמישהו פרסם על המודל הזה. זה אומר לך שתבנית העובד הזול היא אמיתית, שהדרך הברורה לחבר את זה היא הדרך השגויה, ושההבדל בין שתי אלה הוא רוב הערך. כל מה במאמר הזה שנוגע לטכניקה מגיע ממפתחים שפרסמו את התוצאות שלהם בין 30 ביולי ל-5 באוגוסט 2026 — לא מהתיעוד של החברה, שמתאר את GPT-5.6 Luna כמודל ל"עומסי עבודה רגישים לעלות ובעלי נפח גבוה" ולא אומר דבר על כל זה. היכן שמספר נמדד על ידי צד שלישי בלתי תלוי, אנחנו אומרים זאת; היכן שזה יומן ההפעלה של מפתח אחד, אנחנו אומרים גם את זה, כולל כשהם סותרים זה את זה. והם אכן סותרים, הרבה.
מה זה "Luna Max", ולמה רוב האנשים לעולם לא רואים אותו
אין מודל בשם Luna Max. ישנם שני חוגות, ו-Luna Max הוא אחד משילוביהם: השכבה הזולה ביותר במשפחת GPT-5.6, המופעלת בהגדרת החשיבה העמוקה ביותר. חוגת השכבה בוחרת בין GPT-5.6 Sol, GPT-5.6 Terra ו-GPT-5.6 Luna. לחוגת המאמץ יש שש עמדות — ללא, נמוך, בינוני, גבוה, גבוה-אקסטרה ומקסימום — והיא קובעת כמה חשיבה המודל עושה לפני שהוא עונה.
כמעט אף אחד לא שילב את השכבה הזולה עם ההגדרה העמוקה, מסיבה שגרתית: max מוסתר כברירת מחדל. באפליקציית הדסקטופ של ChatGPT/Codex זה נמצא תחת Settings → Configuration → Available reasoning efforts, שם הרשימה מגיעה עם האפשרות העליונה לא מסומנת. שישה מפתחים נפרדים פרסמו את אותו תיקון של שלוש לחיצות בשבוע הראשון של אוגוסט, וזה אינדיקטור טוב לכמה אנשים הריצו את Luna בעומק ברירת המחדל ושפטו את המודל לפי זה. בצד ה-API אין מתג לחפש: אתה מעביר את מזהה המודל gpt-5.6-luna ולהגדיר את מאמץ החשיבה ל־max בגוף הבקשה, וזה כל השינוי.
השלכה אחת שכדאי להפנים לפני שתקראו בנצ'מרק כלשהו: כשהאתר Artificial Analysis מפרסם ציון אינטליגנציה למודל הזה, כותרת הדף היא GPT-5.6 Luna (max). הנתון העצמאי שכולם מצטטים עבור Luna הוא תצורת המאמץ המרבי. אם אתם מריצים את ברירת המחדל ותוהים למה החוויה שלכם לא תואמת ללוח המובילים, זו הסיבה.
החוגה שאיש לא מסביר: המאמץ משנה את מספר הטוקנים, לא את מחיר הטוקן
העלאת מאמץ החשיבה לא מעבירה אותך לדרגת מחיר גבוהה יותר. GPT-5.6 Luna עולה $0.20 לכל מיליון טוקני קלט ו-$1.20 לכל מיליון טוקני פלט בכל הגדרת מאמץ. מה שמשתנה הוא מספר הטוקנים שהמודל משקיע כדי להגיע לתשובה — ובמקסימום, הוא משקיע הרבה.
Artificial Analysis מדדה זאת במסגרת הרצת מדד ה-Intelligence Index שלה, והמספרים הם האישור העצמאי הברור ביותר לתלונותיהם של אנשי המקצוע:
• ציון — 51 במדד האינטליגנציה של Artificial Analysis, לעומת חציון של 17 עבור המודלים שהוא ממדד באותה קטגוריה.
• מילוליות — 130M אסימוני פלט הופקו במהלך ריצת האינדקס, לעומת חציון של 61M. Artificial Analysis מסמן את המודל כ"מילולי מאוד".
• מהירות גולמית — 182.5 אסימוני פלט בשנייה, מקום 16 מתוך 163 דגמים. מהיר לכל אסימון.
• זמן עד לטוקן הראשון — בערך 136 שניות במאמץ מקסימלי, ש-Artificial Analysis מציינת שנמצא בקצה הגבוה אפילו עבור מודלי חשיבה בטווח המחירים הזה.
• סך ההוצאה — $174.06 כדי להעריך את המודל על כל האינדקס.
קרא את השורות השלישית והרביעית יחד, כי הזוג הזה הוא כל חוויית המשתמש. Luna במקסימום מזרימה טוקנים במהירות, אבל לוקח לה דקות להתחיל, ולאחר מכן היא מייצרת בערך פי שניים טוקנים ממה שמודל טיפוסי מייצר על אותה עבודה. לכן התלונה הנפוצה ביותר בדיווחי השטח היא לא "זה שגוי", אלא "זה איטי" — ולכן המחיר הזול לא מתורגם לסשן זול באופן יחסי. אתה קונה תעריף נמוך על כמות טוקנים גבוהה.
לשם השוואה: בעמוד המודל שלנו עבור GPT-5.6 Luna, החציון הנצפה של הזמן עד לטוקן הראשון על פני שבעה ימים של תעבורה אמיתית הוא 1.78 שניות, עם אחוזון 95 של 9.26 שניות. אין זו סתירה לנתון של 136 שניות — מדובר באותו מודל שנמדד על פני מגוון הגדרות מאמץ, שרובן אינן מקסימליות. השהייה שאתה מקבל היא תכונה של החוגה שאתה מגדיר, לא של נקודת הקצה שאליה אתה קורא.

האם Luna Max באמת "Sol Medium בששית מהמחיר"?
זוהי הטענה שהפכה את התבנית לוויראלית, ומקורה בדן מקאטייר, שניסח אותה כלונה בהיגיון מקסימלי שנוחת סביב GPT-5.6, סול בהיגיון בינוני, או קלוד אופוס 5 בהיגיון בינוני, בערך בששית מהעלות. היא חזרה על עצמה על ידי חשבונות רבים, לעיתים כשהסייגים הוסרו, וכדאי להפריד בין מה שנמדד לבין מה שהוא וייבים.
לוח התוצאות העצמאי תומך בחלק העלות של הטענה בצורה נחרצת ובחלק היכולות רק באופן חלקי. בהרצת אותה ערכת בדיקות במאמץ מרבי על פני דרגות, Artificial Analysis רשמה את Luna עם מדד 51 במחיר 174 דולר, Terra עם 55 ב-1,403 דולר, Kimi K3 עם 57 ב-2,437 דולר, ו-Sol עם 59 ב-2,824 דולר. Luna מוותרת על שמונה נקודות מדד ל-Sol ועולה בערך חלק אחד מתוך שש עשרה כדי לבצע איתה את אותה העבודה.

לוח התוצאות העצמאי התחדד ב־13 באוגוסט, כאשר DeepSWE פרסמה את גרסה 1.1 — עדכון של מדד ההנדסה ארוך הטווח שלה, ששומר על 113 משימות מקוריות שנלקחו מ־91 מאגרי קוד בחמש שפות, אך כעת מדרג כל תיקון באמצעות הרצת ה־diff שבוצע בקונטיינר מבודד, מה שקשה יותר לרמות. בלוח המעודכן, כל שלוש רמות ה־GPT-5.6 במאמץ מקסימלי נוחתות במקום שבו הדו"ח של יולי הציב אותן: Luna Max עם 67.2% pass@1 ו־0.61 דולר למשימה, Terra Max בסביבות 70%, Sol Max עם 73% תמורת 8.39 דולר — שש נקודות אחוז של הצלחה תמורת בערך פי ארבעה עשר מהכסף.
ההשוואה שראויה למבט שני נמצאת מתחת ל-Luna, לא מעליה. Claude Sonnet 5 Max משיג 54% על אותן 113 משימות — כשלוש עשרה נקודות מאחורי Luna Max — במחיר של $26.40 למשימה, שהם בערך פי 44 ממה ש-Luna שילמה עבור אותו פתרון. Luna Max גם עוקפת את Gemini 3.7 Flash (65% עבור התצורה במאמץ גבוה על אותו לוח); הפוסט הקהילתי שסימן את הסיבוב הזה מעמיד את הפער מול Gemini 3.7 Flash Medium על כ-1.7 נקודות. DeepSWE הוא מתקן הבדיקות העצמאי של Datacurve, לא הערכה של חברה — הטענה של החברה עצמה שמשפחת GPT-5.6 קבעה תוצאות מתקדמות ביותר על Terminal-Bench 2.1 ו-DeepSWE נותרה קביעה נפרדת המדווחת על ידי הספק.
ובכן, ישנן עדויות שטח, שהן באמת חלוקות. פאוול הורין הריץ מבחן השוואתי משלו לתיקון באגים — 105 באגים שהושתלו בשני קוד-בסיסים אמיתיים, שיפוט עיוור, סבב אחד לכל מודל — ודיווח ש-Luna במאמץ מקסימלי תיקנה 33 באגים בעלות של $1.80, לעומת Claude Fable 5 שתיקן 24 באגים בעלות $68. בכיוון ההפוך, דייגו האז בילה יומיים בהרצת סשנים תואמים והגיע למסקנה נגד הדפוס: Luna עלתה בממוצע $1.20 לסשן, בעוד ש-Sol עלתה בממוצע $29, אבל הוא נאלץ לשכתב את רוב הפלט של Luna ולא קיבל שום דבר שמיש עבור מקרי השימוש שלו, מה שהופך את החיסכון לאשליה ולא להנחה. מפתח אחר שהריץ את אותה תשתית דיווח ש-Sol ברמה בינונית (medium) הפיקה תוצאה טובה יותר בעליל מאשר Luna ברמה מקסימלית (max), בכמחצית מהזמן. תחרות בשפה הסינית על משימה אחת של סצנת תלת-ממד נתנה מספרים לצורה הזו: Sol Medium סיימה ב-21:30 דקות עם דירוג האיכות הגבוה ביותר והכי מעט טוקנים; Luna Max לקחה 40:55 דקות, שרפה כ-130 אלף טוקנים, קיבלה את הציון הנמוך ביותר באיכות, והשתמשה בחצי ממכסת המנוי השבועית.
הסיכום הכנה של עמדת הקהילה לאחר שבוע: Luna Max אינו Sol Medium. הוא זול בהרבה מ-Sol Medium והוא גרוע יותר, והשאלה אם ההחלפה הזו כדאית תלויה לחלוטין בכך שהמשימה מוגדרת במדויק מספיק כדי ש"גרוע יותר" לא משנה. וזה בדיוק למה נועדו תבניות החיווט שלהלן.
התבנית ששרדה את המגע: סול מתכנן, לונה מיישם, סול חדש סוקר
אף אחד שממשיך להשתמש ב-Luna Max לא משתמש בו כסוכן קידוד לשימוש כללי. ההגדרה שעובדת, בכל גרסה שהמשתמשים התכנסו עליה, כוללת ארבעה תפקידים:
• מתזמן — GPT-5.6 Sol במאמץ גבוה, נשאר ב-thread הראשי. הוא אחראי על הדרישות, הארכיטקטורה, פירוק המשימות והקבלה הסופית. הוא אינו כותב את הקוד.
• מיישם שגרתי — GPT-5.6 Luna במאמץ מרבי, על עבודה חסומה ומוגדרת במלואה: ריפקטורינג מכני, כתיבת בדיקות, ניתוח מודולים, סבבי תיעוד — המשימות מהסוג שבו היעד חד-משמעי.
• מיישם קשיח — GPT-5.6 Terra במאמץ מקסימלי, עבור בניות כבדות-הקשר כאשר סחיפת ההוראות של Luna הופכת ליקרה.
• סוקר — מופע GPT-5.6 Sol חדש לקריאה בלבד, שרואה את ה-diff הסופי בלבד ולא שום דבר אחר. הטעם ב"חדש" הוא שסוקר הנושא איתו את ההקשר של היישום נוטה לאשר את ההיגיון של עצמו.
יישום הייחוס הוא sol-advisor, תוסף Codex ברישיון MIT מאת דן מקאטיר, שהגיע לכ-1,400 כוכבים בשבוע הראשון שלו. מתקינים אותו דרך חנות התוספים של Codex על ידי הוספת DannyMac180/sol-advisor כמאגר, ולאחר מכן הוספת sol-advisor כתוסף. הצורה הנוכחית שלו מלמדת: המסלול המובנה מקצה מיישם Terra/High ואחריו מבקר Sol/High חדש, בעוד Luna במצב מקסימום היא מסלול הסכמה מפורש שרץ כמשימה נפרדת גלויה למשתמש, כשהסשן הראשי של Sol סוקר ומקבל את העבודה שלה ישירות במקום להעביר אותה דרך המבקר המובנה.
אם אתה מעדיף לא להתקין כלום, הגרסה המינימלית המועתקת על ידי רבים היא הגדרת סוכן מותאמת אישית בנתיב ~/.codex/agents/luna-worker.toml הנושאת שתי הגדרות — model = "gpt-5.6-luna" ו model_reasoning_effort = "max" — בתוספת תיאור והנחיות שמגבילים אותו לעבודה מואצלת עם גבולות ברורים, אוסרים עליו לשנות את המטרה הכוללת או להרחיב את היקף פעילותו, ומחזירים החלטות ארכיטקטוניות ודרישות דו-משמעיות לסוכן הראשי. העצה הרווחת היא לבקש מסול לכתוב לך את הקובץ הזה, לאמת אותו מול גרסת Codex שהתקנת, ולהראות לך את ה-diff לפני שתאשר אותו, וזו עצה נכונה בין אם אתה סומך על המתכון ובין אם לא.
מלכודת תת-הסוכן, והפתרון שהקהילה התכנסה עליו
כאן הגרסה הוויראלית של התבנית הזו והגרסה העובדת נפרדות.
מערכת תת-הסוכנים המובנית של Codex אינה מתייחסת ל-GPT-5.6 Luna כאל אזרח סוג ראשון. McAteer נתקל במחסום קשיח — Luna אינה מורשית כתת-סוכן — ועקף אותו בכך שהכריז עליה כסוכן מותאם אישית במקום זאת, ולאחר מכן הצביע בפומבי על מחיר העקיפה הזו: סוכן מותאם אישית אינו חולק את ההקשר עם הסוכן הראשי כמו שתת-סוכן מקורי חולק. ימים לאחר מכן הוא הסיר את המסלול של Luna מ-sol-advisor לחלוטין, תוך ציטוט ממצאיו של מפתח אחר המתמקד ב-Codex, שלפיהם Luna מתנהגת באופן גרוע בתפקיד תת-סוכן, מתוך הנחה שהיא לא אומנה מחדש עבור פרוטוקול ה-v2 הרב-סוכני. Diego Haz תיאר באופן בלתי תלוי את אותו קיר מהצד השני: Sol אינה יכולה ליצור את Luna כתת-סוכן, ולכן Luna חייבת לפעול בשרשור ברמה העליונה, מה שהופך את התיאום למבולגן.
הפתרון, שהוא כיום עמדת הרוב, הוא להפסיק להילחם בזה:
• הקצה ל-Luna Max שרשור משלו, לא משבצת בגרף תת-הסוכנים. הורה ל-Sol orchestrator להריץ משימת Codex נפרדת ברמה העליונה על Luna, לנטר אותה, ולשלוף את התוצאה בחזרה. זה מה ש-McAteer הוסיף מחדש ל-sol-advisor ב-4 באוגוסט, ומה שכמה אחרים הגיעו אליו באופן עצמאי.
• קבל את בידוד ההקשר כמחיר. שרשור נפרד פירושו היסטוריה נפרדת. זה המס שאתה משלם, וזו גם הסיבה שההעברה שלהלן חשובה יותר כאן מאשר בהגדרת תת-סוכן מקורית.
• אם אתה חייב לדחוף את זה לתוך multi-agent v2, הקטלוג הוא הסיבה לכך שהוא מסונן החוצה. מפתח אחד ייחס את ההדרה לקטלוג המודלים הרגיל שמסמן את Luna כ-v1, ודיווח על פתרון עוקף: העתק ~/.codex/models_cache.json, הגדר ל-Luna את multi_agent_version ל-v2, כוון את model_catalog_json להעתק שלך, הפעל מחדש את Codex, ואז לגרום ל-orchestrator להפעיל את Luna במקסימום עם שכבת שירות מהירה ולכבות את הפיצול. התייחס לזה כאל האק לא רשמי של אדם אחד על קובץ פנימי — זה בדיוק מהסוג שעדכון Codex שובר.
חבילת ההעברה: חמש שאלות שפותרות את התלונה הנפוצה ביותר
הכשל המדווח ביותר של Luna Max הוא שהיא לא ממלאת אחר ההוראות במדויק, במיוחד כשנותנים לה תהליך עבודה ספציפי או לולאת איטרציה להריץ. התלונה הזו מופיעה גם אצל מפתחים שאוהבים את המודל וגם אצל מפתחים שנטשו אותו. הפתרון שאנשים העוסקים בהקטנת הבעיה ממשיכים להגיע אליו אינו הנחיה טובה יותר במובן של סגנון כתיבה; הוא חוזה מחמיר יותר. לפני שהדיון על Luna מתחיל, ענה על חמישה דברים:
• איזו משימה מדויקת הסוכן הזה צריך להשלים? לא תחום העבודה — המצב הסופי.
• אילו קבצים, מסמכים או מערכות נמצאים בהיקף? מפורטים במפורש, לא משתמעים.
• מה אסור לו לשנות? הממשקים, המיגרציות, התצורות והחוזים הציבוריים שהם מחוץ לתחום.
• אילו ראיות מוכיחות שהמשימה הושלמה? בדיקה בעלת שם, פלט של פקודה מסוימת, diff שנוגע רק בקבצים המפורטים.
• איזו החלטה חסרה אמורה לגרום לזה להיעצר? הטריגר לחזור במקום לנחש — זה מה שמונע ממודל זול ולהוט מדי מלהמציא ארכיטקטורה.
כאן גם המקום שבו כדאי לשלב את הנחיות הפרומפטינג של החברה עצמה, עם התווית שמגיעה להן: החברה מדווחת כי בהערכות הפנימיות שלה לסוכני קוד, פרומפטי מערכת דחוסים יותר שיפרו את ציוני ההערכה ב-10–15%, תוך קיצוץ של 41–66% מסך הטוקנים ושל 33–67% בעלויות, והיא ממליצה לבחון פרומפטים שירשנו מ-GPT-5.5 או GPT-5.4 במקום להעביר אותם קדימה כפי שהם. אלה נתונים המדווחים על-ידי הספק. אבל הכיוון תואם למה שהתחום מצא: לתאר את היעד במדויק ולמחוק את הקריינות של כל צעד בדרך. שימו לב למתח עם הפסקה שלמעלה — דיוק בנוגע להיקף ולמגבלות אינו אותו דבר כמו מילוליות, והקונצנזוס בקהילה הוא ש-Luna Max זקוקה ליותר מהראשון ופחות מהשני.
מצבי כשל שצריך לתכנן סביבם
• סחיפת הוראות. אומת על ידי מספר מפתחים: הוא מתעלם מחלקים מהבריף הראשוני, והוא חמור ביותר כאשר הבריף הוא נוהל שיש לעקוב אחריו ולא תוצאה שיש להשיג.
• איטיות בשעון-הקיר. מדווחת שוב ושוב, ועקבית עם ~136 שניות עד לאסימון הראשון, כפי שמדדה Artificial Analysis במאמץ מקסימלי. מתאים לעבודה שאפשר להשאיר רצה; כואב בלולאה אינטראקטיבית.
• שריפת קונטקסט. מפתח אחד דיווח ש-Luna Max צורכת חלון שרשור של Codex בגודל 258k במהירות מדאיגה, וחשד שצריכת המכסה מזנקת ברגע ש-Codex מתחיל לדחוס את הקונטקסט קרוב למגבלה. חלק הדחיסה הוא התרשמות שלו, לא תוצאה מדודה — אבל קצב הצריכה הוא התוצאה הצפויה של המילוליות ש-Artificial Analysis מדדה באופן עצמאי. בצד ה-API, שימו לב לשלב הקונטקסט הארוך: לוח התמחור (pass-through) של המודל הזה עובר מ-$0.20/$1.20 ל-$0.40/$1.80 ברגע שקריאה חוצה בערך 272k טוקנים, כך ששרשור שהולך וגדל הופך ליקר יותר לכל טוקן, ולא רק יקר יותר בסך הכול.
• כל דבר ויזואלי. זהו הגבול החד ביותר בדוחות השטח. מתרגל אחד הנקרא בהרחבה, שביטל מנוי קידוד של Kimi K3 לטובת Luna Max, דירג את Luna Max כטוב כמו מה שנטש והרבה יותר זול — עם חריג מפורש עבור frontend. אחר היה בוטה יותר: אל תשתמשו ב-Luna לביצוע עיצוב, גרפיקה, עימוד או עבודות מצגות; החלוקה בין תכנון עם Sol לביצוע עם Luna מיועדת למשימות הדרכה שלב-אחר-שלב, לא למשימות אסתטיות.
• קטלוג תת-הסוכן. מוסבר לעיל — אם לונה לעולם אינה נבחרת בשקט בריצת מרובת-סוכנים, היא מסוננת, לא נכשלת.
• כלכלה כוזבת. מצב הכשל היחיד שלא מופיע באף benchmark: סשן שעלה $1.20 במקום $29 והפיק עבודה שכתבת ידנית, עלה לך $1.20 ועוד אחר הצהריים שלך.
מתי לא לשאוף למקס
Max אינו שדרוג חינם, וההנחיה שהחזיקה מעמד היא סולם ולא הגדרה:
• טרנספורמציות ברורות — שינוי שם שדה, חילוץ מכני ומעבר עיצוב. מאמץ נמוך או בינוני על Luna. התנה את זה במעבר של בדיקה בעלת שם.
• יישום שגרתי — high או xhigh. ברירת המחדל של הקהילה עבור עובד Luna היא xhigh, לא max, בדיוק כי max עולה זמן וטוקנים על משימות שמעולם לא היו קשות.
• מוגבל אבל קשה באמת — זוהי העבודה האמיתית של max. החבילה צריכה להיות גם קשה וגם מוגדרת במדויק, כדי שההיגיון הנוסף יתורגם לתוצאה טובה יותר.
• חקירה מעורפלת — שנה את הדרגה, לא את החוגה. אם המודל טועה בשיפוט ולא רק מתכנן מעט מדי, חשיבה נוספת על מודל זול יותר לא תתקן את זה; זו משימת Sol.
• בריף מעורפל — תקן את החוזה, לא את המודל. שום הגדרת מאמץ לא מפצה על קריטריון קבלה שלא צוין.
אזהרה ספציפית למנויים, ממדריך צד שלישי וקל לטעות בה: שיעורי הקרדיט ש-Codex גובה לכל מודל אינם ביחס זהה למחירי ה-API הרשמיים, כך שאי אפשר לקחת יחס ממחירי ה-API ולהשתמש בו ככלל ניתוב למנוי. מכסות ההודעות המדווחות לחמש שעות בשכבת פלוס ממחישות את הנקודה — בערך 15–90 הודעות מקומיות ב-Sol, 20–110 ב-Terra, 50–280 ב-Luna, והטווחים כה רחבים כי "הודעה" אינה יחידת עבודה קבועה. אם החלטות הניתוב שלך מונעות ממכסת מנוי ולא מחשבונית, מדוד לפי המכסה.
מעבר ל-Codex: למה עוד אנשים מכוונים את זה?
השילוב של הנמקה זולה-עמוקה מתברר כמועיל גם מחוץ לסוכני קידוד, ואלה השימושים עם הראיות:
• סוכני דפדפן. מפתח אחד הריץ מחסנית אוטומציה של דפדפן על GPT-5.6 Luna כדי לפתוח את 15 הפוסטים המובילים ב-Hacker News, לקרוא כל עמוד מקושר ולכתוב דוח — העלות הכוללת, 3 סנט. אופק ארוך, סיכון נמוך, טוקנים גבוהים: בדיוק הצורה שהמודל הזה מתמחר עבורה.
• שרשראות מיומנויות. שני מתרגלים דיווחו בנפרד שהניעו פייפליין של שתי מיומנויות — יצירת תמונות לתוך ממיר מתמונה ל-Three.js — מתוך מטרה יחידה של Luna Max כדי לקבל אובייקט תלת-ממדי אינטראקטיבי בסגנון low-poly, וכל אחד מהם ציין שזה בקושי הזיז את מונה השימוש השבועי שלו. כדאי לקרוא לצד האזהרה "אל תשתמשו ב-Luna לעבודה ויזואלית": Luna תזמרה כלים שעשו את העבודה הוויזואלית, ולא שפטה את האסתטיקה בעצמה.
• שמירה על סשן אחד חם.קלט שמור במטמון במודל זה עולה $0.02 למיליון טוקנים, לעומת $0.20 לקלט חדש — הנחה של 90% ש-Artificial Analysis מציגה בלוח התמחור שלה — וחלון המטמון הוא כ-30 דקות. ההשלכה המעשית שכמה מדריכים מגיעים אליה באופן עצמאי: סשן אחד ארוך-טווח שממשיך לקרוא מחדש את אותו בסיס קוד זול בהרבה מסשן חדש לכל משימה.
• ארביטראז' מכסות. הטענה האגרסיבית ביותר בכל הסט, ומסומנת בבירור כטענה: מפתח אחד מדווח שבגלל שהמאמץ כמעט חינם בעוד שהמכפיל של הדרגה גדול, הפעלת מאמץ מקסימלי בדרגה הזולה אפשרה לו לדחוף 4.9 מיליארד טוקנים במשך שלושה שבועות בתוכנית של 200 דולר — שש ספרות בתעריפי API — ושהוא שומר את מודלי Kimi K3, Grok ו-DeepSeek באותו בורר מאחורי ראוטר מקומי, כך שפגיעה במגבלה של ספק אחד לא עוצרת את העבודה. אף אחד לא שחזר באופן עצמאי את נתון הטוקנים. עם זאת, ההרגל של ניתוב שעומד מאחוריו הוא החלק שכדאי להעתיק.
הרצת אותו הפיצול ללא מנוי ל-Codex
הכל למעלה הוא סיפור בצורת מנוי: הסיבה שאנשים מתעניינים ב-Luna Max היא שהיא מותחת מכסה שבועית. בצד ה-API, אותה ארכיטקטורה פשוטה יותר לבנייה וקלה יותר להבנה, כי אתה משלם חשבונית במקום לנהל הקצבה — והחלוקה בין orchestrator ל-worker מפסיקה להיות תוסף והופכת לניתוב רגיל.
GPT-5.6 Luna זמין דרך OrcaRouter ב-$0.20 למיליון טוקני קלט ו-$1.20 למיליון טוקני פלט — מחיר המחירון של הספק, שמועבר בתוספת של 0%, וזו הסיבה שהנחת המחיר של 30 ביולי הייתה פעילה אצלנו ביום שבו החברה הכריזה עליה, ולא במחזור חיוב מאוחר יותר. הוא מסופק דרך API תואם ב-/v1/chat/completions ו-/v1/responses, כך ששדה ה-reasoning-effort מועבר בגוף הבקשה בדיוק כמו בפנייה ישירה, ומזהה המודל הואopenai/gpt-5.6-luna. GPT-5.6 Sol ו-GPT-5.6 Terra יושבים מאחורי אותו מפתח, וזה החלק שחשוב בדפוס הזה: אורקסטרטור בשכבה אחת ועובד בשכבה אחרת הם שני מזהי מודל באינטגרציה אחת, לא שני חוזים מול ספקים. ה-DSL לניתוב מאפשר לך לבטא את הפיצול הזה כקריאה אחת במקום לחבר תהליכונים ביד, ו-failover אוטומטי מכסה את המקרה שחבורת ארביטראז' המכסות פותרת עם ראוטר מקומי — כשספק אחד מתדרדר, הבקשה נוחתת במקום אחר במקום להיעצר.

שתי הסתייגויות כנות. המנגנון הייחודי ל-Codex — גרף תת-הסוכן, שוק התוספים, קטלוג המודלים, הקצבה השבועית — הוא של החברה, ואף אחד ממנו לא מגיע עם מפתח API; אם התבנית שאתה רוצה היא sol-advisor בתוך אפליקציית Codex, אתה רוצה מנוי ל-Codex. ומצבי הכשל שלעיל הם תכונות של המודל, לא של התעבורה: ניתוב משנה את עלות הקריאה ומה קורה כשספק קורס, לא אם לונה ממלאת אחר הוראותיך.
מי צריך להעתיק את זה, ומי לא צריך
{{1}}אם העבודה שלך בהיקף גדול וניתנת להגדרה מכנית — רפקטורינג, תשתית בדיקות, חילוץ, תיעוד, מעברי ניתוח על מאגר קוד גדול — עבור למקסימום, שים את Luna בשרשור משלה עם מסירה בת חמש שאלות, שמור מופע Sol אחד לפניה לתכנון ואחד מאחוריה לסקירה, וצפה להשקיע בסדר גודל פחות.{{/1}} {{2}}האנשים שמדווחים על ההצלחות הגדולות ביותר כולם עושים גרסה כלשהי של זה, ונתוני העלות העצמאיים תומכים בכיוון גם כשהם לא תומכים בניסוח "טוב כמו Sol".{{/2}}
אם העבודה שלך היא חקר, אסתטית, או מגיעה כבריף מעורפל שמתחדד תוך כדי תנועה, דוחות השטח אומרים במפורש שתבזבז את החיסכון פעמיים על עשיית הפלט מחדש. ואם אתה אינטראקטיבי — יושב וצופה בזה — התחלה קרה של שתי דקות במאמץ מקסימלי תפריע לך יותר משהמחיר ישמח אותך.
מה לצפות: האם החברה תבצע אימון המשך (post-train) ל-Luna עבור פרוטוקול ה-subagent v2. כל חלק מביך בפלייבק הנוכחי — השרשור הנפרד, ההקשר המשותף שאבד, הפריצה לקטלוג, כל פרק ה-retract-and-rewire — קיים בגלל הפער האחד הזה. סגור אותו והגרסה הטובה ביותר של התבנית הזו הופכת לפשוטה יותר בכמה שלבים.
שאלות ששוות תשובה אמיתית
האם מאמץ חשיבה מרבי עולה יותר לכל טוקן מאשר ברירת המחדל?
לא, וזוהי אי-ההבנה הנפוצה ביותר בנוגע להגדרה. GPT-5.6 Luna גובה $0.20 עבור קלט ו-$1.20 עבור פלט לכל מיליון טוקנים, ללא קשר לרמת המאמץ. מה ש-max משנה הוא מספר הטוקנים שמושקעים — המודל מתכנן יותר, בודק את עצמו ומתקן לפני שהוא עונה. Artificial Analysis מדדה שהמודל הזה פולט 130M טוקני פלט על ערכת benchmark שבה המודל החציוני פולט 61M. אז סשן עם מאמץ max עולה יותר מסשן עם מאמץ medium על אותה משימה, אך ורק בזכות הנפח, והוא גם לוקח יותר זמן להפיק את הטוקן הראשון שלו. מאמץ הוא חוגת ספירת טוקנים עם תווית של איכות.
האם GPT-5.6 Luna כבר יכול לרוץ כתת-סוכן Codex מקורי?
נכון ל-5 באוגוסט 2026, לא — והקהילה הפסיקה לנסות. מסלול תת-הסוכן המובנה של Codex אינו מקבל את Luna; הפתרון העוקף של סוכן מותאם אישית מריץ אותו אבל מאבד את ההקשר המשותף עם הסוכן הראשי; והמפתח שעומד מאחורי התוסף הידוע ביותר לתבנית זו הסיר את Luna, ואז הוסיף אותו מחדש כמשימה עצמאית ברמה העליונה שהמתזמן עוקב אחריה. אם אתה רואה ריצת סוכנים מרובים שבה Luna אף פעם לא נבחר, סביר להניח שהוא מסונן בגלל שקטלוג המודלים הרגיל מסמן אותו כ-v1 ולא כ-v2, ודבר זה תוקן על ידי מפתח אחד על אחריותו בלבד. זהו הדבר הסביר ביותר ברשימה להשתנות בעקבות עדכון Codex, לכן ודא זאת מול הגרסה המותקנת שלך במקום לסמוך על כל מתכון, כולל זה.
האם זה מספיק טוב כדי להחליף מנוי קידוד של Claude או Kimi K3?
כמה מפתחים ביטלו בפומבי תוכנית של 200 דולר לחודש בגלל בדיוק זה. הפוסט שהעלה את השאלה אל פני השטח הגיע מאימונולוג שמתכנת מדי יום: הוא ביטל את מנוי הקידוד שלו ל-Kimi K3 לא משום שהיא הייתה גרועה אלא משום שלא יכול היה להצדיק זאת כש-GPT-5.6 Luna הייתה, לפי ניסיונו, טובה באותה מידה לעבודתו והרבה יותר זולה — פרט לפרונטאנד. נתוני העלות העצמאיים מקשים להתעלם מהטיעון: על אותה ערכת בדיקות, Kimi K3 במאמץ מרבי קיבל 57 תמורת 2,437 דולר, בעוד GPT-5.6 Luna במאמץ מרבי קיבל 51 תמורת 174 דולר. אבל קראו את דעת החולקים לפני שאתם מבטלים משהו. המפתחים שמדדו הפעלות תואמות וקיבלו תוצאה שלילית לא בדקו מודל אחר; הם בדקו סוג אחר של משימה — פתוחה, חזותית, או מפורטת במעורפל — ובמשימה כזו המודל הזול הפסיד בפער גדול מספיק כדי למחוק את החיסכון. התשובה הניתנת להגנה היא שלונה מקס מחליף חלק גדול מהקידוד שלךעבודה –, לאו דווקא הקידוד הטוב ביותר שלך – מודל –, ושהמתרגלים שמוציאים ממנו את המרב הם אלה שהשאירו לעצמם שכבה מתקדמת כדי לתכנן ולבדוק.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
