כרטיס כותרת הירו עבור GPT-6 Luna לעומת GPT-5.6 Luna עם התג 'GA 22 Sep 2026', הכותרת הראשית 'GPT-6 Luna לעומת GPT-5.6 Luna', כתובית המשנה 'אותו שם, חצי מחיר, תוצר גרוע יותר', ושלושה כרטיסי נתונים עם הכיתוב 'קלט: $0.10 לעומת $0.20 ל-MTok', 'פלט: $0.50 לעומת $1.20 ל-MTok' ו-'AA Index: 37.26 לעומת 37.32', כשהלוגו של OrcaRouter מוטמע בפינה הימנית התחתונה.
Guides & Insights

GPT-6 Luna מול GPT-5.6 Luna: אותו שם, חצי מהמחיר, ותוצר גרוע יותר

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני מודלים, מילה אחת משותפת, וציון עצמאי שהוא למעשה זהה. GPT-6 Luna מגיע ל-37.26 ב-Artificial Analysis Intelligence Index; GPT-5.6 Luna הגיע ל-37.32. הפרש של 0.07 נקודות אינו מדידה, הוא רעש, והוא העובדה הבודדת החשובה ביותר לגבי הצמד הזה. מה שמבדיל בין שני המודלים אינו היכולת — אלא $0.0681 לכל משימת אינדקס שהושלמה לעומת $0.1783, וקבוצה של רגרסיות בעבודת ידע שההוזלה במחיר אינה מזכירה.

התאריכים חשובים לקריאת המספרים. GPT-5.6 Luna שוחרר ב-9 ביולי 2026 במחיר של $0.20 למיליון טוקני קלט ו-$1.20 למיליון טוקני פלט. GPT-6 Luna שוחרר ב-22 בספטמבר 2026 במחיר של $0.10 ו-$0.50 — בדיוק מחצית מתעריף הקלט ו-58% פחות מתעריף הפלט, שאותם תיארה OpenAI כקבועים ולא כמבצעיים. זהו קיצוץ אמיתי, והוא גם החצי הקטן יותר של הסיפור. החצי הגדול יותר הוא שהמודל החדש יותר הוא מודל אחר, ולא אותו מודל עם תמחור מחדש.

Two-column comparison scoreboard titled 'GPT-6 Luna vs GPT-5.6 Luna - the scoreboard'. Left column 'GPT-6 Luna': Input per MTok $0.10; Output per MTok $0.50; Cost per index task $0.0681; Hallucination rate 76.7%; AA-Briefcase Elo 1,299.23; AA Intelligence Index 37.26. Right column 'GPT-5.6 Luna': Input per MTok $0.20; Output per MTok $1.20; Cost per index task $0.1783; Hallucination rate 92.6%; AA-Briefcase Elo 1,345.38; AA Intelligence Index 37.32. Footer reads 'Vendor price lines per OpenAI; independent figures per Artificial Analysis.' OrcaRouter logo composited bottom-right.

מה הגירה בעצם נותנת, במספרים

השווה בין השניים בממדים שמכריעים בהגירה, והתמונה אינה אחידה. חלק מהשורות משתפרות, חלקן נסוגות, ואחת משתפרת במידה רבה.

• מחיר — GPT-6 Luna‏ $0.10 לקלט / $0.50 לפלט למיליון טוקנים לעומת GPT-5.6 Luna‏ $0.20 / $1.20. חצי מחיר בקלט, 58% הנחה בפלט.

• קלט במטמון — 0.01 דולר למיליון לעומת 0.02 דולר. אותה הנחה של 90% על בסיס חצוי, כך שקידומת חוזרת עולה חצי ממה שעלתה ביולי.

• עלות לכל משימה שהושלמה — $0.0681 לעומת $0.1783 באותה סוויטה. הפחתה של 62%, גדולה מהקיצוץ במחיר הטוקנים מכיוון שתמהיל המשימות אינו זהה.

• אסימוני פלט לכל משימה — 50,537 לעומת 41,235. המודל החדש פטפטן ב-23% יותר לכל עבודה שהושלמה, ו-78% מהפלט שלו הם חשיבה שלעולם אינה מופיעה בתשובה.

• חלון הקשר — 1,050,000 אסימונים לעומת 1,000,000. אותה תקרה מעשית; שניהם מגבילים את הפלט ל-128,000 אסימונים.

• הימנעות — שיעור הזיות של 76.7% ב-AA-Omniscience לעומת 92.6%. זהו השיפור הבודד הגדול ביותר בסט, והוא אינו רווח ידע: הדיוק עובר מ-42.7% ל-43.8%, כלומר ללא שינוי של ממש. המודל החדש יותר נמנע מלענות במקום להמציא, וזהו שינוי התנהגותי ולא שינוי ביכולת.

• תוצרי עבודת ידע — AA-Briefcase v1.1 יורד מ-1,345.38 Elo ל-1,299.23, ו-GDPval-AA v2.1 יורד מ-1,443.14 ל-1,367.09. שניהם ירדו, בכ-46 ו-76 נקודות.

• קידוד ועבודה ארוכת טווח — Terminal-Bench 4.0 עולה מ-11.6% ל-12.6% ו-SciCode מ-53.6% ל-54.6%, שתי השורות היחידות כאן שעולות. לעומת זאת, Coding Agent Index יורד מ-43 ל-41 וההערכות הסוכניות בסגנון SWE נעות באותו כיוון.

• AutomationBench-AA — 53.2% לעומת 50.2%. עלייה, ובשיעור גדול יותר מכל מדד סוכני אחר בקבוצה.

Screenshot of the Artificial Analysis page for GPT-6 Luna (max), dated September 2026, showing a proprietary model that accepts text and image input and outputs text with a 1M-token context window, an Artificial Analysis Intelligence Index score of 37, pricing of $0.10 per million input tokens and $0.50 per million output tokens, a 90% cache discount, and a cost rank of 20th of 183 models in its class.

הרגרסיה נמצאת בארטיפקט, לא בהנמקה

הדפוס בשתי השורות האחרונות ראוי לתת לו שם, מפני שהוא כל ההחלטה. המודל החדש טוב יותר בפעולות אג'נטיות חד-שלביות וגרוע יותר בהחזרת מסמך מוגמר. Artificial Analysis מייחסת את הירידה בעבודת ידע לאיכות ההצגה ולתוצרים שדילגו על מרכיבי מחוון נדרשים, ולא לכשלים עובדתיים או בהיסק — וזה בדיוק סוג הרגרסיה ששורד בדיקת עשן ונכשל בסקירה.

חברו את שתי העובדות יחד, וההגירה מתפצלת באופן נקי לפי מה שצורך את הפלט. אם הפייפליין שלכם קורא פלט מובנה — JSON, סיווג, שדה שחולץ, החלטת ניתוב — רגרסיית התצוגה לא עולה לכם דבר, השיפור בהימנעות הוא רווח אמיתי, והפחתת עלות המשימה של 62% מתממשת במלואה. אם אדם קורא את התוצר — דוח, תזכיר, מסמך מול לקוח — המודל החדש יותר גרוע באופן מדיד בדיוק בדבר שעבורו אתם משלמים, והחיסכון קונה לכם סוקר.

מספר ההימנעות ראוי לאותה התייחסות. מודל שעובר מלהמציא ב-93% ממה שהוא לא יודע להמציא ב-77% הוא אובייקט שונה מהותית עבור מעקה בטיחות, מסנן ציות, או כל תהליך שבו תשובה שגויה בטוחה מדי מתפשטת. השיפור הזה אמיתי, הוא נמדד באופן עצמאי, והוא הטיעון החזק ביותר להעברת עבודה למודל החדש, שאינו תלוי במחיר כלל.

מה משתנה בקוד שלך, ומה לא

פחות ממה שהורדת מחיר בגודל כזה מרמזת, וזו החדשות הטובות. חלון ההקשר הוא באותה קטגוריה, הפלט המרבי זהה ועומד על 128,000 טוקנים, וסעיף התמחור מחדש להקשר ארוך של המשפחה לא השתנה: בקשות מעל 272,000 טוקני קלט מחויבות לפי פי 2 מתעריפי הקלט והמטמון ופי 1.5 מהפלט, עבור הבקשה כולה ולא רק עבור החלק שמעל הסף. בקשה שהייתה יקרה ב-300,000 טוקנים ב-GPT-5.6 Luna יקרה גם ב-GPT-6 Luna — חצי מהתעריף, אותו צוק, כך שעומס עבודה שהיה צריך להיות מפוצל ביולי עדיין צריך להיות מפוצל כעת.

סולם המאמץ הוא המקום שבו ההתנהגות משתנה ולא העלות. GPT-6 Luna חושף את none, low, medium (ברירת המחדל), high, xhigh ו-max, וברירת המחדל חשובה: פייפליין שכוּון מול מאמץ ברירת המחדל של מודל אחד אינו מכוון אוטומטית מול זה של אחר. צוותים שנעלו הגדרה במפורש לא מושפעים. צוותים שלקחו את ברירת המחדל מריצים תצורה שונה מזו שהייתה להם ביולי, והסימפטום הגלוי יהיה נפח טוקנים ולא איכות.

מלכודת אחת ראויה לחזרה כי היא לא נעלמת עם המודל החדש. בנקודת הקצה Chat Completions, קריאה לפונקציה עובדת רק כאשר מאמץ החשיבה מוגדר ל-none; כל רמת מאמץ אחרת, וכל כלי מובנה, דורשים את Responses API. צוות שמעביר לולאת קריאה לכלים על ידי שינוי מחרוזת המודל יגלה שהכלים שלו אינם זמינים בשקט במאמץ ברירת המחדל הבינוני, והתיקון הוא שכתוב של משטח הקריאה ולא שינוי פרמטר.

מה ניתן לנתב היום, ומה לא

זהו החלק בנדידה שאין לו שום קשר לבנצ'מרקים. GPT-5.6 Luna זמין ב-OrcaRouter במחיר המחירון שלו — 0.20 דולר למיליון טוקנים בקלט, 1.20 דולר למיליון בפלט, חלון הקשר של 1,000,000 טוקנים, פלט מרבי של 128,000 טוקנים, וזמן p50 עד לטוקן הראשון של 1.60 שניות, כפי שנמדד בתעבורה חיה בעמוד המודל שלנו. אנחנו מעבירים את מחירי המחירון של הספקים כמו שהם, ללא תוספת, כך שביום שבו OpenAI עדכנה את התמחור של המשפחה הזו, השינוי כבר היה פעיל אצלנו ולא רק במחזור החיוב הבא.

Screenshot of the OrcaRouter model page for openai/gpt-5.6-luna, showing GPT-5.6 Luna by OpenAI dated 2026-07-09, Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 128K maximum output, text, image and file input, pricing of $0.20 input and $1.20 output per million tokens, a p50 time to first token of 1.60 seconds and a p95 of 10.00 seconds, and the description 'GPT-5.6 Luna is the fast, cost-efficient model in OpenAI's GPT-5.6 series — tuned for high-volume, latency-sensitive workloads while retaining genuinely capable reasoning.'

GPT-6 Luna אינו ניתן לניתוב דרך OrcaRouter נכון ל-23 בספטמבר 2026. הזמינות היא ב-API של OpenAI עצמה ובקטלוגי הענן שנושאים את המשפחה הזו, ואנחנו לא מציגים מודל שאיננו יכולים לשרת. ההשלכה המעשית היא שצוות שמתכנן את ההגירה הזו יכול להעביר את התמחור היום ואינו יכול להעביר את הניתוב היום — שני חצאי השינוי נוחתים בתאריכים שונים.

מה שזה מאפשר בינתיים הוא ההסדר שרוב הצוותים יגיעו אליו בסופו של דבר בכל מקרה. השאירו את GPT-5.6 Luna בנתיבים שבהם התוצר הוא המוצר, הריצו את GPT-6 Luna בכל מקום שבו הפלט נצרך על ידי קוד, והתייחסו לגבול כאל דרגה ולא כאל שכתוב. מכיוון שהמודלים שאליהם אתם יכולים להגיע יושבים מאחורי נקודת קצה אחת עם יותר מ-200 מודלים על אותו מפתח ומעבר אוטומטי בין ספקים, הוספה או הסרה של דרגה היא ערך קונפיגורציה ולא אינטגרציה שנייה — ונתיב ההסלמה מפסיק להיות תלוי בזמינות של מודל בודד.

החלטת ההגירה, במילים פשוטות

העבר את העבודה למקום שבו הפלט נקרא על ידי מכונה ותנאי ההצלחה ניתנים לאימות. סיווג, חילוץ, החלטות ניתוב, קריאות guardrail, מעברי טרנספורמציה גורפים ופעולות סוכן חד-שלביות — כולם עומדים בתנאים: המדד המשולב לא השתנה, התנהגות ההימנעות טובה באופן מהותי, ועלות המשימה ירדה בכ-62%. עם Batch במחצית מהתעריפים הרגילים וקלט שמור במטמון בעשירית מבסיס מוקטן בחצי, פייפליין שהיה גבולי ביולי יכול להיות פשוט עכשיו.

אל תעביר את העבודה שבה אדם מאשר את התוצר, ואל תעביר מסלולי סוכן קידוד באופן עיוור. ירידה של 46 נקודות ב-AA-Briefcase וירידה של 76 נקודות ב-GDPval הם מספרים קטנים שמצביעים לאותו כיוון שאליו מצביעה ירידה של שתי נקודות ב-Coding Agent Index, ואופן הכשל ש-Artificial Analysis מתארת — דילוג על רכיבי רובריקה, הצגה חלשה יותר — אינו נראה לבדיקה אוטומטית. השאר את המודל הקודם במקום שבו הליטוש הוא התוצר.

והתייחסו לתיקו של 0.07 נקודות במדד כאל הממצא שהוא. זה אינו מודל חכם יותר במחיר נמוך יותר. זהו מודל בעל צורה שונה במחיר נמוך יותר, והשאלה שתוכנית הגירה חייבת להשיב עליה היא איזו צורה צורך עומס העבודה שלך — ולא איזה ציון גבוה יותר, מפני שברשומה הבלתי תלויה שני הציונים האלה הם אותו מספר.