
חלון ההקשר של GPT-6.1 Sol: 1,050,000 טוקנים, קו 922,000, ומצוק 272,000
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
דף המודל של הספק עבור GPT-6.1 Sol, שנקרא ב-7 באוקטובר 2026, מציין חלון הקשר של 1,050,000 טוקנים ופלט מקסימלי של 128,000 טוקנים. אותו דף, בצורה קריאה למכונה שמתקבלת על ידי הוספת .md לכתובת ה-URL שלו, מכיל נתון שלישי שהדף המרונדר אף פעם לא מדפיס: מקסימום של 922,000 טוקני קלט. GPT-6 Sol, המודל ש-6.1 שוחרר כדי לרשת אותו ב-2026-09-29, מפרסם את אותו זוג נתוני תקרה בדף שלו, ואת אותה שורה של 922,000 בצורת ה-markdown שלו. כרטיס המודל שלנו עבור openai/gpt-6-sol מדווח שהחלון הוא 1,050,000 טוקנים ומגבלת הפלט היא 128,000, מציג את הראשון מביניהם כ-"1M" ברצועת המפרט שלו, ומדפיס "1.1M" עבור אותו מודל בטבלת השוואה בהמשך אותו דף.
אז הדפים אכן אינם תמימי דעים, וכדאי להיות מדויקים לגבי האופן שבו הם חלוקים. רצועת המפרט המרונדרת של הספק מספקת חלון ותקרת פלט, אך אין בה תקרת קלט. תיעוד ה-Markdown של אותו ספק עבור אותו מודל מספק את שלושתם. כל מי שמתכנן בקשה על סמך העמוד המרונדר פועל עם אילוץ אחד פחות מזה שהספק פרסם, והאילוץ החסר הוא המספר שמכריע אם בקשה מתאימה.
שלושה מספרים, שלושה מקורות, וחיסור אחד שאיש לא רושם
הנה כל מספר יחד עם המסמך שממנו הוא בא, כולם נקראו ב-7 באוקטובר 2026.
• חלון הקשר של 1,050,000 — עמוד המודל של הספק עבור gpt-6.1-sol, ברצועת המפרט המוצגת ובצורת ה-Markdown שלה, ואותו נתון ממש בעמוד של gpt-6-sol. זה גם מה שהקטלוג שלנו מחזיר עבור openai/gpt-6-sol ו-openai/gpt-6-luna, שם השדה מוקלד כ-1,050,000 ולא מעוגל.
• מקסימום 128,000 אסימוני פלט — אותו עמוד, אותן שתי צורות, עבור שני הדורות. השדה בכרטיס שלנו מציין 128,000; התצוגה שלו מעגלת ל־"128K".
• 922,000 אסימוני קלט מרביים — צורת ה-markdown של דף המודל gpt-6-sol של הספק ושל דף gpt-6.1-sol שלו. היא אינה נמצאת ברצועה המרונדרת של אף אחד מהדפים, והיא אינה נמצאת בשדה הקטלוג שלנו עבור המודל, שעוצר בחלון ובתקרת הפלט.
שלושת המספרים עקביים אריתמטית זה עם זה: 922,000 ועוד 128,000 הם בדיוק 1,050,000. מדריך ההנמקה של הספק עצמו מתאר את המנגנון שמעניק לזהות משמעות מבלי לבצע את החיבור ולו פעם אחת בעמוד המודל — טוקני הנמקה, כך נאמר, "עדיין תופסים מקום בחלון ההקשר של המודל", ואם טוקנים שנוצרו "מגיעים למגבלת חלון ההקשר או לערך max_output_tokens שהגדרת", התשובה חוזרת כשהיא מסומנת כלא שלמה. חלון שמשותף בין מה שנכנס לבין מה שיוצא הוא חלון שבו תקרת הקלט היא החלון בניכוי הקצאת הפלט.
הקריאה הזו מאוששת, לא מוכחת, וכדאי להפריד בין השתיים. מה שמתועד הוא חלון של 1,050,000, תקרת פלט של 128,000, וקלט מקסימלי של 922,000. מה שמוסק הוא איזה מהם הוא האילוץ שמופעל ראשון. ההיסק תקף עבור כל בקשה שמקצה לעצמה את מלוא מכסת הפלט שלה ונכשל בכל בקשה שלא עושה זאת — קבעו max_output_tokens ל-4,000, ואז 1,046,000 טוקני קלט אינם נדחים באופן מובהק. עד שהספק יכתוב את החיסור בעמוד שבו המספרים מופיעים, התייחסו לצירוף כאל צורת התקציב ולא כאל כלל קבלה נוקשה, ואמתו מול נקודת הקצה של הספירה ולא מול פוסט בבלוג.
הקשר אינו מחיר: הצעד של 272,000 טוקנים
חלון גדול יותר הוא טענת קיבולת. זו אינה טענת עלות, ובמשפחה הזו השניים נפרדים בקו מתועד. עמוד התמחור של הספק מציין את הכלל במשפט אחד: בקשות עם יותר מ-272K אסימוני קלט מתומחרות פי 2 מתעריפי הקלט והמטמון ופי 1.5 מהפלט עבור הבקשה כולה. ההגדרה של אותו עמוד לשני העמודות שלו היא "הקשר קצר: ≤272K אסימוני קלט. הקשר ארוך: >272K אסימוני קלט."
קרא את המילה full בעיון. המדרגה אינה מטילה מס על הטוקנים שמעבר לקו — היא מתמחרת מחדש את הכול, כולל את הטוקן הראשון. וזה לא שינוי של 6.1: אותו כלל בדיוק, עם אותו סף בדיוק, חל על GPT-6 Sol, ולכן הצוק חייב להיות מיוחס למדרגה ולא לשחרור.
הרץ מטלה אחת עם הקשר ארוך דרך שני הצדדים, לפי התעריפים המפורסמים של GPT-3 Sol, כשהקידומת כבר נמצאת במטמון כך שחיוב כתיבת המטמון לא משפיע על ההשוואה:
• 240,000 אסימוני קלט (200,000 במטמון, 40,000 חדשים), 6,000 אסימוני פלט — 40,000 אסימוני קלט חדשים במחיר $2.00 למיליון הם $0.080; 200,000 אסימוני קלט במטמון במחיר $0.10 הם $0.020; 6,000 אסימוני פלט במחיר $10.00 הם $0.060. סה״כ, $0.160.
• 300,000 טוקני קלט (260,000 במטמון, 40,000 חדשים), 6,000 פלט — הבקשה כעת מעל הקו, ולכן כל תעריף משתנה: קלט חדש 40,000 ב-$4.00 הוא $0.160; קלט במטמון 260,000 ב-$0.20 הוא $0.052; פלט 6,000 ב-$15.00 הוא $0.090. סה"כ, $0.302.
עשרים וחמישה אחוזים יותר טוקני קלט מניבים חשבון גדול ב-89 אחוזים. הריצו את אותו זוג על GPT-6 Sol והצורה נשמרת עם שיפוע תלול יותר — $0.180 מתחת לקו לעומת $0.354 מעליו, מכיוון שתעריף המטמון של הכרטיס הישן, $0.20, יושב באותו מקום שבו יושב תעריף המטמון של ההקשר הארוך של 6.1. החצייה היא מדרגה, לא שיפוע, והדרך הזולה ביותר לראות זאת היא לחצות אותה במרווח זעיר. בקשה של 271,000 טוקנים ללא מטמון לחלוטין עם 1,000 טוקני פלט עולה $0.552; ב-273,000 היא עולה $1.107. שבע עשיריות האחוז יותר טוקני קלט, פי 2.01 מהכסף. קצצו 2,000 טוקנים מהבקשה הזו והחשבון יורד מ-$1.107 ל-$0.552 — פחות מאחוז מהקלט תמורת חצי מהעלות.
שום דבר בקטע הזה לא עוסק בכך שהחלון של GPT-6.1 Sol גדול. הוא עוסק בכך שהחלון גדול מספיק כדי להגיע לגבול שעולה יותר ממה שגודל החלון קונה.

מה בעצם ממלא 1,050,000 טוקנים
תקציב הקשר מורכב משישה דברים, והם אינם ניתנים לשמירה במטמון במידה שווה. חלקים משוערים מבקשת סוכן מדגמית בת 240,000 טוקנים; הפרופורציות הן שלנו, וכללי השמירה במטמון הם של הספק, מתוך מדריך שמירת המטמון של ההנחיות שלו שנקרא באותו היום.
• תוכן מערכת המוזרק על ידי הספק ועיצוב בקשות — מוצג לפני ההודעות שלך, מחויב כקלט, ומוחרג במפורש מהאורך המינימלי שניתן לשמור במטמון. לא באחריותך לשלוט בכך, ולא באחריותך לקצץ בכך.
• הוראות המפתח והמערכת שלך, בסביבות 6,000 טוקנים. ניתן לשמור במטמון. זהו החלק הקדמי של הקידומת, כך ששינוי כאן מבטל את התוקף של כל מה שמאחוריו.
• הגדרות כלים וסכימות, בסביבות 14,000 טוקנים עבור משטח הכלים המתארח בתוספת הפונקציות שלך. ניתן לשמור במטמון, והחלק השביר ביותר של הקידומת: המדריך מפרט שמות כלים, תיאורים, סכימות, סדר והוראות ספציפיות לכלי כדברים שמזיזים את גבול הקידומת.
• הקורפוס שאוחזר, בסביבות 180,000 אסימונים. ניתן לשמור אותו במטמון, וזו ללא ספק השורה הגדולה ביותר. כדאי לשמור אותו במטמון רק אם הוא יציב ברמת הבתים בין קריאות — קורפוס שנבנה מחדש בכל בקשה הוא קורפוס במחיר מלא.
• התמליל המצטבר — סבבים קודמים ותוצאות כלים — כ-30,000 טוקנים ובמגמת עלייה. ניתן לשמור במטמון עד השינוי החדש ביותר; תוצאת הכלי שהגיעה בסבב הזה היא קלט טרי בתעריף המלא.
• אסימוני חשיבה — נוצרים, לעולם אינם נשמרים במטמון, ומחויבים בתשלום כפלט. הם צורכים חלון והם בלתי נראים בגוף התגובה.
שתי הערות תפעוליות נובעות ישירות מהרשימה הזו. ראשית, רשומות מטמון נשמרות במכונות בודדות: המדריך אומר שבקשה יכולה לעשות שימוש חוזר בקידומת „רק אם היא מגיעה למכונה שמחזיקה ברשומה תואמת שלא פג תוקפה”, ושניתוב עודף מתחיל מעל כ-15 בקשות בדקה. קידומת יציבה בקוד שלך עדיין עלולה להחמיץ בפרודקשן. שנית, הקידומת המינימלית הניתנת למטמון היא 1,024 טוקני קלט גלויים, וטוקני מערכת נסתרים אינם נספרים לצורך זה — כך שפרומפט מערכת קטן אינו קידומת הניתנת למטמון, לא משנה כמה גדולה הבקשה שסביבו.
תקרת התפוקה היא תקציב נפרד, לא מנה שנייה
128,000 טוקני פלט מקסימליים לא אומרים 128,000 טוקנים של תשובה. מדריך החשיבה מבהיר במפורש ש-max_output_tokens מגביל את הסך הכולל שהמודל מייצר, "כולל טוקני חשיבה, טוקני פלט גלויים וטוקני עיצוב שאינם גלויים", וכי טוקני חשיבה מחויבים כפלט תוך שהם תופסים מקום בחלון.
זה הופך את החיתוך להחלטת תכנון ולא למקרה קצה, בגלל האופן שבו הוא נכשל. כאשר היצירה מגיעה למגבלה, התגובה חוזרת עם סטטוס incomplete וסיבה max_output_tokens — והמדריך מזהיר שזה "עלול להתרחש לפני שמופקים אסימוני פלט גלויים כלשהם, כלומר אתה עלול לצבור עלויות עבור אסימוני קלט וחשיבה בלי לקבל תגובה גלויה." תקציב שמבזבז את כל החלון על קלט ומשאיר את הקצאת הפלט למזל הוא תקציב שעלול לחייב על בקשה מלאה בהקשר ארוך ולא להחזיר דבר שאפשר לפענח. ההמלצה ההתחלתית של הספק עצמו היא להקצות לפחות 25,000 אסימונים לחשיבה ולפלטים בזמן שאתה עוד מודד מה הפרומפט באמת דורש.
GPT-6.1 Sol מחדד את זה, וזו אחת השורות הבודדות שבאמת ספציפיות ל-6.1 במהדורה. סולם מאמץ החשיבה שלו כולל low, medium, high, xhigh ו-max, וההגדרות none ו-minimal אינן נתמכות. GPT-6 Sol מקבל את כל שש. לכן אין הגדרה ב-6.1 שמכבה את הוצאת החשיבה, ברירת המחדל היא medium, וצד הפלט של התקציב לעולם אינו בחינם.
חציית הקלט השמור במטמון, נקראת היכן שהחלון רחב ביותר
התעריף היחיד בכרטיס GPT-6.1 Sol שזז לרעת GPT-6 Sol הוא קלט במטמון: מ-$0.20 ל-$0.10 למיליון טוקנים, שעמוד המודל מציג כ-5% מתעריף הקלט ללא מטמון, ושאותו מדריך המטמון של הספק מכנה במפורש כמקרה 0.05x לעומת 0.1x שבו רוב המודלים מ-GPT-5.6 ואילך מתומחרים. קלט, כתיבות למטמון ופלט זהים בשני הכרטיסים, וגם מכפילי ההקשר הארוך זהים.
בדיוק עבור עומס העבודה שהעמוד הזה עוסק בו, זהו המונה הנכון שכדאי היה להזיז, והסיבה לכך היא הרכב של בקשה ארוכה ולא גודלה. במשימת 300,000 הטוקנים שלמעלה, 260,000 מטוקני הקלט הם קידומת ממוטבנת — 87 אחוזים מכל מה שהבקשה שולחת. לכן השורה הממוטבנת היא מונה הקלט הבודד הגדול ביותר בחשבון, וזהו המאפיין הכללי של עבודה עם הקשר ארוך: ככל שהחלון שבו אתה משתמש ארוך יותר, כך יותר ממנו הוא קידומת שכבר שלחת. הקטנת המונה הזה בחצי שווה $0.052 בבקשה ההיא.
והצוק לוקח בחזרה יותר ממה שהחציה נותנת, על אותה בקשה. אילו תומחר לפי תעריפי ההקשר הקצר, הוא היה משלם מתחת לקו: אותה עבודה של 300,000 אסימונים על GPT-6.1 Sol הייתה עולה $0.166 במקום $0.302 — עלות חציה של $0.136, או בערך פי 2.6 ממה ששווה המונה האחד שהשתנה במהדורה. מעל הקו תעריף הקריאה ממטמון מציג $0.20, שאינו מספר חדש במשפחה הזו: הוא כפול מהכותרת בכרטיס 6.1 ובדיוק מה ש-GPT-6 Sol גבה עבור קריאה ממטמון מתחת לקו לפני המהדורה הזו. עומס מטמון בהקשר ארוך אוסף את שינוי הכותרת ואז מחזיר אותו בגבול, והגבול — לא המודל — הוא הסיבה.

איך לקבוע את הגודל של תקציב הקשר
כהליך, לפי הסדר שבו האילוצים מחייבים:
• ספרו את הבקשה, אל תעריכו אותה.בצעו POST של המטען המדויק — כלים, תמונות, קבצים והכול — לנקודת הקצה לספירת טוקנים של קלט ב-Responses API. המדריך חד וחלק לגבי הסיבה: הספירה כוללת טוקנים של עיצוב עבור תפקידי הודעות וגבולות שלעולם אינם מופיעים בטקסט שאפשר לתַקסֵן באופן מקומי, והערכות מקומיות כמו "תווים חלקי ארבע" אינן מדויקות עבור תמונות, קבצים וסכמות.
• הקצה תחילה את צד הפלט.בחר max_output_tokens בהתחשב בכך שהוא מכסה יחד גם חשיבה, פלט גלוי ועיצוב, והתחל מהבאפר של הספק בגודל 25,000 טוקנים ולא מאפס. תקציב הקלט שלך הוא החלון פחות ההקצאה הזו, והמספר תשע מאות עשרים ושתיים הוא הגרסה של הספק לאותו חיסור.
•תמחר את זה בשני צדי 272,000 לפני שאתה שולח אותו. המדרגה גדולה מספיק כדי שבקשה שתוכננה להגיע ממש מתחת לקו ובקשה שתוכננה להגיע ממש מעליו הן מוצרים שונים.
• סדר את הקידומת לפי יציבות.הוראות, אחר כך סכימות כלים, אחר כך הקורפוס, ואז התמלול. כל מה שמשתנה בין קריאות מקומו בסוף, שם זה עולה באיבוד התאמת קידומת ולא בכל המטמון.
• נקה 1,024 טוקני קלט גלויים לפני שמצפים למטמון. מתחת למינימום הזה שום דבר לא נשמר במטמון, וטוקנים נסתרים של הספק אינם נכללים בספירה הזו.
• בדוק ששימוש חוזר הוא סביר. קידומת חייבת לשמש מחדש בתוך משך החיים של המטמון של 30 דקות, ועליה להגיע למכונה שמחזיקה את הרשומה; שניהם מתוארים במדריך, ואף אחד מהם אינו תכונה של הקוד שלך.
• מדוד מחדש לאחר כל שינוי במודל או בהגדרות. מעבר ל-GPT-6.1 Sol מסיר את מצב כיבוי החשיבה, מה שמשנה את מספרי טוקני החשיבה ולכן את צד הפלט של התקציב — ושינוי במאמץ החשיבה, בכלים, בסכימת פלט מובנית או בניהול הקשר יכול גם להזיז גבול של קידומת ולעלות לך את התעריף המטמון לחלוטין.
• החלט מה קורה כשהמשימה לא תצטמצם. דחיסה היא המוצא המתועד: בקשת Responses יכולה להגדיר context_management עם סף compact, והשרת מחליף תוכן שיחה קודם בפריט דחיסה אטום שמעביר מצב חשוב קדימה בפחות טוקנים. זוהי החלטת תקציב ולא קיצוץ ללא עלות, מפני שהמדריך מציין שדחיסה "יכולה למנוע שימוש חוזר מהטוקן הראשון שהשתנה ואילך" — מעבר דחיסה מבטל את הקידומת שמאחוריו.

החישוב בדף זה מתחיל מהדור ש-GPT-6.1 Sol מחליף, והדרגה הזו היא זו שאפשר לקרוא לה היום: הכרטיס שלנו עבור openai/gpt-6-sol מדווח על חלון הקשר של 1,050,000 טוקנים עם 128,000 טוקנים של פלט מקסימלי בתעריפי המחירון של OpenAI עם 0% תוספת — המחיר של הספק הוא המחיר שבדף, ושינוי מצד הספק מגיע לשם באותו יום ולא בעת חידוש. הכרטיס שלנו אינו כולל שדה קלט מקסימלי משל עצמו, כך שהנתון של 922,000 טוקנים עבור אותו מודל חייב להגיע מהתיעוד של הספק עצמו, וזה מה שהדף הזה השתמש בו לאורך כל הדרך. הכרטיס שימושי לקביעת גודל: החלון ותקרת הפלט שהוא כן מפרסם הם שני המספרים שנוהל התקציב שלמעלה מחסר זה מזה, והדרגה שמתחת היא זו שאפשר למעשה להריץ מולה את הנוהל הזה בזמן ש-6.1 עדיין חדש. הוא נמצא בכתובת https://www.orcarouter.ai/models/openai/gpt-6-sol.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
