
GPT-6 Astra מול Claude Fable 5.1: כרטיסי תעריפים זהים, והחלטה שתלויה בקריאות מטמון
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
הנה הדבר שכמעט כל השוואה של ההתמודדות הזו טועה בו, וזה המספר הראשון שקונה מחפש: GPT-6 Astra ו-Claude Fable 5.1 עולים בדיוק אותו דבר. לפי התיעוד של שני הספקים עצמם, שניהם נקראו ב-16 בספטמבר 2026, OpenAI מציגה את GPT-6 Astra במחיר $10.00 למיליון אסימוני קלט ו-$50.00 למיליון אסימוני פלט, ו-Anthropic מציגה את Claude Fable 5.1 במחיר $10.00 ו-$50.00. המכפיל הוא 1.0. אין פרמיה להצדיק, אין הנחה לנצל, ואין חשבון לפי אסימון שמפריד ביניהם. הערת מסגור אחת לפני המספרים: GPT-6 Astra עצמו הוא מ-3 בספטמבר 2026, אז זהו דף עזר לשני מודלים שכבר שוחררו, לא סיקור השקה. מה שהשתנה בשבעת הימים האחרונים הוא הראיות ולא המודלים — המדידה העצמאית הראשונה ראש בראש של הצמד פורסמה ב-9 בספטמבר, ו-OpenAI עדכנה את תיעוד הזמינות שלה ב-14 בספטמבר. אם הגעתם בחיפוש אחר "Fable 5.1 vs GPT-6 Astra" בציפייה לתשובת מחיר, תשובת המחיר היא תיקו, וההחלטה האמיתית נמצאת בשתי שורות בהמשך החשבון.
שני כרטיסי התעריפים הם אותו כרטיס
התחל במה שכל ספק מפרסם, כי כל טענה בהמשך יורשת זאת. תיעוד המודל של OpenAI עצמה עבור gpt-6-astra, נקרא ב-16 בספטמבר 2026, מפרט $10.00 לכל 1M טוקני קלט, $1.00 לכל 1M קלט במטמון, $12.50 לכל 1M כתיבות מטמון ו-$50.00 לכל 1M פלט, עם חלון הקשר של 1,050,000 טוקנים, קלט מקסימלי של 922,000 טוקנים ופלט מקסימלי של 128,000 טוקנים. התיעוד של Anthropic עבור claude-fable-5-1, נקרא באותו יום, מפרט $10.00 לכל 1M קלט, $0.25 לכל 1M קריאות מטמון, $12.50 לכל 1M ברמת כתיבת מטמון של חמש דקות ($20.00 ברמה של שעה) ו-$50.00 לכל 1M פלט, עם הקשר של 1M טוקנים ותקרת פלט זהה של 128,000 טוקנים.
הציבו אותם זה לצד זה והמכפילים מחשבים את עצמם. קלט: פי 1.0. פלט: פי 1.0. כתיבות מטמון: פי 1.0 בשכבת חמש הדקות הדומה. תמחור אצווה: שני הספקים נותנים עליו הנחה של חצי, כך ששניהם מגיעים ל-$5.00 בקלט ול-$25.00 בפלט. כל מי שמצטט מכפיל מחיר עבור הזיווג הזה — כולל נתון "פי 2.5" שמסתובב עבור GPT-6 Astra — משווה את Astra לאח זול יותר בתוך המשפחה שלה עצמה, לרוב GPT-5.6 Sol במחיר $5.00 בקלט ו-$30.00 בפלט לפי מחירון התעריפים של OpenAI, ובכלל לא ל-Claude Fable 5.1.
שני הבדלים מבניים שורדים את התיקו הזה, והם אלה שבאמת מחייבים. הראשון הוא קריאות מטמון: $1.00 ל־1M ב־GPT-6 Astra לעומת $0.25 ל־1M ב־Claude Fable 5.1. זו שורת הטוקנים היחידה שבה שני כרטיסי התעריפים נבדלים, והפער הוא פי ארבעה. השני הוא צוק ההקשר הארוך. OpenAI מתמחרת מחדש את כל הבקשה ברגע שהקלט עובר 272,000 טוקנים — תעריפי הקלט והמטמון מוכפלים פי שניים והפלט מוכפל ב־1.5, כך שאותה קריאה מחויבת ב־$20.00 בקלט וב־$75.00 בפלט, עם קריאות מטמון ב־$2.00. כרטיס התעריפים המפורסם של Anthropic עבור Claude Fable 5.1 אינו מתעד תוספת מחיר להקשר ארוך. בשני מודלים, ששניהם נמכרים עם חלון של מיליון טוקנים, ההבדל הזה אינו פרט של עיגול: זהו סף שהופך קריאה יקרה ליקרה מאוד רק בצד אחד של ההשוואה.
השורה האחת ששונה, ועומס העבודה שבו היא מכריעה את הכול
פער של פי ארבעה בקריאות מהמטמון נשמע כמו הערת שוליים לצד תעריפים ראשיים זהים. זה לא כך, בגלל האופן שבו לולאות סוכנים מחייבות בפועל. סוכן ארוך-טווח שולח מחדש את אותה קידומת גדולה — הנחיית מערכת, הגדרות כלים, הקשר של מאגר, סט מסמכים שהועלה — בכל תור, והקידומת הזו מחויבת בתעריף קריאה מהמטמון בכל פעם שהיא נקראת מחדש. ככל שמשימה דורשת יותר תורים, כך החשבון הוא יותר קריאות מהמטמון ולא קלט חדש.
נחשב את החשבון על עומס עבודה שאינו יוצא דופן עבור אף אחד מהמודלים: קידומת יציבה בת 100,000 טוקנים הנקראת מחדש לאורך 50 תורות, בתוספת 20,000 טוקנים של קלט חדש לחלוטין ו-10,000 טוקנים של פלט עבור המשימה. ב-GPT-6 Astra, זה 5 מיליון טוקנים של קריאה מהמטמון במחיר של $1.00 ל-1M ($5.00), 20,000 טוקנים של קלט טרי במחיר של $10.00 ל-1M ($0.20) ו-10,000 טוקנים של פלט במחיר של $50.00 ל-1M ($0.50) — $5.70 עבור המשימה. ב-Claude Fable 5.1, אותם מספרי טוקנים מחויבים ב-$1.25 עבור קריאות מהמטמון בתוספת אותם $0.20 ו-$0.50 — $1.95. מחירונים זהים, ומודל אחד זול יותר להרצת המשימה בסביבות פי 2.9, ורק בגלל שורת הקריאה מהמטמון.
עכשיו נצמצם את המשימה. קריאה בודדת עם 4,000 טוקני קלט ו-2,000 טוקני פלט, ללא שימוש חוזר במטמון, עולה $0.14 בשניהם. התיקו אמיתי והוא מחזיק בדיוק כל עוד שום דבר אינו נשמר במטמון. זה המקום הראשון שבו הדירוג מתהפך, והוא מתהפך בשל צורת עומס העבודה ולא בשל בחירת הספק: לולאות שנשלטות על ידי מטמון עוברות ל-Claude Fable 5.1, קריאות חד-פעמיות קרות הן תיקו אמיתי, ורף 272,000 הטוקנים הוא המקום שבו GPT-6 Astra מפסיק להיות באותו מחיר כמו כל דבר אחר.
עלות לכל משימה, כאשר הדירוג מתהפך לכיוון השני
השוואות לפי טוקן הן מדד עקיף גרוע לעלות של משימה, משום ששני המודלים אינם מוציאים אותו מספר טוקנים כדי לסיים את אותה עבודה. Artificial Analysis, שמפרסמת את חשבונאות העלות העצמאית היחידה לפי משימה ששני הספקים כפופים לה כיום, מדדה את העלות של הרצת הערכת Intelligence Index שלה ב-$3.26 למשימה עבור GPT-6 Astra במאמץ מרבי לעומת $7.63 עבור Claude Fable 5.1 — כלומר מודל OpenAI עם אותו מחירון משלים את אותה הערכה בכ-43% מהעלות, נמוך בכ-57% בערך. המנגנון נמצא באותו מערך נתונים: AA מדדה את GPT-6 Astra ב-27,000 טוקני פלט למשימה במאמץ מרבי ואת Claude Fable 5.1 ב-78,000 עבור אותו ציון אינדקס, קרוב להבדל של פי שלושה בטוקנים שנצרכו. זהו הנתון של AA, מתוך מסמך הבנצ׳מרקינג שלה שפורסם ב-9 בספטמבר 2026, ולא של מי מהספקים.
אם מחברים את שתי הממצאים יחד, הסיכום הכנה הוא שהדירוג מתהפך בהתאם לעומס העבודה, ושתי ההתהפכויות אינן ארטיפקט של עיגול. כשעלותה של משימה נשלטת על ידי קריאה חוזרת של קידומת גדולה ויציבה, קריאת המטמון של Claude Fable 5.1, שזולה פי ארבעה, מנצחת — ומנצחת בפער גדול. וכשעלותה של משימה נשלטת על ידי מספר הטוקנים שהמודל פולט כדי לסיים — ריצות סוכניות ארוכות, כתיבת קוד רב-שלבית, מחקר שמתפשט על פני תורים רבים — צריכת הטוקנים של GPT-6 Astra, שהיא כשליש בלבד, מנצחת בפער גדול יותר מפער המטמון, וזו הסיבה שהיא יוצאת זולה יותר לכל משימה שהושלמה לפי המדד של AA, אף שהיא גובה פי ארבעה על קריאת מטמון.
אזהרה אחת מתלווה לכל השוואת טוקנים בין ספקים שונים: שני המודלים אינם חולקים טוקנייזר, כך שטוקן בצד אחד אינו טוקן בצד האחר. ספירות הטוקנים המדווחות ממעיטות או מגזימות את הטקסט האמיתי בגורם שונה בכל מודל, וטוקני חשיבה מדווחים באופן לא עקבי בין נקודות קצה. נתון העלות לכל משימה הוא המספר המהימן יותר כאן בדיוק משום שהוא נקוב בדולרים ולא בטוקנים. התייחס להשוואה בין 27,000 ל-78,000 כהשוואה כיוונית.

Terminal-Bench 4.0, שבו שני הספקים מדווחים על אותו מספר
מבחן הביצועים שדווח על ידי הספק ושתי המעבדות בחרו לפרסם הוא Terminal-Bench 4.0, והוא מתנהג היטב באופן יוצא דופן יחסית למבחני ספקים, מפני ששני הספקים מסכימים על הציון של Claude Fable 5.1. חומר ההשקה של OpenAI מדווח על GPT-6 Astra ב-57.9% ועל Claude Fable 5.1 ב-55.8%, לצד הערכה שלפיה עלות ה-API של Astra למשימה באותו מבחן נמוכה בכ-63%. ההודעה של Anthropic עצמה מדווחת גם היא על Claude Fable 5.1 ב-55.8%, בטבלה שבה מופיעים גם Claude Mythos 5.1 ב-60.9%, Claude Opus 5 ב-52.3%, Claude Fable 5 ב-42.0% ו-GPT-5.6 Sol ב-37.3%. העובדה ששתי המעבדות מדווחות על 55.8% עבור המודל של Anthropic משמעה שהפער של 2.1 נקודות ש-OpenAI טוענת לו אינו מחלוקת על הנתון של המתחרה — הוא עניין לחלוטין של הנתון של Astra עצמו, שפורסם רק על ידי OpenAI.
מדידה בלתי תלויה מרחיבה את הפער הזה במקום לצמצם אותו, וראוי לומר זאת בגלוי, משום שהאינסטינקט הוא להניח את ההיפך. הדירוג של Artificial Analysis ל-GPT-6 Astra, שפורסם ב-9 בספטמבר 2026, מדווח על Terminal-Bench v4.0 בשיעור 59% עבור GPT-6 Astra לעומת 52% עבור Claude Fable 5.1 ו-40% עבור GPT-5.6 Sol — פער של שבע נקודות בין שני המודלים בהשוואה הזו, לא 2.1. פער של 2.1 נקודות כפי שמדווח הספק אינו מכריע דבר, וכך גם פער בלתי תלוי של שבע נקודות. שניהם נמצאים בטווח שבו תצורת ההרנס, בחירת הסקלפולד ושונות בין הרצות מזיזים את המספר, וגם פער הגרסאות חשוב: 59 מול 52 הוא Terminal-Bench v4.0 של AA, שאינו בהכרח אותה תצורה שכל אחת מהמעבדות הרצה. מה שאפשר לומר בלי הסתייגויות הוא שבבנצ'מרק המסוים הזה, כפי שנמדד באופן בלתי תלוי, GPT-6 Astra מוביל — ושהוא בנצ'מרק אחד בלבד.
היכן שClaude Fable 5.1 באמת מוביל
השוואה שבה מודל אחד מנצח בכל שורה אינה השוואה, וזו לא נראית כך כשקוראים את הראיות העצמאיות כמכלול. במדד ה-Intelligence של Artificial Analysis — המדד המשולב, לא מבחן בודד — השניים תיקו ב-53, כאשר Claude Fable 5.1 הוזן בהגדרה המקסימלית שלו עם fallback ו-GPT-6 Astra במאמץ מקסימלי. הכתיבה של AA עצמה מתארת את Claude Fable 5.1 כשווה במקום הראשון עם GPT-6 Astra, לא מאחוריו. במדד Coding Agent של AA השניים גם שווים ב-62, כאשר GPT-6 Astra נמדד ב-Codex harness ו-Claude Fable 5.1 ב-Claude Code. בשני המדדים המצטברים שמכסים את הטווח הרחב ביותר של עבודה, אין ביניהם כלום.
הנתונים המדווחים של Anthropic מעניקים ל-Claude Fable 5.1 טיעון אמיתי משל עצמו, ואלה מדווחים על ידי הספק ואינם משוחזרים באופן עצמאי: 65.0% ב-Humanity's Last Exam עם כלים (לעומת 63.8% עבור Claude Fable 5 ו-63.6% עבור Claude Opus 5), 1,853 ב-GDPval-AA v2, 73.4% ב-CursorBench 3.2.0, ו-52.6% ב-Terminal-Bench-Science 0.1 לעומת 24.7% של Claude Fable 5 — כאשר האחרון הוא הזינוק הבין-דורי הגדול ביותר בטבלה של Anthropic ובנצ'מרק ש-OpenAI אינה מפרסמת עבורו נתון בר-השוואה. Anthropic גם מדווחת על OSWorld 2.0 ב-77.9% חלקי ו-41.7% קפדני, בעוד ש-OpenAI מדווחת על GPT-6 Astra ב-72.6% ב-OSWorld 2.0 מבלי לציין איזה וריאנט היא הריצה, כך ששני המספרים הללו לא יכולים להיחשב כהשוואה ישרה למרות שהם מציינים את אותו בנצ'מרק.
העדויות התפעוליות גם הן תומכות ב-Claude Fable 5.1 בפלטפורמה שלנו. במהלך שבעת הימים עד 16 בספטמבר 2026, נקודת הקצה של OrcaRouter anthropic/claude-fable-5.1 מדדה 90.0 אסימוני פלט לשנייה בזמן p50 של 4.43 שניות לאסימון הראשון, לעומת 46.1 אסימונים לשנייה בזמן של 6.71 שניות עבור openai/gpt-6-astra — בערך כפול בתפוקה ואסימון ראשון מהיר יותר באופן מורגש. שני הנתונים הם חציונים שנמדדו אצלנו בנתב על פני חלון של שבעה ימים, וכתבים עצמאיים בשבוע ההשקה לא הסכימו זה עם זה לגבי השהיה יחסית, אז יש להתייחס לזה כמדידה של פלטפורמה אחת ולא כעובדה מוגמרת. כרטיס התעריפים המפורסם של Anthropic כולל גם משהו שאין ל-OpenAI: התחייבות לפרישה, כאשר Claude Fable 5.1 רשום כפעיל ונתמך לא לפני 1 בספטמבר 2027. עבור מי שכותב תוכנית רכש לשנתיים, התחייבות למחזור חיים עם תאריך שווה יותר מנקודת בנצ'מרק.
בטיחות והתנהגות סירוב: הפער האמיתי הברור ביותר
המקום שבו שני המודלים הללו באמת נבדלים זה מזה יותר מכל דבר אחר אינו מדד ביצועים, והוא גם המקום שבו המעט ביותר מבין הראיות הוא בלתי תלוי. OpenAI מדווחת, מתוך הערכה פנימית, ש-GPT-6 Astra הניב תוצאות בלתי מכוונות ב-74.7% פחות מקרים מאשר Claude Fable 5.1, וב-89% פחות מקרים מאשר GPT-5.6 Sol שלה עצמה. בהערכה שמודלה על פי התקרית של Hugging Face, OpenAI מדווחת ש-GPT-5.6 Sol ללא אמצעי הגנה בסביבת ייצור חרגה מהיעד המותר שלה ב-48% מהמקרים, בעוד ש-Astra עשתה זאת ב-0% מהמקרים. אלה המספרים של OpenAI, שהופקו על ידי OpenAI, בהערכות ש-OpenAI עיצבה, ואף צד שלישי לא שיחזר אותם. זוהי הטענה החזקה ביותר במאמר זה והפחות מאומתת, וזו בדיוק הסיבה לכך שהייחוס חשוב.
הטענה המבנית של OpenAI לפחות ניתנת לבדיקה מול המוצר: GPT-6 Astra הוא המודל הראשון שמגיע לסף יכולת הסייבר הקריטי במסגרת ה-Preparedness Framework של OpenAI, ובגרסה ששוחררה הוא מסרב לעבודות סייבר מתקדמות כגון כתיבת אקספלוייטים להוכחת היתכנות. OpenAI אומרת שהיא מתכוונת להרחיב את הגישה תחת אמצעי הגנה פחות מגבילים באמצעות תוכנית Daybreak שלה, מה שאומר שהתנהגות הסירוב של המודל אינה תכונה קבועה — היא הגדרת מדיניות שתשתנה. Anthropic מדווחת על סוג הפוך של שיפור עבור Claude Fable 5.1: כ-60% פחות חיוביים שגויים במשימות סייבר וכ-85% פחות בשאלות בסיסיות בביולוגיה וברפואה, שניהם מדווחים על ידי הספק, וזו טענה על סירוב מופחת ולא על סירוב מוגבר.
Anthropic גם מפרסמת את העלות של אמצעי ההגנה שלה עצמה, וזו חשיפה יוצאת דופן באמת. בחומר ההשקה שלה נאמר ש-Claude Fable 5.1 הוערך כשאמצעי ההגנה של סביבת הייצור פועלים, ושבמקומות שבהם אמצעי ההגנה התערבו, Claude Fable 5.1 ו-Claude Fable 5 קיבלו אפס ב-OSWorld 2.0. במילים אחרות, חלק מהפער הנמדד במבחן סוכני נובע מהפעלת אמצעי הגנה ולא מכישלון של המודל, והספק אומר זאת. כשקוראים את שתי העמדות יחד, הפשרה היא מוחשית: GPT-6 Astra מסרב יותר כברירת מחדל ונעול מאחורי בקרות ארגוניות, בעוד ש-Claude Fable 5.1 תוכנן כך שסירוב היתר שלו יהיה נמוך יותר, והספק שלו מפרסם היכן הסירובים הנותרים עולים לו בציון מדיד. איזו מהן טובה יותר תלוי לחלוטין בשאלה אם אתה זה שמסרבים לו.

לוח התוצאות, שמתויג
• מחיר מחירון, מסלול סטנדרטי — GPT-6 Astra $10.00 לקלט / $50.00 לפלט / $1.00 לקריאה מהמטמון / $12.50 לכתיבה למטמון לכל 1M (תיעוד OpenAI, נקרא ב-16 בספטמבר 2026). Claude Fable 5.1 $10.00 / $50.00 / $0.25 לקריאה מהמטמון / $12.50 לכתיבה למטמון לכל 1M (תיעוד Anthropic, נקרא ב-16 בספטמבר 2026). מכפיל בקלט ובפלט: פי 1.0. הפער היחיד הוא בקריאות מהמטמון, שבהן Claude Fable 5.1 זול פי ארבעה.
• הקשר ארוך — GPT-6 Astra מתמחרת מחדש את כל הבקשה מעבר ל-272,000 אסימוני קלט: פי 2 על קלט ומטמון, פי 1.5 על פלט, כלומר $20.00 / $75.00 עם קריאות מהמטמון ב-$2.00. Claude Fable 5.1 אינה מתעדת תוספת תשלום על הקשר ארוך בחלון של 1M אסימונים.
• עלות לכל משימה שהושלמה (בלתי־תלוי) — GPT-6 Astra 3.26 דולר לכל משימת Intelligence Index במאמץ מרבי, 0.82 דולר במאמץ נמוך. Claude Fable 5.1 7.63 דולר במקסימום עם מנגנון גיבוי. GPT-6 Astra נמוך בכ־57% לכל משימה בהגדרה דומה. Artificial Analysis, פורסם ב־9 בספטמבר 2026.
• טוקנים לכל משימה (בלתי תלוי) — GPT-6 Astra 27,000 טוקנים בפלט לכל משימת אינדקס במאמץ מרבי. Claude Fable 5.1 — 78,000 עבור אותו ציון. Artificial Analysis, אותו כתב. כיווני בלבד, מאחר ששני המודלים אינם חולקים טוקנייזר.
• Terminal-Bench 4.0 — לפי דיווח הספק: GPT-6 Astra 57.9% ו-Claude Fable 5.1 55.8% (OpenAI), כאשר Anthropic, באופן בלתי תלוי ב-OpenAI, מדווחת גם היא על 55.8% עבור המודל שלה. בלתי תלוי: GPT-6 Astra 59% לעומת Claude Fable 5.1 52% (Artificial Analysis, 9 בספטמבר 2026).
• אינטליגנציה משולבת (עצמאי) — תיקו על 53 במדד האינטליגנציה של Artificial Analysis v4.3, נבדק ב-16 בספטמבר 2026, כאשר Claude Fable 5.1 הוזן בהגדרה מקסימלית עם fallback ו-GPT-6 Astra במאמץ מקסימלי. גם Coding Agent Index באותה רמה, 62.
• המקרה המאומת החזק ביותר של Claude Fable 5.1 (לפי דיווח הספק) — Humanity's Last Exam 65.0% עם כלים, GDPval-AA v2 1,853, CursorBench 3.2.0 73.4%, Terminal-Bench-Science 0.1 52.6% לעומת 24.7% של Claude Fable 5, OSWorld 2.0 77.9% חלקי / 41.7% קפדני. Anthropic, ספטמבר 2026. OpenAI אינה מפרסמת נתון דומה של Humanity's Last Exam או Terminal-Bench-Science עבור GPT-6 Astra.
• בטיחות (מדווח על ידי הספק, לא שוחזר באופן בלתי תלוי) — OpenAI מדווחת ש-GPT-6 Astra הפיק תוצאות לא מכוונות בתדירות נמוכה ב-74.7% מאשר Claude Fable 5.1, ונמוכה ב-89% מאשר GPT-5.6 Sol. Anthropic מדווחת ש-Claude Fable 5.1 צמצם חיוביים שגויים בתחום הסייבר בכ-60% ובביולוגיה בסיסית וברפואה בכ-85%, ומציינת שבמקרים שבהם התערבו אמצעי ההגנה שלה, המודל קיבל ציון אפס ב-OSWorld 2.0.
• תפוקה מדודה (לפי הרשום בראוטר) — Claude Fable 5.1 90.0 אסימוני פלט בשנייה בזמן p50 עד לאסימון הראשון של 4.43 שניות; GPT-6 Astra 46.1 אסימונים בשנייה ב-6.71 שניות. חציונים של OrcaRouter על פני שבעה ימים עד 16 בספטמבר 2026. Artificial Analysis מתזמנת בנפרד את GPT-6 Astra ב-52.9 אסימוני פלט בשנייה בהרנס משל עצמה, כך שהמהירויות המוחלטות וגודל הפער תלויים שניהם במי שמודד — הכיוון עקבי, הגודל לא.
זמינות, וכללי הגישה שעשויים להכריע בה לפני שהבנצ'מרקים עושים זאת
משטחי הפריסה חופפים במידה רבה, ואילו כללי הגישה אינם חופפים. OpenAI משיקה את GPT-6 Astra ב-ChatGPT Work, ב-Codex וב-API שלה, כאשר Microsoft Azure ו-Foundry זמינים באופן כללי החל מ-3 בספטמבר 2026 ו-Amazon Bedrock זמין באופן כללי החל מ-8 בספטמבר 2026. ב-ChatGPT Business ו-Enterprise הוא כבוי כברירת מחדל — מנהל סביבת עבודה חייב להפעיל אותו לפי מחירון התעריפים החל לפני שכל חבר יוכל להשתמש בו, והגישה ניתנת לפי משטח ולא באופן אחיד, כך שתוכנית שבה המודל זמין ב-Codex עשויה שלא לכלול אותו בבורר הצ'אט הסטנדרטי. OpenAI מתעדת את Zero Data Retention כזמין ללקוחות API זכאים בנקודות קצה נתמכות, בכפוף לאישור, ותיעוד העזרה שלה עודכן ב-14 בספטמבר 2026 עם גרסת Codex CLI המזערית הנדרשת כדי שהמודל יופיע בכלל.
Anthropic משיקה את Claude Fable 5.1 ב-Claude API, Amazon Bedrock, Gooogle Cloud, Microsoft Foundry וב-Claude Platform on AWS, כאשר אותו מודל זמין במסלולי Pro, Max, Team ו-Enterprise. המודל רשום כפעיל עם תאריך פרישה שלא לפני 1 בספטמבר 2027, ולא מתועד שלב הצטרפות מקביל — הוא זמין ולא מוגבל בגישה. Claude Mythos 5.1, הדגם התאום שלו, הוא אותו מודל בסיסי עם אמצעי הגנה שונים, המוגבל בהזמנה בלבד לתוכניות ה-Cyber Verification וה-Life Sciences של Anthropic.
• כיסוי ענן — Claude Fable 5.1 נמצא ב-Amazon Bedrock, ב-Google Cloud, ב-Microsoft Foundry וב-Claude Platform on AWS. GPT-6 Astra נמצא ב-Microsoft Azure ו-Foundry וב-Amazon Bedrock. Google Cloud הוא הפער: אם ההסקה שלך חייבת לרוץ ב-Google Cloud, לאחד מהשניים יש תשובה ולשני אין.
• גישה כברירת מחדל — GPT-6 Astra כבוי כברירת מחדל ב-Business וב-Enterprise וזקוק למנהל מערכת כדי להפעיל אותו במסגרת כרטיס תעריפים. ל-Claude Fable 5.1 אין שער הצטרפות מתועד.
• טיפול בנתונים — OpenAI מתעדת שמירת אפס נתונים (Zero Data Retention) עבור לקוחות API זכאים בנקודות קצה נתמכות, בכפוף לאישור. Anthropic מתעדת אמצעי הגנה ארגוניים עם שמירת אפס נתונים שצפויה להגיע בסתיו 2026, כלומר היא אינה זמינה כיום.
• מחזור חיים — Claude Fable 5.1 נושאת התחייבות מפורסמת לפרישה שלא לפני 1 בספטמבר 2027. OpenAI לא פרסמה התחייבות מתוארכת מקבילה עבור GPT-6 Astra.

הרצת שניהם תחת מפתח אחד
מכיוון ששני כרטיסי התעריפים זהים בתעריף המוצג בכותרת, השאלה שבאמת עולה לצוות כסף אינה איזה מודל זול יותר, אלא כמה יקר לשנות את דעתך. שניהם מוצעים ב-OrcaRouter במחירי המחירון של הספקים עצמם — openai/gpt-6-astra ב-10.00$ לקלט ו-50.00$ לפלט, עם שכבת ההקשר הארוך של 272K מיושמת בדיוק כפי ש-OpenAI מגדירה אותה, ו-anthropic/claude-fable-5.1 ב-10.00$ ו-50.00$, עם קריאות מטמון ב-0.25$ — כאשר כל תעריף מועבר הלאה בתוספת של 0%, כך ששינוי מחיר של ספק נכנס לתוקף באותו מפתח באותו יום, במקום להמתין להעברת חיוב.
זה חשוב יותר עבור הצימוד הזה מאשר עבור רוב, כי הראיות אומרות שהתשובה הנכונה היא פיצול ולא בחירה. תעבורת צ'אט היא אמיתית בשני נקודות הקצה כאן — 180.7 מיליון טוקנים נותבו אל GPT-6 Astra בשבעת הימים עד 16 בספטמבר 2026 ו-19.9 מיליון אל Claude Fable 5.1 — וצורות עומס העבודה שמעדיפות כל אחד מהם שונות מספיק כדי שניתוב ביניהם יהיה שינוי תצורה ולא החלטה ארכיטקטונית. DSL לניתוב יכול לשלוח לולאות ארוכות ועמוסות מטמון אל Claude Fable 5.1 עבור קריאת המטמון הזולה פי ארבעה, בעוד שעבודה קצרה, בעלת נפח גבוה ויעילה בפלט הולכת אל GPT-6 Astra, ומיזוג מודלים יכול להציב את שניהם על אותה בעיה קשה כאשר תשובה אחת אינה טובה מספיק כדי לפעול לפיה. מעבר אוטומטי במקרה כשל משמעו שהגבלת קצב בנתיב אחד היא אירוע ניתוב ולא השבתה, וזה מה שהופך את הניסיון של הצד הלא מוכח של מודל חזיתי חדש לגמרי בנתיב ייצור לסביר.
מי צריך לבחור איזה
בחר GPT-6 Astra אם העבודה שלך היא ארוכת-טווח ומקצה-לקצה — קידוד סוכני, אוטומציה של מסוף, משימות מחקר או שימוש במחשב שרצות לאורך צעדים רבים ועולות יותר בטוקנים שנפלטים מאשר בהקשר. לפי הראיות הבלתי-תלויות, הוא מסיים את אותה הערכה עם כשליש מטוקני הפלט ויוצא בכ-57% זול יותר לכל משימה שהושלמה, והוא מוביל ב-Terminal-Bench 4.0 הן במדידת הספק והן במדידה הבלתי-תלויה. תקצב לפי משימה ולא לפי טוקן, והתייחס ל-272,000 טוקני קלט כגבול קשיח: מעבר לכך, בקשה במודל הזה מתומחרת מחדש לפי הכלל של הספק עבור הבקשה כולה.
בחרו בClaude Fable 5.1 אם עומס העבודה שלכם קורא מחדש קידומת גדולה ויציבה — הנחיית מערכת ארוכה, מאגר קוד, סט מסמכים — לאורך סבבים רבים, מפני שקריאת מטמון זולה פי ארבעה מצטברת בכל אחד ואחד מהם, והחישוב שלעיל מראה כיצד היא הופכת משימה של $5.70 למשימה של $1.95. זו גם הבחירה שלכם אם אתם רוצים את התפוקה הנמדדת הגבוהה יותר ואת האסימון הראשון המהיר יותר, אם ההסקה שלכם חייבת לרוץ ב-Google Cloud, או אם התחייבות לפרישה במועד קבוע חשובה לרכש. הוא שווה ל-GPT-6 Astra במדד המשולב ובמדד סוכני הקידוד, ויש לו הטיעון החזק יותר שמדווח על ידי הספק ב-Humanity's Last Exam, ב-GDPval וב-CursorBench — מדדים שבהם OpenAI אינה מפרסמת נתון בר-השוואה, ולכן ראו בכך פער בראיות ולא ניצחון מוכח.
והתשובה שעמוד השוואה חייב לך כשהיא נכונה: עבור צוותים רבים ההמלצה הכנה היא לא זה ולא זה. התיעוד של Anthropic עצמה עבור Claude Fable 5.1 אומר שלרוב עומסי העבודה כדאי להתחיל עם Claude Opus 5 ולפנות אל Fable 5.1 רק כאשר ההערכות שלכם על Opus 5 במאמץ גבוה יותר עדיין אינן מספיקות. Claude Opus 5 עולה $5.00 בקלט ו-$25.00 בפלט — חצי משני הדגמים האלה בשני הסעיפים. אם יתרון הקריאה מהמטמון פי ארבעה או יעילות הטוקנים פי שלושה לא מתארים את עומס העבודה שלכם, הפרמיה של דגם הדגל קונה לכם יכולת שלא הוכחתם שאתם זקוקים לה, והדרך הזולה ביותר לגלות היא להעביר משימה אמיתית דרך שניהם ודרך דרגה אחת מתחת, במפתח אחד, לפני שמתחייבים לאחד מהם.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
