
GPT-6.1 Sol נגד Kimi K3: ההורדה קיימת, וזו עדיין לא האפשרות הזולה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Kimi K3 הוא הדוגמה הנגדית שבדרך כלל מכריעה ויכוחים מהסוג הזה. Moonshot AI הוציאה את המודל בעל 2.8 טריליון פרמטרים ביולי 2026 ופרסמה את המשקולות — moonshotai/Kimi-K3 נמצא ב-Hugging Face, ללא הגבלת גישה, עם יותר ממיליון הורדות ותיקון אחרון בספטמבר. אז אין כאן כוכבית של "פתוח באופן עקרוני, נשמר מטעמי הקשחת בטיחות", ואין עיכוב של שבועיים שצריך לחכות שיעבור. GPT-6.1 Sol, ש-OpenAI שחררה ב-29 בספטמבר 2026, הוא סגור ופועל רק דרך API ותמיד יהיה כזה. ובלוח העצמאי המודל שניתן להוריד מקבל 43.6 לעומת 51.8 של המודל הסגור, בעוד עלותו 2.00 דולר לכל משימת אינדקס שהושלמה לעומת 0.72 דולר. משקולות פתוחות אמורות להיות פתח המילוט הזול; בזיווג הזה הן הצד היקר של העסקה, והסיבה אינה הרישיון.
מהו כל מודל
Kimi K3 הוא מודל תערובת מומחים דליל עם 2,800 מיליארד פרמטרים בסך הכל וכ-104 מיליארד — כ-3.7% — פעילים לכל טוקן. הוא נושא חלון הקשר של 1,048,576 טוקנים, מקבל טקסט ותמונות כקלט, ומחזיר טקסט. הצ'קפוינט שפורסם הוא ארטיפקט FP8 וזהו הורדה גדולה באמת; פריסה בייצור על החומרה שלך היא החלטה של אשכול ולא של תחנת עבודה. הטענה הארכיטקטונית של Moonshoot היא סכמת קשב ליניארי היברידי שהיא אומרת שהיא מהירה במידה ניכרת בפענוח הקשר ארוך, בנוסף לעבודת השארית והניתוב שהפכו מודל עם 2.8 טריליון פרמטרים לבר-שירות בכלל.
GPT-6.1 Sol הוא רענון בדרג הביניים של OpenAI — מתחת ל-GPT-6 Astra, מעל GPT-6 Luna — עם חלון של 1,050,000 טוקנים, תקרת פלט של 128,000 טוקנים, קלט טקסט, תמונה וקובץ, ותאריך ידע של 30 באפריל 2026. החשיבה פועלת מרמה נמוכה ועד מקסימום כאשר בינונית היא ברירת המחדל; הרמה 'ללא' ש-GPT-6 Sol הקודם קיבל נדחית לחלוטין, והערת ההגירה של OpenAI עצמה מפנה מפתחים אל הרמה 'נמוכה' במקום. המחיר הוא $2.00 ו-$10.00 למיליון טוקנים, כאשר קלט במטמון עולה $0.10.
שורה אחת לכל מימד, שני הצדדים בכל אחד:
• קלט — GPT-6.1 Sol 2.00 דולר למיליון לעומת Kimi K3 3.00 דולר למיליון
• פלט — GPT-6.1 Sol 10.00 דולר למיליון לעומת Kimi K3 15.00 דולר למיליון
• קלט במטמון — GPT-6.1 Sol 0.10 דולר למיליון לעומת Kimi K3 0.30 דולר למיליון
• חלון הקשר — 1,050,000 טוקנים לעומת 1,048,576 טוקנים; הבדל של 0.1%, חסר משמעות
• פלט מרבי — 128,000 טוקנים בשניהם
• סך הפרמטרים והפרמטרים הפעילים — לא נחשפו לעומת 2,800 מיליארד סה"כ, 104 מיליארד פעילים לכל טוקן
• מודאליות — טקסט, תמונה וקובץ נכנסים, טקסט יוצא לעומת טקסט ותמונה נכנסים, טקסט יוצא
• משקולות — סגור, API בלבד לעומת פתוח, ללא הגבלת גישה, יותר ממיליון הורדות
• סעיף ההקשר הארוך — מתמחר מחדש את כל הבקשה מעל 272,000 טוקני קלט בפי 2 לקלט ולמטמון ופי 1.5 לפלט לעומת אין סעיף מקביל בכרטיס המפורסם
• מדד האינטליגנציה, עצמאי, מאמץ מרבי — 51.8 לעומת 43.6
• עלות למשימת מדד, עצמאי — 0.72 דולר לעומת 2.00 דולר
• טוקני פלט בהרצת המדד — 67 מיליון לעומת 160 מיליון, לעומת חציון לוח של 140 מיליון עבור קבוצת ההשוואה שלו
ההערכה האחת ש-K3 מנצח בה, ולמה זה חשוב
לפני האריתמטיקה, היוצא מן הכלל, כי הוא אמיתי. בניקוד, הערכה אחר הערכה, במאמץ מרבי ב-Artificial Analysis v4.3.2, GPT-6.1 Sol מוביל בשבעה מתוך עשרה ואינו מסיים בתיקו כלל, אך המודל שמנצח בהערכת הסקה עם הקשר ארוך הוא K3:
• AA-LCR v1.1 — Kimi K3 0.887 מול GPT-6.1 Sol 0.830. יתרון של שש נקודות במבחן שנבנה במיוחד להסקה על קלטים ארוכים.
• SciCode — Kimi K3 0.595 מול GPT-6.1 Sol 0.542. K3 מוביל גם בקידוד מדעי.
• Terminal-Bench 4.0 — Kimi K3 0.126 מול GPT-6.1 Sol 0.561. פער של 43 נקודות בכיוון ההפוך, וזהו הפער הגדול ביותר בזיווג הזה.
• Humanity's Last Exam — Kimi K3 0.469 מול GPT-6.1 Sol 0.529.
• AA-Omniscience — Kimi K3 19.7 מול GPT-6.1 Sol 41.5; באמינות עובדתית השניים אינם אותה כיתה של מודל.
• GDPval-AA v2.1 — Kimi K3 Elo 1536.5 מול GPT-6.1 Sol Elo 1575.1.
• MMMU-Pro — Kimi K3 0.805 מול GPT-6.1 Sol 0.860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0.583, 0.22 ו-0.234; Sol 0.649, 0.310 ו-0.317.
תוצאת AA-LCR היא זו שראוי להתייחס אליה ברצינות, מפני שהיא המספר היחיד שסותר את סיפור העלות-למשימה, והיא מצביעה על עומס עבודה שבו התשובה שנראית זולה שגויה בשני הכיוונים. אם התעבורה שלך היא קלטים ארוכים מאוד, תשובה מחוללת מתונה, ושימוש חוזר כבד בתחילית יציבה — הצורה שבה למילוליות אין הזדמנות להזיק — השילוב של K3 — ציון הקשר ארוך מהשורה הראשונה, קלט תמונה וצ'קפוינט להורדה — מתאים יותר מזה של Sol, ונתון העלות-למשימה עבור הרצת האינדקס לא חל עליך. זו הגרסה הכנה של "משקלים פתוחים מצדיקים פרמיה": לפעמים המודל הפתוח הוא פשוט המודל הטוב יותר למשימה, וכאן הוא כזה בציר אחד.
כדאי גם לנקוב במה שמשותף לשני הניצחונות הללו. K3 חזק כשאפשר לענות על משימה בפעולת קריאה או הסקה אחת ארוכה, וחלש כשהיא צריכה להתבצע בצעדים קטנים רבים ולהיבדק. פער של 43 נקודות ב-Terminal-Bench ופער הכול-ידיעה של 22 נקודות הם אותו ממצא שנצפה משתי זוויות: ביצוע סוכני מתמשך אינו מה שהצ'קפוינט הזה עבר אופטימיזציה עבורו.
החשבון, שהוא מה שלמעשה מכריע את זה
המחירון של K3 הוא פי 1.5 מזה של Sol בכל סעיף, והעלות הנמדדת שלו לכל משימת אינדקס שהושלמה היא פי 2.8, וההבדל בין 1.5 ל-2.8 מוסבר כולו בנפח הטוקנים. המדידה של הדירקטוריון עצמו היא 160 מיליון טוקני פלט עבור K3 לעומת 67 מיליון עבור Sol באותו מערך של עשרה מבחני הערכה. K3 מפיק פי 2.4 תפוקה במחיר של פי 1.5, ו-2.4 × 1.5 הם 3.6 — הנתון של הדירקטוריון, 2.00 דולר מול 0.72 דולר, ידידותי מעט יותר מהיחס הטהור מפני שתרומות הקלט והמטמון מקזזות אותו מעט, אך אין מחלוקת על הכיוון.
השיווק העצמי של Moonshoot עומד בסתירה לכך באופן שראוי לקרוא בקפידה. החברה טוענת ש-K3 מפיק פחות טוקני פלט מקודמו, והעבודה הארכיטקטונית — סכמת הקשב, עיצוב השארית — מכוונת ישירות לעלות פענוח בהקשר ארוך. שני הדברים האלה יכולים להיות נכונים בעוד המודל עדיין מפיק פי שניים יותר מילים מחציון בנצ'מרק בחבילת הערכה כללית. שתי הטענות עוסקות בדברים שונים: יעילות ביחס ל-Kimi קודם, ויעילות ביחס לתחום. רק השנייה היא מה שמחייבים אותך על פיו, והיא זו שהמועצה העצמאית מודדת.
המטמון מרכך זאת. שני תעריפי הקלט מהמטמון הם עשירית מתעריף הקלט ללא מטמון של המודל שלהם — 0.30 דולר עבור K3, 0.10 דולר עבור Sol — כך ששורת המטמון אינה משנה את הסדר, אך היא כן אומרת שעומס עבודה עתיר-בקשות ודל-תשובות מצמצם את הפער לבערך יחס המחירון ולא ליחס המשימה הנמדד. וסעיף ההקשר הארוך של Sol פועל בכיוון ההפוך: מעל 272,000 טוקנים של קלט הוא מתמחר מחדש את כל הבקשה ב-4.00 ו-15.00 דולר, כשהמטמון ב-0.20 דולר, וזה הטווח היחיד שבו המחירון השטוח של K3 מנצח באופן מוחלט. כדאי לדעת זאת משתי סיבות, כי זה גם הטווח שבו ציון ההקשר הארוך של K3 הוא המספר הטוב ביותר בהשוואה הזו.

מה באמת שווים משקלים פתוחים כאן?
שלושה דברים, וכדאי להפריד ביניהם, כי "משקלים פתוחים" משמש בדרך כלל כטיעון אחד כשהוא למעשה שלושה.
הדבר הראשון הוא שאתה יכול לעזוב. אם Moonshoot נרכשת, משנה את הרישיון לגרסאות עתידיות, מכריזה על K3 כמיושן או מעלה את מחיר ה-API שלה, צ'קפוינט שכבר הורדת ממשיך לפעול. זה לא תרחיש היפותטי עבור המעבדה הזו: Moonshoot השעתה קבלת מנויים חדשים בתוך כ-48 שעות משחרור קודם כדי להגן על איכות השירות עבור לקוחות משלמים קיימים, וזו הדגמה חיה לכך שגישה ל-API היא החלטת מדיניות ולא תכונה. שום דבר מזה לא מופיע בטבלת עלות לכל משימה, וכל זה אמיתי.
השני הוא שאפשר לנעוץ. גרסה קבועה, מכווננת, שפועלת בתוך גבול שבשליטתך, היא דבר שאפשר להראות למבקר וממשק API לא יכול לספק. עבור תעבורה מוסדרת זה שווה יותר ממחירון.
השלישי — זה שבדרך כלל מניחים — הוא שהוא יהיה זול יותר. הוא לא. הצ'קפוינט הוא ארטיפקט FP8 בן 2.8 טריליון פרמטרים, והנחיות הפריסה שפורסמו ממוסגרות סביב תצורות מרובות מאיצים ולא סביב צומת יחיד. צוות שכבר מפעיל סוג כזה של אשכול יש לו כאן אפשרות אמיתית, והחישוב משתנה לחלוטין, משום שהעלות השולית של טוקן הופכת לעלות החשמל. צוות שלא עושה זאת משווה חשבון API מול רכישה הונית, וחשבון ה-API מנצח בפער עצום. הסיכום הישר הוא שמשקלים פתוחים כאן נותנים לך את היכולת לעזוב, לא את היכולת להריץ בזול.
שניהם על מקש אחד, וזה החלק שהופך את הטרייד לשימושי.
Kimi K3 נמצא ב-OrcaRouter במחיר המחירון של Moonshoot עצמה — $3.00 ו-$15.00 למיליון טוקנים עם קריאת מטמון ב-$0.30, ללא שינוי מכרטיס הספק — ו-GPT-6.1 Sol נחת בנתיבים שלנו במחיר של OpenAI ביום ההשקה, $2.00 ו-$10.00 עם קלט במטמון ב-$0.10, ומדרגת 272,000 הטוקנים הועברה הלאה בדיוק כפי שפורטה. דבר לא מתווסף לאף אחד מהשניים. הפלטפורמה מעבירה את מחיר המחירון של הספק הלאה במקום להוסיף עליו תוספת, כך ששינוי בתעריף של Moonshoot ושינוי בתעריף של OpenAI מופיעים אצלנו באותו יום שבו הם מופיעים אצל הספק, בלי חוזה נוסף או מפיץ מחדש באמצע.

הסיבה שחשובה לזוג הזה יותר מאשר לרוב היא ששני המודלים שייכים למצבי כשל שונים. GPT-6.1 Sol הוא המודל שמריצים עבור ביצוע מתמשך, לופים של כלים ואמינות עובדתית; Kimi K3 הוא המודל שמריצים עבור קלטים ארוכים מאוד, שבהם רוצים את ציון ההקשר הארוך הטוב ביותר ורוצים checkpoint כגידור מפני החלטה עסקית של מישהו אחר. אלה אינן בחירות מתחרות, אלא שני נתיבים באותה תעבורה. החזקת שניהם מאחורי נקודת קצה אחת, עם failover אוטומטי ביניהם וכלל שמעביר עבודת קלט ארוך ל-K3 ועבודת ביצוע ל-Sol, היא מה שהופך את "יש לנו גיבוי במשקלים פתוחים" משורה במסמך תכנון למשהו שעובד בשלוש לפנות בוקר בקריאה שנכשלת.

איפה שכל אחד שייך
• סוכני טרמינל, קידוד בקנה מידה של מאגר קוד, ביצוע רב-שלבי — GPT-6.1 Sol, בפער של 43 נקודות ב-Terminal-Bench 4.0. זה לא צמוד.
• תשובות שבהן הזיה עולה ביוקר — GPT-6.1 Sol, בפער של 22 נקודות ב-AA-Omniscience.
• קלטים ארוכים מאוד עם תשובה קצרה שנוצרת — Kimi K3. ציון ההיסק בהקשר ארוך הטוב ביותר בהשוואה הזו, קלט תמונות, ופירוט יתר שלעולם לא זוכה להזדמנות לבוא לידי ביטוי.
• אירוח עצמי או ערימת היסק שאתה חייב להיות מסוגל להקפיא — Kimi K3, ורק אם אתה כבר מפעיל את החומרה. נקודת הבדיקה (checkpoint) היא התוצר המוגמר; הכלכלה של הפעלתה היא עניין נפרד.
• גידור מפני ספק שמשנה את תנאיו — Kimi K3, וזה הטיעון היחיד ש-GPT-6.1 Sol לא יכול לענות עליו בשום מחיר.
• בחירה לפי מחירון — לא K3 ולא Sol הם האפשרות הזולה בהשוואה הזו, ואף אחד מהם אינו האפשרות הזולה בקו GPT-6. אם החשבונית היא הקלט המכריע, המודל שאתה רוצה נמצא בהמשך רשימת המחירים, ולא בצד השני של הטבלה הזו.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
