נוצר כרטיס כותרת ראשי שכותרתו 'GPT-6 Luna vs Kimi K3', עם כותרת משנה 'פי ארבעה בתפוקה, במחיר של 1/30', כותרת תחתונה עם הכיתוב 'מחירים לפי OpenAI ו-Moonshot AI; נתוני מדד לפי Artificial Analysis.', והלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

GPT-6 Luna מול Kimi K3: פי ארבעה בתפוקה, מחיר נמוך פי שלושים, חריג אמיתי אחד

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני מודלים, שניהם הושקו בשלושת החודשים האחרונים, שניהם ממוצבים כשכבה הזולה של משפחת דגמים חזיתית, ושניהם טועים לגבי משמעות המונח "שכבה זולה" באותו אופן — מה שאינו נכון כלל. Kimi K3 הוא דגל המשקלים הפתוחים של Moonshot AI, זמין לציבור תחת רישיון MIT מתוקן מאז 27 ביולי 2026, במחיר של 3.00 דולר למיליון טוקנים בקלט ו-15.00 דולר למיליון בפלט, עם קריאות מטמון ב-0.30 דולר. GPT-6 Luna הוא שכבת הנפח של הספק, זמין באופן כללי מאז 22 בספטמבר 2026 במחיר 0.10 ו-0.50 דולר, עם קריאות מטמון בסנט. פי שלושים בקלט, פי שלושים בפלט, ורישיון בצד אחד שהצד האחר אינו יכול להציע בשום מחיר.

כרטיס התעריפים אינו מה שקובע את השילוב הזה, עם זאת, משום שהוא אינו צמוד מספיק כדי להצריך הכרעה. מה שקובע זאת הוא מספר שאף ספק לא מכניס לכותרת: מהירות פלט נמדדת. Kimi K3 מייצר 38.7 טוקנים לשנייה. GPT-6 Luna מייצר 153.9. זהו פער של פי ארבעה, ועבור כל עומס עבודה שבו המודל הוא רכיב בתוך לולאה ולא נקודת קצה שאדם מדבר איתה, הבדל תפוקה של פי ארבעה משנה את הארכיטקטורה ולא את החשבון.

מה שני אלה באמת

Kimi K3 הוא מודל תערובת-מומחים (mixture-of-experts) בעל 2.8 טריליון פרמטרים, עם 104 מיליארד פרמטרים פעילים לכל טוקן, חלון הקשר של 1,048,576 טוקנים, תקרת פלט של 1,048,576 טוקנים, ומשקלים שפורסמו ב-Hugging Face תחת רישיון MIT מותאם. זהו המודל בעל המשקלים הפתוחים עם הניקוד הגבוה ביותר בלוח העצמאי — הראשון מבין 112 מודלים בעלי משקלים פתוחים — והוא מחזיק במיקום הראשון בלוח המובילים WebDev של Code Arena עם 1,679 Elo. Moonshot מדווחת על 88.3% ב-Terminal-Bench 2.0, שזה נתון ספק ולא שוחזר באופן עצמאי.

GPT-6 Luna הוא הדרג הקטן של הדור GPT-6 של OpenAI, מתחת ל-GPT-6 Sol במחיר $2.00/$10.00 והרבה מתחת לדגם הדגל GPT-6 Astra במחיר $10.00/$50.00. קלט טקסט ותמונה, פלט טקסט, חלון של 1,050,000 טוקנים עם קלט מקסימלי של 922,000 ותקרת פלט של 128,000 טוקנים, ומאמץ חשיבה שניתן לבחור מ-none דרך low, medium, high, xhigh ו-max, כאשר medium הוא ברירת המחדל. הוא סגור, בעל מזהה יחיד, וזמין לכל מי שיש לו מפתח API.

אחד הוא הורדה. אחד הוא נקודת קצה. שניהם מתומחרים לפי נפח. זו צורת ההשוואה.

הכרטיסים, שורה אחר שורה

שורה אחת לכל מימד, שני הצדדים בכל אחד:

• קלט לכל 1M — GPT-6 Luna $0.10 לעומת Kimi K3 $3.00

• פלט לכל 1M — GPT-6 Luna $0.50 לעומת Kimi K3 $15.00

• קלט במטמון לכל 1M — GPT-6 Luna $0.01 לעומת Kimi K3 $0.30, עשירית מתעריף הקלט של עצמו בשני הכרטיסים

• סעיף הקשר ארוך — GPT-6 Luna מכפילה קלט ומטמון ומעלה פלט פי 1.5 מעל 272,000 אסימוני קלט, חל על כל הבקשה, לעומת Kimi K3 שעבורה לא פורסם סעיף מקביל בכרטיס שלה.

• חלון הקשר — GPT-6 Luna 1,050,000 טוקנים עם 922,000 קלט מקסימלי לעומת Kimi K3 1,048,576 טוקנים

• תפוקה מקסימלית — GPT-6 Luna 128,000 טוקנים לעומת Kimi K3 1,048,576 טוקנים, פי שמונה מהתקרה

• מדד האינטליגנציה, בלתי־תלוי — GPT-6 Luna 37 במאמץ מקסימלי לעומת Kimi K3 44 במאמץ מקסימלי, אותה גרסת מדד

• ציון במאמץ ברירת מחדל — GPT-6 Luna 29 ברמת הביניים המוגדרת כברירת מחדל שלו לעומת Kimi K3 שנמדד בהגדרה המרבית שלו

• עלות לכל משימת Index, עצמאית — GPT-6 Luna כ-$0.07 לעומת Kimi K3 $2.00

• אסימוני פלט בהרצת האינדקס — GPT-6 Luna 150M לעומת Kimi K3 160M, מול חציון לוח של 88M; שניהם הרבה יותר מילוליים מהמודל החציוני של הלוח

• מהירות פלט, עצמאית — GPT-6 Luna 153.9 טוקנים/שנייה לעומת Kimi K3 38.7 טוקנים/שנייה

• משקלים — GPT-6 Luna סגור, API בלבד לעומת Kimi K3 ציבורי ב-Hugging Face מאז 27 ביולי 2026

• רישיון — GPT-6 Luna לא חל לעומת Kimi K3 Modified MIT, שאינו אותו מסמך משפטי כמו MIT

• סך הפרמטרים — GPT-6 Luna לא נחשף לעומת Kimi K3 2,800 מיליארד, מתוכם 104 מיליארד פעילים לכל טוקן

• ראיות בולטות — קריאה לכלים ולולאות סוכניות של GPT-6 Luna בעשירית סנט לאלף טוקני קלט במטמון, לעומת Kimi K3 Code Arena WebDev #1 בדירוג 1,679 Elo, ‏Terminal-Bench 2.0 88.3% לפי דיווח הספק, הציון המוביל למודל עם משקולות פתוחות בלוח העצמאי

• ב-OrcaRouter — GPT-6 Luna לא בקטלוג שלנו לעומת Kimi K3 שניתן לנתב במחיר המחירון של Moonshot

Generated two-column scoreboard titled 'GPT-6 Luna vs Kimi K3 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index at max effort 37, Output speed 153.9 tok/s, Context 1,050,000, Weights closed. Right column Kimi K3 rows: Price in/out $3.00 / $15.00, Cached input $0.30, AA Index at max effort 44, Output speed 38.7 tok/s, Context 1,048,576, Weights Modified MIT. Footer: 'Prices per OpenAI and Moonshot AI; index and speed per Artificial Analysis.'

תפוקה היא המפרט שאיש לא עושה ממנו כותרות

מודל של 38.7 טוקנים לשנייה ומודל של 153.9 טוקנים לשנייה אינם אותו מוצר עם תגי מחיר שונים. הם מוצרים שונים.

קח משימה שבה המודל צריך להפיק תשובה של 1,500 טוקנים — סיכום, חילוץ מובנה, תיקון קוד עם ההסבר שלו. בקצב של 153.9 טוקנים לשנייה, התשובה הזו אורכת כעשר שניות. ב-38.7 היא אורכת כשלושים ותשע. אף אחד מהנתונים אינו כולל זמן חשיבה או השהיית רשת, ולכן הפער בעולם האמיתי רחב יותר מפי ארבעה באופן יחסי, ולא צר יותר.

עכשיו שים את זה בלולאה. סוכן שמבצע שלושים קריאות מודל כדי להשלים משימה אחת — לתכנן, לבחור כלי, לקרוא את התוצאה, להחליט על הצעד הבא, לחזור על כך — מייצר אולי 15,000 אסימוני פלט לאורך הקריאות האלה. GPT-6 Luna מבלה בערך 97 שניות בייצור. Kimi K3 מבלה בערך 388 שניות. זה ההבדל בין משימה שמשתמש ממתין לה לבין משימה שמשתמש מתזמן, ושום כמות של מתירנות ברישיון לא משנה זאת.

ריבוי המילים מחריף את בעיית המהירות במקום לאזן אותה. Kimi K3 ייצר 160 מיליון אסימוני פלט בהשלמת האינדקס העצמאי, לעומת 150 מיליון של GPT-6 Luna — כך שבאותה הערכה המודל האיטי יותר גם ייצר מעט יותר אסימונים, לא פחות. שני המודלים עתירי מילים במידה דומה; הם פשוט אינם מהירים במידה דומה, ובכרטיס מתומחר לפי פלט, ריבוי מילים יקר כפליים.

ראוי לומר בפשטות שזה אינו פגם ב-Kimi K3. מודל של 2.8 טריליון פרמטרים עם 104 מיליארד פעילים עושה יותר עבודה לכל טוקן ממודל בדרג קטן, ונתון התפוקה הוא מדידה של העבודה הזו. השאלה הרלוונטית היא אם עומס העבודה שלך זקוק לעבודה הזו. אם כן, 38.7 טוקנים לשנייה הוא המחיר של היכולת. אם לא, אתה משלם על שיקול דעת שלא ביקשת, פי שלושים.

היכן ממוקמות שבע הנקודות של K3

Kimi K3 משיג 44 במדד Intelligence Index העצמאי במאמץ מקסימלי. GPT-6 Luna משיג 37 באותה הגדרה. שבע נקודות, בציון משולב שבו נקודה אחת נמצאת בתוך הרעש של הרצה חוזרת — והשתיים מופרדות בפער של בערך פי עשרים ושמונה בעלות לכל משימה שהושלמה, $2.00 לעומת כ־$0.07.

שבע הנקודות האלה אינן מפוזרות באופן אחיד. המוניטין של Kimi K3 מרוכז בקידוד ובעבודה תוכנתית מבוססת סוכנים, וזו הסיבה שהמודל קיים: לוח המובילים WebDev של Code Arena מציב אותו ראשון עם 1,679 Elo, והנתון של הספק ב-Terminal-Bench 2.0, 88.3%, הוא מדד של סוכן קידוד. מיקומו של GPT-6 Luna עצמו בקידוד הוא צעד אחורה ולא קדימה — מדד Coding Agent Index שלו עומד על 41, שתי נקודות מתחת ל-GPT-5.6 Luna שאותו החליף, כאשר הירידות מרוכזות ב-SWE-Atlas-QnA וב-DeepSWE v1.1. אם העבודה שלך היא סוכן שכותב תוכנה מול מאגר קוד אמיתי, זהו פער של שבע נקודות במדד ורגרסיה דורית של שתי נקודות שמצביעים לאותו כיוון, והטיעון בעד השכבה הזולה נחלש באופן ניכר.

המקום שבו שבע הנקודות אינן נמצאות הוא סוג העבודה ש-GPT-6 Luna מתומחרת עבורו. סיווג, חילוץ, ניתוב, סיכום בכמות גדולה, הלולאה הפנימית של סוכן שזקוק לתשובת כן-או-לא מהירה — במשימות האלה שני המודלים יפיקו את אותו פלט שמיש ברוב המוחלט של הפעמים, וההבדל לא ישרוד מפגש עם מערך ההערכה שלך. המדד מודד מורכב שמעניק משקל רב לחשיבה ארוכת טווח ולתכנות, ואף אחד מאלה אינו מה שנדרש להחלטת ניתוב.

אזהרה אחת שכדאי להצמיד לנתוני המדד בשני הצדדים: הלוח הזה הוא הערכה מתגלגלת והעדכון שלו משנה. תמונות מצב מוקדמות של אותו לוח דירוג הציבו את Kimi K3 גבוה באופן ממשי מ-44 שהלכידה שלנו מציגה היום, מפני שהמדד המשולב, ההרנס וסט המודלים — כולם זזים. כל השוואה שנשענת על הפער המדויק בין שני מודלים במדד מתגלגל נשענת על משהו שלא יעמוד במקום. הקריאה הכנה היא ששני אלה נמצאים ברצועות יכולת סמוכות בשיא שלהן, ושהמדד לא יכול לומר לך איזה מהם טוב יותר למשימה שלך.

החריג: מה Modified MIT באמת נותן לך

הרישיון של Kimi K3 הוא הממד היחיד שבו ל-GPT-6 Luna אין תשובה באף מחיר, והוא ראוי לדיוק רב יותר ממה שהביטוי "משקולות פתוחות" זוכה לו בדרך כלל.

המשקולות פומביות ב-Hugging Face והרישיון הוא Modified MIT, לא MIT. ההבחנה הזו חשובה: רישיון Modified MIT מצרף בדרך כלל תנאים — לרוב דרישה להציג ייחוס כאשר המודל משמש במוצר מעל קנה מידה מסוים — וכל מי שמתכנן לבנות מוצר מסחרי על המשקולות צריך לקרוא את המסמך עצמו ולא את שם המשפחה שאליו הוא דומה. זו אינה סיבה להימנע ממנו. זו סיבה שלא לתאר אותו כ-MIT במסמך רכש.

מה שההורדה מקנה הוא אמיתי ומוגבל. היא מקנה רצפת עלות, במובן זה שתפוסת GPU קבועה יכולה לנצח חשבון מחויב לפי שימוש בהיקף מספיק. היא מקנה עצמאות ממפת הדרכים של ספק — מודל שאתה מארח לא יכול להיות מוכרז כמיושן מתחת לרגליך. היא מקנה את היכולת לבצע כיוונון עדין על ההתפלגות שלך. והיא מקנה את האפשרות לשמור פרומפטים בתוך הגבול שלך, מה שלגבי צוותים מסוימים מסיים את ההשוואה לפני שמזכירים מחיר.

העלות היא בחומרה. מודל תערובת־מומחים עם 2.8 טריליון פרמטרים ו־104 מיליארד פרמטרים פעילים אינו מודל שרץ על תחנת עבודה. הגשתו בתפוקת ייצור היא התחייבות בקנה מידה של אשכול, עם עלות הון, עלות תפעולית ופרופיל השהיה שאתם מחזיקים בו ולא שוכרים. זו אינה טענה נגד אירוח עצמי של Kimi K3 — זוהי טענה שההשוואה הנכונה אינה $15.00 למיליון טוקני פלט מול $0.00, אלא $15.00 למיליון טוקני פלט מול עלות מלאה לטוקן הכוללת את הסיליקון ואת האנשים. עבור מספר קטן של ארגונים המספר הזה נמוך יותר. עבור רוב הארגונים הוא אינו נמוך, ונקודת החיתוך רחוקה יותר מכפי שהרישיון גורם לזה להרגיש.

הרצת אחד מהם, או את שניהם

Kimi K3 נמצא ב-OrcaRouter במחיר המחירון של Moonshot, במסגרת תמחור pass-through, כלומר ששינוי בתעריף הספק נכנס לתוקף אצלנו באותו היום. מעבר אוטומטי בין שרתים (failover) הוא החלק שמצדיק את מקומו במיוחד עבור המודל הזה: הידרדרות של נקודת קצה של Kimi K3 באחסון עצמי או של צד שלישי היא בדיוק התרחיש שבו רוצים שהמסלול יעבור בלי פריסה, ולמודל שמגיע ל-38.7 טוקנים בשנייה יש פחות מרווח לספוג upstream איטי מאשר למודל מהיר.

GPT-6 Luna אינו בקטלוג שלנו נכון לכתיבת שורות אלה, ואליו מגיעים דרך ה-API של OpenAI, כך שצוות שרוצה את שניהם מפעיל מפתח אחד עבור Kimi K3 לצד מה שהוא כבר משתמש בו עבור OpenAI. זהו גם הזיווג שבו ה-DSL של הניתוב עושה משהו שפיצול מקודד-קשיח לא יכול: כלל ששולח עבודת קידוד ועבודת טווח ארוך אל Kimi K3 ואת כל מה שנצרך על-ידי תוכניות וקצר אל GPT-6 Luna מבטא גבול שזז בכל פעם שאחד מהספקים מוציא גרסה, והוא זז כקונפיגורציה ולא כנתיב קוד. מיזוג מודלים הוא התצורה האחרת שראויה לאזכור כאן — פאנל של מודל אחד איטי וזהיר ומודל אחד מהיר וזול שעונים יחד, כשהחבר הזול עושה את הנפח והחבר היקר מכריע במקרים שחשובים, הוא צורה שצמד המודלים הזה מתאים לה באופן יוצא דופן, מפני שאסימטריית העלויות ביניהם גדולה מספיק כדי שהוצאה של קריאת Kimi K3 על חלק קטן מהתעבורה תהיה משתלמת.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

איזה מהם, ומתי

קח את GPT-6 Luna אם עומס העבודה שלך הוא בנפח גבוה, נצרך על ידי תוכניות ורגיש להשהיה. סיווג, חילוץ, ניתוב, סיכום גורפ, הלולאה הפנימית של סוכן. ב-$0.10/$0.50 עם קריאה מהמטמון בסנט אחד ופי ארבעה מתפוקת Kimi K3, החשבון לא מתקרב וההבדל בהשהיה אינו שולי. הגדר את פרמטר המאמץ במפורש, כי ברירת המחדל היא בינונית והמספר המוצהר 37 הוא מספר של מאמץ מקסימלי, ושמור קריאות ארוכות בצד הנכון של קו 272,000 האסימונים.

קחו את Kimi K3 אם אתם צריכים את המשקלים, אם העבודה שלכם היא קידוד סוכני מול מאגר אמיתי שבו מיקום ה-WebDev שלו ונתוני 88.3% שדווחו על ידי הספק ב-Terminal-Bench 2.0 הם הראיות שקובעות, אם אתם צריכים תקרת פלט מעל 128,000 טוקנים, או אם הארגון שלכם אינו יכול לשלוח פרומפטים לנקודת קצה סגורה. קבלו 38.7 טוקנים לשנייה כחלק מהעסקה, וקראו את תנאי ה-Modified MIT במקום להניח אותם.

הטעות שאליה מזמינה ההשוואה הזו היא לראות בשיעור של פי שלושים את התשובה לשאלה על יכולת. היא התשובה לשאלה על טוקנים. את שאלת היכולת מכריע האם אתה זקוק למשקלים או למהירות, ושתי התשובות הללו מצביעות לכיוונים מנוגדים.

Screenshot of the OrcaRouter model page for Kimi K3 showing the breadcrumb Home > Models > MoonshotAI > Kimi K3, a FEATURED badge, the model id kimi/kimi-k3, Vision, Tools, JSON and Reasoning chips, a MoonshotAI attribution dated 2026-07-15, the description of a 2.8-trillion-parameter mixture-of-experts model with a 1M-token context window, input pricing of $3.00 and output of $15.00 per 1M tokens, a p50 time to first token of 8.11s, a p95 of 10.00s, and traffic of 1163.7M tokens over seven days.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית