
GPT-6.1 Sol مقابل Kimi K3: التنزيل موجود، وما زال ليس الخيار الرخيص
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
Kimi K3 is the counter-example that usually settles this kind of argument. Moonshoot AI shipped the 2.8-trillion-parameter model in July 2026 and published the weights — moonshotai/Kimi-K3 is on Hugging Face, ungated, with more than a million downloads and a last revision in September. So there is no "open in principle, withheld for safety hardening" asterisk here, no two-week delay to wait out. GPT-6.1 Sol, which OpenAI released on 29 September 2026, is closed and API-only and always will be. And on the independent board the downloadable model scores 43.6 to the closed model's 51.8 while costing $2.00 per completed index task against $0.72. Open weights are supposed to be the cheap escape hatch; in this pairing they are the expensive side of the trade, and the reason is not the license.
ما هو كل نموذج
Kimi K3 is a sparse mixture-of-experts model with 2,800 billion total parameters and roughly 104 billion — about 3.7% — active per token. It carries a 1,048,576-token context window, takes text and images as input, and returns text. The published checkpoint is an FP8 artifact and it is a genuinely large download; a production deployment on your own hardware is a cluster decision rather than a workstation one. Moonshoot's architectural claim is a hybrid linear-attention scheme it says is substantially faster at long-context decoding, plus the residual and routing work that made a 2.8-trillion-parameter model servable at all.
GPT-6.1 Sol is OpenAI's mid-tier refresh — below GPT-6 Astra, above GPT-6 Luna — with a 1,050,000-token window, a 128,000-token output ceiling, text, image and file input, and an April 30, 2026 knowledge cutoff. Reasoning runs low through max with medium as the default; the none rung that the previous GPT-6 Sol accepted is rejected outright, and OpenAI's own migration note points developers at low instead. It is priced at $2.00 and $10.00 per million tokens with cached input at $0.10.
سطر واحد لكل بُعد، وكلا الجانبين على كلٍّ منها:
• إدخال — GPT-6.1 Sol $2.00 لكل مليون مقابل Kimi K3 $3.00 لكل مليون
• إخراج — GPT-6.1 Sol $10.00 لكل مليون مقابل Kimi K3 $15.00 لكل مليون
• إدخال مخبأ — GPT-6.1 Sol $0.10 لكل مليون مقابل Kimi K3 $0.30 لكل مليون
• نافذة السياق — 1,050,000 رمز مقابل 1,048,576 رمز؛ فرق 0.1%، غير جوهري
• الحد الأقصى للإخراج — 128,000 رمز في كليهما
• إجمالي المعاملات والمعاملات النشطة — غير معلن مقابل 2,800 مليار إجمالاً، و104 مليار نشطة لكل رمز
• الوسائط — نص وصورة وملف كإدخال، ونص كإخراج مقابل نص وصورة كإدخال، ونص كإخراج
• الأوزان — مغلقة، API فقط مقابل مفتوحة، بلا قيود، وأكثر من مليون تنزيل
• بند السياق الطويل — يعيد تسعير الطلب بأكمله فوق 272,000 رمز إدخال بمقدار 2× للإدخال والتخزين المؤقت و1.5× للإخراج مقابل عدم وجود بند مكافئ على البطاقة المنشورة
• مؤشر الذكاء، مستقل، أقصى جهد — 51.8 مقابل 43.6
• التكلفة لكل مهمة في المؤشر، مستقلة — $0.72 مقابل $2.00
• رموز الإخراج في تشغيل المؤشر — 67 مليون مقابل 160 مليون، مقابل وسيط لوحة قدره 140 مليون لفئة المقارنة الخاصة به
التقييم الوحيد الذي يفوز به K3، ولماذا يهم ذلك
قبل الحساب، الاستثناء، لأنه حقيقي. عند التقييم تقييمًا تلو الآخر بأقصى جهد على Artificial Analysis v4.3.2، يتقدّم GPT-6.1 Sol في سبعة من عشرة ولا يحقق أي تعادل، لكن النموذج الذي يفوز بتقييم الاستدلال طويل السياق هو K3:
• AA-LCR v1.1 — Kimi K3 0.887 مقابل GPT-6.1 Sol 0.830. تقدّم بست نقاط في التقييم المصمَّم خصيصًا للاستدلال على المدخلات الطويلة.
• SciCode — Kimi K3 0.595 مقابل GPT-6.1 Sol 0.542. ويتقدّم K3 أيضًا في البرمجة العلمية.
• Terminal-Bench 4.0 — Kimi K3 0.126 مقابل GPT-6.1 Sol 0.561. فجوة قدرها 43 نقطة في الاتجاه المعاكس، وهي أكبر فارق على الإطلاق في هذه المقارنة.
• Humanity's Last Exam — Kimi K3 0.469 مقابل GPT-6.1 Sol 0.529.
• AA-Omniscience — Kimi K3 19.7 مقابل GPT-6.1 Sol 41.5؛ وفيما يتعلق بالموثوقية الواقعية، فإن النموذجين ليسا من الفئة نفسها.
• GDPval-AA v2.1 — Kimi K3 بتصنيف Elo 1536.5 مقابل GPT-6.1 Sol بتصنيف Elo 1575.1.
• MMMU-Pro — Kimi K3 0.805 مقابل GPT-6.1 Sol 0.860.
• AutomationBench-AA، GDP.pdf، CritPt — K3 0.583 و0.22 و0.234؛ وSol 0.649 و0.310 و0.317.
نتيجة AA-LCR هي التي تستحق أن تؤخذ على محمل الجد، لأنها الرقم الوحيد الذي يناقض رواية التكلفة لكل مهمة، وتشير إلى عبء عمل تكون فيه الإجابة التي تبدو رخيصة خاطئة في كلا الاتجاهين. إذا كانت حركة الطلبات لديك عبارة عن مدخلات طويلة جدًا، وإجابة مولّدة متواضعة، وإعادة استخدام كثيفة لبادئة ثابتة — وهو الشكل الذي لا يجد فيه الإسهاب سبيلًا إلى إحداث الضرر — فإن مزيج K3 من درجة سياق طويل من الطراز الأول، وإدخال الصور، ونقطة تحقق قابلة للتنزيل، أنسب من Sol، ورقم التكلفة لكل مهمة الخاص بتشغيل index لا ينطبق عليك. هذه هي النسخة الصادقة من عبارة «الأوزان المفتوحة تستحق علاوة»: أحيانًا يكون النموذج المفتوح ببساطة هو النموذج الأفضل لهذه المهمة، وهنا هو كذلك على محور واحد.
يستحق أيضًا أن نسمّي القاسم المشترك بين هذين الانتصارين. K3 قوي حيث يمكن الإجابة عن مهمة في فعل واحد طويل من القراءة أو الاستدلال، وضعيف حيث يجب تنفيذها عبر خطوات صغيرة عديدة والتحقق منها. فجوة الـ43 نقطة في Terminal-Bench وفجوة المعرفة الكلية البالغة 22 نقطة هما النتيجة نفسها منظورةً من زاويتين: فالتنفيذ الوكيلي المتواصل ليس ما حُسّنت نقطة التفتيش هذه من أجله.
الحساب، وهو ما يحسم الأمر فعليًا
قائمة أسعار K3 تبلغ 1.5× قائمة Sol في كل بند، وتكلفتها المقيسة لكل مهمة فهرسة مكتملة تبلغ 2.8×، والفرق بين 1.5 و2.8 يُفسَّر بالكامل بحجم الرموز. قياس المجلس نفسه هو 160 مليون رمز إخراج لـ K3 مقابل 67 مليونًا لـ Sol على نفس مجموعة التقييمات العشر. ينتج K3 إخراجًا مقداره 2.4 ضعف بمقدار 1.5 ضعف من السعر، و2.4 × 1.5 يساوي 3.6 — رقم المجلس البالغ 2.00 دولار مقابل 0.72 دولار أرحم قليلاً من النسبة الصافية لأن مساهمات الإدخال والتخزين المؤقت تعوّضه قليلاً، لكن الاتجاه غير متنازع عليه.
Moonshoot's own marketing runs against this in a way that is worth reading carefully. The company claims K3 emits fewer output tokens than its predecessor, and the architectural work — the attention scheme, the residual design — is aimed squarely at long-context decoding cost. Both of those can be true while the model is still twice as verbose as a benchmark median on a general suite. The two claims are about different things: efficiency relative to a previous Kimi, and efficiency relative to the field. Only the second one is what you are being billed against, and it is the one the independent board measures.
يخفف التخزين المؤقت من ذلك. كلا سعري الإدخال المخزَّن مؤقتًا يساوي عُشر سعر الإدخال غير المخزَّن في نموذجه — 0.30 دولار لـ K3، و0.10 دولار لـ Sol — لذا لا يغيّر سطر التخزين المؤقت الترتيب، لكنه يعني أن عبء عمل كثيف الطلبات خفيف الإجابات يضيّق الفجوة إلى ما يقارب نسبة بطاقة الأسعار بدلًا من نسبة المهمة المقيسة. ويعمل بند السياق الطويل لدى Sol في الاتجاه المعاكس: إذا تجاوز عدد رموز الإدخال 272,000، فإنه يعيد تسعير الطلب بأكمله عند 4.00 دولارات و15.00 دولارًا مع التخزين المؤقت عند 0.20 دولار، وهو النطاق الوحيد الذي تفوز فيه البطاقة المسطحة لـ K3 فوزًا قاطعًا. وهذا جدير بالمعرفة لسببين، لأنه أيضًا النطاق الذي تكون فيه درجة السياق الطويل لدى K3 أفضل رقم في هذه المقارنة.

ما قيمة الأوزان المفتوحة فعليًا هنا؟
ثلاثة أشياء، ويجدر الفصل بينها لأن "الأوزان المفتوحة" تُستخدم عادةً كحجة واحدة بينما هي ثلاثة.
The first is that you can leave. If Moonshoot is acquired, changes the license for future versions, deprecates K3 or raises its API price, a checkpoint you have already downloaded keeps running. That is not a hypothetical for this lab: Moonshoot suspended new subscriptions within about 48 hours of an earlier release to protect service quality for existing paying customers, which is a live demonstration that API access is a policy decision rather than a property. None of this shows up in a cost-per-task table and all of it is real.
الثاني هو أن بإمكانك التثبيت. فالإصدار الثابت، المُحسَّن بدقة، الذي يعمل داخل حدود تتحكم بها، شيء يمكن أن يُعرض على مدقق، ولا تستطيع واجهة برمجة التطبيقات تقديمه. وبالنسبة للحركة الخاضعة للتنظيم، فإن هذا يساوي أكثر من بطاقة أسعار.
الثالث — وهو ما يُفترض عادةً — هو أنه سيكون أرخص. لكنه ليس كذلك. نقطة التحقق هي كيان FP8 ذو 2.8 تريليون معامل، وإرشادات النشر المنشورة مصممة حول تكوينات متعددة المسرعات بدلاً من عقدة واحدة. الفريق الذي يشغل بالفعل تلك الفئة من العناقيد لديه خيار حقيقي هنا، وتتغير الحسابات تمامًا، لأن التكلفة الحدية للرمز تصبح الكهرباء. الفريق الذي ليس كذلك يقارن فاتورة API بعملية شراء رأسمالية، وتفوز فاتورة API بفارق كبير. الخلاصة الناجحة هي أن الأوزان المفتوحة هنا تمنح القدرة على المغادرة، وليس القدرة على التشغيل بتكلفة زهيدة.
كلاهما على مفتاح واحد، وهو الجزء الذي يجعل هذه المقايضة مفيدة.
Kimi K3 is on OrcaRouter at Moonshoot's own list price — $3.00 and $15.00 per million tokens with a $0.30 cache read, unchanged from the vendor's card — and GPT-6.1 Sol landed on our routes at OpenAI's price on release day, $2.00 and $10.00 with cached input at $0.10 and the 272,000-token step passed through exactly as listed. Nothing is added to either. The platform passes provider list price through rather than marking it up, so a Moonshoot rate change and an OpenAI rate change both appear on our side the same day they appear on the vendor's, without a second contract or a reseller in between.

السبب الذي يجعل هذا الزوج مهمًّا أكثر من معظم الأزواج هو أن النموذجين ينتميان إلى نمطي فشل مختلفين. GPT-6.1 Sol هو النموذج الذي تشغّله للتنفيذ المستدام، وحلقات الأدوات، والموثوقية الواقعية؛ أما Kimi K3 فهو النموذج الذي تشغّله للمدخلات الطويلة جدًا حيث تريد أفضل نتيجة للسياق الطويل وتريد نقطة تحقق كتحوّط ضد قرار تجاري يخص شخصًا آخر. هذه ليست خيارات متنافسة، بل مساران على الحركة نفسها. الاحتفاظ بكليهما خلف نقطة نهاية واحدة، مع تجاوز فشل تلقائي بينهما وقاعدة تنقل عمل المدخلات الطويلة إلى K3 وعمل التنفيذ إلى Sol، هو ما يحوّل "لدينا بديل مفتوح الأوزان" من سطر في وثيقة تصميم إلى شيء يعمل في الثالثة فجرًا في مكالمة تفشل.

حيث ينتمي كل واحد
• وكلاء الطرفية، البرمجة على نطاق المستودعات، التنفيذ متعدد الخطوات — GPT-6.1 Sol، بفارق 43 نقطة في Terminal-Bench 4.0. الفارق ليس ضئيلاً.
• إجابات تكون فيها الهلوسة مكلفة — GPT-6.1 Sol، بفارق 22 نقطة في AA-Omniscience.
• مدخلات طويلة جداً مع إجابة مُولَّدة قصيرة — Kimi K3. أفضل نتيجة في الاستدلال طويل السياق في هذه المقارنة، وإدخال الصور، وإسهاب لا تسنح له الفرصة للظهور.
• الاستضافة الذاتية أو حزمة استدلال يجب أن تكون قادراً على تجميدها — Kimi K3، وفقط إذا كنت تشغّل العتاد بالفعل. نقطة الحفظ هي المُخرَج؛ أما اقتصاديات تشغيلها فأمر منفصل.
• تحوّط ضد تغيير مورّد لشروطه — Kimi K3، وهذه هي الحجة الوحيدة التي لا يستطيع GPT-6.1 Sol الرد عليها بأي ثمن.
• الاختيار بناءً على قائمة الأسعار — لا K3 ولا Sol هو الخيار الرخيص في هذه المقارنة، ولا أيٌّ منهما هو الخيار الرخيص في سلسلة GPT-6. إذا كانت الفاتورة هي المُدخَل الحاسم، فإن النموذج الذي تريده يقع في أسفل قائمة الأسعار، لا في هذا الجدول.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
