Kimi Linear ينتشر-1.png
Engineering & Research

Kimi Linear ينتشر: كل نموذج يمكننا التحقق منه يعمل فعليًا على KDA

الكاتب

Jim Song

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

"واو! Kimi-Linear يكتسب انتشارًا! هذا مثل ثالث نموذج خارجي أراه." كان هذا هو المنشور بأكمله — سطر واحد من @teortaxesTex في 5 أغسطس 2026، مع لقطة شاشة مرفقة وبدون ذكر أي نموذج. الرابط المختصر فيه يحل إلى الصورة، وليس إلى مستودع، لذا لا يوجد ما يمكن النقر عليه ولا ما يمكن تأكيده. الادعاء قابل للتحقق على أي حال، وهو أكثر أهمية مما يوحي به السطر الواحد: إذا كانت المختبرات الأخرى غير Moonshot AI تبني الآن على تصميم الانتباه الذي يقف وراء Kimi-Linear-48B-A3B-Instruct و Kimi K3، فإن Kimi Delta Attention لم تعد مجرد حيلة داخلية لمختبر واحد، بل أصبحت مكونًا يتبناه آخرون. لذا بحثنا عن النماذج بدلاً من لقطة الشاشة. الجواب المختصر: أقوى حالة هي Ling-3.0-flash، التي تصف بطاقتها التعريفية تكديسًا بنسبة 5:1 من طبقات KDA وMLA؛ والحالة الأكثر فائدة هي نقطة بحثية من مختبر أمريكي تحدد تكلفة KDA النقية؛ وعلى نطاق النماذج الحدودية، خارج Moonshot، لم يطلقها أحد.

ما هو الادعاء، وما ليس كذلك

ممارس واحد، لقطة شاشة واحدة، لا اسم لنموذج، ولا تأكيد مستقل. هذا هو الأساس الإثباتي الكامل لعبارة «تحقيق التبني»، وينبغي أن يُقرأ كحافز للتحقق وليس كخبر. لم نتمكن من إعادة إنتاج لقطة الشاشة، لذا لا شيء أدناه هو تأكيد لها — كل ما يلي هو ما أظهرته البيانات الوصفية العامة للنماذج في 5 أغسطس 2026 عند فحصنا لها، بالإضافة إلى ما يقوله كل مختبر في بطاقة النموذج الخاصة به. وحيثما يأتي رقم من قياس البائع نفسه، يُشار إليه على هذا النحو، لأنه في هذه القصة تحديدًا تقريبًا كل رقم رئيسي يأتي من هذا القبيل.

شاشة واحدة على Kimi Linear، لأن "التبني" يعني تبنّي هذا

Kimi Linear هي بنية انتباه، نشرها فريق Kimi Team تحت المعرف arXiv 2510.26692 بتاريخ 30 أكتوبر 2025، وهي ليست منتجًا. جوهرها هو Kimi Delta Attention (KDA)، الذي يعتمد على Gated DeltaNet ويستبدل بوابة النسيان الخشنة باضمحلال دقيق لكل قناة، بحيث تتعلم الحالة المتكررة ما يجب الاحتفاظ به قناةً قناةً بدلاً من الاحتفاظ الجماعي. أُعيدت هيكلة التحديث إلى صيغة مجزأة من نوع Diagonal-Plus-Low-Rank تحديدًا كي تستقر على نوى الموترات بدلاً من تركها خاملة. هذا التأطير المتعلق بالعتاد هو صميم التصميم: لطالما كان الانتباه الخطي رخيصًا من الناحية النظرية، وغالبًا ما يكون مخيبًا للآمال من الناحية العملية.

الفحوصات المُصدَرة — Kimi-Linear-48B-A3B-Base وKimi-Linear-48B-A3B-Instruct — تمتلك 48B معلمة إجمالية مع 3B نشطة، ونافذة سياق تبلغ 1M رمزًا، وترخيص MIT. تتناوب الطبقات بنسبة تقريبية 3:1، أي عشرون طبقة KDA مقابل سبع طبقات Multi-Head Latent Attention، بحيث تكون ثلاث من كل أربع طبقات من النوع المتكرر منخفض التكلفة، بينما تحافظ كل طبقة رابعة على الانتباه العالمي الدقيق.

ما تبلغ عنه Moonshot، وكلها مُقاسة مقارنةً بخط أساس MLA كامل مدرَّب على وصفة متطابقة — أرقام من البائع، لم يُتحقق منها بشكل مستقل:

• إنتاجية فك الترميز — أسرع حتى 6 أضعاف في الوقت لكل رمز مخرَج عند سياق 1M مقارنةً بـ MLA الكامل

• ذاكرة التخزين المؤقت KV — أصغر بنسبة تصل إلى 75%، وهذا هو مصدر الإنتاجية

• السياق الطويل — RULER عند 128k: 84.3 لـ Kimi Linear مع تسريع قدره 3.98x، مقابل 81.3 لخط الأساس MLA

• سياق قصير — MMLU-Pro عند 4k: 51.0 مقابل 47.2 لخط الأساس MLA و47.9 للنسخة الهجينة Gated DeltaNet، وبسرعة تقارب سرعة الانتباه الكامل، لذا فالتصميم لا يشتري سرعة السياق الطويل على حساب جودة السياق القصير.

• استئصال ما قبل التدريب — الهجين بنسبة 3:1 يحقق حيرة تحقق تبلغ 5.65 بينما يصل الاهتمام الكامل إلى 5.77

الحد الصادق لكل ذلك: الأدلة القائمة على خط الأساس المطابق تتوقف عند 48B. لم يقم أحد ببناء نسخة مزدوجة 2.8T بالانتباه الكامل من Kimi K3 للمقارنة معها، وحتى تدقيق حقائق أواخر يوليو 2026 لادعاءات بنية K3، لم تُنشر أي اختبارات استرجاع طويلة السياق مستقلة وخالية من الحلول المختصرة لأي من النموذجين. قصة الكفاءة مدعومة جيدًا. قصة "يتفوق على الانتباه الكامل" مدعومة على نطاق بحثي من قبل المختبر الذي كتب الورقة.

Kimi Linear Is Spreading-2.png

بدا الزخم حتى الآن في شكل تنزيلات وليس في شكل بنى معمارية يبنيها آخرون: 98,164 تنزيلًا في الشهر الماضي، و570 إعجابًا، وموفّر استدلال واحد مدرج على Hugging Face، وشجرة نماذج تضم محولين و8 عمليات ضبط دقيق و24 تكميمًا. إنه شائع بوضوح. أما كونه منسوخًا فسؤال مختلف.

أقوى حالة اعتماد: Ling-3.0-flash

Ling-3.0-flash هو النموذج الذي يحقق هذا الادعاء. تصف بطاقة Hugging Face الخاصة به بنية انتباه خطية هجينة أصلية مبنية من مكدس متناوب بنسبة 5:1 من Kimi Delta Attention وMLA — 35 طبقة KDA مقابل 7 طبقات MLA مبوّبة — على نموذج Mixture-of-Experts بمعاملات 124B مع 5.1B معامل نشط لكل رمز، وسياق 256K تم تدريبه بتدرج من 8K إلى 32K إلى 256K، وترخيص MIT. هذا ليس لعبة بحثية من هاوٍ؛ إنه نموذج مطروح من مختبر راسخ، ويذكر وحدة انتباه Moonshot في وصف بنيته الخاصة.

وهو أيضًا أكثر عدوانية في ذلك من Moonshot. {{1}}يحتفظ Moonshot بطبقة انتباه دقيقة واحدة من كل أربع طبقات؛ بينما يحتفظ Ling-3.0-flash بواحدة من كل ست طبقات.{{/1}} إذا كان التصميم عبئًا، فأنت تتحوط له؛ ولا تنفق طبقات عالمية أقل من الذين اخترعوه. وبالمقارنة مع الجيل السابق، فإن ذلك يمثل تحولًا: {{2}}مسوح البنى المعمارية في فبراير 2026 التي فهرست هذه الفئة من النماذج أظهرت أن النموذج الرائد السابق من Ling كان يعتمد على Lightning Attention مقترنًا بـ MLA بنسبة 7:1.{{/2}} لقد تغيرت الآلية بين الأجيال، وكان اتجاه هذا التغيير نحو KDA.

ثمة تحفظان لن نواريهما. هذا ما ورد في البطاقة التعريفية: لقد اطّلعنا على وصف البنية الخاص بالمستودع وعلى إعداداته، التي تعلن عن نوع نموذج مخصص باسم bailing_hybrid مع تطبيق BailingMoeV3 — ولم نقم بمراجعة النوى (kernels) للتأكد من أن الرياضيات هي KDA وليست مستوحاة من KDA. والمستودع لا يحمل أي وسم KDA على الإطلاق؛ وما يظهر في البحث عن الوسوم هو تحويل GGUF من طرف ثالث قام شخص آخر بتسميته. وهذا تحذير مفيد بخصوص المنهجية، ويقودنا مباشرة إلى القسمين التاليين.

أجرت Arcee AI التجربة التي لم يجرِها Moonshot.

الاستخدام الخارجي الأكثر دلالةً لـ KDA ليس منتجًا على الإطلاق. بعد حوالي ستة أسابيع من ورقة Kimi Linear، في منتصف ديسمبر 2025، نشرت Arcee AI نقطتَي تحقق بحثيتين بترخيص Apache-2.0 — وهما AFM-4.5B-Base-KDA-Only و AFM-4.5B-Base-KDA-NoPE — ضمن تنفيذها الخاص ArceeKDAForCausalLM، موسومتين صراحةً بـ kimi-delta-attention. كان سؤالهم هو السؤال الذي يتجنبه تصميم Moonshot الهجين بعناية: هل يمكن استبدال الانتباه الكامل كليًا؟ لذا قاموا بتحويل جميع طبقات الانتباه البالغ عددها 24 إلى KDA، دون ترك أي طبقات انتباه عالمية، وقاموا بتقطير النتيجة من AFM-4.5B-Base الأصلية كمعلم بطول تسلسل 32k.

النتائج المبلغ عنها، المعلم مقابل الطالب النقي-KDA:

• MMLU — من 63.1 إلى 55.8، انخفاض حقيقي لكن يمكن تحمّله.

GSM8K — من 52.1 إلى 26.8، انخفض تقريبًا إلى النصف

• HellaSwag — من 78.0 إلى 74.3، شبه سليم

Kimi Linear Is Spreading-3.png

شكل ذلك الضرر هو الجزء المثير للاهتمام. المعرفة الواسعة والاستمرار بالفطرة السليمة ينجوان في الغالب عند مرورهما عبر حالة متكررة ثابتة الحجم. أما الحساب متعدد الخطوات، الذي يتطلب استرجاعًا دقيقًا للنتائج الوسيطة التي كتبها النموذج قبل عدة خطوات، فلا ينجو. كما تشير Arcee إلى أن تدهور الأداء مع السياقات الطويلة يكون تدريجيًا، دون انحدار حاد. وبأخذ كل ذلك معًا، فإنه أوضح دليل علني على سبب كون كل نشر جاد لـ KDA هجينًا: طبقات Moonshot بنسبة واحد من أربعة، وطبقات Ant بنسبة واحد من ستة، ليست جبنًا، بل هي الجزء الذي يحافظ على الحساب.

ما هو ليس: حكم على KDA على نطاق واسع. هذا تقطير بحجم 4.5B، وليس عملية تدريب مسبق، والتقطير إلى بنية معدلة يفقد أشياءً لن يفقدها التدريب من الصفر. اقرأه على أنه عملية إزالة لم يكن لدى البائع أي حافز لنشرها — من مختبر مستقل لم يكن له أي مصلحة في النتيجة.

الذيل الطويل: مجموعة من مستودعات KDA الصغيرة في أسبوع واحد

تحت الحالتين الجديّتين توجد مجموعة من الحالات الصغيرة، والتواريخ هي ما يجعلها جديرة بالذكر. NEXIVON-1B-BASE، الذي رُفع في 31 يوليو 2026، يصرّح بأن نوع نموذجه هو حرفيًا kda — Apache-2.0، مع 285 تحميلًا، ولا إعجابات. qingyi-kda-0.6b، في الأسبوع نفسه، هو ضبط دقيق لـ Qwen3-0.6B-Base يقدّم تنفيذًا مخصصًا لـ qingyi_kda. Scrapegoat-Tiny-Coder، أيضًا في ذلك الأسبوع، يجمع بين وسم kda وتصميم "انتباه متوازي ثنائي المسار" خاص به. نموذجان آخران، maccy-106m-base وmaccy-96m-16k-base، تم وسمهما بـ kimi-delta-attention في 27 و28 يوليو.

لا شيء من هذه الأمور مهم بمفرده — إعجابات بأرقام فردية، مؤلفون غير معروفين، أعداد معاملات بمقياس البحث. مجتمعة، ربما تكون هي ما يعدّه إحصاء «النموذج الخارجي الثالث الذي أراه»، ولا يمكننا تأكيد أيّ ثلاثة منها، لأن المنشور لم يسمِّ أيًّا منها. الإشارة فيها ليست النماذج، بل الأيام العشرة: أربع عمليات تدريب صغيرة مستقلة وصلت إلى KDA في أقل من أسبوع ونصف، وهو ما يحدث عندما تتوقف النواة عن كونها قطعة أثرية بحثية وتصبح شيئًا يمكنك إدراجه في سكربت تدريب خلال عطلة نهاية الأسبوع.

ما لم يعثر عليه المسح

لقد استعلمنا من Hugging Face عن كل مستودع يحمل نوع النموذج kimi_linear. كان العدد 47. جميعها باستثناء ثلاثة تحمل اسم "Kimi"، وما ليس من صنع Moonshot نفسه هو مشتقات وليست معتمدة: تكميمات AWQ وGPTQ وFP8 وNVFP4 وSINQ وGGUF وMLX بكل عمق بت؛ ونسخ REAP المشذبة الخبيرة 35B من Cerebras؛ وبنيات FlagRelease FlagOS لنقطة تفتيش Instruct الخاصة بمسرعات NVIDIA وMetaX وHygon. هذه المجموعة الأخيرة مثيرة للاهتمام حقًا لسبب مختلف — فقد بذل شخص ما الجهد لتشغيل KDA على شرائح صينية محلية — لكن لا شيء من ذلك يخص مختبرًا آخر يصمم نموذجًا آخر.

لا يوجد نموذج بمقياس النماذج الحدودية خارج Moonshot يعلن KDA. Ling-3.0-flash بإجمالي 124B و5.1B نشط هو سقف التبني الخارجي حالياً.

والطريقة فيها ثغرة تستحق التسمية، لأنها تتعارض مع نتيجتنا السلبية. أي مختبر يعيد تطبيق KDA يسجّل نوع نموذجه الخاص — arcee_kda، qingyi_kda، bailing_hybrid — لذا فإن عمليات مسح الوسوم تقلّل بشكل منهجي من عدد المتبنيين الذين نبحث عنهم تحديدًا، ويمكن لنموذج أن يستخدم الآلية دون أن يكتب "KDA" في بطاقته أبدًا. الغياب عن وسم هو دليل ضعيف، وليس إثباتًا. إذا كان هناك متبنٍّ رابع أو خامس صامت، فبهذه الطريقة تحديدًا سيظل غير مرئي.

اختار كل الآخرين انتباهًا خطيًا مختلفًا.

السبب في أن {{1}}«Kimi Linear يكتسب اعتمادًا»{{/1}} يُعد خبرًا من الأساس هو أنه لم يكن كذلك في معظم عام 2026. اجتاح الانتباه الخطي الهجين مجال النماذج مفتوحة الأوزان — لكن ليس هذه النسخة منه. وفقًا لاستقصاءات البنى المنشورة في فبراير 2026: يقرن كل من Qwen3-Next 80B-A3B وQwen3.5-397B-A17B شبكة Gated DeltaNet بالانتباه المبوَّب بنسبة 3:1، أي أن Qwen3.5-397B-A17B يشغّل 45 طبقة متكررة مقابل 15 طبقة انتباه كامل من أصل 60. واستخدم الطراز الرائد السابق من Ling تقنية Lightning Attention مع MLA بنسبة 7:1. أما Nemotron 3 Nano 30B-A3B وSuper 120B-A12B فهما هجينان من Mamba-2، مع 6 طبقات انتباه فقط ضمن بنية من 52 طبقة، و8 طبقات ضمن بنية من 88 طبقة، على التوالي. وبقي GLM-5 مع MLA وأضاف انتباهًا متناثرًا فوقه. أما MiniMax-M2.5 فسلك الاتجاه المعاكس تمامًا وأبقى على انتباه متعدد الرؤوس العادي، ويُذكر أن السبب كان الموثوقية. وأما Kimi K2.5، النموذج الرائد الخاص بـ Moonshot قبل K3، فكان يعتمد MLA — إذ نشر المختبر KDA في أكتوبر 2025 ولم يضمّنه في نموذجه الحدودي حتى يوليو 2026.

إذًا فازت الفئة ولم يفز البديل. الجميع يتفق على أن ثلاثة أرباع طبقاتك يمكن أن تكون متكررة؛ لكن لا أحد يتفق على أي تكرار. الاختلاف المميز لـ KDA هو بوابة التلاشي لكل قناة، وثمنها هو أنك تحتاج إلى نوى مخصصة وبنية التخزين المؤقت للبادئة بدلاً من مسار Gated DeltaNet الذي كان نصف النظام البيئي يمتلكه بالفعل. حتى هذا الشهر، دفع مختبر واحد هذا الثمن.

التبني الذي حدث بالفعل هو في مكدسات الخدمة.

البنى المعمارية لا تنتشر لأنها أنيقة؛ بل تنتشر عندما تجعلها البنية التحتية رخيصة. وهذا الجزء قد اكتمل بالفعل بالنسبة لـ KDA، وقد حدث ذلك أسرع من اعتماد بطاقة النموذج. فقد أطلق كل من vLLM وSGLang دعمًا فوريًا من اليوم الأول عندما نُشرت أوزان Kimi K3 في 27 يوليو 2026، وقامت Moonshot برفع تنفيذها الخاص بتخزين البادئات المؤقتة (KDA prefix-caching) إلى vLLM نفسه بدلاً من الحفاظ على نسخة فرعية (fork). وأطلق SGLang نوى (kernels) مدمجة لـ KDA وGated DeltaNet، وأبلغ عن ارتفاع السعة المنطقية لـ KV من 1.5 مليون إلى 12.2 مليون رمز (token) على نفس العتاد — وهذا قياسه الخاص، وهو الرقم الأكثر واقعية لكفاءة طرف ثالث في هذه القصة بأكملها. وتعيش النوى المرجعية في fla-core، والتي يمكن لأي تشغيل تدريب صغير استيرادها.

هذا هو الفرق بين حاجة Arcee إلى جهد بحثي متعمد في ديسمبر 2025 وبين أربعة مستودعات مجهولة تعلن بشكل عابر عن KDA في أسبوع واحد من يوليو 2026. أصبحت الآلية اعتمادًا تقوم بتثبيته. سواء اتبعت الطليعة هو سؤال منفصل، لكن حجة الاحتكاك ضد KDA قد تبخرت إلى حد كبير.

ما الذي يتغير إذا كنت تشتري الرموز فقط

لا شيء يتعلق بكودك. أنت لا تستدعي KDA إطلاقًا؛ بل تختبره من خلال ما تكلفه معالجة سياق مليون توكن والمدة التي يستغرقها أول توكن. Kimi K3 هو النموذج الذي يظهر ذلك تجاريًا اليوم — فعلى OrcaRouter تبلغ تكلفة تشغيله 3.00 دولارات لكل مليون توكن إدخال و15.00 دولارًا لكل مليون توكن إخراج، مع سياق كامل يبلغ مليون توكن، وقياس زمن الوصول إلى أول توكن عند الوسيط (p50) يبلغ 8.88 ثانية على مدى الأيام السبعة الماضية. هذه الاقتصاديات هي، بشكل جوهري، ما يُتيحه الهجين KDA بنسبة 3:1: تقديم سياق مليون توكن بسعر مكلف فحسب، وليس باهظًا.

Kimi Linear Is Spreading-4.png

نقطة التفتيش البحثية مسألة مختلفة. Kimi-Linear-48B-A3B-Instruct مرخّص بموجب MIT مع مزوّد استدلال واحد مدرج في صفحته على Hugging Face، وهو غير موجود على OrcaRouter — إذا أردت تشغيله، فهذا يعني الاستضافة الذاتية أو استخدام هذا المزوّد. حسابات الاستضافة الذاتية أكثر ملاءمة مما يوحي به عدد المعاملات: أوزان 48B بصيغة bf16 تبلغ حوالي 96 غيغابايت، أي بطاقتان بسعة 80 غيغابايت، بينما تبلغ تحويلات MLX وGGUF بدقة 4-بت حوالي 25-30 غيغابايت وتناسب بطاقة واحدة أو جهاز Mac بمواصفات جيدة. Ling-3.0-flash كذلك غير موجود على OrcaRouter اليوم. لن ندّعي خلاف ذلك للإدلاء برأي حول التوجيه.

أما حيث يكون التوجيه مهمًا هنا فهو تكلفة الخطأ في رهان معماري. نماذج الانتباه الخطي الهجينة هي بالضبط الفئة التي يمكن أن يختلف فيها جدول معايير المورد مع عبء عملك — فالحالة المتكررة ثابتة الحجم تفشل في أنماط الاسترجاع التي لا تكشفها أي درجة مجمعة، وهذا هو الدرس المستفاد من رقم GSM8K المُنَصَّف. تشغيل المقارنة من خلال مفتاح API واحد عبر أكثر من 200 نموذج يعني أن الاختبار هو تغيير سلسلة النموذج بدلاً من دورة شراء، بسعر قائمة المزود مع هامش ربح 0% من جانبنا، ومع تجاوز تلقائي للفشل بحيث لا يكون النموذج طويل السياق الذي ما زلت تقيّمه نقطة فشل واحدة في مسار الإنتاج. جرّبه على حركة المرور طويلة السياق الخاصة بك ليوم واحد. هذه إجابة أرخص من أي جدول معايير، بما في ذلك جدولنا.

أسئلة تستحق أن تُطرح فعلًا

هل Kimi Linear هو نفسه Kimi K3؟

لا، والخلط بينهما هو الخطأ الأكثر شيوعًا في التغطية الإعلامية لكليهما. كيمي لينير (Kimi Linear) هو ورقة بحثية في البنية المعمارية بالإضافة إلى نموذج بحثي بإجمالي 48 مليار معامل و3 مليارات معامل نشطة، مع سياق يبلغ مليون رمز، صدر بموجب رخصة MIT في أواخر 2025 لإثبات أن الهجين المعتمد على KDA يتفوق على MLA الكامل عند التدريب المتطابق. كيمي كيه 3 (Kimi K3) هو النموذج الرائد لشركة Moonshot بمعاملات تبلغ 2.8 تريليون من يوليو 2026 — 104 مليار معامل نشطة، متعدد الوسائط بشكل أصلي، بسياق مليون رمز — والذي نقل فكرة KDA بنسبة 3:1 إلى النطاق الحدودي وأضاف Attention Residuals، وهي خدعة منفصلة تشير تقارير المختبر إلى أنها تحقق كفاءة تدريب تبلغ حوالي 25% بتكلفة إضافية أقل من 2%. آلية مشتركة، لكن نطاقًا وقدرة وسعرًا مختلفين تمامًا. المعايير من أحدهما تخبرك بالقليل جدًا عن الآخر.

لماذا تختار مختبر KDA بدلاً من Gated DeltaNet، بالنظر إلى أن معظمهم اختار Gated DeltaNet؟

KDA هو تنقيح صارم لـ Gated DeltaNet، لذا فإن السؤال هو ما إذا كان هذا التنقيح يستحق تكلفة التحول. التنقيح هو البوابة: يعمل Gated DeltaNet على تخميد ذاكرته المتكررة بقيمة قياسية واحدة لكل خطوة، بينما يتعلم KDA تخميدًا لكل قناة ميزة، وهذا يسمح للحالة بالاحتفاظ باسم متغير عبر عشرة آلاف رمز، وفي الوقت نفسه يمسح الجملة التي ظهر فيها. وضعت تجربة Moonshot الاستئصالية ذلك عند حوالي 0.12 من ارتباك التحقق عند 48B، وقد صِيغت صياغتها المجزأة DPLR لإبقاء أنوية الموتر مشغولة، لذا فإن القدرة التعبيرية الإضافية لا تكلّف الإنتاجية التي تحققها. في المقابل، كان Gated DeltaNet يتمتع بدعم واسع للنواة والأطر قبل أن يصبح أي منهما رائجًا، وهو ما يستحق وقتًا هندسيًا حقيقيًا. كان جواب عام 2026 في الغالب "لا يستحق الأمر". Ling-3.0-flash هو أول رهان على نطاق الإنتاج في الاتجاه المعاكس.

هل ينبغي لأيٍّ من ذلك أن يغيّر ما سأنشره هذا الربع؟

{{1}}فقط إذا كنت تستخدم سياقات طويلة جدًا.{{/1}} {{2}}إذا كانت مطالباتك أقل من حوالي 32 ألف توكن، فإن الانتباه الخطي الهجين هو تفصيل تنفيذي لا يؤثر على اختيارك للنموذج؛ اختر بناءً على الجودة والسعر وزمن الاستجابة كالمعتاد.{{/2}} {{3}}إذا كنت تدفع إلى 128 ألفًا وما بعدها، فمن الجدير معرفة أن النماذج التي تُبقي تكاليفك معقولة عند هذا الطول هي بشكل متزايد نماذج هجينة KDA، وأن نتائجها المنشورة للسياقات الطويلة هي معايير إجمالية وليست اختبارات استرجاع عدائية.{{/3}} {{4}}اختبر الاسترجاع عند طول سياقك الفعلي بدلًا من الوثوق بدرجة RULER.{{/4}} {{5}}ستكون هذه النصيحة متطابقة إذا كانت الآلية هي Gated DeltaNet أو Mamba-2.{{/5}}

أين يترك هذا الادعاء

صحيحٌ من حيث الاتجاه، وأصغر مما يبدو. ما يمكن التحقق منه في 5 أغسطس 2026 هو: نموذج إنتاجي واحد من مختبر راسخ، وورقتان بحثيتان من مختبر أمريكي مستقل نشر الجانب السلبي بشفافية، وحفنة من مستودعات sub-1B من الأيام العشرة الماضية، ونظامٌ بيئيٌّ للخدمة استوعب النواة بالفعل. هذا أكثر من "خدعة مختبر واحد" وأقل بكثير من كونه معيارًا. الرقم الذي يستحق المتابعة ليس ثلاثة نماذج خارجية — بل ما إذا كان الإصدار الحدودي التالي مفتوح الأوزان من مختبر ليس Moonshot سيأتي مع بواباتٍ لكل قناة، وما إذا كان أي شخص خارج Moonshot سينشر يومًا اختبار استرجاع يختبر ما تنساه الحالة ذات الحجم الثابت فعلًا. كلاهما سيخبرك أكثر من أي لقطة شاشة إضافية.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube