
A.X-K2-DSpark: نموذج المسودة لفك الترميز التخميني من SK Telecom وصل دون إعلان
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenجديدQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekجديدDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxجديدMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 2100 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
- tencentTencent: Hy32026-07-0642الذكاء59البرمجة
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232الذكاء42البرمجة
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226الذكاء39البرمجة
- anthropicAnthropic: Claude Sonnet 52026-06-3055الذكاء72البرمجة
- klingKling: Kling 3.0 Turbo2026-06-1757الذكاء52البرمجة57الرياضيات
{{1}}من غير المرجح أن تستدعي نموذج A.X-K2-DSpark مباشرة على الإطلاق — وهذا هو بالضبط سبب استحقاقه للقراءة عنه.{{/1}} {{2}}نشرت SK Telecom النموذج بهدوء على Hugging Face، دون منشور إطلاق أو بيان صحفي خلفه؛ تفتتح بطاقة النموذج ببساطة بالقول إن نقطة التحقق "تخضع حاليًا للتحقق النهائي ومن المقرر إطلاقها للعموم خلال الأيام القليلة المقبلة."{{/2}} {{3}}إنها نقطة تحقق مخصصة للكتابة فقط (drafter-only) من أجل فك الترميز التخميني (speculative decoding)،{{/3}} {{4}}مبنية لمهمة واحدة: جعل نموذج A.X K2 الرائد من SK Telecom الذي يضم 688 مليار معامل أسرع وأقل تكلفة في التشغيل، من خلال اقتراح رموز يقوم A.X K2 بعد ذلك بالتحقق منها.{{/4}} {{5}}إليك ما يخبرنا به المستودع فعليًا، وما الذي لا يزال غير مؤكد،{{/6}} ولماذا يُعد نموذج مساعد صغير من هذا القبيل هو المكان الذي تختبئ فيه الجولة القادمة من خفض تكاليف تقديم نماذج اللغات الكبيرة.{{/7}}
ما هو A.X-K2-DSpark في الواقع
A.X-K2-DSpark ليس نموذجًا مستقلًا بأي معنى ذي دلالة. تقول بطاقة النموذج ذلك في ملاحظات الاستخدام المقصود: إنه "نقطة تفتيش للمسودة فقط" مع "لا استخدام مستقل"، ويتم تحميله بواسطة vLLM إلى جانب نموذجه المستهدف، A.X K2، داخل حلقة فك ترميز تخميني. إنه مرحلة المسودة في مولّد من مرحلتين — نموذج صغير يقترح رموزًا مرشحة بسرعة، ثم يتحقق النموذج المستهدف منها قبل إلزام أي رمز بالمخرجات.
الهدف، للسياق، هو أحد أكبر النماذج مفتوحة الأوزان الموجودة. A.X K2 هو نموذج خليط الخبراء من SK Telecom بإجمالي 688B و33B نشط، صدر على Hugging Face في أواخر يوليو 2026 بموجب رخصة Apache 2.0، وهو مبني على بنية أساسية تجمع بين الانتباه الكامن متعدد الرؤوس وانتباه DeepSeek المتفرق، ويضيف تعديل SK Telecom الخاص بالانتباه البوابي المتفرق للسياقات الطويلة. يعتمد A.X-K2-DSpark على الحالات الكامنة لـ A.X K2 ويضيف نمذجة اعتماد محلية خفيفة بين المواضع المرشحة، بحيث يمكنه اقتراح عدة توكنات بالتوازي بدلاً من التوليد الذاتي التراجعي الصارم. ثم يُتحقق من كل مرشح بواسطة A.X K2 قبل اعتماده — ولهذا تسمي البطاقة النتيجة "خالية من الفقدان بالتصميم": توزيع المخرجات لا يتغير بفعل المُصيغ؛ فقط سرعة الخدمة تتغير.

كيف يعمل فك التشفير التخميني، ولماذا يحتاج نموذج MoE بسعة 688B إليه
ظهر فك الترميز التخميني لأن التوليد الانحداري الذاتي تسلسلي ومقيّد بالذاكرة. توليد كل رمز يعني قراءة أوزان النموذج من الذاكرة، وبالنسبة لنموذج بحجم 688B فهذا عدد هائل من البايتات يجب نقلها لكل رمز على حدة — حتى عندما يكون 33B فقط من المعلمات نشطًا في كل تمريرة أمامية. الحيلة تكمن في إنفاق القليل من الحوسبة الإضافية على نموذج مُسوِّد صغير يخمّن الرموز القليلة التالية دفعة واحدة، ثم يقوم النموذج الكبير بالتحقق من جميع التخمينات في تمريرة أمامية واحدة ويحتفظ بأطول بادئة تطابق توزيعه الخاص. عندما يكون المُسوِّد جيدًا، تحصل على رمزين أو ثلاثة رموز لكل تمريرة من النموذج الكبير بدلًا من رمز واحد، دون أي تغيير في المخرجات النهائية.
اللعبة برمتها هي معدل القبول. المخطّط الذي يخمّن بشكل سيئ تُرفض مقترحاته، ولا يزال تمرير التحقق يكلّف نفس عرض النطاق الترددي للذاكرة، لذلك يتلاشى تسريع الأداء. ولهذا أصبحت المخطّطات موضوع بحث جاد بحد ذاتها: بالنسبة لنموذج بحجم A.X K2، فإن الفرق بين تسريع بمعدل 1.5x و تسريع بمعدل 3x هو الفرق بين أسطول خدمة من عشر وحدات GPU وأسطول من خمس وحدات. طبقات الكفاءة مثل هذه هي المصدر الذي ستأتي منه الجولة القادمة من تخفيضات الأسعار في واجهات برمجة تطبيقات نماذج اللغة الكبيرة المستضافة — ليس من أرقام جودة النموذج الأساسي، بل من مجموعة الخوادم الملتفة حولها.
DSpark هي الطريقة — وهي تأتي من فريق DeepSeek
إن "DSpark" في اسم الطراز هي تقنية محددة، وهي ليست اختراعًا من SK Telecom. تستشهد بطاقة الطراز بالورقة البحثية "DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation" (arXiv 2607.05147)، وهي نسخة أولية بتاريخ 6 يوليو 2026 من فريق مؤلف من 33 باحثًا في DeepSeek، الذين طبّقوا هذه الطريقة في نظام الخدمة الخاص بهم من جيل V4 في ظل حركة مرور مباشرة. وقد قامت SK Telecom بتكييف نفس التقنية لتناسب طرازها المستهدف.
مساهمتا الورقة تتطابقان مباشرةً مع ما تصفه بطاقة A.X-K2-DSpark. أولاً، الصياغة شبه الانحدارية الذاتية: شبكة أساسية متوازية تقترح رموزًا عبر نافذة، بينما تقوم وحدة تسلسلية خفيفة بنمذجة التبعيات بين المواضع المرشحة، مما يحل المشكلة الكلاسيكية المتمثلة في أن معدلات القبول لدى الصياغات المتوازية تنخفض بشكل حاد عبر التسلسل المقترح. ثانيًا، التحقق المجدول حسب الثقة: بدلاً من التحقق دائمًا من عدد ثابت من رموز المسودة، يقوم النظام بتقدير احتمال بقاء كل بادئة وتحديد طول التحقق لكل طلب، مضبوطًا على ملف تعريف الإنتاجية للمحرك — وبذلك يكون جهد التحقق مدركًا للحمل بدلاً من أن يكون موحدًا.
وفقًا لأرقام الورقة نفسها — وهي قياسات المؤلفين، ولم تُتحقق بشكل مستقل — حقّق DSpark تسريعًا بنسبة 60–85% في توليد كل مستخدم مقارنةً بخط الأساس الإنتاجي MTP-1 مع إنتاجية متطابقة، ومنع تدهورًا حادًا في الإنتاجية تحت قيود تفاعلية صارمة. هناك تحفّظان مهمّان لقراءة هذا الإصدار: تلك النتائج قِيست على بيئة المؤلفين الخاصة وهدفهم الخاص، وليس على A.X K2؛ وبطاقة نموذج A.X-K2-DSpark تذكر صراحةً أن تقييمها الخاص لا يزال جاريًا. الورقة تُثبت أن الطريقة تعمل في الإنتاج. لكنها لا تُثبت أن نقطة تفتيش SK Telecom تعيد إنتاج تلك المكاسب — وهذا تحديدًا الجزء غير المؤكد.

ما يقوله المستودع — وما لا يقوله
إليك ما يمكن معرفته من المستودع حاليًا، وكل ذلك من بطاقة النموذج:
• الدور — نقطة تحقق خاصة بالمُعدّ فقط لـ A.X K2؛ لا تُستخدم بشكل مستقل؛ لم يتم التحقق منها مع أي هدف آخر و"غير متوافقة مع النماذج غير ذات الصلة."
• Target — A.X K2، 688B إجمالي / 33B نشط خليط من الخبراء.
• طول السياق — 262,144 توكنًا (256K)، بما يطابق الإعداد الأصلي لـ A.X K2.
• الترخيص — Apache 2.0.
• الآلية — صياغة DSpark شبه الانحدار الذاتي؛ يتم التحقق من كل مرشح بواسطة A.X K2 قبل اعتماده (بدون فقدان).
• الحالة — "قيد التحقق النهائي حاليًا"؛ الإصدار مخطط له "خلال الأيام القليلة القادمة".
وإليك ما لم يتم تأكيده صراحةً بعد:
• دقة نقطة التحقق وحجمها — كلاهما مُدرجان كـ TBD على بطاقة النموذج.
• الإنتاجية، وTPOT، ومتوسط الطول المقبول — الأرقام الثلاثة التي ستُخبرك ما إذا كان المُعد يعمل فعلاً، وكلها غير محددة بعد، مع عبارة "التقييم قيد التنفيذ حاليًا".
• نتائج حسب المجال — البطاقة تعد بتفاصيل للكورية والرياضيات والعلوم والبرمجة «لاحقًا» دون تحديد تاريخ.
• إعلان رسمي — لم تعلن SK Telecom عن A.X-K2-DSpark في أي مكان نجده؛ المستودع هو الإعلان.
• تقييمات مستقلة — لا توجد أي منها. كل ما على البطاقة هو ادعاء من SK Telecom، ومعظمه لا يزال مجرد وعد.

الرقم الأكثر أهمية وغير المؤكد هو متوسط الطول المقبول — أي متوسط عدد توكنات المسودة التي يقبلها A.X K2 في كل تمريرة تحقق. هذا الرقم وحده يحدد ما إذا كان هذا المُصمِّم تحسينًا بسيطًا بنسبة 1.2x أم ترقية خدمية بنسبة 2.5x، وهو أيضًا الرقم الأكثر عرضة للتداول دون مصدر موثوق بمجرد إطلاق النسخة. تعامل معه بشكٍّ عندما يظهر: نسبة 60–85% في ورقة DSpark قيست على حزمة خدمة نموذج مختلف، وA.X K2 له خصائصه الخاصة في قبول المسودات.
كيف ستديره فعليًا
تشغيل المُصِيغ يعني تقديم A.X K2 من نسخة SK Telecom من vLLM. مثال بطاقة النموذج، بعد اقتطاع بسيط، هو:
vllm serve skt/A.X-K2 --tensor-parallel-size 8 --tool-call-parser hermes --reasoning-parser deepseek_v3 --speculative-config '{"method": "dspark", "model": "skt/A.X-K2-DSpark", "num_speculative_tokens": N}'
مع التفرع المثبت من مستودع SKT-AI vLLM على فرع axk2-v0.23.0. وهناك بعض التحذيرات التي تذكرها البطاقة بصراحة: الإعداد يستهدف تكوين السياق الأصلي 256K الخاص بـ A.X K2، ويعتمد مقدار التسريع على عبء العمل — فالتزامن، وطول المخرجات، ومعدل القبول، والتكلفة النسبية للصياغة مقابل التحقق، كلها تؤثر على النتيجة. بعبارة أخرى، هذه بنية تحتية للخدمة، وليست سكربت تنزيل وتشغيل. ستحتاج إلى أوزان A.X K2، ومجموعة عناصر كبيرة بما يكفي لتوازي الموتر 8، والصبر لضبط num_speculative_tokens وفقًا لحركة المرور الخاصة بك. هذا مشروع مهم لفريق يخدم A.X K2 بالفعل؛ وليس سببًا لإنشاء واحدة من الصفر.
الاقتصاديات: طبقات الكفاءة تتفوق على ادعاءات الجودة
السبب في أن نموذج مسودة لنموذج 688B يستحق المتابعة هو أن سباق معايير النموذج الأساسي قد تشبّع في الغالب، بينما سباق تكلفة الخدمة لم يشبع بعد. لقد اعتمد إطلاق SK Telecom الخاص بالفعل على الكفاءة — حيث زُعم أن تغيير Sparse Gate Attention يرفع إجمالي إنتاجية الرموز بنسبة 67.7% مقارنة بالجيل السابق عند مدخلات 120 ألف رمز — والنموذج المسودة هو نفس الفكرة المطبقة على فك التشفير. كل رمز مقبول من النموذج المسودة هو تمرير أمامي لنموذج كبير لم تدفع ثمنه.
بالنسبة لأي شخص يستهلك هذه النماذج عبر واجهة برمجة التطبيقات (API) بدلًا من استضافتها، فإن نموذج الصياغة (الدرافتير) غير مرئي — وهذا هو بيت القصيد. عندما يضيف مزوّد الخدمة تقنية فك الترميز التخميني إلى بنية التقديم لديه، فإنك لا ترى نموذجًا جديدًا؛ بل ترى النموذج نفسه يصبح أسرع وأرخص لكل توكن. طبقة التسعير مهمة لنفس السبب: في OrcaRouter نمرّر سعر المزوّد الرسمي كما هو بهامش ربح 0%، لذلك عندما يظهر تحسين كفاءة التقديم لدى البائع كتخفيض في السعر، يصبح فعّالًا على جانبنا في نفس اليوم — دون إعادة تفاوض ودون تغيير في العقد. وبالنسبة لنموذج غير مُثبت قد ينجح أو لا ينجح، فإن التوجيه مع التبديل التلقائي عند الفشل هو السبيل لتجربته دون المخاطرة بمسار إنتاجي عليه: مفتاح API واحد، ويُحوَّل الطلب إلى مزوّد آخر إذا تدنى أداء الأول.
ملاحظة صراحة خاصة بهذا الإصدار: A.X-K2-DSpark هو نقطة تحقق خاصة بالمسودّين فقط، لذا لا يمكن لأي واجهة برمجة تطبيقات لنماذج مستضافة توجيهه — بما في ذلك واجهتنا. المسودّون مكوّن من جانب الخدمة، وليس منتجًا قابلًا للاستدعاء. عندما يُطرح المسودّ وتظهر نتائج التقييم، فإن ما سيظهر في قائمة الأسعار هو A.X K2 أسرع وأرخص — وليس نقطة نهاية جديدة تُسمى "DSpark".
بعض الأسئلة التي تستحق الإجابة
هل يمكنني استخدام A.X-K2-DSpark بمفرده؟ لا — هذه هي الحقيقة الجوهرية لهذا الإصدار. إنها نقطة تفتيش مخصصة للصياغة فقط، دون أي استخدام مستقل أو واجهة برمجة تطبيقات عامة؛ فهي موجودة فقط كأداة مساعدة داخل حلقة فك الترميز التخميني vLLM التي تخدم A.X K2، وتذكر البطاقة أنه لم يتم التحقق من صحتها مع أي هدف آخر.
هل A.X-K2-DSpark منافس لـ A.X K2؟ العكس تمامًا. إنه مسرّع لـ A.X K2 — نفس النموذج يصبح أسرع، مع بقاء توزيع المخرجات دون تغيير. اعتبره جزء كفاءة يُضاف إلى النظام، وليس إضافة جديدة في التشكيلة.
متى سيتم إصداره فعليًا؟ تقول بطاقة النموذج إنه في مرحلة التحقق النهائية ومن المقرر إصداره للعامة "خلال الأيام القليلة القادمة." هذا كل ما تم تأكيده. التاريخ الذي يجب متابعته هو اليوم الذي تُملأ فيه أرقام TBD — الإنتاجية، وTPOT، ومتوسط الطول المقبول — لأنه عندها يتوقف الإصدار عن كونه وعدًا ويصبح شيئًا يمكنك تقييمه.
هل أحتاج إلى التفكير في الأمر إذا كنت أستخدم A.X K2 عبر واجهة برمجة التطبيقات؟على الأرجح لا، ليس بشكل مباشر. حزمة الخدمة خلف واجهة برمجة التطبيقات هي التي تحدد ما إذا كان نموذج المسودة في الحلقة؛ ترى النتيجة كسعر وزمن استجابة، وليس كعلامة. ولهذا أهمية كبرى للفرق التي تستضيف A.X K2 ذاتيًا، حيث يكون تفعيل الميزة تغييرًا في إعداد vLLM يتحكمون فيه.
القصة هنا ليست في المُصيغ نفسه، بل فيما يُشير إليه المُصيغ. أعمال الكفاءة تتحول بهدوء إلى فئة إصدارات قائمة بذاتها، والنماذج الجديدة الأكثر إثارة للاهتمام هذا العام هي بشكل متزايد أدوات مساعدة تجعل النماذج الكبيرة رخيصة، وليس نماذج أكبر. A.X-K2-DSpark هو أوضح مثال حتى الآن: نقطة تحقق لا استخدام مستقل لها، نُشرت قبل الإعلان، وتحمل معظم أدلتها الخاصة كـ TBD. راقب رقم الطول المقبول عندما يظهر، وتعامل مع مكاسب ورقة DSpark كدليل على المنهجية وليس كوعد لهذه النقطة، وإذا كنت تقدم A.X K2 بنفسك، خصص ميزانية للاختبار المعياري — فهذه هي الطريقة الوحيدة لمعرفة ما إذا كان المُصيغ المنشور بهدوء بمثابة تحسين بسيط بنسبة 1.2x أم أنه الشيء الحقيقي.
