بطاقة العنوان الرئيسية: 'Muse Glimmer — 230 Tokens/s على RTX 5090 واحدة — دعم SGLang من اليوم الأول'، مع شرائح إحصائية تعرض: أوزان مفتوحة كثيفة 30B، Apache 2.0، ودعم SGLang من اليوم الأول.
Guides & Insights

Muse Glimmer تحقق 230 توكنًا في الثانية على بطاقة RTX 5090 واحدة: دعم SGLang من اليوم الأول هو قصة الإطلاق الحقيقية

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

مائتان وثلاثون رمزًا في الثانية رقم سريع لأي نموذج. بالنسبة إلى Muse Glimmer — إصدار Meta المكثّف مفتوح الأوزان بحجم 30B من Meta Superintelligence Labs، الذي صدر في 10 أغسطس 2026 بموجب Apache 2.0 — هو الرقم الذي يفصل بين نموذج "يعمل على وحدات معالجة الرسومات لديّ" ونموذج "يخدم وكيلًا حقيقيًا". أعلنت SGLang عن دعمها من اليوم الأول لـ Muse Glimmer في اليوم نفسه الذي نُشرت فيه الأوزان، وقياسها المنشور على بطاقة GeForce RTX 5090 واحدة هو 236.4 رمزًا في الثانية لكل مستخدم عند batch 1، مع تفعيل كل من التكميم NVFP4 ونموذج DFlash للترميز التخميني من Meta.

ذلك الرقم الواحد يروي معظم قصة هذا الإصدار، لكن يجدر التمهل في باقي التفاصيل، لأن الجزء المثير للاهتمام ليس السرعة التي تصدّرت العناوين. الجزء المثير للاهتمام هو أن النموذج يعمل أيضًا فورًا على RTX PRO 6000، وعلى NVIDIA DGX Spark، وعلى معالجات Apple عبر MLX — وأن SGLang تصف هذا العمل بأنه تعاون مع Meta Superintelligence Labs وليس مجرد فكرة لاحقة من المجتمع. إنه أول نموذج من Meta قريب من مستوى الطليعة منذ فترة طويلة يُصمَّم حول بيئة الخدمة، وليس حول الأوزان فقط.

ما الذي يعنيه "day-0 support" فعليًا هنا

الدعم من اليوم الأول في SGLang v0.5.17 يعني أن النموذج لم يُضَف كملحق لاحقًا: فقد وصل عمل وقت التشغيل في نفس نافذة إصدار الأوزان، مع مسار مخصص للأجهزة التي تستهدفها Meta فعليًا. تغطي الخلفية SM120 في SGLang خط أجهزة سطح المكتب ومحطات العمل من Blackwell — حيث تعمل RTX 5090 وRTX PRO 6000 وDGX Spark جميعها على نفس المسار الأمثل — بينما تحصل شرائح Apple على خلفية MLX أصلية بدلاً من منفذ بطيء.

المكدس الذي ضبطته SGLang وMeta له محدد. يعمل النموذج كنقطة تفتيش NVFP4 بحجم 18 جيجابايت مقترنة بنموذج مسودة DFlash بتقنية BF16 بحجم 5 جيجابايت، وهو النموذج المصاحب لفك الترميز التخميني الذي دربته Meta من أجل Muse Glimmer. هذا المزيج يتسع داخل بطاقة سعتها 32 جيجابايت مع متسع من المساحة، ويبلغ الحجم الكلي لمسار التكميم المختلط NVFP4-plus-MXFP8 حوالي 19.5 جيجابايت في الذاكرة المقيمة. من جانب SGLang، تشير ملاحظات الإصدار إلى ثلاث آليات موثوقية كجزء من القصة نفسها: فك الترميز التخميني DFlash، وRadixAttention لتخزين البادئات مؤقتًا، ورسوم CUDA البيانية القابلة للمقاطعة.

الرقم، وما هو وما ليس هو

الأرقام المنشورة من SGLang بخصوص RTX 5090، والتي تستخدم جميعها NVFP4 ومسار SM120، تنقسم على النحو التالي:

• فك ترميز مستخدم واحد (الدفعة 1) — 63.9 رمز/ثانية بالوضع القياسي، و236.4 رمز/ثانية مع فك الترميز التخميني DFlash. هذا التحسين البالغ 3.7x هو الرقم التفاعلي، وهو الذي يحدد ما إذا كان الوكيل المحلي يبدو كمحادثة أم كطابور.

• الإخراج الإجمالي (دفعة 8) — 501 رمزًا/ثانية قياسيًا، و1,452 رمزًا/ثانية مع DFlash. هذا هو رقم الإنتاجية لخادم محلي يخدم عدة طلبات في وقت واحد.

• للمقارنة، نموذج GGUF بصيغة q4_k_m على نفس وحدة معالجة الرسوميات — وهو المسار الذي سيستخدمه معظم الناس مع بيئات تشغيل llama.cpp — يصل إلى 72.6 رمزًا/ثانية في الوضع القياسي و140.7 رمزًا/ثانية مع DFlash. مسار NVFP4 متقدم بشكل ملحوظ.

هذه أرقام منشورة من SGLang وMeta في يوم الإطلاق، وليست نتائج إعادة إنتاج مستقلة — فالوصف الصادق هو أنها مُبلّغة من البائع والإطار البرمجي، وسيأتي التحقق المجتمعي خلال الأسابيع القادمة. لكن النمط عبر المنصتين اللتين أعلنتا عن أرقام متسق. في llama.cpp، أبلغت Meta عن 74.9 إلى 233.4 رمزًا/ثانية على RTX 5090 مع DFlash، أي زيادة بمقدار 3.1x؛ وM5 Max يرتفع من 26.6 إلى 50.2؛ وM4 Max من 23.7 إلى 37.8. وقتا تشغيل مختلفان، وأسلوبا قياس مختلفان، ونفس النطاق التقريبي: نموذج 30B يفك ترميزًا بمعدل يزيد عن 200 رمز في الثانية على وحدة معالجة رسومات استهلاكية واحدة، وDFlash يضاعف الإنتاجية تقريبًا ثلاث مرات على كل إعداد Nvidia نشر أرقامًا.

لماذا يهم "serves" أكثر من "runs"

مدونة ميتا للأجهزة تقدم ادعاءً أقوى من {{1}}أرقام الحواسيب المكتبية{{/1}}. على NVIDIA Blackwell Ultra — {{2}}جيل مراكز البيانات، وليس بطاقة الحواسيب المكتبية{{/2}} — تستشهد المدونة بـ{{3}}أكثر من 20,000 رمزًا في الثانية لكل GPU عند BF16/NVF4{{/3}}، {{4}}مع الإشارة إلى أن SGLang وvLLM كلاهما من حزم المصدر المفتوح المدعومة{{/4}}. هذا مستوى مختلف تمامًا، وهو المؤشر على ما تبنيه ميتا فعلًا: {{5}}الأوزان نفسها صُممت لتعمل في أي مكان بدءًا من حاسوب محمول وصولًا إلى رف خوادم GPU{{/5}}، و{{6}}عوملت أُطر تقديم النماذج كعنصر أساسي من الدرجة الأولى منذ اليوم الأول بدلًا من كونها نسخًا مُنقلة تُكتب لاحقًا{{/6}}.

نصف القصة المتعلق بالموثوقية لا يقل أهمية عن السرعة. فالعامل المحلي الذي يتعطل في منتصف المهمة بسبب تذبذب طبقة الخدمة ليس أفضل بشكل جوهري من عامل سحابي تعرّض لتقييد المعدل. الآليات في البنية الأساسية من اليوم الأول — فك الترميز التخميني القابل للمقاطعة، والتخزين المؤقت للبادئات الذي يُبقي سياقات العامل الطويلة رخيصة العودة إليها، والمصمّم المضبوط على النموذج الأساسي — هي تحديدًا الأجزاء التي تجعل العوامل المحلية الدائمة قادرة على البقاء. هذا هو "السرعة والموثوقية" الذي كان الإطلاق يشير إليه، وهو موقف هندسي حقيقي، وليس عبارة تسويقية.

A single-model speed board for Muse Glimmer: batch-1 decode 63.9 to 236.4 tok/s with DFlash, batch-8 output 501 to 1,452 tok/s, GGUF q4_k_m 72.6 to 140.7 tok/s, 128K context window, 18GB checkpoint plus 5GB drafter, runs on RTX 5090, RTX PRO 6000, DGX Spark and Mac. Footer: SGLang/NVIDIA-reported, launch day.

ما الذي يمكنك فعله به فعليًا

Muse Glimmer هو نموذج كثيف متعدد الوسائط بحجم 30 مليار معامل — يستقبل النصوص والصور عبر مشفر إدراك مجمّد، ويُخرج النصوص — وهو مُدرَّب على أكثر من 100 لغة، بنافذة سياق تبلغ 131,072 رمزًا، وحدّ زمني للمعرفة في 4 يناير 2026. مهمته هي الأعمال الوكيلية غير البرّاقة: استدعاء الدوال، استخدام الأدوات، إدارة الجداول والملفات، تقييم LLM كحَكَم، والمهام متعددة الخطوات مع التعافي من الفشل — فعندما يفشل استدعاء أداة، يكون النموذج مُدرَّبًا على تشخيص المشكلة وإعادة المحاولة بدلًا من التوقف. يتيح مستويات جهد استدلالي (من منخفض إلى مرتفع للغاية) تحدّدها في موجه النظام، وهذه هي الطريقة التي توازن بها بين زمن الاستجابة وعمق المعالجة على الأوزان نفسها.

إن رقم 230 رمزًا في الثانية هو ما يجعل كل ذلك قابلاً للاستخدام على جهاز واحد. تحت حوالي 50 رمزًا في الثانية، يبدو الوكيل التفاعلي وكأنه جلسة تصحيح عن بُعد؛ وعند 200 فأكثر، يبدو وكأنه أداة محلية. هذه هي الحجة الكاملة للنموذج في رقم واحد، وهي السبب في أن قائمة الأجهزة — RTX 5090، وRTX PRO 6000، وDGX Spark، وMLX Macs — تبدو كدليل تسوق لعصر الوكلاء المحليين وليس كحاشية توافق.

كم تبلغ تكلفتها؟

أما Muse Glimmer نفسه فمجاني — أوزانه بترخيص Apache 2.0 على Hugging Face في meta-models/Muse-Glimmer-30B، مع تكميمات GGUF منشورة بالفعل لبيئات تشغيل بأسلوب llama.cpp، ودون أي API عام من Meta. التكلفة الحقيقية تكمن في العتاد المطلوب لتشغيله: نقطة فحص NVFP4 بحجم 18GB إلى جانب وحدة المسودة (drafter) بحجم 5GB تعني أنك تحتاج إلى بطاقة بذاكرة 24GB أو 32GB، أو Mac متطورًا من سلسلة M. إذا كنت تملك ذلك مسبقًا، فالتكلفة الحدّية لوكيل محلي دائم التشغيل هي الكهرباء. أما إذا لم تملكه، فبطاقة الرسوميات هي بند التكلفة — وهذه هي الطريقة الصادقة لمقارنة "نموذج مجاني" بواجهة API مستضافة.

عندما تجري هذه المقارنة، قيّم كلا الجانبين بشكل مباشر. في OrcaRouter، السعر الذي تراه لأي من النماذج المستضافة التي تزيد عن 200 نموذج هو سعر القائمة الخاص بالمزود مع تمريره بهامش ربح 0%، لذا فإن تخفيض سعر البائع يصبح ساريًا هنا في نفس اليوم — مما يحافظ على دقة الحسابات بين المحلي والمستضاف. Muse Glimmer نفسها ليست متاحة على OrcaRouter اليوم، لأنه لا يوجد مزود استدلال يقدمها بعد؛ فهي تُطرح كملف للتحميل. في اللحظة التي يبدأ فيها مزود بتقديمها، فإن نفس المفتاح الذي يصل إلى بقية الكتالوج سيصل إليها، والتحويل التلقائي عند الفشل هو الآلية التي تجعل من الآمن توجيه حركة الإنتاج إلى نموذج جديد كليًا أبلغ عنه البائع قبل أن يكون له سجل موثوق مستقل.

Screenshot of the NVIDIA Developer blog 'Run Local AI Agentic Workflows with Meta's Muse Glimmer', describing the 30B open-weight dense model with a 120K+ context window and quoting 20K tokens/sec on a single GPU for always-on local agents.

القصة الأكبر وراء السرعة

اعتبروا دعم SGLang منذ اليوم الأول إشارةً، وعندها لن يكون الإصدار مجرد نموذج واحد. Muse Glimmer هو نسخة مقطرة من النموذج الرائد المملوك لشركة Meta، Muse Spark 1.2، وقد صرّحت Meta بأن أوزان النموذج المعلّم ستتوفر "في الأسابيع القادمة". وكيل محلي بحجم 30B مع حزمة تقديم مُحسَّنة، ونموذج معلّم على وشك أن يصبح مفتوحًا، وصندوق مجتمعي بقيمة مليار دولار أُعلن عنه إلى جانب ذلك — هذا ليس إصدارًا نقطيًا. إنها بداية تشكيلة أوزان مفتوحة تستهدف سوق الوكلاء المحليين بشكل مباشر، ودعم الأطر البرمجية المتاح في اليوم الأول هو ما يؤكد أن Meta تعتزم أن يشغّله الناس فعلًا، وليس مجرد تنزيله.

التحذير الذي يجب أن يبقى على الطاولة: جميع أرقام السرعة والأداء المرتبطة بهذا الإطلاق حتى الآن هي من تقارير البائعين أو أطر العمل. أرقام الإنتاجية متسقة عبر مجموعتين تقنيتين مستقلتين، وهو أمر مطمئن، لكن القياس المعياري المستقل، والإدراج في منصة Artificial Analysis، وإعادة الإنتاج في العالم الحقيقي هي ما سيؤكد الادعاء بمعالجة 230 رمزًا في الثانية — وعادةً ما تظهر هذه النتائج في غضون أسابيع من إصدار كهذا.

ما الذي يجب متابعته، بترتيب تقريبي حسب السرعة: إطلاق الأوزان المفتوحة لـ Muse Spark 1.2 (القراءة الاستراتيجية لعبارة "عادت Meta" تعتمد عليه)؛ أول عمليات إعادة إنتاج مستقلة للإنتاجية على أجهزة غير تابعة لـ Nvidia، حيث مسار MLX هو ما يجب متابعته؛ وأول موفر استدلال ينشئ نقطة نهاية Glimmer — وهي اللحظة التي تتوقف فيها حجج "نموذج محلي مجاني" و"واجهة برمجة تطبيقات مستضافة" عن كونها افتراضية وتصبح خيارًا يمكنك اتخاذه بمفتاح واحد.

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the model's purpose-built local-agentic description.
© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube