بطاقة عنوان رئيسية مُولَّدة لـ Solar Mini 4 بعنوان رئيسي 'Solar Mini 4 — التشغيل المستقل'، مع عنوان فرعي 'مؤشر الذكاء 24، ونحو خمسة أضعاف تكلفة كل مهمة مقارنةً بـ GPT-6 Luna'، وشارتين مكتوب عليهما 'صدر في 22 سبتمبر 2026' و'أول تقييم من طرف ثالث، 30 سبتمبر 2026'.
Guides & Insights

سجّلت Solar Mini 4 نتيجة 24 على مؤشر Artificial Analysis — وتكلّف لكل مهمة خمسة أضعاف ما تكلّفه GPT-6 Luna

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

تتقاضى Solar Mini 4 نفس السعر لكل رمز إدخال مثل GPT-6 Luna، وحوالي خمسة أضعاف لإنجاز مهمة فعليًا. هذه هي القصة كاملةً لأول تقييم مستقل لنموذج Upstage الجديد، وهي ليست القصة التي ترويها مواد الإطلاق. أُطلق Solar Mini 4 في 22 سبتمبر 2026 كنموذج خليط خبراء متفرق (sparse mixture-of-experts) بمعاملات تبلغ 35 مليارًا يُنشّط 3 مليارات معامل لكل رمز، بسعر 0.10 دولار لكل مليون رمز إدخال و0.40 دولار لكل مليون رمز إخراج. بينما يُسعّر GPT-6 Luna، فئة الكفاءة لدى OpenAI، عند 0.10 دولار و0.50 دولار، مع فئة سياق طويل تتجاوز 182,000 رمز تضاعف كليهما تقريبًا. على بطاقة الأسعار يبدوان كعملية شراء واحدة. أما على مؤشر Artificial Intelligence Index، حيث خضع النموذجان لنفس مجموعة التقييمات العشر، فتبلغ تكلفة Solar Mini 4 0.36 دولار لكل مهمة مكتملة مقابل 0.07 دولار لـ GPT-6 Luna (max) — بمعامل 4 يأتي بالكامل من كيفية تصرف النموذجين أثناء المهمة وليس مما يتقاضيانه مقابل الرمز.

في 30 سبتمبر 2026، نشرت Artificial Analysis تقريرها عن النموذج، الذي يسجل 30 على Intelligence Index v4.3.2. كل ما يُنسب في هذا المقال إلى Artificial Analysis هو قياس المنظمة نفسها؛ وكل ما يُنسب إلى Upstage هو ادعاء المورد. الفرق هنا أكثر أهمية من المعتاد، لأن مجموعتي الأرقام لا تتفقان دائمًا.

ما تقوله {{التشغيل المستقل}} فعلاً

A scoreboard titled 'Solar Mini 4 — the scoreboard' with the rows: Intelligence Index 24.05 against a median of 12; Cost per index task $0.36 against GPT-6 Luna (max) at $0.07; Rate card $0.10 in / $0.01 cached / $0.40 out per 1M; Output per index task 88,300 tokens, 71,600 of them reasoning; Output speed 204 tokens per second and 430 seconds per index task; Context Upstage says 512K while Artificial Analysis lists 1.05M; Weakest result Terminal-Bench 4.0 at 1%.

تحقق Solar Mini 4 نتيجة 24.05 على مؤشر Intelligence Index، مقابل وسيط قدره 12 بين نماذج الاستدلال في فئة سعرها. وهذا يضعها أعلى بكثير من المتوسط لفئتها، كما أن صياغة Upstage نفسها — "أعلى درجة إجمالية بين النماذج النشطة بـ3B في مقارنة Artificial Analysis Intelligence Index" — تصمد أمام الاختبار المستقل في هذه النقطة تحديدًا. ويسجّل Qwen3.6 35B A3B، الذي ينشّط أيضًا 3B من المعلمات، 18.2 على المؤشر نفسه. ويسجّل K2 Horizon MoVA 36B A4B، مع 4B نشطة، 25.3 — وهو يفعل ذلك بسياق أقصر، 524K رمزًا مقابل 1.05M لـ Solar Mini 4. وبالمقارنة مع Inkling، وهو MoE مفتوح الأوزان بـ975 مليار معلمة صدر في يوليو، تأتي Solar Mini 4 عند 24.1 مقابل 25.0 — في نطاق نقطة واحدة من نموذج يقارب حجمه ثلاثين ضعفًا وبتكلفة 1.00/4.05 دولار لكل مليون رمز.

الملف داخل تلك النتيجة غير متساوٍ، والتفاوت هو الجزء المفيد:

• الاستدلال في السياقات الطويلة هو نقطة القوة النسبية. يسجّل Solar Mini 4 نسبة 83% في AA-LCR v1.1، بمستوى MiniMax-M3 وGPT-6 Luna (max)، ومتقدمًا على Gemini 3.8 Flash (high) وGPT-6 Astra (max) عند 81%.

• البرمجة العلمية تصمد. 48% في SciCode، متقدّمًا بنقطة واحدة على MiniMax-M3 وInkling (xhigh).

• البرمجة الوكيلية تنهار. 1% في Terminal-Bench 4.0. ليس "ضعيفًا" — بل 1%. وفي AutomationBench-AA، الذي يشغّل سير عمل متعدد الخطوات عبر تطبيقات SaaS الحقيقية، 22.3%.

• دقة المعرفة منخفضة، لكن النموذج يعلم أنه يخمّن. تُعيد AA-Omniscience قيمة −11 بدقة 18%؛ ويمتنع النموذج عن الإجابة عن نحو نصف الأسئلة التي تُطرح عليه. معدل عدم التهلوسة لديه 64%، متقدمًا بفارق كبير على Inkling (xhigh) عند 32% وGPT-6 Luna (max) عند 23%. النموذج الذي يقول "لا أعرف" في نصف الأوقات ويكون مصيبًا في ثلثي الأوقات التي يجيب فيها هو أداة مختلفة عن نموذج يختلق بثقة.

في العمل المعرفي الوكيلي، تبلغ الأرقام 1072 إيلو على GDPval-AA و872 إيلو على AA-Briefcase، وكلاهما قريب من Inkling (xhigh).

عدد الخمس مرات، مُفصّلًا

رقم التكلفة لكل مهمة لدى Artificial Analysis هو الرقم الذي سيحسم معظم محادثات الشراء، وهو يستحق أن يُقرأ كتحليل تفصيلي بدلاً من أن يُقتبس كعنوان رئيسي. هناك أمران يحرّكانه.

أولًا، الحجم. يصدر Solar Mini 4 نحو 88,300 توكن إخراج لكل مهمة Intelligence Index؛ منها 71,600 توكن استدلال. وبسعر 0.40 دولار لكل مليون توكن إخراج، يبلغ ذلك نحو 0.035 دولار من الفاتورة — رخيص، لأن الإخراج رخيص. لكن ما يكلّفه بدلًا من ذلك هو الوقت: عند معدل مُقاس يبلغ 204 توكن في الثانية، تسجّل Artificial Analysis 430 ثانية من العمل لمهمة مؤشر متوسطة، أو نحو 7.2 دقائق. أما GPT-6 Luna (max) فيصدر 50,000 توكن إخراج لكل مهمة عند 127 توكن في الثانية ويستغرق 396 ثانية. وInkling (xhigh)، وهو نموذج مفتوح الأوزان بـ 975 مليار معامل، يصدر 34,700 توكن وينتهي في 169 ثانية. إن Solar Mini 4 أبطأ من كليهما، لكن بفارق لا علاقة له بفجوة التكلفة البالغة خمسة أضعاف.

ثانيًا — وهذه هي القصة كاملة — إدخال كتابة ذاكرة التخزين المؤقت. في تفصيل التكلفة لدى Artificial Analysis، يُنسب نحو 0.30 دولار من أصل 0.36 دولار لكل مهمة لـ Solar Mini 4 إلى الرموز المكتوبة في ذاكرة التخزين المؤقت للمطالبة، مقابل 0.03 دولار لقراءات ذاكرة التخزين المؤقت، و0.035 دولار للمخرجات، ومقدار ضئيل جدًا للإدخال غير المخزّن مؤقتًا حقًا. وبالنسبة إلى GPT-6 Luna (max)، تبلغ كتابة ذاكرة التخزين المؤقت 0.012 دولار من 0.068 دولار — أي نحو 17% من الفاتورة، مقابل 82% لـ Solar Mini 4. الإدخال المخزّن مؤقتًا هو أرخص بند في قائمة أسعار Upstage عند 0.01 دولار لكل مليون، ونموذج Artificial Analysis يستخدمه بالفعل؛ المشكلة هي مقدار ما يجب كتابته قبل أن يمكن قراءته. الوكيل الذي يعيد إرسال محادثة متنامية في كل دور يدفع تكلفة الكتابة أكثر بكثير من نموذج يجيب في دور قصير مغلق.

تلك هي النتيجة التي تستحق أن تُنقل إلى بيئة الإنتاج: بالنسبة لنموذج كهذا، لا يكاد سعر الرمز الواحد يتنبأ بشيء عن فاتورة المهمة الواحدة. أما سلوك التخزين المؤقت فيفعل ذلك.

حيث تختلف أرقام Upstage الخاصة بها

A screenshot of Upstage's Console documentation page for Solar Mini 4, showing the Intelligence, Speed and Price gauges, the '$0.10 / 1M tokens' input rate, the description of a cost-efficient compact language model at 35B total and 3B active parameters built for agentic use cases, English, Japanese and Korean language support, tool calling, a 128K max output, the platforms Upstage Console and on-premises, and the version string solar-mini4-260922 with a training data cut-off of February 2026.

تشير منشور إطلاق Upstage، المنشور في 1 أكتوبر 2026 بعنوان "Solar Mini 4: مصمم لأعباء عمل الوكلاء عالية الحجم"، إلى تحقيق 24.1 على Artificial Analysis Intelligence Index — وهو الرقم نفسه فعليًا — ويطرح عدة ادعاءات تقف إلى جانب البيانات المستقلة بدلًا من أن تقف فوقها.

يستشهد المورّد بنسبة 22.3% على AutomationBench-AA، بما يطابق Artificial Analysis تمامًا، و47.2 على τ³-Banking، وهو معيار لتقييم السياسات واستخدام الأدوات أسقطته مجموعة المؤشرات منذ ذلك الحين. وتُبلّغ عن 83.3% على AA-LCR و47.6% على SciCode، وكلاهما ضمن هامش خطأ تقريب من الأرقام المستقلة. وفي Humanity's Last Exam تُبلّغ عن 19.6%، بينما تعرض صفحة Artificial Analysis نسبة 25.8% للنموذج نفسه؛ وكلا القراءتين معقولتان لتقييم معروف بتقلبه الشديد، لكنهما ليسا الرقم نفسه، ولا ينبغي تقديم أي منهما على أنه الآخر.

هناك أيضاً تناقضٌ بين سطرَي مواصفات. فوثائق Upstage تذكر نافذة سياق بسعة 512 ألف رمز، مع إخراج يصل إلى 128 ألف رمز. أما Artificial Analysis فتُدرج نافذة سياق بسعة 1.0 مليون رمز وحداً أقصى للإخراج يبلغ 262 ألف رمز. ومدوّنة Upstage صريحة في أن رقم 512 ألف هو المواصفة التعاقدية المعتمدة للطرح؛ وهذا التباين من الأمور التي يستحق التحقق منها مقابل استجابة API قبل أن يبني أي أحد خط أنابيب استرجاع عليه.

كما يُجري المورّد المقارنة الوحيدة التي يمكنه إجراؤها وفق شروطه الخاصة: اختبار داخلي عبر ثلاث مهام وكيل باللغة الكورية، تُشغَّل ثلاث مرات لكل نموذج، حيث بلغت تكلفة إكمال 1000 مجموعة من ثلاث مهام نحو 1.25 دولار مع Solar Mini 4 و2.20 دولار مع MiMo-V2.5. وهذا اختبار يديره المورّد على مهام يختارها المورّد مع استبعاد زمن الاستجابة، ويشير في الاتجاه المعاكس لنتيجة Artificial Analysis. وهو ليس خاطئًا — فالمهام المختلفة تستدعي ميزانيات رموز مختلفة — لكنه رقم تسويقي، كما أن خصم الإطلاق المنشور للنموذج سبب منفصل لإعادة إجراء حساباتك الخاصة بدلًا من تبنّي أرقام أي جهة أخرى.

التسعير، وفقًا للوثائق المباشرة لوحدة تحكم Upstage: 0.10 دولار لكل مليون رمز إدخال، و0.01 دولار لكل مليون رمز إدخال مخزّن مؤقتًا، و0.40 دولار لكل مليون رمز إخراج، مع خصم إطلاق مُعلن عنه حاليًا بنسبة 50% حتى 22 أكتوبر 2026 بتوقيت UTC، مما يجعل الأسعار الفعلية عند 0.05 دولار للإدخال، و0.005 دولار للإدخال المخزّن مؤقتًا، و0.20 دولار للإخراج حتى ذلك الحين.

ماذا يعني هذا إذا كنت أنت من يدفع

الأمر المثير للاهتمام في Solar Mini 4 ليس كونه نموذجًا سيئًا، بل كونه نموذجًا صغيرًا جيدًا حقًا، وتحكم اقتصادياته سلوكيات لا تستطيع بطاقة أسعار أن تُظهرها لك. إن تسجيل 24 على المؤشر بثلاثة معاملات نشطة هو إنجاز هندسي حقيقي، وأحمال العمل باللغة الكورية — وهي نقطة القوة المعلنة للنموذج، إلى جانب الإنجليزية واليابانية — هي بالضبط المجال الذي يُرجَّح أن تكون فيه تلك النتيجة جديرة بسعرها.

الجزء المربك هو كل ما يأتي بعد الاستدعاء الأول. ردود المساعد الطويلة، وضعف إعادة استخدام الذاكرة المؤقتة، ومهمة تستهلك سبع دقائق من فك الترميز في كل تشغيل فهرسة، كلها تتجمع لتصل إلى رقم لا يشبه $0.10/$0.40 إطلاقًا. إذا كنت تقيّمه، فإن التجربة النزيهة هي اختبار التكلفة لكل مهمة مكتملة على حمل العمل الخاص بك، مع تفعيل التخزين المؤقت للمطالبات بالطريقة التي ستستخدمها بها منظومة الإنتاج لديك فعليًا — لا مقارنة أسعار الرموز المميزة.

هذه أيضًا فئة المشكلة التي يوجد الموجّه لحلّها، والسبب الذي من أجله يقوم OrcaRouter بتمرير أسعار قوائم المزوّدين كما هي دون هامش ربح بنسبة 0% بحيث يصل أي تغيير في سعر أحد المورّدين إلى فاتورتك في اليوم نفسه. نحن لا نوجّه نماذج Upstage، لذا لا يتوفّر Solar Mini 4 ولا Solar Pro 4 من خلالنا — فهما يأتيان من واجهة Upstage API الخاصة بها ومن منصات طرف ثالث. وما نوجّهه فعلًا هو النصف الآخر من هذه المقارنة: GPT-6 Luna وQwen3.8-Max وQwen3.8-27B وQwen3.8-Flash وأكثر من 200 نموذج آخر خلف مفتاح واحد، وهو ما يجعل من العملي الاحتفاظ بنموذج رخيص ونموذج مكلف في المهمة نفسها وترك التبديل التلقائي عند الفشل والتوجيه لكل طلب يقرّران أيّهما يجيب. عندما يكون الفارق بين نموذجين فجوة في التكلفة لكل مهمة تبلغ خمسة أضعاف لا تكشفها أي قائمة أسعار، فإن القدرة على نقل طلب واحد بينهما تهمّ أكثر من أي جدول معايير.

A screenshot of the Artificial Analysis article dated September 30, 2026, headlined 'Korean AI Lab Upstage has released Solar Mini 4 which scores 24 on the Artificial Analysis Intelligence Index, but costs ~5x as much per task as GPT-6 Luna (max) despite similar per-token prices'. The visible key-results text covers the 3B-active Pareto claim, the 6-point lead over Qwen3.6 35B A3B at the same active size, 83% on AA-LCR v1.1 matching MiniMax-M3 and GPT-6 Luna (max), 48% on SciCode, and fast output at 208 tokens per second with slow tasks.

النسخة المختصرة: Solar Mini 4 هو نقطة باريتو الجديدة التي ترسمها Artificial Analysis للنماذج التي يقل عدد معاملاتها النشطة عن ثلاثة مليارات، وهو أغلى بنحو خمسة أضعاف لكل مهمة مكتملة مقارنةً بنموذج يُدرج بسعر الإدخال نفسه. كلا العبارتين صحيحتان، والثانية هي التي تظهر في الفاتورة.