
معاينة Pareto 26.10 من Unbiased: تبديل 1M-Context خلف نفس سلسلة النموذج
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 221 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
لا يتغير التكامل. لكن النموذج الذي يقف خلفه يتغير. في 1 أكتوبر 2026، نقلت Unbiased سلسلة نموذجها — pareto — إلى Pareto 26.10 Preview، إصدار جديد بنافذة سياق أكبر بأربع مرات، وسعر أقل على الكتالوج الموجّه، وورقة معايير هي، باعتراف البائع نفسه، أولية وغير منشورة في شكلها النهائي. إذا استدعيت Pareto اليوم باسمها، فأنت تستدعي 26.10 Preview، ويقول سجل تغييرات البائع ذلك بأوضح العبارات الممكنة: "Pareto 26.10 Preview هو الآن إصدار Pareto الحالي… وتبقى سلسلة النموذج pareto."
هذا السطر الواحد هو القصة كاملة لأي شخص لديه Pareto في مكدس تقني. هذا ليس منتجًا ثانيًا يُطلق جنبًا إلى جنب مع الأول. بل هو المنتج الأول، يُستبدل في مكانه، تحت اسم لم يتغير — مما يعني أن الإصدار الذي تحصل عليه يحدده تقويم الإصدارات، وليس أي شيء في طلبك.
ما الذي تغيّر فعليًا في الأول من أكتوبر؟
تحرّكت أربعة أشياء، وهي لا تشير جميعها في الاتجاه نفسه.
• نافذة السياق — 262,144 توكنًا في إصدار Pareto الصادر في سبتمبر، وأصبحت الآن 1,048,576. ولا تذكر وثائق Unbiased نفسها هذا الرقم قط؛ فالرقم يأتي من القائمة التقنية العامة للنموذج، حيث يمثّل الحد الأقصى لكل طلب دون توفير فئة أصغر.
• السعر، وفقًا للتوجيه — السعران اللذان يُقتبسان عادةً لـ Pareto هما 2.50 دولار لكل مليون توكن إدخال و7.50 دولار لكل مليون توكن إخراج، مع إدخال مخزَّن مؤقتًا بسعر 0.25 دولار. أما قائمة 26.10 Preview فتحمل 0.80 و3.20 و0.03 دولار على التوالي — أي نحو ثلث سعر الإدخال وأكثر بقليل من 40% من سعر الإخراج.
• نتائج المعايير — نُشرت للمرة الأولى لهذا الإصدار، وهي أولية بحسب تصنيف البائع نفسه.
• الخيار المستقر — إن 26.10 Preview إصدار تجريبي. ويقول نص كتالوج Unbiased إنه "قد يتغير دون إشعار" ويوجّه من يحتاج إلى سلوك يمكن التنبؤ به إلى الإصدار السابق بدلًا من ذلك.
ظلّ كل ما عدا ذلك على حاله. لا يزال الحد الأقصى للإخراج 131,072 رمزًا. لا تزال المدخلات نصًا وصورة؛ ولا تزال المخرجات نصًا فقط. لا يزال لا يوجد معرّف Hugging Face على القائمة، لذا تظل الأوزان مغلقة. ولا يزال هناك مزوّد خدمة واحد بالضبط — وهو Unbiased نفسه — دون مضيف ثانٍ داخل القائمة.

السعر هو الجزء الذي يستحق القراءة مرتين
على منصة Unbiased نفسها، لم تتحرّك بطاقة الأسعار. لا تزال بطاقة النموذج وصفحة التسعير تعرضان 2.50 دولار لكل مليون رمز إدخال، و0.25 دولار للمخزّن مؤقتًا، و7.50 دولار للإخراج — وهي الأرقام الثلاثة نفسها التي حملها إصدار سبتمبر — ولأن سلسلة النموذج بقيت pareto، فإن العميل الذي يستخدم واجهة برمجة التطبيقات الخاصة بالمورّد يدفع تلك الأسعار مقابل 26.10 Preview. الأرقام الأدنى هي المدرجة في قائمة الكتالوج الموجَّه، والفجوة بين الاثنين هي بالضبط ما يحسم قرار الترحيل.
هناك قراءتان محتملتان، ولم يقل المورّد أيّهما صحيح. فإما أن يكون 26.10 Preview يُقدَّم فعلاً بسعر أرخص عبر ذلك المسار كدفعة تعريفية، أو أن الإدراج يمثل ترتيبًا تجاريًا مختلفًا عن المنصة المباشرة. لا تنشر Unbiased أي تاريخ انتهاء ترويجي، والسعر المحدد في يوم الإطلاق ليس التزامًا.
هذا هو الجزء الوحيد من القصة الذي يغيّر الراوتر شكله. يمرّر OrcaRouter سعر القائمة الخاص بالمزوّد مباشرةً بهامش ربح 0%، لذا يصبح تخفيض سعر المورّد ساريًا لدينا في اليوم نفسه الذي يصل فيه بدلًا من دورة تعاقدية — كما أن التحويل التلقائي عند الفشل يعني أن إصدار معاينة يتصرّف بشكل مختلف الأسبوع المقبل يمكن استبداله دون تغيير في الشيفرة. نحن لا نوفّر Unbiased's Pareto 26.10 Preview، لذا فالنسخة الصادقة هي هذه: إذا أردت هذا الطراز تحديدًا، فاستدعِه عبر واجهة API الخاصة بـ Unbiased. المغزى فقط هو أنه في إصدار معاينة، يكون السعر والإصدار كلاهما متغيّرين، ولا ينبغي تثبيت أيٍّ منهما في الشيفرة.
ورقة القياس المرجعي، مع التسميات التي جاءت معها
نشرت Unbiased أربع درجات للإصدار 26.10 Preview، كل واحدة منها مقترنة بتكلفة مُقاسة لكل مهمة، وكل واحدة تحمل تحفظًا كتبه المورّد بنفسه. اقرأها على أنها مُشغّلة من المورّد وغير مُعاد إنتاجها، لأن هذا هو ما هي عليه:
• DeepSWE v1.1 (البرمجة الوكيلية) — 69.9%، بتكلفة 0.24 دولار لكل مهمة
• Terminal-Bench 4.0 (استخدام الطرفية الوكيلي) — 50.8%، بتكلفة 0.48 دولار لكل مهمة
• Humanity's Last Exam، نصي فقط (الاستدلال الخبير) — 49.9%، بتكلفة 0.008 دولار لكل مهمة
• GPQA-Diamond (الاستدلال العلمي) — 92.4%، بتكلفة 0.004 دولار لكل مهمة

صياغة المورّد هي أن 26.10 Preview «يطابق حدود باريتو أو يضعها في جميع المعايير الأربعة». والجدول الذي ينشره إلى جانب هذا الادّعاء أكثر تحديدًا، ويُحسَب لـ Unbiased أنه يُنشَر أصلًا: في Terminal-Bench 4.0، يُدرَج GPT 4 Astra عند 58 وFable 5.1 عند 56، وكلاهما فوق 50.8 الخاصة بباريتو، ويقول قسم المورّد نفسه «حيث تسجّل نماذج أخرى نتائج أعلى» ذلك مباشرة. وفي DeepSWE v1.1 يقع الإصدار داخل مجموعة متقاربة — GLM-5.3 وKimi K3 مُدرَجان كلٌّ منهما عند 69.0 مقابل 69.9 لباريتو — وهو تعادل عمليًا وداخل أي هامش خطأ يحمله تشغيل واحد.
تحمل أرقام المقارنة تحفّظًا ثانيًا أهمّ من الأول: فهي منقولة من مقارنة بتاريخ 21 سبتمبر، وهي، بحسب تعبير المورّد، "غير مصادَق عليها بشكل مستقل"، كما أُنتجت في تقييم منفصل لنماذج فردية — لذا ينبغي ألّا تُقرن بأرقام التكلفة لكل مهمة الخاصة بـ Pareto كما لو أن كليهما صدر عن منصة الاختبار نفسها. ويقول المورّد ذلك في تفاصيل التقييم. أما القارئ الذي يتخطى ذلك السطر فسيقرأ الرسم البياني قراءة مبالغًا فيها.
ما لا يمثله أي من هذا: الاستقلالية. فلا تملك Artificial Analysis، المنصة التي تتحقق منها معظم الفرق قبل أن تثق باسم جديد على قائمة أسعار، أي صفحة عن Pareto على الإطلاق. وكل رقم ورد أعلاه أنتجته الشركة التي تبيع النموذج. والشيء الوحيد الذي يخفف وطأة ذلك هو أن أداة التقييم عامة — إذ ينشر المورّد مجموعة مواجهات مباشرة قابلة للتكرار يمكن لأي شخص توجيهها إلى نقطة نهاية — وهذا يحوّل «ثق بتقييمنا» إلى «أعد تشغيل تقييمنا». هذا عرض حقيقي، لكنه ليس مثل رقم موثّق. ولم ينشر أحد إعادة التشغيل بعد.
ما المقصود بكلمة "preview" في العقد؟
الكلمة هنا تؤدي عملًا أكبر مما تفعله ملاحظات الإصدار. توثيق Unbiased نفسه يصف الوصول الحالي بأنه وصول تقييمي بموجب شروطه، وينص على أن الاستخدام التجاري أو الإنتاجي يتطلب اتفاقًا كتابيًا منفصلًا. وتُراجع الحسابات الجديدة يدويًا قبل إصدار مفتاح API. الواجهة متوافقة مع OpenAI وAnthropic — عنوان URL الأساسي، والمفتاح، وسلسلة النموذج، دون إعادة كتابة — لكن السطح الموثّق يقتصر على إكمالات الدردشة والرسائل فقط، مع ثغرات معروفة يدرجها المورّد علنًا: GET /v1/models غير مُنفَّذ، ومعرّفات النماذج غير المعروفة لا تُرفض، لذا على المستدعين إرسال pareto صراحةً بدلًا من استكشاف ما هو متاح.
ضع ملصق المعاينة وعقد البيتا الخاصة معًا، فتكتب النصيحة التشغيلية نفسها. هذا نموذج يُقيَّم مقابل عبء عملك الخاص خلف طبقة توجيه، لا نموذج يُوضع أمام حركة الإيرادات ويُنسى. والآلية لذلك غير مبهرة: سلسلة احتياطية تُضبط مرة واحدة، بحيث يصبح الإصدار الذي يتغير تحت قدميك في منتصف الأسبوع تغييرًا في الإعدادات بدلًا من حادث. أمضت Unbiased شهر سبتمبر في إصلاح هذا النوع من المشكلات تحديدًا على جانبها — إذ يسجل إدخال في سجل التغييرات بتاريخ 16 سبتمبر أن نحو 13% من الطلبات الطويلة غير المتدفقة كانت تصطدم بمهلة 120 ثانية، وتم رفع سقف البوابة إلى 300 ثانية. هذا بائع يتحدث بصراحة عن عيب طفيف. وهو أيضًا تذكير بأن الملف التشغيلي لأي معاينة لا يزال قيد الكتابة.

ما يجب الانتباه إليه قبل الالتزام
ثلاثة أمور محددة من شأنها أن تحسم الأسئلة المفتوحة، وكل منها قابل للتحقق.
الأولى نتيجة مستقلة. إلى أن يُشغّل طرفٌ ثالث إصدار 26.10 Preview على بيئة اختبار منشورة، فإن 92.4 على GPQA-Diamond و50.8 على Terminal-Bench ليست سوى ادعاءات من المورّد عن عمل المورّد نفسه — كافية لتقرير ما إذا كان ينبغي الاختبار، لكنها ليست كافية لتقرير ما إذا كان ينبغي الترحيل.
الثاني هو ما تفعله المعاينة بالسعر. إذا بقيت القائمة الموجّهة عند $0.80 و$3.20 بينما تحتفظ منصة البائع نفسه بـ $2.50 و$7.50، فإن الفرق قرار قناة يستحق الفهم قبل أن تبني نموذج تكلفة على أي من الرقمين.
الثالث هو ما يعنيه «قد يتغير دون إشعار» في الممارسة العملية. فالمعاينة التي تُنقّح مرتين في الشهر أداة مختلفة عن تلك التي تُجمّد وتُعاد تسميتها في نهاية الربع، وسجل التغييرات هو المكان الذي سيظهر فيه ذلك أولاً.
لا شيء من هذا يصلح حجة ضد تجربته. نموذج متعدد الوسائط بمليون رمز يقدّم درجات قريبة من مستوى الطليعة مقابل 0.24 دولار للمهمة يستحق أن تقضي بعد ظهر من العمل الحقيقي على مطالباتك الخاصة، وتكلفة ذلك التقييم أقل من الجدل حوله. لكنه يصلح حجة ضد افتراض أن النموذج الذي تقيس أداءه هذا الأسبوع هو النموذج الذي ستحصل عليه الأسبوع المقبل — وهو، بالنسبة لإصدار يسميه المورّد نفسه معاينة، الافتراض الوحيد الذي يجب أن يكون صحيحًا.
الإصدار التجريبي هو بالضبط الحالة التي صُمم من أجلها التجاوز التلقائي للفشل: التجاوز التلقائي للفشل يحوّل نموذجًا يتغيّر تحتك في منتصف الأسبوع إلى تغيير في الإعدادات بدلاً من انقطاع الخدمة.
