تم إنشاء بطاقة عنوان بعنوان 'Step 5 Preview مقابل Claude Opus 5 — فجوة السعر' مع عمودين: Step 5 Preview عند AA Index 44، السعر: 1.00 دولار للإدخال / 2.70 دولار للإخراج، تكلفة تشغيل المؤشر 922.84 دولار وسرعة الإخراج 99.8 توكن/ثانية؛ Claude Opus 5 عند AA Index 51، السعر: 5.00 دولار للإدخال / 25.00 دولار للإخراج، تكلفة تشغيل المؤشر 7,274.74 دولار وسرعة الإخراج 55.3 توكن/ثانية. في التذييل: '7.9 ضعف التكلفة مقابل 7 نقاط مؤشر. كلاهما وفقًا لـ Artificial Analysis Intelligence Index v4.3.2 عند أقصى جهد استدلالي.'
Guides & Insights

Step 5 Preview مقابل Claude Opus 5: سبع نقاط مؤشر مقابل سبعة أضعاف الفاتورة

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

مواد إطلاق StepFun الخاصة بـ Step 5 Preview تتصدّر بادعاء مقارن واحد: أن مهمة واحدة عليه تكلّف ثُمن تكلفة المهمة نفسها على Claude Opus 5. كلا النموذجين الآن على اللوحة المستقلة نفسها، لذا يمكن التحقق من هذا الادعاء بدل الجدال حوله. شغّلت Artificial Analysis كلاً منهما عبر Intelligence Index v4.3.2 — عشر تقييمات — ونشرت تكلفة كل تشغيل، مع تقييم Claude Opus 5 عند إعداد أقصى جهد استدلالي خاص به. Step 5 Preview: 44 على المؤشر، و922.84 دولاراً لإكمال التشغيل. Claude Opus 5: 51 على المؤشر، و7,274.74 دولاراً. أي 7.9 أضعاف المال مقابل 7 نقاط في النتيجة، وتبيّن أن النسبة التي ذكرتها StepFun هي النسبة الدقيقة. وما تخفيه النسبة هو الجزء المثير، لأن الفجوة ليست فجوة سعر بشكل أساسي. إنها فجوة إسهاب ترتدي ثياب فجوة سعر، وفصل الاثنتين يغيّر أي نموذج ينبغي أن تضعه أمام أي عبء عمل.

تكلفتا تشغيل، ولوحة واحدة، وما يوجد فعليًا بداخلهما

تُعدّ التكلفة الإجمالية للتشغيل أنظف مقارنة منفردة متاحة هنا، لأن كلا النموذجين أجابا عن الأسئلة نفسها ضمن منظومة الاختبار نفسها، ولم يُنتِج أيٌّ من المورّدين هذا الرقم. وهي أيضًا الرقم الأكثر عرضة لسوء القراءة، لذا يستحق أن نُفصّل فيه.

• درجة المؤشر — Step 5 Preview 44 مقابل Claude Opus 5 51، وقد حقّق Claude Opus 5 هذه الدرجة عند إعداد أقصى جهد للاستدلال لديه

• إجمالي التكلفة لإكمال الفهرس — Step 5 Preview 922.84 دولارًا مقابل Claude Opus 5 7,274.74 دولارًا

• السعر المدمج عند مزيج 7:2:1 من إصابة ذاكرة التخزين المؤقت / الإدخال / الإخراج — Step 5 Preview بسعر $0.51 لكل مليون رمز مقابل Claude Opus 5 بسعر $3.85

• رموز الإخراج المُولَّدة أثناء تشغيل الفهرس — Step 5 Preview 160M مقابل Claude Opus 5 140M

• سعر القائمة — Step 5 Preview: 1.00 دولار للإدخال / 2.70 دولار للإخراج مقابل Claude Opus 5: 5.00 دولار للإدخال / 25.00 دولار للإخراج

انظر إلى الصفين الثالث والخامس معًا، فتتوقف الحسابات عن كونها مقارنة أسعار مباشرة. فمعدل Step 5 Preview المُدمج أرخص بمقدار 7.5 مرة، والسعر المعلن أرخص 5 مرات على الإدخال و9.3 مرة على الإخراج — لذا فالمزيج يؤدي عملًا لا يؤديه سعر الإدخال. وذلك لأن المزيج مُرجَّح نحو الإخراج، والإخراج هو الموضع الذي يتباعد فيه النموذجان أكثر من أي موضع آخر. يتقاضى Claude Opus 5 عن الإخراج 9.3 أضعاف معدل Step 5 Preview، وكلا النموذجين يكتبان قدرًا كبيرًا: 140 مليون رمز إخراج لـ Claude Opus 5 مقابل وسيط قدره 92 مليون عبر النماذج التي يقيسها المؤشر، و160 مليون لـ Step 5 Preview مقابل الوسيط نفسه البالغ 92 مليون.

إذن، القراءة الصادقة أضيق من "النموذج الرخيص صفقة رابحة". إن Step 5 Preview أرخص على كل المحاور، وهو ليس نموذجًا مقتصدًا — فهو يكتب مخرجات أكثر بنسبة 74% من النموذج الوسيط الذي يُقاس عليه، وهو بالضبط السلوك الذي يُفترض أن يعاقبه السعر. يكتب Claude Opus 5 أكثر بنسبة 52% من الوسيط، ويتقاضى 9.3 أضعاف المبلغ عن كل من تلك الرموز. المستدعي الذي يقيّد طول المخرجات يحصل على نسبة مختلفة عن الذي لا يفعل.

السؤال ليس أيهما أفضل، بل أين تقع نقطة التحوّل.

لنفترض أن المؤشر يمثل بديلاً معقولاً عن العمل الذي ترسله فعلاً — مهام وكيلية طويلة الأفق، وبرمجة، واستخدام أدوات متعدد الخطوات. عندئذٍ يمكن ذكر نقطة التعادل ببساطة: يجب أن يكون Claude Opus 5 أكثر فائدة لكل مهمة بما لا يقل عن 7.9 أضعاف قبل أن يستحق فاتورته، وعلى المؤشر فهو أفضل بـ7 نقاط على مقياس من 100 نقطة. ولا يلزم أن تشير هاتان الحقيقتان في الاتجاه نفسه، لأن فارق 7 نقاط في المؤشر لا يعني أنه أفضل بنسبة 16% في كل شيء. إنه حصيلة عشر عمليات تقييم، والتركيب يهم أكثر من الإجمالي.

هذه هي الحجة الداعية إلى الاهتمام بشكل النتيجتين بدلًا من العنوان الرئيسي. قراءة Step 5 Preview على Terminal-Bench 4.0 هي 33.3% — نتيجة وكيلية حقيقية، متقدمة على DeepSeek V4.1 Flash عند 26.8% — لكن لا شيء في السجل المنشور يُظهر حتى الآن أنه يضاهي Claude Opus 5 في التقييمات طويلة الأفق التي يكون فيها نموذج Anthropic الأقوى. مواد StepFun نفسها تعترف بذلك في الصياغة: في ALE-CLI وFrontierFinance وDRACO، تضع الشركة Step 5 Preview في المركز الثاني، خلف إما GPT-6 Astra أو Claude Opus 5، وأمام النماذج المفتوحة الأخرى في المقارنة. المركز الثاني بخُمس السعر نتيجة جيدة حقًا. لكنه أيضًا ليس المركز الأول، والمهام التي يُنهي فيها النموذج في المركز الثاني هي عادةً المهام التي كانت تحتاج المركز الأول.

التباين الآخر هو ما يحدث عند استدعاء سيئ. فالإجابة الخاطئة الصادرة عن نموذج رخيص استغرق أربع ثوانٍ و2000 رمز تكلّفك إعادة المحاولة؛ أما الإجابة الخاطئة نفسها من Claude Opus 5 بتكلفة 25 دولارًا لكل مليون رمز مُخرَج فتكلّفك إعادة المحاولة إضافةً إلى التفكير المتأني. وإذا كانت منظومتك تعيد المحاولة عند الفشل — وهذا ما تفعله معظم حلقات الوكيل — فإن التكلفة الفعلية لكل مهمة ناجحة هي الرقم المهم، وهي ليست النسبة نفسها كسعر القائمة، لأن النموذجين لن يفشلا بالمعدل ذاته. ولم ينشر أحد ذلك الرقم بعد لـ Step 5 Preview.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

تباين المواصفات، بُعدًا بُعدًا

• درجة المؤشر — Step 5 Preview 44 مقابل Claude Opus 5 51، كلاهما على Intelligence Index v4.3.2، Claude Opus 5 عند إعداد أقصى جهد للاستدلال

• السعر لكل مليون رمز — Step 5 Preview ‏1.00$ للمدخلات / 2.70$ للمخرجات مقابل Claude Opus 5 ‏5.00$ للمدخلات / 25.00$ للمخرجات

• خصم ذاكرة التخزين المؤقت — Step 5 Preview ‏95% مقابل Claude Opus 5 ‏90%

• السياق — كلاهما 1M توكن؛ لم تُعلن StepFun عن حدّ أقصى للمخرجات، وحدّ Anthropic هو 128K

• المدخل — كلاهما يقبل النص والصور؛ وكلاهما يُخرج نصًا فقط

• سرعة الإخراج — ‏Step 5 Preview ‏99.8 رمز/ثانية مقابل Claude Opus 5 ‏55.3 رمز/ثانية

• سطح التحكم — يتيح Step 5 Preview التفكير الموسّع؛ ويستبدل Claude Opus 5 كلاً من temperature وtop_p بمقبض تكيّفي لجهد الاستدلال

• الأوزان — أُغلق Step 5 Preview اليوم، ونقطة حفظ BF16 مجدولة في 15 أكتوبر؛ ويبقى Claude Opus 5 احتكاريًا بالكامل

• دليل مستقل — كلاهما مُقيَّم من Artificial Analysis؛ وصفوف المعيار الوكيلي الخاصة بـ StepFun مُشغَّلة من المورّد ولم يُعَد إنتاجها

يستحق صفّان ملاحظة. فجوة السرعة حقيقية، وهي عمليًا أكبر مما يوحي به الجدول: 99.8 توكن في الثانية مقابل 55.3 يعني نموذجًا ينهي المخرجات نفسها بسرعة تقارب ضعف سرعة النموذج الآخر، كما أن زمن الوصول إلى أول توكن لدى Step 5 Preview البالغ 2.96 ثانية مقابل 56.84 ثانية لدى Claude Opus 5 على اللوحة نفسها يعد أمرًا مختلفًا جذريًا في طبيعته — مع أن هذا الرقم الثاني يقيس تهيئة الاستدلال بأقصى جهد، حيث يتدبر النموذج قبل أن يصدر أي شيء. وهو ليس زمن الاستجابة الذي يراه استدعاء إنتاجي. وبالمقارنة مع نقطة النهاية القياسية، يفيد كتالوجنا الخاص بأن زمن الوصول إلى أول توكن عند p50 هو 6.73 ثانية لـ Claude Opus 5، وهو الرقم الذي ينبغي التخطيط بناءً عليه إذا لم تكن تطلب عمدًا أقصى قدر من التدبر.

صف خصم ذاكرة التخزين المؤقت هو الصف الذي يحدّد بهدوء أحمال العمل المتكررة، وهو يرجّح كفة Step 5 Preview، بنسبة 95% مقابل 90%. حلقة الوكيل التي تعيد إرسال نفس موجّه النظام وسياق المستودع في كل استدعاء تعتمد تقريبًا بالكامل على ذلك الخصم، لذا يتراكم فرق خمس نقاط على مدار جلسة طويلة.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Claude Opus 5 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, output speed 99.8 tokens/sec, context 1M tokens, and weights due October 15. The right column gives Claude Opus 5 the rows AA Index 51, price $5.00 / $25.00, cache discount 90%, output speed 55.3 tokens/sec, context 1M tokens, and weights proprietary. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort. StepFun agentic rows are vendor-run.'

حيث يظل Claude Opus 5 هو الإجابة الوحيدة

لا شيء مما سبق يجادل ضد نموذج Anthropic. إنه يكلّف ما يكلّفه لأنه يفعل الشيء الذي يحاول المؤشر قياسه، ويفعله قرب قمة القائمة — 51 على Intelligence Index v4.3.2، بفارق سبع نقاط عن Step 5 Preview وفي متناول رواد الجيل الحالي. أما أعباء العمل التي يقلّل فيها فارق إجمالي قدره 7 نقاط من حجم الاختلاف فهي تلك التي لا تحتمل إجابة في المركز الثاني: إعادة هيكلة تمتد ساعات يكون نمط الفشل فيها تغيّرًا سلوكيًا دقيقًا، ونموذج مالي يجب أن تكون سلسلة الاستدلال فيه قابلة للتدقيق، وترحيل يُكتشف فيه قرار خاطئ بعد أسبوع. في هذه الحالات، ليست إعادة المحاولة رخيصة، والتفكير المتأني هو المنتج.

الأعمال التي تكون فيها الفجوة غير ذات أهمية هي تلك المبنية من قرارات صغيرة كثيرة: خطوات التصنيف والتوجيه، والاستخلاص، والتلخيص، وهياكل الاختبار، والألف نداء التي يطلقها وكيل بين النداءين المهمّين فعلاً. في هذه الحالات، فإن نموذجاً بتقييم 44 يجيب في نصف الوقت وبخُمس سعر الإدخال ليس حلّاً وسطاً. إنه الخيار الافتراضي الصحيح، مع الاحتفاظ بالنموذج المكلف للخطوة التي يجب أن تكون صحيحة.

تشغيل التقسيم دون تشغيل تكاملين

النسخة العملية لهذه المقارنة هي خط أنابيب متعدد الطبقات، والسبب في أن الفرق لا تبني واحدًا هو المشتريات وليس الهندسة — مورّدان، عقدان، مجموعتان من SDK، ومفتاحان يجب تدويرهما.Claude Opus 5 موجود في كتالوجنا بسعر 5.00 دولار و25.00 دولار، والنماذج النصية الأرخص التي قد تضعها أمامه موجودة في الكتالوج نفسه،كلها خلف مفتاح واحد لأكثر من 200 نموذج مع تمرير سعر القائمة لدى المزوّد بهامش ربح 0%.. Step 5 Preview ليس على تلك القائمة — فهو يعمل عبر واجهة API الخاصة بـ StepFun، وإلى أن تتوفر الأوزان، فذلك هو المكان الوحيد الذي يعمل فيه. تركيب التقسيم الطبقي عبر النماذج التي نوجّهها فعلًا هو تعبير routing-DSL وليس تغييرًا في الكود — أرسل الاستدعاءات الروتينية إلى النموذج الصغير، وارفع المستوى إلى النموذج المكلف عند تحقق شرط ثقة أو تعقيد، وأبقِ المسارين خلف نقطة النهاية نفسها.

يُعدّ الفشل التلقائي مهمًا لسبب محدد هنا وليس كميزة عامة. أطلقت Step 5 Preview واجهتها البرمجية (API) في يوم الإعلان دون أوزان منشورة ودون كشف عن أسطول الخدمة؛ إنها نقطة نهاية معاينة عمرها أيام، ونقاط نهاية المعاينة محدودة السعة بطريقة لا تكون عليها النقاط الناضجة. يتم تقديم Claude Opus 5 من قِبل العديد من المزوّدين المستقلين، وهو التكرار الذي لا تستطيع المعاينة تقديمه. الإبقاء على نموذج مُثبت كمسار احتياطي — من جانبنا يعني ذلك نموذجًا إنتاجيًا من الكتالوج، وليس المعاينة — هو كيف تحصل على إشارة جودة حقيقية على عبء العمل الخاص بك دون جعل مسار الإنتاج الخاص بك يعتمد على أسطول لا يزال قيد التحديد.

Screenshot of the OrcaRouter model page for Claude Opus 5 at www.orcarouter.ai/models/anthropic/claude-opus-5, showing the model id anthropic/claude-opus-5, the max output and context figures of 128K and 1M tokens, input pricing of $5.00 and output pricing of $25.00 per million tokens, a p50 time to first token of 6.73 seconds, 59.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

قاعدة القرار

إذا كان عبء عملك عبارة عن عدد قليل من المهام الصعبة جدًا، فإن Claude Opus 5 ليس الخيار المكلف — بل هو الخيار الرخيص، لأن الإجابة الثانية في الجودة تكلف أكثر من الفارق. وإذا كان عبء عملك عبارة عن عدد كبير من المهام العادية يتخللها عدد قليل من المهام الصعبة، فإن Step 5 Preview بسعر 1.00 دولار و2.70 دولار مع خصم تخزين مؤقت بنسبة 95% هو الخيار الافتراضي الأفضل، وفارق الـ7 نقاط ليس في معظمه سوى خطأ تقريب في عمل لم يكن بحاجة إليه.

ما من شأنه أن يغيّر ذلك الحساب هو أدلة مستقلة على معدلات الفشل وعلى الصفوف الوكيلية بعيدة المدى. أرقام StepFun نفسها تضع النموذج في المرتبة الثانية في التقييمات التي جعلت StepFun إطلاقها يدور حولها، ولم تُعِدْ إنتاجها أي جهة خارجية. راقب نقطة التحقق في 15 أكتوبر من أجل أمرين: ما إذا كان الترخيص يسمح بالضبط الدقيق الذي سيتيح لك سد فجوة قدرها 7 نقاط باستخدام بياناتك الخاصة، وما إذا كان الإطناب سيصمد بمجرد إزالة لاحقة المعاينة. الأول من شأنه تغيير النسبة؛ أما الثاني فقد حرّكها مرة بالفعل.