بطاقة عنوان رئيسية مُولَّدة لمقال بعنوان «Grok 4.7 مقابل Grok 4.6 — السعر نفسه، طراز مختلف»، مع عنوان فرعي «ما الذي غيّره إصدار 21 سبتمبر فعليًا»، وشرائح إحصائية تقرأ Terminal-Bench 4.0 بنسبة 38.0% مقابل 20.3%، وAA Index 46 مقابل 44، و2$/6$ لكلٍّ منهما.
Guides & Insights

Grok 4.7 مقابل Grok 4.6: السعر نفسه $2/$6، لكن النموذج مختلف من الداخل

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أطلقت SpaceXAI Grok 4.7 في 21 سبتمبر 2026، وأول ما يستحق الملاحظة بشأنه هو ما لم يتغيّر: السعر. يكلّف Grok 4.7 دولارين لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج، وهو بالضبط ما Grok 4.6 يكلّفه منذ إطلاقه في 12 أغسطس 2026. بطاقة الأسعار نفسها، ونافذة السياق نفسها البالغة 500,000 رمز، والمدخلات النصية والصورية نفسها — ومع ذلك لا يقترب النموذجان من بعضهما في التقييمات المهمة للعمل الوكيلي. وفقًا للأرقام المنشورة من SpaceXAI نفسها، يضاعف Grok 4.7 تقريبًا أداء Grok 4.6 على Terminal-Bench 4.0، بنسبة 38.0% مقابل 20.3%. هذا هو الشكل الكامل لهذه المقارنة: تبديل جيلي بالسعر نفسه حيث يتركز كل المكسب تقريبًا في مكان واحد، وما زالت الأجزاء من Grok 4.6 التي أزعجت فرق الإنتاج موجودة.

ما الذي تغيّر فعليًا بين النموذجين؟

وصف SpaceXAI نفسه للإصدار ضيق، ويستحق اقتباس شكله بدلاً من الصفات. بُني Grok 4.7 على نموذج أساسي أكبر من Grok 4.6، وأُجريت له جولة تدريب أطول بالتعلم المعزز تستهدف مهامًا "قد تستغرق ساعات لإكمالها". تقول الشركة إن تلك الجولة صقلت ثلاثة أمور: التحقق الذاتي، والتعامل مع السياق الطويل، والسلوك داخل بيئة Grok Bot. لا يوجد ادعاء بوجود بنية جديدة، أو نمطية جديدة، أو حزمة خدمة مختلفة.

هذا التأطير مهم لأنه يتنبأ بمكان ظهور مكاسب المعايير القياسية، وهي تظهر هناك بالضبط. إن تمريرة تعلّم معزّز أطول على مهام صعبة تستغرق ساعات متعددة تحرّك العمل في الطرفية والمستودعات أكثر بكثير مما تحرّك اختبارًا معرفيًا. إذا كنت تأمل أن يكون Grok 4.7 نموذجًا أوسع من Grok 4.6، فإن ملاحظات الإصدار تقول عكس ذلك — فهو النموذج بالشكل نفسه، لكنه دُرّب أكثر نحو الطرف الصعب من العمل الوكيلي.

قصة البارامترات هي الجزء الوحيد من هذا الذي ليس إفصاحًا من مورّد. قال ماسك في أوائل سبتمبر إن Grok 4.7 يحمل نحو 2.1 تريليون بارامتر مقابل 1.5 تريليون لـ Grok 4.6، أي بزيادة 40%، وقد تكرر هذا الرقم في كل مكان منذ ذلك الحين. لم يظهر قط في ورقة مواصفات SpaceXAI. تعامل معه كادعاء واسع التناقل عن النموذج الأساسي، لا كمواصفة مؤكدة — ولاحظ أن أعداد البارامترات لا تقول سوى القليل عن تكلفة الخدمة أو القدرة عندما تكون البنية المعمارية متناثرة، وهو ما عليه خط Grok.

فجوة المعيار، مع ملصق المصدر المرفق

كل رقم في هذا القسم مصدره مواد الإطلاق الخاصة بـ SpaceXAI. ولم يُعَد إنتاج أيٍّ منها بشكل مستقل وقت كتابة هذا النص، والطريقة الأمينة لقراءته هي اعتباره مجموعة ادعاءات تصادف أنها محددة على نحو غير معتاد — وهذا ما يجعله قابلاً للتحقق منه لاحقاً، لكنه لا يجعله مُتحقَّقاً منه الآن.

• Terminal-Bench 4.0 — Grok 4.7 بنسبة 38.0% (وفق ما أبلغ عنه المورّد) مقابل Grok 4.6 بنسبة 20.3%. وهي أكبر دلتا منفردة في الإصدار، والدلتا التي تتوافق مع ادعاء "التعلم المعزز الأطول على المهام الأصعب".

• CursorBench 4.0 — Grok 4.7 بنسبة 46.3% (حسب ما أعلنته الجهة المطوّرة) مقابل Grok 4.6 بنسبة 40.4%. مكسب حقيقي، لكنه متواضع — أقل من ست نقاط، على معيار أقرب إلى العمل اليومي في المحرر منه إلى جلسات الطرفية المستقلة.

• DeepSWE v1.1 — Grok 4.7 بنسبة 71.0% عند جهد استدلال مرتفع (بحسب ما أعلنته الجهة المطوّرة) مقابل Grok 4.6 بنسبة 65.2%. مرة أخرى، تحسّن ملموس لكنه غير مبهر.

• EEBench — Grok 4.7 64.0% (مُبلَّغ عنه من المورّد). لم يُنشر رقم Grok 4.6 إلى جانبه، لذا لا يخبرك هذا بشيء عن الترقية.

• AA-Briefcase v1.1 — Grok 4.7 عند 1,657 نقطة إيلو (بحسب ما أفاد به المورّد)، في تقييم العمل المعرفي المهني.

اقرأ القائمة كمجموعة واحدة، فالنمط متسق: Grok 4.7 أفضل بدرجة معتبرة حين تكون المهمة طويلة ووكيلية، وأفضل بشكل هامشي حين تكون المهمة قصيرة. قفزة Terminal-Bench تقارب الضعف؛ أما مكاسب العمل على المحرر فهي نسب مئوية من رقم واحد. إذا كان عبء عملك على شكل الإكمال التلقائي، فأنت تدفع نفس $2/$6 مقابل تحسين صغير. وإذا كان عبء عملك هو «التشغيل لمدة ساعتين ثم العودة»، فهذا الإصدار موجّه إليك مباشرة.

ما الذي يقوله القياس المستقل حتى الآن

يوجد رقم مستقل واحد، ويجدر ذكره بعناية لأنه من السهل إساءة قراءته. يمنح Artificial Analysis نموذج Grok 4.7 درجة 46 على مؤشر Intelligence Index الخاص به، الإصدار v4.3.2، مما يجعله في المرتبة 16 من أصل 655 نموذجًا على لوحة الصدارة. ويقع Grok 4.6 عند 44 على المقياس نفسه. والفارق بمقدار نقطتين على مؤشر مركّب ليس المضاعفة التي يُظهرها Terminal-Bench، وهذا التباين مفيد وليس متناقضًا: فالمؤشر يمزج بين الاستدلال والمعرفة والرياضيات والبرمجة، لذا فإن المكسب الكبير في شريحة وكيلية واحدة يخفف بفعل كل ما لم يغيّره النموذج.

هناك تفصيلان إضافيان من الصفحة نفسها أكثر فائدة من النتيجة الرئيسية. أولًا، ولّد Grok 4.7 240 مليون توكن إخراج أثناء تشغيل المؤشر، مقابل وسيط قدره 92 مليون — فهو مفكّر مسهب، وبسعر إخراج يبلغ $6 لكل مليون، يصبح هذا الإسهاب بندًا في التكلفة. ثانيًا، النتيجة المركّبة للمؤشر تضعه ضمن أقوى النماذج في فئته السعرية، وهي المقارنة التي تهم المشتري فعليًا. لم تنشر Artificial Analysis سعرًا مُدرجًا لـ Grok 4.7 على صفحة النموذج، فلا تأخذ رقم التكلفة لكل مهمة من هناك؛ استخدم سعر البائع $2/$6.

A generated two-column comparison scoreboard for Grok 4.7 and Grok 4.6 with six rows: Terminal-Bench 4.0 38.0% vs 20.3%, CursorBench 4.0 46.3% vs 40.4%, DeepSWE v1.1 71.0% vs 65.2%, AA Intelligence Index 46 vs 44, context 500K on both, and price $2/$6 on both, with a footer noting all benchmark figures are vendor-reported and the index scores are per Artificial Analysis v4.3.2.

الجرف السعري لم يُصلحه أيٌّ من النموذجين.

هذا هو الجزء من بطاقة أسعار Grok 4.6 الذي تعلّمت فرق الإنتاج كرهه، ولم يغيّره Grok 4.7. تحت 200,000 توكن إدخال، السعر هو $2 للإدخال و$6 للإخراج. وفوق هذا الحد، يُعاد تسعير الطلب بالكامل إلى $4 للإدخال و$12 للإخراج. ليس التوكنات الزائدة — بل الطلب بأكمله. استدعاء بـ 210,000 توكن يكلّف ضعف ما يكلّفه استدعاء بـ 199,000 توكن، مقابل 11,000 توكن إضافية.

مع نافذة سياق تبلغ 500,000 رمز على كلا الطرازين، من السهل السقوط من ذلك الجرف. تشغيل الوكلاء ذوي السياق الطويل ومطالبات المستودع بالكامل هي بالضبط أعباء العمل التي تم ضبط Grok 4.7 من أجلها، مما يعني أن أفضل حالة استخدام للنموذج هي أيضًا الأكثر عرضة للتسبب في المضاعفة. إذا كنت تنقل العمل إلى Grok 4.7 لأنه يتعامل مع الجلسات الوكيلية الطويلة بشكل أفضل، فضع ميزانية لإعادة التسعير قبل نقل العمل، وليس بعده.

هناك أيضًا مستوى سرعة ينبغي أخذه في الاعتبار. تُصدر SpaceXAI نسخة سريعة من Grok 4.7 تضاعف سرعة الإخراج وتضاعف السعر المعلن. هذه مقايضة مشروعة للبرمجة التفاعلية، ومقايضة سيئة للعمل بالدفعات — فالمهمة نفسها بالجودة نفسها تكلّف ضعف الثمن مقابل توفير في الوقت الفعلي لا يراقبه أحد.

الترحيل من Grok 4.6 دون إعادة كتابة

الخبر السار عمليًا هو أن هذا استبدال لطراز، وليس ترحيلًا لمنصة. كلا الطرازين يستقبلان النصوص والصور ويعيدان نصًا، وكلاهما يستخدم مستويات جهد الاستدلال نفسها من low إلى xhigh، وشكل الطلب هو ذاته الذي تقدمه SpaceXAI منذ Grok 4.5. الكود الذي يستدعي Grok 4.6 مع معامل effort لا يحتاج إلى إعادة هيكلة لاستدعاء Grok 4.7.

النقطة التي لا يكون فيها التبديل مجانيًا هي التقييم. تتركز مكاسب Grok 4.7 في التشغيلات الوكيلية الطويلة، لذا فإن مجموعة اختبارات مبنية على مطالبات قصيرة أحادية الدور لن تُظهر لك شيئًا تقريبًا — سترى التحسن بحجم CursorBench وتستنتج أن الترقية لم تستحق الجهد، بينما تكمن الحجة لصالحها في مهام لا تختبرها مجموعتك أبدًا. القياس الذي سيحسم الأمر فعليًا هو إتمام المهام عبر عمل متعدد الخطوات: التصحيحات المقبولة، والانحدارات المُدخلة، واستدعاءات الأدوات لكل مهمة مكتملة، ومدى تكرار حاجة التشغيل إلى إنقاذ بشري. تلك هي المحاور التي تشير إليها أرقام البائع نفسه، وهي التي لا يغطيها أي معيار قياس منشور لقاعدة الشيفرة الخاصة بك.

الإسهاب هو الشيء الثاني الذي يجب قياسه. النموذج الذي يُصدر 240 مليون رمز على فهرس قياسي سيُصدر رموزًا أكثر على عبء العمل الخاص بك مما فعل سابقه، وبسعر 6 دولارات لكل مليون مخرَج، يمكن أن يمحو بهدوء قيمة ترقية بنفس السعر. تتبَّع رموز المخرَج لكل مهمة مكتملة لمدة أسبوع قبل أن تلتزم.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

أي واحد يجب الاتصال به؟

القرار بسيط حقًا، وهو أمر غير معتاد في مقارنة النماذج. يظل Grok 4.6 الخيار الصحيح لحركة المرور قصيرة الدور والحساسة للتكلفة: الدردشة، والتصنيف، والتلخيص، ومساعدة البرمجة على نطاق المحرر، حيث تكون مكاسب Grok 4.7 صغيرة وإسهابه عبئًا. أما Grok 4.7 فهو الخيار الصحيح لعبء العمل الذي بُني من أجله — البرمجة الوكيلية طويلة الأفق والعمل في الطرفية حيث تستمر المهمة لساعات، ويكون التحقق الذاتي هو الفرق بين مهمة منجزة ومهمة عالقة.

تشغيل كليهما ليس حلًا وسطًا هنا، بل هو الجواب الصحيح، وبتكلفة زهيدة.Grok 4.6 موجود في كتالوج OrcaRouter بسعر SpaceXAI المعلن مع تمرير هامش ربح 0% مباشرةً، لذا فإن بطاقة السعر $2/$6 أعلاه هي ما تدفعه — ولأننا نمرّر سعر المزوّد المعلن بدلًا من إضافة هامش ربح عليه، فإن أي تغيير في سعر البائع يصبح ساريًا لدينا في اليوم نفسه الذي يحدث فيه. مفتاح API واحد يغطي Grok 4.6 وأكثر من 200 طراز آخر، لذا فإن نقل حركة المرور بينها حسب المهمة يصبح تغييرًا في الإعدادات لا عقدًا ثانيًا. إذا أردت تجربة Grok 4.7 على مسار إنتاجي قبل أن تثق به، فإن النمط الأكثر أمانًا هو إبقاء الاحتياط على Grok 4.6 — وهو طراز يمكنك توجيه الطلبات إليه اليوم — والسماح بالتحويل التلقائي عند الفشل عبر المزوّدين بإعادة الطلب عندما يسيء الطراز الجديد التصرف.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing SpaceXAI's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 500K token context window, and the reasoning and vision capability tags.

ماذا تشاهد بعد ذلك

سيحسم أمران هذه المقارنة، ولم يحدث أي منهما بعد. الأول هو إعادة إنتاج مستقلة لنتيجة Terminal-Bench 4.0 — فنسبة 38% قفزة كبيرة بما يكفي ليعيد شخص ما تشغيله، وإذا ثبتت، فإن الحجة لصالح Grok 4.7 في خطوط أنابيب الوكلاء قوية على أساس الجدارة وليس التسويق. والثاني هو بقية خارطة طريق Grok: فقد أعلنت SpaceXAI علنًا عن ترتيب Grok 4.8 وGrok 4.9 وGrok 5 بعد هذا الإصدار، وكان عمر Grok 4.6 نفسه حوالي خمسة أسابيع. إن اعتماد Grok 4.7 كافتراض منصة طويل الأجل سيكرر الخطأ الذي ارتكبته الفرق مع Grok 4.5.

في الوقت الحالي، الترقية بالسعر نفسه حقيقية واتجاه المسار واضح. الرقم الذي ينبغي التمسك به هو أن $2/$6 كان يشتري لك نموذجًا يتضاعف تقريبًا في المهام الطرفية الطويلة الأفق وبالكاد يتحرك في أي مكان آخر — وهذا ادعاء محدد ومفيد وقابل للتحقق وليس قفزة جيلية.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا