
Grok 4.7 مقابل Grok 4.6: السعر نفسه $2/$6، لكن النموذج مختلف من الداخل
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 1009 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 195 tok/s
- OrcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- xAISpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
أطلقت SpaceXAI Grok 4.7 في 21 سبتمبر 2026، وأول ما يستحق الملاحظة بشأنه هو ما لم يتغيّر: السعر. يكلّف Grok 4.7 دولارين لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج، وهو بالضبط ما Grok 4.6 يكلّفه منذ إطلاقه في 12 أغسطس 2026. بطاقة الأسعار نفسها، ونافذة السياق نفسها البالغة 500,000 رمز، والمدخلات النصية والصورية نفسها — ومع ذلك لا يقترب النموذجان من بعضهما في التقييمات المهمة للعمل الوكيلي. وفقًا للأرقام المنشورة من SpaceXAI نفسها، يضاعف Grok 4.7 تقريبًا أداء Grok 4.6 على Terminal-Bench 4.0، بنسبة 38.0% مقابل 20.3%. هذا هو الشكل الكامل لهذه المقارنة: تبديل جيلي بالسعر نفسه حيث يتركز كل المكسب تقريبًا في مكان واحد، وما زالت الأجزاء من Grok 4.6 التي أزعجت فرق الإنتاج موجودة.
ما الذي تغيّر فعليًا بين النموذجين؟
وصف SpaceXAI نفسه للإصدار ضيق، ويستحق اقتباس شكله بدلاً من الصفات. بُني Grok 4.7 على نموذج أساسي أكبر من Grok 4.6، وأُجريت له جولة تدريب أطول بالتعلم المعزز تستهدف مهامًا "قد تستغرق ساعات لإكمالها". تقول الشركة إن تلك الجولة صقلت ثلاثة أمور: التحقق الذاتي، والتعامل مع السياق الطويل، والسلوك داخل بيئة Grok Bot. لا يوجد ادعاء بوجود بنية جديدة، أو نمطية جديدة، أو حزمة خدمة مختلفة.
هذا التأطير مهم لأنه يتنبأ بمكان ظهور مكاسب المعايير القياسية، وهي تظهر هناك بالضبط. إن تمريرة تعلّم معزّز أطول على مهام صعبة تستغرق ساعات متعددة تحرّك العمل في الطرفية والمستودعات أكثر بكثير مما تحرّك اختبارًا معرفيًا. إذا كنت تأمل أن يكون Grok 4.7 نموذجًا أوسع من Grok 4.6، فإن ملاحظات الإصدار تقول عكس ذلك — فهو النموذج بالشكل نفسه، لكنه دُرّب أكثر نحو الطرف الصعب من العمل الوكيلي.
قصة البارامترات هي الجزء الوحيد من هذا الذي ليس إفصاحًا من مورّد. قال ماسك في أوائل سبتمبر إن Grok 4.7 يحمل نحو 2.1 تريليون بارامتر مقابل 1.5 تريليون لـ Grok 4.6، أي بزيادة 40%، وقد تكرر هذا الرقم في كل مكان منذ ذلك الحين. لم يظهر قط في ورقة مواصفات SpaceXAI. تعامل معه كادعاء واسع التناقل عن النموذج الأساسي، لا كمواصفة مؤكدة — ولاحظ أن أعداد البارامترات لا تقول سوى القليل عن تكلفة الخدمة أو القدرة عندما تكون البنية المعمارية متناثرة، وهو ما عليه خط Grok.
فجوة المعيار، مع ملصق المصدر المرفق
كل رقم في هذا القسم مصدره مواد الإطلاق الخاصة بـ SpaceXAI. ولم يُعَد إنتاج أيٍّ منها بشكل مستقل وقت كتابة هذا النص، والطريقة الأمينة لقراءته هي اعتباره مجموعة ادعاءات تصادف أنها محددة على نحو غير معتاد — وهذا ما يجعله قابلاً للتحقق منه لاحقاً، لكنه لا يجعله مُتحقَّقاً منه الآن.
• Terminal-Bench 4.0 — Grok 4.7 بنسبة 38.0% (وفق ما أبلغ عنه المورّد) مقابل Grok 4.6 بنسبة 20.3%. وهي أكبر دلتا منفردة في الإصدار، والدلتا التي تتوافق مع ادعاء "التعلم المعزز الأطول على المهام الأصعب".
• CursorBench 4.0 — Grok 4.7 بنسبة 46.3% (حسب ما أعلنته الجهة المطوّرة) مقابل Grok 4.6 بنسبة 40.4%. مكسب حقيقي، لكنه متواضع — أقل من ست نقاط، على معيار أقرب إلى العمل اليومي في المحرر منه إلى جلسات الطرفية المستقلة.
• DeepSWE v1.1 — Grok 4.7 بنسبة 71.0% عند جهد استدلال مرتفع (بحسب ما أعلنته الجهة المطوّرة) مقابل Grok 4.6 بنسبة 65.2%. مرة أخرى، تحسّن ملموس لكنه غير مبهر.
• EEBench — Grok 4.7 64.0% (مُبلَّغ عنه من المورّد). لم يُنشر رقم Grok 4.6 إلى جانبه، لذا لا يخبرك هذا بشيء عن الترقية.
• AA-Briefcase v1.1 — Grok 4.7 عند 1,657 نقطة إيلو (بحسب ما أفاد به المورّد)، في تقييم العمل المعرفي المهني.
اقرأ القائمة كمجموعة واحدة، فالنمط متسق: Grok 4.7 أفضل بدرجة معتبرة حين تكون المهمة طويلة ووكيلية، وأفضل بشكل هامشي حين تكون المهمة قصيرة. قفزة Terminal-Bench تقارب الضعف؛ أما مكاسب العمل على المحرر فهي نسب مئوية من رقم واحد. إذا كان عبء عملك على شكل الإكمال التلقائي، فأنت تدفع نفس $2/$6 مقابل تحسين صغير. وإذا كان عبء عملك هو «التشغيل لمدة ساعتين ثم العودة»، فهذا الإصدار موجّه إليك مباشرة.
ما الذي يقوله القياس المستقل حتى الآن
يوجد رقم مستقل واحد، ويجدر ذكره بعناية لأنه من السهل إساءة قراءته. يمنح Artificial Analysis نموذج Grok 4.7 درجة 46 على مؤشر Intelligence Index الخاص به، الإصدار v4.3.2، مما يجعله في المرتبة 16 من أصل 655 نموذجًا على لوحة الصدارة. ويقع Grok 4.6 عند 44 على المقياس نفسه. والفارق بمقدار نقطتين على مؤشر مركّب ليس المضاعفة التي يُظهرها Terminal-Bench، وهذا التباين مفيد وليس متناقضًا: فالمؤشر يمزج بين الاستدلال والمعرفة والرياضيات والبرمجة، لذا فإن المكسب الكبير في شريحة وكيلية واحدة يخفف بفعل كل ما لم يغيّره النموذج.
هناك تفصيلان إضافيان من الصفحة نفسها أكثر فائدة من النتيجة الرئيسية. أولًا، ولّد Grok 4.7 240 مليون توكن إخراج أثناء تشغيل المؤشر، مقابل وسيط قدره 92 مليون — فهو مفكّر مسهب، وبسعر إخراج يبلغ $6 لكل مليون، يصبح هذا الإسهاب بندًا في التكلفة. ثانيًا، النتيجة المركّبة للمؤشر تضعه ضمن أقوى النماذج في فئته السعرية، وهي المقارنة التي تهم المشتري فعليًا. لم تنشر Artificial Analysis سعرًا مُدرجًا لـ Grok 4.7 على صفحة النموذج، فلا تأخذ رقم التكلفة لكل مهمة من هناك؛ استخدم سعر البائع $2/$6.

الجرف السعري لم يُصلحه أيٌّ من النموذجين.
هذا هو الجزء من بطاقة أسعار Grok 4.6 الذي تعلّمت فرق الإنتاج كرهه، ولم يغيّره Grok 4.7. تحت 200,000 توكن إدخال، السعر هو $2 للإدخال و$6 للإخراج. وفوق هذا الحد، يُعاد تسعير الطلب بالكامل إلى $4 للإدخال و$12 للإخراج. ليس التوكنات الزائدة — بل الطلب بأكمله. استدعاء بـ 210,000 توكن يكلّف ضعف ما يكلّفه استدعاء بـ 199,000 توكن، مقابل 11,000 توكن إضافية.
مع نافذة سياق تبلغ 500,000 رمز على كلا الطرازين، من السهل السقوط من ذلك الجرف. تشغيل الوكلاء ذوي السياق الطويل ومطالبات المستودع بالكامل هي بالضبط أعباء العمل التي تم ضبط Grok 4.7 من أجلها، مما يعني أن أفضل حالة استخدام للنموذج هي أيضًا الأكثر عرضة للتسبب في المضاعفة. إذا كنت تنقل العمل إلى Grok 4.7 لأنه يتعامل مع الجلسات الوكيلية الطويلة بشكل أفضل، فضع ميزانية لإعادة التسعير قبل نقل العمل، وليس بعده.
هناك أيضًا مستوى سرعة ينبغي أخذه في الاعتبار. تُصدر SpaceXAI نسخة سريعة من Grok 4.7 تضاعف سرعة الإخراج وتضاعف السعر المعلن. هذه مقايضة مشروعة للبرمجة التفاعلية، ومقايضة سيئة للعمل بالدفعات — فالمهمة نفسها بالجودة نفسها تكلّف ضعف الثمن مقابل توفير في الوقت الفعلي لا يراقبه أحد.
الترحيل من Grok 4.6 دون إعادة كتابة
الخبر السار عمليًا هو أن هذا استبدال لطراز، وليس ترحيلًا لمنصة. كلا الطرازين يستقبلان النصوص والصور ويعيدان نصًا، وكلاهما يستخدم مستويات جهد الاستدلال نفسها من low إلى xhigh، وشكل الطلب هو ذاته الذي تقدمه SpaceXAI منذ Grok 4.5. الكود الذي يستدعي Grok 4.6 مع معامل effort لا يحتاج إلى إعادة هيكلة لاستدعاء Grok 4.7.
النقطة التي لا يكون فيها التبديل مجانيًا هي التقييم. تتركز مكاسب Grok 4.7 في التشغيلات الوكيلية الطويلة، لذا فإن مجموعة اختبارات مبنية على مطالبات قصيرة أحادية الدور لن تُظهر لك شيئًا تقريبًا — سترى التحسن بحجم CursorBench وتستنتج أن الترقية لم تستحق الجهد، بينما تكمن الحجة لصالحها في مهام لا تختبرها مجموعتك أبدًا. القياس الذي سيحسم الأمر فعليًا هو إتمام المهام عبر عمل متعدد الخطوات: التصحيحات المقبولة، والانحدارات المُدخلة، واستدعاءات الأدوات لكل مهمة مكتملة، ومدى تكرار حاجة التشغيل إلى إنقاذ بشري. تلك هي المحاور التي تشير إليها أرقام البائع نفسه، وهي التي لا يغطيها أي معيار قياس منشور لقاعدة الشيفرة الخاصة بك.
الإسهاب هو الشيء الثاني الذي يجب قياسه. النموذج الذي يُصدر 240 مليون رمز على فهرس قياسي سيُصدر رموزًا أكثر على عبء العمل الخاص بك مما فعل سابقه، وبسعر 6 دولارات لكل مليون مخرَج، يمكن أن يمحو بهدوء قيمة ترقية بنفس السعر. تتبَّع رموز المخرَج لكل مهمة مكتملة لمدة أسبوع قبل أن تلتزم.

أي واحد يجب الاتصال به؟
القرار بسيط حقًا، وهو أمر غير معتاد في مقارنة النماذج. يظل Grok 4.6 الخيار الصحيح لحركة المرور قصيرة الدور والحساسة للتكلفة: الدردشة، والتصنيف، والتلخيص، ومساعدة البرمجة على نطاق المحرر، حيث تكون مكاسب Grok 4.7 صغيرة وإسهابه عبئًا. أما Grok 4.7 فهو الخيار الصحيح لعبء العمل الذي بُني من أجله — البرمجة الوكيلية طويلة الأفق والعمل في الطرفية حيث تستمر المهمة لساعات، ويكون التحقق الذاتي هو الفرق بين مهمة منجزة ومهمة عالقة.
تشغيل كليهما ليس حلًا وسطًا هنا، بل هو الجواب الصحيح، وبتكلفة زهيدة.Grok 4.6 موجود في كتالوج OrcaRouter بسعر SpaceXAI المعلن مع تمرير هامش ربح 0% مباشرةً، لذا فإن بطاقة السعر $2/$6 أعلاه هي ما تدفعه — ولأننا نمرّر سعر المزوّد المعلن بدلًا من إضافة هامش ربح عليه، فإن أي تغيير في سعر البائع يصبح ساريًا لدينا في اليوم نفسه الذي يحدث فيه. مفتاح API واحد يغطي Grok 4.6 وأكثر من 200 طراز آخر، لذا فإن نقل حركة المرور بينها حسب المهمة يصبح تغييرًا في الإعدادات لا عقدًا ثانيًا. إذا أردت تجربة Grok 4.7 على مسار إنتاجي قبل أن تثق به، فإن النمط الأكثر أمانًا هو إبقاء الاحتياط على Grok 4.6 — وهو طراز يمكنك توجيه الطلبات إليه اليوم — والسماح بالتحويل التلقائي عند الفشل عبر المزوّدين بإعادة الطلب عندما يسيء الطراز الجديد التصرف.

ماذا تشاهد بعد ذلك
سيحسم أمران هذه المقارنة، ولم يحدث أي منهما بعد. الأول هو إعادة إنتاج مستقلة لنتيجة Terminal-Bench 4.0 — فنسبة 38% قفزة كبيرة بما يكفي ليعيد شخص ما تشغيله، وإذا ثبتت، فإن الحجة لصالح Grok 4.7 في خطوط أنابيب الوكلاء قوية على أساس الجدارة وليس التسويق. والثاني هو بقية خارطة طريق Grok: فقد أعلنت SpaceXAI علنًا عن ترتيب Grok 4.8 وGrok 4.9 وGrok 5 بعد هذا الإصدار، وكان عمر Grok 4.6 نفسه حوالي خمسة أسابيع. إن اعتماد Grok 4.7 كافتراض منصة طويل الأجل سيكرر الخطأ الذي ارتكبته الفرق مع Grok 4.5.
في الوقت الحالي، الترقية بالسعر نفسه حقيقية واتجاه المسار واضح. الرقم الذي ينبغي التمسك به هو أن $2/$6 كان يشتري لك نموذجًا يتضاعف تقريبًا في المهام الطرفية الطويلة الأفق وبالكاد يتحرك في أي مكان آخر — وهذا ادعاء محدد ومفيد وقابل للتحقق وليس قفزة جيلية.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
