بطاقة عنوان رئيسية لـ {{1}}Gemini 3.8 Live Extended Thinking{{/1}} مقابل {{2}}Gemini 3.8 Live{{/2}}، تُظهر النموذجين مفصولين بفارق تكلفة صوتية بالساعة يبلغ 4 أضعاف، {{3}}$3.50{{/3}} مقابل {{4}}$0.84{{/4}}.
Guides & Insights

Gemini 3.8 Live Extended Thinking مقابل Gemini 3.8 Live: دفع 4 أضعاف مقابل النقاط الـ38 التي تهم

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

نموذجان، وإطلاق واحد، وبطاقة أسعار واحدة، وقرار تخطئ فيه معظم الكتابات في الاتجاه نفسه. Gemini 3.8 Live Extended Thinking و Gemini 3.8 Live طُرحا معًا في 15 سبتمبر 2026، وكلاهما مبني على Gemini 3 Pro، وكلاهما يتعامل مع 97 لغة مع التبديل التلقائي في منتصف المحادثة، وكلاهما يقبل إدخالًا بصريًا شبه فوري، وكلاهما يضع علامة مائية على الصوت المُنشأ باستخدام SynthID. على مؤشر Speech to Speech Index المركّب الذي تنشره Artificial Analysis، يفصل بينهما 6.6 نقاط — 82.6 مقابل 76.0. وعلى تكلفة الصوت بالساعة التي تقيسها اللوحة نفسها، يفصل بينهما ما يزيد قليلًا على أربعة أضعاف.

لا هذا ولا ذاك هو الرقم الذي ينبغي أن يحدد معماريتك. الرقم الذي ينبغي هو 38: الفجوة بينهما على τ-Voice، المكوّن الوكيلي لإكمال المهام، حيث تحل النسخة الاستدلالية 68.6% من سيناريوهات خدمة العملاء المُحاكاة، بينما تحل النسخة القياسية 30.1%. أنت لا تختار بين نموذج جيد ونموذج أفضل. أنت تختار بين واجهة حوارية ونظام استدلالي يصدف أنه يتحدث، والفرق السعري هو أقل ما يثير الاهتمام في ذلك الاختيار.

مفترق الأسعار، بالوحدات التي تتم محاسبتك بها فعليًا

ابدأ بالفاتورة، لأنها الجزء الذي يفهمه الناس بشكل صحيح ثم يبالغون في وزنه. يقدّم كلا النموذجين نفس السعر المنشور عبر Live API: 0.005 دولار لكل دقيقة من إدخال الصوت و0.018 دولار لكل دقيقة من إخراج الصوت، وفي ما يتعلق بـ Extended Thinking، فإن رموز الإخراج تلك تشمل التفكير. نفس البطاقة، نفس الأسعار، ولا فئة مميزة منفصلة للاستدلال.

يظهر التباين بمجرد أن تقيس العمل بدلًا من الدقائق. عمود التكلفة لكل ساعة من الصوت المُدخَل لدى Artificial Analysis — أي تكلفة إكمال مجموعة فرعية ثابتة مكوّنة من 40 سؤالًا من Big Bench Audio، بعد تسويتها إلى رقم بالساعة — يضع النموذجين في فئتين مختلفتين تمامًا:

Gemini 3.8 Live Extended Thinking (High) — 3.50 دولار لكل ساعة من الصوت المُدخل، وفقًا لقياس Artificial Analysis نفسه

Gemini 3.8 Live — 0.84 دولار في الساعة، وهو أدنى معدل مدفوع على تلك اللوحة

• GPT-Live-1 (خلفية Astra، جهد متوسط) — 5.83 دولار في الساعة، لذا تظل النسخة الاستدلالية أقل سعرًا من النموذج الذي تتفوق عليه بنحو 40%

Grok Voice Think Fast 2.0 High — 4.80 دولار في الساعة

• GPT-Realtime-2.1 High — 10.75 دولار في الساعة

هذا هو التشعّب: أربعة أضعاف تكلفة الصوت لكل ساعة، وبالسعر المنشور نفسه لكل دقيقة، لأن نسخة الاستدلال تستهلك توكنات أكثر لأداء القدر نفسه من الاستماع. مبلغ $0.84 الخاص بالطراز القياسي ليس خصمًا، بل هو الحد الأدنى في اللوحة بأكملها.

ما الذي تشتريه الـ38 نقطة

فكّك المركّب، وسيتوقف النموذجان عن الظهور كزوج:

مؤشر الكلام إلى الكلام — Gemini 3.8 Live Extended Thinking (High) 82.6 مقابل Gemini 3.8 Live 76.0

الأداء الوكيلي (إنجاز مهام τ-Voice) — ‏68.6% مقابل 30.1%‏

الاستدلال الكلامي (Big Bench Audio) — 98% مقابل 92%

ديناميكيات المحادثة — 91.9% مقابل 96.1%

تفضيل الساحة (Elo) — 990 مقابل 1083

معدل نجاح المهام — 89.1% مقابل 93.2%

الوقت حتى أول صوت — 1.35 ث مقابل 1.18 ث

تكلفة الساعة من الصوت المُدخل — ‏$3.50 مقابل $0.84

اقرأ ذلك بصدق، وسيفوز النموذج الأرخص في أربعة من البنود الثمانية. فهو أسرع في الوصول إلى أول صوت، وتفضّله الساحة، وأكثر احتمالاً لإكمال مهمة سطحية، ويُقيَّم بشكل أفضل في ديناميكيات المحادثة — وهذا الأخير ليس جائزة ترضية، لأن ديناميكيات المحادثة هي ما يلاحظه المتصل. ما لا يستطيع فعله هو إنهاء مهمة ذات خطوات. إن 31.1% مقابل 68.6% هي أكبر فجوة منفردة في أي مكان في هذا الإصدار، وهي تقع على المحور الوحيد الذي يفصل الوكيل عن الواجهة.

ملاحظتان على تلك الصفوف. قيمة تفضيل الساحة داخل المؤشر مُجمّدة عند النقطة التي يصبح فيها النموذج مؤهلًا للنشر، لذا فهي لقطة وليس تصنيف إيلو متجددًا — اقرأها كتقييم عند نقطة زمنية محددة وليس كمخطط Speech Agent Arena الحي. كما أن قمة لوحة τ-Voice متقاربة: تتقدّم نسخة الاستدلال بنسبة 68.6% على GPT-Live-1 عند 67.9% (خلفية Astra، جهد متوسط) بمقدار 0.7 نقطة، مع وجود GPT-Live-1 (Sol، جهد منخفض) عند 59.3% وGrok Voice Think Fast 2.0 High عند 56.5% في الخلف. تفوّق 0.7 نقطة على GPT-Live-1 يقع ضمن نطاق الضجيج. أما فجوة 38 نقطة داخل هذا الثنائي فليست كذلك.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and Gemini 3.8 Live across six dimensions: Speech to Speech Index 82.6 vs 76.0, agentic performance on tau-Voice 68.6 percent vs 30.1 percent, speech reasoning on Big Bench Audio 98 percent vs 92 percent, arena preference Elo 990 vs 1083, time to first audio 1.35 seconds vs 1.18 seconds, and cost per hour of input audio $3.50 vs $0.84.

الـ4x الأخرى: ما الذي تكلفك إياه طبقة الاستدلال في الكود

يوجد تفريع ثانٍ في هذا الإصدار، وهو لا يظهر على أي لوحة صدارة. النموذجان ليسا قابلين للتبديل المباشر، لأن نسخة الاستدلال تغيّر العقد الذي يجب على عميلك الالتزام به.

على النموذج القياسي، Gemini 3.8 Liveيتصرف بالطريقة التي يتوقعها عميل Live API: تعمل استدعاءات الأدوات وواجهة API في الخلفية بينما يواصل النموذج التحدث، وturnComplete: trueلا يزال يحدّد نهاية الدور. لا يوجد إعداد لمستوى التفكير لاختياره، لأنه لا يوجد شيء منفصل لتهيئته — يجيب النموذج، وعندما ينتهي من الإجابة، يكون الدور قد انتهى.

في Gemini 3.8 Live Extended Thinking، تتغير ثلاثة أمور في آنٍ واحد:

استدعاءات الدوال غير متزامنة دائمًا. إعلان أداة حاجبة لا يصطف بأدب — بل يعيد خطأً صارمًا. أي مخطط أداة كتبته للنموذج القياسي يجب إعادة إعلانه كغير حاجب.

حقل حالة جديد يحمل الحالة الفعلية. على العملاء قراءة interaction_status بدلاً من الوثوق بـ turnComplete: يقرأ الحقل IN_PROGRESS بينما لا يزال النموذج يفكّر أو لا تزال أداة قيد التشغيل، ولا يستقر إلا على IDLE عند اكتمال المهمة بأكملها. قد ينتهي الدور بينما لم تنتهِ المهمة بعد.

عمق التفكير مِقبض. يكشف النموذج عن مستويات استدلال قابلة للضبط — منخفض، متوسط، وعالٍ — والأرقام 82.6 و68.6 على اللوحة هي (عالٍ) الإعداد. الانتقال إلى منخفض يغيّر كلاً من الجودة وفاتورة الرموز، ولا شيء في المؤشر يخبرك بما يكلّفك المنخفض في إنجاز المهمة.

تلك النقطة الثالثة هي فخ الترحيل. لأن Extended Thinking يجيب بالطريقة نفسها على مستوى الاتصال كما يفعل النموذج القياسي إلى أن يتعلق الأمر باستدعاء أداة، يمكن لفريق أن يستبدل معرّف النموذج، ويرى عرضًا توضيحيًا يعمل، ثم لا يكتشف العقد غير المتزامن في الإنتاج إلا عندما تُرجع أداة حجز خطأً بدلًا من نتيجة. خصّص ميزانية لإعادة هيكلة العميل إلى جانب معدل الصوت 4×؛ في تكامل ناضج، تكون هذه هي التكلفة الأكبر بين التكلفتين.

أي واحد يطلبه عبء العمل لديك فعليًا؟

الطريقة الواضحة لاتخاذ القرار هي أن تسأل ما الغرض من الجلسة، لا كم تريدها أن تكون ذكية.

اختر Gemini 3.8 Liveعندما تكون المحادثة هي المُخرَج. الإجابة، والحفاظ على سياق الحديث، وتدوين رسالة، وتأهيل متصل، وكونه لطيفًا وسريعًا ورخيصًا. بتكلفة 0.84 دولار لكل ساعة من الصوت المُدخَل، إنه أرخص نموذج صوتي كفء يطرحه أي طرف حاليًا، وهو مفضّل في الساحة، وأكثر موثوقية في المهام الضحلة، وأسرع بـ170 مللي ثانية للوصول إلى الصوت الأول — فرقٌ يشعر به المتصل. الشيء الوحيد الذي يجب تقبّله هو السقف: نسبة 30.1% في إكمال المهام متعددة الخطوات تعني أنه لن يُنجز عملًا له خطوات، ولا أي قدر من هندسة التوجيهات يغيّر ذلك الرقم.

اختر Gemini 3.8 Live Extended Thinking عندما تكون للجلسة مهمة عملية. حجز موعد، أو تغييره، أو إلغاؤه، أو حل مشكلة في حساب، أو إرشاد متصل عبر عملية متعددة الخطوات أثناء انتظاره. هذا هو خط الـ38 نقطة، وهو يستحق 3.50 دولارات في الساعة — وهو، لاحظ، لا يزال أرخص من كلا النموذجين اللذين يتفوق عليهما في الدرجة المركّبة. وتحصل أيضًا على سلوك السرد الذي يجعل الانتظار محتملًا: هذا النموذج يستنتج ويتحدث في الوقت نفسه، فبدلًا من الصمت أثناء بحثه عن معلومة ما، يسمع المتصل "دعني أتحقق من ذلك…" والتقدّم أولًا بأول. إنها المشكلة نفسها التي تحلّها معماريات الازدواج الكامل عبر عدم إيقاف الصوت أبدًا؛ أما جواب Google فهو مواصلة الكلام أثناء العمل.

سطران إضافيان يستحقان الموازنة. تُبلّغ Google أيضًا عن نسبة 35.1% لنموذج Extended Thinking على لوحة الصدارة τ³-Banking الخاصة بـ Sierra، مقابل 32.0% لـ GPT-Live-1 Astra — وهو رقم مُبلَّغ عنه من البائع دون أي قراءة مستقلة تسنده، ومقلق من حيث القيمة المطلقة، لأن 35.1% تعني أن أفضل نموذج على تلك اللوحة يفشل في نحو محاولتين من كل ثلاث محاولات واقعية لمهام مصرفية. كما أن المركز الثاني للنموذج القياسي في Speech Agent Arena، الذي تستشهد به Google في موادها الخاصة، نتيجة حقيقية على لوحة مختلفة تقيس التفضيل بدلًا من إنجاز المهام. كلا القولين صحيح. معًا، يقولان إن النموذج الرخيص بارع جدًا في التحدث إليه، وإن النموذج المكلف هو الوحيد بين الاثنين الذي يمكن إسناد العمل إليه.

تشغيل كليهما، دون تكاملين

الاعتراض العملي على كل هذا هو أن الاختيار حسب عبء العمل يعني صيانة مسارين. لكن لا يجب أن يكون الأمر كذلك. كلا البديلين يقعان أمام نفس فئة الواجهة الخلفية — فتنفيذ الأدوات في الخلفية والتخطيط متعدد الخطوات يُختزلان إلى استدعاءات عادية لنموذج نصي — وهذه الطبقة هي حيث يكمن تباين تكلفتك وحيث يكون التبديل رخيصًا.

يتيح OrcaRouter 190 نموذجًا من مفتاح واحد بسعر قائمة المزوّد دون أي هامش ربح، لذا يصبح أي تغيير في سعر المورّد ساريًا لدينا في اليوم نفسه بدلًا من تجديد العقد التالي. بالنسبة إلى مكدس يوجّه بين طبقة محادثة رخيصة وطبقة استدلال مكلفة، فإنّ الخاصيتين المهمتين هما أنّ هدف التفويض يمكن تبديله على حركة المرور المباشرة دون المساس بتكامل الصوت، وأنّ التحويل التلقائي عند الفشل يبقي الجلسة حية عندما يقع خطأ في نظام خلفي أو تنتهي مهلته. وللتوضيح بشأن ما نستضيفه وما لا نستضيفه: إنّ نقطتي نهاية Gemini 3.8 Live وGemini 3.8 Live Extended Thinking ليستا على الموجّه الخاص بنا — فهما تأتيان من واجهة برمجة التطبيقات الخاصة بجوجل، في Gemini API وLive API وGoogle AI Studio. ونماذج النصوص التي تُحيل إليها هذه الوكلاء عملها في كثير من الأحيان هي، ومن بينها Gemini 3.8 Flash.

أين يقع كل نموذج على اللوحة

التُقطت اللقطة أدناه في 16 سبتمبر 2026، وجاء في أعلى Speech to Speech Index ما يلي:

Gemini 3.8 Live Extended Thinking (High) — 82.6، المركز الأول

• GPT-Live-1 (واجهة Astra الخلفية، جهد متوسط) — 81.5

• Grok Voice Think Fast 2.0 High — 81.3

• {{1}}GPT-Live-1 (خلفية Sol، جهد منخفض) — 80.1

Gemini 3.8 Live — 76.0، المركز الخامس

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

ملاحظة بشأن التسمية أثناء قراءتك لتلك القائمة: (High)اللاحقة الملحقة بهذا الطراز في التغطية هي تسمية لإعداد جهد الاستدلال، وليست إصدارًا منفصلًا. وهي العُرف نفسه الذي تتبعه اللوحة مع Grok Voice Think Fast 2.0 High وGPT-Realtime-2.1 High.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 at 81.5, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

ما الذي لا يزال غير مُودَع؟

هناك أمر واحد بشأن هذا الثنائي يسهل إساءة قراءته، لذا يجدر قوله بوضوح: لا يُعد أي من النموذجين متاحًا بشكل عام بالمعنى التعاقدي، رغم أن كليهما مُسعَّران وموثَّقان.

يحصل المطورون على Gemini 3.8 Live في Gemini API وLive API وGoogle AI Studio تحت المعرّف gemini-3.8-live؛ وتحصل المؤسسات على معاينة خاصة في Gemini Enterprise، مع إدراج Gemini Enterprise for Customer Experience كقادم قريبًا؛ ويحصل المستهلكون عليه في Search Live. Gemini 3.8 Live Extended Thinking يتضمن نفس واجهة المطورين تحت gemini-3.8-live-extended-thinking، بالإضافة إلى مسار أوسع للمستهلكين — Gemini Live، وDocs Live لمشتركي Google AI Pro وUltra، وGmail Live وKeep Live لجميع مشتركي Google AI. ويُدرج عملاء Workspace من الشركات كقادمين قريبًا.

ما ينقص هو ما تحتاجه المؤسسة قبل أن تضع خط إيرادات على هذا: التزام بالتوافر العام، ورقم منشور لزمن التشغيل، وسعرٌ وعدت Google بالحفاظ عليه. الأسعار منشورة، ومن عادة أسعار المعاينة أن تتغيّر. ابنِ نموذجًا أوليًا الآن، وخطّط للترحيل، ولا توقّع على هدف توافر لم يُعطَ لك.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

القرار الذي يعرضه هذا الزوج في الواقع أضيق مما يجعله الفهرس يبدو، وهو ليس سلّمًا للجودة. فإذا كانت مهمة وكيلك هي الحديث، فإن النموذج الرخيص ليس تنازلًا — بل هو المنتج الأفضل بسعر أقل، ومعدل أرخص بأربع مرات مكافأة لا حجة. وإذا كانت مهمة وكيلك هي إنجاز شيء ما، فإن نسخة الاستدلال هي الوحيدة من بين الاثنتين التي يمكن إسناد المهمة إليها أصلًا، و3.50 دولار في الساعة خطأ تقريب لا يُذكر مقابل حجز يفشل لولا ذلك. والخطأ الذي يجب تجنبه هو تقسيم الفرق: الدفع مقابل عمق الاستدلال على عبء عمل لم يحتج يومًا إلا إلى محادثة جيدة، وهو ما يحدث عندما يقرأ فريق فجوة المركّبة البالغة 6.6 نقطة ولا يمرر الشاشة إلى الأسفل أبدًا ليرى الـ38.