
Gemini 3.5 Transcribe Live مقابل Gemini 3.5 Transcribe: أي نقطة نهاية يجب أن يستدعيها تطبيقك
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123الذكاء49البرمجة
عندما أطلقت Google عائلة Gemini 3.5 Transcribe في 26 أغسطس 2026، أصدرت نموذجين يتشاركان الاسم والرسالة لكنهما مصممان لمراحل مختلفة من المحادثة: Gemini 3.5 Transcribe Live، نقطة النهاية للبث المباشر التي تُقدَّم عبر واجهة برمجة التطبيقات Live API، وGemini 3.5 Transcribe، نقطة النهاية للتسجيل المسبق التي تُقدَّم عبر واجهة برمجة التطبيقات Interactions API. الخطأ الذي ترتكبه معظم الفرق في الأسبوع الأول هو التعامل مع هذا الأمر على أنه نموذج واحد بزرين. إنهما وحدتا SKU مختلفتان — واجهات برمجة تطبيقات مختلفة، وأسعار مختلفة، وحدود قصوى مختلفة — ومقارنة الدقة بينهما ليست منصفة، لأنهما تُقيَّمان تحت قواعد مختلفة. يضع هذا المقال النموذجين جنبًا إلى جنب بحيث يعتمد القرار على عبء العمل لديك، وليس على لوحة الصدارة.
الاثنان في لمحة
• API — يعمل Gemini 3.5 Transcribe Live على Live API (WebSocket، بث ثنائي الاتجاه)، بينما يعمل Gemini 3.5 Transcribe على Interactions API (إدخال ملف، وإخراج تفريغ نصي).
• الوظيفة — المحادثة المباشرة، التسميات التوضيحية، وكلاء الصوت مقابل الاجتماعات، سجلات المكالمات، الصوت المؤرشف.
• {{1}}الدقة{{/1}} — {{2}}4.0% WER للبث المباشر{{/2}} مقابل {{3}}2.6% WER لغير البث المباشر{{/3}}، وفقًا لـ {{4}}Artificial Analysis{{/4}}، كما استشهدت به {{5}}{{KEEP}}Google{{/KEEP}}{{/5}}؛ أنظمة قياس مختلفة، ولا يمكن المقارنة بينها مباشرةً.
• زمن الاستجابة — نص نهائي بعد 0.40 ثانية من انتهاء الكلام مقابل المعالجة المجمعة لملف كامل.
• الجلسة — حد أقصى 10 دقائق لكل جلسة مباشرة مقابل ملفات تصل إلى 60 دقيقة (30 دقيقة مع تفعيل تمييز المتحدثين والطوابع الزمنية).
• المتحدثون — لا يوجد على جانب البث المباشر مقابل ما يصل إلى ثلاثة متحدثين مع طوابع زمنية على مستوى الكلمة على الجانب المسجّل مسبقًا.
• السعر — حوالي 0.009 دولار للدقيقة بمعدل مختلط مقابل حوالي 0.005 دولار للدقيقة بمعدل مختلط.

قرار البنية المعمارية: Interactions API أو Live API
يقع كلا الطرازين ضمن عائلة Gemini Audio من Google، وكلاهما في معاينة عامة. يبدأ الفرق من طبقة النقل. يفتح gemini-3-5-transcribe-live اتصال WebSocket ويُبقيه مفتوحًا: يتدفق الصوت الخام باستمرار — الإطار الشائع هو 16 كيلو هرتز أو 24 كيلو هرتز بقطع PCM بترميز 16 بت — ويعيد النموذج نصوصًا جزئية أثناء التحدث، ثم نصًا نهائيًا لكل جملة كلامية عند انتهاء الكلام. يأخذ gemini-3-5-transcribe ملفًا كاملًا، يعالجه، ويعيد النص النهائي مع إسناد المتحدث والطوابع الزمنية على مستوى الكلمة.
قرار النقل يقود كل شيء آخر. إذا كان منتجك يعرض الكلمات كما تُنطق — ترجمة فورية مباشرة، أو وكيل صوتي يقرأ النية في منتصف الجملة، أو مساعد مكالمات يتصرف بينما المكالمة مباشرة — فأنت على المسار المباشر. {{1}}إذا كان منتجك يُنتج سجلًا — ملاحظات اجتماع، أو سجل مكالمات، أو أرشيفًا — فأنت على مسار التفاعلات.{{/1}} {{2}}الالتباس هو أن كلاهما يُنتج نصًا؛ الفرق هو ما إذا كان النص حالة زمنية حقيقية أم أثرًا نهائيًا.{{/2}}
الدقة: ضريبة البث حقيقية
مؤسسة Artificial Analysis المستقلة للقياس، التي تستشهد Google بأرقامها في منشور الإطلاق، تقيس متوسط معدل خطأ في الكلمات بنسبة 4.0% لواجهة البث و2.6% للواجهة غير البثية. وفي معيار FLEURS متعدد اللغات، تذكر Google 5.50% للبث مقابل 5.04% لغير البث. ويضع رقم 2.6% أداة Gemini 3.5 Transcribe في المرتبة #5 على لوحة صدارة WER الخاصة بـ AA عند الإطلاق، خلف ElevenLabs Scribe v2 بنسبة 2.2% وMAI-Transcribe-1.5 من Microsoft بنسبة 2.4% — وهي قياسات AA، لا ادعاءات Google.
الرقم الخاص بالبث المباشر ليس نسخة أسوأ من نفس الاختبار. إنه نمط مختلف: يلتزم النموذج بالكلمات قبل أن يسمع نهاية الجملة، ويدفع ثمن ذلك. لا تختر بين الاثنين بناءً على الدقة وحدها، لأن الفجوة قد تنقلب في أي عبء عمل معين. اختر بناءً على القيود: نقطة نهاية البث المباشر لها حد أقصى للجلسة يبلغ 10 دقائق، ولا تدعم فصل المتحدثين، ولا توفر طوابع زمنية؛ بينما تعالج نقطة نهاية التسجيل المسبق ملفات تصل إلى ساعة، وتنسب الكلام إلى ما يصل إلى ثلاثة متحدثين، وتُرجع طوابع زمنية على مستوى الكلمة. إذا كان تطبيقك يحتاج إلى تسميات المتحدثين، فإن نموذج البث المباشر ببساطة لا يمكنه القيام بالمهمة، مهما كانت قيمة WER الخاصة به.

ما يتشاركونه
يتشارك الطرفان محرك "النسخ الذكي"، وفي الميزات المشتركة يكون الاختيار بينهما محايدًا:
• أكثر من 85 لغة مع اكتشاف تلقائي، بما في ذلك تبديل اللغة في منتصف البث على المسار المباشر (Live path).
• تنظيف عدم الطلاقة — إسقاط الحشوات، وحل التصحيحات الذاتية (عبارة "الثلاثاء — لا، الأربعاء" تُعامل كاليوم المصحح).
• التنسيق التلقائي — علامات الترقيم وحالة الأحرف وبنية الفقرات المطبقة على المخرجات.
• مفردات مخصصة — حتى 1,000 مصطلح للمصطلحات المتخصصة وأسماء المنتجات، مع توصية وثائق Google بحوالي 100 مصطلح للحصول على أفضل النتائج.
تحذير واحد ينطبق على كليهما: التنظيف «الذكي» الذي يجعل المخرجات قابلة للقراءة هو قرار تصميمي يضحي بالدقة الحرفية. يتم تنعيم العبارات غير السلسة؛ فالنص هو قراءة النموذج للقصد، وليس سجلاً قضائياً. للحصول على نصوص حرفية دقيقة، ستحتاج إلى خيار حرفي عند توفره، وسيتعين عليك التحقق من السلوك على صوتياتك الخاصة في جميع الأحوال.
تكلفة الدقيقة: البريميوم المباشر
تقوم Google بتسعير الصوت بالرموز (tokens) بمعدل 25 رمزًا صوتيًا في الثانية، مع إخراج يقارب 175 رمزًا نصيًا في الدقيقة من النص المكتوب. وبأسعار القائمة، تبلغ التكلفة المختلطة لكل دقيقة من الصوت حوالي 0.005 دولارًا لـ gemini-3-5-transcribe وحوالي 0.009 دولارًا لـ gemini-3-5-transcribe-live — حيث يبلغ سعر الإدخال 2 دولار مقابل 3.50 دولار لكل مليون رمز، وسعر الإخراج 12 دولارًا مقابل 21 دولارًا لكل مليون رمز. وكلاهما يتوفر على خطة مجانية اليوم.
الاشتراك المميز يمنحك المسار اللحظي، لا دقة أعلى: تدفع نحو 80% أكثر لكل دقيقة مقابل نقطة البث المباشر، وتُنتِج نصوصًا بمعدل خطأ كلمات (WER) أعلى. هذا هو الإطار الصادق. النموذج المسجَّل مسبقًا أرخص وأكثر دقة في الوقت نفسه؛ أما نموذج البث المباشر فيوجد لأن بعض المنتجات لا يمكنها انتظار اكتمال الملف.
أي نقطة نهاية يجب أن تبني عليها
• التسميات التوضيحية والترجمات الفورية — Gemini 3.5 Transcribe Live، وتحقق من حد عدم وجود الطوابع الزمنية إذا كنت بحاجة إلى مخرجات متوافقة زمنيًا.
• وكلاء الصوت — Gemini 3.5 Transcribe Live لتحديد النية في منتصف الجملة؛ خطط مع مراعاة الحد الأقصى البالغ 10 دقائق للجلسات الطويلة.
• الاجتماعات، المقابلات، الأرشفة — Gemini 3.5 Transcribe، لمعدل خطأ الكلمات البالغ 2.6%، وإسناد المتحدثين، والطوابع الزمنية على مستوى الكلمة.
• تحليلات ما بعد المكالمة — Gemini 3.5 Transcribe للتسجيل النهائي؛ وGemini 3.5 Transcribe Live فقط إذا كان يجب إجراء التحليل أثناء المكالمة.
• صوت مستمر طويل — Gemini 3.5 Transcribe، لأن ملفًا مدته 60 دقيقة أفضل من لصق جلسات مباشرة مدتها عشر دقائق يدويًا.

الطبقة التي تعلو النص الحرفي
لا يُعد أيٌّ من النموذجين شيئًا تستضيفه OrcaRouter — فنحن لا نوجّه تحويل الكلام إلى نص اليوم، وستستدعي واجهة برمجة تطبيقات Google مباشرةً لأيٍّ من الطرفين. ما تفعله طبقة التوجيه في خط الصوت هو أن تقع فوق النص الحرفي: المُلخِّص، ومستخرِج الكيانات، ونموذج عناصر الإجراءات الذي يحوّل التدفق إلى قرار. تلك الطبقة هي حيث تُثبت OrcaRouter قيمتها — واجهة برمجة تطبيقات واحدة عبر أكثر من 200 نموذج بسعر المزوّد المعلن دون أي زيادة، مع تجاوز تلقائي للفشل بين المزوّدين، ولغة توجيه خاصة (DSL) تجمع عدّة نماذج في استدعاء واحد. اختر نقطة نهاية النسخ حسب عبء العمل، ثم شغّل النموذج الذي يقرأ النص الحرفي خلف مفتاح واحد.
خلاصة القول
إن Gemini 3.5 Transcribe Live وGemini 3.5 Transcribe من العائلة نفسها لكنهما منتجان مختلفان. اختر Live عندما يجب أن يكون النص موجودًا قبل انتهاء المحادثة، ويمكنك قبول جلسة مدتها 10 دقائق، دون تسميات للمتحدثين، ودون طوابع زمنية. اختر Transcribe عندما يكون المخرج سجلًّا وتكون الدقة والإسناد أهم من السرعة — فهو أرخص وأدق وأقل تقييدًا بكثير. الإجابة الخاطئة الوحيدة هي افتراض أن نقطة نهاية واحدة تؤدي الوظيفتين.
