بطاقة عنوان رئيسية لـ 'Gemini 3.5 Transcribe مقابل Whisper Large v3 Turbo' مع عنوان فرعي 'هل تحتاج الخط الأساسي إلى استبدال؟'، تعرض بطاقة API مُدارة على اليسار تحمل اسم Gemini 3.5 Transcribe بمعدل WER غير متدفق 2.6% وبطاقة مفتوحة الأوزان على اليمين تحمل اسم Whisper Large v3 Turbo بمعدل LibriSpeech النظيف 2.1% مع شارة MIT ووسم 809M، وشعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

Gemini 3.5 Transcribe مقابل Whisper Large v3 Turbo: هل يحتاج خط الأساس إلى الاستبدال؟

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Whisper Large v3 Turbo هو النموذج الذي تُحيل إليه عبارة "speech-to-text" افتراضيًا في جزء كبير من الصناعة، وGemini 3.​5 Transcribe هو أول نموذج نسخ من Go​ogle يُطرح صراحةً كمنافس لذلك المعيار الأساسي بدلًا من كونه واجهة برمجة تطبيقات عامة للكلام. يُعيد Gemini 3.​5 Transcribe، المتاح في المعاينة العامة منذ 26 أغسطس 2026، صياغة النسخ كمهمة استدلال — فهو يحل التصحيحات الذاتية، ويُنسق المخرجات، وينسب المتحدثين، ويستدعي نماذج G​emini الأخرى من تلقاء نفسه. Whisper Large v3 Turbo هو تقطير Ope​nAI لـ Whisper Large-v3 بعدد 809 ملايين معامل، مرخّص برخصة MIT، ويمكن استضافته ذاتيًا، ويدعم 99 لغة، وهو أسرع بنحو أربع إلى ثماني مرات من النموذج الذي قُطّر منه اعتمادًا على العتاد. أحدهما طبقة ذكاء مُدارَة فوق الصوت؛ والآخر مكوّن مجاني معروف جيدًا يمكنك تشغيله أينما تشاء. السؤال الذي وُجدت هذه الصفحة للإجابة عنه أكثر تحديدًا وفائدةً من سؤال «أيهما أفضل»: متى يتوقف المعيار الأساسي عن كونه جيدًا بما يكفي؟

خط الأساس، في حال نسيت مدى جودته

يستحق Whisper Large v3 Turbo مكانته الافتراضية، لذا فإن الحجة المؤيدة له تأتي أولاً:

• يعمل في أي مكان — رخصة MIT، أوزان مفتوحة، قابل للتثبيت على لابتوب، أو وحدة معالجة رسومية واحدة، أو دالة بدون خادم. لا بائع، لا عدّاد، ولا بيانات تغادر شبكتك.

إنها سريعة — فوحدة فك الترميز المقطّرة (32 طبقة تشفير، 4 طبقات فك ترميز، انخفاضًا من 32) تجعلها أسرع بنحو أربع مرات من Whisper Large-v3 على الأجهزة النموذجية، وأكثر على بعضها، مع الحفاظ على معظم دقتها. رقم Ope​nAI الخاص بها هو نحو ثماني مرات على A100.

• يغطي 99 لغة للنسخ، وهي قائمة أوسع من قائمة Gemini 3.5 Transcribe التي تضم أكثر من 85 لغة.

دقتها موثقة جيدًا: 2.1% WER على LibriSpeech test-clean، و4.2% على test-other، و9.1% على Common Voice English — أرقام تم تكرارها عبر المجتمع لسنوات.

النظام البيئي ضخم — faster-whisper، وwhisper.cpp، وتصديرات ONNX، وكل أُطر الاستدلال التي تستخدمها بالفعل. إذا كان بإمكانك تشغيل نموذج، فبإمكانك تشغيل هذا النموذج.

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

بالنسبة للنسخ الجماعي للإنجليزية وما يقاربها على نطاق واسع، يعد Whisper Large v3 Turbo الخيار السائد لأسباب هيكلية لا يمكن لأي فجوة في المعايير أن تتغلب عليها بسهولة: إنه مجاني، وهو ملكك، وهو في كل مكان.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

ما الذي يضيفه Gemini 3.‌5 Transcribe

قيمة المنافس المُدار ليست في أنه يتفوق على خط الأساس في اللغة الإنجليزية النظيفة — فذلك صراع لا تستطيع الأرقام حتى حسمه بشكل نظيف بعد. قيمته هي العمل الذي يحدث فوق الكلمات، وهو ما لا يفعله Whisper صراحةً:

إسناد المتحدث — حتى ثلاثة متحدثين مع طوابع زمنية على مستوى الكلمة، في النموذج الأساسي. يقوم Whisper بنسخ دفق واحد من الكلام؛ وليس لديه مفهوم لمن قال ماذا.

• تنسيق ذكي — إزالة التشويش اللفظي، ومعالجة التصحيحات الذاتية، وتطبيق علامات الترقيم والأحرف الكبيرة. يعيد Whisper الكلمات كما نُطقت، مع كل "آم" وما شابهها.

• مفردات مخصصة — انحياز نحو المصطلحات والهجاء غير المعتاد. لا يمتلك Whisper مثل هذه الآلية؛ يمكنك المعالجة اللاحقة أو الضبط الدقيق.

• استدعاء الدوال — يمكن تسليم النص المُفرَّغ إلى نماذج Gemini أخرى، مما يجعل التفريغ خطوة في خط أنابيب وكيل بدلاً من أن يكون المخرجات النهائية.

• جلسات طويلة — حوالي ساعة من الصوت في تمريرة واحدة (سياق 96K كما ورد في التقارير الصحفية) مقابل حاجة Whisper العملية إلى تقسيم الملفات الطويلة وربطها.

ذلك منتج مختلف. وهو ما تعنيه Go​ogle بمصطلح «النسخ الذكي»، وهو الجزء من المقارنة الذي لا يعتمد على حسابات المعايير.

سؤال الدقة الذي لا يستطيع أحد الإجابة عنه بوضوح بعد.

الأرقام الرئيسية للنموذجين لا تتنافس فعليًا. قياس {{1}}2.6% لمعدل الخطأ في الكلمات دون بث{{/1}} لنموذج Gemini 3.​5 Transcribe هو قياس من Artificial Analysis استشهدت به Go​ogle، ويشمل {{2}}أكثر من 85 لغة{{/2}}. أما {{3}}2.1% في اختبار LibriSpeech test-clean{{/3}} لنموذج Whisper Large v3 Turbo فهو معيار إنجليزي من ورقة التقطير الخاصة بـ Ope​nAI، وقد تمت إعادة إنتاجه على نطاق واسع. مجموعات نصوص مختلفة، وتغطية لغات مختلفة، وبائعون مختلفون. ما يمكن قوله بصدق: في الإنجليزية الواضحة، من المعقول أن يكون النموذج المفتوح الأساسي والنموذج المُدار المنافس في {{4}}نفس المستوى تقريبًا{{/4}}، وميزة النموذج المُدار تكمن في {{5}}ميزاته متعددة اللغات والهيكلية{{/5}}، وليس في انتصار مثبت على معدل الخطأ في الكلمات بالإنجليزية. لا تحتوي مواد إطلاق Go​ogle على أي {{6}}مقارنة مباشرة{{/6}} مع نماذج عائلة Whisper، ولا توجد مقارنة مستقلة بين المتنافسين حتى الآن لأن نموذج Gemini 3.​5 Transcribe لم يكن متاحًا للعموم إلا منذ يوم واحد. وإلى أن تظهر هذه المقارنة، يظل لقب الدقة {{7}}بلا مالك{{/7}}، وأي مقال — بما في ذلك هذا المقال — يعلن فائزًا في معدل الخطأ في الكلمات بناءً على هذين الرقمين يكون متجاوزًا لحدوده.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

التكلفة: مجاني للتشغيل مقابل 0.005 دولار في الدقيقة

{{1}}Whisper Large v3 Turbo{{/1}} له تكلفة أجهزة ولا عداد استخدام. إذا شغّلته على GPU تمتلكها بالفعل، فإن التكلفة الحدّية لكل دقيقة مُفرَّغة تقترب من الصفر؛ أما إذا استأجرت GPU فستدفع سعر المثيل طوال مدة عمله. {{2}}Gemini 3.​5 Transcribe{{/2}} يفرض رسومًا تبلغ نحو 0.005 دولار لكل دقيقة صوتية في المتوسط، بينما تبلغ تكلفة الإصدار المباشر (live SKU) نحو 0.009 دولار لكل دقيقة مع توفّر طبقة مجانية. عند ألف ساعة من الصوت، يبلغ ذلك نحو 300 دولار على عداد {{3}}G​emini{{/3}} مقابل بضعة دولارات من زمن GPU على الأساس المفتوح. هذه الفجوة هي قصة التكلفة الحقيقية في هذه المواجهة، وهي السبب في أن الأساس سيحتفظ بوضعه الافتراضي لفترة طويلة في أعمال المعالجة المجمّعة الإنجليزية عالية الحجم. لا تُغلق اقتصاديات النموذج المُدار الفجوة إلا عندما تكون الميزات التي يضمّنها — الفصل بين المتحدثين، والتنسيق، والتحكم في المفردات — ستكلّفك أنت نفسك وقتًا هندسيًا لتجميعها فوق {{4}}Whisper{{/4}}.

اللغات والبث

يُدرج Whisper Large v3 Turbo 99 لغةً في مقابل 85+ لدى G​emini، لكن القصة العملية للتعدد اللغوي مختلفة: ينسخ Whisper جميع اللغات الـ99 في تمريرة واحدة دون أي اكتشاف تلقائي، ويكون تراجع دقته أشد في اللغات منخفضة الموارد والعالية الضوضاء — وهو ثمن النموذج المُقطّر. يقوم G​emini بالاكتشاف التلقائي بين لغاته الـ85+، وتُبرز Go​ogle اللهجات واللكنات الإقليمية. أما بالنسبة إلى البث المباشر، فلا يملك Whisper نموذجًا أصليًا للوقت الفعلي؛ إذ تستخدم عمليات النشر في الوقت الفعلي أطر عمل مثل faster-whisper وما يشابهها على أجهزتك الخاصة، بينما يوفر Gemini 3.​5 Transcribe نقطة نهاية مباشرة مصممة خصيصًا لذلك، مع زمن استجابة أقل من ثانية كما يُدَّعى وسعر يقابل ذلك. إذا كان عبء عملك مباشرًا ومتعدد اللغات، فإن نقطة النهاية المُدارة أبسط في التشغيل؛ أما إذا كان على دفعات وباللغة الإنجليزية، فإن النموذج الأساسي المفتوح أقل تكلفة.

الحكم، كما هو

يظل Whisper Large v3 Turbo الخيار الافتراضي المناسب للنسخ الدفعي باللغة الإنجليزية على نطاق واسع، ولأي شيء يجب أن يعمل على بنيتك التحتية الخاصة، وللفرق التي تريد نتاجًا مجمدًا وقابلًا للتدقيق. Gemini 3.5 Transcribe هو الاختيار الصحيح عندما يحتاج النص المنسوخ إلى أن يكون أكثر من مجرد كلمات — تسميات المتحدثين، تنسيق نظيف، مفردات مجال، تغطية متعددة اللغات، أو خطاف وكيل — وعندما تكون مستعدًا للدفع مقابل هذه الميزات. الاثنان يتعايشان، والنمط الذي يجعل هذا التعايش رخيصًا هو حدود توجيه: المنسخ الذي يناسب الصوت، ثم طبقة LLM التي تقرر ما يحدث للنص. تلك الطبقة هي ما يشغّله OrcaRouter — واجهة برمجة تطبيقات واحدة عبر أكثر من 200 نموذج، وتجاوزًا تلقائيًا للفشل بين المزودين، ولغة توجيه خاصة (DSL) لتكوين عدة نماذج في استدعاء واحد. لا يُستضاف أي من نموذجي الكلام على جانبنا؛ خيار النسخ هو بين GPU الخاصة بك وعداد Google، وكلاهما سيبقى لفترة طويلة.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube