
Gemini 3.5 Transcribe مقابل Whisper Large v3 Turbo: هل يحتاج خط الأساس إلى الاستبدال؟
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
Whisper Large v3 Turbo هو النموذج الذي تُحيل إليه عبارة "speech-to-text" افتراضيًا في جزء كبير من الصناعة، وGemini 3.5 Transcribe هو أول نموذج نسخ من Google يُطرح صراحةً كمنافس لذلك المعيار الأساسي بدلًا من كونه واجهة برمجة تطبيقات عامة للكلام. يُعيد Gemini 3.5 Transcribe، المتاح في المعاينة العامة منذ 26 أغسطس 2026، صياغة النسخ كمهمة استدلال — فهو يحل التصحيحات الذاتية، ويُنسق المخرجات، وينسب المتحدثين، ويستدعي نماذج Gemini الأخرى من تلقاء نفسه. Whisper Large v3 Turbo هو تقطير OpenAI لـ Whisper Large-v3 بعدد 809 ملايين معامل، مرخّص برخصة MIT، ويمكن استضافته ذاتيًا، ويدعم 99 لغة، وهو أسرع بنحو أربع إلى ثماني مرات من النموذج الذي قُطّر منه اعتمادًا على العتاد. أحدهما طبقة ذكاء مُدارَة فوق الصوت؛ والآخر مكوّن مجاني معروف جيدًا يمكنك تشغيله أينما تشاء. السؤال الذي وُجدت هذه الصفحة للإجابة عنه أكثر تحديدًا وفائدةً من سؤال «أيهما أفضل»: متى يتوقف المعيار الأساسي عن كونه جيدًا بما يكفي؟
خط الأساس، في حال نسيت مدى جودته
يستحق Whisper Large v3 Turbo مكانته الافتراضية، لذا فإن الحجة المؤيدة له تأتي أولاً:
• يعمل في أي مكان — رخصة MIT، أوزان مفتوحة، قابل للتثبيت على لابتوب، أو وحدة معالجة رسومية واحدة، أو دالة بدون خادم. لا بائع، لا عدّاد، ولا بيانات تغادر شبكتك.
إنها سريعة — فوحدة فك الترميز المقطّرة (32 طبقة تشفير، 4 طبقات فك ترميز، انخفاضًا من 32) تجعلها أسرع بنحو أربع مرات من Whisper Large-v3 على الأجهزة النموذجية، وأكثر على بعضها، مع الحفاظ على معظم دقتها. رقم OpenAI الخاص بها هو نحو ثماني مرات على A100.
• يغطي 99 لغة للنسخ، وهي قائمة أوسع من قائمة Gemini 3.5 Transcribe التي تضم أكثر من 85 لغة.
دقتها موثقة جيدًا: 2.1% WER على LibriSpeech test-clean، و4.2% على test-other، و9.1% على Common Voice English — أرقام تم تكرارها عبر المجتمع لسنوات.
النظام البيئي ضخم — faster-whisper، وwhisper.cpp، وتصديرات ONNX، وكل أُطر الاستدلال التي تستخدمها بالفعل. إذا كان بإمكانك تشغيل نموذج، فبإمكانك تشغيل هذا النموذج.

بالنسبة للنسخ الجماعي للإنجليزية وما يقاربها على نطاق واسع، يعد Whisper Large v3 Turbo الخيار السائد لأسباب هيكلية لا يمكن لأي فجوة في المعايير أن تتغلب عليها بسهولة: إنه مجاني، وهو ملكك، وهو في كل مكان.

ما الذي يضيفه Gemini 3.5 Transcribe
قيمة المنافس المُدار ليست في أنه يتفوق على خط الأساس في اللغة الإنجليزية النظيفة — فذلك صراع لا تستطيع الأرقام حتى حسمه بشكل نظيف بعد. قيمته هي العمل الذي يحدث فوق الكلمات، وهو ما لا يفعله Whisper صراحةً:
إسناد المتحدث — حتى ثلاثة متحدثين مع طوابع زمنية على مستوى الكلمة، في النموذج الأساسي. يقوم Whisper بنسخ دفق واحد من الكلام؛ وليس لديه مفهوم لمن قال ماذا.
• تنسيق ذكي — إزالة التشويش اللفظي، ومعالجة التصحيحات الذاتية، وتطبيق علامات الترقيم والأحرف الكبيرة. يعيد Whisper الكلمات كما نُطقت، مع كل "آم" وما شابهها.
• مفردات مخصصة — انحياز نحو المصطلحات والهجاء غير المعتاد. لا يمتلك Whisper مثل هذه الآلية؛ يمكنك المعالجة اللاحقة أو الضبط الدقيق.
• استدعاء الدوال — يمكن تسليم النص المُفرَّغ إلى نماذج Gemini أخرى، مما يجعل التفريغ خطوة في خط أنابيب وكيل بدلاً من أن يكون المخرجات النهائية.
• جلسات طويلة — حوالي ساعة من الصوت في تمريرة واحدة (سياق 96K كما ورد في التقارير الصحفية) مقابل حاجة Whisper العملية إلى تقسيم الملفات الطويلة وربطها.
ذلك منتج مختلف. وهو ما تعنيه Google بمصطلح «النسخ الذكي»، وهو الجزء من المقارنة الذي لا يعتمد على حسابات المعايير.
سؤال الدقة الذي لا يستطيع أحد الإجابة عنه بوضوح بعد.
الأرقام الرئيسية للنموذجين لا تتنافس فعليًا. قياس {{1}}2.6% لمعدل الخطأ في الكلمات دون بث{{/1}} لنموذج Gemini 3.5 Transcribe هو قياس من Artificial Analysis استشهدت به Google، ويشمل {{2}}أكثر من 85 لغة{{/2}}. أما {{3}}2.1% في اختبار LibriSpeech test-clean{{/3}} لنموذج Whisper Large v3 Turbo فهو معيار إنجليزي من ورقة التقطير الخاصة بـ OpenAI، وقد تمت إعادة إنتاجه على نطاق واسع. مجموعات نصوص مختلفة، وتغطية لغات مختلفة، وبائعون مختلفون. ما يمكن قوله بصدق: في الإنجليزية الواضحة، من المعقول أن يكون النموذج المفتوح الأساسي والنموذج المُدار المنافس في {{4}}نفس المستوى تقريبًا{{/4}}، وميزة النموذج المُدار تكمن في {{5}}ميزاته متعددة اللغات والهيكلية{{/5}}، وليس في انتصار مثبت على معدل الخطأ في الكلمات بالإنجليزية. لا تحتوي مواد إطلاق Google على أي {{6}}مقارنة مباشرة{{/6}} مع نماذج عائلة Whisper، ولا توجد مقارنة مستقلة بين المتنافسين حتى الآن لأن نموذج Gemini 3.5 Transcribe لم يكن متاحًا للعموم إلا منذ يوم واحد. وإلى أن تظهر هذه المقارنة، يظل لقب الدقة {{7}}بلا مالك{{/7}}، وأي مقال — بما في ذلك هذا المقال — يعلن فائزًا في معدل الخطأ في الكلمات بناءً على هذين الرقمين يكون متجاوزًا لحدوده.

التكلفة: مجاني للتشغيل مقابل 0.005 دولار في الدقيقة
{{1}}Whisper Large v3 Turbo{{/1}} له تكلفة أجهزة ولا عداد استخدام. إذا شغّلته على GPU تمتلكها بالفعل، فإن التكلفة الحدّية لكل دقيقة مُفرَّغة تقترب من الصفر؛ أما إذا استأجرت GPU فستدفع سعر المثيل طوال مدة عمله. {{2}}Gemini 3.5 Transcribe{{/2}} يفرض رسومًا تبلغ نحو 0.005 دولار لكل دقيقة صوتية في المتوسط، بينما تبلغ تكلفة الإصدار المباشر (live SKU) نحو 0.009 دولار لكل دقيقة مع توفّر طبقة مجانية. عند ألف ساعة من الصوت، يبلغ ذلك نحو 300 دولار على عداد {{3}}Gemini{{/3}} مقابل بضعة دولارات من زمن GPU على الأساس المفتوح. هذه الفجوة هي قصة التكلفة الحقيقية في هذه المواجهة، وهي السبب في أن الأساس سيحتفظ بوضعه الافتراضي لفترة طويلة في أعمال المعالجة المجمّعة الإنجليزية عالية الحجم. لا تُغلق اقتصاديات النموذج المُدار الفجوة إلا عندما تكون الميزات التي يضمّنها — الفصل بين المتحدثين، والتنسيق، والتحكم في المفردات — ستكلّفك أنت نفسك وقتًا هندسيًا لتجميعها فوق {{4}}Whisper{{/4}}.
اللغات والبث
يُدرج Whisper Large v3 Turbo 99 لغةً في مقابل 85+ لدى Gemini، لكن القصة العملية للتعدد اللغوي مختلفة: ينسخ Whisper جميع اللغات الـ99 في تمريرة واحدة دون أي اكتشاف تلقائي، ويكون تراجع دقته أشد في اللغات منخفضة الموارد والعالية الضوضاء — وهو ثمن النموذج المُقطّر. يقوم Gemini بالاكتشاف التلقائي بين لغاته الـ85+، وتُبرز Google اللهجات واللكنات الإقليمية. أما بالنسبة إلى البث المباشر، فلا يملك Whisper نموذجًا أصليًا للوقت الفعلي؛ إذ تستخدم عمليات النشر في الوقت الفعلي أطر عمل مثل faster-whisper وما يشابهها على أجهزتك الخاصة، بينما يوفر Gemini 3.5 Transcribe نقطة نهاية مباشرة مصممة خصيصًا لذلك، مع زمن استجابة أقل من ثانية كما يُدَّعى وسعر يقابل ذلك. إذا كان عبء عملك مباشرًا ومتعدد اللغات، فإن نقطة النهاية المُدارة أبسط في التشغيل؛ أما إذا كان على دفعات وباللغة الإنجليزية، فإن النموذج الأساسي المفتوح أقل تكلفة.
الحكم، كما هو
يظل Whisper Large v3 Turbo الخيار الافتراضي المناسب للنسخ الدفعي باللغة الإنجليزية على نطاق واسع، ولأي شيء يجب أن يعمل على بنيتك التحتية الخاصة، وللفرق التي تريد نتاجًا مجمدًا وقابلًا للتدقيق. Gemini 3.5 Transcribe هو الاختيار الصحيح عندما يحتاج النص المنسوخ إلى أن يكون أكثر من مجرد كلمات — تسميات المتحدثين، تنسيق نظيف، مفردات مجال، تغطية متعددة اللغات، أو خطاف وكيل — وعندما تكون مستعدًا للدفع مقابل هذه الميزات. الاثنان يتعايشان، والنمط الذي يجعل هذا التعايش رخيصًا هو حدود توجيه: المنسخ الذي يناسب الصوت، ثم طبقة LLM التي تقرر ما يحدث للنص. تلك الطبقة هي ما يشغّله OrcaRouter — واجهة برمجة تطبيقات واحدة عبر أكثر من 200 نموذج، وتجاوزًا تلقائيًا للفشل بين المزودين، ولغة توجيه خاصة (DSL) لتكوين عدة نماذج في استدعاء واحد. لا يُستضاف أي من نموذجي الكلام على جانبنا؛ خيار النسخ هو بين GPU الخاصة بك وعداد Google، وكلاهما سيبقى لفترة طويلة.
