
MAI-Transcribe-2-Streaming مقابل Gemini 3.5 Transcribe Live: نفس الـ9 دولارات، مقايضة مختلفة
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 221 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
MAI-Transcribe-2-Streaming وGemini 3.5 Transcribe Live يكلفان المال نفسه ويقومان على نظريتين متعارضتين حول الغرض من ناسخ البث. يستقر كلاهما عند نحو 9.00 دولارات لكل 1,000 دقيقة من الصوت المتدفق. نموذج Microsoft، الصادر في 1 أكتوبر 2026، أداة دقة: معدل خطأ كلمات متدفق مُعلن قدره 2.5% عند 0.13 ثانية حتى النسخة النهائية، الأول في الدقة على كلٍّ من النسخ النهائية والجزئية وفقًا لرواية Microsoft نفسها، مقيسًا وفق منهجية البث الخاصة بـ Artificial Analysis لكنه لم يُرسم بعد كصف على تلك اللوحة. النموذج الآخر، في معاينة عامة منذ 26 أغسطس 2026 ويُقدَّم عبر Live API، أداة تغطية: أكثر من 85 لغة مع التبديل أثناء البث، وطبقة مجانية، ومعدل خطأ كلمات متدفق قدره 4.00% عند 0.40 ثانية، وهو الرقم الذي تقيسه Artificial Analysis له. لا يُعد أيٌّ منهما الخيار البديهي، والسبب أنهما لا يتنافسان حقًا على عبء العمل نفسه.
إليك المقارنة المباشرة كما تُقرأ الأرقام فعليًا — الأرقام المعلنة من الموردين موسومة، وأرقام أدوات التتبع منسوبة، والجوانب التي يتفوق فيها أحد الطرازين في بُعد لا ينافسه فيه الآخر على الإطلاق.
النسخة المختصرة في سطر واحد
• الدقة وزمن الاستجابة — MAI-Transcribe-2-Streaming، وفقًا للأرقام المنشورة. تدّعي Microsoft تحقيق معدل خطأ الكلمات (WER) في البث بنسبة 2.5% عند 0.13 ثانية للوصول إلى النص النهائي، وهي الأولى في الدقة في كلٍّ من النصوص النهائية والجزئية، و2.5% في أول نص جزئي عند 0.12 ثانية. وفي المقابل، لدى Artificial Analysis نتيجة Gemini 3.5 Transcribe Live عند 4.00% عند 0.40 ثانية. الميزة التي تدّعيها Microsoft هي 1.5 نقطة، وأسرع بنحو ثلاث مرات في الحسم. التحفّظ هو أن المتتبّع لم يُدرج بعد MAI-Transcribe-2-Streaming نفسه في مخططه — فالمتصدّر الحالي في اللوحة هو Grok Voice Transcribe 2.0 بنسبة 2.73% و0.49 ثانية، مع Muse Voice Transcribe عند 3.06% و0.16 ثانية — لذا فإن نسبة 2.5% رقم مورّد يُقرأ مقابل مجال يقيسه المتتبّع بالفعل. الأمر ليس متقاربًا على المحور الذي ينشره كلا النموذجين، لكن جانبًا واحدًا منه فقط منشور بشكل مستقل.
• اتساع اللغات — Gemini 3.5 Transcribe Live. أكثر من 85 لغة مع الكشف التلقائي والقدرة على تبديل اللغة أثناء البث دون إعادة تشغيل الجلسة، وهو الادعاء الرئيسي من Google بشأن Live API. يغطي MAI-Transcribe-2-Streaming 60 لغة مع كشف تلقائي مستمر للغة. الحد الأدنى لدى Microsoft أعلى؛ وسقف Google أوسع، والفجوة البالغة 25 لغة تقع غالباً في لغات لا يكون فيها نموذج بث أحادي اللغة قابلاً للاستخدام على الإطلاق.
• شكل الجلسة — Gemini 3.5 Transcribe Live، وهذا الأمر له وجهان. واجهة Live API هي جلسة WebSocket محدودة بـ10 دقائق، وهو أمر مناسب لدور وكيل صوتي ومربك لاجتماع يستغرق ساعة؛ ولا تنشر Microsoft أي سقف جلسة مكافئ لنموذجها التدفقي، وهو ما يهم إذا كانت وحدة عملك مكالمة وليست دورًا حواريًا.
• تكلفة الدخول — Gemini 3.5 Transcribe Live. تتوفر طبقة مجانية، ويبلغ السعر المدمج لدى Google نحو 0.009 دولار لكل دقيقة وفق التسعير القائم على الرموز. أما سعر Microsoft البالغ 0.54 دولار لكل ساعة صوتية فهو سعر تمهيدي تقول Microsoft إنه يستمر حتى نهاية العام، دون الإفصاح عن سعر قياسي — وهو الهيكل نفسه المتبع في إطلاق دفعات سبتمبر.

لماذا فجوة الدقة أكبر مما تبدو عليه
قد تبدو فجوة بنسبة 1.5 نقطة في معدل خطأ الكلمات وكأنها فرق تقريب، إلى أن تحسب تكلفتها. عند معدل خطأ الكلمات في البث (WER) البالغ 4.00%، يخطئ Gemini 3.5 Transcribe Live في نحو 40 كلمة من كل 1,000؛ وعند النسبة المُعلنة من مايكروسوفت البالغة 2.5%، يخطئ MAI-Transcribe-2-Streaming في 25 كلمة. وبالنظر إلى الأحجام التي تنتجها خطوط المعالجة في الوقت الفعلي — فمؤسسة دعم تُجري 5,000 ساعة من المكالمات شهريًا تعادل 300,000 دقيقة، وأكثر من 45 مليون كلمة بمعدلات المحادثة — يمثل هذا الفارق ملايين الكلمات غير الصحيحة سنويًا، تتركز في الكيانات التي تعتمد عليها الأنظمة اللاحقة: أسماء الحسابات، وأرقام التذاكر، والجرعات، والعناوين.
الفرق في زمن التأخير هو الأصعب في بيعه. 0.13 ثانية مقابل 0.40 ثانية بعد انتهاء الكلام أمر ملحوظ في بث التعليق النصي المباشر — أقل من نحو 0.2 ثانية يُقرأ كأنه متزامن، وثلث الثانية يُقرأ كأن النص يلاحق المتحدث — لكنه ليس ملحوظًا في لوحة مساعدة الوكيل التي تُحدَّث على مقياس زمني بشري. إذا كان مستهلكك شخصًا يقرأ مع البث، فإن تفوق Microsoft في زمن التأخير هو المنتج. وإذا كان مستهلكك نموذجًا يحصل على النص النهائي عند انتهاء الدور، فهو مجرد رقم.
يحمل الرقمان التحذير نفسه، ويجدر ذكره مرة واحدة: هذان رقمان من تشغيل واحد من لوحة تتبّع يبلغ عمقها 37 نموذجًا، والفارق بين المركز الأول والثالث على تلك اللوحة أقل من نقطة. وقد تعيد إعادة التشغيل خلط صدارة لوحة المتصدرين للبث على نحو لا يستطيع فارق قدره نقطتان على لوحة الدفعات فعله. كما أن نسبة Microsoft البالغة 2.5% ليست على اللوحة على الإطلاق بعد — فهي ادعاء من مورّد قيس وفق منهجية المتتبّع، وهو أمر يختلف عن صفّ ينشره المتتبّع.
الحدود هي حيث يكمن القرار فعليًا.
تفصل حدود الميزات بين هذين الاثنين أسرع مما تفعله الاختبارات المعيارية، وهما يتجهان في اتجاهين متعاكسين.
يحمل Gemini 3.5 Transcribe Live ثلاثة قيود موثّقة: حدّ مدة الجلسة البالغ 10 دقائق في Live API، وغياب فصل المتحدثين، وغياب الطوابع الزمنية على مستوى الكلمة. القيد الأول معماري — فالبث عبر جلسة WebSocket له سقف بحكم التصميم — وهو يعني أنه لا بد من تجميع النسخ الحي للنصوص الطويلة عبر جلسات متعددة، مع ترك معالجة الوصلات لك. أما القيدان الآخران فمطلقان: إذا كان منتجك يحتاج إلى نسب الكلام إلى متحدث، أو إلى وضع كلمة عند طابع زمني للبحث أو مزامنة الترجمة، فإن Gemini 3.5 Transcribe Live لا يفعل ذلك بأي ثمن.
قيود MAI-Transcribe-2-Streaming أقل توثيقًا، وهذا بحد ذاته معلومة. لا تدّعي Microsoft فصل المتحدثين بالنسبة إلى النموذج التدفقي، ولا تدّعي وجود طوابع زمنية على مستوى الكلمات كذلك؛ فـ MAI-Transcribe-2 الدفعي يضم فصل المتحدثين ويعيد طوابع زمنية على مستوى الكلمات، لكن ذلك هو المنتج الدفعي، وافتراض أن إصدار SKU التدفقي يرثهما هو بالضبط نوع الاستنتاج الذي توجد مواد الإطلاق لمنعه. ما تدّعيه Microsoft فعلاً هو 60 لغة مع كشف مستمر عن اللغة وتموضع على الحدود الأمامية لباريتو فيما يتعلق بالدقة مقابل زمن الاستجابة — وهما تصريحان من المورّد تتفق معهما بيانات المتتبّع.
إذن، القراءة الصادقة للميزات هي: لا ينشر أيٌّ من نموذجَي البث ميزة تحديد المتحدثين ولا الطوابع الزمنية للكلمات. يمتلك Gemini 3.5 Transcribe Live حدًّا منشورًا للجلسة وطبقة مجانية؛ بينما يمتلك MAI-Transcribe-2-Streaming عددًا منشورًا للغات ولا يمتلك حدًّا منشورًا. إذا كانت متطلباتك تشمل تحديد المتحدثين، فلا أحد هذين هو الحل، وأنت أمام نسخ دفعي مع طبقة بث مُركّبة في المقدمة.
ما الذي يخبرك به تكافؤ الأسعار حقًا
مورّدان يصلان إلى نفس 9 دولارات لكل 1000 دقيقة من اتجاهين متعاكسين هو أكثر حقيقة إثارة للاهتمام في هذه المقارنة. وصلت جوجل إلى هناك من خلال التسعير القائم على الرموز في جلسة Live API: الصوت الداخل بسعر 3.50 دولارات لكل مليون رمز، والنص الصادر بسعر 21 دولارًا لكل مليون، واستهلاك تقريبي يبلغ 175 رمزًا نصيًا في الدقيقة، مما يمتزج ليصبح حوالي 0.009 دولار في الدقيقة. ووصلت مايكروسوفت إلى هناك من خلال إدراج سعر ثابت قدره 0.54 دولار لكل ساعة صوتية لنموذج في عائلة يعمل نظيرها في المعالجة بالدفعات بسعر 0.10 دولار. أحدهما جلسة مقاسة في الوقت الفعلي؛ والآخر سعر ثابت لكل دقيقة مع خصم تمهيدي.
تتصرف هذه البُنى بشكل مختلف مع توسّع النطاق. السعر الثابت قابل للتوقّع ويسهل وضعه في الميزانية؛ أما الجلسة القائمة على عدّ الرموز فتتغيّر وفق مقدار ما يردّ به النموذج وطول المدة التي تظل فيها الجلسة خاملة ومفتوحة. بالنسبة إلى خطّ معالجة عالي الحجم، يُعدّ السعر الثابت الفاتورة الأكثر ملاءمة؛ وبالنسبة إلى نموذج أولي أو ميزة منخفضة الحجم، تُعدّ الطبقة المجانية والفوترة لكل رمز نقطة الدخول الأكثر ملاءمة.

ما لا تغيّره أيٌّ من البنيتين هو الطبقة الواقعة فوق النص المفرَّغ. فأيًّا كان النموذج الذي ينتجه، يُعدّ النص المفرَّغ الحي مُدخَلًا إلى التلخيص والتصنيف والتنقيح والتوجيه، وهذه الخطوات لها منحنيات تكلفة وجودة خاصة بها — وهي تُشغَّل عادةً عبر عدة نماذج لا نموذج واحد. تلك هي الطبقة التي يغطيها OrcaRouter: واجهة API واحدة عبر أكثر من 200 نموذج، وأسعار قوائم المزوّدين تُمرَّر بهامش ربح 0%، وتحويل تلقائي عند الفشل، ولغة توجيه (DSL) قادرة على دفع النص المفرَّغ إلى نماذج مختلفة حسب كل حمل عمل. لا يوجد MAI-Transcribe-2-Streaming ولا Gemini 3.5 Transcribe Live على تلك القائمة — إذ يُقدَّمان عبر منظومتَي الكلام الخاصتين بـ Microsoft وGoogle على التوالي — والمقصود ليس توجيههما، بل إبقاء كل ما يقع بعدهما في سلسلة المعالجة قابلًا للنقل.

أي واحدة تختار؟
اختر MAI-Transcribe-2-Streaming عندما تكون الدقة وزمن الاستقرار هما المنتج: ترجمات مباشرة يقرأها إنسان، أو تقييم فوري للامتثال أو الجودة حيث يكون لخطأ سماع كيان ما تكلفة، أو جلسات طويلة سيجبرك حد Gemini البالغ 10 دقائق على تجميعها. اختر Gemini 3.5 Transcribe Live عندما تكون التغطية هي المنتج: نشر عالمي عبر لغات لا يمكنك حصرها مسبقًا، أو تبديل اللغة أثناء البث، أو نموذج أولي حيث تزيل الطبقة المجانية والفوترة لكل رمز الالتزام. الفرق التي تحتاج إلى الاثنين ليست عالقة — فهما واجهتا برمجة تطبيقات مختلفتان بنماذج جلسات مختلفة، والمعمارية الصادقة هي التوجيه حسب عبء العمل بدلًا من التوحيد على واحدة.
الخلاصة الجديرة بالأخذ من هذه المقارنة ليست أن مايكروسوفت فازت، بل أن النسخ المباشر أصبح لديه الآن خياران موثوقان من الطراز المتقدم بسعر متطابق، ما يعني أن القرار انتقل من «ما هو متاح» إلى «ما الذي يحتاجه عبء العمل هذا تحديدًا». وهذه مشكلة أفضل أن تكون لديك.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
