بطاقة عنوان رئيسي لخاصية 'النسخ الذكي باستخدام Gemini 3.5 Transcribe' تعرض موجة صوتية تتحول إلى نص منسق، وكرة أرضية عليها علامة 85+ لغة، وشارات تسمية المتحدثين، والأرقام الرئيسية 2.6% WER للنسخ غير المتدفق و~$0.005/الدقيقة بمعدل إجمالي، وشعار OrcaRouter في الزاوية السفلية اليمنى.
Engineering & Research

النسخ الذكي مع Gemini 3.5 Transcribe

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

دخل Gemini 3.​5 Transcribe مرحلة المعاينة العامة في 26 أغسطس 2026، وهو أول نموذج من Go​ogle لتحويل الكلام إلى نص يُباع فعليًا كنموذج G​emini: تستدعيه عبر G​emini API بمعرّف نموذج، ويُحسب سعر الصوت بعدد الرموز (tokens)، وتنشر Go​ogle تكلفة كل دقيقة من الصوت في صفحة التسعير الخاصة بها. وهذه التفصيلة الأخيرة هي ما تتجاهله التغطية الموجهة للمستهلكين. قصص يوم الإطلاق تدور حول إزالة كلمات الحشو وتحرير الصوت في Gboard، ولكن ما تغيّر فعليًا للمطورين هو أن النسخ أصبح الآن على نفس سطح واجهة برمجة التطبيقات (API) الذي تستخدمه بقية خط إنتاج G​emini، مع إسناد المتحدث وطوابع زمنية على مستوى الكلمة في النموذج الأساسي بدلاً من أن تكون في إضافة منفصلة. هذه القطعة تُقرأ كمرجع لواجهة برمجة التطبيقات، لأن ذلك هو الفجوة التي تتركها الموجة الأولى من التغطية.

تحذيران مقدمًا حتى لا تضلل الأرقام أدناه. لا تطلق Google على Gemini 3.5 Transcribe لقب "النموذج الأكثر دقة لتحويل الكلام إلى نص لدينا" — فالادعاء هو النموذج الأكثر دقة للتفاعلات الصوتية الذكية، وهو ادعاء مختلف، وهذا الاختلاف مهم عند قراءة أرقام WER. وكل ما هنا يصف معاينة عامة: معرّفا النموذجين، والأسعار، وأرقام المعايير هي ما توفره Google اليوم، وكل ذلك قد يتغير قبل الإصدار العام.

مسارا API — ومعرفات النماذج التي يجب تذكرها

تُطرح Gemini 3.5 Transcribe كنقطتي نهاية، واختيار النقطة الصحيحة هو أول قرار معماري يتخذه الفريق:

• gemini-3-5-transcribe — المسار المُسجَّل مسبقًا عبر واجهة برمجة تطبيقات التفاعلات (Interactions API). أرسِل ملفًا واحصل على النص المفصَّل مع تحديد المتحدثين (حتى ثلاثة متحدثين؛ ثلاثة أو أكثر تجريبي) والطوابع الزمنية على مستوى الكلمات. هذه هي الأداة الأساسية للمعالجة الدفعية وغير المتزامنة.

gemini-3-5-transcribe-live — المسار الفوري عبر واجهة برمجة تطبيقات Live. بث ثنائي الاتجاه بزمن استجابة أقل من ثانية، مصمم للمحادثات المباشرة والترجمة النصية والواجهات الصوتية.

الانقسام يعكس الطريقة التي رُتّبت بها بقية عائلة Gemini Audio، وهذا مهم لأن "live" هو وحدة SKU مستقلة بسعر خاص بها. العديد من القراءات المبكرة لهذا الإطلاق تفترض أن نموذجًا واحدًا يقوم بالأمرين؛ لكنه لا يفعل.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

ما الذي يعنيه "النسخ الذكي" فعليًا

منشور إطلاق جوجل يؤطر هذا على أنه تجاوز الدقة الصوتية نحو الفهم. الميزات التي تتبع هذا التأطير هي التي يجب تقييمها وليس التأطير نفسه:

• معالجة عدم الطلاقة — يتم حذف "أم" و"آه"، وتُحل التصحيحات الذاتية. "لنلتقِ الثلاثاء — لا، الأربعاء" تُدوَّن على أنها اليوم المُصحَّح، وليس كتسجيل لبداية خاطئة. هذا قرار يتخذه النموذج، وبهذا المعنى تسميه Google ذكيًا.

• التنسيق التلقائي — يعود المخرَج كنص مُنسّق: مع تطبيق علامات الترقيم وحالة الأحرف وبنية الفقرات، وليس تدفقًا خامًا من الرموز.

• تحديد المتحدثين المتعددين — يُنسب الصوت المسجَّل مسبقًا إلى ثلاثة متحدثين كحد أقصى مع طوابع زمنية على مستوى الكلمة؛ أما العدد الأكبر من ثلاثة متحدثين فهو تجريبي. هذه الخاصية مدمجة في النموذج الأساسي وليست خدمة فصل متحدثين منفصلة.

• مفردات مخصصة — يمكنك توجيه التعرف نحو المصطلحات المتخصصة وأسماء المنتجات والتهجئات غير المألوفة من خلال توفير مفردات، وهي الآلية الخاصة بالمجالات التخصصية.

• أكثر من 85 لغة — اكتشاف تلقائي، مع الإشارة الصريحة إلى اللكنات واللهجات الإقليمية.

• استدعاء الوظائف — يمكن للنموذج تفويض مهام مثل توليد الصور أو تحليل الملفات إلى نماذج G​emini أخرى، مما يحوّل النسخ إلى مكوّن من وكيل أكبر بدلاً من خطوة نهائية.

• التقاط الكيانات — تدّعي Go​ogle أداءً قويًا على الصوتيات الواقعية المزعجة وعلى الكيانات الأبجدية الرقمية مثل الرموز البريدية ومعرفات الطلبات.

كما أفادت التغطية الصحفية أيضًا بوجود نافذة سياقية بسعة 96,000 رمز (ما يعادل تقريبًا ساعة من تسجيل الاجتماع دون تقسيم) وقدرة على اكتشاف المشاعر. وكلاهما يتوافق مع إطار الإطلاق، لكن بطاقة النموذج التي نشرتها Go​ogle لا تبرزهما كعناصر رئيسية، لذا يُنصح بالتعامل معهما كمعلومات منقولة وليست مؤكدة حتى ظهور ورقة مواصفات الإصدار العام (GA).

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

أرقام الدقة، المُعلَّمة

أرقام WER التي تستشهد بها Go​ogle مأخوذة من Artificial Analysis: متوسط معدل خطأ الكلمات 4.0% للبث المباشر و2.6% للنسخ غير المباشر. وفي معيار FLEURS متعدد اللغات، تبلغ نسبة WER وفقًا لـGo​ogle 5.50% للبث المباشر و5.04% لغير المباشر. كما تدّعي Go​ogle تحسنًا بنسبة 70% في الوقت المستغرق للوصول إلى النسخ النهائي مقارنة بسابقتها، Chirp 3.

القراءة الصادقة: هذه قياسات مستقلة بمعنى أن Artificial Analysis ليست Go​ogle، لكنها قياسات اختارتها Google، ونُشرت داخل إعلان Go​ogle الرسمي، لنموذج كان متاحًا للاستدعاء منذ يوم واحد فقط. لا أحد خارج Go​ogle أجرى حتى الآن مقارنة تنافسية مباشرة ضد النماذج مفتوحة الأوزان التي يقارنها معظم الفرق به، ولا تحتوي مواد الإطلاق على مقارنة مباشرة مع عائلة Whisper أو سلسلة Parakeet من NVIDIA. الرقم القائل بأنه أسرع بنسبة 70% من Chirp-3 هو ادعاء من البائع، وهذا كل شيء. اعتبر 2.6% و4.0% إشارات أولية قوية، وليست حقائق مؤكدة.

كم تبلغ تكلفتها؟

صفحة التسعير في Google تعرض كل نموذج بالرموز token وبالدقائق التقديرية للصوت. بالنسبة إلى gemini-3-5-transcribe، التقدير المختلط يبلغ حوالي 0.005 دولار لكل دقيقة صوت بأسعار القائمة — الإدخال حوالي 0.003 دولار/دقيقة، والإخراج حوالي 0.002 دولار/دقيقة. أما بالنسبة إلى gemini-3-5-transcribe-live، فالتقدير المختلط حوالي 0.009 دولار لكل دقيقة. وكلاهما يتوفر بطبقة مجانية اليوم.

أرقام الدقيقة الواحدة هذه تقديرات مستمدة من معدل رموز مفترض (25 رمزًا صوتيًا في الثانية للداخل، و175 رمزًا نصيًا في الدقيقة للخارج)، لذا فهي تتغير إذا غيّرت Go​ogle حساب الرموز. ما هو ثابت هو المبدأ: السعر المدرج هو السعر. وهذا هو بالضبط المبدأ الذي يعمل به موجّه التمرير المباشر مثل OrcaRouter — هامش ربح 0%، وتمرير السعر المدرج من المزود — لذا إذا خفضت Go​ogle أسعار النسخ خلال نافذة ما بين المعاينة والتوفر العام، فإن التخفيض يصبح ساريًا من جانبنا في اليوم نفسه، وليس بعد أن يحدّث موزع بطاقة الأسعار.

أين يتم طرحه

للمطورين، تعني المعاينة العامة اليوم جانبين: G​emini API في Go​ogle AI Studio، وG​emini Enterprise Agent Platform للمهام المؤسسية. على صعيد المستهلك، تدعم Gemini 3.​5 Transcribe بالفعل ميزة الإملاء Rambler في Gboard على Android وتطبيق G​emini على macOS. Chrome هو التالي — التحدث للكتابة في أي حقل ويب — تليها Search Live وG​emini Live وDocs وKeep وGmail. بالنسبة لفريق يقيّمه، الإجابة العملية أبسط: يمكن استدعاؤه برمجيًا اليوم، باللغة الإنجليزية، في المناطق التي تتوفر فيها G​emini API.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

ماذا يعني هذا لخط أنابيبك

الأمر الجديد حقًا ليس رقم WER. بل أن Go​ogle تبيع الآن النسخ مع الميزتين اللتين كانت الفرق تجمعهما بنفسها سابقًا — تسميات المتحدث والطوابع الزمنية على مستوى الكلمة — في النموذج الأساسي، عبر واجهة G​emini API التي تدعم استدعاء الدوال. إذا كنت تبني خط أنابيب لملاحظات اجتماعات مع تسمية المتحدثين من ناسخ بسيط بالإضافة إلى أداة تسمية متحدثين منفصلة وتمريرة تنسيق، فهذا أول نموذج من Go​ogle يدمج هذه الخطوات. السؤال المفتوح هو كيف يصمد رقم WER غير المتدفق البالغ 2.6% على الصوت الخاص بك، وحتى تظهر إعادة إنتاج مستقلة، فإن الخطوة المسؤولة لفريق الإنتاج هي تشغيل عينة حقيقية عبر API بدلاً من التخطيط بناءً على معايير Go​ogle المختارة. أما بالنسبة لعمل LLM الذي يعمل فوق النص — التلخيص، الاستخراج المنظم، عناصر الإجراءات — فهذه هي الطبقة التي يُبرر فيها التوجيه (routing) وجوده، وهي الطبقة التي يغطيها OrcaRouter: واجهة API واحدة عبر أكثر من 200 نموذج، وتجاوز تلقائي للفشل عبر المزودين، وDSL توجيه يجمع عدة نماذج في استدعاء واحد. أما خطوة النسخ نفسها، فيجب عليك اختبارها مع الصوت الخاص بك قبل أن تثق بأي رقم ترويجي.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube