
النسخ الذكي مع Gemini 3.5 Transcribe
- 智谱جديدZ.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 لكل مليون رمز
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
دخل Gemini 3.5 Transcribe مرحلة المعاينة العامة في 26 أغسطس 2026، وهو أول نموذج من Google لتحويل الكلام إلى نص يُباع فعليًا كنموذج Gemini: تستدعيه عبر Gemini API بمعرّف نموذج، ويُحسب سعر الصوت بعدد الرموز (tokens)، وتنشر Google تكلفة كل دقيقة من الصوت في صفحة التسعير الخاصة بها. وهذه التفصيلة الأخيرة هي ما تتجاهله التغطية الموجهة للمستهلكين. قصص يوم الإطلاق تدور حول إزالة كلمات الحشو وتحرير الصوت في Gboard، ولكن ما تغيّر فعليًا للمطورين هو أن النسخ أصبح الآن على نفس سطح واجهة برمجة التطبيقات (API) الذي تستخدمه بقية خط إنتاج Gemini، مع إسناد المتحدث وطوابع زمنية على مستوى الكلمة في النموذج الأساسي بدلاً من أن تكون في إضافة منفصلة. هذه القطعة تُقرأ كمرجع لواجهة برمجة التطبيقات، لأن ذلك هو الفجوة التي تتركها الموجة الأولى من التغطية.
تحذيران مقدمًا حتى لا تضلل الأرقام أدناه. لا تطلق Google على Gemini 3.5 Transcribe لقب "النموذج الأكثر دقة لتحويل الكلام إلى نص لدينا" — فالادعاء هو النموذج الأكثر دقة للتفاعلات الصوتية الذكية، وهو ادعاء مختلف، وهذا الاختلاف مهم عند قراءة أرقام WER. وكل ما هنا يصف معاينة عامة: معرّفا النموذجين، والأسعار، وأرقام المعايير هي ما توفره Google اليوم، وكل ذلك قد يتغير قبل الإصدار العام.
مسارا API — ومعرفات النماذج التي يجب تذكرها
تُطرح Gemini 3.5 Transcribe كنقطتي نهاية، واختيار النقطة الصحيحة هو أول قرار معماري يتخذه الفريق:
• gemini-3-5-transcribe — المسار المُسجَّل مسبقًا عبر واجهة برمجة تطبيقات التفاعلات (Interactions API). أرسِل ملفًا واحصل على النص المفصَّل مع تحديد المتحدثين (حتى ثلاثة متحدثين؛ ثلاثة أو أكثر تجريبي) والطوابع الزمنية على مستوى الكلمات. هذه هي الأداة الأساسية للمعالجة الدفعية وغير المتزامنة.
gemini-3-5-transcribe-live — المسار الفوري عبر واجهة برمجة تطبيقات Live. بث ثنائي الاتجاه بزمن استجابة أقل من ثانية، مصمم للمحادثات المباشرة والترجمة النصية والواجهات الصوتية.
الانقسام يعكس الطريقة التي رُتّبت بها بقية عائلة Gemini Audio، وهذا مهم لأن "live" هو وحدة SKU مستقلة بسعر خاص بها. العديد من القراءات المبكرة لهذا الإطلاق تفترض أن نموذجًا واحدًا يقوم بالأمرين؛ لكنه لا يفعل.

ما الذي يعنيه "النسخ الذكي" فعليًا
منشور إطلاق جوجل يؤطر هذا على أنه تجاوز الدقة الصوتية نحو الفهم. الميزات التي تتبع هذا التأطير هي التي يجب تقييمها وليس التأطير نفسه:
• معالجة عدم الطلاقة — يتم حذف "أم" و"آه"، وتُحل التصحيحات الذاتية. "لنلتقِ الثلاثاء — لا، الأربعاء" تُدوَّن على أنها اليوم المُصحَّح، وليس كتسجيل لبداية خاطئة. هذا قرار يتخذه النموذج، وبهذا المعنى تسميه Google ذكيًا.
• التنسيق التلقائي — يعود المخرَج كنص مُنسّق: مع تطبيق علامات الترقيم وحالة الأحرف وبنية الفقرات، وليس تدفقًا خامًا من الرموز.
• تحديد المتحدثين المتعددين — يُنسب الصوت المسجَّل مسبقًا إلى ثلاثة متحدثين كحد أقصى مع طوابع زمنية على مستوى الكلمة؛ أما العدد الأكبر من ثلاثة متحدثين فهو تجريبي. هذه الخاصية مدمجة في النموذج الأساسي وليست خدمة فصل متحدثين منفصلة.
• مفردات مخصصة — يمكنك توجيه التعرف نحو المصطلحات المتخصصة وأسماء المنتجات والتهجئات غير المألوفة من خلال توفير مفردات، وهي الآلية الخاصة بالمجالات التخصصية.
• أكثر من 85 لغة — اكتشاف تلقائي، مع الإشارة الصريحة إلى اللكنات واللهجات الإقليمية.
• استدعاء الوظائف — يمكن للنموذج تفويض مهام مثل توليد الصور أو تحليل الملفات إلى نماذج Gemini أخرى، مما يحوّل النسخ إلى مكوّن من وكيل أكبر بدلاً من خطوة نهائية.
• التقاط الكيانات — تدّعي Google أداءً قويًا على الصوتيات الواقعية المزعجة وعلى الكيانات الأبجدية الرقمية مثل الرموز البريدية ومعرفات الطلبات.
كما أفادت التغطية الصحفية أيضًا بوجود نافذة سياقية بسعة 96,000 رمز (ما يعادل تقريبًا ساعة من تسجيل الاجتماع دون تقسيم) وقدرة على اكتشاف المشاعر. وكلاهما يتوافق مع إطار الإطلاق، لكن بطاقة النموذج التي نشرتها Google لا تبرزهما كعناصر رئيسية، لذا يُنصح بالتعامل معهما كمعلومات منقولة وليست مؤكدة حتى ظهور ورقة مواصفات الإصدار العام (GA).

أرقام الدقة، المُعلَّمة
أرقام WER التي تستشهد بها Google مأخوذة من Artificial Analysis: متوسط معدل خطأ الكلمات 4.0% للبث المباشر و2.6% للنسخ غير المباشر. وفي معيار FLEURS متعدد اللغات، تبلغ نسبة WER وفقًا لـGoogle 5.50% للبث المباشر و5.04% لغير المباشر. كما تدّعي Google تحسنًا بنسبة 70% في الوقت المستغرق للوصول إلى النسخ النهائي مقارنة بسابقتها، Chirp 3.
القراءة الصادقة: هذه قياسات مستقلة بمعنى أن Artificial Analysis ليست Google، لكنها قياسات اختارتها Google، ونُشرت داخل إعلان Google الرسمي، لنموذج كان متاحًا للاستدعاء منذ يوم واحد فقط. لا أحد خارج Google أجرى حتى الآن مقارنة تنافسية مباشرة ضد النماذج مفتوحة الأوزان التي يقارنها معظم الفرق به، ولا تحتوي مواد الإطلاق على مقارنة مباشرة مع عائلة Whisper أو سلسلة Parakeet من NVIDIA. الرقم القائل بأنه أسرع بنسبة 70% من Chirp-3 هو ادعاء من البائع، وهذا كل شيء. اعتبر 2.6% و4.0% إشارات أولية قوية، وليست حقائق مؤكدة.
كم تبلغ تكلفتها؟
صفحة التسعير في Google تعرض كل نموذج بالرموز token وبالدقائق التقديرية للصوت. بالنسبة إلى gemini-3-5-transcribe، التقدير المختلط يبلغ حوالي 0.005 دولار لكل دقيقة صوت بأسعار القائمة — الإدخال حوالي 0.003 دولار/دقيقة، والإخراج حوالي 0.002 دولار/دقيقة. أما بالنسبة إلى gemini-3-5-transcribe-live، فالتقدير المختلط حوالي 0.009 دولار لكل دقيقة. وكلاهما يتوفر بطبقة مجانية اليوم.
أرقام الدقيقة الواحدة هذه تقديرات مستمدة من معدل رموز مفترض (25 رمزًا صوتيًا في الثانية للداخل، و175 رمزًا نصيًا في الدقيقة للخارج)، لذا فهي تتغير إذا غيّرت Google حساب الرموز. ما هو ثابت هو المبدأ: السعر المدرج هو السعر. وهذا هو بالضبط المبدأ الذي يعمل به موجّه التمرير المباشر مثل OrcaRouter — هامش ربح 0%، وتمرير السعر المدرج من المزود — لذا إذا خفضت Google أسعار النسخ خلال نافذة ما بين المعاينة والتوفر العام، فإن التخفيض يصبح ساريًا من جانبنا في اليوم نفسه، وليس بعد أن يحدّث موزع بطاقة الأسعار.
أين يتم طرحه
للمطورين، تعني المعاينة العامة اليوم جانبين: Gemini API في Google AI Studio، وGemini Enterprise Agent Platform للمهام المؤسسية. على صعيد المستهلك، تدعم Gemini 3.5 Transcribe بالفعل ميزة الإملاء Rambler في Gboard على Android وتطبيق Gemini على macOS. Chrome هو التالي — التحدث للكتابة في أي حقل ويب — تليها Search Live وGemini Live وDocs وKeep وGmail. بالنسبة لفريق يقيّمه، الإجابة العملية أبسط: يمكن استدعاؤه برمجيًا اليوم، باللغة الإنجليزية، في المناطق التي تتوفر فيها Gemini API.

ماذا يعني هذا لخط أنابيبك
الأمر الجديد حقًا ليس رقم WER. بل أن Google تبيع الآن النسخ مع الميزتين اللتين كانت الفرق تجمعهما بنفسها سابقًا — تسميات المتحدث والطوابع الزمنية على مستوى الكلمة — في النموذج الأساسي، عبر واجهة Gemini API التي تدعم استدعاء الدوال. إذا كنت تبني خط أنابيب لملاحظات اجتماعات مع تسمية المتحدثين من ناسخ بسيط بالإضافة إلى أداة تسمية متحدثين منفصلة وتمريرة تنسيق، فهذا أول نموذج من Google يدمج هذه الخطوات. السؤال المفتوح هو كيف يصمد رقم WER غير المتدفق البالغ 2.6% على الصوت الخاص بك، وحتى تظهر إعادة إنتاج مستقلة، فإن الخطوة المسؤولة لفريق الإنتاج هي تشغيل عينة حقيقية عبر API بدلاً من التخطيط بناءً على معايير Google المختارة. أما بالنسبة لعمل LLM الذي يعمل فوق النص — التلخيص، الاستخراج المنظم، عناصر الإجراءات — فهذه هي الطبقة التي يُبرر فيها التوجيه (routing) وجوده، وهي الطبقة التي يغطيها OrcaRouter: واجهة API واحدة عبر أكثر من 200 نموذج، وتجاوز تلقائي للفشل عبر المزودين، وDSL توجيه يجمع عدة نماذج في استدعاء واحد. أما خطوة النسخ نفسها، فيجب عليك اختبارها مع الصوت الخاص بك قبل أن تثق بأي رقم ترويجي.
