نموذج Google لتحويل النص إلى كلام السريع والفعال من حيث التكلفة لتوليد الصوت في الوقت الفعلي، والذي يتم الوصول إليه عبر OrcaRouter.
google/gemini-3.1-flash-tts-preview هو نموذج لتحويل النص إلى كلام من Google، وهو جزء من عائلة Gemini Flash. يقبل إدخالًا نصيًا ويولّد مخرجات صوتية منطوقة. تم تحسين النموذج من حيث السرعة والتكلفة، مما…
القدرة الأساسية هي تحويل النص المكتوب إلى كلام طبيعي الصوت. صُمم النموذج للسرعة، مستفيدًا من بنية Flash لتقليل زمن الاستجابة. هل يدعم لغات وأصواتًا متعددة؟ لا تتضمن الحقائق المقدمة تفاصيل دعم اللغة والصوت لهذه النسخة التجريبية المحددة؛ يُرجى الرجوع إلى وثائق Google للاطلاع على خيارات الصوت الحالية. يمكن للنموذج معالجة مدخلات نصية متنوعة تشمل علامات الترقيم والأرقام والاختصارات، منتجًا مخرجات منطوقة تعكس الإيقاع والنبرة المقصودة.
تشمل أفضل حالات الاستخدام أي تطبيق يكون فيه توليد الكلام منخفض الزمن الكامن أمرًا بالغ الأهمية: المساعدات الصوتية في الوقت الحقيقي، والدبلجة الحية للترجمة، وروبوتات المحادثة التفاعلية ذات الإخراج الصوتي، وأنظمة الهاتف الآلية. كما أنها تتميز في المعالجة الدفعية عندما تحتاج إلى توليد العديد من المقاطع الصوتية القصيرة بسرعة. يمكن لمنتجي المحتوى استخدامها للتعليقات الصوتية الديناميكية في ألعاب الفيديو أو الكتب الصوتية. نظرًا لأن تكلفة الإخراج مرتفعة مقارنة بالإدخال، فهي الأكثر اقتصادية عندما يكون الصوت الناتج موجزًا.
إذا كانت حالة الاستخدام الخاصة بك تتضمن توليد صوت طويل جدًا (على سبيل المثال، ساعات من الكلام) أو لا تتطلب زمن استجابة منخفض، ففكر في استخدام نموذج TTS مجمّع بتكلفة إخراج أقل لكل رمز (token). بالنسبة للتطبيقات التي يهيمن فيها حجم الإدخال (على سبيل المثال، العديد من المطالبات القصيرة)، فإن تكلفة الإدخال المنخفضة تجعل نموذج Flash هذا جذابًا. بالنسبة للسيناريوهات التي تتطلب جودة إخراج عالية جدًا، مثل الشخصيات المعبرة عاطفيًا، قد تقوم بتقييم نماذج TTS المتميزة من Google أو موفّرين آخرين. راقب دائمًا إجمالي حجم الرموز (tokens) ومتطلبات زمن الاستجابة.
باعتبارها نموذج Gemini Flash، تم تحسين هذا النوع من TTS لتحقيق زمن استجابة منخفض. لم يتم تقديم معايير زمن استجابة محددة (مثل الوقت حتى أول حزمة صوتية) في الحقائق المتاحة. عمليًا، غالبًا ما تستجيب نماذج Flash في غضون مئات المللي ثانية للمدخلات القصيرة. يمكن أن يختلف زمن الاستجابة بناءً على طول المخرجات، ظروف الشبكة، وحمل الطلبات المتزامنة. قد يضيف توجيه OrcaRouter تأخيرًا بسيطًا. بالنسبة للتطبيقات في الوقت الفعلي، اختبر باستخدام مدد الصوت المتوقعة تحت الحمل.
تشمل نقاط القوة انخفاض تكلفة الإدخال ($1.00/1M tokens)، وسرعة التوليد، والبنية التحتية القوية من Google. حالة المعاينة تعني أن جودة النموذج وتوافره قد يتغيران. من القيود ارتفاع تكلفة الإخراج ($20.00/1M tokens) مقارنة بنماذج النصوص. بالإضافة إلى ذلك، جودة الصوت الناتج - مثل الطبيعية، تنوع اللهجات، والنبرة - لم يتم قياسها هنا. يجب عليك تقييم جودة صوت النموذج لمجالك المحدد (مثل المصطلحات التقنية، النطاق العاطفي) قبل النشر في الإنتاج.
لا توجد نتائج معيارية لـ google/gemini-3.1-flash-tts-preview في الحقائق المتاحة. غالبًا ما يتم تقييم نماذج تحويل النص إلى كلام (TTS) باستخدام مقاييس مثل متوسط درجة الرأي (MOS) للطبيعية، ومعدل الخطأ في الكلمات (WER) للوضوح، والنسب المئوية لزمن الاستجابة. بدون أرقام محددة، يجب عليك إجراء تقييمك الخاص باستخدام مطالبات تمثيلية لتقييم الجودة والسرعة مقارنة بمتطلباتك. لا يقوم OrcaRouter بإضافة أو تعديل أداء النموذج.
الحقائق المتاحة لا تحدد اللغات المدعومة أو قدرات النطق لهذه المعاينة من TTS. نماذج TTS الأوسع من Google تدعم عادةً لغات متعددة، ولكن تغطية هذا النوع المحدد غير معروفة. يجب أن تختبر بنصوص متعددة اللغات لتأكيد جودة المخرجات. بالنسبة للغة الإنجليزية، من المحتمل أن يكون الأداء قويًا نظرًا لاستثمار Google. بالنسبة للغات الأقل شيوعًا، فكر في الاتصال بـ Google مباشرةً أو اختبار النص عبر واجهة برمجة التطبيقات الخاصة بـ OrcaRouter.
تتبع التسعيرة أسعار Google الرسمية بدون أي زيادة من OrcaRouter. تبلغ تكلفة رموز الإدخال (النص) 1.00 دولار لكل مليون رمز. تبلغ تكلفة رموز الإخراج (الصوت) 20.00 دولار لكل مليون رمز. يتم إنشاء رموز الإخراج لكل وحدة صوتية؛ لم يتم تحديد النسبة الدقيقة بين الرموز والوقت. يتم محاسبتك على كل من رموز الإدخال والإخراج المستخدمة في كل طلب. لا توجد رسوم إضافية على المنصة أو متطلبات حد أدنى للإنفاق. يتم الفوترة عبر طرق الدفع الحالية لـ OrcaRouter.
رموز الإدخال أرخص بـ 20 مرة من رموز الإخراج. يحفز ذلك على إرسال مطالبات نصية أطول (ضمن حدود الرموز) لتوليد مخرجات صوتية أطول نسبيًا، إذ تظل تكلفة الإدخال منخفضة. على سبيل المثال، قد يستهلك إنشاء مقطع صوتي مدته دقيقة واحدة العديد من رموز الإخراج بسعر 20 دولارًا/1M، بينما قد تكلف المطالبة النصية بنسات قليلة فقط. قم بتحسين الأداء بإبقاء المخرجات موجزة كلما أمكن. إذا كانت حالة الاستخدام لديك تولد صوتًا طويلًا جدًا، فإن تكلفة الإخراج لكل طلب يمكن أن تتراكم بسرعة.
لا تذكر الحقائق المتاحة أي برامج تخزين مؤقت أو خصم لهذا النموذج على OrcaRouter. تسعير OrcaRouter هو تمريري بأسعار المزود. قد ترغب في مراجعة OrcaRouter لمعرفة أي خيارات خصم بالجملة أو سعة محجوزة يمكن تطبيقها عبر النماذج. نظرًا لأن تكلفة رمز الإخراج مرتفعة، فإن تخزين مقاطع الصوت المولدة مؤقتًا للاستخدام المتكرر (مثل الردود الشائعة) يمكن أن يقلل الإنفاق الإجمالي بشكل كبير.
المقارنات غير متوفرة بشكل مباشر. ومع ذلك، تم وضع Flash TTS من Google كخيار فعال من حيث التكلفة للاستخدام في الوقت الفعلي بتكلفة إدخال منخفضة. قد تختلف هياكل التسعير لنماذج TTS الأخرى (مثل OpenAI TTS وElevenLabs)—غالبًا ما تفرض رسومًا لكل حرف أو لكل ثانية من الصوت. قد يكون تسعير هذا النموذج لكل ناتج رمزي (per-token) أكثر تكلفة للصوت الطويل جدًا، ولكنه أرخص للتوليدات القصيرة والمتقطعة. قيّم أحجام الرموز المتوقعة لديك مقابل العروض الأخرى في كتالوج OrcaRouter.
استخدم أي عميل متوافق مع OpenAI. اضبط عنوان URL الأساسي على https://api.orcarouter.ai/v1، ومفتاح API من حساب OrcaRouter الخاص بك، ومعرف النموذج على "google/gemini-3.1-flash-tts-preview". أرسل طلب إكمال محادثة مع رسالة مستخدم تحتوي على النص المراد نطقه. سيحتوي الرد على محتوى صوتي (على الأرجح كقطعة مشفرة بـ base64 أو عنوان URL). يعتمد تنسيق الإخراج الدقيق على تنفيذ نموذج Google. راجع وثائق OrcaRouter للحصول على دعم التدفق وتحليل الردود.
تنطبق معاملات إكمال الدردشة القياسية: model، وmessages (مع role وcontent)، واختياريًا temperature أو top_p لتنوع المخرجات (على الرغم من أنها أقل صلة بـ TTS). بالنسبة لاختيار الصوت، قد يدعم نموذج Google معلمة إضافية (مثل اسم الصوت). لا تسرد الحقائق المتاحة معاملات TTS محددة. قد تحتاج إلى تمرير حقول إضافية مثل "voice" أو "language" في نص الطلب. يُرجى الرجوع إلى توثيق API الخاص بـ Google للنموذج التجريبي للحصول على الخيارات الدقيقة.
من الشائع أن تدعم نماذج تحويل النص إلى كلام (TTS) الصوت المتدفق، حيث يتم إرسال أجزاء الصوت أثناء توليدها. لا تؤكد الحقائق المقدمة دعم التدفق لهذا النموذج الأولي. إذا كان التدفق ممكّنًا، يمكنك استخدام معامل `stream` مضبوطًا على `true` في طلب API الخاص بك ومعالجة الأجزاء عند وصولها. يدعم OrcaRouter التدفق للنماذج المتوافقة. اختبر باستخدام طلب بسيط لمعرفة ما إذا كان الصوت يُرجع بشكل تدريجي أو ككتلة كاملة.
إذا كنت تستخدم بالفعل واجهة برمجة تطبيقات متوافقة مع OpenAI، فغيّر عنوان URL الأساسي إلى https://api.orcarouter.ai/v1 وحدّث معرف النموذج. قم بتعديل معلمات طلبك لتتوافق مع مواصفات TTS من Google (مثل اسم الصوت). قد تحتاج إلى تعديل معالجة مخرجات الصوت إذا كان التنسيق مختلفًا (مثل MP3 مقابل WAV). اختبر باستخدام نماذج تجريبية للتحقق من الجودة. نظرًا لأن التسعير بدون هامش ربح، فقد تتغير تكاليفك بناءً على استخدام الرموز. لا حاجة لأدوات ترحيل خاصة.
تقدم OpenAI نماذج TTS (tts-1, tts-1-hd) بتسعير يعتمد على عدد الأحرف (حوالي 0.015 دولار لكل 1000 حرف). في المقابل، يستخدم نموذج Google تسعيرًا يعتمد على الرموز (tokens)، والذي قد يكون أكثر اقتصادًا للمدخلات القصيرة ولكنه أكثر تكلفة للمخرجات الطويلة. يدعم TTS من OpenAI أصواتًا ولغات متعددة؛ بينما تفاصيل نموذج Google الأولي ليست معروفة بالكامل. زمن الاستجابة: كلا من Flash ونماذج OpenAI مصممة لزمن استجابة منخفض. الجودة أمر ذاتي؛ يجب عليك اختبار المحتوى الخاص بك لمقارنة الطبيعة الطبيعية والنبرة.
توفر جوجل أيضًا نماذج TTS متميزة (مثل WaveNet وStudio) عبر واجهة Cloud Text-to-Speech API الخاصة بها. تتقاضى هذه النماذج عادةً رسومًا لكل حرف من النص المُرسل، مما قد يكون أرخص للمحتوى الصوتي الطويل جدًا، لكن بتكلفة أعلى لكل طلب. يُعد Flash TTS أسرع وله تسعير إدخال أبسط (لكل رمز مميز)، لكنه قد يوفر خيارات صوتية أقل. للحصول على صوت عالي الدقة وغني بالعواطف، قد يكون النموذج المتميز أفضل. أما بالنسبة للسرعة والتكلفة المنخفضة لكل إدخال، فلها ميزة في إصدار Flash.
إذا كنت بحاجة إلى استجابة فورية ولديك نصوص إدخال قصيرة (طلبات صغيرة متعددة)، فإن نموذج Flash هذا ذو تكلفة الإدخال المنخفضة والتوليد السريع يعد مثاليًا. أما بالنسبة لتوليد الصوت الطويل جدًا (مثل الكتب الصوتية الكاملة)، فقد يكون النموذج الذي يفرض رسومًا لكل حرف إدخال (مثل خدمة TTS القياسية من Google) أرخص، حيث يتم تجنب تكلفة رموز الإخراج. ضع في اعتبارك أيضًا تنوع الأصوات ودعم اللغات: إذا كنت بحاجة إلى العديد من الأصوات المميزة، فتأكد مما إذا كانت هذه المعاينة تدعم ذلك. اختبر كلا الخيارين مع عبء العمل الخاص بك قبل الالتزام.
متوافق مع OpenAI — أبقِ على SDK الحالي
https://api.orcarouter.ai/v1voice| الإدخال / 1M توكن | $1.00 |
| الإخراج / 1M توكن | $20.00 |
| العملة | USD |
تقدير بناءً على السعر المُعلن
تقدير فقط — يعتمد العدد الفعلي للرموز على مُجزّئ الرموز الخاص بالمزوّد.
GET /api/public/models/google/gemini-3.1-flash-tts-previewفتح @misc{orcarouter_gemini_3_1_flash_tts_preview,
title = {google/gemini-3.1-flash-tts-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview}
}google. (n.d.). google/gemini-3.1-flash-tts-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview