Google Gemini 2.5 Pro preview مع TTS، يتم الوصول إليها عبر OrcaRouter بدون أي رسوم إضافية.
google/gemini-2.5-pro-preview-tts هو نموذج نص إلى كلام تجريبي من Google، مبني على أساس Gemini 2.5 Pro. يحول الإدخال النصي إلى مخرجات صوتية منطوقة. يمكن الوصول إلى النموذج عبر واجهة برمجة التطبيقات…
القدرة الأساسية لنموذج google/gemini-2.5-pro-preview-tts هي تحويل النص المكتوب إلى صوت منطوق. وهو مبني على نموذج Gemini 2.5 Pro من Google، مما يشير إلى فهم قوي للغة، مما ينبغي أن يؤدي إلى صياغة طبيعية، ونبرة مناسبة، ونطق واضح. يقبل النموذج إدخال النص فقط، لذا فهو ليس متعدد الوسائط على جانب الإدخال. لا يتعامل مع إدخال الصوت أو الصور أو الفيديو. من المرجح أن يكون الإخراج صوتًا بتنسيق رقمي قياسي. كنموذج تحويل نص إلى كلام، يمكنه التعامل مع لغات متعددة، ولكن لم يتم الكشف عن دعم لغات محددة لهذه المعاينة. وهو محسّن لتوليد الكلام، وليس لقدرات Gemini 2.5 Pro الأخرى مثل الاستدلال أو توليد الكود.
النموذج يتفوق في التطبيقات التي تتطلب تحويل النص المكتوب إلى كلام طبيعي الصوت. أفضل حالات الاستخدام تشمل المساعدات الصوتية حيث يقرأ المساعد الردود بصوت عالٍ، والسرد الآلي للكتب الصوتية والبودكاست، وميزات الوصول التي تقرأ النص على الشاشة للمستخدمين ضعاف البصر، وأنظمة خدمة العملاء التي تقدم ردودًا منطوقة. يمكن استخدامه أيضًا في تطبيقات تعلم اللغة حيث يتم نمذجة النطق الصحيح، أو لتوليد محتوى صوتي من خلاصات RSS أو المقالات. نظرًا لحالته التجريبية، يُنصح بالاختبار الشامل للغة أو المجال أو متطلبات الأسلوب الخاصة بك قبل الالتزام بالنشر على نطاق واسع.
بينما يوفر google/gemini-2.5-pro-preview-tts جودة TTS متميزة، قد يكون مبالغًا فيه للاستخدامات البسيطة مثل أصوات التنبيه أو الإشعارات، أو للتطبيقات التي يكون فيها زمن الوصول المنخفض أمرًا بالغ الأهمية ولكن وقت معالجة النموذج أطول من رقائق TTS المخصصة. إذا كنت تحتاج فقط إلى كلام أساسي أحادي النغمة أو لديك حجم كبير جدًا مع قيود ميزانية صارمة، فقد يكون نموذج TTS أخف (على سبيل المثال، من موفري آخرين على OrcaRouter) بتكاليف أقل لكل رمز أكثر ملاءمة. أيضًا، إذا كانت حالة الاستخدام الخاصة بك تتطلب البث في الوقت الفعلي مع زمن وصول منخفض للغاية، فقم بتقييم ما إذا كان النموذج التجريبي لـ Gemini يلبي متطلبات السرعة الخاصة بك، حيث يمكن للنماذج الأكبر أن تؤدي إلى زمن وصول أعلى للرمز الأول.
اعتبارًا من إصدار المعاينة للنموذج، لم تنشر جوجل نتائج معايير محددة لنموذج gemini-2.5-pro-preview-tts. النموذج الأساسي Gemini 2.5 Pro أظهر أداءً قويًا في مهام فهم اللغة والاستدلال، لكن مقاييس جودة الصوت لنموذج تحويل النص إلى كلام (مثل Mean Opinion Score وWord Error Rate) لم تتم مشاركتها علنًا. بدون معايير رسمية، توصي OrcaRouter بتقييم النموذج على مجموعة الاختبار الخاصة بك من مدخلات النص، وقياس جودة الصوت الذاتية، وزمن الاستجابة، والموثوقية تحت الحمل. بالنسبة لقرارات الإنتاج، قم بإجراء مقارنات A/B الخاصة بك ضد خدمات تحويل النص إلى كلام الأخرى.
لم يتم الكشف علنًا عن أرقام زمن الاستجابة الدقيقة لنموذج google/gemini-2.5-pro-preview-tts. باعتباره نموذج TTS يعتمد على بنية نموذج لغوي كبير، فقد يُظهر زمن استجابة أعلى مقارنة بنماذج TTS العصبية المتخصصة المُحسّنة للبث المباشر في الوقت الفعلي. تشمل العوامل المؤثرة على السرعة طول النص المدخل، ووقت المعالجة الداخلية للنموذج، وزمن الرحلة ذهابًا وإيابًا عبر الشبكة إلى نقاط نهاية OrcaRouter. بالنسبة للتطبيقات التي يكون فيها زمن الاستجابة المنخفض أمرًا بالغ الأهمية (مثل الذكاء الاصطناعي التحادثي)، اختبر هذا النموذج بأطوال إدخال نموذجية لتقييم مدى ملاءمته. فكر في استخدام التوليد المتدفق أو النص المُجزّأ إذا كانت واجهة برمجة التطبيقات تدعم ذلك.
نقاط القوة: مبني على بنية Google Gemini 2.5 Pro المتقدمة، مما يجعله يُنتج كلامًا طبيعيًا ومعبّرًا للغاية مع نبرة ونطق جيدين. الوصول عبر واجهة OrcaRouter المتوافقة مع OpenAI يُبسّط التكامل. عدم وجود زيادات على تسعير المزوّد يجعله متوقع التكلفة. القيود: طريقة الإدخال هي النص فقط؛ لا يمكنه معالجة الصوت أو غيره من الوسائط. كونه إصدارًا تجريبيًا، قد يحتوي على حالات حافة غير مكتشفة أو جودة غير متناسقة. حجم نافذة السياق غير معروف، مما يحد من طول النص الذي يمكن تحويله في طلب واحد. تفاصيل تنسيق الإخراج غير متوفرة. غير مصمم لمهام مثل التعرف على الكلام أو استنساخ الصوت.
تسعير خدمة google/gemini-2.5-pro-preview-tts يعتمد على استهلاك الرموز (tokens)، حيث يتم تحصيل $1.00 لكل مليون رمز إدخال و $20.00 لكل مليون رمز إخراج. تشمل رموز الإدخال النص الموجه والتعليمات. وتمثل رموز الإخراج الصوت المُنشأ. تقوم OrcaRouter بإصدار الفواتير بسعر المزوّد نفسه دون أي هامش ربح، مما يعني أنك تدفع فقط ما تفرضه Google، بالإضافة إلى أي ضرائب سارية. لا توجد حد أدنى للالتزام أو رسوم شهرية. يتم قياس الاستخدام لكل طلب وتجميعه في فاتورة OrcaRouter الخاصة بك. ونظرًا لأن عدد رموز إخراج TTS قد يكون مرتفعًا (حيث أن الصوت أكثر كثافة من حيث الرموز مقارنة بالنص)، فإن تكلفة الإخراج هي النفقات الرئيسية.
سعر رمز المخرجات ($20 per 1M) أعلى بكثير من سعر رمز المدخلات ($1 per 1M). هذا أمر معتاد للنماذج التوليدية لأن رموز المخرجات تتطلب قوة معالجة أكبر. بالنسبة لتحويل النص إلى كلام، يتم تمثيل المخرج الصوتي كسلسلة من الرموز، ويتضمن تحويل النص إلى كلام توليد سلسلة طويلة من رموز الصوت. تعتمد التكلفة الإجمالية لمهمة معينة على طول الصوت الناتج مقارنة بنص الإدخال. إذا كنت بحاجة إلى توليد مقاطع طويلة من الكلام (على سبيل المثال، كتاب صوتي كامل)، فقد تتراكم التكاليف. بالنسبة للمطالبات القصيرة (على سبيل المثال، جملة واحدة)، تكون التكاليف ضئيلة. راقب استخدامك للرموز لتوقع التكاليف.
لا، لا يضيف OrcaRouter أي هامش ربح إلى سعر المزود لـ google/gemini-2.5-pro-preview-tts. الأسعار المذكورة البالغة 1.00 دولار لكل مليون رمز إدخال و20.00 دولار لكل مليون رمز إخراج هي بالضبط ما تفرضه Google. يقوم OrcaRouter بتمريرها إليك مباشرة. يتوافق هذا مع نموذج التسعير الخاص بـ OrcaRouter للعديد من النماذج حيث تعمل المنصة كوسيط شفاف. أنت تدفع فقط مقابل الرموز المميزة التي تستهلكها. قد تخضع أي ميزات اختيارية مثل التخزين المؤقت أو الدعم المميز لرسوم منفصلة، لكن التكلفة الأساسية لكل رمز مميز لا تتضمن أي هامش ربح.
لاستخدام google/gemini-2.5-pro-preview-tts، قم بإرسال الطلبات إلى واجهة برمجة التطبيقات المتوافقة مع OpenAI من OrcaRouter على عنوان URL الأساسي https://api.orcarouter.ai/v1. استخدم معرف النموذج 'google/gemini-2.5-pro-preview-tts' في استدعاءات واجهة برمجة التطبيقات الخاصة بك. يتبع تنسيق الطلب هيكل إكمال المحادثة القياسي من OpenAI مع حقل 'model'، ومصفوفة 'messages' تحتوي على نص الطلب الخاص بك (مع دور النظام و/أو المستخدم)، ومعلمات قياسية مثل temperature وmax_tokens. سيحتوي الرد على رموز صوتية مولدة، يمكن لعميلك فك تشفيرها لتشغيلها ككلام. يتم المصادقة عبر مفتاح API يوفره OrcaRouter.
تدعم واجهة برمجة التطبيقات (API) معاملات متوافقة مع OpenAI القياسية بما في ذلك 'model', 'messages' (مصفوفة من الكائنات التي تحتوي على role و content), 'temperature' (للتحكم في تباين المخرجات الصوتية), 'max_tokens' (لتحديد طول الصوت المُنشأ), و 'top_p'. باعتبارها نموذج TTS، قد يكون هناك معاملات إضافية لنمط الصوت أو السرعة، ولكن لم يتم توثيق هذه المعاملات في الحقائق المتاحة. يُرجى الرجوع إلى توثيق واجهة برمجة التطبيقات (API) الخاصة بـ OrcaRouter للحصول على أحدث الحقول المدعومة. قد يسمح معامل 'response_format' بتحديد ترميز الصوت (مثل wav أو mp3). إذا لم يكن ذلك مدعومًا افتراضيًا، فقد تحتاج إلى فك تشفير تدفق الرموز المُعاد.
إذا كنت تستخدم حاليًا خدمة TTS مختلفة (مثل Google Cloud Text-to-Speech، Amazon Polly)، فإن الانتقال إلى google/gemini-2.5-pro-preview-tts عبر OrcaRouter يتضمن تحديث نقطة نهاية API وتنسيق الطلب. يستخدم OrcaRouter نقاط نهاية متوافقة مع OpenAI، لذا ستتحول من SDK خاص بمزود خدمة إلى نقطة نهاية متوافقة مع OpenAI. استبدل عنوان URL الأساسي الحالي بـ https://api.orcarouter.ai/v1، واستخدم معرف النموذج 'google/gemini-2.5-pro-preview-tts'، واضبط نصوص الطلب لتتوافق مع مخطط chat completions. قد تحتاج إلى تعديل طريقة معالجتك للرد: بدلاً من استقبال ملفات صوتية مباشرة، ستحصل على مخرجات مميزة (tokenized) ستحتاج إلى فك تشفيرها. اختبر باستخدام مدخلات نموذجية.
يتم إجراء المصادقة عن طريق تضمين مفتاح API في رأس Authorization (التنسيق: Bearer YOUR_API_KEY). تحصل على مفتاح API من حساب OrcaRouter الخاص بك. يتم تعيين حدود المعدل بواسطة OrcaRouter بناءً على خطتك؛ وهي ليست مماثلة لحدود Google. بالنسبة للاستخدام عالي الحجم، اتصل بـ OrcaRouter لتعديل الحدود. قد يحتوي نموذج المعاينة على قيود إضافية من Google – إذا واجهت أخطاء مثل "النموذج غير متاح"، تحقق من أن خطتك في OrcaRouter تتضمن هذا النموذج. لا توجد حدود معدل محددة معلنة لهذا النموذج، ولكن يُنصح باتباع أفضل الممارسات القياسية (إعادة المحاولة مع التراجع الأسي).
google/gemini-2.5-pro-preview-tts هو متغير متخصص من عائلة Gemini 2.5 Pro مُصمم لتحويل النص إلى كلام. نماذج Gemini 2.5 Pro الأخرى متعددة الأغراض وتتعامل مع إدخال النصوص والصور والصوت والفيديو؛ ولا تولد مخرجات كلامية بشكل أصلي. هذا المتغير الخاص بـ TTS يُزيل الإدخال متعدد الوسائط ويُركز على توليد الصوت من النص. من المحتمل أنه يستخدم نفس الفهم اللغوي الأساسي لضبط الإيقاع والتنغيم، لكنه غير مناسب للاستدلال أو البرمجة أو التحليل متعدد الوسائط. إذا كنت بحاجة إلى قدرات TTS دون التخلي عن الإدخال متعدد الوسائط، يمكنك الجمع بين نموذج Gemini قياسي وخط أنابيب TTS منفصل. يوفر TTS الأولي (preview) خط أنابيب أكثر انسيابية.
يقدم OrcaRouter إمكانية الوصول إلى نماذج تحويل النص إلى كلام (TTS) من مزودين مختلفين. يعتمد هذا النموذج من Google على بنية نموذج لغوي كبير، مما قد يُنتج خطابًا أكثر طبيعية ووعيًا بالسياق مقارنةً بأنظمة TTS التجميعية أو المعلمية الأقدم. ومع ذلك، قد يكون أبطأ وأكثر تكلفة لكل توكن مقارنةً بنماذج TTS العصبية المتخصصة المصممة للاستجابة المنخفضة والإنتاجية العالية. تفرض العديد من خدمات TTS الشائعة رسومًا لكل حرف أو لكل ثانية من الصوت، وليس لكل توكن، مما يجعل المقارنة المباشرة للتكلفة صعبة. بالنسبة للنشر في بيئات الإنتاج التي تتطلب تكلفة منخفضة للغاية، قد تكون نماذج TTS المخصصة أفضل. نموذج Google هو الأنسب لحالات الاستخدام التي تبرر فيها أعلى جودة للمخرجات التكلفة الأعلى لكل توكن.
اختر هذا النموذج إذا كنت بحاجة إلى جودة صوت متطورة من أحدث بنية Gemini من Google وتريد الوصول إليها عبر واجهة برمجة تطبيقات متوافقة مع OpenAI القياسية دون إدارة بيانات اعتماد Google Cloud. تضمن التسعير بدون هامش ربح الشفافية. إنه مثالي للتطبيقات حيث تكون الطبيعية أمرًا بالغ الأهمية، مثل الذكاء الاصطناعي التحادثي أو المحتوى السردي. تسمح حالة المعاينة بالتجريب المبكر لتقييم جودته لمجالك. ومع ذلك، إذا كنت بحاجة إلى تدفق فوري مع زمن وصول أقل من 100 مللي ثانية، فقد يكون نموذج TTS المخصص للتدفق أفضل. أيضًا، إذا كانت ميزانيتك حساسة، فاختبر استهلاك رمز الإخراج لحالات الاستخدام النموذجية لضمان أن التكلفة مقبولة.
متوافق مع OpenAI — أبقِ على SDK الحالي
https://api.orcarouter.ai/v1voice| الإدخال / 1M توكن | $1.00 |
| الإخراج / 1M توكن | $20.00 |
| العملة | USD |
تقدير بناءً على السعر المُعلن
تقدير فقط — يعتمد العدد الفعلي للرموز على مُجزّئ الرموز الخاص بالمزوّد.
ما يتحدث عنه المطورون هذا الأسبوع
GET /api/public/models/google/gemini-2.5-pro-preview-ttsفتح @misc{orcarouter_gemini_2_5_pro_preview_tts,
title = {google/gemini-2.5-pro-preview-tts API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts}
}google. (n.d.). google/gemini-2.5-pro-preview-tts API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts