Google Gemini 2.5 Pro preview พร้อม TTS เข้าถึงผ่าน OrcaRouter โดยไม่มีส่วนเพิ่ม
google/gemini-2.5-pro-preview-tts เป็นโมเดลข้อความเป็นเสียงพูด (text-to-speech) รุ่นตัวอย่างโดย Google ซึ่งสร้างขึ้นบนรากฐานของ Gemini 2.5 Pro โมเดลนี้แปลงอินพุตข้อความเป็นเอาต์พุตเสียงพูด…
ความสามารถหลักของ google/gemini-2.5-pro-preview-tts คือการแปลงข้อความที่เขียนเป็นเสียงพูด โดยสร้างขึ้นบน Google Gemini 2.5 Pro ซึ่งบ่งชี้ถึงความเข้าใจภาษาที่แข็งแกร่ง ส่งผลให้มีการเรียบเรียงคำที่เป็นธรรมชาติ น้ำเสียงที่เหมาะสม และการออกเสียงที่ชัดเจน โมเดลนี้รองรับเฉพาะอินพุตข้อความเท่านั้น ดังนั้นจึงไม่ใช่ multimodal ทางด้านอินพุต และไม่รองรับอินพุตเสียง รูปภาพ หรือวิดีโอ ผลลัพธ์น่าจะเป็นเสียงในรูปแบบดิจิทัลมาตรฐาน ในฐานะโมเดล TTS สามารถรองรับได้หลายภาษา แต่การรองรับภาษาเฉพาะยังไม่ถูกเปิดเผยสำหรับพรีวิวนี้ โมเดลนี้ปรับให้เหมาะสมสำหรับการสร้างเสียงพูด ไม่ใช่สำหรับความสามารถอื่นๆ ของ Gemini 2.5 Pro เช่น การให้เหตุผลหรือการสร้างโค้ด
โมเดลนี้มีความโดดเด่นในงานที่ต้องแปลงข้อความที่เขียนให้เป็นเสียงพูดที่ฟังเป็นธรรมชาติ กรณีการใช้งานที่ดีที่สุด ได้แก่ ผู้ช่วยเสียงที่ผู้ช่วยอ่านคำตอบออกเสียง การบรรยายหนังสือเสียงและพอดแคสต์อัตโนมัติ คุณสมบัติการช่วยสำหรับการเข้าถึงที่อ่านข้อความบนหน้าจอให้ผู้ใช้ที่มีความบกพร่องทางการมองเห็น และระบบบริการลูกค้าที่ให้คำตอบด้วยเสียงพูด นอกจากนี้ยังสามารถใช้สำหรับแอปพลิเคชันการเรียนรู้ภาษา ซึ่งจำลองการออกเสียงที่ถูกต้อง หรือสำหรับสร้างเนื้อหาเสียงจากฟีด RSS หรือบทความ เนื่องจากอยู่ในสถานะพรีวิว จึงควรทดสอบอย่างละเอียดสำหรับภาษา โดเมน หรือข้อกำหนดด้านรูปแบบเฉพาะของคุณก่อนดำเนินการปรับใช้ในวงกว้าง
แม้ว่า google/gemini-2.5-pro-preview-tts จะให้คุณภาพ TTS ระดับพรีเมียม แต่อาจมากเกินไปสำหรับเสียงบีบง่ายๆ หรือเสียงแจ้งเตือน หรือสำหรับแอปพลิเคชันที่ความหน่วงต่ำเป็นสิ่งสำคัญ แต่เวลาประมวลผลของโมเดลยาวนานกว่าชิป TTS เฉพาะ หากคุณต้องการเพียงเสียงพูดพื้นฐานแบบเรียบๆ หรือมีปริมาณการใช้งานสูงมากและมีข้อจำกัดด้านงบประมาณที่เข้มงวด โมเดล TTS ที่เบากว่า (เช่น จากผู้ให้บริการอื่นบน OrcaRouter) ที่มีต้นทุนต่อโทเค็นต่ำกว่าอาจเหมาะสมกว่า นอกจากนี้ หากกรณีการใช้งานของคุณต้องการสตรีมมิงแบบเรียลไทม์ที่มีความหน่วงต่ำมาก ให้ประเมินว่าโมเดลพรีวิวของ Gemini ตรงตามข้อกำหนดด้านความเร็วของคุณหรือไม่ เนื่องจากโมเดลที่ใหญ่กว่าอาจทำให้เกิดความหน่วงของโทเค็นแรกที่สูงขึ้น
ณ ขณะที่โมเดลอยู่ในช่วงพรีวิว Google ยังไม่เผยแพร่คะแนน benchmark เฉพาะสำหรับ variant gemini-2.5-pro-preview-tts โมเดลพื้นฐาน Gemini 2.5 Pro แสดงประสิทธิภาพที่แข็งแกร่งในงานด้านความเข้าใจภาษาและการใช้เหตุผล แต่ metrics คุณภาพเสียงของ variant TTS (เช่น Mean Opinion Score, Word Error Rate) ยังไม่ได้ถูกเปิดเผยต่อสาธารณะ หากไม่มี benchmark อย่างเป็นทางการ OrcaRouter แนะนำให้ประเมินโมเดลด้วยชุดทดสอบข้อความเข้าของคุณเอง โดยวัดคุณภาพเสียงตามอัตวิสัย เวลาแฝง และความน่าเชื่อถือภายใต้โหลด สำหรับการตัดสินใจในระดับโปรดักชัน ให้ทำการเปรียบเทียบ A/B ของคุณเองกับบริการ TTS อื่นๆ
ตัวเลขความหน่วงเฉพาะสำหรับ google/gemini-2.5-pro-preview-tts ยังไม่ได้รับการเปิดเผยต่อสาธารณะ เนื่องจากเป็นโมเดล TTS ที่ใช้สถาปัตยกรรม Large Language Model อาจมีความหน่วงสูงกว่าเมื่อเทียบกับโมเดล TTS เชิงประสาทที่ออกแบบมาเฉพาะซึ่งถูกปรับให้เหมาะสมสำหรับการสตรีมแบบเรียลไทม์ ปัจจัยที่มีผลต่อความเร็ว ได้แก่ ความยาวของข้อความที่ป้อน เวลาประมวลผลภายในของโมเดล และการเดินทางไปกลับของเครือข่ายไปยังเอนด์พอยต์ของ OrcaRouter สำหรับแอปพลิเคชันที่ความหน่วงต่ำมีความสำคัญ (เช่น AI การสนทนา) ให้ทดสอบโมเดลนี้ด้วยความยาวของอินพุตทั่วไปเพื่อวัดความเหมาะสม พิจารณาใช้การสตรีมหรือการสร้างข้อความแบบแบ่งส่วนหาก API รองรับ
จุดแข็ง: สร้างจากสถาปัตยกรรม Gemini 2.5 Pro ขั้นสูงของ Google ซึ่งน่าจะสร้างเสียงพูดที่เป็นธรรมชาติและสื่ออารมณ์ได้ดี พร้อมการออกเสียงและการเน้นเสียงที่เหมาะสม การเข้าถึงผ่าน API ที่เข้ากันได้กับ OpenAI ของ OrcaRouter ช่วยให้การรวมระบบง่ายขึ้น การไม่มี markup บนราคาจากผู้ให้บริการทำให้คาดการณ์ค่าใช้จ่ายได้ ข้อจำกัด: รูปแบบอินพุตเป็นข้อความเท่านั้น ไม่สามารถประมวลผลเสียงหรือรูปแบบอื่นๆ ได้ เนื่องจากเป็นเวอร์ชันพรีวิว อาจมีกรณีขอบที่ยังไม่ถูกค้นพบหรือคุณภาพที่ไม่สม่ำเสมอ ขนาดหน้าต่างบริบท (context window) ไม่เป็นที่ทราบ ซึ่งจำกัดความยาวของข้อความที่สามารถแปลงได้ในคำขอเดียว รายละเอียดรูปแบบเอาต์พุตไม่ได้ระบุไว้ ไม่ได้ออกแบบมาสำหรับงานต่างๆ เช่น การรู้จำเสียงหรือการโคลนเสียง
การกำหนดราคาสำหรับ google/gemini-2.5-pro-preview-tts ขึ้นอยู่กับการใช้งานโทเค็น โดยคิดค่าใช้จ่าย $1.00 ต่อ 1 ล้านโทเค็นอินพุต และ $20.00 ต่อ 1 ล้านโทเค็นเอาต์พุต โทเค็นอินพุตประกอบด้วยข้อความแจ้งและคำแนะนำใดๆ โทเค็นเอาต์พุตแทนเสียงที่สร้างขึ้น OrcaRouter คิดค่าใช้จ่ายตามอัตราของผู้ให้บริการโดยตรงโดยไม่มีค่าธรรมเนียมเพิ่ม หมายความว่าคุณจ่ายเฉพาะในสิ่งที่ Google เรียกเก็บเท่านั้น บวกกับภาษีที่เกี่ยวข้อง ไม่มีข้อผูกมัดขั้นต่ำหรือค่าธรรมเนียมรายเดือน การใช้งานจะถูกวัดตามคำขอและรวมในใบแจ้งหนี้ OrcaRouter ของคุณ เนื่องจากจำนวนโทเค็นเอาต์พุตของ TTS อาจสูง (เสียงมีความหนาแน่นของโทเค็นมากกว่าข้อความ) ค่าใช้จ่ายด้านเอาต์พุตจึงเป็นค่าใช้จ่ายหลัก
ราคาของ token เอาต์พุต ($20 ต่อ 1M) สูงกว่า token อินพุต ($1 ต่อ 1M) อย่างมีนัยสำคัญ นี่เป็นเรื่องปกติสำหรับโมเดลเชิงกำเนิดเนื่องจาก token เอาต์พุตต้องการการคำนวณที่มากกว่า สำหรับข้อความเป็นเสียง เอาต์พุตเสียงจะถูกแสดงเป็นชุดของ token และการแปลงข้อความเป็นเสียงเกี่ยวข้องกับการสร้างลำดับ token เสียงที่ยาว ต้นทุนรวมสำหรับงานเฉพาะขึ้นอยู่กับความยาวของเอาต์พุตเสียงเมื่อเทียบกับข้อความอินพุต หากคุณต้องการสร้างเสียงพูดในระยะยาว (เช่น หนังสือเสียงทั้งเล่ม) ต้นทุนอาจสะสม สำหรับคำสั่งสั้นๆ (เช่น ประโยคเดียว) ต้นทุนจะน้อยมาก ติดตามการใช้งาน token ของคุณเพื่อประมาณการต้นทุน
ไม่ OrcaRouter ไม่ได้เพิ่มมาร์กอัปใด ๆ ให้กับอัตราค่าบริการของผู้ให้บริการสำหรับ google/gemini-2.5-pro-preview-tts ราคาที่ระบุไว้ที่ $1.00 ต่อ 1M input tokens และ $20.00 ต่อ 1M output tokens เป็นราคาที่ Google คิดจริง ๆ OrcaRouter ส่งผ่านราคาเหล่านี้ถึงคุณโดยตรง ซึ่งสอดคล้องกับโมเดลการกำหนดราคาของ OrcaRouter สำหรับหลายโมเดลที่แพลตฟอร์มทำหน้าที่เป็นพร็อกซีโปร่งใส คุณจ่ายเฉพาะโทเค็นที่คุณใช้เท่านั้น คุณสมบัติเสริมใด ๆ เช่น การแคชหรือการสนับสนุนระดับพรีเมียมอาจมีค่าธรรมเนียมแยกต่างหาก แต่ต้นทุนพื้นฐานต่อโทเค็นไม่มีมาร์กอัป
หากต้องการใช้ google/gemini-2.5-pro-preview-tts ให้ส่งคำขอไปยัง API ที่เข้ากันได้กับ OpenAI ของ OrcaRouter ที่ URL ฐาน https://api.orcarouter.ai/v1 ใช้รหัสโมเดล 'google/gemini-2.5-pro-preview-tts' ในการเรียก API ของคุณ รูปแบบคำขอเป็นไปตามโครงสร้าง OpenAI chat completions มาตรฐาน โดยมีฟิลด์ 'model' อาร์เรย์ 'messages' ที่มีข้อความแจ้งของคุณ (พร้อมบทบาท system และ/หรือ user) และพารามิเตอร์มาตรฐาน เช่น temperature และ max_tokens การตอบกลับจะประกอบด้วยโทเค็นเสียงที่สร้างขึ้น ซึ่งไคลเอนต์ของคุณสามารถถอดรหัสเพื่อเล่นเป็นเสียงพูดได้ การตรวจสอบสิทธิ์ทำผ่านคีย์ API ที่ OrcaRouter ให้มา
API รองรับพารามิเตอร์ที่เข้ากันได้กับ OpenAI มาตรฐานรวมถึง 'model', 'messages' (อาร์เรย์ของออบเจ็กต์ที่มี role และ content), 'temperature' (สำหรับควบคุมความแปรปรวนของเอาต์พุตเสียง), 'max_tokens' (เพื่อจำกัดความยาวของเสียงที่สร้าง), และ 'top_p' ในฐานะโมเดล TTS อาจมีพารามิเตอร์เพิ่มเติมสำหรับสไตล์เสียงหรือความเร็ว แต่ยังไม่มีเอกสารในข้อเท็จจริงที่มีอยู่ โปรดดูเอกสาร API ของ OrcaRouter สำหรับฟิลด์ที่รองรับล่าสุด พารามิเตอร์ 'response_format' อาจอนุญาตให้ระบุการเข้ารหัสเสียง (เช่น wav หรือ mp3) หากไม่รองรับโดยค่าเริ่มต้น คุณอาจต้องถอดรหัสสตรีมโทเค็นที่ส่งคืน
หากคุณกำลังใช้บริการ TTS อื่นอยู่ (เช่น Google Cloud Text-to-Speech, Amazon Polly) การย้ายไปยัง google/gemini-2.5-pro-preview-tts ผ่าน OrcaRouter จะเกี่ยวข้องกับการอัปเดต API endpoint และรูปแบบคำขอของคุณ OrcaRouter ใช้ endpoints ที่เข้ากันได้กับ OpenAI ดังนั้นคุณจะเปลี่ยนจาก SDK ที่เฉพาะเจาะจงกับผู้ให้บริการไปเป็นแบบที่เข้ากันได้กับ OpenAI แทนที่ base URL ที่มีอยู่ด้วย https://api.orcarouter.ai/v1 ใช้รหัสโมเดล 'google/gemini-2.5-pro-preview-tts' และปรับ request bodies ของคุณให้ตรงกับรูปแบบ chat completions คุณอาจต้องปรับเปลี่ยนวิธีจัดการการตอบกลับ: แทนที่จะรับไฟล์เสียงโดยตรง คุณจะได้รับผลลัพธ์แบบ tokenized ที่คุณต้องถอดรหัส ทดสอบด้วย input ตัวอย่าง
การตรวจสอบสิทธิ์ทำได้โดยรวมคีย์ API ไว้ในส่วนหัว Authorization (รูปแบบ: Bearer YOUR_API_KEY) คุณได้รับคีย์ API จากบัญชี OrcaRouter ของคุณ ข้อจำกัดอัตราการใช้งานถูกกำหนดโดย OrcaRouter ตามแผนของคุณ ซึ่งไม่เหมือนกับข้อจำกัดของ Google สำหรับการใช้งานปริมาณมาก โปรดติดต่อ OrcaRouter เพื่อปรับเปลี่ยนข้อจำกัด โมเดลตัวอย่างอาจมีข้อจำกัดเพิ่มเติมจาก Google – หากคุณพบข้อผิดพลาดเช่น 'model not available' โปรดตรวจสอบว่าแผน OrcaRouter ของคุณรวมโมเดลนี้ไว้ ไม่มีข้อจำกัดอัตราการใช้งานเฉพาะสำหรับโมเดลนี้ที่เปิดเผย แต่แนะนำให้ปฏิบัติตามแนวทางปฏิบัติที่ดีที่สุดมาตรฐาน (ลองใหม่แบบเพิ่มระยะเวลารอแบบเลขชี้กำลัง)
google/gemini-2.5-pro-preview-tts เป็นรุ่นเฉพาะของตระกูล Gemini 2.5 Pro ที่ปรับแต่งมาสำหรับการแปลงข้อความเป็นเสียง (TTS) โมเดลอื่นๆ ในตระกูล Gemini 2.5 Pro เป็นโมเดลอเนกประสงค์ที่รองรับการป้อนข้อมูลข้อความ รูปภาพ เสียง และวิดีโอ แต่ไม่ได้สร้างเอาต์พุตเสียงโดยตรง รุ่น TTS นี้ได้ตัดความสามารถในการรับข้อมูลหลายรูปแบบ (multimodal input) ออก และเน้นที่การสร้างเสียงจากข้อความ มีแนวโน้มว่าจะใช้ความเข้าใจภาษาเดียวกันในระดับพื้นฐานสำหรับการควบคุมจังหวะและการพูด แต่ไม่เหมาะสมสำหรับการให้เหตุผล การเขียนโค้ด หรือการวิเคราะห์ข้อมูลหลายรูปแบบ หากคุณต้องการความสามารถ TTS โดยไม่ละทิ้งการป้อนข้อมูลหลายรูปแบบ คุณจะต้องรวมโมเดล Gemini มาตรฐานเข้ากับไปป์ไลน์ TTS แยกต่างหาก รุ่น TTS แบบพรีวิวนี้นำเสนอไปป์ไลน์ที่คล่องตัวกว่า
OrcaRouter ให้บริการเข้าถึงโมเดล TTS จากผู้ให้บริการต่างๆ โมเดลนี้จาก Google มีพื้นฐานมาจากสถาปัตยกรรมโมเดลภาษาขนาดใหญ่ ซึ่งอาจสร้างคำพูดที่เป็นธรรมชาติและเข้าใจบริบทมากกว่าระบบ TTS แบบต่อเรียงหรือพารามิเตอร์รุ่นเก่า อย่างไรก็ตาม อาจช้ากว่าและมีต้นทุนต่อโทเคนสูงกว่าเมื่อเทียบกับโมเดล TTS แบบนิวรัลเฉพาะทางที่ออกแบบมาเพื่อเวลาแฝงต่ำและปริมาณงานสูง บริการ TTS ยอดนิยมหลายแห่งคิดค่าบริการต่อตัวอักษรหรือต่อวินาทีของเสียง ไม่ใช่ต่อโทเคน ทำให้การเปรียบเทียบต้นทุนโดยตรงทำได้ยาก สำหรับการปรับใช้ในระบบผลิตจริงที่ต้องการต้นทุนต่ำมาก โมเดล TTS เฉพาะทางอาจเป็นตัวเลือกที่ดีกว่า โมเดลของ Google เหมาะที่สุดกับกรณีการใช้งานที่คุณภาพเอาต์พุตสูงสุดคุ้มค่ากับต้นทุนโทเคนเอาต์พุตที่สูงกว่า
เลือกโมเดลนี้หากคุณต้องการคุณภาพเสียงพูดที่ล้ำสมัยจากสถาปัตยกรรม Gemini ล่าสุดของ Google และคุณต้องการเข้าถึงผ่าน API ที่เข้ากันได้กับ OpenAI มาตรฐานโดยไม่ต้องจัดการข้อมูลรับรอง Google Cloud การกำหนดราคาแบบไม่มีส่วนเพิ่มช่วยให้เกิดความโปร่งใส เหมาะสำหรับแอปพลิเคชันที่ต้องการความเป็นธรรมชาติสูง เช่น AI สนทนาหรือเนื้อหาเชิงบรรยาย สถานะตัวอย่างช่วยให้ทดลองใช้งานล่วงหน้าเพื่อประเมินคุณภาพสำหรับโดเมนของคุณ อย่างไรก็ตาม หากคุณต้องการสตรีมแบบเรียลไทม์ที่มีเวลาแฝงต่ำกว่า 100 มิลลิวินาที โมเดล TTS สำหรับสตรีมโดยเฉพาะอาจดีกว่า นอกจากนี้ หากคุณมีข้อจำกัดด้านงบประมาณ ให้ทดสอบการใช้โทเคนเอาต์พุตสำหรับกรณีการใช้งานทั่วไปเพื่อให้แน่ใจว่าต้นทุนเป็นที่ยอมรับ
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1voice| อินพุต / 1M โทเค็น | $1.00 |
| เอาต์พุต / 1M โทเค็น | $20.00 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
สิ่งที่นักพัฒนาพูดถึงในสัปดาห์นี้
GET /api/public/models/google/gemini-2.5-pro-preview-ttsเปิด @misc{orcarouter_gemini_2_5_pro_preview_tts,
title = {google/gemini-2.5-pro-preview-tts API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts}
}google. (n.d.). google/gemini-2.5-pro-preview-tts API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts