โมเดลข้อความเป็นเสียงความละเอียดสูงของ OpenAI ซึ่งเข้าถึงผ่าน API ของ OrcaRouter ในราคา $30 ต่อ 1M tokens (ไม่มีมาร์กอัป)
openai/tts-1-hd เป็นโมเดลข้อความเป็นเสียงพูด (text-to-speech) จาก OpenAI ที่แปลงข้อความให้เป็นเสียงพูดธรรมชาติคุณภาพสูง เป็นเวอร์ชันที่ปรับปรุงจากโมเดล TTS-1 มาตรฐาน โดยให้คุณภาพเสียงที่ดีขึ้น…
OpenAI's TTS-1-HD รองรับเสียงที่สร้างไว้หลายเสียง รวมถึง alloy, echo, fable, onyx, nova และ shimmer แต่ละเสียงมีโทนที่แตกต่างกัน ตั้งแต่ทุ้มก้องไปจนถึงสดใสมีพลัง โมเดลยังรองรับหลายภาษา เช่น อังกฤษ สเปน ฝรั่งเศส เยอรมัน อิตาลี โปรตุเกส และอื่นๆ ด้วยสำเนียงและจังหวะที่เป็นธรรมชาติ คุณสามารถระบุเสียงและภาษาในคำขอ API ได้ โมเดลความละเอียดสูงช่วยเพิ่มความแม่นยำของสำเนียงและช่วงอารมณ์เมื่อเทียบกับเวอร์ชันมาตรฐาน สำหรับรายการภาษาที่รองรับทั้งหมด โปรดดูเอกสารทางการของ OpenAI
openai/tts-1-hd ถูกปรับให้เหมาะกับความหน่วงที่ต่ำกว่าเมื่อเทียบกับ TTS-1 มาตรฐาน ทำให้เหมาะสำหรับแอปพลิเคชันแบบเรียลไทม์ เช่น ผู้ช่วยเสียง (voice assistants) และการใส่คำบรรยายสด (live captioning) อย่างไรก็ตาม ความหน่วงที่แน่นอนขึ้นอยู่กับปัจจัยต่างๆ เช่น ความยาวของข้อความ ความเร็วของเครือข่าย และโหลดของเซิร์ฟเวอร์ โมเดลนี้รองรับการตอบกลับแบบสตรีมผ่าน API ซึ่งช่วยให้คุณเริ่มเล่นเสียงก่อนที่เสียงทั้งหมดจะถูกสร้างเสร็จ ซึ่งจะช่วยลดความล่าช้าที่รับรู้ได้ สำหรับการตอบกลับที่เกือบจะทันที ควรพิจารณาใช้โมเดล TTS-1 มาตรฐาน ซึ่งให้ความสำคัญกับความเร็วมากกว่าคุณภาพ โครงสร้างพื้นฐานที่เสถียรของ OrcaRouter ช่วยให้มั่นใจได้ว่าความหน่วงที่เพิ่มขึ้นนั้นน้อยที่สุด
หากแอปพลิเคชันของคุณไม่ต้องการคุณภาพเสียงระดับพรีเมียม ให้พิจารณาใช้โมเดล TTS-1 มาตรฐานของ OpenAI หรือผู้ให้บริการ TTS ที่เป็นมิตรกับงบประมาณอื่นๆ ตัวอย่างเช่น เมื่อสร้างเสียงพูดสำหรับการทดสอบภายใน การแจ้งเตือนด้วยเสียงคุณภาพต่ำ หรือสถานการณ์ที่มีข้อจำกัดด้านจำนวนตัวอักษร โมเดลที่ถูกกว่าจะช่วยลดต้นทุน นอกจากนี้ หากคุณกำลังทดลองหลายรูปแบบหรือต้องการเวลาแฝงที่ต่ำมาก TTS-1 อาจเหมาะสมกว่า openai/tts-1-hd มากเกินไปสำหรับการแจ้งเตือนง่ายๆ ประเมินเกณฑ์คุณภาพและความทนทานต่อต้นทุนของคุณ: โมเดล HD มีราคาต่อโทเค็นเท่ากับรุ่นมาตรฐานบน OrcaRouter แต่เอาต์พุตอาจทำให้มีจำนวนโทเค็นสูงขึ้นสำหรับเสียงที่ยาวขึ้น
TTS-1-HD ของ OpenAI ให้เสียงพูดที่มีความเที่ยงตรงสูงขึ้น ด้วยความชัดเจนที่ดีขึ้น เสียงพูดที่เป็นธรรมชาติมากขึ้น และลดเสียงคลิกหรือเสียงหึ่ง สามารถจับอารมณ์ได้ดีขึ้น และจัดการเครื่องหมายวรรคตอนและการหยุดได้แม่นยำมากขึ้น แม้จะไม่มีคะแนนเกณฑ์มาตรฐานที่แน่นอน แต่รายงานจากผู้ใช้และนักพัฒนาแสดงให้เห็นถึงคุณภาพเชิงอัตวิสัยที่ดีขึ้นอย่างเห็นได้ชัด โมเดลนี้มีประสิทธิภาพโดยเฉพาะสำหรับเนื้อหาแบบยาว เช่น หนังสือเสียง ซึ่งความสม่ำเสมอของคุณภาพเสียงมีความสำคัญ สำหรับวลีสั้น ๆ ธรรมดา ความแตกต่างอาจจะเล็กน้อย ข้อแลกเปลี่ยนคือต้นทุนการคำนวณที่สูงขึ้นเล็กน้อย แต่ราคาต่อโทเค็นยังคงเท่าเดิม
แม้จะมีคุณภาพดี แต่ openai/tts-1-hd ยังมีข้อจำกัด อาจเกิดการออกเสียงผิดเป็นครั้งคราว โดยเฉพาะชื่อที่ไม่คุ้นเคย คำต่างประเทศ หรือคำศัพท์เทคนิค โมเดลไม่สามารถสร้างเสียงร้องเพลง เอฟเฟกต์เสียง หรือเสียงที่ไม่ใช่คำพูดได้ นอกจากนี้ยังมีความยาวข้อความสูงสุด (context window) ต่อคำขอ แม้จะไม่ได้ระบุขีดจำกัดที่แน่นอนต่อสาธารณะ ข้อความที่ยาวมากอาจต้องแบ่งและเชื่อมต่อ โมเดลขาดการสนับสนุนการโคลนเสียงแบบกำหนดเองผ่าน API มาตรฐาน และไม่ได้ออกแบบมาเพื่อควบคุมอัตราการพูดหรือระดับเสียงอย่างละเอียด สำหรับคุณสมบัติขั้นสูงดังกล่าว ควรพิจารณาใช้แพลตฟอร์มสังเคราะห์เสียงเฉพาะทาง
ความเร็วขึ้นอยู่กับความยาวของข้อความและรูปแบบเสียงที่ร้องขอ openai/tts-1-hd ได้รับการปรับให้มีเวลาแฝงต่ำกว่ารุ่นก่อนหน้า แต่ไม่ใช่ตัวเลือกที่เร็วที่สุดที่มี สำหรับประโยคทั่วไป เวลาตอบสนองอยู่ในระดับต่ำกว่าหนึ่งวินาทีภายใต้สภาวะปกติ ความสามารถในการสตรีมช่วยให้ได้รับผลลัพธ์บางส่วนก่อน API ของ OrcaRouter เองแทบไม่เพิ่มภาระงานใดๆ เนื่องจากทำหน้าที่พร็อกซีคำขอไปยัง OpenAI โดยตรง สำหรับแอปพลิเคชันแบบเรียลไทม์ที่ทุกมิลลิวินาทีมีความสำคัญ โมเดล TTS-1 มาตรฐาน (หรือรุ่นที่ไม่ใช่ HD) อาจส่งมอบไบต์เสียงแรกได้เร็วกว่า ควรพิจารณาทดสอบวัดประสิทธิภาพกับ payload ทั่วไปของคุณเพื่อกำหนดประสิทธิภาพที่ยอมรับได้
openai/tts-1-hd มีราคาอยู่ที่ $30.00 ต่อ 1 ล้านโทเค็นขาเข้า และ $30.00 ต่อ 1 ล้านโทเค็นขาออก โทเค็นขาเข้าสอดคล้องกับข้อความที่คุณส่ง ในขณะที่โทเค็นขาออกแทนเสียงที่สร้างขึ้น นี่คืออัตราของผู้ให้บริการ OrcaRouter ไม่มีการบวกมาร์กอัปใดๆ คุณจะถูกเรียกเก็บเงินเฉพาะตามการใช้งานจริงเท่านั้น โทเค็นจะถูกนับทั้งขาเข้าและขาออก แต่เนื่องจากเอาต์พุตเสียงโดยธรรมชาติแล้วมีระยะเวลานานกว่า ต้นทุนของโทเค็นขาออกจึงอาจสูงกว่า ตัวอย่างเช่น ข้อความขนาด 1,000 ตัวอักษรอาจมีต้นทุนประมาณ $0.0012 ในโทเค็นขาเข้า ในขณะที่เอาต์พุต (เช่น เสียงยาว 30 วินาที) อาจมีต้นทุนสูงกว่า
บน OrcaRouter ทั้ง TTS-1 และ TTS-1-HD มีราคาต่อโทเค็นเท่ากัน ดังนั้นความแตกต่างของต้นทุนไม่ได้อยู่ที่ราคาต่อหน่วย แต่อยู่ที่การใช้งานโทเค็น เนื่องจาก TTS-1-HD อาจสร้างเสียงคุณภาพสูงขึ้นด้วยการตั้งค่าการบีบอัดที่แตกต่างกัน จำนวนโทเค็นเอาต์พุตจึงอาจใกล้เคียงกับ TTS-1 สำหรับข้อความเดียวกัน อย่างไรก็ตาม หากคุณต้องลองซ้ำน้อยลงเนื่องจากคุณภาพที่ดีขึ้น โมเดล HD อาจคุ้มค่ากว่าโดยรวม ผู้ให้บริการ TTS รายอื่นอาจเสนออัตราต่อตัวอักษรที่ต่ำกว่าแต่มีคุณภาพต่ำกว่า ชั่งน้ำหนักความสำคัญของความเที่ยงตรงของเสียงกับงบประมาณ สำหรับแอปพลิเคชันที่มีปริมาณสูง แม้ความแตกต่างเล็กน้อยในเปอร์เซ็นต์ก็มีความสำคัญ
OrcaRouter ไม่มีการแคชสำหรับการตอบกลับ TTS เนื่องจากแต่ละคำขออาจมีเสียง ภาษา หรือข้อความที่แตกต่างกัน อย่างไรก็ตาม มันส่งผ่านราคาของผู้ให้บริการโดยไม่มีค่าธรรมเนียมเพิ่มเติม ไม่มีส่วนลดตามระดับหรือราคาตามปริมาณผ่าน OrcaRouter สำหรับโมเดลนี้ ค่าใช้จ่ายจะเพิ่มขึ้นเป็นเส้นตรงตามการใช้งาน หากคุณคาดการณ์ว่าจะมีการใช้งานสูงมาก คุณอาจพิจารณาติดต่อ OpenAI โดยตรงเพื่อขอราคาสำหรับองค์กร แต่ผ่าน OrcaRouter คุณจะได้รับประโยชน์จากการเรียกเก็บเงินแบบจ่ายตามการใช้งานที่เรียบง่าย ไม่มีข้อผูกมัดขั้นต่ำหรือค่าใช้จ่ายแอบแฝง
คุณสามารถใช้ไคลเอนต์ที่รองรับ OpenAI ใดก็ได้ (เช่น Python openai library) โดยตั้งค่า base URL เป็น https://api.orcarouter.ai/v1 ใส่รหัสโมเดล "openai/tts-1-hd" ในการร้องขอของคุณ ตัวอย่างเช่น การใช้ Python: client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_orcarouter_key') จากนั้นเรียก client.audio.speech.create(model='openai/tts-1-hd', voice='alloy', input='Hello world', response_format='mp3') OrcaRouter จะส่งต่อคำขอไปยัง OpenAI และส่งคืนไฟล์เสียง ตรวจสอบให้แน่ใจว่าคีย์ API ของคุณมาจาก OrcaRouter ไม่ใช่จาก OpenAI โดยตรง
API รองรับพารามิเตอร์หลายตัว: model (จำเป็น: openai/tts-1-hd), input (ข้อความที่จะพูด), voice (หนึ่งใน alloy, echo, fable, onyx, nova, shimmer), response_format (mp3, opus, aac, flac), speed (เลขทศนิยมตั้งแต่ 0.25 ถึง 4.0, ค่าเริ่มต้น 1.0), และ optional streaming boolean. คุณยังสามารถตั้งค่า language เพื่อปรับปรุงการออกเสียงสำหรับบางภาษาได้ OrcaRouter จะส่งผ่านค่าเหล่านี้โดยไม่เปลี่ยนแปลง พารามิเตอร์เช่น temperature หรือ top_p ไม่สามารถใช้ได้กับโมเดล TTS ดูเอกสาร API เสียงของ OpenAI สำหรับรายละเอียดทั้งหมด
ใช่ การย้ายระบบต้องเปลี่ยนแปลงเพียงสองอย่าง: เปลี่ยน URL ฐานจาก 'https://api.openai.com/v1' เป็น 'https://api.orcarouter.ai/v1' และใช้คีย์ API ของ OrcaRouter แทนคีย์ของ OpenAI โครงสร้างของคำขอและการตอบกลับเหมือนกันทุกประการ ไม่จำเป็นต้องแก้ไขตรรกะของโค้ดหรือชื่อพารามิเตอร์ของคุณ OrcaRouter รองรับรูปแบบการสตรีมและการจัดการข้อผิดพลาดแบบเดียวกันด้วย ทำให้การสลับระบบเป็นเรื่องง่ายสำหรับนักพัฒนาที่ต้องการจัดการโมเดลหลายตัวผ่านเกตเวย์เดียว
ความแตกต่างหลักอยู่ที่คุณภาพเสียง TTS-1-HD ออกแบบมาเพื่อความเที่ยงตรงสูงขึ้น โดยให้ความชัดเจนที่ดีกว่าและน้ำเสียงที่เป็นธรรมชาติมากขึ้น ขณะที่ TTS-1 ถูกปรับให้เหมาะสมสำหรับเวลาแฝงที่ต่ำกว่าและการสร้างที่เร็วกว่า ทั้งสองรุ่นมีราคาต่อโทเค็นเท่ากันบน OrcaRouter รุ่น HD ใช้ทรัพยากรการคำนวณมากกว่าเล็กน้อยบนแบ็กเอนด์ของ OpenAI แต่จำนวนโทเค็นสำหรับข้อความนำเข้าเดียวกันนั้นเท่ากัน สำหรับวลีสั้นๆ ธรรมดา ความแตกต่างด้านคุณภาพอาจเล็กน้อย สำหรับเนื้อหาแบบยาวหรือเนื้อหาที่มีอารมณ์ รุ่น HD จะดีกว่าอย่างเห็นได้ชัด เลือกตามความต้องการด้านคุณภาพและความเร็วของคุณ
ElevenLabs นำเสนอเสียงพูดที่สื่ออารมณ์ได้อย่างดีเยี่ยมพร้อมความสามารถในการโคลนเสียง แต่มีต้นทุนต่อตัวอักษรสูงกว่า Google Cloud TTS ให้เสียงที่หลากหลายและรองรับ SSML แต่อาจไม่เป็นธรรมชาติเท่าโมเดล HD ของ OpenAI openai/tts-1-hd สร้างสมดุลระหว่างคุณภาพและต้นทุน ด้วยโมเดลการกำหนดราคาแบบตามจำนวนโทเคนที่ตรงไปตรงมา ไม่รองรับการโคลนเสียงแบบกำหนดเองผ่าน API มาตรฐาน ซึ่ง ElevenLabs ทำได้ดีเยี่ยม โมเดลของ Google ครอบคลุมภาษาได้มากกว่าและควบคุมแบบละเอียดได้มากกว่า ผ่าน OrcaRouter คุณสามารถเปรียบเทียบต้นทุนโดยตรงโดยการทดสอบด้วยความยาวข้อความทั่วไปของคุณ
ใช้ openai/tts-1-hd เมื่อความสำเร็จของแอปพลิเคชันของคุณขึ้นอยู่กับคุณภาพเสียง เช่น หากคุณกำลังสร้างเนื้อหาระดับมืออาชีพ ผู้ช่วยเสียงที่ผู้ใช้ต้องเผชิญซึ่งความประทับใจแรกมีความสำคัญ หรือเครื่องมือช่วยการเข้าถึงที่ต้องการเสียงพูดที่ชัดเจน หลีกเลี่ยงการใช้งานหากผู้ใช้ของคุณไม่สามารถแยกแยะความแตกต่างของคุณภาพได้ เช่น ในระบบแจ้งเตือนภายใน หรือเมื่อเอาต์พุตจะถูกบีบอัดอย่างหนัก นอกจากนี้ โปรดพิจารณาว่าบน OrcaRouter ราคาต่อโทเค็นสำหรับ TTS-1 และ TTS-1-HD นั้นเท่ากัน ดังนั้นโมเดล HD จึงไม่ทำให้คุณเสียเปรียบในเรื่องต้นทุนต่อหน่วย คุณจะจ่ายเพิ่มก็ต่อเมื่อมีเสียงที่ยาวขึ้นเนื่องจากตั้งค่าคุณภาพที่สูงขึ้นเท่านั้น
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1response_formatspeedvoice| อินพุต / 1M โทเค็น | $30.00 |
| เอาต์พุต / 1M โทเค็น | $30.00 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
GET /api/public/models/openai/tts-1-hdเปิด @misc{orcarouter_tts_1_hd,
title = {openai/tts-1-hd API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/tts-1-hd}
}openai. (n.d.). openai/tts-1-hd API. OrcaRouter. https://www.orcarouter.ai/models/openai/tts-1-hd