OpenAI TTS-1 HD 1106: การแปลงข้อความเป็นเสียงความละเอียดสูงผ่าน API ที่เข้ากันได้กับ OpenAI ของ OrcaRouter
โมเดล openai/tts-1-hd-1106 เป็นโมเดลข้อความเป็นเสียงพูดจาก OpenAI ซึ่งเป็นรุ่นความละเอียดสูงที่เปิดตัวในเดือนพฤศจิกายน 2023 โดยแปลงข้อความเป็นเสียงที่ฟังดูเป็นธรรมชาติโดยเน้นความชัดเจนและการแสดงออก…
โมเดล openai/tts-1-hd-1106 ถูกออกแบบมาสำหรับการสร้างเอาต์พุตเสียงความละเอียดสูง มันสร้างเสียงพูดที่เป็นธรรมชาติ มีจังหวะและอารมณ์ที่ดี โมเดลรองรับเสียงหลายแบบ (ตามที่ OpenAI จัดให้) และอนุญาตให้ปรับความเร็วและอัตราการสุ่มตัวอย่างได้ เอาต์พุตโดยทั่วไปเป็นเสียง 24kHz หรือ 48kHz ขึ้นอยู่กับการกำหนดค่า สิ่งนี้ทำให้เหมาะสำหรับการใช้งานระดับมืออาชีพ เช่น การผลิตสื่อ
การใช้งานที่เหมาะสมที่สุดรวมถึงการสร้างเสียงพากย์สำหรับวิดีโอ การสร้างคำบรรยายสำหรับหนังสือเสียง การสร้างอินเทอร์เฟซเสียงในแอปพลิเคชัน และการเพิ่มเอาต์พุตเสียงพูดให้กับเทคโนโลยีช่วยเหลือ คุณภาพความคมชัดสูงมีคุณค่าอย่างยิ่งเมื่อเอาต์พุตจะถูกได้ยินโดยผู้ใช้ปลายทางในสถานการณ์ที่ต้องเผชิญหน้ากับลูกค้า สำหรับการทดสอบภายในหรือต้นแบบความเที่ยงตรงต่ำ ให้พิจารณาทางเลือกที่ต้นทุนต่ำกว่า
หากกรณีการใช้งานของคุณไม่ต้องการเสียงที่มีความเที่ยงตรงสูง—ตัวอย่างเช่น เสียงแจ้งเตือนง่ายๆ คำพูดสั้นมาก หรือการบันทึกภายใน—การใช้โมเดล TTS ที่มีต้นทุนต่ำกว่าอาจจะประหยัดกว่า ราคา $30 ต่อ 1M token ใช้กับทั้ง input และ output ดังนั้นการสร้างคลิปสั้นๆ จำนวนมากสามารถสะสมค่าใช้จ่ายได้อย่างรวดเร็ว สำหรับการผลิตในขนาดใหญ่ ให้ประเมินข้อกำหนดด้านคุณภาพและงบประมาณของคุณ
ใช่ OpenAI มีเสียงเริ่มต้นหลายแบบให้เลือกสำหรับโมเดลนี้ (เช่น alloy, echo, fable, onyx, nova, shimmer) คุณสามารถเลือกเสียงผ่านพารามิเตอร์ API นอกจากนี้ คุณยังปรับความเร็วได้ (0.5x ถึง 2.0x), อัตราตัวอย่าง, และรูปแบบผลลัพธ์ โมเดลไม่รองรับการโคลนเสียงหรือการปรับแต่งแบบกำหนดเอง ระบบ OrcaRouter จะส่งผ่านพารามิเตอร์เหล่านี้ไปยัง OpenAI โดยไม่มีการดัดแปลง
แม้ว่าคะแนน benchmark เฉพาะสำหรับ openai/tts-1-hd-1106 จะไม่มีให้ในข้อมูลที่มีอยู่ แต่เป็นที่ยอมรับอย่างกว้างขวางว่าเป็นโมเดล TTS ที่มีคุณภาพสูงที่สุดของ OpenAI ณ วันที่เปิดตัว (พฤศจิกายน 2023) โดยจัดอันดับอยู่ในกลุ่มโมเดลชั้นนำด้านความเป็นธรรมชาติและความชัดเจนในการประเมินภายใน สำหรับประสิทธิภาพเชิงวัตถุ ควรปรึกษาเอกสารของ OpenAI และรีวิวจากบุคคลที่สาม
เวลาแฝงขึ้นอยู่กับความยาวของข้อความที่ป้อนและรูปแบบเสียงที่เลือก โดยทั่วไป โมเดลจะส่งคืนเสียงภายในไม่กี่วินาทีสำหรับข้อความสั้น (เช่น 100 ตัวอักษร) ข้อความที่ยาวอาจใช้เวลานานตามสัดส่วน OrcaRouter ไม่เพิ่มค่าใช้จ่ายที่สำคัญเกินกว่าเวลาตอบสนองของผู้ให้บริการ การสตรีมสามารถลดเวลาแฝงที่รับรู้ได้สำหรับแอปพลิเคชันแบบเรียลไทม์
โมเดลนี้ถูกจำกัดให้ใช้สำหรับการแปลงข้อความเป็นเสียงพูดเท่านั้น โดยไม่รองรับการสนทนาด้วยเสียงหรือการควบคุมอารมณ์นอกเหนือจากการเลือกเสียงที่มีให้ ไม่สามารถสร้างเสียงพื้นหลังหรือดนตรีได้ คุณภาพของผลลัพธ์อาจลดลงเมื่อพบกับการออกเสียงที่ผิดปกติ คำพ้องเสียง หรือคำต่างประเทศ นอกจากนี้ โมเดลมีความยาวอินพุตสูงสุด (โดยทั่วไปคือ 4096 ตัวอักษร) สำหรับข้อความที่ยาวมาก ให้แบ่งส่วนอินพุต
ราคาคือ $30.00 ต่อ 1 ล้าน input tokens และ $30.00 ต่อ 1 ล้าน output tokens Input tokens นับจำนวนข้อความที่คุณให้ Output tokens นับจำนวน audio tokens ที่สร้างขึ้น ทั้งสองถูกเรียกเก็บในอัตราเดียวกัน ไม่มีค่าใช้จ่ายต่อนาทีหรือต่อตัวอักษร การทำ tokenization ดำเนินการโดย OpenAI OrcaRouter ไม่บวกเพิ่มใดๆ ดังนั้นคุณจ่ายตามอัตราที่ OpenAI ประกาศไว้เท่านั้น
ราคาที่ให้ไว้เป็นอัตรามาตรฐานผ่าน OrcaRouter ไม่มีการกล่าวถึงส่วนลดตามปริมาณหรือราคาแคชในข้อเท็จจริงที่มี คุณสามารถลดต้นทุนได้โดยการปรับความยาวข้อความอินพุตให้เหมาะสม—พรอมต์ที่สั้นลงจะสร้างโทเค็นเอาต์พุตน้อยลง สำหรับการใช้งานขนาดใหญ่ ให้พิจารณาเจรจาโดยตรงกับ OpenAI แม้ว่า OrcaRouter จะไม่มีระดับราคาแยกต่างหาก
ในราคา $30 ต่อ 1M โทเค็นสำหรับทั้งอินพุตและเอาต์พุต โมเดลนี้มีราคาสูงกว่าโมเดล TTS มาตรฐานหลายตัว ตัวอย่างเช่น โมเดล tts-1 มาตรฐานของ OpenAI มีราคา $15 ต่อ 1M อินพุตและ $15 ต่อ 1M เอาต์พุต ตัวแปร HD เรียกเก็บค่าพรีเมียมสำหรับคุณภาพที่สูงขึ้น OrcaRouter ส่งต่ออัตราของผู้ให้บริการเหล่านี้โดยไม่มีส่วนเพิ่ม ดังนั้นความแตกต่างของราคาจึงเท่ากับการใช้ OpenAI โดยตรง
การไม่มีส่วนเพิ่มหมายความว่า OrcaRouter จะไม่คิดค่าธรรมเนียมเพิ่มเติมใดๆ เหนือราคาต่อโทเคนของผู้ให้บริการ ค่าใช้จ่ายของคุณเท่ากับอัตราของ OpenAI ทุกประการ: $30 ต่ออินพุต 1M โทเคน และ $30 ต่อเอาต์พุต 1M โทเคน ไม่มีค่าธรรมเนียมแพลตฟอร์ม ค่าใช้จ่ายแอบแฝง หรือเกณฑ์การใช้งาน ค่าใช้จ่ายเดียวที่เกิดขึ้นคือค่าการใช้โทเคนในราคาที่ผู้ให้บริการประกาศไว้
ใช้ API ที่เข้ากันได้กับ OpenAI ที่ https://api.orcarouter.ai/v1 ตั้งค่าพารามิเตอร์ model เป็น "openai/tts-1-hd-1106" ระบุข้อความนำเข้าในรูปแบบข้อความมาตรฐาน (เช่น role: user, content: your text) พารามิเตอร์เฉพาะ TTS เพิ่มเติม (เช่น voice, speed, response_format) สามารถรวมอยู่ในเนื้อหาคำขอ OrcaRouter จะส่งต่อคำขอไปยัง OpenAI และส่งคืนเสียงที่ตอบกลับ ดูเอกสาร API TTS ของ OpenAI สำหรับรายละเอียดพารามิเตอร์ทั้งหมด
คุณสามารถตั้งค่าพารามิเตอร์เดียวกับ OpenAI TTS API ได้: input (สตริง), model ("openai/tts-1-hd-1106"), voice (สตริงจากเสียงที่มี), speed (ตัวเลข 0.5–2.0), response_format (เช่น "mp3", "opus", "aac", "flac", "wav"), และ sample_rate รวมพารามิเตอร์เหล่านี้ใน JSON body ของคำขอ POST ไปยัง chat/completions endpoint OrcaRouter จะรักษาพารามิเตอร์ทั้งหมดไว้และไม่เปลี่ยนแปลง
ใช่ คุณสามารถใช้สตรีมมิ่งได้โดยตั้งค่าพารามิเตอร์ stream เป็น true ในคำขอ API ของคุณ โมเดลจะส่งคืน audio chunks เมื่อถูกสร้างขึ้น ซึ่งมีประโยชน์สำหรับแอปพลิเคชันแบบเรียลไทม์ OrcaRouter รองรับสตรีมมิ่งโดยไม่ต้องกำหนดค่าเพิ่มเติม ตรวจสอบให้แน่ใจว่าไคลเอนต์ของคุณจัดการกับ chunked responses อย่างเหมาะสม ตามมาตรฐานสำหรับปลายทางสตรีมมิ่งที่เข้ากันได้กับ OpenAI
เปลี่ยน URL API ฐานของคุณเป็น https://api.orcarouter.ai/v1 และอัปเดตตัวระบุโมเดลเป็น "openai/tts-1-hd-1106" คีย์ API OpenAI ที่คุณมีอยู่จะใช้ไม่ได้ คุณต้องใช้คีย์ API ของ OrcRouter รูปแบบเนื้อหาคำขอ (request body) ยังคงเหมือนเดิม ไม่ต้องเปลี่ยนแปลงโค้ดอื่น ๆ ปลายทางของ OrcaRouter ออกแบบมาให้ใช้แทนที่ได้ทันที (drop-in replacement) สำหรับผู้ที่คุ้นเคยกับ SDK ของ OpenAI
ทั้งสองรุ่นมาจาก OpenAI รุ่น HD (tts-1-hd-1106) ให้คุณภาพเสียงที่สูงกว่า โดยมีการออกเสียงที่เป็นธรรมชาติและชัดเจนมากกว่าเมื่อเทียบกับรุ่นมาตรฐาน tts-1 (ซึ่งมีราคา $15 ต่อ 1M โทเค็นต่อทาง) รุ่น HD มีราคาสองเท่าต่อโทเค็น การเลือกขึ้นอยู่กับความต้องการด้านคุณภาพของคุณ สำหรับการใช้งานทั่วไป รุ่นมาตรฐานอาจเพียงพอ สำหรับการผลิตระดับมืออาชีพ แนะนำให้ใช้รุ่น HD
เมื่อเปรียบเทียบกับผู้ให้บริการอย่าง Amazon Polly, Google Cloud Text-to-Speech หรือ Microsoft Azure Speech โมเดล openai/tts-1-hd-1106 มีความสามารถในการแข่งขันด้านความเป็นธรรมชาติ แต่มักมีราคาสูงกว่าต่อตัวอักษร เหนือกว่าในด้านการแสดงออกและความสะดวกในการผสานรวมผ่าน API ที่เข้ากันได้กับ OpenAI อย่างไรก็ตาม ผู้ให้บริการรายอื่นมีเสียงที่หลากหลายกว่า รองรับภาษามากกว่า และสามารถสร้างเสียงที่กำหนดเองได้ ให้ประเมินตามความต้องการเฉพาะของคุณในด้านภาษา คุณภาพ และงบประมาณ
โมเดลโอเพนซอร์สอย่าง Tacotron, FastSpeech หรือ Tortoise ต้องมีการตั้งค่าและอาจไม่เท่ากับคุณภาพของเอาต์พุตของโมเดล HD ของ OpenAI โมเดลที่โฮสต์ไว้นั้นให้ความสะดวกสบาย ความน่าเชื่อถือ และคุณภาพสูงโดยไม่ต้องจัดการโครงสร้างพื้นฐาน อย่างไรก็ตาม โมเดลโอเพนซอร์สสามารถใช้ได้ฟรีสำหรับการโฮสต์เอง แม้ว่าจะมีค่าใช้จ่ายในการคำนวณ สำหรับโปรเจกต์ขนาดเล็ก โอเพนซอร์สอาจถูกกว่า สำหรับการผลิตที่ต้องการคุณภาพที่สม่ำเสมอ โมเดล HD เป็นตัวเลือกที่แข็งแกร่ง
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1response_formatspeedvoice| อินพุต / 1M โทเค็น | $30.00 |
| เอาต์พุต / 1M โทเค็น | $30.00 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
GET /api/public/models/openai/tts-1-hd-1106เปิด @misc{orcarouter_tts_1_hd_1106,
title = {openai/tts-1-hd-1106 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/tts-1-hd-1106}
}openai. (n.d.). openai/tts-1-hd-1106 API. OrcaRouter. https://www.orcarouter.ai/models/openai/tts-1-hd-1106