การ์ดฮีโร่ที่สร้างขึ้นสำหรับ 'Gemini 3.8 TTS vs Sesame Preview' บนพื้นหลังสีขาวพร้อมเน้นไล่เฉดสีฟ้าและสีฟ้านีออนแบบนุ่มนวล การ์ดด้านซ้าย 'Gemini 3.8 Flash TTS' ระบุ Elo 1,260 ที่อันดับ 2, เสียงในอารีนา 8 เสียง, ปลายทาง API และราคา $16.50 ต่อ 1 ล้านตัวอักษรแบบนอร์มัลไลซ์; การ์ดด้านขวา 'Sesame' แยกออกเป็น 'แอป Preview — ฟรี, ภาษาอังกฤษเท่านั้น, ไม่มี API, ไม่มี model ID' และ 'เช็กพอยต์ CSM-1B — Apache 2.0, พารามิเตอร์ 2B, แบ็กโบน Llama' บรรทัดท้ายระบุว่า 'Elo อ้างอิงจาก Artificial Analysis Provider Voice Arena, กันยายน 2026; รายละเอียด CSM-1B อ้างอิงจากโมเดลการ์ดของมัน' โลโก้ OrcaRouter ถูก composited ไว้ที่มุมขวาล่าง
Guides & Insights

Gemini 3.8 TTS กับ Sesame Preview: หนึ่งในนี้เป็นไฟล์ดาวน์โหลด ส่วนอีกอันเป็นแอป

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ลองค้นหาการเปรียบเทียบระหว่าง Gemini 3.8 Flash TTS กับ Sesame Previewแล้วคุณจะพบงานเขียนมากมายที่มองว่าทั้งสองเป็นผลิตภัณฑ์ในหมวดหมู่เดียวกัน แต่ความจริงไม่ใช่เช่นนั้น และความแตกต่างนี้ก็ไม่ใช่แค่เรื่องเทคนิคเล็กน้อย Gemini 3.8 Flash TTS คือ API endpoint: มันมี model identifier มีตารางราคาที่เผยแพร่ มีอันดับบนลีดเดอร์บอร์ดที่อันดับ 2 ด้วยค่า Elo 1,260 จากตัวอย่าง 1,999 ตัวอย่างบน Artificial Analysis Provider Voice Arena และมีรูปแบบคำขอที่จัดทำเอกสารไว้ ส่วน Sesame Preview คือแอปผู้ช่วยเสียงสำหรับผู้บริโภคที่ใช้ฟรี มีเอเจนต์ที่มีชื่อ มีการสนทนาหลายรอบ และจำกัดเวลาสายไว้ที่ 30 นาที มันไม่มี API ไม่มี model ID ไม่มีแผนการเรียกเก็บเงิน และไม่มีคะแนนบนบอร์ดนั้น

ชิ้นงาน Sesame หนึ่งเดียวที่คุณสามารถสร้างต่อยอดได้จริงนั้นเป็นอีกเรื่องหนึ่งโดยสิ้นเชิง: CSM-1B ซึ่งเป็นเช็กพอยต์ Apache 2.0 บน Hugging Face ที่สร้างรหัสเสียงจากข้อความโดยใช้โครงหลัก Llama และตัวถอดรหัสเสียง Mimi มันไม่ใช่เสียงที่ผู้คนพูดถึงเมื่อบรรยายว่าแอปฟังดูเป็นมนุษย์แค่ไหน ดังนั้นการเปรียบเทียบจึงกลายเป็นคำถามที่ตอบได้: คุณต้องการเช่าโมเดลเสียงพูด หรือต้องการดาวน์โหลดมันมาใช้?

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Sesame, showing what each one is (a hosted API against a consumer app), model ID (gemini-3.8-flash-tts against none), Elo (1,260 at rank 2 against not ranked), price ($16.50 per 1M characters against free with no meter), licence (vendor terms against not applicable to the app) and two-speaker support (yes against agents rather than a script).

สองสิ่งที่เรียกว่า Sesame และมีเพียงหนึ่งเดียวในนั้นที่สามารถบิลด์ได้

การตั้งชื่อเป็นต้นเหตุของความสับสนส่วนใหญ่ ดังนั้นจงแยกมันออกเสียก่อนที่จะไปต่อ

• Sesame Preview — ตัวแอป ใช้งานฟรี เอเจนต์ชื่อ Maya, Miles, Simone และ Charlie การสนทนาแบบหลายรอบพร้อมบริบทที่คงอยู่ข้ามรอบ มีความสามารถด้านการค้นหาเว็บและการแจ้งเตือน รองรับเฉพาะภาษาอังกฤษ จำกัดเวลาสายไว้ที่ 30 นาที ไม่มีช่องทางสำหรับนักพัฒนา: ไม่มีอะไรให้ยืนยันตัวตน ไม่มีอะไรให้วัดปริมาณการใช้งาน ไม่มีปลายทางให้เรียกใช้

• CSM-1B — เช็คพอยต์ เผยแพร่บน Hugging Face ภายใต้ sesame/csm-1b ด้วยสัญญาอนุญาต Apache 2.0 แบ็กโบน Llama และตัวถอดรหัสขนาดเล็กที่สร้างรหัสเสียง Mimi ประมาณ 2 พันล้านพารามิเตอร์ ภาษาอังกฤษ น้ำหนัก F32 และทำงานผ่าน Hugging Face Transformers การ์ดโมเดลบันทึกว่าเวอร์ชัน 1B เริ่มจัดส่งในเดือนมีนาคม 2025 และการรองรับ Transformers แบบเนทีฟมาถึงในเดือนพฤษภาคม 2025

สองสิ่งนั้นมีบริษัทเดียวกันและมีสายงานวิจัยร่วมกัน และความสัมพันธ์ก็จบลงประมาณตรงนั้น แอปเป็นผลิตภัณฑ์ ส่วนเช็กพอยต์เป็นสิ่งที่ได้จากงานวิจัยที่มาก่อนหน้ามัน ผู้รีวิวที่ชื่นชมความจำเชิงสนทนาของแอปกำลังบรรยายถึงระบบที่มีการค้นคืนและการจัดการสถานะอยู่รอบ ๆ โมเดลเสียง ไม่ใช่คุณสมบัติของเช็กพอยต์ 2B ที่คุณดาวน์โหลดได้

จริง ๆ แล้วข้างในเช็กพอยต์มีอะไรกันแน่

CSM-1B เป็นโมเดลแปลงข้อความเป็นเสียงพูดในเชิงสถาปัตยกรรม ซึ่งเป็นสิ่งที่สำคัญสำหรับใครก็ตามที่วางแผนจะรันโมเดลนี้: มันรับข้อความและบริบทเสียงเป็นอินพุต และส่งออก RVQ audio codes ซึ่งตัวถอดรหัสจะเปลี่ยนเป็นรูปคลื่นเสียง ข้อเท็จจริงในทางปฏิบัติจาก model card มีดังนี้:

• สัญญาอนุญาต — Apache 2.0 นี่เป็นบรรทัดที่สำคัญที่สุดเพียงบรรทัดเดียวในหน้านี้ ต่างจากสัญญาอนุญาตน้ำหนักที่จำกัดเฉพาะการวิจัย Apache 2.0 อนุญาตให้ใช้ในเชิงพาณิชย์ได้โดยไม่ต้องมีข้อตกลงแยกต่างหาก ซึ่งทำให้ CSM-1B เป็นหนึ่งในไม่กี่เช็คพอยต์เสียงพูดแบบเปิดที่ใช้งานได้จริง

• ขนาด — ประมาณ 2B พารามิเตอร์ที่ F32 ใหญ่พอที่จะต้องใช้ฮาร์ดแวร์จริงสำหรับงานที่ทำงานพร้อมกัน และเล็กพอที่จะรันบนตัวเร่งความเร็วตัวเดียวสำหรับการพัฒนา

• ภาษา — อังกฤษ ตามที่ระบุบนการ์ด ไม่ใช่โมเดลหลายภาษา

• กระแสตอบรับ — 141,461 ดาวน์โหลดในเดือนที่ผ่านมา ณ เวลาที่เขียน โดยมีไลก์ประมาณ 245,000 บนรีพอซิทอรี นั่นถือเป็นเช็คพอยต์ที่ถูกใช้งานอย่างแพร่หลายตามมาตรฐานของโมเดลเสียงพูดแบบเปิด และเป็นข้อโต้แย้งที่หนักแน่นที่สุดว่าอาร์ติแฟกต์นี้มีฐานผู้ใช้จริงที่เป็นอิสระจากกระแสข่าวของแอป

A screenshot of the Hugging Face model card for sesame/csm-1b, showing the Apache 2.0 licence, the roughly 2 billion parameter F32 weights, the Llama backbone and Mimi audio decoder description, and the repository's download and like counts.

สิ่งที่การ์ดไม่ได้ให้คุณคือคำกล่าวอ้างเรื่องคุณภาพที่คุณสามารถนำไปเปรียบเทียบกับอะไรก็ได้ ไม่มีแถวในอารีนา ไม่มีเกณฑ์วัดของผู้ขายที่บุคคลที่สามทำซ้ำ และไม่มีการประเมินที่เผยแพร่เกี่ยวกับว่าเอาต์พุตของเช็กพอยต์เกี่ยวข้องกับของแอปอย่างไร ใครก็ตามที่บอกคุณว่าโมเดลที่ดาวน์โหลดได้นั้นดูเหมือนแอป กำลังอนุมานสิ่งนั้นจากชื่อเท่านั้น

ทำไมจึงไม่มีการเปรียบเทียบแบบตัวต่อตัว และทำไมสิ่งนั้นจึงไม่ใช่ช่องว่างงานวิจัย

ไม่มีการเปรียบเทียบ Gemini 3.8 TTS กับ Sesame Preview บนลีดเดอร์บอร์ด เพราะไม่มีทางที่จะมีได้ อารีนาจัดอันดับโมเดลโดยให้ผู้ฟังเปรียบเทียบคลิปที่สร้างจากปลายทางที่โฮสต์ไว้ ฝ่ายหนึ่งของการจับคู่นี้ไม่มีปลายทางดังกล่าว จึงไม่สามารถส่งเข้าแข่งขันได้

นั่นเป็นสิ่งที่ควรพูดให้ชัดเจน เพราะ “ไม่มีการเปรียบเทียบโดยตรง” มักถูกเขียนขึ้นราวกับว่าข้อมูลนั้นหายไป มันไม่ได้หายไป แต่มันไม่ได้ถูกนิยาม สองสิ่งที่ถูกนำมาเปรียบเทียบกันไม่มีพื้นผิวที่วัดร่วมกันได้:

• Gemini 3.8 Flash TTS ได้รับการให้คะแนนจากเสียงที่โฮสต์ไว้ซึ่งเป็นเสียงดั้งเดิมของตัวเอง ส่วน Sesame Preview ไม่มีเสียงดั้งเดิมที่จะให้คะแนนในความหมายนั้น — มันมีเอเจนต์

• Gemini 3.8 Flash TTS เผยแพร่ตารางอัตราค่าบริการเป็นโทเคน ส่วน Sesame Preview นั้นฟรีและไม่เผยแพร่สิ่งใด เพราะไม่มีอะไรให้เรียกเก็บ

• Gemini 3.8 Flash TTS รับสคริปต์และส่งคืนเสียง ส่วน Sesame Preview รับบทสนทนาและส่งคืนบทสนทนา พร้อมด้วยการดึงข้อมูลและหน่วยความจำใดก็ตามที่แอปซ้อนเพิ่มเข้ามา

สิ่งที่ใกล้เคียงที่สุดกับการเปรียบเทียบที่สมเหตุสมผลคือระหว่าง Gemini 3.8 Flash TTS กับ CSM-1B และแม้แต่การเปรียบเทียบนั้นก็ยังไม่เสมอกัน: ฝ่ายหนึ่งมีคะแนน Elo ที่เป็นอิสระและตารางราคาของผู้ให้บริการ ส่วนอีกฝ่ายไม่มีทั้งสองอย่าง สิ่งที่คุณเปรียบเทียบได้คือรูปแบบของข้อผูกมัด — API แบบคิดค่าตามการใช้งาน เทียบกับเช็กพอยต์ที่ดาวน์โหลดได้ — และการเปรียบเทียบนั้นไม่จำเป็นต้องมีลีดเดอร์บอร์ด

ด้านเดียวของสิ่งนี้ที่มีตัวเลขอยู่

ทุกอย่างที่เป็นเชิงปริมาณในการจับคู่นี้ล้วนอยู่ฝั่งของ Google ซึ่งนั่นเองก็คือประเด็น

บน Artificial Analysis Provider Voice Arena ซึ่งบันทึกเมื่อวันที่ 24 กันยายน 2026 Gemini 3.8 Flash TTS อยู่อันดับ 2 ด้วย Elo 1,260 จากตัวอย่าง 1,999 ตัวอย่างและเสียงในอารีนา 8 เสียง เปิดตัวเมื่อวันที่ 23 กันยายน 2026 Gemini 3.8 Flash-Lite TTS รุ่นพี่น้องของมันอยู่อันดับ 6 ด้วย 1,235 Google คิดราคา Flash TTS ที่ 0.50 ดอลลาร์ต่อล้านโทเคนข้อความขาเข้า และ 9.00 ดอลลาร์ต่อล้านโทเคนเสียงขาออก ไปจนถึงวันที่ 31 ธันวาคม 2026 จากนั้นเป็น 18.00 ดอลลาร์ โดย Flash-Lite TTS อยู่ที่ 0.50 และ 6.00 ดอลลาร์ จากนั้น 12.00 ดอลลาร์; Artificial Analysis ปรับมาตรฐานค่าเหล่านี้เป็น 16.50 และ 11.00 ดอลลาร์ต่อล้านตัวอักษร เพื่อให้เทียบเคียงบนกระดานเดียวกันกับโมเดลที่คิดราคาเป็นหน่วยอื่นได้ การปรับมาตรฐานนั้นเป็นการคำนวณของกระดานจัดอันดับ ไม่ใช่คำกล่าวอ้างของ Google

ในทางกลับกัน CSM-1B ไม่มีราคาเพราะไม่มีมาตรวัดการใช้งาน มันมีจำนวนการดาวน์โหลด ใบอนุญาต และจำนวนพารามิเตอร์ หากกรอบการตัดสินใจของคุณต้องการค่า Elo การเปรียบเทียบนี้จะไม่ให้ค่าดังกล่าวสำหรับฝั่ง Sesame และข้อสรุปที่ตรงไปตรงมาคือทั้งสองตัวเลือกกำลังถูกประเมินด้วยเกณฑ์ที่แตกต่างกัน มากกว่าที่จะเป็นเพราะหนึ่งในนั้นยังไม่ได้รับการพิสูจน์

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, released September 23, 2026, with Gemini 3.8 Flash-Lite TTS at rank 6 and no Sesame row anywhere on the board.

ถ้าสิ่งที่คุณต้องการคือประสบการณ์การใช้งานแอป

หลายคนที่ค้นหาการเปรียบเทียบนี้ไม่ได้กำลังเลือกโมเดลเลยด้วยซ้ำ พวกเขาใช้แอป Sesame ชอบความรู้สึกของการสนทนา และอยากได้แบบนั้นในผลิตภัณฑ์ของตน นั่นเป็นคนละปัญหา และการดาวน์โหลดจะไม่ช่วยแก้ปัญหานั้น

สิ่งที่ทำให้แอปให้ความรู้สึกแบบที่มันเป็น ส่วนใหญ่ไม่ใช่โมเดลเสียงพูด บริบทที่คงอยู่ข้ามเทิร์น การตัดสินใจค้นเว็บกลางบทสนทนา จังหวะที่เอเจนต์พูด สิ่งเหล่านี้คือ orchestration และไม่มีสิ่งใดอยู่ในเช็กพอยต์ขนาด 2B การดาวน์โหลด CSM-1B ให้เสียงกับคุณ การสร้างพฤติกรรมของแอปบนพื้นฐานของมันเป็นงานวิศวกรรมของคุณ และเพดานการโทร 30 นาทีกับการไม่มี API หมายความว่าคุณก็ไม่สามารถเช่าตัวเวอร์ชันสำเร็จรูปได้เช่นกัน

ถ้าสิ่งที่คุณต้องการคือโมเดลเสียงพูดที่คุณเรียกใช้งานได้ คำตอบตรงไปตรงมาคือ Gemini 3.8 Flash TTS เป็นตัวเลือกที่มีอินเทอร์เฟซพร้อมเอกสารประกอบ มีราคาที่ประกาศไว้ มีคะแนนจากแหล่งอิสระ และรองรับบทสนทนาสองผู้พูดในคำขอเดียว ถ้าสิ่งที่คุณต้องการคือเวตที่คุณเก็บไว้ได้ CSM-1B ภายใต้ Apache 2.0 คือหนึ่งในสองตัวที่คุณถือครองได้จริง — และข้อแลกเปลี่ยนคือคุณต้องจัดหาฮาร์ดแวร์ สแตกสำหรับให้บริการ และการรับประกันคุณภาพทั้งหมดด้วยตัวเอง

OrcaRouter ไม่ได้โฮสต์ทั้งสองอย่างนี้ โมเดลของ Google ถูกเรียกผ่าน API ของ Google เองและผ่านช่องทางต่างๆ ที่ระบุไว้ในประกาศเมื่อวันที่ 23 กันยายน ส่วน CSM-1B เป็นเช็กพอยต์ที่คุณรันเอง สิ่งที่ OrcaRouter มีไว้เพื่อคือชั้นที่อยู่เหนือทางเลือกนั้น: โมเดลกว่า 200 รุ่นภายใต้คีย์เดียว ในราคาตามที่ผู้ให้บริการประกาศไว้โดยไม่บวกเพิ่ม ดังนั้นเมื่อผู้ให้บริการเปลี่ยนราคา ก็มีผลทันทีในวันเดียวกัน การสลับสำรองอัตโนมัติเพื่อให้เส้นทางทดลองไม่กลายเป็นสิ่งที่ระบบโปรดักชันต้องพึ่งพา และ DSL สำหรับกำหนดเส้นทางที่ประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียว เมื่อเสียงเดียวไม่ใช่คำตอบของงานทั้งหมด

เวอร์ชันสั้นของการเปรียบเทียบนี้ก็คือ จริง ๆ แล้วมันไม่ใช่การเปรียบเทียบเลย ฝ่ายหนึ่งมีเรตการ์ดกับ Elo ส่วนอีกฝ่ายมีใบอนุญาตกับจำนวนดาวน์โหลด เลือกฝ่ายที่คุณเติมคอลัมน์ได้จริงเถอะ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube