
Gemini 3.8 TTS กับ Sesame Preview: หนึ่งในนี้เป็นไฟล์ดาวน์โหลด ส่วนอีกอันเป็นแอป
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
ลองค้นหาการเปรียบเทียบระหว่าง Gemini 3.8 Flash TTS กับ Sesame Previewแล้วคุณจะพบงานเขียนมากมายที่มองว่าทั้งสองเป็นผลิตภัณฑ์ในหมวดหมู่เดียวกัน แต่ความจริงไม่ใช่เช่นนั้น และความแตกต่างนี้ก็ไม่ใช่แค่เรื่องเทคนิคเล็กน้อย Gemini 3.8 Flash TTS คือ API endpoint: มันมี model identifier มีตารางราคาที่เผยแพร่ มีอันดับบนลีดเดอร์บอร์ดที่อันดับ 2 ด้วยค่า Elo 1,260 จากตัวอย่าง 1,999 ตัวอย่างบน Artificial Analysis Provider Voice Arena และมีรูปแบบคำขอที่จัดทำเอกสารไว้ ส่วน Sesame Preview คือแอปผู้ช่วยเสียงสำหรับผู้บริโภคที่ใช้ฟรี มีเอเจนต์ที่มีชื่อ มีการสนทนาหลายรอบ และจำกัดเวลาสายไว้ที่ 30 นาที มันไม่มี API ไม่มี model ID ไม่มีแผนการเรียกเก็บเงิน และไม่มีคะแนนบนบอร์ดนั้น
ชิ้นงาน Sesame หนึ่งเดียวที่คุณสามารถสร้างต่อยอดได้จริงนั้นเป็นอีกเรื่องหนึ่งโดยสิ้นเชิง: CSM-1B ซึ่งเป็นเช็กพอยต์ Apache 2.0 บน Hugging Face ที่สร้างรหัสเสียงจากข้อความโดยใช้โครงหลัก Llama และตัวถอดรหัสเสียง Mimi มันไม่ใช่เสียงที่ผู้คนพูดถึงเมื่อบรรยายว่าแอปฟังดูเป็นมนุษย์แค่ไหน ดังนั้นการเปรียบเทียบจึงกลายเป็นคำถามที่ตอบได้: คุณต้องการเช่าโมเดลเสียงพูด หรือต้องการดาวน์โหลดมันมาใช้?

สองสิ่งที่เรียกว่า Sesame และมีเพียงหนึ่งเดียวในนั้นที่สามารถบิลด์ได้
การตั้งชื่อเป็นต้นเหตุของความสับสนส่วนใหญ่ ดังนั้นจงแยกมันออกเสียก่อนที่จะไปต่อ
• Sesame Preview — ตัวแอป ใช้งานฟรี เอเจนต์ชื่อ Maya, Miles, Simone และ Charlie การสนทนาแบบหลายรอบพร้อมบริบทที่คงอยู่ข้ามรอบ มีความสามารถด้านการค้นหาเว็บและการแจ้งเตือน รองรับเฉพาะภาษาอังกฤษ จำกัดเวลาสายไว้ที่ 30 นาที ไม่มีช่องทางสำหรับนักพัฒนา: ไม่มีอะไรให้ยืนยันตัวตน ไม่มีอะไรให้วัดปริมาณการใช้งาน ไม่มีปลายทางให้เรียกใช้
• CSM-1B — เช็คพอยต์ เผยแพร่บน Hugging Face ภายใต้ sesame/csm-1b ด้วยสัญญาอนุญาต Apache 2.0 แบ็กโบน Llama และตัวถอดรหัสขนาดเล็กที่สร้างรหัสเสียง Mimi ประมาณ 2 พันล้านพารามิเตอร์ ภาษาอังกฤษ น้ำหนัก F32 และทำงานผ่าน Hugging Face Transformers การ์ดโมเดลบันทึกว่าเวอร์ชัน 1B เริ่มจัดส่งในเดือนมีนาคม 2025 และการรองรับ Transformers แบบเนทีฟมาถึงในเดือนพฤษภาคม 2025
สองสิ่งนั้นมีบริษัทเดียวกันและมีสายงานวิจัยร่วมกัน และความสัมพันธ์ก็จบลงประมาณตรงนั้น แอปเป็นผลิตภัณฑ์ ส่วนเช็กพอยต์เป็นสิ่งที่ได้จากงานวิจัยที่มาก่อนหน้ามัน ผู้รีวิวที่ชื่นชมความจำเชิงสนทนาของแอปกำลังบรรยายถึงระบบที่มีการค้นคืนและการจัดการสถานะอยู่รอบ ๆ โมเดลเสียง ไม่ใช่คุณสมบัติของเช็กพอยต์ 2B ที่คุณดาวน์โหลดได้
จริง ๆ แล้วข้างในเช็กพอยต์มีอะไรกันแน่
CSM-1B เป็นโมเดลแปลงข้อความเป็นเสียงพูดในเชิงสถาปัตยกรรม ซึ่งเป็นสิ่งที่สำคัญสำหรับใครก็ตามที่วางแผนจะรันโมเดลนี้: มันรับข้อความและบริบทเสียงเป็นอินพุต และส่งออก RVQ audio codes ซึ่งตัวถอดรหัสจะเปลี่ยนเป็นรูปคลื่นเสียง ข้อเท็จจริงในทางปฏิบัติจาก model card มีดังนี้:
• สัญญาอนุญาต — Apache 2.0 นี่เป็นบรรทัดที่สำคัญที่สุดเพียงบรรทัดเดียวในหน้านี้ ต่างจากสัญญาอนุญาตน้ำหนักที่จำกัดเฉพาะการวิจัย Apache 2.0 อนุญาตให้ใช้ในเชิงพาณิชย์ได้โดยไม่ต้องมีข้อตกลงแยกต่างหาก ซึ่งทำให้ CSM-1B เป็นหนึ่งในไม่กี่เช็คพอยต์เสียงพูดแบบเปิดที่ใช้งานได้จริง
• ขนาด — ประมาณ 2B พารามิเตอร์ที่ F32 ใหญ่พอที่จะต้องใช้ฮาร์ดแวร์จริงสำหรับงานที่ทำงานพร้อมกัน และเล็กพอที่จะรันบนตัวเร่งความเร็วตัวเดียวสำหรับการพัฒนา
• ภาษา — อังกฤษ ตามที่ระบุบนการ์ด ไม่ใช่โมเดลหลายภาษา
• กระแสตอบรับ — 141,461 ดาวน์โหลดในเดือนที่ผ่านมา ณ เวลาที่เขียน โดยมีไลก์ประมาณ 245,000 บนรีพอซิทอรี นั่นถือเป็นเช็คพอยต์ที่ถูกใช้งานอย่างแพร่หลายตามมาตรฐานของโมเดลเสียงพูดแบบเปิด และเป็นข้อโต้แย้งที่หนักแน่นที่สุดว่าอาร์ติแฟกต์นี้มีฐานผู้ใช้จริงที่เป็นอิสระจากกระแสข่าวของแอป

สิ่งที่การ์ดไม่ได้ให้คุณคือคำกล่าวอ้างเรื่องคุณภาพที่คุณสามารถนำไปเปรียบเทียบกับอะไรก็ได้ ไม่มีแถวในอารีนา ไม่มีเกณฑ์วัดของผู้ขายที่บุคคลที่สามทำซ้ำ และไม่มีการประเมินที่เผยแพร่เกี่ยวกับว่าเอาต์พุตของเช็กพอยต์เกี่ยวข้องกับของแอปอย่างไร ใครก็ตามที่บอกคุณว่าโมเดลที่ดาวน์โหลดได้นั้นดูเหมือนแอป กำลังอนุมานสิ่งนั้นจากชื่อเท่านั้น
ทำไมจึงไม่มีการเปรียบเทียบแบบตัวต่อตัว และทำไมสิ่งนั้นจึงไม่ใช่ช่องว่างงานวิจัย
ไม่มีการเปรียบเทียบ Gemini 3.8 TTS กับ Sesame Preview บนลีดเดอร์บอร์ด เพราะไม่มีทางที่จะมีได้ อารีนาจัดอันดับโมเดลโดยให้ผู้ฟังเปรียบเทียบคลิปที่สร้างจากปลายทางที่โฮสต์ไว้ ฝ่ายหนึ่งของการจับคู่นี้ไม่มีปลายทางดังกล่าว จึงไม่สามารถส่งเข้าแข่งขันได้
นั่นเป็นสิ่งที่ควรพูดให้ชัดเจน เพราะ “ไม่มีการเปรียบเทียบโดยตรง” มักถูกเขียนขึ้นราวกับว่าข้อมูลนั้นหายไป มันไม่ได้หายไป แต่มันไม่ได้ถูกนิยาม สองสิ่งที่ถูกนำมาเปรียบเทียบกันไม่มีพื้นผิวที่วัดร่วมกันได้:
• Gemini 3.8 Flash TTS ได้รับการให้คะแนนจากเสียงที่โฮสต์ไว้ซึ่งเป็นเสียงดั้งเดิมของตัวเอง ส่วน Sesame Preview ไม่มีเสียงดั้งเดิมที่จะให้คะแนนในความหมายนั้น — มันมีเอเจนต์
• Gemini 3.8 Flash TTS เผยแพร่ตารางอัตราค่าบริการเป็นโทเคน ส่วน Sesame Preview นั้นฟรีและไม่เผยแพร่สิ่งใด เพราะไม่มีอะไรให้เรียกเก็บ
• Gemini 3.8 Flash TTS รับสคริปต์และส่งคืนเสียง ส่วน Sesame Preview รับบทสนทนาและส่งคืนบทสนทนา พร้อมด้วยการดึงข้อมูลและหน่วยความจำใดก็ตามที่แอปซ้อนเพิ่มเข้ามา
สิ่งที่ใกล้เคียงที่สุดกับการเปรียบเทียบที่สมเหตุสมผลคือระหว่าง Gemini 3.8 Flash TTS กับ CSM-1B และแม้แต่การเปรียบเทียบนั้นก็ยังไม่เสมอกัน: ฝ่ายหนึ่งมีคะแนน Elo ที่เป็นอิสระและตารางราคาของผู้ให้บริการ ส่วนอีกฝ่ายไม่มีทั้งสองอย่าง สิ่งที่คุณเปรียบเทียบได้คือรูปแบบของข้อผูกมัด — API แบบคิดค่าตามการใช้งาน เทียบกับเช็กพอยต์ที่ดาวน์โหลดได้ — และการเปรียบเทียบนั้นไม่จำเป็นต้องมีลีดเดอร์บอร์ด
ด้านเดียวของสิ่งนี้ที่มีตัวเลขอยู่
ทุกอย่างที่เป็นเชิงปริมาณในการจับคู่นี้ล้วนอยู่ฝั่งของ Google ซึ่งนั่นเองก็คือประเด็น
บน Artificial Analysis Provider Voice Arena ซึ่งบันทึกเมื่อวันที่ 24 กันยายน 2026 Gemini 3.8 Flash TTS อยู่อันดับ 2 ด้วย Elo 1,260 จากตัวอย่าง 1,999 ตัวอย่างและเสียงในอารีนา 8 เสียง เปิดตัวเมื่อวันที่ 23 กันยายน 2026 Gemini 3.8 Flash-Lite TTS รุ่นพี่น้องของมันอยู่อันดับ 6 ด้วย 1,235 Google คิดราคา Flash TTS ที่ 0.50 ดอลลาร์ต่อล้านโทเคนข้อความขาเข้า และ 9.00 ดอลลาร์ต่อล้านโทเคนเสียงขาออก ไปจนถึงวันที่ 31 ธันวาคม 2026 จากนั้นเป็น 18.00 ดอลลาร์ โดย Flash-Lite TTS อยู่ที่ 0.50 และ 6.00 ดอลลาร์ จากนั้น 12.00 ดอลลาร์; Artificial Analysis ปรับมาตรฐานค่าเหล่านี้เป็น 16.50 และ 11.00 ดอลลาร์ต่อล้านตัวอักษร เพื่อให้เทียบเคียงบนกระดานเดียวกันกับโมเดลที่คิดราคาเป็นหน่วยอื่นได้ การปรับมาตรฐานนั้นเป็นการคำนวณของกระดานจัดอันดับ ไม่ใช่คำกล่าวอ้างของ Google
ในทางกลับกัน CSM-1B ไม่มีราคาเพราะไม่มีมาตรวัดการใช้งาน มันมีจำนวนการดาวน์โหลด ใบอนุญาต และจำนวนพารามิเตอร์ หากกรอบการตัดสินใจของคุณต้องการค่า Elo การเปรียบเทียบนี้จะไม่ให้ค่าดังกล่าวสำหรับฝั่ง Sesame และข้อสรุปที่ตรงไปตรงมาคือทั้งสองตัวเลือกกำลังถูกประเมินด้วยเกณฑ์ที่แตกต่างกัน มากกว่าที่จะเป็นเพราะหนึ่งในนั้นยังไม่ได้รับการพิสูจน์

ถ้าสิ่งที่คุณต้องการคือประสบการณ์การใช้งานแอป
หลายคนที่ค้นหาการเปรียบเทียบนี้ไม่ได้กำลังเลือกโมเดลเลยด้วยซ้ำ พวกเขาใช้แอป Sesame ชอบความรู้สึกของการสนทนา และอยากได้แบบนั้นในผลิตภัณฑ์ของตน นั่นเป็นคนละปัญหา และการดาวน์โหลดจะไม่ช่วยแก้ปัญหานั้น
สิ่งที่ทำให้แอปให้ความรู้สึกแบบที่มันเป็น ส่วนใหญ่ไม่ใช่โมเดลเสียงพูด บริบทที่คงอยู่ข้ามเทิร์น การตัดสินใจค้นเว็บกลางบทสนทนา จังหวะที่เอเจนต์พูด สิ่งเหล่านี้คือ orchestration และไม่มีสิ่งใดอยู่ในเช็กพอยต์ขนาด 2B การดาวน์โหลด CSM-1B ให้เสียงกับคุณ การสร้างพฤติกรรมของแอปบนพื้นฐานของมันเป็นงานวิศวกรรมของคุณ และเพดานการโทร 30 นาทีกับการไม่มี API หมายความว่าคุณก็ไม่สามารถเช่าตัวเวอร์ชันสำเร็จรูปได้เช่นกัน
ถ้าสิ่งที่คุณต้องการคือโมเดลเสียงพูดที่คุณเรียกใช้งานได้ คำตอบตรงไปตรงมาคือ Gemini 3.8 Flash TTS เป็นตัวเลือกที่มีอินเทอร์เฟซพร้อมเอกสารประกอบ มีราคาที่ประกาศไว้ มีคะแนนจากแหล่งอิสระ และรองรับบทสนทนาสองผู้พูดในคำขอเดียว ถ้าสิ่งที่คุณต้องการคือเวตที่คุณเก็บไว้ได้ CSM-1B ภายใต้ Apache 2.0 คือหนึ่งในสองตัวที่คุณถือครองได้จริง — และข้อแลกเปลี่ยนคือคุณต้องจัดหาฮาร์ดแวร์ สแตกสำหรับให้บริการ และการรับประกันคุณภาพทั้งหมดด้วยตัวเอง
OrcaRouter ไม่ได้โฮสต์ทั้งสองอย่างนี้ โมเดลของ Google ถูกเรียกผ่าน API ของ Google เองและผ่านช่องทางต่างๆ ที่ระบุไว้ในประกาศเมื่อวันที่ 23 กันยายน ส่วน CSM-1B เป็นเช็กพอยต์ที่คุณรันเอง สิ่งที่ OrcaRouter มีไว้เพื่อคือชั้นที่อยู่เหนือทางเลือกนั้น: โมเดลกว่า 200 รุ่นภายใต้คีย์เดียว ในราคาตามที่ผู้ให้บริการประกาศไว้โดยไม่บวกเพิ่ม ดังนั้นเมื่อผู้ให้บริการเปลี่ยนราคา ก็มีผลทันทีในวันเดียวกัน การสลับสำรองอัตโนมัติเพื่อให้เส้นทางทดลองไม่กลายเป็นสิ่งที่ระบบโปรดักชันต้องพึ่งพา และ DSL สำหรับกำหนดเส้นทางที่ประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียว เมื่อเสียงเดียวไม่ใช่คำตอบของงานทั้งหมด
เวอร์ชันสั้นของการเปรียบเทียบนี้ก็คือ จริง ๆ แล้วมันไม่ใช่การเปรียบเทียบเลย ฝ่ายหนึ่งมีเรตการ์ดกับ Elo ส่วนอีกฝ่ายมีใบอนุญาตกับจำนวนดาวน์โหลด เลือกฝ่ายที่คุณเติมคอลัมน์ได้จริงเถอะ
