
GPT-Live-1 กับ Sesame Preview: เสียงที่ดีที่สุดในการเปรียบเทียบนี้คือเสียงที่คุณซื้อไม่ได้
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด

ถามใครก็ได้ที่เคยใช้ทั้งสอง แล้วอันดับจะไม่ใกล้เคียงกันเลย: Sesame Preview คือผู้ช่วยเสียงที่น่าเชื่อถือที่สุดที่คนส่วนใหญ่เคยพูดด้วย และมันก็เป็นตัวที่คุณสร้างต่อยอดไม่ได้เช่นกัน GPT-Live-1 กับ Sesame Preview ถูกนำมาเปรียบเทียบกันอยู่ตลอด — ทั้งคู่สนทนาได้ ทั้งคู่รองรับการขัดจังหวะ ทั้งคู่ฟังดูเหมือนคนมากกว่าระบบตอบรับโทรศัพท์อัตโนมัติ — แต่ทั้งสองถูกเสนอในวิธีที่ตรงกันข้าม GPT-Live-1 เป็นโมเดลแบบโฮสต์ที่คุณเช่าเป็นรายนาที เปิดให้เรียกใช้ได้ทั่วไปตั้งแต่วันที่ 10 กันยายน 2026 ส่วน Sesame Preview เป็นแอปสำหรับผู้บริโภคฟรีที่ไม่มี API เลย และเสียงที่ผู้คนประทับใจนั้นทำงานบนโมเดลโปรดักชันที่ไม่เคยถูกเปิดตัว
แต่ละอย่างจริงๆ แล้วคืออะไร
• GPT-Live-1 — โมเดลเสียงแบบ full-duplex ของ OpenAI อยู่ใน ChatGPT ตั้งแต่ 8 กรกฎาคม 2026 และอยู่ใน API ตั้งแต่ 10 กันยายน ในราคา 0.05 ดอลลาร์ต่อนาทีเสียง มีเสียงใน API 12 เสียง ไม่มีการโคลนเสียง ไม่รองรับอินพุตภาพหรือวิดีโอ โดยจะส่งข้อความถอดเสียงและข้อความตอบกลับมาพร้อมกันในทุกเซสชัน
• Sesame Preview — ผู้ช่วยเสียงสำหรับผู้บริโภคของ Sesame ฟรีบน iOS ตั้งแต่เดือนพฤษภาคม 2026 เปิดให้ใช้งานอย่างกว้างขวางบน Android ตั้งแต่ต้นเดือนสิงหาคม 2026 พร้อมเว็บพรีวิวที่เน้นเสียงเป็นหลัก เอเจนต์ 4 ตัว — Maya, Miles, Simone และ Charlie — รองรับเฉพาะภาษาอังกฤษ โดยจำกัดเวลาสนทนาครั้งละ 30 นาที ซึ่งจะลดเหลือ 5 นาทีเมื่อออกจากระบบ
• CSM-1B — ส่วนของ Sesame ที่เปิดให้ใช้: โมเดลเสียงพูดเชิงสนทนาขนาด 1B ที่เผยแพร่ภายใต้ Apache 2.0 เมื่อวันที่ 23 เมษายน 2026 สร้างบนโครงหลักสถาปัตยกรรม Llama พร้อมตัวถอดรหัสแยกต่างหากและตัวแปลงรหัส Mimi ของ Kyutai ให้เสียงพูดภาษาอังกฤษแบบโมโนที่ 24 kHz จากบริบทประมาณ 4K โทเคน
สามบรรทัดด้านบนนี้คือโครงร่างทั้งหมดของการตัดสินใจ บริษัทหนึ่งขายโมเดลเป็นรายนาที อีกบริษัทแจกแอปให้ใช้ฟรี และเปิดซอร์สโมเดลขนาดเล็กกว่าซึ่งไม่ใช่โมเดลที่อยู่ในแอปนั้น
ช่องว่างระหว่างเดโมกับดาวน์โหลด
Sesame ตรงไปตรงมาเกี่ยวกับเรื่องนี้อย่างผิดปกติ และนี่คือข้อเท็จจริงสำคัญที่สุดเพียงข้อเดียวสำหรับใครก็ตามที่กำลังประเมินทั้งคู่นี้ เสียงในแอป Preview — เสียงที่สร้างคลิปไวรัลและรีวิว "โหมดเสียงที่ดีที่สุดในระดับเดียวกัน" — เป็นโมเดลโปรดักชันแบบปิดที่มีขนาดใหญ่กว่า CSM-1B เป็นเช็กพอยต์เปิดขนาด 1B พารามิเตอร์จากห้องแล็บเดียวกัน และจากการประเมินของผู้ที่ได้ลองใช้ทั้งสอง มันเป็นเสียงที่อ่อนแอกว่าอย่างชัดเจน เซสชันบน Preview ยังมีเพดานการใช้งานและจำกัดเฉพาะภาษาอังกฤษเท่านั้น และไม่มีการดำเนินการตามงานใด ๆ: เหล่าเอเจนต์เพียงพูดคุย พวกมันไม่จอง ซื้อ หรือยื่นเอกสารใด ๆ
นั่นทำให้นักพัฒนามีข้อเสนอที่เป็นจริงแต่แคบลง: เช็กพอยต์เสียงสนทนาที่โฮสต์เองได้โดยไม่มีค่าลิขสิทธิ์ ซึ่งให้บริการโดยผู้ให้บริการอินเฟอเรนซ์บุคคลที่สามรายหนึ่งในราคา 7 ดอลลาร์ต่อล้านตัวอักษร — ประมาณ 0.35 ดอลลาร์ต่อชั่วโมงของเสียงสังเคราะห์ — หรือฟรีบนฮาร์ดแวร์ของคุณเอง ยังไม่มีใครเผยแพร่การทดสอบประสิทธิภาพที่เป็นอิสระของไม่ว่าจะเป็นเสียง Preview หรือ CSM-1B ดังนั้นคำกล่าวอ้างเรื่องคุณภาพในทางใดทางหนึ่งจึงเป็นเพียงความรู้สึกจากการฟัง ไม่ใช่ผลการวัด Sesame ยังไม่ได้เผยแพร่ราคาสาธารณะ ไม่มีแพ็กเกจระดับองค์กร และไม่มีแผนการสร้างรายได้ ทิศทางที่บริษัทระบุไว้คือความร่วมมือด้านการวิจัยและผลิตภัณฑ์ฮาร์ดแวร์ที่วางแผนไว้

สิ่งที่ $0.05 ต่อนาทีซื้อได้ ซึ่งแบบฟรีไม่มี
จุดขายของ GPT-Live-1 ต่อนักพัฒนาไม่ใช่ว่ามันฟังดูดีกว่า เพราะข้อโต้แย้งนั้นไม่มีทางชนะเมื่อเทียบกับโมเดลปิดที่ไม่มีใครวัดได้ แต่คือความที่สิ่งนี้เรียกใช้ได้และมีราคากำหนดไว้ พูดให้ชัดเจนก็คือ สิ่งที่คุณได้เมื่อมิเตอร์เดิน:
• เซสชันที่คุณควบคุม — ID โมเดลหนึ่งรายการ ปลายทาง Live Sessions หนึ่งปลายทาง ตัวอย่างการผสานรวมที่เผยแพร่ซึ่งรันอยู่บน WebRTC และเซสชันที่คุณกำหนดค่าด้วยคำสั่ง เสียง และบล็อกการมอบหมาย
• การจัดการการขัดจังหวะในฐานะพฤติกรรมที่ได้รับการบันทึกไว้ — ระดับการโต้ตอบ 80.1% บน Full Duplex Bench v1.5 เทียบกับ 45.4% สำหรับ GPT-Realtime-2.1 โดยมีความหน่วงในการผลัดกันพูด 0.798 วินาที และความสำเร็จในการเรียกใช้เครื่องมือ 87% ทั้งสามตัวเลขเป็นตัวเลขของ OpenAI เอง เผยแพร่พร้อมกับการเปิดตัว และยังไม่มีใครทำซ้ำได้ ณ เวลาที่เขียนนี้
• แบ็กเอนด์การให้เหตุผลที่คุณเลือก — เลเยอร์เสียงส่งต่องานหนักข้ามขอบเขตแบบอะซิงโครนัสไปยังโมเดลแยกต่างหากที่ระบุชื่อไว้ในการตั้งค่าเซสชัน ซึ่งยังคงทำงานต่อไปขณะที่การสนทนาดำเนินต่อ ในตัวอย่างเอกสารของ OpenAI แบ็กเอนด์นั้นคือ GPT-5.6 Terra; ในการเปิดตัวสำหรับผู้บริโภคเมื่อเดือนกรกฎาคม มันคือ GPT-5.5
• ข้อความถอดเสียง ข้อความตอบกลับ และการเรียกเก็บค่าบริการในรูปแบบโทรศัพท์ — $3.00 สำหรับการเปิดสายต่อเนื่องหนึ่งชั่วโมง คิดค่าบริการเป็นรายวินาที โดย 15 วินาทีของการเริ่มต้นเซสชันจะถูกให้เป็นเครดิตแทนที่จะถูกบวกเพิ่ม
Sesame มอบบทสนทนาที่ดีกว่าให้คุณ และไม่มีสิ่งเหล่านั้นเลย หากคุณกำลังสร้างผลิตภัณฑ์ “บทสนทนาที่ดีกว่า ไม่มี API ไม่มีราคา ไม่มีเบนช์มาร์ก รองรับแค่ภาษาอังกฤษ จำกัดเวลา 30 นาที” ไม่ใช่การเปรียบเทียบ — มันคือรายชื่อรอ
ตอนนี้มีตัวเลขหนึ่งบน GPT-Live-1 ที่ไม่มีอยู่ตอนเปิดตัวสำหรับผู้บริโภค และมันเป็นน้ำหนักถ่วงอย่างซื่อตรงต่อทุกสิ่งที่กล่าวมาข้างต้น Speech to Speech Index ของ Artificial Analysis ให้คะแนน GPT-Live-1 ที่ 69.8% — เป็นอันดับเจ็ดจากสิบเอ็ดโมเดล ตามหลัง GPT-Realtime-2.1 ที่ 73.9% และตามหลัง Grok Voice Think Fast 2.0 ที่ 79.0% ดังนั้นโมเดลที่คุณซื้อได้ก็ไม่ใช่ตัวที่ดีที่สุดบนบอร์ดจัดอันดับอิสระเช่นกัน สิ่งที่บอร์ดให้คะแนนไม่ได้คือสิ่งที่ Sesame กำลังชนะจริง ๆ: ไม่มีโมเดลใดในสิบเอ็ดโมเดลบนดัชนีนั้นถูกให้คะแนนในแง่ว่าคุยด้วยแล้วรู้สึกอย่างไร และเสียงของ Sesame Preview ก็ไม่มีแถวในตารางที่ไหนเลย

ชิ้นส่วนของสแต็กที่ไม่ใช่ของบริษัทใดเลย
นี่คือจุดที่ทั้งสองทางเลือกมาบรรจบกัน และเป็นจุดที่การตัดสินใจไม่ใช่แบบสองทางอีกต่อไป ทั้ง Sesame Preview และ GPT-Live-1 ต่างก็ไม่ใช่เอเจนต์ที่สมบูรณ์ เอเจนต์ของ Sesame ไม่ได้ลงมือทำงาน ส่วน GPT-Live-1 มอบหมายสิ่งใดก็ตามที่ต้องใช้การให้เหตุผล การค้นคืนข้อมูล หรือเครื่องมือ ให้แก่โมเดลแบ็กเอนด์อย่างชัดเจน ในทั้งสองดีไซน์ งานที่น่าสนใจเกิดขึ้นเบื้องหลังเสียง ในการเรียกโมเดลข้อความธรรมดา และเลเยอร์นั้นพอร์ตได้ในแบบที่เลเยอร์เสียงทำไม่ได้ — คุณสามารถย้ายแบ็กเอนด์ได้โดยไม่ต้องอัดพรอมป์ต์ใหม่แม้แต่รายการเดียวสำหรับโมเดลเสียง
แบ็กเอนด์นั้นก็เป็นจุดที่ OrcaRouter มีประโยชน์ และควรพูดให้ชัดเจนว่าเรารับช่วงอะไรและไม่รับช่วงอะไร เราไม่จัดเส้นทางให้ GPT-Live-1: เอ็นด์พอยต์ Live Sessions เป็นของ OpenAI และเลเยอร์เสียงตรงนั้นอยู่นอกเหนือการเข้าถึงของเรา เราไม่จัดเส้นทางให้โมเดลโปรดักชันของ Sesame เช่นกัน ด้วยเหตุผลที่ง่ายกว่าคือมันไม่เคยถูกเสนอเป็น API สิ่งที่เราจัดเส้นทางคือเลเยอร์ที่ทั้งสองผลิตภัณฑ์ส่งงานต่อให้ โดยมีโมเดลราว 190 โมเดลจากผู้ให้บริการต้นทาง 11 รายทำงานอยู่เบื้องหลังคีย์เดียวในราคาตามที่ผู้ให้บริการระบุโดยไม่บวกเพิ่ม พร้อมการสลับสำรองอัตโนมัติระหว่างผู้ให้บริการ และ DSL สำหรับการจัดเส้นทางที่ประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียวได้ สำหรับทีมที่สร้างบนส่วนหน้าเสียงที่ยังไม่ผ่านการพิสูจน์ นั่นคือการป้องกันความเสี่ยงที่สำคัญ: เลเยอร์เสียงสามารถถูกสลับหรือถูกทิ้งไว้ได้โดยไม่ต้องพาเลเยอร์การให้เหตุผลไปด้วย และโมเดลที่คุณเดิมพันในเดือนมีนาคมก็สามารถถูกเปลี่ยนในเดือนมิถุนายนได้ด้วยการแก้ไขเพียงบรรทัดเดียว
ดูอะไรดี
สามสิ่งจะเปลี่ยนการเปรียบเทียบนี้ และยังไม่มีสิ่งใดอยู่ในมือของใครในตอนนี้ Sesame API — แม้จะเป็นแบบเสียเงิน — จะเปลี่ยนเสียงที่แข็งแกร่งที่สุดในหมวดหมู่นี้ให้กลายเป็นตัวเลือกที่สร้างได้ทันที และจะทำให้มีราคาจริงเทียบกับ $0.05 ของ GPT-Live-1 การเผยแพร่เกณฑ์มาตรฐานของเสียง Preview จะเปลี่ยนความประทับใจจากการฟังให้เป็นตัวเลข และการประเมินโดยอิสระมักจะไม่ปรานีต่อเสียงที่เคยแข่งขันเฉพาะในเดโมเท่านั้น และการทำซ้ำจากภายนอกครั้งแรกของตัวเลขการโต้ตอบและความหน่วงของ OpenAI จะตัดสินได้ว่าฟูลดูเพล็กซ์เป็นช่องว่างความสามารถจริงหรือเป็นการประเมินที่เลือกมาอย่างดี
จนถึงตอนนั้น ข้อสรุปที่ตรงไปตรงมาก็คือแบบนี้ ถ้าคุณกำลังเลือกเสียงให้ตัวเอง ใช้ Sesame Preview — มันฟรี มันดีกว่า และการเลือกใช้มันก็ไม่มีค่าใช้จ่ายอะไร ถ้าคุณกำลังเลือกเสียงสำหรับผลิตภัณฑ์ที่คุณต้องส่งมอบ ขาย และซัพพอร์ต GPT-Live-1 เป็นตัวเดียวในสองตัวที่คุณซื้อได้จริง และข้อเท็จจริงที่ว่ามันไม่ใช่ตัวที่ฟังดูดีกว่านั้นก็คือราคาที่ต้องจ่ายเพื่อเข้าเกม
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
