การ์ดชื่อเรื่องหลักสำหรับ 'GPT-Live-1 vs Sesame Preview' คำบรรยายใต้ชื่อ 'เสียงที่ดีที่สุดตรงนี้คือเสียงที่ไม่มี API' พร้อมป้ายที่อ่านว่า 'อันหนึ่งฟรีและปิด อันหนึ่งเสียค่าใช้จ่ายและเรียกใช้ได้' และการ์ดสามใบ: 'Sesame Preview — แอปฟรี ไม่มี API เสียงระดับโปรดักชันยังไม่เปิดตัว', 'GPT-Live-1 — 0.05 ดอลลาร์ต่อนาทีเสียง API สาธารณะตั้งแต่ 10 กันยายน 2026' และ 'ส่วนที่นำไปสร้างได้ของ Sesame — CSM-1B, Apache-2.0, พารามิเตอร์ 1B, 7 ดอลลาร์ต่อ 1 ล้านตัวอักษร หรือโฮสต์เอง' เหนือแถบส่วนท้ายที่อ่านว่า 'เสียงระดับโปรดักชันของ Sesame ไม่มีเกณฑ์มาตรฐานที่เผยแพร่ ส่วนตัวเลขเสียงของ GPT-Live-1 เป็นข้อมูลที่ OpenAI รายงาน' โลโก้ OrcaRouter ถูกคอมโพสิตไว้มุมขวาล่าง
Guides & Insights

GPT-Live-1 กับ Sesame Preview: เสียงที่ดีที่สุดในการเปรียบเทียบนี้คือเสียงที่คุณซื้อไม่ได้

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด
A two-column scoreboard titled 'GPT-Live-1 vs Sesame Preview - the scoreboard'. Left column GPT-Live-1: 'Access: public API since September 10, 2026', 'Price: $0.05 per voice minute', 'Voices: 12 API voices, no cloning', 'Duplex: full duplex, barge-in native', 'Weights: closed', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Sesame Preview: 'Access: free consumer app, no API', 'Price: $0 to the user, no paid tier', 'Voices: four agents, one production voice', 'Duplex: conversational, interruptible', 'Weights: CSM-1B open, production model closed', 'Independent score: none, no public benchmark of the Preview voice'. Footer: 'The Sesame Preview production voice is unreleased; CSM-1B is a separate, smaller open checkpoint.'

ถามใครก็ได้ที่เคยใช้ทั้งสอง แล้วอันดับจะไม่ใกล้เคียงกันเลย: Sesame Preview คือผู้ช่วยเสียงที่น่าเชื่อถือที่สุดที่คนส่วนใหญ่เคยพูดด้วย และมันก็เป็นตัวที่คุณสร้างต่อยอดไม่ได้เช่นกัน GPT-Live-1 กับ Sesame Preview ถูกนำมาเปรียบเทียบกันอยู่ตลอด — ทั้งคู่สนทนาได้ ทั้งคู่รองรับการขัดจังหวะ ทั้งคู่ฟังดูเหมือนคนมากกว่าระบบตอบรับโทรศัพท์อัตโนมัติ — แต่ทั้งสองถูกเสนอในวิธีที่ตรงกันข้าม GPT-Live-1 เป็นโมเดลแบบโฮสต์ที่คุณเช่าเป็นรายนาที เปิดให้เรียกใช้ได้ทั่วไปตั้งแต่วันที่ 10 กันยายน 2026 ส่วน Sesame Preview เป็นแอปสำหรับผู้บริโภคฟรีที่ไม่มี API เลย และเสียงที่ผู้คนประทับใจนั้นทำงานบนโมเดลโปรดักชันที่ไม่เคยถูกเปิดตัว

แต่ละอย่างจริงๆ แล้วคืออะไร

• GPT-Live-1 — โมเดลเสียงแบบ full-duplex ของ OpenAI อยู่ใน ChatGPT ตั้งแต่ 8 กรกฎาคม 2026 และอยู่ใน API ตั้งแต่ 10 กันยายน ในราคา 0.05 ดอลลาร์ต่อนาทีเสียง มีเสียงใน API 12 เสียง ไม่มีการโคลนเสียง ไม่รองรับอินพุตภาพหรือวิดีโอ โดยจะส่งข้อความถอดเสียงและข้อความตอบกลับมาพร้อมกันในทุกเซสชัน

• Sesame Preview — ผู้ช่วยเสียงสำหรับผู้บริโภคของ Sesame ฟรีบน iOS ตั้งแต่เดือนพฤษภาคม 2026 เปิดให้ใช้งานอย่างกว้างขวางบน Android ตั้งแต่ต้นเดือนสิงหาคม 2026 พร้อมเว็บพรีวิวที่เน้นเสียงเป็นหลัก เอเจนต์ 4 ตัว — Maya, Miles, Simone และ Charlie — รองรับเฉพาะภาษาอังกฤษ โดยจำกัดเวลาสนทนาครั้งละ 30 นาที ซึ่งจะลดเหลือ 5 นาทีเมื่อออกจากระบบ

• CSM-1B — ส่วนของ Sesame ที่เปิดให้ใช้: โมเดลเสียงพูดเชิงสนทนาขนาด 1B ที่เผยแพร่ภายใต้ Apache 2.0 เมื่อวันที่ 23 เมษายน 2026 สร้างบนโครงหลักสถาปัตยกรรม Llama พร้อมตัวถอดรหัสแยกต่างหากและตัวแปลงรหัส Mimi ของ Kyutai ให้เสียงพูดภาษาอังกฤษแบบโมโนที่ 24 kHz จากบริบทประมาณ 4K โทเคน

สามบรรทัดด้านบนนี้คือโครงร่างทั้งหมดของการตัดสินใจ บริษัทหนึ่งขายโมเดลเป็นรายนาที อีกบริษัทแจกแอปให้ใช้ฟรี และเปิดซอร์สโมเดลขนาดเล็กกว่าซึ่งไม่ใช่โมเดลที่อยู่ในแอปนั้น

ช่องว่างระหว่างเดโมกับดาวน์โหลด

Sesame ตรงไปตรงมาเกี่ยวกับเรื่องนี้อย่างผิดปกติ และนี่คือข้อเท็จจริงสำคัญที่สุดเพียงข้อเดียวสำหรับใครก็ตามที่กำลังประเมินทั้งคู่นี้ เสียงในแอป Preview — เสียงที่สร้างคลิปไวรัลและรีวิว "โหมดเสียงที่ดีที่สุดในระดับเดียวกัน" — เป็นโมเดลโปรดักชันแบบปิดที่มีขนาดใหญ่กว่า CSM-1B เป็นเช็กพอยต์เปิดขนาด 1B พารามิเตอร์จากห้องแล็บเดียวกัน และจากการประเมินของผู้ที่ได้ลองใช้ทั้งสอง มันเป็นเสียงที่อ่อนแอกว่าอย่างชัดเจน เซสชันบน Preview ยังมีเพดานการใช้งานและจำกัดเฉพาะภาษาอังกฤษเท่านั้น และไม่มีการดำเนินการตามงานใด ๆ: เหล่าเอเจนต์เพียงพูดคุย พวกมันไม่จอง ซื้อ หรือยื่นเอกสารใด ๆ

นั่นทำให้นักพัฒนามีข้อเสนอที่เป็นจริงแต่แคบลง: เช็กพอยต์เสียงสนทนาที่โฮสต์เองได้โดยไม่มีค่าลิขสิทธิ์ ซึ่งให้บริการโดยผู้ให้บริการอินเฟอเรนซ์บุคคลที่สามรายหนึ่งในราคา 7 ดอลลาร์ต่อล้านตัวอักษร — ประมาณ 0.35 ดอลลาร์ต่อชั่วโมงของเสียงสังเคราะห์ — หรือฟรีบนฮาร์ดแวร์ของคุณเอง ยังไม่มีใครเผยแพร่การทดสอบประสิทธิภาพที่เป็นอิสระของไม่ว่าจะเป็นเสียง Preview หรือ CSM-1B ดังนั้นคำกล่าวอ้างเรื่องคุณภาพในทางใดทางหนึ่งจึงเป็นเพียงความรู้สึกจากการฟัง ไม่ใช่ผลการวัด Sesame ยังไม่ได้เผยแพร่ราคาสาธารณะ ไม่มีแพ็กเกจระดับองค์กร และไม่มีแผนการสร้างรายได้ ทิศทางที่บริษัทระบุไว้คือความร่วมมือด้านการวิจัยและผลิตภัณฑ์ฮาร์ดแวร์ที่วางแผนไว้

A screenshot of the Sesame homepage as of September 2026, headed 'Curiosity, met' with the subline 'Personal intelligence with a point of view', and a section titled 'A collection of personal agents' reading 'Think out loud. Follow a thread. Discover something unexpected.' with a 'Get the Preview' button. The navigation offers only Blog, Team, Mobile Preview and Research Preview — no pricing, no documentation and no developer or API link.

สิ่งที่ $0.05 ต่อนาทีซื้อได้ ซึ่งแบบฟรีไม่มี

จุดขายของ GPT-Live-1 ต่อนักพัฒนาไม่ใช่ว่ามันฟังดูดีกว่า เพราะข้อโต้แย้งนั้นไม่มีทางชนะเมื่อเทียบกับโมเดลปิดที่ไม่มีใครวัดได้ แต่คือความที่สิ่งนี้เรียกใช้ได้และมีราคากำหนดไว้ พูดให้ชัดเจนก็คือ สิ่งที่คุณได้เมื่อมิเตอร์เดิน:

• เซสชันที่คุณควบคุม — ID โมเดลหนึ่งรายการ ปลายทาง Live Sessions หนึ่งปลายทาง ตัวอย่างการผสานรวมที่เผยแพร่ซึ่งรันอยู่บน WebRTC และเซสชันที่คุณกำหนดค่าด้วยคำสั่ง เสียง และบล็อกการมอบหมาย

• การจัดการการขัดจังหวะในฐานะพฤติกรรมที่ได้รับการบันทึกไว้ — ระดับการโต้ตอบ 80.1% บน Full Duplex Bench v1.5 เทียบกับ 45.4% สำหรับ GPT-Realtime-2.1 โดยมีความหน่วงในการผลัดกันพูด 0.798 วินาที และความสำเร็จในการเรียกใช้เครื่องมือ 87% ทั้งสามตัวเลขเป็นตัวเลขของ Ope​nAI เอง เผยแพร่พร้อมกับการเปิดตัว และยังไม่มีใครทำซ้ำได้ ณ เวลาที่เขียนนี้

• แบ็กเอนด์การให้เหตุผลที่คุณเลือก — เลเยอร์เสียงส่งต่องานหนักข้ามขอบเขตแบบอะซิงโครนัสไปยังโมเดลแยกต่างหากที่ระบุชื่อไว้ในการตั้งค่าเซสชัน ซึ่งยังคงทำงานต่อไปขณะที่การสนทนาดำเนินต่อ ในตัวอย่างเอกสารของ Ope​nAI แบ็กเอนด์นั้นคือ GPT-5.6 Terra; ในการเปิดตัวสำหรับผู้บริโภคเมื่อเดือนกรกฎาคม มันคือ GPT-5.5

• ข้อความถอดเสียง ข้อความตอบกลับ และการเรียกเก็บค่าบริการในรูปแบบโทรศัพท์ — $3.00 สำหรับการเปิดสายต่อเนื่องหนึ่งชั่วโมง คิดค่าบริการเป็นรายวินาที โดย 15 วินาทีของการเริ่มต้นเซสชันจะถูกให้เป็นเครดิตแทนที่จะถูกบวกเพิ่ม

Sesame มอบบทสนทนาที่ดีกว่าให้คุณ และไม่มีสิ่งเหล่านั้นเลย หากคุณกำลังสร้างผลิตภัณฑ์ “บทสนทนาที่ดีกว่า ไม่มี API ไม่มีราคา ไม่มีเบนช์มาร์ก รองรับแค่ภาษาอังกฤษ จำกัดเวลา 30 นาที” ไม่ใช่การเปรียบเทียบ — มันคือรายชื่อรอ

ตอนนี้มีตัวเลขหนึ่งบน GPT-Live-1 ที่ไม่มีอยู่ตอนเปิดตัวสำหรับผู้บริโภค และมันเป็นน้ำหนักถ่วงอย่างซื่อตรงต่อทุกสิ่งที่กล่าวมาข้างต้น Speech to Speech Index ของ Artificial Analysis ให้คะแนน GPT-Live-1 ที่ 69.8% — เป็นอันดับเจ็ดจากสิบเอ็ดโมเดล ตามหลัง GPT-Realtime-2.1 ที่ 73.9% และตามหลัง Grok Voice Think Fast 2.0 ที่ 79.0% ดังนั้นโมเดลที่คุณซื้อได้ก็ไม่ใช่ตัวที่ดีที่สุดบนบอร์ดจัดอันดับอิสระเช่นกัน สิ่งที่บอร์ดให้คะแนนไม่ได้คือสิ่งที่ Sesame กำลังชนะจริง ๆ: ไม่มีโมเดลใดในสิบเอ็ดโมเดลบนดัชนีนั้นถูกให้คะแนนในแง่ว่าคุยด้วยแล้วรู้สึกอย่างไร และเสียงของ Sesame Preview ก็ไม่มีแถวในตารางที่ไหนเลย

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%. No Sesame model appears on the index.

ชิ้นส่วนของสแต็กที่ไม่ใช่ของบริษัทใดเลย

นี่คือจุดที่ทั้งสองทางเลือกมาบรรจบกัน และเป็นจุดที่การตัดสินใจไม่ใช่แบบสองทางอีกต่อไป ทั้ง Sesame Preview และ GPT-Live-1 ต่างก็ไม่ใช่เอเจนต์ที่สมบูรณ์ เอเจนต์ของ Sesame ไม่ได้ลงมือทำงาน ส่วน GPT-Live-1 มอบหมายสิ่งใดก็ตามที่ต้องใช้การให้เหตุผล การค้นคืนข้อมูล หรือเครื่องมือ ให้แก่โมเดลแบ็กเอนด์อย่างชัดเจน ในทั้งสองดีไซน์ งานที่น่าสนใจเกิดขึ้นเบื้องหลังเสียง ในการเรียกโมเดลข้อความธรรมดา และเลเยอร์นั้นพอร์ตได้ในแบบที่เลเยอร์เสียงทำไม่ได้ — คุณสามารถย้ายแบ็กเอนด์ได้โดยไม่ต้องอัดพรอมป์ต์ใหม่แม้แต่รายการเดียวสำหรับโมเดลเสียง

แบ็กเอนด์นั้นก็เป็นจุดที่ OrcaRouter มีประโยชน์ และควรพูดให้ชัดเจนว่าเรารับช่วงอะไรและไม่รับช่วงอะไร เราไม่จัดเส้นทางให้ GPT-Live-1: เอ็นด์พอยต์ Live Sessions เป็นของ OpenAI และเลเยอร์เสียงตรงนั้นอยู่นอกเหนือการเข้าถึงของเรา เราไม่จัดเส้นทางให้โมเดลโปรดักชันของ Sesame เช่นกัน ด้วยเหตุผลที่ง่ายกว่าคือมันไม่เคยถูกเสนอเป็น API สิ่งที่เราจัดเส้นทางคือเลเยอร์ที่ทั้งสองผลิตภัณฑ์ส่งงานต่อให้ โดยมีโมเดลราว 190 โมเดลจากผู้ให้บริการต้นทาง 11 รายทำงานอยู่เบื้องหลังคีย์เดียวในราคาตามที่ผู้ให้บริการระบุโดยไม่บวกเพิ่ม พร้อมการสลับสำรองอัตโนมัติระหว่างผู้ให้บริการ และ DSL สำหรับการจัดเส้นทางที่ประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียวได้ สำหรับทีมที่สร้างบนส่วนหน้าเสียงที่ยังไม่ผ่านการพิสูจน์ นั่นคือการป้องกันความเสี่ยงที่สำคัญ: เลเยอร์เสียงสามารถถูกสลับหรือถูกทิ้งไว้ได้โดยไม่ต้องพาเลเยอร์การให้เหตุผลไปด้วย และโมเดลที่คุณเดิมพันในเดือนมีนาคมก็สามารถถูกเปลี่ยนในเดือนมิถุนายนได้ด้วยการแก้ไขเพียงบรรทัดเดียว

ดูอะไรดี

สามสิ่งจะเปลี่ยนการเปรียบเทียบนี้ และยังไม่มีสิ่งใดอยู่ในมือของใครในตอนนี้ Sesame API — แม้จะเป็นแบบเสียเงิน — จะเปลี่ยนเสียงที่แข็งแกร่งที่สุดในหมวดหมู่นี้ให้กลายเป็นตัวเลือกที่สร้างได้ทันที และจะทำให้มีราคาจริงเทียบกับ $0.05 ของ GPT-Live-1 การเผยแพร่เกณฑ์มาตรฐานของเสียง Preview จะเปลี่ยนความประทับใจจากการฟังให้เป็นตัวเลข และการประเมินโดยอิสระมักจะไม่ปรานีต่อเสียงที่เคยแข่งขันเฉพาะในเดโมเท่านั้น และการทำซ้ำจากภายนอกครั้งแรกของตัวเลขการโต้ตอบและความหน่วงของ OpenAI จะตัดสินได้ว่าฟูลดูเพล็กซ์เป็นช่องว่างความสามารถจริงหรือเป็นการประเมินที่เลือกมาอย่างดี

จนถึงตอนนั้น ข้อสรุปที่ตรงไปตรงมาก็คือแบบนี้ ถ้าคุณกำลังเลือกเสียงให้ตัวเอง ใช้ Sesame Preview — มันฟรี มันดีกว่า และการเลือกใช้มันก็ไม่มีค่าใช้จ่ายอะไร ถ้าคุณกำลังเลือกเสียงสำหรับผลิตภัณฑ์ที่คุณต้องส่งมอบ ขาย และซัพพอร์ต GPT-Live-1 เป็นตัวเดียวในสองตัวที่คุณซื้อได้จริง และข้อเท็จจริงที่ว่ามันไม่ใช่ตัวที่ฟังดูดีกว่านั้นก็คือราคาที่ต้องจ่ายเพื่อเข้าเกม

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube