
Gemini 3.8 Live กับ GLM-4-Voice: 21 เดือนของ Voice AI ให้อะไรได้จริง ๆ บ้าง
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 459 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 183 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
GLM-4-Voice เปิดตัวเมื่อวันที่ 3 ธันวาคม 2024 Gemini 3.8 Live ได้รับการประกาศเมื่อวันที่ 15 กันยายน 2026 นั่นคือ 21 เดือน และเป็นข้อเท็จจริงที่สำคัญที่สุดในการเปรียบเทียบนี้ — สำคัญกว่าผลเบนช์มาร์กใด ๆ เพราะมันเป็นตัวกำหนดว่าจริง ๆ แล้วคุณกำลังถามคำถามแบบไหนอยู่
สองโมเดลนี้ไม่ใช่คู่แข่งกัน ไม่มีใครที่นำเสียงไปใช้งานในวงกว้างในปี 2026 มาตัดสินใจเลือกระหว่างสองตัวนี้จากคุณภาพ คำถามที่แท้จริงคือคำถามที่ GLM-4-Voice ตั้งไว้ และ Gemini 3.8 Live ตอบไม่ได้: จะต้องทำอะไรบ้างจึงจะเป็นเจ้าของสิ่งนี้แทนที่จะเช่ามัน? คำถามนั้นมีคำตอบอยู่จริง และมันเปลี่ยนไปน้อยใน 21 เดือนกว่าที่คุณอาจคาดคิด
สิ่งที่ Google เปิดตัว และสิ่งที่ Zhipu เปิดตัว
Gemini 3.8 Live เป็นโมเดลบทสนทนาแบบสดที่โฮสต์ไว้และมีน้ำหนักแบบปิด โดยรองรับอินพุตภาพแบบเกือบเรียลไทม์ ตรวจจับและสลับไปมาระหว่าง 97 ภาษาที่รองรับโดยอัตโนมัติกลางบทสนทนา และเรียกใช้เครื่องมือและการเรียก API อยู่เบื้องหลังในขณะที่บทสนทนาดำเนินต่อไป พร้อมใช้งานสำหรับนักพัฒนาผ่าน Gemini API และ Google AI Studio อยู่ในช่วงพรีวิวส่วนตัวใน Gemini Enterprise และใน Search Live ราคาที่ประกาศไว้คือ $0.005 ต่อนาทีสำหรับเสียงอินพุต และ $0.018 ต่อนาทีสำหรับเสียงเอาต์พุต ผ่าน Live API; แผนภูมิต้นทุนต่อชั่วโมงของเสียงอินพุตจาก Artificial Analysis ระบุโดยอิสระว่าอยู่ที่ $1.50 ต่อชั่วโมง โมเดลพี่น้องของมันคือ Gemini 3.8 Live Extended Thinking ปัจจุบันครองอันดับสูงสุดในดัชนีเดียวกันที่ 82.6 ขณะที่ตัว Gemini 3.8 Live เองอยู่ที่ 76.0
GLM-4-Voice เป็นโมเดลเสียงพูดแบบ end-to-end ตัวแรกของ Zhipu AI และเป็นเช็กพอยต์ที่ดาวน์โหลดได้ เป็นระบบที่ประกอบด้วยสามส่วน: ตัวแปลงเสียงเป็นโทเค็นที่สร้างบนเอนโคเดอร์ Whisper-large-v3 พร้อมคอขวดแบบเวกเตอร์ควอนไทซ์ที่มีพารามิเตอร์ประมาณ 0.4B, โมเดลภาษาแบบออโตเรเกรสซีฟ (GLM-4-Voice-9B ซึ่งเริ่มต้นจาก GLM-4-9B) ที่พารามิเตอร์ประมาณ 9B และตัวถอดรหัสแบบ flow-matching ที่ฝึกใหม่จาก CosyVoice พูดภาษาจีนและอังกฤษได้ รองรับการควบคุมอารมณ์ น้ำเสียง อัตราการพูด และภาษาถิ่นตามคำสั่ง — รวมถึงกวางตุ้ง จีนกลางฉงชิ่ง และสำเนียงปักกิ่ง — และแปลงเสียงเป็นโทเค็นที่ 12.5 Hz ให้เป็นสตรีมโค้ดบุ๊กเดียวที่ประมาณ 175 bps ซึ่งต่ำกว่าโคเดกเสียงประสาททั่วไปประมาณหนึ่งอันดับขนาด
ขนาด เมื่อวางเคียงข้างกัน:
• เปิดตัว — Gemini 3.8 Live: 15 กันยายน 2026. GLM-4-Voice: 3 ธันวาคม 2024.
• เวท — ปิด โฮสต์เท่านั้น เทียบกับแบบดาวน์โหลดได้ โค้ด Apache-2.0 พร้อมสัญญาอนุญาตเวทแบบกำหนดเอง
• ภาษา — 97 ภาษา พร้อมการสลับภาษากลางบทสนทนา เมื่อเทียบกับภาษาจีนและภาษาอังกฤษ
• การมองเห็น — อินพุตภาพแบบเกือบเรียลไทม์ เทียบกับไม่มีเลย
• การเรียกใช้เครื่องมือ — การทำงานของเครื่องมือและ API เบื้องหลังระหว่างการสนทนา เทียบกับการไม่มีช่องทางสำหรับเครื่องมือเลย
• บริบท — ไม่ได้เปิดเผยโดย Google เทียบกับบริบท 8K เอาต์พุตสูงสุด 4K
• เกณฑ์ขั้นต่ำสำหรับการโฮสต์เอง — ไม่เกี่ยวข้อง เมื่อเทียบกับ 32 GB RAM พร้อม GPU CUDA อย่างเป็นทางการ; ประมาณ 12 GB VRAM ที่ int4
• การใส่ลายน้ำ — SynthID บนเสียงที่สร้างขึ้นทั้งหมด เทียบกับกรณีที่ไม่ได้ระบุไว้

21 เดือนที่ซื้อมาได้มาซึ่งขีดความสามารถ ไม่ใช่แค่คุณภาพ
เรื่องง่าย ๆ ก็คือโมเดลระดับแนวหน้าปี 2026 เอาชนะเช็กพอยต์แบบเปิดปี 2024 ได้ ซึ่งก็จริง และช่องว่างก็มาก — แต่ข้อสังเกตที่มีประโยชน์กว่าคือ หมวดหมู่นี้เปลี่ยนรูปทรง มากกว่าที่จะเคลื่อนไปตามแกนเดียว
ในรายงานทางเทคนิคของ Zhipu เอง GLM-4-Voice ทำคะแนนความแม่นยำการแปลงเสียงเป็นข้อความ 93.6% บน Topic-StoryCloze, 82.9% สำหรับเสียงเป็นเสียง, ค่าความเป็นธรรมชาติ UTMOS 4.45 และการถามตอบด้วยเสียง 5.40/10 ด้านทั่วไป และ 5.20/10 ด้านความรู้ — ทั้งหมดเป็นตัวเลขที่รายงานเองและยังไม่มีการทำซ้ำ การประเมินโดยอิสระมีน้อยกว่าและให้ภาพที่ไม่สวยเท่า: บน VoiceBench มันบันทึกคะแนนรวมไว้ที่ 56.48 อยู่อันดับราว 29 จาก 42 ในการจัดตารางหนึ่ง และอันดับ 30 จาก 40 ในอีกการจัดตารางหนึ่ง โดยความเข้าใจบทสนทนาหลายรอบถูกระบุว่าอ่อนในทั้งสองภาษา บนเกณฑ์วัดความเข้าใจบทสนทนาหลายรอบ C³ ได้ 11.09% ในภาษาจีน และ 33.22% ในภาษาอังกฤษ VCB Bench พบว่ามันเป็นผู้นำด้านการควบคุมอารมณ์ด้วย 93.0 ในตัวชี้วัดย่อย SIF ภาษาจีน และมีการจัดแนวข้อความ–เสียงที่แข็งแกร่ง แต่การจัดการภาษาถิ่นของ TELEVAL อยู่ที่ 4.57% เมื่อไม่มีคำสั่งอย่างชัดเจน
ตัวเลขเหล่านั้นอธิบายโมเดลที่เก่งด้านการแสดงออกทางเสียง แต่ไม่ดีในการทำความเข้าใจอย่างต่อเนื่อง นั่นคือโมเดลเสียงพูดปี 2024 ในหนึ่งประโยค
คะแนน 76.0 ของ Gemini 3.8 Live บน Speech to Speech Index ของ Artificial Analysis เป็นคะแนนรวมที่ประกอบด้วยการให้เหตุผลด้านเสียง ประสิทธิภาพเชิงเอเจนต์ ความชอบในอารีนา และอัตราความสำเร็จของงาน ไม่ใช่ว่าโมเดลที่ใหม่กว่านั้นเก่งกว่าในงานเดียวกันหลายเท่า แต่เป็นเพราะตอนนี้คะแนนรวมได้รวมประสิทธิภาพเชิงเอเจนต์และความสำเร็จของงานเข้าไปด้วยเลย — หมวดหมู่ที่ GLM-4-Voice ไม่สามารถแข่งขันได้เนื่องจากไม่มีช่องทางใช้เครื่องมือ โมเดลปี 2024 กำลังถูกให้คะแนนในเกมที่มันไม่ได้ถูกสร้างมาเพื่อเล่น

ใบอนุญาตคือส่วนที่ผู้คนมักข้ามไป
ถ้าคุณกำลังดู GLM-4-Voice เพราะมันเป็นแบบเปิด อ่านข้อกำหนดก่อนที่เวตจะดาวน์โหลดเสร็จ การแบ่งแยกนี้เป็นเรื่องจริงและง่ายที่จะตีความผิด:
• โค้ด — Apache-2.0 เปิดกว้างอย่างแท้จริง
• ค่าน้ำหนัก — สัญญาอนุญาตแบบกำหนดเองที่กำหนดให้ต้องระบุที่มาและลงทะเบียนกับ Zhipu สำหรับการใช้งานเชิงพาณิชย์
“Open weights” กับ “Apache-2.0” ไม่ใช่ข้ออ้างเดียวกัน และบทความทุติยภูมิจำนวนมากเกี่ยวกับโมเดลนี้มักทำให้สองสิ่งนี้ปนกันไป หากคุณตั้งใจจะปล่อยผลิตภัณฑ์เชิงพาณิชย์บน GLM-4-Voice ข้อกำหนดด้านการลงทะเบียนถือเป็นขั้นตอนทางกฎหมาย ไม่ใช่แค่พิธีการ และควรอยู่ในเส้นทางวิกฤต มีผู้ติดตามตรวจสอบรายหนึ่งไปไกลกว่านั้น โดยอธิบายว่าโมเดลนี้เป็นซอฟต์แวร์กรรมสิทธิ์ที่มีเงื่อนไขการใช้งานเชิงพาณิชย์ ไม่ว่าจะทางใด การไม่มีใบเรียกเก็บเงินรายนาทีก็ไม่ใช่การไม่มีความสัมพันธ์เชิงพาณิชย์
การคำนวณต้นทุนอย่างตรงไปตรงมา
เหตุผลสนับสนุนการโฮสต์ด้วยตนเองคือค่าใช้จ่ายรายเดือนแบบคงที่ชนะค่าใช้จ่ายแบบคิดรายนาทีเมื่อใช้งานในปริมาณมาก ข้อโต้แย้งนั้นเป็นเรื่องจริง และมันเล็กกว่าที่เห็นเมื่อคุณคำนึงถึงสิ่งที่คุณต้องดำเนินการ
GLM-4-Voice อย่างเป็นทางการต้องการ RAM 32 GB และ CUDA GPU การควอนไทซ์ int4 โดยชุมชนทำงานใน VRAM ประมาณ 12 GB ในทางปฏิบัติประมาณ 10–11 GB ซึ่งอยู่ในระดับ RTX 3060 โดยมีเพดานในทางปฏิบัติที่ประมาณ 30 วินาทีของเสียงพูดต่อเทิร์น A10 บนคลาวด์ในราคาประมาณ $0.50–$1.00 ต่อชั่วโมง เทียบเท่ากับประมาณ $350 ถึง $700 ต่อเดือนสำหรับอินสแตนซ์ที่รันต่อเนื่อง — ก่อนที่คุณจะให้บริการผู้ใช้แม้แต่คนเดียว และไม่มีการ failover ไม่มีความสามารถในการรับโหลดแบบ burst และไม่มีใครให้เพจเมื่อตัวถอดรหัสสร้างเสียงรบกวนตอนตี 3
เมื่อเทียบกับสิ่งนั้น Gemini 3.8 Live ในราคา $1.50 ต่อชั่วโมงของเสียงอินพุต หมายความว่า $350 ซื้อเสียงได้ประมาณ 233 ชั่วโมง ซึ่งไม่ได้แย่กว่าอย่างชัดเจน และยังมาพร้อมความจุที่คุณไม่ได้จัดสรรไว้ จุดตัดกันมีอยู่จริง มันสูงกว่าที่การเปรียบเทียบในพาดหัวชี้ให้เห็น และมันขยับไปตามว่าทราฟฟิกของคุณสม่ำเสมอหรือมาเป็นช่วงกระชาก ทราฟฟิกแบบกระชากคือกรณีที่การคิดราคาต่อนาทีชนะอย่างเด็ดขาด เพราะ GPU ที่ว่างก็ถูกคิดเงินเท่ากับ GPU ที่ใช้งานเต็มที่
ยังมีความแตกต่างในสิ่งที่คุณได้รับเมื่อเทียบกับเงินที่จ่ายไป รายงานจากชุมชนเกี่ยวกับการติดตั้งใช้งาน GLM-4-Voice แบบควอนไทซ์ระบุว่าความหน่วงของการสนทนาต่อเนื่องอยู่ที่ 38–120 มิลลิวินาที แม้ว่าตัวเลขเหล่านั้นจะมาจากบทความ-report มากกว่าที่จะมาจาก Zhipu ก็ตาม ส่วนความหน่วงของ Gemini 3.8 Live นั้น Google ยังไม่ได้เผยแพร่เลย หากความหน่วงต่ำเป็นข้อกำหนดที่ต้องมีสำหรับคุณ ทั้งสองตัวนี้ไม่มีตัวเลขที่คุณสามารถใช้ในการวางแผนได้ — ตัวหนึ่งมีผลวัดจากชุมชนบุคคลที่สาม อีกตัวมีคำรับรองจากพันธมิตรและไม่มีตัวเลข

ทางเลือกตรงกลาง: เป็นเจ้าของตรรกะ เช่าความสามารถ
การมองเรื่องนี้เป็นแบบ self-host กับ hosted นั้นมองข้ามรูปแบบที่ทีมส่วนใหญ่ลงเอยด้วยจริง ๆ GLM-4-Voice ไม่มีช่องทางสำหรับเครื่องมือ ดังนั้นผลิตภัณฑ์ใดก็ตามที่สร้างบนโมเดลนี้จึงต้องมีโมเดลข้อความแยกต่างหากมาทำหน้าที่ค้นข้อมูล ซึ่งหมายความว่าไม่ว่าจะทางไหน โมเดลเสียงที่โฮสต์เองก็จะอยู่หน้าโมเดลข้อความที่โฮสต์ไว้อยู่ดี การตัดสินใจเรื่องการติดตั้งใช้งานกับการตัดสินใจเรื่องขีดความสามารถนั้นแยกออกจากกันได้
จุดแยกนี้คือจุดที่เราเตอร์ทำงานจริง ๆ OrcaRouter รองรับโมเดล 190 ตัวไว้เบื้องหลังคีย์เดียว ในราคาตามที่ผู้ให้บริการประกาศโดยไม่บวกเพิ่ม ดังนั้นเป้าหมายการมอบหมายงานที่อยู่เบื้องหลังฟรอนต์เอนด์เสียงของคุณจึงสลับได้บนทราฟฟิกที่ใช้งานจริงโดยไม่ต้องสร้างอะไรใหม่ และการลดราคาจากต้นทางก็มาถึงคุณภายในวันเดียวกัน ไม่ต้องรอถึงรอบต่ออายุถัดไป การสลับไปใช้ระบบสำรองอัตโนมัติสำคัญกว่าปกติในการตั้งค่าแบบโฮสต์เอง เพราะเมื่ออินสแตนซ์ GPU ของคุณเองคือสิ่งที่ล่ม โมเดลแบ็กเอนด์ก็ยังเข้าถึงได้ และเซสชันไม่จำเป็นต้องตายไปพร้อมกับมัน มีข้อชี้แจงสองข้อ เนื่องจากการเปรียบเทียบนี้ชวนให้สับสน เราไม่ได้โฮสต์ GLM-4-Voice และเอนด์พอยต์ Gemini 3.8 Live ก็ไม่ได้อยู่บนเราเตอร์ของเราเช่นกัน — สิ่งเหล่านั้นมาจากผู้ขายของมันเอง สิ่งที่อยู่บนเราเตอร์คือเลเยอร์ข้อความที่ทั้งสองฝ่ายส่งงานต่อมาให้
การตัดสินใจ และบทเรียนที่อยู่เบื้องหลังมัน
เลือก GLM-4-Voiceถ้าคุณต้องการโมเดลนี้บนฮาร์ดแวร์ของคุณเอง ถ้าปริมาณการใช้งานของคุณคงที่ในระดับสูงอย่างแท้จริง ถ้าคุณพัฒนาเฉพาะภาษาจีนหรือภาษาอังกฤษเท่านั้น และถ้าคุณต้องปรับแก้โมเดลแทนที่จะเรียกใช้ผ่าน API จงถือว่าการลงทะเบียนใบอนุญาตเป็นงานจริงที่ต้องทำ และเตรียมรับมือว่าคุณจะต้องแก้ปัญหาความเข้าใจในบทสนทนาหลายรอบด้วยตัวเอง — นี่คือจุดอ่อนที่เอกสารของโมเดลระบุไว้ และไม่ว่าคุณจะปรับละเอียดมากแค่ไหนโดยมีเพดานเอาต์พุต 4K ก็ไม่อาจกลบเรื่องนี้ได้ทั้งหมด
เลือก Gemini 3.8 Liveหากความต้องการของคุณครอบคลุมถึงความสามารถด้านการมองเห็น (vision) การเรียกใช้เครื่องมือ (tool calling) การรองรับมากกว่าสองภาษา หรือรูปแบบทราฟฟิกใด ๆ ที่คุณอยากเรียกว่ากระเพื่อมเป็นพัก ๆ มันเป็นโมเดลพรีวิวที่ยังไม่มีการเผยแพร่ตัวเลขขนาดบริบทและความหน่วง ซึ่งถือเป็นความเสี่ยงในการวางแผนที่แท้จริง แต่ในขณะเดียวกันก็เป็นเพียงหนึ่งเดียวจากสองตัวนี้ที่สามารถค้นหาข้อมูลบางอย่างได้กลางประโยค
บทเรียนทั่วไปมีค่ามากกว่าคำตัดสินใด ๆ ทั้งสองข้อ ยี่สิบเอ็ดเดือนของเสียง AI ได้สร้างโมเดลที่ไม่ได้เป็นหลักแล้วว่าเป็นโมเดลเสียงที่ดีขึ้น — แต่เป็นอินเทอร์เฟซเสียงที่เชื่อมไปยังเอเจนต์ หากเหตุผลของคุณที่ต้องการน้ำหนักแบบเปิดคือต้นทุน การคำนวณตัวเลขนั้นใกล้เคียงกว่าที่กรอบคิดแบบไม่มีค่าใบอนุญาตชี้ให้เห็น หากเหตุผลของคุณคือการควบคุม สิ่งนั้นไม่ได้กลายเป็นสินค้าโภคภัณฑ์เลยแม้แต่น้อย และ GLM-4-Voice ก็ยังคงเป็นคำตอบที่ชอบธรรมสำหรับคำถามที่ Gemini 3.8 Live ไม่ได้ตอบ
