
สรุปข่าว AI ประจำวัน วันที่ 19 ก.ย.: Grok Voice Transcribe 2.0 เปิดใช้งานจริงแล้ว และ Meta เปิด Muse ให้นักพัฒนา
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 เปิดใช้งานจริงใน Grok Voice API แล้ว ณ วันที่ 18 กันยายน 2026 ในราคา $0.10 ต่อชั่วโมงเสียงสำหรับการถอดเสียงแบบบันทึก และ $0.20 ต่อชั่วโมงสำหรับการสตรีม — อัตราเดียวกับที่ SpaceXAI เรียกเก็บสำหรับเวอร์ชัน 1.0 ในสัปดาห์เดียวกัน Meta ได้เปิดแพลตฟอร์มตัวเชื่อมต่อ Muse ให้กับนักพัฒนาภายนอก โดยให้บริการใดก็ได้เปิดเผย API ที่มีอยู่ของตน และให้เอเจนต์ Muse ของ Meta เรียกใช้งานมันในนามของผู้ใช้ พาดหัวข่าวเหล่านี้ดูเหมือนไม่เกี่ยวข้องกันจากสองบริษัทที่ต่างกันเกี่ยวกับผลิตภัณฑ์สองอย่างที่ต่างกัน และในช่วงสองปีที่ผ่านมาส่วนใหญ่ก็คงเป็นเช่นนั้น เมื่ออ่านรวมกันแล้ว พวกมันคือเรื่องเดียวกัน: การถอดเสียงกำลังกลายเป็นอินพุต และการต่อสู้ได้เคลื่อนไปสู่คำถามที่ว่าใครเป็นเจ้าของการเรียกที่นำมันไปใช้
เริ่มจากราคาก่อน เพราะนั่นเป็นส่วนที่ผู้อ่านนำไปใช้ได้จริงตั้งแต่วันนี้ จากนั้นคือความแม่นยำ ซึ่งเป็นเรื่องจริงแต่แคบกว่าที่กรอบการเปิดตัวบอกเป็นนัย แล้วก็ส่วนของ Meta ซึ่งจะเป็นส่วนที่สำคัญในอีกหกเดือนข้างหน้า
ราคาคงที่ และความหมายของมันหากคุณจ่ายค่าถอดเสียงอยู่แล้ว
Grok Voice Transcribe 2.0 มีค่าใช้จ่ายเท่ากับ 1.0 ไม่ใช่ "เริ่มต้นที่" เท่ากัน ไม่ใช่อัตราโปรโมชันที่หมดอายุ — แต่เหมือนกันทุกประการ โดยอยู่ที่ $0.10 ต่อชั่วโมงเสียงสำหรับงานแบบแบตช์ และ $0.20 ต่อชั่วโมงสำหรับสตรีมมิง ซึ่งคิดเป็น $1.67 และ $3.33 ต่อ 1,000 นาที การแยกแยะผู้พูด การประทับเวลาในระดับคำพร้อมคะแนนความเชื่อมั่น การปรับข้อความให้เป็นมาตรฐานย้อนกลับ การลบคำฟุ่มเฟือย และการให้น้ำหนักคำสำคัญ ล้วนรวมอยู่ในราคานั้น แทนที่จะขายแยกเป็นส่วนเสริม ซึ่งไม่ใช่เรื่องปกติของหมวดนี้
ผลในทางปฏิบัติเป็นเรื่องของการคำนวณมากกว่าเรื่องน่าตื่นเต้น ทีมที่ถอดเสียงจากคอนแทกต์เซ็นเตอร์เดือนละ 5,000 ชั่วโมงจ่าย $500 สำหรับเส้นทางแบบแบตช์ไม่ว่าจะทางใด และโมเดลใหม่ให้ผลลัพธ์ปริมาณเท่าเดิมโดยมีอัตราความผิดพลาดต่ำลงอย่างมีนัยสำคัญ ไม่มีส่วนใดของการย้ายระบบที่เปลี่ยนสิ่งที่คุณต้องจ่าย ซึ่งเป็นเหตุผลโดยตรงที่ทำให้การย้ายระบบง่ายต่อการให้เหตุผลรองรับ: ไม่มีการตัดสินใจเรื่องต้นทุนให้ต้องทำ มีเพียงการตัดสินใจเรื่องคุณภาพ และคุณภาพก็เพิ่มขึ้น
การผสานรวมที่มีอยู่จะย้ายไปใช้ grok-voice-transcribe-2.0 โดยส่งเป็นพารามิเตอร์ model บน /v1/stt หรือเลือกมันเมื่อเปิดเซสชัน WebSocket สำหรับสตรีมมิง ไม่มีการเปลี่ยนแปลง schema ไม่มีเอนด์พอยต์ใหม่ ไม่ต้องเข้ารหัสไปป์ไลน์เสียงของคุณใหม่ SpaceXAI ยังคงปล่อยให้ 1.0 เป็นค่าเริ่มต้นไปก่อนในตอนนี้ ดังนั้นการผสานรวมที่ไม่เคยแตะพารามิเตอร์ model จะยังคงได้รับเวอร์ชันเก่าต่อไปจนกว่าบริษัทจะสลับมัน — ซึ่งบริษัทกล่าวว่าจะเกิดขึ้นในอีกไม่กี่สัปดาห์ข้างหน้า พร้อมกับการเลิกใช้ 1.0 ช่วงเวลานั้นคุ้มค่าที่จะใช้อย่างตั้งใจ: ชี้สำเนาเงาของเสียงโปรดักชันของคุณไปที่ 2.0 แล้วเปรียบเทียบความแตกต่างของทรานสคริปต์กับสิ่งที่คุณใช้งานจริงในวันนี้ เพราะเมื่อค่าเริ่มต้นสลับ คุณจะรันมันไม่ว่าคุณจะทดสอบมันหรือไม่ก็ตาม
ส่วนที่เหลือของเอกสารสเปกยังมีรูปแบบเดิมและเป็นสิ่งที่ควรรู้ إذا كنتกำลังประเมินขนาดการติดตั้งใช้งาน而不是แค่ทดสอบความแม่นยำเพียงอย่างเดียว: รูปแบบไฟล์เสียงขาเข้า 12 รูปแบบ ตั้งแต่เสียงโทรศัพท์ 8 kHz ไปจนถึง 48 kHz, ช่องสัญญาณเสียงอิสระสูงสุดแปดช่องในคำขอเดียว, คำศัพท์เฉพาะทาง 100 คำต่อคำขอสำหรับคำศัพท์เฉพาะโดเมน, การตรวจจับภาษาอัตโนมัติพร้อมสลับภาษาได้กลางการบันทึก, และการปรับข้อความให้เป็นรูปแบบปกติแบบผกผัน (inverse text normalization) รองรับ 25 ภาษา เพื่อให้วัน เดือน ปี สกุลเงิน หมายเลขโทรศัพท์ และอีเมลที่พูดออกมาถูกส่งกลับมาในรูปแบบการเขียนแบบที่มนุษย์จะเขียน ขีดจำกัดของบริการคือ 10 คำขอต่อวินาที และ 100 เซสชันสตรีมมิ่งพร้อมกันต่อทีม และบริการนี้ทำงานในภูมิภาคเดียวเท่านั้น — us-east-1 — ซึ่งเป็นบรรทัดเดียวในเอกสารที่ควรทำให้ทีมโปรดักชันต้องหยุดคิด เพราะ API เสียงที่ทำงานในภูมิภาคเดียวก็คือความล่มที่เกิดขึ้นในภูมิภาคเดียว
จุดที่ความแม่นยำขยับไปจริง ๆ
คำกล่าวอ้างตอนเปิดตัวคือ "แม่นยำเป็นสองเท่า" และตัวเลขเบื้องหลังก็มีความเฉพาะเจาะจงมากกว่าและไม่สม่ำเสมอเท่ากับวลีนั้น บนบอร์ด AA-WER Streaming ของ Artificial Analysis ซึ่งเป็นการวัดอิสระในที่นี้ สองเวอร์ชันแยกออกจากกันดังนี้:
• ความแม่นยำของบทถอดเสียงฉบับสุดท้าย — Grok Voice Transcribe 2.0 อยู่ที่อัตราความผิดพลาดระดับคำ 2.7% เมื่อเทียบกับ Grok Voice Transcribe 1.0 ที่ 3.9% โดยทั้งคู่วัดหลังจากผู้พูดหยุดพูด
• ความแม่นยำของบทถอดเสียงบางส่วนครั้งแรก — WER 3.4% เทียบกับ 18.3% ซึ่งเป็นความแตกต่างรายการเดียวที่ใหญ่ที่สุดระหว่างสองเวอร์ชัน และทิ้งห่างอย่างมาก
• เวลาจนได้บทถอดเสียงฉบับสมบูรณ์ — 0.49 วินาที เทียบกับ 0.37 วินาที ดังนั้นในด้านนี้ 2.0 จึงช้ากว่า ไม่ใช่เร็วกว่า
• เวลาถึงการปิดสถานะบางส่วนครั้งแรก — 0.49 วินาที เทียบกับ 0.25 วินาที สำหรับการเทรดเดียวกันในทิศทางตรงกันข้าม
คู่สุดท้ายนั้นเป็นสิ่งที่น่าสนใจที่สุดในชีต Grok Voice Transcribe 2.0 ได้ความแม่นยำมาโดยแลกกับความหน่วงราวหนึ่งในสี่วินาทีในทั้งสองทิศทาง สำหรับ voice agent นี่เป็นต้นทุนจริง — มันคือความแตกต่างระหว่างการหยุดตามธรรมชาติกับการหยุดที่ผู้โทรสังเกตเห็น — และสำหรับ batch pipeline มันมองไม่เห็น ส่วนการปรับปรุง first-partial คือสิ่งที่เปลี่ยนสิ่งที่คุณสร้างได้ เพราะ partial transcript คือข้อความที่ agent ได้ใช้ในการคิดวิเคราะห์ในขณะที่ผู้โทรยังพูดอยู่ การเปลี่ยนจาก 18.3% เป็น 3.4% ในตัวเลขนั้นคือความแตกต่างระหว่าง partial ที่เป็นเพียงคำใบ้คร่าว ๆ กับ partial ที่ใช้งานได้จริง ส่วน final transcript ที่เปลี่ยนจาก 3.9% เป็น 2.7% เป็นการปรับปรุงที่ดีที่ไม่มีผู้ใช้คนไหนจะสังเกตเห็น

SpaceXAI ยังได้เผยแพร่การประเมินภายในสี่ฉบับ และสิ่งเหล่านี้น่าอ่านโดยคำนึงถึงป้ายกำกับที่แนบมาด้วย — นี่คือตัวเลขของบริษัทเองเกี่ยวกับเสียงของบริษัทเอง ไม่ได้ถูกทำซ้ำโดยอิสระ:
• สายสนับสนุนลูกค้า 8 kHz — WER 10.6% ใน 1.0 ลดลงเหลือ 7.1% ใน 2.0
• การสนทนากับ Grok — ลดลงจาก 8.7% เหลือ 3.3%
• การพูดข้อมูลรับรองออกเสียง ซึ่งหมายถึงการอ่านชื่อ อีเมล และรายละเอียดบัญชีออกเสียง — ลดลงจาก 7.2% เหลือ 3.2%
• วลีสั้นใน 19 ภาษา — จาก 20.6% เหลือ 6.8%
แถว 8 kHz คือแถวที่ควรให้ความสำคัญ เสียงโทรศัพท์เป็นอินพุตทั่วไปที่ยากที่สุดในหมวดนี้ และเป็นอินพุตที่ผู้ซื้อระบบศูนย์ติดต่อส่วนใหญ่มีใช้จริง และการลดลงจาก 10.6% เหลือ 7.1% ในแถวนั้นถือเป็นเรื่องใหญ่สำหรับผู้ซื้อเหล่านั้นมากกว่าตัวเลขพาดหัวบนบอร์ด
คำกล่าวอ้างเรื่องตารางอันดับ เมื่ออ่านอย่างตรงไปตรงมา
SpaceXAI กล่าวว่าโมเดลนี้อยู่อันดับหนึ่งจาก 32 โมเดลสตรีมมิ่งในด้านความแม่นยำ กระดานจัดอันดับของ Artificial Analysis จัดให้มันอยู่อันดับหนึ่งในทั้งอันดับ final-transcript และ first-partial ก็จริง — แต่หน้ากระดานแสดงข้อมูล 27 จาก 33 โมเดล ดังนั้น "32" จึงเป็นตัวเลขที่บริษัทนับเอง และการจัดอันดับนี้อยู่บนเซตที่ผู้อ่านควรเข้าใจลักษณะของมัน AA-WER Streaming เป็นการรวมแบบถ่วงน้ำหนักของชุดข้อมูลภาษาอังกฤษ 3 ชุด ได้แก่ AA-AgentTalk 50%, VoxPopuli 25% และ Earnings22 25% รวมเสียงประมาณแปดชั่วโมง และถ่วงน้ำหนักไปทางคำพูดสนทนาแบบเอเจนต์อย่างหนัก มันไม่ได้วัดสำเนียง โคเดกโทรศัพท์ คำศัพท์เฉพาะโดเมน หรือเสียงคอลเซ็นเตอร์แบบหลายช่องทางในลักษณะที่เป็นระบบใด ๆ
ไม่มีสิ่งใดในนั้นทำให้ตัวเลขผิด มันทำให้ตัวเลขเฉพาะเจาะจงต่างหาก โมเดลที่นำบอร์ดภาษาอังกฤษที่ถ่วงน้ำหนักด้วยบทสนทนาเอเจนต์คือตัวเลือกที่ถูกต้องสำหรับเสียงภาษาอังกฤษในรูปแบบบทสนทนาเอเจนต์ และเหตุผลที่ซื่อตรงที่ทำให้เชื่อได้ว่าผลลัพธ์ 8 kHz นั้นมาจากการประเมินภายในของผู้ขาย ไม่ใช่จากบอร์ดสาธารณะ ผู้ซื้อที่มีโปรไฟล์เสียงแตกต่างออกไปควรทดสอบกับเสียงของตนเอง แทนที่จะอ่านอันดับนี้เป็นคำตัดสินทั่วไป ซึ่งเป็นความจริงก่อนการเปิดตัวครั้งนี้ และจะเป็นความจริงหลังการเปิดตัวครั้งถัดไป

Meta เปิดตัว Muse คอนเน็กเตอร์ให้นักพัฒนา
เรื่องที่สองของสัปดาห์นี้เป็นของ Meta Muse เอเจนต์ส่วนบุคคลที่ Meta เปิดตัวเมื่อวันที่ 8 กันยายนบน iOS, Android, muse.ai และ WhatsApp ตอนนี้รองรับคอนเนกเตอร์จากบุคคลที่สามแล้ว: บริการหนึ่งเปิดเผย API ของตน และ Muse จัดหาเอเจนต์ เบราว์เซอร์ และบริบทผู้ใช้ที่เปลี่ยน API นั้นให้เป็นสิ่งที่คนสามารถเรียกใช้ได้เพียงแค่เอ่ยขอ กรอบที่ Meta วางไว้คือการแบ่งงาน — คุณนำ API มา เรานำเจตนาและผู้ใช้มา คอนเนกเตอร์แรก ๆ ที่ระบุชื่อคือ Notion และเครื่องมือจดบันทึกการประชุม Granola นอกเหนือจากที่ Meta ปล่อยเอง
คุ้มค่าที่จะพูดให้ชัดเจนว่านี่คืออะไรและไม่ใช่อะไร มันไม่ใช่โปรโตคอลข้ามเอเจนต์แบบเปิด การสร้างคอนเน็กเตอร์ทำให้คุณได้ช่องทางกระจายภายในฐานผู้ใช้ของ Muse เอง และไม่มีที่อื่น ส่วนการสร้างบนโปรโตคอลเปิดทำให้คุณเข้าถึงเอเจนต์ที่เข้ากันได้ทุกตัว และไม่มีฐานผู้ใช้ใดโดยเฉพาะ Meta ยังไม่ได้เผยแพร่ส่วนต่างๆ ที่นักพัฒนาจำเป็นต้องใช้ในการวางแผนด้วย — กระบวนการตรวจสอบคอนเน็กเตอร์ พื้นผิวการผสานรวมทางเทคนิค วิธีที่ Muse เลือกระหว่างคอนเน็กเตอร์สองตัวที่ทับซ้อนกัน หรือวิธีที่นักพัฒนาวัดว่าคอนเน็กเตอร์หนึ่งๆ ทำให้เกิดการใช้งานจริงหรือไม่
สิ่งที่ไม่มีข้อกังขาคือทิศทาง Muse รันเอเจนต์ของผู้ใช้แต่ละรายในเครื่องเสมือนของตัวเอง พร้อมเบราว์เซอร์ของตัวเองและชั้นตรวจทานแยกต่างหากที่วางอยู่หน้าการดำเนินการขาออก และมันเก็บโทเคนทดแทนแทนที่จะเก็บคีย์ API จริง สถาปัตยกรรมนั้นสมเหตุสมผลก็ต่อเมื่อแผนคือให้เอเจนต์เรียกใช้สิ่งต่างๆ จำนวนมาก API ถอดเสียงก็เป็นหนึ่งในสิ่งที่เอเจนต์เรียกใช้ และ Meta ก็มีของตัวเอง — Muse Voice Transcribe โมเดลแบบเรียลไทม์ที่ Meta เปิดตัวเมื่อต้นเดือนกันยายนในราคา 0.18 ดอลลาร์ต่อชั่วโมงเสียง แพลตฟอร์มที่เป็นเจ้าของทั้งเอเจนต์และโมเดลเสียงย่อมมีเหตุผลชัดเจนที่จะส่งทราฟฟิกของตัวเองไปยังโมเดลของตัวเอง และนักพัฒนาที่สร้างบนคอนเนกเตอร์ควรถือว่านั่นคือค่าเริ่มต้น เว้นแต่มีบางอย่างทำให้มันไม่ใช่ค่าเริ่มต้น

ทีมที่ปล่อยงานด้านเสียงในเดือนนี้ควรทำอะไรจริง ๆ
ทั้งสองเรื่องชี้ไปในทิศทางเดียวกัน ความแม่นยำด้านเสียงพูดกำลังบรรจบกัน — สามโมเดลห่างกันไม่เกิน 1.5 จุดบนลีดเดอร์บอร์ดเดียวกันภายในสามสัปดาห์ — และปัจจัยสร้างความแตกต่างที่เหลืออยู่คือราคา ความหน่วง สิทธิ์การใช้งาน และใครเป็นผู้ควบคุมการกำหนดเส้นทาง นั่นทำให้การเลือกว่าการเรียกถอดเสียงของคุณจะไปที่ใดมีผลตามมามากกว่าการเลือกว่าโมเดลใดจะตอบคำขอนั้น เพราะคุณจะพบว่าตัวเองอยากเปลี่ยนคำตอบนั้นหลายครั้งในปีหน้า
นี่คือเลเยอร์ที่ OrcaRouter ตั้งอยู่ API key เดียวครอบคลุม 200+ โมเดลหลังเอนด์พอยต์ที่เข้ากันได้กับ OpenAI พร้อมการ failover อัตโนมัติข้ามผู้ให้บริการ ดังนั้นบริการเสียงในภูมิภาคเดียวที่มีปัญหาช่วงบ่ายจึงไม่กลายเป็นเหตุขัดข้องของคุณอีกต่อไป เราส่งผ่านราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% ซึ่งหมายความว่าการลดราคาของผู้ขายหรือโมเดลเวอร์ชันใหม่จะพร้อมใช้งานในฝั่งเราภายในวันเดียวกัน แทนที่จะรอการปรับราคาใหม่ และเนื่องจากทุกโมเดลอยู่ภายใต้สัญญาเดียว การย้ายงานถอดเสียงจากโมเดลหนึ่งไปอีกโมเดลหนึ่งจึงเป็นการเปลี่ยนสตริงโมเดล แทนที่จะต้องจัดซื้อครั้งที่สอง
สามการดำเนินการที่เป็นรูปธรรมสำหรับสัปดาห์นี้ ถ้าคุณใช้ Grok Voice Transcribe 1.0 อยู่ ให้ทดสอบเงา 2.0 กับเสียงของคุณเองตอนนี้เลย ในขณะที่ 1.0 ยังเป็นค่าเริ่มต้นและคุณยังควบคุมการสลับได้เอง ถ้าคุณกำลังประเมินระบบเสียงพูดแบบสตรีมมิงสำหรับเอเจนต์ ให้วัดเวลาถึง partial แรกบนงบความหน่วงของคุณเอง แทนที่จะไปเชื่อบอร์ดของใครก็ตาม — หนึ่งในสี่วินาทีที่โมเดลนี้ใช้ไปเพื่อซื้อความแม่นยำนั้นไม่มีความหมายอะไรเลยหรือร้ายแรงถึงตาย ขึ้นอยู่กับว่าเอเจนต์ของคุณนำข้อความนั้นไปทำอะไร และถ้าคุณกำลังสร้างอะไรก็ตามที่เอเจนต์ส่วนบุคคลอาจเรียกใช้สักวันหนึ่ง ให้จับตาโปรแกรมตัวเชื่อม Muse อย่างใกล้ชิด เพราะข้อโต้แย้งเรื่องการกระจายที่มันนำเสนอนั้นแข็งแรงยิ่งกว่ารายละเอียดทางเทคนิคที่มันเปิดตัวมาด้วย
