การ์ดหลักของบทความที่ระบุข้อความ 'Daily AI Brief — September 19' พร้อมป้าย 'NEWS' และคำบรรยายรอง 'Grok Voice Transcribe 2.0 ships, and Meta opens Muse' โดยมีชิปที่ระบุข้อความ $0.10 ต่อชั่วโมงแบบแบตช์, WER แบบสตรีมมิ่ง 2.7%, ผลลัพธ์บางส่วนแรก 3.4% และ Muse connectors ใช้งานได้แล้ว บนพื้นหลังไล่ระดับสีขาวไปน้ำเงิน พร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Engineering & Research

สรุปข่าว AI ประจำวัน วันที่ 19 ก.ย.: Grok Voice Transcribe 2.0 เปิดใช้งานจริงแล้ว และ Meta เปิด Muse ให้นักพัฒนา

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Grok Voice Transcribe 2.0 เปิดใช้งานจริงใน Grok Voice API แล้ว ณ วันที่ 18 กันยายน 2026 ในราคา $0.10 ต่อชั่วโมงเสียงสำหรับการถอดเสียงแบบบันทึก และ $0.20 ต่อชั่วโมงสำหรับการสตรีม — อัตราเดียวกับที่ SpaceXAI เรียกเก็บสำหรับเวอร์ชัน 1.0 ในสัปดาห์เดียวกัน Meta ได้เปิดแพลตฟอร์มตัวเชื่อมต่อ Muse ให้กับนักพัฒนาภายนอก โดยให้บริการใดก็ได้เปิดเผย API ที่มีอยู่ของตน และให้เอเจนต์ Muse ของ Meta เรียกใช้งานมันในนามของผู้ใช้ พาดหัวข่าวเหล่านี้ดูเหมือนไม่เกี่ยวข้องกันจากสองบริษัทที่ต่างกันเกี่ยวกับผลิตภัณฑ์สองอย่างที่ต่างกัน และในช่วงสองปีที่ผ่านมาส่วนใหญ่ก็คงเป็นเช่นนั้น เมื่ออ่านรวมกันแล้ว พวกมันคือเรื่องเดียวกัน: การถอดเสียงกำลังกลายเป็นอินพุต และการต่อสู้ได้เคลื่อนไปสู่คำถามที่ว่าใครเป็นเจ้าของการเรียกที่นำมันไปใช้

เริ่มจากราคาก่อน เพราะนั่นเป็นส่วนที่ผู้อ่านนำไปใช้ได้จริงตั้งแต่วันนี้ จากนั้นคือความแม่นยำ ซึ่งเป็นเรื่องจริงแต่แคบกว่าที่กรอบการเปิดตัวบอกเป็นนัย แล้วก็ส่วนของ Meta ซึ่งจะเป็นส่วนที่สำคัญในอีกหกเดือนข้างหน้า

ราคาคงที่ และความหมายของมันหากคุณจ่ายค่าถอดเสียงอยู่แล้ว

Grok Voice Transcribe 2.0 มีค่าใช้จ่ายเท่ากับ 1.0 ไม่ใช่ "เริ่มต้นที่" เท่ากัน ไม่ใช่อัตราโปรโมชันที่หมดอายุ — แต่เหมือนกันทุกประการ โดยอยู่ที่ $0.10 ต่อชั่วโมงเสียงสำหรับงานแบบแบตช์ และ $0.20 ต่อชั่วโมงสำหรับสตรีมมิง ซึ่งคิดเป็น $1.67 และ $3.33 ต่อ 1,000 นาที การแยกแยะผู้พูด การประทับเวลาในระดับคำพร้อมคะแนนความเชื่อมั่น การปรับข้อความให้เป็นมาตรฐานย้อนกลับ การลบคำฟุ่มเฟือย และการให้น้ำหนักคำสำคัญ ล้วนรวมอยู่ในราคานั้น แทนที่จะขายแยกเป็นส่วนเสริม ซึ่งไม่ใช่เรื่องปกติของหมวดนี้

ผลในทางปฏิบัติเป็นเรื่องของการคำนวณมากกว่าเรื่องน่าตื่นเต้น ทีมที่ถอดเสียงจากคอนแทกต์เซ็นเตอร์เดือนละ 5,000 ชั่วโมงจ่าย $500 สำหรับเส้นทางแบบแบตช์ไม่ว่าจะทางใด และโมเดลใหม่ให้ผลลัพธ์ปริมาณเท่าเดิมโดยมีอัตราความผิดพลาดต่ำลงอย่างมีนัยสำคัญ ไม่มีส่วนใดของการย้ายระบบที่เปลี่ยนสิ่งที่คุณต้องจ่าย ซึ่งเป็นเหตุผลโดยตรงที่ทำให้การย้ายระบบง่ายต่อการให้เหตุผลรองรับ: ไม่มีการตัดสินใจเรื่องต้นทุนให้ต้องทำ มีเพียงการตัดสินใจเรื่องคุณภาพ และคุณภาพก็เพิ่มขึ้น

การผสานรวมที่มีอยู่จะย้ายไปใช้ grok-voice-transcribe-2.0 โดยส่งเป็นพารามิเตอร์ model บน /v1/stt หรือเลือกมันเมื่อเปิดเซสชัน WebSocket สำหรับสตรีมมิง ไม่มีการเปลี่ยนแปลง schema ไม่มีเอนด์พอยต์ใหม่ ไม่ต้องเข้ารหัสไปป์ไลน์เสียงของคุณใหม่ SpaceXAI ยังคงปล่อยให้ 1.0 เป็นค่าเริ่มต้นไปก่อนในตอนนี้ ดังนั้นการผสานรวมที่ไม่เคยแตะพารามิเตอร์ model จะยังคงได้รับเวอร์ชันเก่าต่อไปจนกว่าบริษัทจะสลับมัน — ซึ่งบริษัทกล่าวว่าจะเกิดขึ้นในอีกไม่กี่สัปดาห์ข้างหน้า พร้อมกับการเลิกใช้ 1.0 ช่วงเวลานั้นคุ้มค่าที่จะใช้อย่างตั้งใจ: ชี้สำเนาเงาของเสียงโปรดักชันของคุณไปที่ 2.0 แล้วเปรียบเทียบความแตกต่างของทรานสคริปต์กับสิ่งที่คุณใช้งานจริงในวันนี้ เพราะเมื่อค่าเริ่มต้นสลับ คุณจะรันมันไม่ว่าคุณจะทดสอบมันหรือไม่ก็ตาม

ส่วนที่เหลือของเอกสารสเปกยังมีรูปแบบเดิมและเป็นสิ่งที่ควรรู้ إذا كنتกำลังประเมินขนาดการติดตั้งใช้งาน而不是แค่ทดสอบความแม่นยำเพียงอย่างเดียว: รูปแบบไฟล์เสียงขาเข้า 12 รูปแบบ ตั้งแต่เสียงโทรศัพท์ 8 kHz ไปจนถึง 48 kHz, ช่องสัญญาณเสียงอิสระสูงสุดแปดช่องในคำขอเดียว, คำศัพท์เฉพาะทาง 100 คำต่อคำขอสำหรับคำศัพท์เฉพาะโดเมน, การตรวจจับภาษาอัตโนมัติพร้อมสลับภาษาได้กลางการบันทึก, และการปรับข้อความให้เป็นรูปแบบปกติแบบผกผัน (inverse text normalization) รองรับ 25 ภาษา เพื่อให้วัน เดือน ปี สกุลเงิน หมายเลขโทรศัพท์ และอีเมลที่พูดออกมาถูกส่งกลับมาในรูปแบบการเขียนแบบที่มนุษย์จะเขียน ขีดจำกัดของบริการคือ 10 คำขอต่อวินาที และ 100 เซสชันสตรีมมิ่งพร้อมกันต่อทีม และบริการนี้ทำงานในภูมิภาคเดียวเท่านั้น — us-east-1 — ซึ่งเป็นบรรทัดเดียวในเอกสารที่ควรทำให้ทีมโปรดักชันต้องหยุดคิด เพราะ API เสียงที่ทำงานในภูมิภาคเดียวก็คือความล่มที่เกิดขึ้นในภูมิภาคเดียว

จุดที่ความแม่นยำขยับไปจริง ๆ

คำกล่าวอ้างตอนเปิดตัวคือ "แม่นยำเป็นสองเท่า" และตัวเลขเบื้องหลังก็มีความเฉพาะเจาะจงมากกว่าและไม่สม่ำเสมอเท่ากับวลีนั้น บนบอร์ด AA-WER Streaming ของ Artificial Analysis ซึ่งเป็นการวัดอิสระในที่นี้ สองเวอร์ชันแยกออกจากกันดังนี้:

• ความแม่นยำของบทถอดเสียงฉบับสุดท้าย — Grok Voice Transcribe 2.0 อยู่ที่อัตราความผิดพลาดระดับคำ 2.7% เมื่อเทียบกับ Grok Voice Transcribe 1.0 ที่ 3.9% โดยทั้งคู่วัดหลังจากผู้พูดหยุดพูด

• ความแม่นยำของบทถอดเสียงบางส่วนครั้งแรก — WER 3.4% เทียบกับ 18.3% ซึ่งเป็นความแตกต่างรายการเดียวที่ใหญ่ที่สุดระหว่างสองเวอร์ชัน และทิ้งห่างอย่างมาก

• เวลาจนได้บทถอดเสียงฉบับสมบูรณ์ — 0.49 วินาที เทียบกับ 0.37 วินาที ดังนั้นในด้านนี้ 2.0 จึงช้ากว่า ไม่ใช่เร็วกว่า

• เวลาถึงการปิดสถานะบางส่วนครั้งแรก — 0.49 วินาที เทียบกับ 0.25 วินาที สำหรับการเทรดเดียวกันในทิศทางตรงกันข้าม

คู่สุดท้ายนั้นเป็นสิ่งที่น่าสนใจที่สุดในชีต Grok Voice Transcribe 2.0 ได้ความแม่นยำมาโดยแลกกับความหน่วงราวหนึ่งในสี่วินาทีในทั้งสองทิศทาง สำหรับ voice agent นี่เป็นต้นทุนจริง — มันคือความแตกต่างระหว่างการหยุดตามธรรมชาติกับการหยุดที่ผู้โทรสังเกตเห็น — และสำหรับ batch pipeline มันมองไม่เห็น ส่วนการปรับปรุง first-partial คือสิ่งที่เปลี่ยนสิ่งที่คุณสร้างได้ เพราะ partial transcript คือข้อความที่ agent ได้ใช้ในการคิดวิเคราะห์ในขณะที่ผู้โทรยังพูดอยู่ การเปลี่ยนจาก 18.3% เป็น 3.4% ในตัวเลขนั้นคือความแตกต่างระหว่าง partial ที่เป็นเพียงคำใบ้คร่าว ๆ กับ partial ที่ใช้งานได้จริง ส่วน final transcript ที่เปลี่ยนจาก 3.9% เป็น 2.7% เป็นการปรับปรุงที่ดีที่ไม่มีผู้ใช้คนไหนจะสังเกตเห็น

Screenshot of the SpaceXAI Speech to Text API documentation page showing the 'Speech to Text' heading, the line 'Transcribe audio files into text with a single API call, or stream audio in real time over WebSocket', and a Python quick-start code block that posts an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0 alongside a keyterm parameter.

SpaceXAI ยังได้เผยแพร่การประเมินภายในสี่ฉบับ และสิ่งเหล่านี้น่าอ่านโดยคำนึงถึงป้ายกำกับที่แนบมาด้วย — นี่คือตัวเลขของบริษัทเองเกี่ยวกับเสียงของบริษัทเอง ไม่ได้ถูกทำซ้ำโดยอิสระ:

• สายสนับสนุนลูกค้า 8 kHz — WER 10.6% ใน 1.0 ลดลงเหลือ 7.1% ใน 2.0

• การสนทนากับ Grok — ลดลงจาก 8.7% เหลือ 3.3%

• การพูดข้อมูลรับรองออกเสียง ซึ่งหมายถึงการอ่านชื่อ อีเมล และรายละเอียดบัญชีออกเสียง — ลดลงจาก 7.2% เหลือ 3.2%

• วลีสั้นใน 19 ภาษา — จาก 20.6% เหลือ 6.8%

แถว 8 kHz คือแถวที่ควรให้ความสำคัญ เสียงโทรศัพท์เป็นอินพุตทั่วไปที่ยากที่สุดในหมวดนี้ และเป็นอินพุตที่ผู้ซื้อระบบศูนย์ติดต่อส่วนใหญ่มีใช้จริง และการลดลงจาก 10.6% เหลือ 7.1% ในแถวนั้นถือเป็นเรื่องใหญ่สำหรับผู้ซื้อเหล่านั้นมากกว่าตัวเลขพาดหัวบนบอร์ด

คำกล่าวอ้างเรื่องตารางอันดับ เมื่ออ่านอย่างตรงไปตรงมา

SpaceXAI กล่าวว่าโมเดลนี้อยู่อันดับหนึ่งจาก 32 โมเดลสตรีมมิ่งในด้านความแม่นยำ กระดานจัดอันดับของ Artificial Analysis จัดให้มันอยู่อันดับหนึ่งในทั้งอันดับ final-transcript และ first-partial ก็จริง — แต่หน้ากระดานแสดงข้อมูล 27 จาก 33 โมเดล ดังนั้น "32" จึงเป็นตัวเลขที่บริษัทนับเอง และการจัดอันดับนี้อยู่บนเซตที่ผู้อ่านควรเข้าใจลักษณะของมัน AA-WER Streaming เป็นการรวมแบบถ่วงน้ำหนักของชุดข้อมูลภาษาอังกฤษ 3 ชุด ได้แก่ AA-AgentTalk 50%, VoxPopuli 25% และ Earnings22 25% รวมเสียงประมาณแปดชั่วโมง และถ่วงน้ำหนักไปทางคำพูดสนทนาแบบเอเจนต์อย่างหนัก มันไม่ได้วัดสำเนียง โคเดกโทรศัพท์ คำศัพท์เฉพาะโดเมน หรือเสียงคอลเซ็นเตอร์แบบหลายช่องทางในลักษณะที่เป็นระบบใด ๆ

ไม่มีสิ่งใดในนั้นทำให้ตัวเลขผิด มันทำให้ตัวเลขเฉพาะเจาะจงต่างหาก โมเดลที่นำบอร์ดภาษาอังกฤษที่ถ่วงน้ำหนักด้วยบทสนทนาเอเจนต์คือตัวเลือกที่ถูกต้องสำหรับเสียงภาษาอังกฤษในรูปแบบบทสนทนาเอเจนต์ และเหตุผลที่ซื่อตรงที่ทำให้เชื่อได้ว่าผลลัพธ์ 8 kHz นั้นมาจากการประเมินภายในของผู้ขาย ไม่ใช่จากบอร์ดสาธารณะ ผู้ซื้อที่มีโปรไฟล์เสียงแตกต่างออกไปควรทดสอบกับเสียงของตนเอง แทนที่จะอ่านอันดับนี้เป็นคำตัดสินทั่วไป ซึ่งเป็นความจริงก่อนการเปิดตัวครั้งนี้ และจะเป็นความจริงหลังการเปิดตัวครั้งถัดไป

A generated infographic titled 'Grok Voice Transcribe 2.0 — what changed from 1.0', showing two columns of four rows: final transcript 3.9% to 2.7% WER, first partial 18.3% to 3.4% WER, time to first partial 0.25s to 0.49s, and streaming price $0.20 per hour unchanged, with a footer reading 'Board figures per Artificial Analysis AA-WER Streaming; internal evaluations vendor-reported.'

Meta เปิดตัว Muse คอนเน็กเตอร์ให้นักพัฒนา

เรื่องที่สองของสัปดาห์นี้เป็นของ Meta Muse เอเจนต์ส่วนบุคคลที่ Meta เปิดตัวเมื่อวันที่ 8 กันยายนบน iOS, Android, muse.ai และ WhatsApp ตอนนี้รองรับคอนเนกเตอร์จากบุคคลที่สามแล้ว: บริการหนึ่งเปิดเผย API ของตน และ Muse จัดหาเอเจนต์ เบราว์เซอร์ และบริบทผู้ใช้ที่เปลี่ยน API นั้นให้เป็นสิ่งที่คนสามารถเรียกใช้ได้เพียงแค่เอ่ยขอ กรอบที่ Meta วางไว้คือการแบ่งงาน — คุณนำ API มา เรานำเจตนาและผู้ใช้มา คอนเนกเตอร์แรก ๆ ที่ระบุชื่อคือ Notion และเครื่องมือจดบันทึกการประชุม Granola นอกเหนือจากที่ Meta ปล่อยเอง

คุ้มค่าที่จะพูดให้ชัดเจนว่านี่คืออะไรและไม่ใช่อะไร มันไม่ใช่โปรโตคอลข้ามเอเจนต์แบบเปิด การสร้างคอนเน็กเตอร์ทำให้คุณได้ช่องทางกระจายภายในฐานผู้ใช้ของ Muse เอง และไม่มีที่อื่น ส่วนการสร้างบนโปรโตคอลเปิดทำให้คุณเข้าถึงเอเจนต์ที่เข้ากันได้ทุกตัว และไม่มีฐานผู้ใช้ใดโดยเฉพาะ Meta ยังไม่ได้เผยแพร่ส่วนต่างๆ ที่นักพัฒนาจำเป็นต้องใช้ในการวางแผนด้วย — กระบวนการตรวจสอบคอนเน็กเตอร์ พื้นผิวการผสานรวมทางเทคนิค วิธีที่ Muse เลือกระหว่างคอนเน็กเตอร์สองตัวที่ทับซ้อนกัน หรือวิธีที่นักพัฒนาวัดว่าคอนเน็กเตอร์หนึ่งๆ ทำให้เกิดการใช้งานจริงหรือไม่

สิ่งที่ไม่มีข้อกังขาคือทิศทาง Muse รันเอเจนต์ของผู้ใช้แต่ละรายในเครื่องเสมือนของตัวเอง พร้อมเบราว์เซอร์ของตัวเองและชั้นตรวจทานแยกต่างหากที่วางอยู่หน้าการดำเนินการขาออก และมันเก็บโทเคนทดแทนแทนที่จะเก็บคีย์ API จริง สถาปัตยกรรมนั้นสมเหตุสมผลก็ต่อเมื่อแผนคือให้เอเจนต์เรียกใช้สิ่งต่างๆ จำนวนมาก API ถอดเสียงก็เป็นหนึ่งในสิ่งที่เอเจนต์เรียกใช้ และ Meta ก็มีของตัวเอง — Muse Voice Transcribe โมเดลแบบเรียลไทม์ที่ Meta เปิดตัวเมื่อต้นเดือนกันยายนในราคา 0.18 ดอลลาร์ต่อชั่วโมงเสียง แพลตฟอร์มที่เป็นเจ้าของทั้งเอเจนต์และโมเดลเสียงย่อมมีเหตุผลชัดเจนที่จะส่งทราฟฟิกของตัวเองไปยังโมเดลของตัวเอง และนักพัฒนาที่สร้างบนคอนเนกเตอร์ควรถือว่านั่นคือค่าเริ่มต้น เว้นแต่มีบางอย่างทำให้มันไม่ใช่ค่าเริ่มต้น

Screenshot of the Artificial Analysis Speech to Text AI Model and Provider Leaderboard with the Streaming filter selected, showing the WER Index - Final Transcription, Latency and Price highlight cards, the 'See Non-streaming Benchmarks' toggle, and the AA-WER Streaming Index versus Time to Final Transcription chart.

ทีมที่ปล่อยงานด้านเสียงในเดือนนี้ควรทำอะไรจริง ๆ

ทั้งสองเรื่องชี้ไปในทิศทางเดียวกัน ความแม่นยำด้านเสียงพูดกำลังบรรจบกัน — สามโมเดลห่างกันไม่เกิน 1.5 จุดบนลีดเดอร์บอร์ดเดียวกันภายในสามสัปดาห์ — และปัจจัยสร้างความแตกต่างที่เหลืออยู่คือราคา ความหน่วง สิทธิ์การใช้งาน และใครเป็นผู้ควบคุมการกำหนดเส้นทาง นั่นทำให้การเลือกว่าการเรียกถอดเสียงของคุณจะไปที่ใดมีผลตามมามากกว่าการเลือกว่าโมเดลใดจะตอบคำขอนั้น เพราะคุณจะพบว่าตัวเองอยากเปลี่ยนคำตอบนั้นหลายครั้งในปีหน้า

นี่คือเลเยอร์ที่ OrcaRouter ตั้งอยู่ API key เดียวครอบคลุม 200+ โมเดลหลังเอนด์พอยต์ที่เข้ากันได้กับ OpenAI พร้อมการ failover อัตโนมัติข้ามผู้ให้บริการ ดังนั้นบริการเสียงในภูมิภาคเดียวที่มีปัญหาช่วงบ่ายจึงไม่กลายเป็นเหตุขัดข้องของคุณอีกต่อไป เราส่งผ่านราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% ซึ่งหมายความว่าการลดราคาของผู้ขายหรือโมเดลเวอร์ชันใหม่จะพร้อมใช้งานในฝั่งเราภายในวันเดียวกัน แทนที่จะรอการปรับราคาใหม่ และเนื่องจากทุกโมเดลอยู่ภายใต้สัญญาเดียว การย้ายงานถอดเสียงจากโมเดลหนึ่งไปอีกโมเดลหนึ่งจึงเป็นการเปลี่ยนสตริงโมเดล แทนที่จะต้องจัดซื้อครั้งที่สอง

สามการดำเนินการที่เป็นรูปธรรมสำหรับสัปดาห์นี้ ถ้าคุณใช้ Grok Voice Transcribe 1.0 อยู่ ให้ทดสอบเงา 2.0 กับเสียงของคุณเองตอนนี้เลย ในขณะที่ 1.0 ยังเป็นค่าเริ่มต้นและคุณยังควบคุมการสลับได้เอง ถ้าคุณกำลังประเมินระบบเสียงพูดแบบสตรีมมิงสำหรับเอเจนต์ ให้วัดเวลาถึง partial แรกบนงบความหน่วงของคุณเอง แทนที่จะไปเชื่อบอร์ดของใครก็ตาม — หนึ่งในสี่วินาทีที่โมเดลนี้ใช้ไปเพื่อซื้อความแม่นยำนั้นไม่มีความหมายอะไรเลยหรือร้ายแรงถึงตาย ขึ้นอยู่กับว่าเอเจนต์ของคุณนำข้อความนั้นไปทำอะไร และถ้าคุณกำลังสร้างอะไรก็ตามที่เอเจนต์ส่วนบุคคลอาจเรียกใช้สักวันหนึ่ง ให้จับตาโปรแกรมตัวเชื่อม Muse อย่างใกล้ชิด เพราะข้อโต้แย้งเรื่องการกระจายที่มันนำเสนอนั้นแข็งแรงยิ่งกว่ารายละเอียดทางเทคนิคที่มันเปิดตัวมาด้วย

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube