
MAI-Transcribe-2 เปิดให้บริการแล้ว: ไมโครซอฟท์ชิงตลาดแปลงเสียงเป็นข้อความด้วยราคาเพียง $0.10 ต่อชั่วโมง
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MAI-Transcribe-2 เป็นโมเดลที่ Microsoft AI วางเดิมพันไว้ว่าจะทำให้การแปลงเสียงพูดเป็นข้อความกลายเป็นสิ่งธรรมดาทั่วไป มากกว่าจะเป็นฟีเจอร์ระดับพรีเมียม และตัวเลขที่มาพร้อมการเปิดตัวนี้ถูกออกแบบมาเพื่อสนับสนุนข้อโต้แย้งดังกล่าว โดยเปิดตัวในรูปแบบ public preview เมื่อวันที่ 3 กันยายน 2026 บน Microsoft Foundry, MAI Playground และอินเทอร์เฟซ API ต่างๆ ของ Microsoft เอง MAI-Transcribe-2 เป็นโมเดลเสียงพูดตัวที่สามของ Microsoft ในรอบห้าเดือน ถัดจาก MAI-Transcribe-1 ซึ่งเปิดตัวในเดือนเมษายนที่ราคา 0.36 ดอลลาร์ต่อชั่วโมงเสียง และ MAI-Transcribe-1.5 ในเดือนมิถุนายน และยังเป็นโมเดลแรกที่นำหน้าคู่แข่งแบบ managed ทุกรายที่ถูกระบุชื่อในสองเมตริกซึ่งทีมงานใช้ตัดสินใจซื้อจริง บนลีดเดอร์บอร์ดอัตราคำผิดแบบไม่สตรีมมิงของ Artificial Analysis โมเดลนี้อยู่อันดับสองด้วยค่า AA-WER 2.0% และที่ประมาณ 411 เท่าของเวลาจริง ซึ่งเมื่อรวมกันแล้วทำให้มันอยู่บนขอบเขตพาเรโตด้านความแม่นยำ-ความเร็ว กล่าวคือบนลีดเดอร์บอร์ดนั้น ไม่มีโมเดลใดที่ทั้งแม่นยำกว่าและเร็วกว่าได้พร้อมกัน ราคาเปิดตัวของมันต่ำกว่ารุ่นก่อนหน้าของตัวเองประมาณ 72%
"โมเดลรู้จำเสียงพูดที่เร็วที่สุด แม่นยำที่สุด และถูกที่สุดในโลก" คือพาดหัวข่าวที่ไมโครซอฟท์ใช้เองสำหรับการเปิดตัวครั้งนี้ และสมควรถูกอ่านโดยมีเครื่องหมายดอกจันจากแหล่งข้อมูลต้นฉบับกำกับอยู่ด้วย นี่คือเรื่องราวการเปิดตัวตามที่เกิดขึ้นจริง โดยมีการติดป้ายข้อกล่าวอ้างของผู้ขายเอาไว้ และแยกส่วนที่ยังต้องมีการพิสูจน์ออกจากกัน
สิ่งที่ Microsoft ส่งมอบจริง
MAI-Transcribe-2 เป็นโมเดลถอดความแบบประมวลผลเป็นชุด (batch) สำหรับไฟล์ที่บันทึกไว้ล่วงหน้า โดยเจาะจงสำหรับเสียงแบบยาว (long-form audio) อย่างเช่น การประชุม สายโทรศัพท์ คลังสื่อ และบันทึกจากศูนย์รับสาย Microsoft วางตำแหน่งโมเดลนี้ไว้สำหรับปริมาณงานที่อัตราการประมวลผล (throughput) และต้นทุนต่อนาทีเป็นปัจจัยหลักโดยตรง โดยรองรับการถอดความใน 60 ภาษาพร้อมการระบุภาษาอัตโนมัติ มีการแยกผู้พูด (speaker diarization) ที่ระบุคำพูดให้ตรงกับบุคคลที่พูด ให้ timestamp ระดับคำ และรองรับการให้น้ำหนักคำสำคัญ (keyword biasing) สำหรับชื่อ คำย่อ และคำศัพท์เฉพาะโดเมน รูปแบบการถอดความที่ปรับแต่งได้สองแบบครอบคลุมการแบ่งแยกตามปกติ: "verbatim" ซึ่งเก็บคำเติมเต็ม (fillers) และการเริ่มพูดที่ผิดพลาด (false starts) ไว้สำหรับถอดความระดับที่ต้องใช้ในการปฏิบัติตามข้อกำหนด และ "clean" ซึ่งตัดความไม่คล่องแคล่ว (disfluencies) ออกไปสำหรับคำบรรยายและบันทึกย่อ Microsoft ยังกล่าวถึงการสลับภาษา (code-switching) ในคำพูดที่ผสมหลายภาษา เช่น ฮิงลิช (Hinglish) และสแปงลิช (Spanglish) รวมถึงความทนทานต่อเสียงรบกวนในสภาพแวดล้อมเสียงจริง

เรื่องราวของความพร้อมใช้งานสำคัญพอ ๆ กับรายการฟีเจอร์ Microsoft ไม่ได้จำกัดสิ่งนี้ไว้เบื้องหลังระบบสแตกเสียงพูดระดับองค์กร: โมเดลนี้สามารถทดลองใช้งานได้แล้ววันนี้จาก MAI Playground และให้บริการผ่าน Microsoft Foundry ในพรีวิวสาธารณะ โดยเอกสารของ Foundry อยู่ภายใต้บริการ Azure AI Speech นี่คือทางเลือกในการเผยแพร่ที่ตั้งใจ — วางโมเดลระดับแนวหน้าไว้ในจุดที่นักพัฒนาสามารถเข้าถึงได้ด้วยคีย์ แทนที่จะต้องรอรอบการขายระดับองค์กรอนุมัติก่อน Microsoft ไม่ได้เผยแพร่ค่าน้ำหนัก (weights) และไม่มีสิ่งใดในเอกสารเปิดตัวที่บ่งชี้ว่าพวกเขาจะทำเช่นนั้น
การอ่านพาดหัวตามตัวอักษร
"เร็วที่สุด แม่นยำที่สุด และถูกที่สุดในโลก" คือคำกล่าวอ้างสามข้อที่มีน้ำหนักต่างกัน และโพสต์เปิดตัวเองก็ลดระดับสองข้อนั้นลงอย่างเงียบๆ เวอร์ชันที่ตรงไปตรงมาของแต่ละข้อคือ:
• ความแม่นยำ — ในลีดเดอร์บอร์ดของ Artificial Analysis นั้น MAI-Transcribe-2 อยู่ในอันดับสองที่ค่า AA-WER 2.0% ไม่ใช่อันดับหนึ่ง ข้อความในเนื้อหาของ Microsoft เองก็ระบุว่าเป็นอันดับสอง วลี “แม่นยำที่สุด” จะยังใช้ได้ก็ต่อเมื่อตีความว่า “ในกลุ่ม managed batch API ที่มีการติดตามผลในระดับนี้” และถึงอย่างนั้นก็ยังเป็นการกล่าวถึงโมเดลที่มีอายุแค่สี่วัน ไม่ใช่ตำแหน่งสูงสุดที่มั่นคง Microsoft รายงานแยกต่างหากว่าโมเดลนี้เป็นอันดับหนึ่งบนเกณฑ์ชี้วัดหลายภาษาของ FLEURS ด้วยค่า WER เฉลี่ย 5.2% ใน 60 ภาษา — ตัวเลขดังกล่าวมาจากโพสต์เปิดตัวของ Microsoft ยังไม่มีการคำนวณใหม่โดยอิสระในแต่ละภาษา
• ความเร็ว — ตามการวิเคราะห์ของ Artificial Analysis นั้น MAI-Transcribe-2 ทำงานด้วยความเร็วประมาณ 411 เท่าของเวลาจริง (real time) ซึ่งเป็นอันดับสองในตารางนั้น น่าแปลกที่ประกาศของไมโครซอฟต์เองไม่เคยพิมพ์ตัวเลขสัมบูรณ์ออกมา แต่กลับใช้ตัวคูณแบบสัมพันธ์ที่ฟังดูเป็นมิตรกว่าเป็นอันดับแรก อย่างเช่น "ประมวลผลได้เร็วกว่าคู่แข่งชั้นนำถึง 10 เท่า โดยเฉพาะอย่างยิ่งกับเสียงแบบยาว" และโดยเฉพาะเจาะจงคือเร็วกว่า GPT-Transcribe ของ OpenAI 10 เท่า, เร็วกว่า Scribe v2 ของ ElevenLabs 7 เท่า และเร็วกว่า Gemini 3.5 Transcribe 5 เท่า อัตราส่วนเหล่านั้นคือการตีกรอบข้อมูล Artificial Analysis ชุดเดียวกันของไมโครซอฟต์ และอัตราฐานก็มีความสำคัญ: "เร็วกว่า Gemini 3.5 Transcribe 5 เท่า" ฟังดูเหมือนช่องว่างเล็กน้อย จนกว่าคุณจะแปลงเป็นจำนวนนาทีของการประมวลผลต่อหนึ่งชั่วโมงของเสียง
• ถูกที่สุด — จริงเฉพาะภายใต้กรอบสองข้อที่ Microsoft ระบุไว้อย่างชัดเจน อัตรา $0.10 เป็น "ข้อเสนอจำกัดเวลาจนถึงสิ้นปี" และไม่มีราคามาตรฐานหลังโปรโมชันเปิดเผยในเอกสารเปิดตัวแต่อย่างใด และมันถูกที่สุดในบรรดา managed API ที่มีความแม่นยำสูง โมเดลโอเพนซอร์สที่โฮสต์เองอย่าง Whisper Large v3 Turbo ยังคงถอดเสียงด้วยต้นทุนที่เทียบเท่าค่าไฟฟ้าเท่านั้น ข้อโต้แย้งเรื่องสินค้าโภคภัณฑ์เป็นจริง — เพียงแต่มันแคบกว่าพาดหัวข่าว

$1.67 ต่อ 1,000 นาที ซื้ออะไรได้บ้าง
กำหนดราคาไว้ที่ $0.10 ต่อชั่วโมงเสียง MAI-Transcribe-2 จึงคิดเป็นประมาณ $1.67 ต่อเสียง 1,000 นาที การเปรียบเทียบที่ทำให้ตัวเลขนี้เห็นภาพชัดคือการเทียบกับ managed transcription API อื่นๆ ที่แข่งขันกันในเรื่องความแม่นยำ GPT-Transcribe ระบุราคาไว้ที่ $4.50 ต่อ 1,000 นาที; ระดับเสียงที่บันทึกไว้ล่วงหน้าของ Gemini 3.5 Transcribe คิดเป็นประมาณ $5 ต่อ 1,000 นาทีตามระบบการคิดราคาแบบ token ของ Google; ส่วน ElevenLabs' Scribe v2 ระบุราคาสูงกว่านั้นอีก เมื่อคิดจากเสียง 1,000 ชั่วโมงต่อเดือน — ปริมาณงานที่จริงจังแต่ไม่ใหญ่โตสำหรับศูนย์ติดต่อหรือสื่อ — ช่องว่างระหว่าง MAI-Transcribe-2 ในอัตราช่วงแนะนำกับ GPT-Transcribe ตามราคาปกติจะอยู่ที่ประมาณ $170 ต่อเดือน ทุกเดือน โดยยังไม่นับความแตกต่างด้านความแม่นยำ นี่คือช่องว่างด้านราคาที่ทำให้การถอดเสียงเลิกเป็นรายการค่าใช้จ่ายที่ทีมต้องปรับให้เหมาะสม แล้วกลายเป็นรายการที่พวกเขามองข้ามได้เลย
ข้อควรระวังสองประการนี้ควรกล่าวควบคู่กัน ประการแรก ราคาโปรโมชันคือการทดลองตั้งราคาจนกว่าจะไม่ใช่โปรโมชันอีกต่อไป ทีมที่สร้างผลิตภัณฑ์บนอัตรา $0.10 ควรรู้ไว้ว่าอัตรามาตรฐานไม่ได้รับการเปิดเผย และตัวเลขวางแผนที่สมเหตุสมผลสำหรับงบประมาณปี 2027 คือค่าที่อยู่ระหว่างข้อเสนอตอนเปิดตัวกับสิ่งที่ Microsoft จะประกาศเมื่อข้อเสนอหมดอายุ ประการที่สอง คำกล่าวที่ว่า “ถูกที่สุดในระดับความแม่นยำนี้” ไม่ได้บอกอะไรเกี่ยวกับต้นทุนรวมในการเป็นเจ้าของ — โมเดลนี้ใช้งานผ่าน API เท่านั้น ดังนั้น การเปรียบเทียบที่สำคัญสำหรับทีมที่มีปริมาณการใช้งานสูงจึงอยู่ที่ $1.67 ต่อ 1,000 นาที เทียบกับต้นทุนเบ็ดเสร็จของการรัน open-weights stack ของตนเอง ไม่ใช่เพียงแค่เทียบกับ API อื่น
เมื่อย่อลงเป็นตารางสรุป ตำแหน่งการเปิดตัวจะเป็นดังนี้ — ตัวเลขทั้งหมดด้านล่างนี้มีป้ายกำกับแหล่งที่มาตามที่ระบุไว้ในเนื้อหาด้านบน

อะไรที่ยังไม่ได้รับการพิสูจน์
แม้คำกล่าวอ้างตอนเปิดตัวจะเฉพาะเจาะจงเพียงใด สามเรื่องนี้ก็ยังเปิดค้างอยู่จริง ๆ เรื่องแรกคือการสตรีมมิง: MAI-Transcribe-2 เป็นโมเดลแบบแบตช์ เรื่องความเร็วของ Microsoft นั้นเกี่ยวกับปริมาณไฟล์ที่ประมวลผล และยังไม่มี SKU แบบเรียลไทม์ที่ประกาศหรือสาธิตออกมา — "411×" จึงไม่ใช่ตัวเลขความหน่วงของการถอดความแบบเรียลไทม์ เรื่องที่สองคือคุณภาพของการแยกผู้พูด (diarization): การระบุผู้พูดถูกรวมอยู่ในบริการแล้ว แต่ Microsoft ไม่ได้เผยแพร่อัตราความผิดพลาดในการแยกผู้พูด และฟีเจอร์นี้เองที่น่าจะดูแย่กว่า WER มากที่สุดเมื่อถูกทดสอบโดยอิสระ เรื่องที่สามคือรายละเอียดเชิงหลายภาษา: ค่าเฉลี่ย FLEURS เพียงค่าเดียวจาก 60 ภาษา อาจซ่อนความแปรปรวนระหว่างภาษาในวงกว้างไว้ และ Microsoft ยังไม่ได้เผยแพร่ตารางแยกรายภาษา ทั้งหมดนี้ล้วนเป็นเหตุผลที่ทำให้เรื่องราวยังไม่จบลงในวันที่สี่
จุดที่ออกจากสแตกการถอดเสียงของคุณ
ทั้งหมดนี้ไม่ได้หมายความว่าต้องเลือก MAI-Transcribe-2 ในวันนี้ ซึ่งเป็นเหตุผลที่ราคาควรได้รับความสนใจจากทีมที่ไม่ได้อยู่ในตลาดหาผู้ให้บริการรายใหม่ การแปลงเสียงเป็นข้อความแทบจะไม่ใช่จุดสิ้นสุดของไปป์ไลน์ — บันทึกการประชุมจะถูกสรุป ลงมือปฏิบัติ ค้นหา และจัดเส้นทาง และเลเยอร์ปลายทางนี่เองที่การตั้งค่าระบบหลายโมเดลแสดงคุณค่า แพลตฟอร์มอย่าง OrcaRouter มีไว้สำหรับครึ่งหนึ่งของสแตกดังกล่าว: API เดียวที่ครอบคลุมโมเดลกว่า 200 รายการ ราคารายการจากผู้ให้บริการส่งผ่านโดยไม่มีมาร์กอัป 0% การเฟลโอเวอร์อัตโนมัติ และ DSL สำหรับจัดเส้นทางที่ให้บันทึกการประชุมป้อนไปยังโมเดลที่แตกต่างกันตามปริมาณงานแต่ละประเภท — รายงานการประชุมไปยังตัวสรุปหนึ่งตัว การตรวจสอบการปฏิบัติตามข้อกำหนดไปยังอีกตัวหนึ่ง — โดยไม่ต้องบูรณาการครั้งที่สอง ตัว MAI-Transcribe-2 เองไม่ได้อยู่ในรายชื่อนั้นในวันนี้ มันอยู่บน API ของ Microsoft เองและแพลตฟอร์มบุคคลที่สามที่ Microsoft ระบุไว้ แต่ราคาสินค้าโภคภัณฑ์ที่เพิ่งตั้งไว้นี้เป็นข้อโต้แย้งที่ดีที่สุดในการสร้างส่วนที่อยู่เหนือบันทึกการประชุมให้ไม่ยึดติดกับโมเดลใดโมเดลหนึ่ง
ราคาเปิดตัวคือเครื่องบ่งชี้ที่บอกทุกอย่าง Microsoft ไม่ได้พยายามเอาชนะเกม speech-to-text ด้วยฟีเจอร์เพียงอย่างเดียว — แต่มันกำลังทำให้ความแม่นยำระดับสูงมีต้นทุนถูกมากจนหมวดหมู่นี้ไม่ต้องเป็นรายการค่าใช้จ่ายที่ต้องคิดแยกอีกต่อไป MAI-Transcribe-2 สมควรได้รับความสนใจที่กำลังได้รับอยู่ เพียงแค่อ่านข้อความที่ว่า "เร็วที่สุด แม่นยำที่สุด และถูกที่สุดในโลก" พร้อมเครื่องหมายดอกจันสามอันที่แนบมา: เป็นอันดับสองในเกณฑ์ AA-WER ราคาส่งเสริมการขายไปจนถึงสิ้นปี และเรื่องราวของโหมดสตรีมมิงที่ยังไม่เคยถูกเล่าออกมา
