การ์ดชื่อเรื่องที่สร้างขึ้นโดยมีหัวข้อ MODEL REFERENCE พร้อมชื่อเรื่องว่า 'Muse Voice Transcribe' และคำโปรยว่า 'โมเดลแปลงเสียงพูดเป็นข้อความแบบสตรีมมิงของ Meta บน Model API' เหนือการ์ดมุมโค้งสี่ใบที่ระบุว่า '$0.18 ต่อชั่วโมงเสียง', 'WebSocket แบบสตรีมมิง + เอนด์พอยต์ไฟล์', '25 ภาษาที่ประเมินแล้วพร้อมการสลับภาษา' และ 'การประทับเวลาแบบระดับเทิร์น ไม่ใช่ระดับคำ' โดยมีส่วนท้ายว่า 'ที่มา: หน้าโมเดลและเอกสารของ Meta เอง, 2026-09-29'
Guides & Insights

Muse Voice Transcribe: โมเดลถอดเสียงเป็นข้อความแบบสตรีมมิ่งของ Meta อธิบายฉบับเข้าใจง่าย

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Muse Voice Transcribe เป็นโมเดลถอดเสียงพูดแบบสตรีมมิ่งของ Meta โดยให้บริการบน Meta Model API ในราคา $0.18 ต่อชั่วโมงเสียง ภายใต้รหัสโมเดล muse-voice-transcribe-1.0 และราคาเดียวกันไม่ว่าคุณจะสตรีมเสียงสดหรือส่งไฟล์บันทึกที่เสร็จแล้วให้กับมัน สิ่งที่ทำให้มันคู่ควรกับการมีหน้าเอกสารอ้างอิงมากกว่าการเช็คราคาเพียงบรรทัดเดียว คือจุดที่งานเกิดขึ้น: การระบุผู้พูดสำหรับเสียงมากกว่ายี่สิบเสียง และการตรวจจับจุดสิ้นสุดของคำพูด ทำงานอยู่ภายในโมเดลการรู้จำเสียง ไม่ใช่ในรอบการประมวลผลแบบแบตช์ที่ติดตั้งเพิ่มไว้ท้ายสตรีม มันเป็นการถอดเสียงพูดเป็นข้อความเท่านั้น — เอกสารสำหรับนักพัฒนาของ Meta ระบุไว้อย่างชัดเจนเช่นนั้น: มันไม่ได้สังเคราะห์เสียงพูด และไม่ได้ให้ API สำหรับการสนทนาแบบเสียงเป็นเสียง

นี่คือหน้าที่ผู้อ่านเข้ามาเจอหลังจากค้นหาชื่อของโมเดลนี้เอง จึงถูกสร้างขึ้นให้เป็นคำตอบที่มั่นคงสำหรับสองคำถาม — โมเดลนี้คืออะไร และเสียงหนึ่งชั่วโมงมีค่าใช้จ่ายเท่าไร — มากกว่าที่จะเป็นประกาศข่าว มีวันที่หนึ่งที่ควรบันทึกไว้ก่อนสิ่งอื่นใด เพราะมันเป็นข้อเท็จจริงเกี่ยวกับโมเดล ไม่ใช่เหตุผลที่หน้านี้มีอยู่: Meta Superintelligence Labs เปิดตัว Muse Voice Transcribe เมื่อ 2026-09-01 ในโพสต์ประกาศที่ระบุวันที่ แนะนำ Muse Voice Transcribe — โพสต์ที่ผู้อ่านยังเข้าถึงได้ผ่านดัชนีบล็อกของ Meta แม้ตอนนี้จะไม่ตอบสนองที่ URL ของตัวเองอีกต่อไป ทุกสิ่งด้านล่างนี้ถูกอ่านจากหน้าของ Meta เองเมื่อวันที่ 2026-09-29 โดยหลักคือหน้าโมเดลและเอกสารเรื่อง speech-to-text และภาพรวมของ API ในกรณีที่ Meta ไม่เผยแพร่ตัวเลขใด หน้านี้ก็จะบอกไว้เช่นนั้น แทนที่จะไปหยิบตัวเลขจากแหล่งอื่นมาใช้แทน

มันคืออะไร ในคำนิยามของ Meta

เอกสารของ Meta เองเปิดคำอธิบายไว้อย่างตรงไปตรงมาว่า "Muse Voice Transcribe คือโมเดลแปลงเสียงพูดเป็นข้อความของ Meta บน Meta Model API ถอดเสียงจากเสียงสดหรือไฟล์บันทึกที่มีอยู่ พร้อมการตรวจจับการผลัดกันพูด ป้ายกำกับผู้พูด และการปรับความเอนเอียงของคำศัพท์" หน้าภาพรวมย่อสิ่งเดียวกันให้เหลือหนึ่งประโยค — การแยกผู้พูดแบบสตรีมมิ่ง การตรวจจับจุดสิ้นสุดและการตรวจจับกิจกรรมเสียงในตัว การปรับความเอนเอียงตามบริบทและคำสำคัญ และภาษาที่ผ่านการประเมิน 25 ภาษาที่มีการสลับภาษา ดังนั้นเอาต์พุตจึงเป็นสตรีมบทถอดเสียงเดียวที่พกป้ายสามอย่างพร้อมกัน: คำพูด ใครกำลังพูด และข้อความนั้นพูดจบแล้วหรือยัง นั่นคือการรวมกันที่สแตกโปรดักชันส่วนใหญ่ในปัจจุบันต้องประกอบขึ้นจากตัวรู้จำเสียง บวกกับตัวตรวจจับกิจกรรมเสียงแยกต่างหาก บวกกับโมเดลแยกผู้พูดอีกตัวหนึ่ง ซึ่งแต่ละตัวมีงบความหน่วงของตัวเอง

หน้าโมเดลของ Meta วางกรอบสิ่งนี้ว่า "ความหน่วงที่แข่งขันได้และความแม่นยำในการถอดเสียงแบบสตรีมมิ่ง พร้อมการระบุผู้พูดแบบเรียลไทม์สำหรับผู้พูด 20 คนขึ้นไป" และเอกสารสำหรับนักพัฒนาอธิบายฟิลด์เอาต์พุตว่า "ข้อความถอดเสียงพร้อมการจับเวลาระดับช่วงผลัดการพูดและป้ายผู้พูดแบบไม่บังคับ" สองสิ่งตามมาจากตรงนั้น และทั้งสองอย่างสำคัญกว่าการวางกรอบนั้น:

• มันเป็นโมเดลที่รับเสียงเข้าและส่งข้อความออก ไม่ใช่แบบรับข้อความเข้าและไม่ใช่แบบส่งข้อความออก และ Meta ระบุชัดเจนว่ามันไม่ใช่ตัวสร้างเสียงพูด

• เป็นโมเดลสตรีมมิ่งตั้งแต่แรก เส้นทางเรียลไทม์ไม่ใช่ตัวห่อหุ้มรอบเส้นทางไฟล์ แต่เป็นเซสชัน WebSocket ที่มีอีเวนต์ โหมด และขีดจำกัดของตัวเอง ดังที่อธิบายด้านล่าง

ค่าใช้จ่ายสำหรับเสียงหนึ่งชั่วโมง

หน้าโมเดลของ Meta สำหรับ Muse Voice Transcribe ระบุราคาไว้ว่า "สร้างด้วยโมเดลเดียวในราคา $0.18/ชั่วโมง" และตารางข้อมูลจำเพาะของมันแสดงรายการ muse-voice-transcribe-1.0 ที่ $0.18 ต่อชั่วโมง ของเสียง และ $3.00 ต่อ 1,000 นาที. ทั้งสองเป็นการแสดงหน่วยสองแบบของอัตราเดียว และทั้งคู่ถูกพิมพ์ไว้บนหน้าของ Meta เอง ณ วันที่อ่านเมื่อ 2026-09-29 เอกสารสำหรับนักพัฒนาระบุอัตราเดียวกันในรูปแบบที่สามว่า "ราคาคือ $0.18 ต่อชั่วโมง ของเสียงที่ประมวลผล" ไม่มีตัวเลขใดในหน้านี้ที่ยกมาจากหน้าสำหรับกำหนดราคาของ Meta เพราะไม่มีหน้าสำหรับกำหนดราคาของ Meta ที่อ่านได้ให้อ่าน: เอกสารเชื่อมโยงอัตรานี้ออกไปยังหน้า "การกำหนดราคาและขีดจำกัดอัตรา" ที่ตอบว่า หน้านี้ไม่พร้อมใช้งาน ณ วันที่อ่านเมื่อ 2026-09-29 ดังนั้นหน้าโมเดลจึงเป็นแหล่งข้อมูลอ้างอิงสำหรับอัตรานี้ และเป็นแหล่งเดียวที่ใช้ที่นี่

รายละเอียดการคิดค่าบริการอยู่ในเอกสารสำหรับนักพัฒนา และเป็นเรื่องที่ควรรู้ก่อนที่คุณจะกำหนดขนาดเวิร์กโหลด:

• การสตรีมและการไม่สตรีมมีค่าใช้จ่ายเท่ากัน ไม่มีค่าใช้จ่ายเพิ่มเติมสำหรับ endpoint แบบเรียลไทม์

• การประมวลผลแบบไม่เก็บข้อมูล (zero-data-retention) มีราคาเท่ากับ {{1}}ระดับ Standard{{/1}} ตามเอกสาร — ไม่ใช่รายการคิดค่าบริการเพิ่มเติม

• การคิดค่าบริการจะปัดลงเป็นจำนวนวินาทีเต็ม ดังนั้นเทิร์นที่มีความยาวสองวินาทีจะคิดเป็นสองวินาที ไม่ใช่สามวินาที

• ความล้มเหลวที่เกิดขึ้นก่อนที่จะมีการสร้างบทถอดความจะไม่ถูกเรียกเก็บค่าบริการ และเช่นเดียวกันกับ429 การตอบกลับที่มีการจำกัดอัตราก็ไม่ถูกเรียกเก็บค่าบริการเช่นกัน

• เครดิตฟรีมีอยู่ในระดับแพลตฟอร์ม ไม่ใช่ระดับโมเดล เอกสารการถอดเสียงเป็นข้อความของ Meta จบย่อหน้าเรื่องราคาด้วยประโยคที่ว่า "เครดิตฟรีระดับแพลตฟอร์มมีผลใช้" นั่นเป็นข้อความเดียวที่กล่าวถึงเรื่องฟรีใด ๆ ในหน้าสำหรับโมเดลนี้ และจงใจไม่เจาะจง: มันชี้ไปที่แผนเครดิตของแพลตฟอร์ม มากกว่าจะสัญญาว่ามีโควตาฟรีสำหรับการถอดเสียง และไม่มีการระบุจำนวน ระยะเวลา หรือกฎเกณฑ์คุณสมบัติใด ๆ สำหรับสิ่งนี้ ให้ตีความว่าเป็นเครดิตที่อาจช่วยลดยอดเรียกเก็บเงิน ไม่ใช่ระดับฟรีสำหรับโมเดล คำกล่าวสำหรับผู้บริโภคของ Meta ที่ว่าเอเจนต์ส่วนตัวของตน "ฟรีสำหรับสิ่งที่ผู้คนต้องการเป็นส่วนใหญ่" เป็นประโยคแยกต่างหากเกี่ยวกับแอป Muse และไม่ครอบคลุมถึง Model API

ตัวอย่างที่คำนวณให้เห็นภาพ เพราะราคาต่อชั่วโมงเป็นเรื่องจับต้องได้ยาก: การสัมภาษณ์ที่บันทึกไว้ความยาวสองชั่วโมงมีค่าถอดเสียง $0.36 เสียงสนทนาทางโทรศัพท์หนึ่งพันชั่วโมง — คิดเป็นปริมาณโดยประมาณต่อเดือนของศูนย์ติดต่อขนาดกลาง — อยู่ที่ $180 ในระดับนั้น อัตราคือประเด็นทั้งหมด และอัตราก็เป็นสิ่งเดียวที่สามารถเปลี่ยนไปใต้เท้าคุณได้: หน้าเว็บของ Meta คือแหล่งอ้างอิงหลักในเรื่องนี้ และหากตัวเลขตรงนั้นเปลี่ยน ตัวเลขตรงนี้ก็เปลี่ยนตาม

อินเทอร์เฟซสตรีมมิ่ง ทีละเอนด์พอยต์

This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.

• เสียงสด — wss://api.meta.ai/v1/asr/realtime. การรับส่งข้อมูลเป็น WebSocket และรายละเอียดการยืนยันตัวตนเป็นกับดัก: คุณต้องยืนยันตัวตนในเฟรมแฮนด์เชก โดยที่ Authorization เฮดเดอร์จะถูกละเว้น แฮนด์เชกต้องเป็นเฟรมข้อความ JSON แรก และต้องมาถึงภายใน 10 วินาที เซสชันมีอายุได้สูงสุด 60 นาที WebSocket ใหม่จะสร้างเซสชันใหม่ และไม่มีโทเค็นสำหรับกลับมาเชื่อมต่อ

• การบันทึกเสียง — POST https://api.meta.ai/v1/asr/transcribe. อัปโหลดแบบ multipart และอันนี้ก็ยืนยันตัวตนด้วย Authorization header อินพุตจำกัดมาก: รองรับเฉพาะ mono 16-bit PCM WAV ที่ 16 หรือ 24 kHz เท่านั้น ขีดจำกัดคือ 32 MB ต่อ body และเสียง 10 นาทีต่อคำขอ

ภายในเซสชันจริง มีสามโหมดที่เปลี่ยนสิ่งที่คุณได้รับ PUSH_TO_TALK เป็นค่าเริ่มต้นและทำการถอดเสียงแบบเทิร์นเดียว ENDPOINTING ให้ขอบเขตเทิร์นที่โมเดลตรวจจับได้ หนึ่งเทิร์นต่อหนึ่งช่วงเสียงพูดที่ตรวจพบ โดยส่งเหตุการณ์ speechStart ซ้ำ ๆ transcript, speechEnd และ speechComplete — พร้อมคำเตือนว่า speechEnd ไม่ใช่ transcript DIARIZATION เพิ่มการตรวจจับและระบุผู้พูดโดยอัตโนมัติ โดยส่งเหตุการณ์ speaker ที่มีป้ายกำกับเช่น A และ B ข้อความถอดเสียงบางส่วนจะมาในรูปแบบสะสม โดยแต่ละ partial จะแทนที่อันก่อนหน้า หรือมาในรูปแบบเดลตา

รายละเอียดเชิงปฏิบัติการสองข้อจากเอกสารเดียวกันนั้นเป็นเรื่องง่ายที่จะมองข้าม และมีค่าใช้จ่ายสูงหากพบในสภาพแวดล้อมการผลิต:

• การแยกผู้พูด (diarization) จะทำเครื่องหมายว่าอาจเป็นผู้พูดรายใหม่ มากกว่าจะเป็นจุดสิ้นสุดของคำพูดที่ชัดเจน และ Meta ระบุว่ายังไม่ได้ปรับแต่งให้เหมาะกับการใช้งานคำสั่งเสียงที่มีความหน่วงต่ำ ควรถือว่าป้ายกำกับเหล่านี้เป็นตัวระบุเฉพาะเซสชัน — A ในเซสชันหนึ่งไม่ใช่คนเดียวกับA ในเซสชันถัดไป

• เทิร์นอาจทับซ้อนกัน ดังนั้นสถานะต่อเทิร์นควรผูกกับตัวระบุเทิร์น แทนที่จะผูกกับลำดับการมาถึง

• ขีดจำกัดสูงสุดที่ประกาศไว้ต่อผู้เช่ารายหนึ่งคือ 128 สตรีมพร้อมกัน และ 16,000 สตรีมต่อชั่วโมง

อะไรที่ทำงานอยู่ภายในโมเดล และมันเข้ามาแทนที่อะไร

หน้าโมเดลของ Meta ระบุข้อกล่าวอ้างที่เจาะจงเกี่ยวกับสถาปัตยกรรม มากกว่าที่จะเป็นเรื่องของคะแนน: "การระบุผู้พูดสำหรับผู้พูด 20 คนขึ้นไป และการตรวจจับจุดสิ้นสุดของการพูด เกิดขึ้นภายในโมเดลการรู้จำเสียง" — และหน้าเพจนั้นเปรียบเทียบเรื่องนี้อย่างชัดเจนกับการประมวลผลแบบเป็นชุดที่ทำตอนท้ายของสตรีมเสียง ความแตกต่างในทางปฏิบัติก็คือ ไม่มีขั้นตอนที่สองให้ต้องรออยู่ ป้ายกำกับผู้พูดและขอบเขตการผลัดกันพูดมาพร้อมกับสตรีมเดียวกับคำพูด ดังนั้นเอเจนต์เสียงปลายทางหรือหน้าจอคำบรรยายสดจึงได้รับเทิร์นที่เสร็จสมบูรณ์และข้อมูลระบุตัวตน โดยไม่ต้องผ่านขั้นตอนหลังการประมวลผลเพิ่มเติม

ความสามารถอื่น ๆ ที่ Meta ระบุว่าอยู่ภายในโมเดล:

• การตรวจจับจุดสิ้นสุดคำพูดและการตรวจจับกิจกรรมเสียงพูดในตัว ดังนั้นคุณจึงไม่ต้องรัน VAD ของคุณเองไว้หน้า API ตามถ้อยคำในเอกสาร คุณจะได้ทรานสคริปต์ที่สมบูรณ์หนึ่งรายการต่อหนึ่งคำพูด โดยไม่ต้องรันการตรวจจับกิจกรรมเสียงพูดของคุณเอง และการตรวจพบจุดสิ้นสุดของเสียงพูดจะไม่ทำให้เซสชันสิ้นสุดลง

• การไบแอสตามบริบทและคำสำคัญ โดยไม่ต้องปรับแต่งละเอียด หน้าของโมเดลของ Meta อธิบายว่าความแม่นยำคงอยู่ "ผ่านการไบแอสตามบริบทและคำสำคัญ โดยไม่ต้องปรับแต่งละเอียด" ซึ่งเป็นคุณสมบัติที่ทำให้ ASR แบบสตรีมมิ่งใช้งานได้กับคำศัพท์เฉพาะทาง — ชื่อยา สัญลักษณ์หุ้น รหัสสินค้า — มากกว่าค่าเฉลี่ยของภาษาทั่วไป เอกสารระบุขีดจำกัดอย่างชัดเจน: คำสำคัญช่วยไบแอสการรู้จำแต่ไม่รับประกันการสะกดที่แน่นอน และทั้งคำสำคัญและการไบแอสภาษาจะถูกกำหนดไว้ตายตัวเมื่อเริ่มเซสชัน

• 25 ภาษาที่ได้รับการประเมินพร้อมการสลับภาษา เอกสารระบุไว้ดังนี้: อาหรับ เบงกาลี ดัตช์ อังกฤษ ฝรั่งเศส เยอรมัน ฮีบรู ฮินดี อินโดนีเซีย อิตาลี ญี่ปุ่น กันนาดา เกาหลี มาเลย์ จีนกลาง มราฐี โปแลนด์ โปรตุเกส สเปน ตากาล็อก ทมิฬ เตลูกู ไทย ตุรกี และเวียดนาม การสลับภาษา — กลางประโยคและกลางถ้อยคำ โดยไม่ต้องบอกว่ากำลังจะมาเป็นภาษาใด — เป็นความสามารถที่ระบบรู้จำภาษาเดียวไม่สามารถให้ได้ในเชิงโครงสร้าง ข้อควรระวังหนึ่งที่ควรจำไว้: ไบแอสภาษาเป็นรายการภาษา ไม่ใช่บริบทแบบอิสระ และไม่ได้บังคับให้โมเดลใช้ภาษาเหล่านั้น

โพสต์ประกาศที่ระบุวันที่นั้นให้รายละเอียดเพิ่มเติมว่า โมเดลนี้ได้รับการฝึกบนภาษามากกว่า 70 ภาษา โดยในจำนวนนั้น 25 ภาษา "ผ่านการตรวจสอบอย่างละเอียด" ซึ่งเป็นข้อมูลที่ผู้ขายรายงานเอง และรายชื่อ 25 ภาษาที่ผ่านการตรวจสอบก็เป็นเพียงส่วนย่อยที่ Meta ยืนยันรับรอง นั่นคือความครอบคลุมที่ควรใช้ในการวางแผน ไม่ใช่ตัวเลข 70

ขีดจำกัดที่ระบุไว้ในเอกสาร

หน้าอ้างอิงจะมีค่าเพียงเท่ากับข้อจำกัดที่มันพิมพ์ออกมา และ Meta พิมพ์ออกมาหลายข้อ

• การประทับเวลาแบบระดับเทิร์น ไม่ใช่ระดับคำ ทั้งหน้าโมเดลและเอกสารระบุไว้อย่างชัดเจนว่า "ระบบจะคืนค่าการประทับเวลาแบบระดับเทิร์น แต่ไม่ใช่การประทับเวลาแบบระดับคำ" เทิร์นจะมีความเริ่มต้นและเวลาสิ้นสุดเป็นมิลลิวินาที หากผลิตภัณฑ์ของคุณต้องการคลิกเพื่อกระโดดไปยังแต่ละคำ — การไฮไลต์แบบคาราโอเกะ การกำหนดเส้นทางตามความเชื่อมั่นรายคำ การจัดตำแหน่งแบบบังคับ — นี่คือโมเดลที่ผิด และไม่ว่าการออกแบบพรอมป์ตจะทำมากแค่ไหนก็ไม่เปลี่ยนสิ่งนั้น

• ไม่มีคะแนนความมั่นใจ ไม่มีการตรวจจับเหตุการณ์เสียง ไม่มีการตรวจจับอารมณ์ ไม่มีการจัดรูปแบบข้อความถอดเสียงใหม่ Meta ระบุว่าทั้งสี่อย่างไม่พร้อมใช้งาน คุณจะได้คำพูด ช่วงผลัดการพูด เวลา และป้ายกำกับผู้พูด และไม่มีอะไรบอกว่าโมเดลมั่นใจแค่ไหน

• ไม่มีการสังเคราะห์เสียงพูดและไม่มี API สำหรับการสนทนาแบบเสียงพูดถึงเสียงพูด เป็นแบบทางเดียวเท่านั้น

• รูปแบบเสียงที่รองรับบนเส้นทางไฟล์นั้นมีจำกัด โมโน 16-bit PCM WAV, 16 หรือ 24 kHz สิ่งอื่นใดต้องแปลงก่อนจึงจะอัปโหลดได้

เวทแบบเปิด และความสับสนเรื่อง Muse Glimmer

Muse Voice Transcribe เป็นซอฟต์แวร์เฉพาะเจ้าของ (proprietary) และให้บริการผ่าน API — ไม่ใช่รุ่นที่เปิดเผยน้ำหนักโมเดล (open-weight) และเอกสารของ Meta ก็ไม่เคยอ้างว่าเป็นเช่นนั้น เรื่องนี้สำคัญเพราะผู้อ่านมักนำเส้นทางแบบ open-weight ของตระกูล Muse ไปผูกกับชื่อผิด Muse Glimmer คือเส้นทางนั้น: เอกสารของ Meta อธิบายว่าเป็นโมเดลมัลติโมดัลแบบ open-weight ที่กลั่นมาจาก Muse Spark เผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 ซึ่งอนุญาตให้ใช้ได้อย่างเสรี โดยคุณดาวน์โหลดและรันบนฮาร์ดแวร์ของคุณเองผ่านรันไทม์อย่าง vLLM, SGLang, llama.cpp หรือ ExecuTorch ส่วน Muse Voice Transcribe ถูกจัดกลุ่มไว้ในหน้าเดียวกันกับ Muse Spark, Muse Image และ SAM ในฐานะโมเดลที่คุณเรียกใช้มากกว่าที่จะดาวน์โหลด

ดังนั้น: ไม่มีเวตสำหรับ Muse Voice Transcribe ไม่มีตัวเลือกโฮสต์เอง ไม่มีเส้นทางที่จะตรวจสอบหรือไฟน์จูนมันได้ หากหน้าใดบอกเป็นอย่างอื่น แสดงว่าหน้านั้นสับสนปนเปกับ Muse Glimmer ในกรณีที่เวตของโมเดลไม่ถูกเผยแพร่ แพลตฟอร์มที่ให้บริการคือเรื่องทั้งหมด — และนั่นคือสิ่งที่ส่วนถัดไปจะกล่าวถึง

ไคลเอนต์เข้าถึงมันได้อย่างไร

Model API ของ Meta ถูกสร้างมาเพื่อให้หยิบใส่ในไคลเอนต์ที่คุณมีอยู่แล้วได้เลย คำกล่าวอ้างของผู้ให้บริการ ซึ่งพิมพ์อยู่บนหน้าภาพรวมของ API ระบุว่า Model API "เข้ากันได้แบบดรอปอินกับไลบรารีไคลเอนต์ที่เข้ากันได้กับ OpenAI และ Anthropic และกับ CLI ของเอเจนต์ที่เข้ากันได้กับ OpenAI ตั้งค่า base URL ของไคลเอนต์ เพิ่มคีย์ของคุณ และเก็บโค้ดส่วนที่เหลือไว้" โดยทั่วไปสำหรับ Model API มีรูปแบบคำขอสามแบบที่นำเสนอ ได้แก่ Responses API, Chat Completions API และ Messages API ดังนั้นการผสานรวมที่มีอยู่แล้วมักมีอินเทอร์เฟซที่สอดคล้องกันโดยไม่ต้องเขียนใหม่ ข้อควรระวังหนึ่งประการเกี่ยวกับขอบเขต: ประโยคเกี่ยวกับความเข้ากันได้นั้นและรูปแบบทั้งสามนั้นเป็นความสามารถของ Model API โดยรวม ไม่ใช่ข้อความที่พิมพ์อยู่บนหน้าโมเดลของ Muse Voice Transcribe เอง ควิกสตาร์ทของหน้าโมเดลเองนั้นจำกัดกว่า — โดยระบุเพียงว่าคุณ "ชี้ไคลเอนต์ที่เข้ากันได้กับ OpenAI ที่คุณมีอยู่ไปที่ Meta Model API" และคุณจะมีคำขอที่ทำงานได้ครั้งแรกภายในเวลาไม่ถึงห้านาที

ช่องว่างหนึ่งอย่างที่ควรชี้ให้เห็นอย่างตรงไปตรงมาบนหน้าอ้างอิง: เอกสารของ Meta สำหรับโมเดลนี้ไม่ได้ระบุชื่อไลบรารีไคลเอนต์อย่างเป็นทางการสำหรับ Muse Voice Transcribe และหน้า "Client libraries" ของ它也อยู่ภายใต้ส่วน SAM ไม่ใช่ส่วน Voice สิ่งที่คู่มือ speech-to-text มอบให้แทนก็คือรายการ dependency ที่เป็นรูปธรรม — Python 3.9 หรือใหม่กว่า พร้อมกับwebsockets และ sounddevice แพ็กเกจ — บวกกับคู่มือพื้นฐาน voice API ดังนั้นคำกล่าวอ้างเรื่องการใช้งานแทนกันได้ทันทีจึงอธิบายถึงพื้นผิวคำขอของ Model API โดยทั่วไป ส่วน endpoint ASR แบบเรียลไทม์นั้นเองก็เป็น WebSocket ที่มีกฎการ handshake ของตัวเอง และไม่มี wrapper ที่มีการจัดทำเอกสารไว้

A screenshot of Meta's model page for Muse Voice Transcribe (captured 2026-09-29), showing the headline 'Competitive latency and streaming transcription accuracy with live attribution for 20+ speakers. Build with a single model at $0.18/hour.', a 'Meet Muse Voice Transcribe' panel of capability cards headed 'Competitive transcription accuracy', 'Live speaker and turn awareness' and 'Production pricing', a 'Muse Voice Transcribe benchmarks' section labelled 'AA-WER Streaming Index - Final Transcription Diarization' with 3.9% and 3.9%, and the pricing row reading muse-voice-transcribe-1.0 at $3.00 per 1,000 minutes and $0.18 per hour.

สิ่งที่ Meta ยังไม่ได้เผยแพร่

การไม่มีเบนช์มาร์กเป็นข้อเท็จจริงเกี่ยวกับเอกสาร จึงระบุไว้เช่นนั้น หน้าของโมเดล Muse Voice Transcribe ของ Meta ไม่มีตารางความแม่นยำที่พิมพ์ไว้ โดยหลักฐานด้านความแม่นยำนำเสนอเป็นไฟล์ภาพสามไฟล์ — ตารางจัดอันดับอัตราความผิดพลาดระดับคำแบบสตรีมมิง การเปรียบเทียบอัตราความผิดพลาดในการแยกผู้พูด และดัชนีความแม่นยำแบบสตรีมมิง — โดยไม่มีตัวเลขในข้อความที่สกัดออกมาได้ หน้าของโมเดลเองไม่ได้ให้อัตราความผิดพลาดระดับคำ ไม่ได้ให้อัตราความผิดพลาดในการแยกผู้พูด และไม่มีการแยกย่อยรายภาษา

โพสต์ประกาศนั้นมีตัวเลขที่ผู้ขายรายงานอยู่จริง รวมถึงอัตราความผิดพลาดระดับคำแบบสตรีมมิ่งและอัตราความผิดพลาดเฉลี่ยในการแยกผู้พูด และนั่นคือตัวเลขที่เราเขียนถึงตอนโมเดลเปิดตัว; มันเป็นการวัดของ Meta เองและยังไม่มีบุคคลที่สามทำซ้ำได้ หน้านี้ไม่ได้รันการเปรียบเทียบนั้นใหม่ เพราะการรันเบนช์มาร์กของผู้ขายจากวันเปิดตัวซ้ำบนหน้าอ้างอิงจะแต่งตัวเลขที่ยังไม่มีใครทำซ้ำให้ดูเป็นข้อสรุปที่ยุติแล้ว สิ่งที่พูดได้อย่างตรงไปตรงมานั้นแคบกว่า: Meta ไม่ได้เผยแพร่การประเมินแบบเทียบตรงกับคู่แข่งที่ระบุชื่อ โดยใช้ความพยายามเท่ากันและฮาร์เนสเดียวกันสำหรับโมเดลนี้ ดังนั้นการเปรียบเทียบใดที่คุณอ่านเจอไม่ว่าที่ไหนก็คือการเปรียบเทียบตัวเลขของผู้ขายที่เก็บภายใต้เงื่อนไขต่างกัน

ยังมีวันที่หนึ่งที่จงใจไม่ระบุไว้เช่นกัน หน้าโมเดลไม่มีวันที่เปิดตัวเลย — เครื่องหมายเวอร์ชันเดียวของมันคือ -1.0 ใน model id วันที่ 2026-09-01 ในบทความนี้มาจากโพสต์ประกาศที่ลงวันที่นั้น และถูกใช้ที่นี่เพื่อระบุวันที่ของโมเดลมากกว่าจะเป็นการรายงานเหตุการณ์

A generated reference scoreboard titled 'Muse Voice Transcribe — the reference', listing six rows for the model: price $0.18 per hour of audio, interface as a realtime WebSocket at wss://api.meta.ai/v1/asr/realtime plus a file endpoint, speaker attribution for 20+ speakers inside the recognition model, turn-level timestamps without word-level times, 25 evaluated languages with code-switching, and proprietary weights with no open download.A screenshot of the Speech to text page in Meta's Model API documentation (captured 2026-09-29), showing the opening sentence 'Muse Voice Transcribe is Meta's speech-to-text model on Meta Model API', an 'Available endpoints' table contrasting wss://api.meta.ai/v1/asr/realtime for live audio against POST https://api.meta.ai/v1/asr/transcribe for a recording and noting that the Authorization header is ignored on the WebSocket, and a Features table whose rows include language biasing across 25 supported languages with code-switching, vocabulary biasing, speech-turn detection, speaker labels, partial transcripts and progress events.

ใครควรเลือกใช้ และใครไม่ควร

Muse Voice Transcribe มีจุดขายที่แคบแต่แข็งแกร่ง: เสียงสดที่คุณต้องการคำพูด ตัวตนของผู้พูด และการสิ้นสุดของรอบการพูดบนสตรีมเดียวกัน ในราคาที่ต่ำพอที่จะรันอย่างต่อเนื่องแทนที่จะรันตามความต้องการ เอเจนต์เสียง คำบรรยายสด การวิเคราะห์การประชุมและสายสนทนา การพิมพ์ตามคำบอก และการถอดเสียงปริมาณมาก คือเวิร์กโหลดที่ Meta ระบุ และเป็นเวิร์กโหลดที่อินเทอร์เฟซถูกออกแบบมาเพื่อรองรับจริงๆ — WebSocket 60 นาที พร้อมโหมด endpointing และป้ายชื่อผู้พูดที่ผูกกับเซสชัน

ข้อโต้แย้งต่อมันก็เจาะจงไม่แพ้กัน หากคุณต้องการการประทับเวลาระดับคำ ความเชื่อมั่นต่อคำ การตรวจจับเหตุการณ์เสียงหรืออารมณ์ หรือการจัดรูปแบบข้อความถอดเสียงใหม่ โมเดลนี้ไม่มีสิ่งเหล่านั้น และนั่นคือการไม่มีอยู่ซึ่งระบุไว้ในเอกสาร ไม่ใช่บั๊ก หากเสียงของคุณมาในรูปแบบอื่นที่ไม่ใช่ WAV โมโน 16 บิต ที่ 16 หรือ 24 kHz และคุณใช้ปลายทางแบบไฟล์ คุณต้องเสียขั้นตอนการแปลงที่ที่อื่นคุณไม่ต้องเสีย และหากความต้องการของคุณคือการถอดเสียงแบบเป็นชุดของไฟล์บันทึกที่เก็บถาวร โดยที่ความแม่นยำเป็นแกนเดียว จุดขายด้านสตรีมมิงก็ไม่ให้อะไรกับคุณเลย — ราคาเท่ากันทั้งสองเส้นทาง คุณจึงจ่ายสำหรับความสามารถแบบเรียลไทม์ที่คุณจะไม่ได้ใช้

สิ่งเดียวที่ต้องตรวจสอบก่อนที่คุณจะตัดสินใจเลือกเส้นทางสำหรับงานโปรดักชัน ก็คือตัวเลขที่หน้านี้มีอยู่เพื่อตอบ และมันเป็นตัวเลขเดียวที่สามารถเปลี่ยนแปลงได้โดยที่ตัวโมเดลไม่ต้องเปลี่ยนเลยแม้แต่นิดเดียว: $0.18 ต่อชั่วโมงของเสียง ตามที่ระบุไว้บนหน้าของโมเดลของ Meta เองในวันนี้ หน้าของ Meta คือแหล่งอ้างอิงที่เชื่อถือได้สำหรับเรื่องนี้ เมื่อตัวเลขนี้เปลี่ยน ทุกอย่างที่คำนวณจากมัน — เดือนที่มีพันชั่วโมง ต้นทุนต่อการสัมภาษณ์หนึ่งครั้ง การคำนวณเปรียบเทียบระหว่างสร้างเองกับซื้อ — ก็เปลี่ยนตามไปด้วย

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube