การ์ดชื่อเรื่องแบบฮีโร่ที่สร้างขึ้น โดยมีพาดหัวว่า 'StepAudio 3 ASR vs Whisper Large v3 Turbo' และคำบรรยายรองว่า '1.7 เปอร์เซ็นต์ เทียบกับ 4.6 เปอร์เซ็นต์ และยังไม่มีการทดสอบแบบตัวต่อตัว' อยู่เหนือส่วนท้ายว่า 'StepAudio ตาม Artificial Analysis; Whisper ตาม Hugging Face'
Guides & Insights

StepAudio 3 ASR เทียบกับ Whisper Large v3 Turbo: 1.7% ต่อ 4.6% และยังไม่มีใครรันการทดสอบนี้

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

การเปรียบเทียบที่คุณต้องการไม่มีอยู่ StepAudio 3 ASR และ Whisper Large v3 Turbo{{2}}StepAudio 3 ASR{{/2}}{{3}} และ {{/3}}{{4}}Whisper Large v3 Turbo{{/4}} อยู่ในดัชนี AA-WER เดียวกันของ Artificial Analysis สำหรับการแปลงเสียงเป็นข้อความแบบไม่สตรีมมิ่ง — อัตราความผิดพลาดระดับคำ 1.7% เทียบกับตัวเลขในช่วง 4 ถึง 5.5% — และ ณ ปลายเดือนกันยายน 2026 ยังไม่มีใครเผยแพร่การเปรียบเทียบแบบตัวต่อตัวบนเสียงชุดเดียวกัน ไม่ใช่ StepFun ไม่ใช่ผู้ดูแล Whisper ไม่ใช่ห้องแล็บอิสระ เอกสารของ StepFun เองเปรียบเทียบกับ Doubao ASR 2.0, Seed 2.0 Lite และ HY3.0 ASR Preview ซึ่งล้วนเป็นผลิตภัณฑ์ ASR ภาษาจีน ฝั่ง Whisper ไม่มีผู้ขายรายใดเผยแพร่การเปรียบเทียบเลย เพราะ Whisper Large v3 Turbo เปิดให้ดาวน์โหลดมานานหลายปี และตัวเลขของมันขึ้นอยู่กับว่าใครเป็นผู้ให้บริการ

ดังนั้นหน้านี้จึงเสนอเวอร์ชันที่ซื่อตรง: มันอ่านกระดานเดียวที่วัดทั้งสองอย่าง แยกสิ่งที่เทียบกันได้ออกจากสิ่งที่เทียบกันไม่ได้ และระบุอย่างตรงไปตรงมาว่าหลักฐานสิ้นสุดลงตรงไหน คำตอบสั้น ๆ ก็คือ ช่องว่างด้านความแม่นยำนั้นมีจริงและกว้างราวสามจุด ส่วนช่องว่างในเรื่องอื่น ๆ ทั้งหมด — ราคา สัญญาอนุญาต ความสามารถในการนำไปใช้งาน — กลับไปในทิศทางตรงกันข้ามและใหญ่กว่า

แต่ละอย่างจริงๆ แล้วคืออะไร

StepAudio 3 ASR เป็นโมเดลถอดเสียงแบบโฮสต์ที่ StepFun เปิดตัวเมื่อวันที่ 15 กันยายน 2026 โดยเป็นส่วนหนึ่งของตระกูลเสียง StepAudio 3 ซึ่งประกอบด้วยห้าโมเดล เข้าถึงได้ผ่านเอนด์พอยต์สตรีมมิ่งจุดเดียวที่คืนข้อความแบบเพิ่มขึ้นเรื่อย ๆ ระหว่างการถอดรหัส และคืนบทถอดเสียงฉบับสมบูรณ์เมื่อสิ้นสุด StepFun อธิบายว่าเป็นระบบถอดเสียงที่แนบโมเดลภาษามาเพื่อจับบริบท ปรับแต่งมาสำหรับเสียงด้านการแพทย์ กฎหมาย การเงิน ยานยนต์ และการเขียนโปรแกรม รวมถึงอินพุตที่ทำให้ระบบรู้จำแบบเดิม ๆ ใช้ไม่ได้ — เสียงกระซิบ เสียงพูดเร็ว เสียงพูดต่อเนื่อง การร้องเพลง และเสียงที่มีดนตรีประกอบอยู่ข้างใต้ ไม่มีน้ำหนักโมเดลแบบเปิด ไม่มีเส้นทางสำหรับติดตั้งภายในองค์กร (on-premise) และไม่มีตัวเลือกการโฮสต์เองในทุกระดับ ราคาตามรายการที่ประกาศไว้คือ 2.8 หยวนต่อชั่วโมง หรือประมาณ 6.67 ดอลลาร์สหรัฐต่อ 1,000 นาที ตามแกนราคาของลีดเดอร์บอร์ดเอง

Whisper Large v3 Turbo เป็นโมเดลแบบ open-weights ที่เผยแพร่โดย OpenAI ภายใต้สัญญาอนุญาต MIT: มีพารามิเตอร์ 809 ล้านตัว รองรับ 99 ภาษา เป็นอนุพันธ์ที่ผ่านการ pruning และ fine-tuning มาจาก Whisper large-v3 โดยลดจำนวนเลเยอร์ตัวถอดรหัสลง มีการดาวน์โหลดหลายล้านครั้ง และมีแพลตฟอร์มจำนวนมากให้บริการในเชิงพาณิชย์ อีกทั้งยังรันบนฮาร์ดแวร์ของคุณเองได้ คุณสมบัติข้อหลังนี้คือสิ่งที่ทำให้การเปรียบเทียบทั้งหมดนี้มีความหมาย และเป็นเหตุผลว่าช่องว่างด้านความแม่นยำไม่ใช่ตัวเลขเดียวที่สำคัญ

บอร์ดเดียวที่วัดได้ทั้งสองอย่าง

ดัชนี AA-WER ของ Artificial Analysis รายงานเปอร์เซ็นต์ของคำที่ถอดความผิด โดยยิ่งต่ำยิ่งดี และเวอร์ชัน 2 ของดัชนีนี้ผสมผสานชุดข้อมูลสามชุด ได้แก่ AA-AgentTalk ที่ 50% VoxPopuli-Cleaned-AA ที่ 25% และ Earnings22-Cleaned-AA ที่ 25% มุมมองแบบไม่สตรีมมิงแสดง 36 จาก 71 โมเดลที่ดัชนีนี้ติดตาม โมเดลทั้งสองปรากฏอยู่ในนั้น ซึ่งมากกว่าที่การเปรียบเทียบส่วนใหญ่จะกล่าวอ้างได้

อ่านตามที่บอร์ดระบุไว้:

• StepAudio 3 ASR — AA-WER 1.7% ประมาณ $6.67 ต่อข้อมูลเสียง 1,000 นาที

• Whisper Large v3 Turbo เอนด์พอยต์ที่โฮสต์ให้หนึ่งรายการ — AA-WER 4.6% ประมาณ $0.67 ต่อ 1,000 นาที

• Whisper Large v3 Turbo เอนด์พอยต์แบบโฮสต์แห่งที่สอง — AA-WER 5.5% ประมาณ $15.00 ต่อ 1,000 นาที

• Whisper Large v3 เจเนอเรชันน้ำหนักเปิดอีกรุ่นที่แตกต่างออกไป — 4.1% บนเอนด์พอยต์หนึ่ง, 10.1% บนอีกเอนด์พอยต์หนึ่ง

• StepAudio 2.5 ASR รุ่นก่อนหน้าของ StepFun — 4.7%

สองบรรทัดสุดท้ายเป็นสิ่งที่มีประโยชน์ที่สุดบนบอร์ด และไม่ได้เกี่ยวกับ StepFun เลย น้ำหนัก Whisper แบบเปิดชุดเดียวกันได้คะแนน 4.1% บนปลายทางหนึ่ง และ 10.1% บนอีกปลายทางหนึ่ง นั่นคือส่วนต่าง 6 จุดบนพารามิเตอร์ที่เหมือนกัน ซึ่งเกิดจากความแตกต่างในการให้บริการทั้งหมด: กลยุทธ์การแบ่งก้อน ฮาร์ดแวร์ การกำหนดค่าการถอดรหัส และวิธีที่โฮสต์แต่ละแห่งจัดการกับเสียงที่ยาวเกินขีดจำกัดภายในของตน เชิงอรรถของบอร์ดเองก็กล่าวไว้เช่นนั้น โดยระบุว่าสำหรับชุดข้อมูลหนึ่งของบอร์ด โมเดลบางตัวถูกแบ่งเสียงออกเป็นก้อนประมาณเก้านาที และบางตัวแบ่งเป็นประมาณสามสิบวินาที เนื่องจากข้อจำกัดด้านเวลา

ซึ่งหมายความว่าการเปรียบเทียบ "StepAudio 3 ASR vs Whisper Large v3 Turbo" จริง ๆ แล้วคือการเปรียบเทียบสองอย่างที่ซ้อนกันอยู่ นั่นคือตัวโมเดลเทียบกับเวต และตัวโมเดลเทียบกับเอนด์พอยต์ใดก็ตามที่คุณบังเอิญใช้ทดสอบ อย่างหลังนี้แปรเปลี่ยนไปมากกว่าอย่างแรก

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

ช่องว่างความแม่นยำนั้นมาจากไหน และควรเชื่อถือได้มากน้อยเพียงใด

อัตราความผิดพลาดระดับคำที่ต่างกันสามจุดถือเป็นช่องว่างที่ใหญ่ในสาขาซึ่งระบบห้าอันดับแรกมีคะแนนห่างกันไม่เกิน 0.6 จุด นอกจากนี้ยังเป็นตัวเลขเดียวในการเปรียบเทียบนี้ที่บุคคลที่สามเป็นผู้วัด และมาพร้อมข้อควรระวังจริงที่ส่งผลได้ทั้งสองทาง

ข้อโต้แย้งต่อ StepAudio 3 ASR: ตัวเลขดังกล่าวเป็นดัชนีแบบผสม และการผสมนี้มี AA-AgentTalk อยู่ 50% ซึ่งเป็นชุดข้อมูลบทสนทนาของเอเจนต์ โมเดลที่ปรับแต่งสำหรับการถอดเสียงเฉพาะโดเมนโดยมี LLM ต่อพ่วงเพื่อให้บริบทนั้นเหมาะอย่างยิ่งกับรูปแบบเสียงแบบนั้น หากถ่วงน้ำหนักดัชนีใหม่ไปทางเสียงอ่านหรือข่าวออกอากาศ การจัดอันดับอาจแน่นขึ้น นอกจากนี้ยังไม่มีรายงานทางเทคนิคที่เผยแพร่สำหรับโมเดล ASR ไม่มีชุดทดสอบที่เปิดเผย ไม่มีการกำหนดค่าการถอดรหัส และไม่มีโปรโตคอลที่ทำซ้ำได้จากใครก็ตามนอก StepFun

เมื่อเทียบกับ Whisper Large v3 Turbo: ตัวเลข 4.6% เป็นตัวเลขของโฮสต์เอนด์พอยต์หนึ่งราย ไม่ใช่คุณสมบัติของโมเดล เวตนั้นตายตัวและเปิดเผยต่อสาธารณะ ส่วนคะแนนไม่ใช่ ทีมที่รันเวตชุดเดียวกันอย่างระมัดระวัง ด้วยการแบ่งชังก์ที่เหมาะกับโดเมนและการตั้งค่าดีโคดเดอร์ที่ดี สามารถทำคะแนนได้ดีกว่าอย่างมีนัยสำคัญเมื่อเทียบกับแถวบนลีดเดอร์บอร์ด และทีมที่รันอย่างไม่ระมัดระวังอาจทำคะแนนได้แย่กว่า 10.1% ที่รุ่น open-weights อีกรุ่นหนึ่งรายงานไว้ สรุปตามจริงก็คือ ฝั่ง open-weights ของการเปรียบเทียบนี้มีพื้นล่างที่วัดได้ และมีเพดานที่ต้องทำเองให้ได้

สิ่งที่ขาดไปคือตัวเลขที่จะชี้ขาด: การทดลองที่ตีพิมพ์แล้วซึ่งใช้ทั้งสองระบบ ชุดเสียงชุดเดียวกัน และโปรโตคอลถอดรหัสชุดเดียวกัน ยังไม่มีใครทำการทดลองนี้ และจนกว่าจะมีคนทำ “1.7% vs 4.6%” ก็เป็นเพียงการเปรียบเทียบผลการวัดสองครั้งที่ทำภายใต้เงื่อนไขต่างกัน มากกว่าจะเป็นการวัดสองระบบเทียบกันโดยตรง

อีกสี่มิติที่ Whisper ชนะมากกว่า

ความแม่นยำคือมิติที่ StepFun ชนะ ส่วนรายการที่เหลือ โมเดล open-weights ตามไม่ติดเลย และสิ่งเหล่านี้คือสิ่งที่ตัดสินว่าการนำไปใช้งานจริงจะเป็นไปได้หรือไม่เลย:

• สัญญาอนุญาตและน้ำหนักโมเดล — น้ำหนักโมเดลแบบเปิดที่ใช้สัญญาอนุญาต MIT ขนาด 809M พารามิเตอร์ เทียบกับ API แบบโฮสต์ที่ไม่มีการเผยแพร่น้ำหนักโมเดลในระดับใดเลย

• การติดตั้งใช้งาน — โฮสต์เอง, ภายในองค์กร, แบบแยกจากเครือข่ายภายนอก (air-gapped), หรือผ่านแพลตฟอร์มเชิงพาณิชย์หลายสิบแห่งใดก็ได้ เทียบกับ API ของ StepFun เท่านั้น

• ต้นทุนขั้นต่ำ — ประมาณ $0.67 ต่อ 1,000 นาที บนเอนด์พอยต์แบบโฮสต์หนึ่งแห่ง และต่ำกว่านั้นอีกหากคุณรันเอง เทียบกับประมาณ $6.67 ต่อ 1,000 นาที ตามอัตราที่ผู้ขายเผยแพร่

• ที่ตั้งข้อมูล — เสียงจะไม่ออกจากโครงสร้างพื้นฐานที่คุณควบคุม เทียบกับเสียงที่ส่งไปยังปลายทางของบุคคลที่สาม

• ความเสี่ยงด้านการผสานรวม — โมเดลไม่สามารถถูกถอนออก ตั้งราคาใหม่ หรือเลิกใช้งานระหว่างที่คุณใช้งานอยู่ได้ เพราะคุณถือน้ำหนักของโมเดลไว้เอง ต่างจากอัตราแบบโฮสต์ที่เปลี่ยนแปลงได้ตามรายการราคา

• พฤติกรรมการทำงานกับเสียงความยาวมาก — การแบ่งเป็นชิ้น (chunking) ขึ้นอยู่กับการตัดสินใจของคุณ และสามารถปรับแต่งได้ตามแต่ละไฟล์ เทียบกับสิ่งที่เอนด์พอยต์ของผู้ให้บริการทำอยู่ภายใน ซึ่งไม่มีเอกสารระบุไว้

ช่องว่างราคานั้นอยู่ที่ประมาณสิบต่อหนึ่งเมื่อเทียบกับปลายทาง Whisper ที่ถูกกว่า และมันเป็นภาพสะท้อนกลับกันของสิ่งที่เกิดขึ้นภายในสายผลิตภัณฑ์ของ StepFun เอง: โมเดลที่รุ่นนี้เข้ามาแทนที่ คือ StepAudio 2.5 ASR ตั้งราคาไว้ที่ 0.15 หยวนต่อชั่วโมง และระดับปัจจุบันตั้งราคาไว้ที่ 2.8 StepFun ปรับขึ้นอัตราค่าถอดเสียงประมาณสิบเก้าเท่าเพื่อแลกกับความแม่นยำ ซึ่งทำให้มันอยู่ในตลาดที่แตกต่างจากโมเดลน้ำหนักเปิดที่โฮสต์เอง มากกว่าที่จะเป็นเวอร์ชันที่มีราคาแพงกว่าของโมเดลนั้น

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

คุณควรเลือกอันไหน

การแยกนี้อ่านง่ายกว่าการเปรียบเทียบแบบตัวต่อตัวส่วนใหญ่:

• เลือก Whisper Large v3 Turbo หากเสียงเป็นเสียงทั่วไป ปริมาณสูง ข้อมูลไม่สามารถออกจากโครงสร้างพื้นฐานของคุณได้ หรือคุณต้องการให้การปรับใช้เป็นแบบถาวรและราคาคงที่ ใบอนุญาต MIT หมายความว่าคุณสามารถย้อนกลับการตัดสินใจได้ และไม่มีใครสามารถเรียกคืนมันได้

• เลือกใช้ StepAudio 3 ASR หากไฟล์เสียงนั้นยากจริง ๆ — มีสำเนียง พูดกระซิบ ร้องเพลง หรือมีดนตรีประกอบ underneath — หรือหากโดเมนนั้นเป็นหนึ่งในห้าโดเมนที่ StepFun ปรับแต่งมาเพื่อ นั่นคือสิ่งที่คุณได้มาจากการจ่ายในราคาพรีเมียม และกับไฟล์เสียงแบบนั้น ช่องว่างความแม่นยำสามจุดคือความแตกต่างระหว่างทรานสคริปต์ที่ใช้งานได้ กับการต้องกลับมาแก้ไขด้วยมืออีกรอบ

• อย่าเลือกใช้เส้นทางใดเส้นทางหนึ่งแต่เพียงอย่างเดียว หากคุณไม่รู้ว่าเสียงของคุณเป็นแบบใด ต้นทุนของการเลือกผิดนั้นไม่สมมาตร: เส้นทางแบบ open-weights ทดสอบบนฮาร์ดแวร์ของคุณเองได้ในราคาค่า GPU หนึ่งชั่วโมง ส่วนเส้นทางแบบโฮสต์นั้นลองได้ฟรี แต่ผูกมัดคุณกับอัตราค่าบริการที่คุณควบคุมไม่ได้

เหตุผลสนับสนุนการใช้แบบไฮบริดในกรณีนี้แข็งแรงกว่าในการเปรียบเทียบส่วนใหญ่ และเหตุผลก็คือการกระจายของเอนด์พอยต์บนบอร์ดจัดอันดับ เนื่องจากเวตของ Whisper ชุดเดียวกันทำคะแนนได้ตั้งแต่ 4.1% ถึง 10.1% ขึ้นอยู่กับว่าใครเป็นผู้ให้บริการ แนวทางที่ปฏิบัติได้จริงคือการกำหนดเส้นทางแบบ open-weights ให้วิ่งผ่านโฮสต์มากกว่าหนึ่งราย แทนที่จะยึดติดกับรายเดียว ซึ่งนั่นคือสิ่งที่ automatic failover มอบให้คุณ และมันเป็นกลไกเดียวกันกับที่ช่วยให้คุณวางโมเดลแบบโฮสต์ไว้หน้าเส้นทางโปรดักชัน โดยไม่ต้องเดิมพันเส้นทางนั้นกับมัน

สิ่งนี้เข้ากับสแตกอย่างไร และสิ่งที่เราให้บริการและไม่ให้บริการ

ไม่ว่าคุณจะเลือกอะไรสำหรับการถอดเสียง ข้อความถอดเสียงก็ต้องไปที่ใดที่หนึ่ง ไม่ว่าจะเป็นตัวสรุป การสกัดแบบมีโครงสร้าง การตรวจสอบด้านการปฏิบัติตามกฎระเบียบ หรือดัชนีการค้นหา — การเรียกเหล่านั้นไปลงที่โมเดลข้อความทั่วไป และเป็นส่วนของค่าใช้จ่ายที่ขยายตามการใช้งาน ไม่ใช่ตามนาทีเสียง โมเดลเรียลไทม์ของ StepFun เองโฆษณาความสามารถด้านการเรียกใช้เครื่องมือและการทำงานแบบอะซิงโครนัสของงานที่ใช้เวลานาน ซึ่งหมายความว่าแม้แต่ชั้นเสียงก็ส่งงานไปยังสิ่งที่ไม่ใช่โมเดลเสียงอยู่ตลอดเวลา

เพื่อให้ชัดเจนในเรื่องขอบเขต เพราะเป็นเรื่องง่ายที่จะทำให้เข้าใจเป็นอย่างอื่น ทั้ง StepAudio 3 ASR และ Whisper Large v3 Turbo ต่างก็ไม่ได้อยู่บน OrcaRouter StepAudio เข้าถึงได้ผ่าน API ของ StepFun เอง ส่วนน้ำหนักโมเดล Whisper นั้นเป็นของคุณที่จะรันเองหรือนำไปวางบนแพลตฟอร์มโฮสติ้ง สิ่งที่ OrcaRouter ให้บริการคือเลเยอร์การมอบหมายงานที่ทรานสคริปต์ส่งต่อไป โมเดลข้อความเกือบ 200 โมเดลภายใต้ API เดียว พร้อมด้วย การสลับใช้งานอัตโนมัติเมื่อเกิดข้อขัดข้อง เพื่อให้การเรียกใช้ปลายทางไม่ล้มตามผู้ให้บริการรายเดียว, DSL สำหรับการกำหนดเส้นทางที่ประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียว และการหลอมรวมโมเดลเมื่อคำตัดสินของโมเดลเดียวไม่เพียงพอ ในกรณีที่ผู้ให้บริการประกาศราคา ราคาตามรายการนั้นจะถูกส่งผ่านโดยไม่บวกเพิ่ม ดังนั้นการเปลี่ยนแปลงราคาจะไปถึงบิลของคุณในวันที่ประกาศ — ซึ่งเมื่อพิจารณาว่าการเปรียบเทียบนี้มีผู้จำหน่ายรายหนึ่งที่ขึ้นอัตราค่าถอดเสียงถึงสิบเก้าเท่าในการเปิดตัวครั้งเดียว นั่นจึงไม่ใช่ประโยชน์แบบสมมุติ

ถ้าคุณกำลังจะใช้เงินจริงกับโจทย์เรื่องความแม่นยำ ลำดับขั้นตอนที่ประหยัดคือแบบนี้: รันโมเดลน้ำหนักเปิดบนเสียงของคุณเองก่อน เพราะคุณทำได้ และเพราะตัวเลขที่คุณได้จะเกี่ยวข้องกับคุณมากกว่าตัวเลขจากบอร์ดจัดอันดับใด ๆ จากนั้นค่อยตัดสินว่าช่องว่างที่ยังเหลืออยู่คุ้มค่ากับอัตราที่แพงกว่าสิบเท่าหรือไม่ ทีมส่วนใหญ่จะพบว่ามันคุ้มสำหรับทราฟฟิกเพียงบางส่วน และไม่คุ้มสำหรับส่วนที่เหลือ และนั่นเป็นปัญหาเรื่องการจัดเส้นทาง มากกว่าการเลือกโมเดล

อะไรจะยุติเรื่องนี้ได้

การทดสอบที่ตีพิมพ์แล้วหนึ่งครั้ง ทั้งสองระบบ ไฟล์เสียงเดียวกัน โปรโตคอลการถอดรหัสเดียวกัน การแบ่งที่ตรงไปตรงมาระหว่างเสียงอ่านจากข้อความ เสียงสนทนา และกรณีที่ยากซึ่ง StepFun อ้างว่าปรับจูนมาเพื่อ จนกว่าสิ่งนั้นจะมีอยู่จริง การเปรียบเทียบนี้ก็คือดัชนีของบุคคลที่สามในด้านหนึ่ง และชุดน้ำหนักแบบเปิดที่มีคะแนนแปรผันได้ในอีกด้านหนึ่ง และวิธีตีความอย่างมีความรับผิดชอบเพียงวิธีเดียวคือมองมันเป็นจุดเริ่มต้นมากกว่าคำตอบ

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube