การ์ดชื่อเรื่องหลักที่สร้างขึ้น พร้อมพาดหัวว่า 'StepAudio 3 ASR vs StepAudio 3' และคำบรรยายรองว่า 'อันหนึ่งคือโมเดล ส่วนอีกอันคือห้าผลิตภัณฑ์ที่ใช้ชื่อเดียว' เหนือส่วนท้ายว่า 'ตัวเลขของ StepFun ตามที่เผยแพร่เมื่อเดือนกันยายน 2026'
Guides & Insights

StepAudio 3 ASR กับ StepAudio 3: ไม่มีโมเดลที่ใช้ชื่อนั้น

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ค้นหา StepAudio 3 แล้วคุณจะพบกับตระกูลผลิตภัณฑ์ ไม่ใช่โมเดลเดียว การเปิดตัวผลิตภัณฑ์ด้านเสียงของ StepFun เมื่อวันที่ 15 กันยายน 2026 ได้เปิดตัวห้าผลิตภัณฑ์ภายใต้ชื่อนั้น ได้แก่ Realtime, ASR, text-to-speech, Gen และ Music และผลิตภัณฑ์ถอดความในกลุ่มนั้นอย่าง StepAudio 3 ASR ก็คือตัวที่ไต่ขึ้นสู่กระดานจัดอันดับตั้งแต่นั้นเป็นต้นมา ระดับที่เอกสารของ StepFun เองเรียกว่าโมเดล ASR ที่ใหญ่ที่สุดเท่าที่เคยมีมาคือ StepAudio 3 ASR Max และคู่หูสายสนทนาที่ใช้โครงสร้างหลักร่วมกันคือ StepAudio 3 Realtime หากคุณกำลังพยายามเปรียบเทียบ "StepAudio 3 ASR" กับ "StepAudio 3" คุณกำลังเปรียบเทียบผลิตภัณฑ์กับสายผลิตภัณฑ์ และคำตอบนั้นขึ้นอยู่กับว่าคุณหมายถึงตัวไหนในสามตัวนั้นจริง ๆ

หน้านี้ช่วยคลี่คลายเรื่องนั้นได้ ไม่ใช่การเปรียบเทียบเชิงการตลาด แต่เป็นการขจัดความกำกวมที่คุณจำเป็นต้องมีก่อนจะอ่านเอกสารสเปกของ StepAudio 3 ฉบับใดได้อย่างถูกต้อง เพราะชื่อทั้งสามชื่อข้างต้นมีราคา ปลายทาง และโหมดความล้มเหลวที่แตกต่างกัน

ทำไมชื่อจึงคลุมเครือ

StepFun เปิดตัวชุดผลิตภัณฑ์ระบบเสียงทั้งหมดในวันเดียว และธรรมเนียมการตั้งชื่อทำให้ชื่อตระกูลกลายเป็นรากของชื่อผลิตภัณฑ์ทุกตัว แบบนั้นดูเรียบร้อยบนสไลด์เปิดตัว แต่เก้ ๆ กัง ๆ ในทุกที่อื่น นั่นหมายความว่าการค้นหาชื่อตระกูลจะได้ผลลัพธ์ที่ปนกันจากผลิตภัณฑ์ห้าตัวที่แตกต่างกัน และแถวเบนช์มาร์กที่ติดป้ายว่า "StepAudio 3" ก็มีความเป็นไปได้ว่าจะเป็นผลิตภัณฑ์ใดก็ได้ในห้าตัวนั้น

ผลที่ตามมาในทางปฏิบัติก็คือ คุณไม่อาจบอกได้จากพาดหัวข่าวว่าสิ่งใดถูกวัด โพสต์ที่บอกว่า "StepAudio 3 ครองอันดับหนึ่งบนลีดเดอร์บอร์ดการถอดเสียง" กำลังกล่าวถึง StepAudio 3 ASR โพสต์ที่บอกว่า "StepAudio 3 ชนะในด้านพลวัตการสนทนา" กำลังกล่าวถึง StepAudio 3 Realtime ทั้งสองข้อเป็นจริง พวกมันเป็นผลิตภัณฑ์ที่แตกต่างกัน และใช้แทนกันไม่ได้

มีความกำกวมประการที่สองภายในสาย ASR โดยเฉพาะ เอกสารของ StepFun กล่าวถึงระดับ ASR Max ว่าเป็นโมเดล ASR ที่ใหญ่ที่สุดจนถึงปัจจุบัน พร้อมราคาของตัวเองและ endpoint ของตัวเอง ในขณะที่แถวบน leaderboard สาธารณะใช้ป้ายชื่อที่เรียบง่ายกว่า การหาว่าสิ่งเหล่านั้นเป็น SKU เดียวที่ใช้สองชื่อ หรือเป็นสอง SKU เป็นสิ่งที่มีประโยชน์ที่สุดที่หน้านี้ทำได้ และส่วนถัดไปก็ทำเช่นนั้น

สามสิ่งที่ชื่อนั้นสามารถหมายถึง

StepAudio 3 ASR — ผลิตภัณฑ์ถอดเสียง เป็นเอนด์พอยต์แบบสตรีมมิงที่คืนข้อความแบบเพิ่มขึ้นเรื่อย ๆ ขณะถอดรหัส และคืนบทถอดเสียงฉบับสมบูรณ์เมื่อสิ้นสุด StepFun อธิบายว่าเป็นเทคโนโลยีถอดเสียงที่แนบโมเดลภาษามาเพื่อช่วยเรื่องบริบท ปรับจูนมาสำหรับเสียงด้านการแพทย์ กฎหมาย การเงิน ยานยนต์ และการเขียนโปรแกรม รวมถึงอินพุตที่ยาก ๆ อย่างเสียงกระซิบ เสียงพูดเร็ว เสียงพูดที่เชื่อมติดกัน การร้องเพลง และเพลงบรรเลงพื้นหลัง นี่คือโมเดลที่ทำอัตราความผิดพลาดระดับคำได้ 1.7% ในดัชนี AA-WER ของ Artificial Analysis สำหรับการแปลงเสียงเป็นข้อความแบบไม่สตรีมมิง

StepAudio 3 ASR Max — รุ่นที่เอกสารของ StepFun ระบุว่าเป็นโมเดล ASR ที่ใหญ่ที่สุดของบริษัทจนถึงปัจจุบัน โดยมีอัตราตามรายการที่ประกาศไว้ที่ 2.8 หยวนต่อชั่วโมง ไม่ใช่ตัวถอดเสียงราคาถูก แต่เป็นสุดยอดของสายผลิตภัณฑ์ ASR

StepAudio 3 Realtime — โมเดลสนทนาแบบฟูลดูเพล็กซ์ ซึ่งประมวลผลเหตุผลจากเสียงพูดโดยตรง แทนที่จะใช้กระบวนการถอดเสียงแล้วจึงประมวลผลเหตุผล และการถอดเสียงเป็นเพียงผลพลอยได้จากกระบวนการนั้น มันไม่ใช่ผลิตภัณฑ์ ASR และความแม่นยำในงานถอดเสียงก็ไม่ใช่สิ่งที่โมเดลนี้ถูกปรับจูนมาเพื่อ

ทุกสิ่งอื่นในตระกูลนี้ — TTS, Gen, Music — เป็นงานที่แตกต่างไปโดยสิ้นเชิง และไม่ควรปรากฏในการเปรียบเทียบการถอดเสียงเลย

ASR และ ASR Max เป็นโมเดลเดียวกันหรือไม่

หลักฐานชี้ไปที่คำตอบว่าใช่ และการตรวจสอบก็เป็นการคำนวณทางคณิตศาสตร์ StepFun ระบุระดับ ASR Max ไว้ที่ 2.8 หยวนต่อชั่วโมง เมื่อแปลงที่ประมาณ 7.1 หยวนต่อดอลลาร์ จะได้ประมาณ $0.39 ต่อชั่วโมง หรือประมาณ $6.6 ต่อ 1,000 นาที Artificial Analysis ระบุโมเดลนี้บนลีดเดอร์บอร์ดที่ $6.67 ต่อ 1,000 นาที ตัวเลขที่เผยแพร่แยกกันสองแหล่ง แหล่งหนึ่งจากรายการราคาของผู้ขาย และอีกแหล่งจากกระดานของบุคคลที่สาม ต่างกันไม่ถึงหนึ่งเซนต์ นั่นคือสิ่งที่คุณคาดว่าจะเห็นได้ หากแถวบนลีดเดอร์บอร์ดและอัตราตามรายการ ASR Max อธิบายถึง SKU เดียวกัน

ควรพูดให้ชัดเจนว่าสิ่งนั้นพิสูจน์อะไรและไม่ได้พิสูจน์อะไร มันพิสูจน์ว่าแกนราคาของลีดเดอร์บอร์ดกับตารางราคาของผู้ให้บริการกำลังอธิบายถึงผลิตภัณฑ์เดียวกันในราคาเดียวกัน แต่มันไม่ได้พิสูจน์ว่า 1.7% ของลีดเดอร์บอร์ดถูกวัดบนปลายทางที่คุณจะเรียกใช้จริง เพราะบอร์ดไม่เผยแพร่การตั้งค่าการถอดรหัสหรือปลายทางที่มันเรียกไป ดังนั้น: ผลิตภัณฑ์เดียวกัน เป็นไปได้สูงมาก; เงื่อนไขการวัดเดียวกัน ยังไม่ได้รับการยืนยัน

สิ่งที่แน่นอนคือการก้าวกระโดดข้ามรุ่นภายในสายผลิตภัณฑ์นี้ StepAudio 2.5 ASR อยู่ที่ 4.7% บนบอร์ดเดียวกันในราคา 0.15 หยวนต่อชั่วโมง ระดับปัจจุบันอยู่ที่ 1.7% ในราคา 2.8 หยวนต่อชั่วโมง นั่นคือการลดอัตราความผิดพลาดระดับคำลง 64% โดยแลกกับราคาที่สูงขึ้นราวสิบเก้าเท่า — เป็นการแลกเปลี่ยนที่คมชัดที่สุดในตระกูลนี้ และเป็นสิ่งที่ตัดสินว่าการอัปเกรดนั้นคุ้มค่าหรือไม่

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

มิติที่แตกต่างกันจริง ๆ

เมื่อการตั้งชื่อเรียบร้อยแล้ว การเปรียบเทียบจะย่นลงเหลือเพียงรายการสั้น ๆ สิ่งเหล่านี้คือสิ่งที่เปลี่ยนการตัดสินใจได้:

• ความแม่นยำ — StepAudio 3 ASR ที่ 1.7% AA-WER แบบไม่สตรีมมิ่ง เทียบกับ StepAudio 2.5 ASR ที่ 4.7% บนบอร์ดเดียวกัน วัดโดย Artificial Analysis ไม่ใช่โดย StepFun

• ราคา — 2.8 หยวนต่อชั่วโมง เทียบกับ 0.15 หยวนต่อชั่วโมง ทั้งคู่เป็นอัตราที่ผู้ขายประกาศไว้ และเป็นอัตราปัจจุบันทั้งสองราย คิดเป็นประมาณ 19 เท่า

• เวท — API แบบโฮสต์เท่านั้นสำหรับทั้งคู่ ไม่มีเวทแบบเปิดที่ใดในตระกูล ไม่มีเส้นทางติดตั้งภายในองค์กร ไม่มีตัวเลือกการโฮสต์เองในทุกระดับ

• รูปแบบเอนด์พอยต์ — เอนด์พอยต์ถอดเสียงแบบสตรีมมิ่งเพียงจุดเดียวที่ส่งคืนข้อความแบบเพิ่มทีละส่วนและข้อความสุดท้าย เทียบกับรูปแบบเดียวกันในรุ่นก่อนหน้า ไม่มีอะไรเกี่ยวกับโมเดลการผสานรวมที่เปลี่ยนแปลง ดังนั้นการย้ายระบบจึงเป็นการสลับตัวระบุโมเดลมากกว่าการเขียนใหม่

• การปรับจูนสำหรับเสียงที่ยาก — StepAudio 3 ASR ถูกปรับจูนอย่างชัดเจนสำหรับคำพูดที่กระซิบ พูดเร็ว พูดต่อเนื่องเชื่อมกัน และการร้องเพลง รวมถึงเสียงที่มีดนตรีประกอบอยู่ด้านหลัง การปรับจูนนั้นคือตัวผลิตภัณฑ์ ส่วนรุ่นก่อนหน้าไม่ได้ถูกสร้างมาเพื่อสิ่งนี้

• การเปลี่ยนแปลงในแต่ละโดเมนตามที่ผู้ขายอ้าง — StepFun รายงานว่าภาษาจีนลดลง 9.3% ภาษาอังกฤษลดลง 25.0% ภาษาถิ่นลดลง 22.3% โดเมนเฉพาะทางลดลง 42.1% และการสลับภาษาลดลง 27.9% เมื่อเทียบรุ่นต่อรุ่น เป็นข้อมูลที่ผู้ขายรายงานเองและยังไม่ถูกทำซ้ำ จึงควรถือเป็นข้อมูลเชิงทิศทางเท่านั้น

สิ่งที่ขาดไปอย่างเห็นได้ชัดจากรายการนั้น ได้แก่ ความยาวบริบท การรองรับรูปแบบเสียง ระยะเวลาเสียงสูงสุด และตัวระบุโมเดล เอกสารสาธารณะของ StepFun สำหรับโมเดลนี้ไม่ได้ระบุสิ่งเหล่านี้ และใครก็ตามที่อ้างตัวเลขเหล่านั้นกำลังอ้างอิงสิ่งอื่น

ASR กับ Realtime คือการเปรียบเทียบที่ผู้คนต้องการจริง ๆ

หากคุณกำลังเลือกหว่างผลิตภัณฑ์ถอดเสียง ไม่ใช่ระหว่างเจเนอเรชัน คู่เปรียบเทียบที่น่าสนใจไม่ใช่ ASR กับ ASR Max — แต่เป็น ASR กับ Realtime เอกสารทางเทคนิคของ StepFun เองระบุว่าทั้งสองใช้ขั้นตอน pretraining และ midtraining ร่วมกัน และแตกต่างกันเฉพาะในช่วง supervised fine-tuning เท่านั้น ฐานเดียวกัน ไฟน์ทูนต่างกัน ผลิตภัณฑ์จึงต่างกัน

ข้อเท็จจริงข้อเดียวนั้นมีการตีความในทางปฏิบัติ อัตราความผิดพลาดระดับคำที่ 1.7% เป็นคุณสมบัติของการไฟน์ทูน ASR ไม่ใช่คำสัญญาเกี่ยวกับโมเดลแบบเรียลไทม์ ซึ่งปรับให้เหมาะกับการผลัดกันพูด การจัดการการขัดจังหวะ และการให้เหตุผลจากเสียงพูด มากกว่าความแม่นยำของบทถอดความ หากสถาปัตยกรรมของคุณถอดความโดยเป็นผลพลอยได้จากการสนทนาแบบสด คุณไม่ได้กำลังซื้อ 1.7% นั้น — คุณกำลังซื้อโมเดลสนทนาที่บังเอิญส่งข้อความออกมา

ในทางกลับกันก็เป็นจริงเช่นกันและชัดเจนน้อยกว่า: เนื่องจากพวกมันใช้แบ็กโบนร่วมกัน โมเดล ASR จึงไม่ใช่โมเดลผู้เชี่ยวชาญขนาดเล็กที่ถูกนำมาต่อพ่วงเข้ากับตระกูลนี้ มันเป็นระบบขนาดเดียวกัน แต่ถูกปรับละเอียดมาแตกต่างกัน นั่นคือเหตุผลว่าทำไมอัตราของ ASR จึงใกล้เคียงกับส่วนที่เหลือของตระกูล แทนที่จะอยู่ใกล้ปลายถูกราคาของตลาด

จะทำอย่างไรกับสิ่งนี้ถ้าคุณกำลังจะเลือกอันหนึ่ง

สามคำถามก็ตัดสินได้แล้ว คุณต้องการทรานสคริปต์ หรือคุณต้องการบทสนทนา? ถ้าเป็นทรานสคริปต์ StepAudio 3 ASR คือผลิตภัณฑ์ และชื่อตระกูลก็เป็นเพียงเสียงรบกวน ถ้าเป็นบทสนทนา คุณต้องการ StepAudio 3 Realtime และคุณไม่ควรอ่านเบนช์มาร์ก ASR เลย และถ้าคุณต้องการทรานสคริปต์ของเสียงที่ยากอย่างแท้จริง — ที่มีสำเนียง กระซิบ ร้องเพลง หรือมีดนตรีประกอบ — ค่าพรีเมียม 19 เท่าก็คือราคาของระดับที่ปรับแต่งมาเพื่อสิ่งนั้น และการทดสอบที่ตรงไปตรงมาคือเสียงของคุณเอง ไม่ใช่ดัชนีแบบผสม

การตัดสินใจที่ทำให้ผิดพลาดได้ง่าย คือการมองว่าชั้นการถอดเสียงเป็นสิ่งที่ถาวร ไม่ว่าคุณจะเลือกอะไร ข้อความถอดเสียงก็เป็นเพียงข้อมูลนำเข้าของสิ่งอื่น — ตัวสรุป การสกัดข้อมูลแบบมีโครงสร้าง การตรวจสอบการปฏิบัติตามกฎเกณฑ์ ดัชนีสำหรับค้นหา — และการเรียกเหล่านั้นก็ไปตกที่โมเดลข้อความธรรมดา ๆ นั่นคือชั้นที่ขยายตามปริมาณการใช้งาน ไม่ใช่ตามจำนวนนาทีของเสียง และเป็นชั้นที่ควรค่าแก่การรักษาให้พกพาได้ตั้งแต่วันแรก OrcaRouter รวมโมเดลข้อความเกือบ 200 รุ่นไว้หลัง API เดียวพร้อมระบบสลับไปใช้ผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้อง, DSL สำหรับจัดเส้นทางที่ประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียว และการหลอมรวมโมเดล (model fusion) เมื่อการตัดสินใจของโมเดลเดียวไม่เพียงพอ ในกรณีที่ผู้ให้บริการประกาศอัตราค่าบริการ ราคาตามรายการนั้นจะถูกส่งผ่านโดยไม่บวกเพิ่มใด ๆ ดังนั้นเมื่อราคาฝั่งข้อความเปลี่ยนแปลง บิลของคุณจะสะท้อนการเปลี่ยนแปลงนั้นในวันที่ประกาศทันที

ขอชี้แจงขอบเขตให้ชัดเจน เนื่องจากหน้านี้พูดถึงตระกูลโมเดลที่เราไม่ได้ให้บริการ: ไม่มี endpoint ของ StepAudio 3 อยู่บน OrcaRouter โมเดลถอดเสียงและโมเดลเสียงนั้นเข้าถึงได้ผ่าน API ของ StepFun เอง สิ่งที่ OrcaRouter ให้บริการคือชั้นการให้เหตุผลที่อยู่ปลายน้ำของข้อความถอดเสียง ซึ่งเป็นจุดที่การตัดสินใจสลับเปลี่ยนทำได้ในต้นทุนต่ำ แต่การเลื่อนออกไปกลับมีต้นทุนสูง

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

สิ่งที่ยังไม่มีใครยุติ

การตั้งชื่อนั้นไขได้ แต่ข้ออ้างด้านประสิทธิภาพยังไขไม่ได้ ยังไม่มีรายงานทางเทคนิคที่เผยแพร่สำหรับโมเดล ASR นี้ ไม่มีชุดทดสอบที่เปิดให้ใช้ ไม่มีการกำหนดค่าการถอดรหัส และไม่มีโปรโตคอลที่ทำซ้ำได้จากใครก็ตามนอก StepFun และการเปรียบเทียบของผู้ขายเองก็เทียบกับผลิตภัณฑ์ ASR จีนรายอื่น ๆ มากกว่าที่จะเทียบกับโมเดลเจ้าตลาดแบบเปิดน้ำหนัก ส่วน 1.7% เป็นการวัดจริงโดยบุคคลที่สามบนดัชนีผสมสามชุดข้อมูล ทุกอย่างอื่นเกี่ยวกับโมเดลนี้เป็นคำกล่าวอ้างของผู้ขาย

มีสองสิ่งที่จะเปลี่ยนภาพรวมได้ การเปรียบเทียบแบบตัวต่อตัวกับ Whisper Large v3 Turbo บนเสียงเดียวกัน ซึ่งยังไม่มีใครเผยแพร่ และอัตราค่าใช้จ่ายสำหรับรุ่นอื่น ๆ ที่เหลือในตระกูลนี้ — สี่ในห้ารุ่นของ StepAudio 3 ยังอยู่ในราคาช่วงทดลองใช้ฟรีแบบจำกัดเวลา ณ ตอนเปิดตัว และมีเพียงการถอดเสียงและการสังเคราะห์เสียงเท่านั้นที่มีการเผยแพร่อัตราค่าใช้จ่าย ซึ่งหมายความว่ารายการราคาที่คุณอ่านได้ในวันนี้ครอบคลุมเพียงสองในห้าผลิตภัณฑ์

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

นั่นคือเลเยอร์ที่ขยายตามปริมาณการใช้งาน ไม่ใช่ตามนาทีของเสียง และเป็นเลเยอร์ที่คุ้มค่าที่จะทำให้พอร์ตได้ตั้งแต่เริ่มต้น การสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้อง, ภาษาจำเพาะสำหรับการจัดเส้นทาง (DSL) ที่ประกอบหลายอย่างเข้าด้วยกันเป็นการเรียกครั้งเดียว และการหลอมรวมโมเดลเมื่อดุลยพินิจของโมเดลเดียวไม่เพียงพอ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube