
StepAudio 3 ASR กับ StepAudio 3: ไม่มีโมเดลที่ใช้ชื่อนั้น
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ค้นหา StepAudio 3 แล้วคุณจะพบกับตระกูลผลิตภัณฑ์ ไม่ใช่โมเดลเดียว การเปิดตัวผลิตภัณฑ์ด้านเสียงของ StepFun เมื่อวันที่ 15 กันยายน 2026 ได้เปิดตัวห้าผลิตภัณฑ์ภายใต้ชื่อนั้น ได้แก่ Realtime, ASR, text-to-speech, Gen และ Music และผลิตภัณฑ์ถอดความในกลุ่มนั้นอย่าง StepAudio 3 ASR ก็คือตัวที่ไต่ขึ้นสู่กระดานจัดอันดับตั้งแต่นั้นเป็นต้นมา ระดับที่เอกสารของ StepFun เองเรียกว่าโมเดล ASR ที่ใหญ่ที่สุดเท่าที่เคยมีมาคือ StepAudio 3 ASR Max และคู่หูสายสนทนาที่ใช้โครงสร้างหลักร่วมกันคือ StepAudio 3 Realtime หากคุณกำลังพยายามเปรียบเทียบ "StepAudio 3 ASR" กับ "StepAudio 3" คุณกำลังเปรียบเทียบผลิตภัณฑ์กับสายผลิตภัณฑ์ และคำตอบนั้นขึ้นอยู่กับว่าคุณหมายถึงตัวไหนในสามตัวนั้นจริง ๆ
หน้านี้ช่วยคลี่คลายเรื่องนั้นได้ ไม่ใช่การเปรียบเทียบเชิงการตลาด แต่เป็นการขจัดความกำกวมที่คุณจำเป็นต้องมีก่อนจะอ่านเอกสารสเปกของ StepAudio 3 ฉบับใดได้อย่างถูกต้อง เพราะชื่อทั้งสามชื่อข้างต้นมีราคา ปลายทาง และโหมดความล้มเหลวที่แตกต่างกัน
ทำไมชื่อจึงคลุมเครือ
StepFun เปิดตัวชุดผลิตภัณฑ์ระบบเสียงทั้งหมดในวันเดียว และธรรมเนียมการตั้งชื่อทำให้ชื่อตระกูลกลายเป็นรากของชื่อผลิตภัณฑ์ทุกตัว แบบนั้นดูเรียบร้อยบนสไลด์เปิดตัว แต่เก้ ๆ กัง ๆ ในทุกที่อื่น นั่นหมายความว่าการค้นหาชื่อตระกูลจะได้ผลลัพธ์ที่ปนกันจากผลิตภัณฑ์ห้าตัวที่แตกต่างกัน และแถวเบนช์มาร์กที่ติดป้ายว่า "StepAudio 3" ก็มีความเป็นไปได้ว่าจะเป็นผลิตภัณฑ์ใดก็ได้ในห้าตัวนั้น
ผลที่ตามมาในทางปฏิบัติก็คือ คุณไม่อาจบอกได้จากพาดหัวข่าวว่าสิ่งใดถูกวัด โพสต์ที่บอกว่า "StepAudio 3 ครองอันดับหนึ่งบนลีดเดอร์บอร์ดการถอดเสียง" กำลังกล่าวถึง StepAudio 3 ASR โพสต์ที่บอกว่า "StepAudio 3 ชนะในด้านพลวัตการสนทนา" กำลังกล่าวถึง StepAudio 3 Realtime ทั้งสองข้อเป็นจริง พวกมันเป็นผลิตภัณฑ์ที่แตกต่างกัน และใช้แทนกันไม่ได้
มีความกำกวมประการที่สองภายในสาย ASR โดยเฉพาะ เอกสารของ StepFun กล่าวถึงระดับ ASR Max ว่าเป็นโมเดล ASR ที่ใหญ่ที่สุดจนถึงปัจจุบัน พร้อมราคาของตัวเองและ endpoint ของตัวเอง ในขณะที่แถวบน leaderboard สาธารณะใช้ป้ายชื่อที่เรียบง่ายกว่า การหาว่าสิ่งเหล่านั้นเป็น SKU เดียวที่ใช้สองชื่อ หรือเป็นสอง SKU เป็นสิ่งที่มีประโยชน์ที่สุดที่หน้านี้ทำได้ และส่วนถัดไปก็ทำเช่นนั้น
สามสิ่งที่ชื่อนั้นสามารถหมายถึง
• StepAudio 3 ASR — ผลิตภัณฑ์ถอดเสียง เป็นเอนด์พอยต์แบบสตรีมมิงที่คืนข้อความแบบเพิ่มขึ้นเรื่อย ๆ ขณะถอดรหัส และคืนบทถอดเสียงฉบับสมบูรณ์เมื่อสิ้นสุด StepFun อธิบายว่าเป็นเทคโนโลยีถอดเสียงที่แนบโมเดลภาษามาเพื่อช่วยเรื่องบริบท ปรับจูนมาสำหรับเสียงด้านการแพทย์ กฎหมาย การเงิน ยานยนต์ และการเขียนโปรแกรม รวมถึงอินพุตที่ยาก ๆ อย่างเสียงกระซิบ เสียงพูดเร็ว เสียงพูดที่เชื่อมติดกัน การร้องเพลง และเพลงบรรเลงพื้นหลัง นี่คือโมเดลที่ทำอัตราความผิดพลาดระดับคำได้ 1.7% ในดัชนี AA-WER ของ Artificial Analysis สำหรับการแปลงเสียงเป็นข้อความแบบไม่สตรีมมิง
• StepAudio 3 ASR Max — รุ่นที่เอกสารของ StepFun ระบุว่าเป็นโมเดล ASR ที่ใหญ่ที่สุดของบริษัทจนถึงปัจจุบัน โดยมีอัตราตามรายการที่ประกาศไว้ที่ 2.8 หยวนต่อชั่วโมง ไม่ใช่ตัวถอดเสียงราคาถูก แต่เป็นสุดยอดของสายผลิตภัณฑ์ ASR
• StepAudio 3 Realtime — โมเดลสนทนาแบบฟูลดูเพล็กซ์ ซึ่งประมวลผลเหตุผลจากเสียงพูดโดยตรง แทนที่จะใช้กระบวนการถอดเสียงแล้วจึงประมวลผลเหตุผล และการถอดเสียงเป็นเพียงผลพลอยได้จากกระบวนการนั้น มันไม่ใช่ผลิตภัณฑ์ ASR และความแม่นยำในงานถอดเสียงก็ไม่ใช่สิ่งที่โมเดลนี้ถูกปรับจูนมาเพื่อ
ทุกสิ่งอื่นในตระกูลนี้ — TTS, Gen, Music — เป็นงานที่แตกต่างไปโดยสิ้นเชิง และไม่ควรปรากฏในการเปรียบเทียบการถอดเสียงเลย
ASR และ ASR Max เป็นโมเดลเดียวกันหรือไม่
หลักฐานชี้ไปที่คำตอบว่าใช่ และการตรวจสอบก็เป็นการคำนวณทางคณิตศาสตร์ StepFun ระบุระดับ ASR Max ไว้ที่ 2.8 หยวนต่อชั่วโมง เมื่อแปลงที่ประมาณ 7.1 หยวนต่อดอลลาร์ จะได้ประมาณ $0.39 ต่อชั่วโมง หรือประมาณ $6.6 ต่อ 1,000 นาที Artificial Analysis ระบุโมเดลนี้บนลีดเดอร์บอร์ดที่ $6.67 ต่อ 1,000 นาที ตัวเลขที่เผยแพร่แยกกันสองแหล่ง แหล่งหนึ่งจากรายการราคาของผู้ขาย และอีกแหล่งจากกระดานของบุคคลที่สาม ต่างกันไม่ถึงหนึ่งเซนต์ นั่นคือสิ่งที่คุณคาดว่าจะเห็นได้ หากแถวบนลีดเดอร์บอร์ดและอัตราตามรายการ ASR Max อธิบายถึง SKU เดียวกัน
ควรพูดให้ชัดเจนว่าสิ่งนั้นพิสูจน์อะไรและไม่ได้พิสูจน์อะไร มันพิสูจน์ว่าแกนราคาของลีดเดอร์บอร์ดกับตารางราคาของผู้ให้บริการกำลังอธิบายถึงผลิตภัณฑ์เดียวกันในราคาเดียวกัน แต่มันไม่ได้พิสูจน์ว่า 1.7% ของลีดเดอร์บอร์ดถูกวัดบนปลายทางที่คุณจะเรียกใช้จริง เพราะบอร์ดไม่เผยแพร่การตั้งค่าการถอดรหัสหรือปลายทางที่มันเรียกไป ดังนั้น: ผลิตภัณฑ์เดียวกัน เป็นไปได้สูงมาก; เงื่อนไขการวัดเดียวกัน ยังไม่ได้รับการยืนยัน
สิ่งที่แน่นอนคือการก้าวกระโดดข้ามรุ่นภายในสายผลิตภัณฑ์นี้ StepAudio 2.5 ASR อยู่ที่ 4.7% บนบอร์ดเดียวกันในราคา 0.15 หยวนต่อชั่วโมง ระดับปัจจุบันอยู่ที่ 1.7% ในราคา 2.8 หยวนต่อชั่วโมง นั่นคือการลดอัตราความผิดพลาดระดับคำลง 64% โดยแลกกับราคาที่สูงขึ้นราวสิบเก้าเท่า — เป็นการแลกเปลี่ยนที่คมชัดที่สุดในตระกูลนี้ และเป็นสิ่งที่ตัดสินว่าการอัปเกรดนั้นคุ้มค่าหรือไม่

มิติที่แตกต่างกันจริง ๆ
เมื่อการตั้งชื่อเรียบร้อยแล้ว การเปรียบเทียบจะย่นลงเหลือเพียงรายการสั้น ๆ สิ่งเหล่านี้คือสิ่งที่เปลี่ยนการตัดสินใจได้:
• ความแม่นยำ — StepAudio 3 ASR ที่ 1.7% AA-WER แบบไม่สตรีมมิ่ง เทียบกับ StepAudio 2.5 ASR ที่ 4.7% บนบอร์ดเดียวกัน วัดโดย Artificial Analysis ไม่ใช่โดย StepFun
• ราคา — 2.8 หยวนต่อชั่วโมง เทียบกับ 0.15 หยวนต่อชั่วโมง ทั้งคู่เป็นอัตราที่ผู้ขายประกาศไว้ และเป็นอัตราปัจจุบันทั้งสองราย คิดเป็นประมาณ 19 เท่า
• เวท — API แบบโฮสต์เท่านั้นสำหรับทั้งคู่ ไม่มีเวทแบบเปิดที่ใดในตระกูล ไม่มีเส้นทางติดตั้งภายในองค์กร ไม่มีตัวเลือกการโฮสต์เองในทุกระดับ
• รูปแบบเอนด์พอยต์ — เอนด์พอยต์ถอดเสียงแบบสตรีมมิ่งเพียงจุดเดียวที่ส่งคืนข้อความแบบเพิ่มทีละส่วนและข้อความสุดท้าย เทียบกับรูปแบบเดียวกันในรุ่นก่อนหน้า ไม่มีอะไรเกี่ยวกับโมเดลการผสานรวมที่เปลี่ยนแปลง ดังนั้นการย้ายระบบจึงเป็นการสลับตัวระบุโมเดลมากกว่าการเขียนใหม่
• การปรับจูนสำหรับเสียงที่ยาก — StepAudio 3 ASR ถูกปรับจูนอย่างชัดเจนสำหรับคำพูดที่กระซิบ พูดเร็ว พูดต่อเนื่องเชื่อมกัน และการร้องเพลง รวมถึงเสียงที่มีดนตรีประกอบอยู่ด้านหลัง การปรับจูนนั้นคือตัวผลิตภัณฑ์ ส่วนรุ่นก่อนหน้าไม่ได้ถูกสร้างมาเพื่อสิ่งนี้
• การเปลี่ยนแปลงในแต่ละโดเมนตามที่ผู้ขายอ้าง — StepFun รายงานว่าภาษาจีนลดลง 9.3% ภาษาอังกฤษลดลง 25.0% ภาษาถิ่นลดลง 22.3% โดเมนเฉพาะทางลดลง 42.1% และการสลับภาษาลดลง 27.9% เมื่อเทียบรุ่นต่อรุ่น เป็นข้อมูลที่ผู้ขายรายงานเองและยังไม่ถูกทำซ้ำ จึงควรถือเป็นข้อมูลเชิงทิศทางเท่านั้น
สิ่งที่ขาดไปอย่างเห็นได้ชัดจากรายการนั้น ได้แก่ ความยาวบริบท การรองรับรูปแบบเสียง ระยะเวลาเสียงสูงสุด และตัวระบุโมเดล เอกสารสาธารณะของ StepFun สำหรับโมเดลนี้ไม่ได้ระบุสิ่งเหล่านี้ และใครก็ตามที่อ้างตัวเลขเหล่านั้นกำลังอ้างอิงสิ่งอื่น
ASR กับ Realtime คือการเปรียบเทียบที่ผู้คนต้องการจริง ๆ
หากคุณกำลังเลือกหว่างผลิตภัณฑ์ถอดเสียง ไม่ใช่ระหว่างเจเนอเรชัน คู่เปรียบเทียบที่น่าสนใจไม่ใช่ ASR กับ ASR Max — แต่เป็น ASR กับ Realtime เอกสารทางเทคนิคของ StepFun เองระบุว่าทั้งสองใช้ขั้นตอน pretraining และ midtraining ร่วมกัน และแตกต่างกันเฉพาะในช่วง supervised fine-tuning เท่านั้น ฐานเดียวกัน ไฟน์ทูนต่างกัน ผลิตภัณฑ์จึงต่างกัน
ข้อเท็จจริงข้อเดียวนั้นมีการตีความในทางปฏิบัติ อัตราความผิดพลาดระดับคำที่ 1.7% เป็นคุณสมบัติของการไฟน์ทูน ASR ไม่ใช่คำสัญญาเกี่ยวกับโมเดลแบบเรียลไทม์ ซึ่งปรับให้เหมาะกับการผลัดกันพูด การจัดการการขัดจังหวะ และการให้เหตุผลจากเสียงพูด มากกว่าความแม่นยำของบทถอดความ หากสถาปัตยกรรมของคุณถอดความโดยเป็นผลพลอยได้จากการสนทนาแบบสด คุณไม่ได้กำลังซื้อ 1.7% นั้น — คุณกำลังซื้อโมเดลสนทนาที่บังเอิญส่งข้อความออกมา
ในทางกลับกันก็เป็นจริงเช่นกันและชัดเจนน้อยกว่า: เนื่องจากพวกมันใช้แบ็กโบนร่วมกัน โมเดล ASR จึงไม่ใช่โมเดลผู้เชี่ยวชาญขนาดเล็กที่ถูกนำมาต่อพ่วงเข้ากับตระกูลนี้ มันเป็นระบบขนาดเดียวกัน แต่ถูกปรับละเอียดมาแตกต่างกัน นั่นคือเหตุผลว่าทำไมอัตราของ ASR จึงใกล้เคียงกับส่วนที่เหลือของตระกูล แทนที่จะอยู่ใกล้ปลายถูกราคาของตลาด
จะทำอย่างไรกับสิ่งนี้ถ้าคุณกำลังจะเลือกอันหนึ่ง
สามคำถามก็ตัดสินได้แล้ว คุณต้องการทรานสคริปต์ หรือคุณต้องการบทสนทนา? ถ้าเป็นทรานสคริปต์ StepAudio 3 ASR คือผลิตภัณฑ์ และชื่อตระกูลก็เป็นเพียงเสียงรบกวน ถ้าเป็นบทสนทนา คุณต้องการ StepAudio 3 Realtime และคุณไม่ควรอ่านเบนช์มาร์ก ASR เลย และถ้าคุณต้องการทรานสคริปต์ของเสียงที่ยากอย่างแท้จริง — ที่มีสำเนียง กระซิบ ร้องเพลง หรือมีดนตรีประกอบ — ค่าพรีเมียม 19 เท่าก็คือราคาของระดับที่ปรับแต่งมาเพื่อสิ่งนั้น และการทดสอบที่ตรงไปตรงมาคือเสียงของคุณเอง ไม่ใช่ดัชนีแบบผสม
การตัดสินใจที่ทำให้ผิดพลาดได้ง่าย คือการมองว่าชั้นการถอดเสียงเป็นสิ่งที่ถาวร ไม่ว่าคุณจะเลือกอะไร ข้อความถอดเสียงก็เป็นเพียงข้อมูลนำเข้าของสิ่งอื่น — ตัวสรุป การสกัดข้อมูลแบบมีโครงสร้าง การตรวจสอบการปฏิบัติตามกฎเกณฑ์ ดัชนีสำหรับค้นหา — และการเรียกเหล่านั้นก็ไปตกที่โมเดลข้อความธรรมดา ๆ นั่นคือชั้นที่ขยายตามปริมาณการใช้งาน ไม่ใช่ตามจำนวนนาทีของเสียง และเป็นชั้นที่ควรค่าแก่การรักษาให้พกพาได้ตั้งแต่วันแรก OrcaRouter รวมโมเดลข้อความเกือบ 200 รุ่นไว้หลัง API เดียวพร้อมระบบสลับไปใช้ผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้อง, DSL สำหรับจัดเส้นทางที่ประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียว และการหลอมรวมโมเดล (model fusion) เมื่อการตัดสินใจของโมเดลเดียวไม่เพียงพอ ในกรณีที่ผู้ให้บริการประกาศอัตราค่าบริการ ราคาตามรายการนั้นจะถูกส่งผ่านโดยไม่บวกเพิ่มใด ๆ ดังนั้นเมื่อราคาฝั่งข้อความเปลี่ยนแปลง บิลของคุณจะสะท้อนการเปลี่ยนแปลงนั้นในวันที่ประกาศทันที
ขอชี้แจงขอบเขตให้ชัดเจน เนื่องจากหน้านี้พูดถึงตระกูลโมเดลที่เราไม่ได้ให้บริการ: ไม่มี endpoint ของ StepAudio 3 อยู่บน OrcaRouter โมเดลถอดเสียงและโมเดลเสียงนั้นเข้าถึงได้ผ่าน API ของ StepFun เอง สิ่งที่ OrcaRouter ให้บริการคือชั้นการให้เหตุผลที่อยู่ปลายน้ำของข้อความถอดเสียง ซึ่งเป็นจุดที่การตัดสินใจสลับเปลี่ยนทำได้ในต้นทุนต่ำ แต่การเลื่อนออกไปกลับมีต้นทุนสูง

สิ่งที่ยังไม่มีใครยุติ
การตั้งชื่อนั้นไขได้ แต่ข้ออ้างด้านประสิทธิภาพยังไขไม่ได้ ยังไม่มีรายงานทางเทคนิคที่เผยแพร่สำหรับโมเดล ASR นี้ ไม่มีชุดทดสอบที่เปิดให้ใช้ ไม่มีการกำหนดค่าการถอดรหัส และไม่มีโปรโตคอลที่ทำซ้ำได้จากใครก็ตามนอก StepFun และการเปรียบเทียบของผู้ขายเองก็เทียบกับผลิตภัณฑ์ ASR จีนรายอื่น ๆ มากกว่าที่จะเทียบกับโมเดลเจ้าตลาดแบบเปิดน้ำหนัก ส่วน 1.7% เป็นการวัดจริงโดยบุคคลที่สามบนดัชนีผสมสามชุดข้อมูล ทุกอย่างอื่นเกี่ยวกับโมเดลนี้เป็นคำกล่าวอ้างของผู้ขาย
มีสองสิ่งที่จะเปลี่ยนภาพรวมได้ การเปรียบเทียบแบบตัวต่อตัวกับ Whisper Large v3 Turbo บนเสียงเดียวกัน ซึ่งยังไม่มีใครเผยแพร่ และอัตราค่าใช้จ่ายสำหรับรุ่นอื่น ๆ ที่เหลือในตระกูลนี้ — สี่ในห้ารุ่นของ StepAudio 3 ยังอยู่ในราคาช่วงทดลองใช้ฟรีแบบจำกัดเวลา ณ ตอนเปิดตัว และมีเพียงการถอดเสียงและการสังเคราะห์เสียงเท่านั้นที่มีการเผยแพร่อัตราค่าใช้จ่าย ซึ่งหมายความว่ารายการราคาที่คุณอ่านได้ในวันนี้ครอบคลุมเพียงสองในห้าผลิตภัณฑ์

นั่นคือเลเยอร์ที่ขยายตามปริมาณการใช้งาน ไม่ใช่ตามนาทีของเสียง และเป็นเลเยอร์ที่คุ้มค่าที่จะทำให้พอร์ตได้ตั้งแต่เริ่มต้น การสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้อง, ภาษาจำเพาะสำหรับการจัดเส้นทาง (DSL) ที่ประกอบหลายอย่างเข้าด้วยกันเป็นการเรียกครั้งเดียว และการหลอมรวมโมเดลเมื่อดุลยพินิจของโมเดลเดียวไม่เพียงพอ
