การ์ดชื่อเรื่องแบบฮีโร่ที่สร้างขึ้นสำหรับ 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: สตรีมมิงแบบเนทีฟเทียบกับม้าศึก 99 ภาษา' โดยมีคำบรรยายใต้ชื่อว่า 'สตรีมมิงแบบเนทีฟเทียบกับม้าศึก 99 ภาษา' พร้อมการ์ดโมเดลสองใบ — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 กันยายน 2026 · MIT · สตรีมมิงแบบเนทีฟ · 10 ภาษา) และ Whisper Large v3 Turbo (OpenAI · ตุลาคม 2024 · MIT · แบบแบตช์ · 99 ภาษา) — และแท็กที่ระบุข้อความว่า 'ชิ้นเสียง ~2.9 วินาที + การมองไปข้างหน้า ~0.5 วินาที', 'ดาวน์โหลด 7M+ ครั้ง/เดือน (Whisper)' และ 'ยังไม่มีการเผยแพร่ผล Benchmark' โดยมีโลโก้ OrcaRouter ประกอบอยู่ที่มุมขวาล่าง
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: สตรีมมิงแบบเนทีฟ ปะทะ ม้าศึก 99 ภาษา

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

มีความเป็นไปได้สูงที่โมเดลแปลงเสียงพูดเป็นข้อความที่คุณใช้อยู่ในตอนนี้คือ Whisper Large v3 Turbo และตอนนี้มีโมเดลใหม่ที่กำลังถามว่าควรจะเป็นรุ่นนั้นหรือไม่ Whisper Large v3 Turbo ของ OpenAI — จุดเช็คพอยต์แบบกลั่นที่มีพารามิเตอร์ 809M ซึ่งเผยแพร่ในเดือนตุลาคม 2024 — คือม้าทำงานแบบ open-weights: รองรับ 99 ภาษา เร็วกว่า large-v3 ดั้งเดิมประมาณสี่ถึงแปดเท่า เล็กพอสำหรับแล็ปท็อป ใช้สัญญาอนุญาต MIT และมีระบบนิเวศการถอดเสียงที่ใหญ่ที่สุดหนุนหลัง VibeVoice-ASR-Streaming-1.5B ซึ่งอัปโหลดโดย Microsoft Research เมื่อวันที่ 2 กันยายน 2026 คือผู้ท้าชิงที่สร้างมาเพื่อสิ่งที่ Whisper ไม่ได้ทำโดยธรรมชาติ: การสตรีม มันถอดเสียงเป็นส่วนๆ เมื่อเสียงเข้ามา แทนที่จะจัดการกับหน้าต่างที่กำหนดไว้ตายตัว อ้างว่าระบุผู้พูดได้ และมี 10 ภาษา โดยไม่มีเกณฑ์มาตรฐานที่ตีพิมพ์ติดตัวเลย

ประโยคสุดท้ายนั่นเองคือเหตุผลที่หน้านี้ถูกจัดโครงสร้างขึ้นรอบคำถามเรื่องการย้ายระบบ มากกว่าจะเป็นการประลองวัดกัน ตัวเลขของ Whisper Large v3 Turbo ถูกวัดผลและเปิดเผยต่อสาธารณะแล้ว — ทั้ง LibriSpeech, ชุดรวม Open ASR, และ Common Voice — ขณะที่โมเดลการ์ดของ VibeVoice-ASR-Streaming-1.5B ไม่ได้เผยแพร่ตัวเลข WER หรือค่าหน่วงเวลา (latency) ไว้เป็นลายลักษณ์อักษร และไม่มีเกณฑ์วัด (benchmark) อิสระใดๆ ในขณะที่เขียนบทความนี้ ทุกอย่างที่เกี่ยวกับฝั่ง Microsoft ด้านล่างนี้คือสิ่งที่พอทราบได้จาก repository ของมัน ได้แก่ ไฟล์คอนฟิก โมเดลการ์ด และเอกสารสตรีมมิงของ Microsoft ส่วนทุกอย่างที่เกี่ยวกับฝั่ง Whisper คือข้อมูลสาธารณะที่ได้รับการยุติแล้ว ทั้งสองไม่ได้ถูกนำมาแข่งวัดกันแบบตัวต่อตัว การเปรียบเทียบนี้จึงเป็นระหว่างสิ่งที่พิสูจน์แล้วกับสิ่งที่ให้สัญญาไว้

โมเดลที่คุณอาจกำลังรันอยู่แล้ว

Whisper Large v3 Turbo ได้มาซึ่งตำแหน่งด้วยวิธีที่ไม่สวยงามนัก: มันเร็ว เล็ก รองรับหลายภาษา และน่าเบื่อในแบบที่ทีมโปรดักชันชื่นชอบ ตัวโมเดลถูกกลั่นจาก Whisper large-v3 ที่มีพารามิเตอร์ 1.55B ลงเหลือ 809M พารามิเตอร์ โดยยังคงครอบคลุม 99 ภาษา และมีความแม่นยำประมาณ 95% ของ large-v3 — อยู่ที่ประมาณ 2.1% WER บนชุด LibriSpeech clean และประมาณ 7.7–7.8% บนชุดรวม Open ASR โดยความเสื่อมถอยมากที่สุดเกิดกับภาษาที่มีทรัพยากรน้อยและภาษาที่มีวรรณยุกต์ — ขณะที่ทำงานได้เร็วขึ้นหลายเท่า และใช้ VRAM เพียงประมาณ 1.6 GB ในรูปแบบ FP16 มันอยู่ภายใต้สัญญาอนุญาต MIT ทำงานผ่าน faster-whisper, whisper.cpp และการผสานรวมที่สะสมมากว่าสามปี และหน้าบน Hugging Face ของมันแสดงยอดดาวน์โหลดกว่าเจ็ดล้านครั้งในเดือนเดียว หากคุณโฮสต์ระบบถอดเสียงด้วยตัวเอง โมเดลนี้คือตัวที่คุณน่าจะใช้อยู่มากที่สุด

สิ่งที่ Whisper Large v3 Turbo ไม่ได้เป็น และไม่เคยอ้างว่าเป็น ก็คือโมเดลแบบสตรีมมิง มันรับเสียงเป็นหน้าต่างเวลาคงที่ 30 วินาที และส่งคืนบทถอดความต่อหนึ่งหน้าต่าง มันไม่มีการตรวจจับกิจกรรมเสียงในตัว ไม่มีการตรวจจับจุดสิ้นสุดคำพูด ไม่มีการแยกผู้พูด และไม่มีกลไกคำปลุก การถอดความแบบเรียลไทม์บน Whisper จึงเป็นการต่อเติมที่คุณต้องสร้างขึ้นมาเองเสมอ และจุดที่ความหน่วงและต้นทุนทางวิศวกรรมอาศัยอยู่ก็คือการต่อเติมนั้นเอง

จริงๆ แล้ว ถ้าคุณเปลี่ยน อะไรจะเปลี่ยนไปบ้าง

โมเดลเวลาแฝง — VibeVoice-ASR-Streaming-1.5B จะปล่อยข้อความทุกครั้งต่อแชงค์ที่ประมวลผลเสร็จประมาณ 2.9 วินาที โดยมีการมองล่วงหน้า ~0.5 วินาที ตามการออกแบบ เทียบกับ Whisper Large v3 Turbo: โมเดลแบบแบตช์บนหน้าต่างเวลา 30 วินาที ซึ่งต้องมีชั้นสำหรับตัดแบ่งและต่อเชื่อมชิ้นส่วนเพื่อให้ได้ผลลัพธ์ใกล้เคียงกับเอาต์พุตแบบสด

• รูปแบบเซสชัน — เซสชันสดแบบไม่จำกัดซึ่งบริบทถูกส่งต่อข้ามชิ้นส่วนใน prefix cache เทียบกับหน้าต่าง 30 วินาทีแบบแยกส่วนที่ไม่มีสถานะการสนทนาข้ามหน้าต่าง

• ภาษา — สิบ (จีน, อังกฤษ, ฝรั่งเศส, เยอรมัน, อิตาลี, ญี่ปุ่น, เกาหลี, โปรตุเกส, รัสเซีย, สเปน) เทียบกับ 99

• ความแม่นยำจากเอกสารตีพิมพ์ — ไม่มีการตีพิมพ์ผลเทียบกับ ~2.1% LibriSpeech clean, ~7.7–7.8% Open ASR composite โดยทั้งหมดผ่านการวัดและเปิดเผยต่อสาธารณะ

• เอาต์พุตเสริม — อ้างว่ารองรับการระบุว่าใครพูดอะไรในสตรีมมิง และฮอตเวิร์ดเทียบกับไทม์สแตมป์ของคำ แต่ไม่มี diarization และไม่มีฮอตเวิร์ดในตัว

• ฮาร์ดแวร์ — น้ำหนัก bf16 ประมาณ 5.6 GB บน NVIDIA GPU, การติดตั้งจากซอร์สเทียบกับ FP16 ประมาณ 1.6 GB, รันบนแล็ปท็อปและ CPU ผ่าน whisper.cpp และ faster-whisper

• สัญญาอนุญาต — MIT, ทั้งสอง

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Streaming native ~2.9 s chunks, Languages 10, WER none published, Extras who-said-what + hotwords, Hardware ~5.6 GB NVIDIA GPU, License MIT. Right column Whisper Large v3 Turbo: Released Oct 2024, Streaming none / 30 s windows, Languages 99, WER ~2.1% LibriSpeech clean, Extras timestamps, no diarization, Hardware ~1.6 GB laptop-class, License MIT. Footer reads 'Whisper figures measured and public; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

ปัญหาการปรับปรุงระบบเพื่อรองรับสตรีมมิง

วิธีที่ตรงไปตรงมาในการมองการเปรียบเทียบนี้คือ Whisper Large v3 Turbo มีปัญหาสตรีมมิงที่คุณได้ชำระเงินไปแล้วหรือยังคงชำระเงินอยู่ ไปป์ไลน์แบบเรียลไทม์บน Whisper ต้องมีตัวตรวจจับกิจกรรมเสียงเพื่อหาคำพูด ตัวแบ่งชิ้นเสียงเป็นหน้าต่างขนาดที่ Whisper รองรับ มีการซ้อนทับหน้าต่างเพื่อไม่ให้คำหายไปตามขอบเขต และตัวรวมผลเพื่อประสานบทถอดความบางส่วนเข้าด้วยกัน การนำสแตกดังกล่าวไปใช้งานโดยชุมชนมีเวลาแฝงแบบ end-to-end ราวหนึ่งถึงห้าวินาที — พอใช้ได้สำหรับบันทึกการประชุม แต่ยังไม่ถึงมาตรฐานสำหรับเอเจนต์โทรศัพท์และคำบรรยายสด

VibeVoice-ASR-Streaming-1.5B ตัดความจำเป็นในการดัดแปลงภายหลังออกไปได้โดยการออกแบบเอง การกำหนดค่าตัวประมวลผลล่วงหน้าจะยึด chunk จำนวน 22 เฟรมและการมองไปข้างหน้า 4 เฟรมบนสตรีมโทเค็นเสียงพูดความถี่ประมาณ 7.5 เฮิรตซ์ — ซึ่งคือเสียงประมาณ 2.9 วินาทีต่อเซกเมนต์ที่ส่งออก โดยมีบริบทในอนาคตครึ่งวินาที — และเอกสารของ Microsoft อธิบายว่าบริบทจาก chunk ก่อนหน้าจะถูกคงไว้ผ่าน KV cache ดังนั้นเซสชันไลฟ์จึงไม่ต้องคำนวณใหม่ทั้งชุด แต่โปรดอ่านคำว่า "streaming" อย่างถี่ถ้วนทั้งสองด้านของการเปรียบเทียบนี้: ไม่มีโมเดลใดเป็นเอนจินแบบ partials รายคำแบบที่ API เชิงพาณิชย์หน่วงต่ำที่สุดขาย ทรานสคริปต์ของ VibeVoice เติบโตทีละประมาณสามวินาทีโดยการออกแบบ ซึ่งเป็นจังหวะที่แตกต่างและโดยทั่วไปก็ใช้ได้สำหรับการประชุม แต่ไม่ใช่ระดับต่ำกว่าหนึ่งวินาที และหากความต้องการของคุณคือให้คำขึ้นหน้าจอภายในหนึ่งวินาที คุณควรวัดโครงสร้าง chunk นี้เทียบกับงบประมาณเวลานั้นก่อนจะนำไปสร้างต่อ

ความแม่นยำ: สิ่งที่คุณกำลังยอมสละเพื่อเปลี่ยนไปใช้ native-streaming

นี่คือช่องว่างที่ควรเป็นตัวกำหนดการตัดสินใจ Whisper Large v3 Turbo มีประวัติความแม่นยำที่เปิดเผยต่อสาธารณะซึ่งคุณสามารถตรวจสอบได้ — และเมื่อเสียงบันทึกของคุณอยู่ใน 99 ภาษาที่โมเดลรองรับ ประวัติดังกล่าวก็แข็งแกร่ง VibeVoice-ASR-Streaming-1.5B ไม่มีประวัติเช่นนั้น: การประเมินบนการ์ดโมเดลเป็นเพียงรูปภาพ Microsoft ไม่ได้เผยแพร่ค่า WER แบบสตรีมมิงในรูปแบบข้อความ และจุดยึดเชิงตัวเลขเพียงจุดเดียวในตระกูลนี้คือค่า WER เฉลี่ย 7.77% ที่ผู้พัฒนารายงานบนการ์ด VibeVoice-ASR แบบแบตช์จากชุดทดสอบภาษาอังกฤษแปดชุด ซึ่งพรรณนาถึงโมเดลแบบไม่สตรีมมิงที่แตกต่างออกไป พูดตรงๆ ก็คือ การย้ายงานถอดเสียงของคุณไปยัง VibeVoice-ASR-Streaming-1.5B ในวันนี้หมายถึงการยอมรับระดับความแม่นยำที่ไม่ทราบค่าบนเสียงของคุณเอง — ซึ่งเป็นเหตุผลว่าทำไมการประเมินโมเดลนี้จึงต้องดำเนินการโดยคุณ บนเสียงบันทึกจริงที่ยากที่สุดของคุณ ก่อนที่มันจะคู่ควรกับการรับปริมาณงานในระบบ production

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

ภาษาและการระบุผู้พูด: ช่องว่างของคุณลักษณะส่งผลทั้งสองทาง

การเปรียบเทียบคุณสมบัติไม่ได้มีด้านเดียว และนั่นคือสิ่งที่ทำให้การตัดสินใจน่าสนใจจริง ๆ หากเสียงของคุณเป็นหลายภาษา การตัดสินใจก็จบลงทันที: 99 ภาษาของ Whisper Large v3 Turbo ครอบคลุมสิ่งที่ VibeVoice-ASR-Streaming-1.5B มีเพียงสิบภาษาไม่ครอบคลุม และเพดานแค่สิบภาษานั้นถือว่าขาดคุณสมบัติสำหรับไปป์ไลน์ใด ๆ ที่เจอเสียงพูดหลากหลายผสมกัน แต่หากงานของคุณอยู่ในสิบภาษานั้น และสิ่งที่คุณต้องการจริง ๆ คือรู้ว่าใครพูดอะไรในการประชุมสด ลูกศรก็ชี้ไปอีกทาง: Whisper ไม่มีการแยกผู้พูด (diarization) ดั้งเดิมและไม่มีฮอตเวิร์ด ขณะที่ VibeVoice-ASR-Streaming-1.5B อ้างว่ามีทั้งสองอย่าง — ผลลัพธ์แบบสตรีมที่ระบุผู้พูด และฮอตเวิร์ดคำศัพท์เฉพาะโดเมนที่ส่งเป็นพรอมต์บริบท การอ้างนี้ยังไม่ได้รับการพิสูจน์ และการแยกผู้พูดแบบสตรีมข้ามขอบเขตชิ้นส่วนนั้นยากพอสมควรจนสมควรแก่ความกังขา แต่มันคือคุณสมบัติรูปธรรมที่วิศวกรรม Whisper ไม่ว่าจะมากเพียงใดก็ไม่ให้คุณได้มาอย่างพร้อมใช้

คณิตศาสตร์การย้ายถิ่น

{{1}}ในแง่ต้นทุนและความพยายาม ระบบเดิมได้เปรียบ{{/1}} {{2}}Whisper Large v3 Turbo ทำงานในสแตกของคุณได้แล้วบนฮาร์ดแวร์ที่คุณมีเอง ไม่ว่าจะเป็นแล็ปท็อป เครื่องที่ใช้ CPU หรือ GPU ระดับกลาง{{/2}} — และ {{3}}การย้ายไปยัง VibeVoice-ASR-Streaming-1.5B หมายถึงการติดตั้งงานวิจัยจากซอร์สโค้ดบน NVIDIA GPU ซึ่งมีน้ำหนักโมเดล ~5.6 GB{{/3}}, {{4}}การตรวจสอบเส้นทางการโหลดซึ่งคลาสสถาปัตยกรรมยังไม่มีในเอกสาร Transformers ที่เผยแพร่ต่อสาธารณะ{{/4}} และ {{5}}การสร้างเกณฑ์มาตรฐานที่การตัดสินใจของคุณต้องพึ่งพาขึ้นมาจากศูนย์{{/5}} {{6}}นั่นคือโปรเจกต์ที่ต้องลงมือทำจริง ๆ และผลตอบแทนจะขึ้นอยู่กับว่าฟีเจอร์ที่ยังไม่ผ่านการพิสูจน์นั้นสำคัญต่อคุณหรือไม่{{/6}}

A screenshot of the Hugging Face model card for openai/whisper-large-v3-turbo, showing the OpenAI namespace, the model title Whisper, the MIT license tag, the 99-languages tag, and the automatic-speech-recognition pipeline tags, with the description of Whisper as a state-of-the-art automatic speech recognition model.

วิธีที่ประหยัดในการรันโปรเจกต์นั้นคือ อย่าถือว่ามันเป็นการสลับแทนที่ ปล่อยให้ Whisper Large v3 Turbo เป็นค่าเริ่มต้นต่อไป แล้วส่งเสียงสดบางส่วนไปยัง VibeVoice-ASR-Streaming-1.5B ผ่าน API เดียวกัน — ซึ่งเป็นแพตเทิร์นที่เลเยอร์จัดเส้นทางมีไว้รองรับเรื่องนี้อยู่แล้ว: โมเดล 200+ ตัวหลังเอนด์พอยต์เดียว ในราคารายการของผู้ให้บริการแบบไม่บวกเพิ่ม, เฟลโอเวอร์อัตโนมัติเมื่อโมเดลใหม่สะดุด และ routing DSL ที่ให้เวิร์กโหลดต่างกันเลือกตัวถอดเสียงต่างกันได้จากการเรียกใช้ครั้งเดียว นี่คือรูปแบบของ OrcaRouter และมันคือความต่างระหว่างการวางเดิมพันไปป์ไลน์โปรดักชันของคุณไว้กับเช็คพอยต์อายุเพียงสองวัน กับการเปิดโอกาสให้เช็คพอยต์ตัวนั้นพิสูจน์ตำแหน่งของมันคู่กับตัวหลักที่ทำงานหนัก บนทรานสคริปต์ของคุณเอง

คำถามที่พบบ่อย

Whisper Large v3 Turbo สามารถสตรีมสดได้เลยหรือไม่

ใช้ได้เฉพาะเป็นการติดตั้งเสริมภายหลังเท่านั้น Whisper Large v3 Turbo เป็นโมเดลแบบแบตช์ที่ประมวลผลหน้าต่างเวลาคงที่ 30 วินาที ดังนั้นการถอดความแบบสดจึงต้องให้คุณสร้างตัวตรวจจับการมีเสียงพูด (voice-activity detector) ตัวแบ่งชิ้น (chunker) กลยุทธ์การซ้อนทับ (overlap strategy) และตัวเชื่อมชิ้น (stitcher) วางซ้อนขึ้นไปอีกชั้นหนึ่ง อินพลีเมนเทชันที่ใช้งานได้จริงมีอยู่แล้ว และให้ค่าหน่วงประมาณ 1 ถึง 5 วินาที ซึ่งเหมาะกับบันทึกการประชุม แต่ยังไม่ถึงเกณฑ์ต่ำกว่า 1 วินาทีสำหรับเอเจนต์โทรศัพท์และการถ่ายทอดคำบรรยายสด ส่วน VibeVoice-ASR-Streaming-1.5B เป็นโมเดลแบบสตรีมมิงโดยกำเนิด (streaming-native) โดยส่งข้อความออกมาทุกชิ้นส่วนประมาณ 2.9 วินาที มีการมองล่วงหน้า (lookahead) ประมาณ 0.5 วินาที แต่มันคือการสตรีมแบบแบ่งเป็นชิ้นส่วน (chunked streaming) ไม่ใช่การส่งผลลัพธ์ย่อยแบบทีละคำ ดังนั้นจงตรวจสอบจังหวะการส่งผลดังกล่าวเทียบกับงบประมาณด้านความหน่วงของคุณเองด้วยเช่นกัน

VibeVoice-ASR-Streaming-1.5B มีความแม่นยำมากกว่า Whisper Large v3 Turbo หรือไม่?

ยังไม่มีใครสามารถตอบคำถามนั้นได้ในตอนนี้ รวมถึงไมโครซอฟท์ด้วย ความแม่นยำของ Whisper Large v3 Turbo เป็นค่าที่มีการวัดผลและเปิดเผยต่อสาธารณะแล้ว โดยอยู่ที่ประมาณ 2.1% WER บน LibriSpeech clean และ 7.7–7.8% บน Open ASR composite ส่วน VibeVoice-ASR-Streaming-1.5B ยังไม่มีตัวเลข WER แบบสตรีมมิ่งที่เผยแพร่เป็นลายลักษณ์อักษร และไม่มีเกณฑ์มาตรฐานอิสระมารองรับ ณ เวลาที่เขียนบทความนี้ วิธีเดียวที่จะตอบคำถามนี้ได้คือการนำ checkpoint ไปรันกับเสียงของคุณเอง แล้วเปรียบเทียบบทถอดเสียงกับระบบเดิมที่คุณใช้อยู่ ซึ่งก็คือการทดสอบที่หน้านี้แนะนำก่อนการย้ายระบบนั่นเอง

ทั้งสองรองรับภาษาใดบ้าง?

Whisper Large v3 Turbo รองรับ 99 ภาษาด้วยชุดน้ำหนักชุดเดียว VibeVoice-ASR-Streaming-1.5B ระบุภาษาไว้สิบภาษา: จีน อังกฤษ ฝรั่งเศส เยอรมัน อิตาลี ญี่ปุ่น เกาหลี โปรตุเกส รัสเซีย และสเปน สำหรับเสียงใดๆ ที่อยู่นอกชุดสิบภาษานั้น Whisper คือตัวเลือกเดียวในคู่การเปรียบเทียบนี้ และช่องว่างด้านการรองรับหลายภาษานี้คือเหตุผลที่ชัดเจนที่สุดเพียงข้อเดียวที่ทำให้ทีมส่วนใหญ่ยังคงเลือกใช้ตัวเลือกเดิมต่อไป

Whisper Large v3 Turbo เป็นโมเดลที่เหมาะสมสำหรับทีมส่วนใหญ่เกือบตลอดเวลา และ checkpoint ที่มีอายุเพียงสองวันโดยไม่มี benchmark ไม่ใช่เหตุผลที่จะเปลี่ยนแพลตฟอร์ม แต่เป็นเหตุผลที่จะทำการทดลอง ถ้าเสียงของคุณอยู่ในสิบภาษาของมัน และการระบุผู้พูดแบบสดจะเปลี่ยนผลิตภัณฑ์ของคุณ จงตั้ง VibeVoice-ASR-Streaming-1.5B ขึ้นหลังเราเตอร์ ชี้ทราฟฟิกจริงส่วนหนึ่งไปที่มัน แล้วให้ทรานสคริปต์—ไม่ใช่การไม่มี benchmark ของทั้งสองฝ่าย—เป็นผู้ชี้ขาด

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube