การ์ดไทเทิลหลักที่สร้างขึ้นสำหรับ 'VibeVoice-ASR-Streaming-1.5B เทียบกับ Gemini 3.5 Transcribe: สตรีมมิง ASR เงียบ ๆ ของ Microsoft กับ API ใหม่ของ Google' พร้อมคำบรรยายใต้ไทเทิลว่า 'สตรีมมิง ASR แบบโอเพนซอร์สที่เงียบ ๆ ของ Microsoft กับ API แบบโฮสต์ใหม่ของ Google' โดยมีการ์ดโมเดลสองใบ — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · น้ำหนักแบบ MIT, 2 กันยายน 2026 · โอเพนเช็คพอยต์ · 10 ภาษา) และ Gemini 3.5 Transcribe (Google · พรีวิวสาธารณะ, 26 สิงหาคม 2026 · API แบบโฮสต์ · 2 เอนด์พอยต์) — พร้อมแท็กที่อ่านว่า 'ยังไม่มีการประกาศ', 'ยังไม่มีเบนช์มาร์กเผยแพร่' และ '~$0.30–0.54 ต่อชั่วโมงเสียง (Google)' โลโก้ OrcaRouter ถูกวางซ้อนที่มุมขวาล่าง
Guides & Insights

VibeVoice-ASR-Streaming-1.5B เทียบกับ Gemini 3.5 Transcribe: ASR แบบสตรีมมิงเงียบๆ ของไมโครซอฟท์ สู้กับ API ใหม่ของกูเกิล

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เจ็ดวันและเส้นแบ่งทางปรัชญาหนึ่งข้อคั่นระหว่างระบบแปลงคำพูดเป็นข้อความแบบสตรีมมิงรุ่นใหม่ล่าสุดสองระบบ เมื่อวันที่ 26 สิงหาคม 2026 Google เปิดตัว Gemini 3.5 Transcribe ในรุ่นพรีวิวสาธารณะ: API แปลงคำพูดเป็นข้อความแบบโฮสต์และปิดระบบ คิดราคาต่อโทเค็นเสียง พร้อมเอนด์พอยต์ Live แยกต่างหากสำหรับเซสชันแบบเรียลไทม์ เมื่อวันที่ 2 กันยายน 2026 Microsoft Research อัปโหลด VibeVoice-ASR-Streaming-1.5B ขึ้น Hugging Face ภายใต้เนมสเปซ microsoft — น้ำหนักโมเดลภายใต้ใบอนุญาต MIT ไม่มีการแถลงข่าว ไม่มีโพสต์เปิดตัว และในขณะที่เขียนบทความนี้ ยังไม่มีสื่อภายนอกกล่าวถึงเลย ทั้งสองระบบถอดเสียงคำพูดในขณะที่เสียงยังคงเข้ามาเรื่อย ๆ แทบทุกอย่างอื่นเกี่ยวกับพวกเขา — ใครได้รับอนุญาตให้เรียกใช้ มีค่าใช้จ่ายเท่าไร มีหลักฐานอะไรบ้างที่พิสูจน์ว่ามันทำงาน — ล้วนแตกต่างกัน

หน้านี้เปรียบเทียบทั้งสองระบบตามสภาพที่แท้จริง ณ ปัจจุบัน ซึ่งทำให้หลักฐานของทั้งสองฝั่งไม่สมมาตรกัน Gemini 3.5 Transcribe เป็นผลิตภัณฑ์ Google ที่ใช้งานจริง โดยมีการเผยแพร่ราคา token และตัวเลขความแม่นยำจากบุคคลที่สามอย่าง Artificial Analysis ซึ่งก็คือตัวเลขที่ติดป้าย AA ด้านล่าง ส่วน VibeVoice-ASR-Streaming-1.5B เป็น checkpoint ที่โมเดลการ์ดของมันไม่มีการเผยแพร่อัตราคำผิด (word-error-rate) หรือค่าหน่วงเวลา (latency) ในรูปแบบข้อความเลยแม้แต่น้อย — การประเมินบนการ์ดเป็นรูปภาพ ส่วนการประกาศเพียงหนึ่งเดียวของตระกูล streaming ที่มีจนถึงตอนนี้คือข้อความข่าวลงวันที่ 3 กันยายนในที่เก็บ GitHub ของ Microsoft ชื่อ VibeVoice ข้อมูลทั้งหมดในฝั่ง Microsoft ด้านล่างเป็นสิ่งที่รู้ได้จากที่เก็บดังกล่าวเท่านั้น ได้แก่ ไฟล์คอนฟิก โมเดลการ์ด และเอกสารประกอบ streaming ของ Microsoft เอง โดยยังไม่มีสิ่งใดที่ถูกวัดประสิทธิภาพอย่างเป็นอิสระ

สองโมเดลโดยสรุป

• มันคืออะไร — VibeVoice-ASR-Streaming-1.5B: เช็คพอยต์แบบเปิด, ใช้สัญญาอนุญาต MIT, โฮสต์เองได้ เทียบกับ Gemini 3.5 Transcribe: API ที่โฮสต์ให้บริการ, น้ำหนักโมเดลปิด

• การเปิดตัว — weights วันที่ 2 กันยายน 2026, ไลน์ข่าว repo วันที่ 3 กันยายน เทียบกับการพรีวิวต่อสาธารณะวันที่ 26 สิงหาคม 2026 พร้อมเอกสารเปิดตัวฉบับเต็ม

• รูปแบบการสตรีม — ส่งข้อความออกมาเป็นท่อนๆ ประมาณ 2.9 วินาทีต่อท่อน โดยมีการมองไปข้างหน้าประมาณ 0.5 วินาที สถานะเซสชันถูกเก็บไว้ในแคชคำนำหน้า เทียบกับเซสชัน WebSocket Live ที่คิดค่าใช้จ่ายตามโทเคนเสียง และจำกัดเสียงสูงสุด 10 นาทีต่อเซสชัน

• ความแม่นยำในเอกสารสิ่งพิมพ์ — ไม่มีการเผยแพร่ตัวเลข WER หรือความหน่วงเป็นข้อความ เทียบกับค่า WER ที่ AA วัดได้ 2.6% บนเอนด์พอยต์แบบบันทึกล่วงหน้า และ 4.0% บนเอนด์พอยต์แบบสด

• ผลลัพธ์ผู้พูด — อ้างว่ามีการระบุว่าใครพูดอะไรแบบสตรีมมิง (ยังไม่ผ่านการยืนยัน) เทียบกับไม่มี speaker diarization และไม่มี timestamp ระดับคำบน Live endpoint

• Hotwords — รองรับ ผ่านพรอมต์บริบทเดียวกันกับ VibeVoice-ASR แบบแบตช์ ในขณะที่ไม่ได้เป็นฟีเจอร์ที่ระบุไว้ของ Live endpoint

• ต้นทุน — $0 สำหรับน้ำหนัก, ~5.6 GB สำหรับการโฮสต์เอง เทียบกับประมาณ $0.30 ต่อชั่วโมงเสียงโดยเฉลี่ยบนเอนด์พอยต์ที่บันทึกล่วงหน้า และ ~$0.54 บน Live ตามราคาโทเค็นที่ Google ระบุไว้

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, License MIT open weights, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, Speaker output who-said-what claimed, Cost $0 weights / ~5.6 GB self-host. Right column Gemini 3.5 Transcribe: Released Aug 26 2026, License closed API, Streaming WebSocket Live, 10-min cap, WER 2.6% batch / 4.0% Live (AA), Speaker output none on Live, Cost ~$0.30–0.54 per audio-hour. Footer reads 'Gemini figures per Google pricing and Artificial Analysis; VibeVoice specs read from the HF repo; no VibeVoice benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

API ที่โฮสต์ไว้และการอัปโหลดอย่างเงียบๆ ห่างกันเจ็ดวัน

Gemini 3.5 Transcribe เป็นโมเดลถอดเสียงรุ่นทดแทนของ Google และเผยแพร่เป็นผลิตภัณฑ์สองแบบ เอนด์พอยต์แบบบันทึกล่วงหน้า ซึ่งให้บริการผ่าน Interactions API จะรับไฟล์เสียงเต็มรูปแบบและส่งคืนทรานสคริปต์พร้อมส่วนเสริมที่คาดหวัง เอนด์พอยต์แบบสด (Live) ชื่อ gemini-3.5-transcribe-live ทำงานผ่าน WebSocket แบบสองทิศทาง และเป็นตัวที่แข่งขันกับ VibeVoice-ASR-Streaming-1.5B ในเรื่องลักษณะของงาน: การถอดเสียงเซสชันขณะที่เกิดขึ้นจริง Google ประกาศด้วยกลไกปกติ — เปิดตัวเป็น public preview ในวันที่ 26 สิงหาคม กำหนดราคาในหน้าโมเดล และกระดานผู้นำจากบุคคลที่สามนำไปจัดอันดับภายในไม่กี่วัน

การสตรีมรีลีสของ Microsoft ไม่มีอะไรแบบนั้นเลย เมื่อวันที่ 2 กันยายน บัญชี Hugging Face ของ microsoft ได้สร้างเช็คพอยต์สองรายการในนาทีเดียวกัน: VibeVoice-ASR-Streaming-7B และ VibeVoice-ASR-Streaming-1.5B ตารางโมเดลในรีโพซิทอรี GitHub ตอนนี้ระบุ VibeVoice-ASR-Streaming เป็นสมาชิกในตระกูล และส่วน News มีข้อความวันที่ 3 กันยายนประกาศว่า "โมเดล ASR สตรีมมิงแบบรวมเป็นหนึ่งที่ถอดเสียงอย่างต่อเนื่องว่าใครพูดอะไรเมื่อคำพูดมาถึง พร้อมรองรับคำฮอตเวิร์ดที่กำหนดเองและ 10 ภาษา" — แต่ประกาศนั้นเอ่ยชื่อเฉพาะรุ่น 7B และรุ่น 1.5B เป็นรุ่นน้องที่เล็กกว่า ซึ่งเปิดตัวมาพร้อมกันโดยไม่ถูกเอ่ยถึง เมื่อเราตรวจสอบหนึ่งวันหลังอัปโหลด เช็คพอยต์ทั้งสองยังคงแสดงการดาวน์โหลดเป็นศูนย์

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

"สตรีมมิ่ง" ในแต่ละฝ่ายหมายถึงอะไร

คำว่า streaming ซ่อนความแตกต่างในการออกแบบที่แท้จริงไว้ การกำหนดค่าตัวประมวลผลล่วงหน้าของ Microsoft ทำให้จังหวะของ VibeVoice เป็นรูปธรรม: เสียงเข้ามาที่ 24 kHz และถูกบีบอัด 3,200 เท่าเป็นสตรีมของโทเค็นคำพูดที่ประมาณ 7.5 เฮิรตซ์ (หนึ่งโทเค็นทุก ๆ ประมาณ 133 มิลลิวินาที) จากนั้นการกำหนดค่าจะระบุ chunk จำนวน 22 เฟรม และ lookahead 4 เฟรม — คิดเป็นเสียงประมาณ 2.9 วินาทีต่อ chunk โดยใช้เสียงในอนาคตประมาณครึ่งวินาทีเพื่อทำให้เซกเมนต์ปัจจุบันมีความแน่นอนยิ่งขึ้น โมเดลจะสร้างข้อความหนึ่งครั้งต่อ chunk ที่สรุปผลแล้ว และเอกสารของ Microsoft ระบุว่าบริบทจาก chunk ก่อนหน้าถูกเก็บรักษาไว้ผ่าน KV cache ดังนั้นเซสชันที่ยาวจึงไม่ต้องคำนวณใหม่ตั้งแต่ต้น ตัวเลขชุดนี้ถูกระบุไว้ในการกำหนดค่า และผลในทางปฏิบัติคือทรานสคริปต์จะเพิ่มขึ้นเป็นช่วง ๆ ประมาณสามวินาที ไม่ใช่ทีละคำแบบบางส่วน

ปลายทาง Live ของ Google มีรูปแบบการสตรีมที่ต่างออกไป: เป็นเซสชัน WebSocket แบบสองทิศทางซึ่งเสียงจะถูกคิดค่าใช้จ่ายในอัตรา 25 โทเคนเสียงต่อวินาที ออกแบบมาเพื่อการใช้งานแบบโต้ตอบ แต่จำกัดเสียงไว้ที่ 10 นาทีต่อเซสชัน และ—เฉพาะบนปลายทาง Live—ไม่มีระบบแยกแยะผู้พูด (speaker diarization) หรือการประทับเวลาในระดับคำ (word-level timestamps) สำหรับผู้ที่เปรียบเทียบทั้งสองระบบในฐานะเอนจินถอดเสียงสด ความแตกต่างที่สำคัญคือ ขีดจำกัดของเซสชัน (10 นาทีบนฝั่ง Live ของ Google ส่วนฝั่ง Microsoft ถูกจำกัดเพียงแค่ GPU และหน่วยความจำของคุณเอง) จังหวะการส่งข้อมูลออก (ชิ้นส่วนละ ~3 วินาที เทียบกับสิ่งที่เซสชัน WebSocket ส่งให้) และคุณสมบัติเสริมในผลลัพธ์ (การระบุผู้พูดและคำสำคัญ (hotwords) ที่ Microsoft ระบุไว้บนการ์ดของตน แต่ไม่มีในรายการคุณสมบัติของ Google Live)

ความแม่นยำ: ด้านหนึ่งมีตัวเลข อีกด้านหนึ่งมีรูปภาพ

นี่คือช่องว่างที่กว้างที่สุดในการเปรียบเทียบครั้งนี้ และเป็นช่องว่างของหลักฐาน ไม่จำเป็นต้องเป็นเรื่องของคุณภาพ Artificial Analysis วัด Gemini 3.5 Transcribe ว่ามีอัตราความผิดพลาดของคำที่ 2.6% บนเอนด์พอยต์แบบบันทึกไว้ล่วงหน้า และ 4.0% บนเอนด์พอยต์แบบ Live — ค่าพรีเมียมที่คุณจ่ายเพื่อการส่งแบบเรียลไทม์ปรากฏชัดในอัตราความผิดพลาด ซึ่งเป็นการแลกเปลี่ยนที่ตรงไปตรงมาและพบได้ทั่วไปสำหรับระบบสตรีมมิง ตัวเลขเหล่านั้นมาจากบุคคลที่สามบนลีดเดอร์บอร์ดที่เป็นกลาง ซึ่งเผยแพร่หลังการเปิดตัวเพียงไม่กี่วัน

VibeVoice-ASR-Streaming-1.5B ไม่มีตัวเลขที่เทียบเคียงได้จากที่ใดเลย การ์ดโมเดลมาพร้อมรูปภาพแสดงผลการประเมิน แต่ไม่มีตัวเลข WER, RTF หรือ latency ในรูปแบบข้อความ — ไม่มีอะไรที่อ้างอิงได้ และไม่มีอะไรที่ตรวจสอบได้อย่างอิสระ Microsoft ยังไม่ได้ใส่ตัวเลขความแม่นยำแบบสตรีมมิ่งในข้อความสำหรับทั้งรุ่น 7B และ 1.5B จุดยึดตัวเลขเพียงจุดเดียวในทั้งตระกูลคือการ์ดโมเดลแบบแบตช์ VibeVoice-ASR ซึ่งรายงานค่าเฉลี่ย WER 7.77% ที่รันโดยผู้จำหน่ายบนชุดทดสอบภาษาอังกฤษแปดชุด และ 2.20% บน LibriSpeech clean — แต่สิ่งนั้นอธิบายโมเดลแบบไม่สตรีมมิ่ง และโมเดลสตรีมมิ่งโดยทั่วไปจะแลกความแม่นยำเล็กน้อยเพื่อชนะในด้านเวลาแฝง จนกว่าจะมีใครสักคนรัน checkpoint แบบสตรีมมิ่งผ่านชุดทดสอบสาธารณะ จุดยืนที่ซื่อสัตย์คือโมเดลของ Google ถูกวัดค่าแล้ว ส่วนของ Microsoft ยังไม่ได้ถูกวัด

ต้นทุน: ต่อชั่วโมงเสียง เทียบกับ ต่อชั่วโมง GPU

Google ขาย Gemini 3.5 Transcribe ตามจำนวนโทเคน และราคาถูกแบ่งออกมาอย่างชัดเจนระหว่างสองเอนด์พอยต์ เอนด์พอยต์แบบพรีเรคอร์ด (pre-recorded) ระบุราคา $2 ต่อ 1 ล้านโทเคนเสียงที่นำเข้า และ $12 ต่อ 1 ล้านโทเคนข้อความที่ส่งออก ซึ่งคิดเป็นประมาณ $0.30 ต่อชั่วโมงเสียงแบบผสม (blended) เอนด์พอยต์แบบ Live ระบุราคา $3.50 ต่อ 1 ล้านโทเคนเสียง และ $21 ต่อ 1 ล้านโทเคนข้อความ — ประมาณ $0.54 ต่อชั่วโมงเสียงแบบผสม หรือสูงกว่าราคาแบบพรีเรคอร์ดประมาณ 80% ซึ่งเป็นราคาของการส่งแบบเรียลไทม์ Google คิดค่าเสียงที่ 25 โทเคนต่อวินาที ดังนั้นช่วงเงียบจะไม่มีค่าใช้จ่ายก็ต่อเมื่อไคลเอนต์ของคุณไม่ได้สตรีมมันเข้ามา ส่วนการเชื่อมต่อใหม่ เสียงที่ซ้ำกัน และการบันทึกล็อกล้วนเพิ่มค่าใช้จ่ายจริงได้ มีฟรีเทียร์ให้ใช้งาน โดยมีข้อแม้ว่าเนื้อหาในฟรีเทียร์อาจถูกนำไปใช้เพื่อปรับปรุงผลิตภัณฑ์ของ Google

A generated comparison card titled 'Gemini 3.5 Transcribe — the two endpoints'. Left column 'Pre-recorded': $2 / $12 per 1M audio / text tokens, ~$0.30 per audio-hour, AA WER 2.6%, diarization and word-level timestamps. Right column 'Live': $3.50 / $21 per 1M tokens, ~$0.54 per audio-hour, AA WER 4.0%, no diarization, 10-minute session cap. Footer reads 'Token prices per Google's model page; WER per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

โมเดลของ Microsoft กลับคิดราคาเป็นชั่วโมงการใช้งาน GPU แทน จุดเช็คพอยต์ขนาด 1.5B มีน้ำหนักแบบ bf16 ประมาณ 5.6 GB (แกนภาษาหลัก Qwen ระดับ 1.5B บวกกับตัวแปลงโทเค็นเสียงและส่วนหัวแบบ diffusion — ข้อมูลเมตาของ safetensors รวมกันแล้วประมาณ 3B พารามิเตอร์) และเส้นทางที่ระบุไว้เพื่อรันโมเดลคือแบบโฮสต์เอง: สคริปต์ตัวอย่าง Python ในที่เก็บ microsoft/VibeVoice หรือปลั๊กอิน vLLM ที่ Microsoft อธิบายไว้สำหรับให้บริการเอนด์พอยต์ที่เข้ากันได้กับ OpenAI และ WebSocket ยังไม่มีราคาแบบโฮสต์เพราะยังไม่มีผู้ให้บริการ inference รายใดลงรายการโมเดลนี้ คำถามเรื่องต้นทุนจึงอยู่ที่ว่าเวลาบน GPU ของคุณเองถูกกว่าอัตรารายชั่วโมงของ Google หรือไม่ ซึ่งสำหรับปริมาณการถอดเสียงแบบต่อเนื่องแทบทุกกรณีก็ถูกกว่าอยู่ดี — และคำถามเรื่องสัญญาอนุญาตก็แยกจากคำถามเรื่องต้นทุน เพราะน้ำหนักแบบ MIT เป็นของคุณเองที่จะเก็บไว้ได้ในแบบที่การสมัครใช้ API ไม่สามารถทำได้

ทั้งสองสิ่งนี้ไม่ได้แยกขาดจากกันในสแตกของระบบโปรดักชัน รูปแบบที่ใช้งานได้จริงสำหรับทีมที่ต้องการการถอดเสียงสดในวันนี้ คือการวางชั้น ASR ไว้หลังเอนด์พอยต์เดียว เพื่อให้การเลือกยังคงย้อนกลับได้: API เราเตอร์ที่มีโมเดลกว่า 200 รุ่นอยู่เบื้องหลัง ในราคารายการของผู้ให้บริการ — ไม่มีมาร์กอัป การเปลี่ยนแปลงราคาของผู้ให้บริการจึงมีผลจริงในวันเดียวกัน — พร้อมระบบ failover อัตโนมัติ คือชั้นที่ทำให้คุณใช้ measured API ของ Google เป็นค่าเริ่มต้น ขณะที่ทราฟฟิกจริงส่วนหนึ่งทดสอบ VibeVoice-ASR-Streaming-1.5B ทันทีที่มีผู้ให้บริการโฮสต์โมเดลดังกล่าว นั่นคือรูปแบบของ OrcaRouter และเป็นวิธีที่มีความเสี่ยงต่ำในการนำเช็คพอยต์ที่ยังไม่มีใครยืนยันความแม่นยำมาใช้

ใครควรเลือกอันไหน

เลือก Gemini 3.5 Transcribe หากคุณต้องการ API การถอดเสียงที่ใช้งานได้จริงในวันนี้ มีความแม่นยำที่เผยแพร่ต่อสาธารณะ ราคาต่อชั่วโมงที่คาดเดาได้ และไม่ต้องดูแล GPU — โดยเฉพาะอย่างยิ่งหากเสียงของคุณไม่อยู่ในสิบบภาษาที่ Microsoft ระบุไว้ หรือหากคุณต้องการ diarization และ timestamp ระดับคำของ endpoint แบบ pre-recorded สำหรับการถอดเสียงไฟล์ ขีดจำกัด 10 นาทีของเซสชัน Live เป็นข้อจำกัดจริงที่คุณต้องทดสอบกับกรณีการใช้งานของคุณก่อนตัดสินใจใช้สำหรับเซสชันสด

เลือก VibeVoice-ASR-Streaming-1.5B หากคุณโฮสต์เอง หากต้องการควบคุมน้ำหนักโมเดลและข้อมูลตามที่ MIT เปิดให้ใช้ หากต้องการความยาวเซสชันไม่จำกัด หรือหากฟีเจอร์เอาต์พุตสตรีมมิงแบบระบุว่าใครพูดอะไรและฮอตเวิร์ดเป็นสิ่งที่คุณอยากประเมินเป็นพิเศษ ต้องเตรียมงบประมาณสำหรับการติดตั้งจากซอร์สโค้ด น้ำหนักโมเดลประมาณ 5.6 GB บน GPU ของ NVIDIA และเกณฑ์การประเมินของคุณเอง — ไม่มี benchmark ให้อิง ดังนั้นเรื่องความแม่นยำจึงเป็นสิ่งที่คุณต้องตอบด้วยเสียงของคุณเอง

คำตัดสินหลังผ่านไปหนึ่งสัปดาห์: Google ส่งมอบผลิตภัณฑ์ที่ผ่านการวัดผลอย่างรอบคอบ ส่วน Microsoft ส่งมอบเดิมพันที่น่าสนใจ Gemini 3.5 Transcribe คือตัวเลือกเริ่มต้นที่ปลอดภัยกว่า และเป็นตัวที่มีตัวเลขจากบุคคลที่สามรองรับอยู่เบื้องหลัง ส่วน VibeVoice-ASR-Streaming-1.5B เป็นทางเลือกแบบเปิด โฮสต์เองได้ และไม่ผ่านการตรวจสอบใด ๆ เลย สิ่งที่ทำให้การเลือกนี้ต้นทุนต่ำก็คือ มันไม่จำเป็นต้องเป็นทางเลือกถาวร — ทำให้ ASR endpoint สลับเปลี่ยนได้ และ checkpoint ที่ปล่อยออกมาโดยไม่มี benchmark แม้แต่ตัวเดียว ก็สามารถสร้างหรือลดทราฟฟิกของคุณได้จากหลักฐานในบทถอดเสียงของคุณเอง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube