การ์ดฮีโร่ของบทความที่ระบุว่า 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC' พร้อมป้าย 'การเปรียบเทียบโมเดล' และคำบรรยายย่อย 'ทรูพุตเทียบกับความหน่วง' โดยมีชิปที่ระบุว่า 12,600 RTFx, WER แบบสตรีมมิ่ง 2.7%, พารามิเตอร์ 470M และ $0.20 ต่อชั่วโมงการสตรีม บนพื้นหลังไล่เฉดสีขาวไปน้ำเงินพร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Grok Voice Transcribe 2.0 กับ Granite Speech 5.0 470M TurboCTC: เร็วกว่าเรียลไทม์ 12,600 เท่า แตะครึ่งวินาที

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Granite Speech 5.0 470M TurboCTC ถอดเสียงประมาณ 3.5 ชั่วโมงต่อวินาทีบน H200 เพียงตัวเดียว และ Grok Voice Transcribe 2.0 ส่งคืนบทถอดความบางส่วนชุดแรกภายใน 0.49 วินาทีหลังจากคุณหยุดพูด ตัวเลขสองตัวนี้มักถูกนำมาใส่เคียงกันในโพสต์เปรียบเทียบ ราวกับว่าเป็นการวัดชนิดเดียวกัน ทั้งที่จริงไม่ใช่การวัดชนิดเดียวกันเลยแม้แต่น้อย — ตัวหนึ่งเป็นตัวเลขปริมาณงานในศูนย์ข้อมูลแบบแบตช์ที่ไม่ได้ผูกกับความหน่วง ส่วนอีกตัวเป็นตัวเลขความหน่วงของโมเดลที่ยังไม่มีใครเผยแพร่ปริมาณงาน IBM เปิดตัว Granite Speech 5.0 470M TurboCTC เมื่อวันที่ 25 สิงหาคม 2026 ภายใต้ Apache 2.0 โดยตัดตัวถอดรหัส language model ออกทั้งหมด และถอดรหัสด้วย CTC pass แบบ non-autoregressive เพียงรอบเดียว SpaceXAI เปิดตัว Grok Voice Transcribe 2.0 เมื่อวันที่ 18 กันยายน 2026 ในรูปแบบ managed API ราคา $0.10 ต่อชั่วโมงเสียงสำหรับแบบแบตช์ และ $0.20 ต่อชั่วโมงสำหรับสตรีมมิ่ง ทั้งสองเป็นโมเดลถอดเสียงที่ยอดเยี่ยม ซึ่งแก้ปัญหาคนละครึ่งที่ตรงข้ามกันของปัญหาเดียวกัน และการเลือกระหว่างสองตัวจะง่ายขึ้นเมื่อคุณเลิกเปรียบเทียบตัวเลขกันโดยตรง

12,600× เวลาจริง และคำที่ขยายความคำนั้น

ตัวเลขของ Granite คือ 12,600 RTFx ซึ่งวัดบน NVIDIA H200 ตัวเดียวด้วยการอนุมานแบบแบตช์ — เป็นตัวเลขของ IBM ที่รายงานตอนเปิดตัวและยังไม่มีการจำลองซ้ำโดยอิสระตั้งแต่นั้น RTFx คืออัตราส่วนระหว่างความยาวเสียงต่อเวลาที่ใช้ประมวลผล ดังนั้น 12,600 จึงหมายถึงเสียงประมาณ 3.5 ชั่วโมงต่อเวลาจริงหนึ่งวินาที กรอบที่ IBM เองใช้อธิบายคือสิ่งนี้มีอัตราการประมวลผลมากกว่า 20 เท่าของการเปิดตัว Granite Speech รุ่นก่อน ๆ ซึ่งนี่คือข้ออ้างที่สำคัญจริงในที่นี้: ความเร็วที่เพิ่มขึ้นมาจากการลดงานลง ไม่ใช่จากการเพิ่มฮาร์ดแวร์

สิ่งที่มันไม่ใช่ก็คือตัวเลขความหน่วง งานแบบแบตช์ที่ประมวลผลเสียง 3.5 ชั่วโมงต่อวินาที ก็ยังอาจใช้เวลานานในการส่งคืนโทเคนแรกของไฟล์ใดไฟล์หนึ่ง ขึ้นอยู่กับว่าการประกอบแบตช์เป็นอย่างไร และคุณป้อนเสียงให้มันมากแค่ไหนก่อนที่มันจะเริ่ม IBM ไม่ได้เผยแพร่ตัวเลขความหน่วงใด ๆ เลยสำหรับ TurboCTC บนลีดเดอร์บอร์ดแบบ far-field เช็คพอยต์ทั้งสองเป็นสองรายการที่เร็วที่สุด แต่ทรูพุตตรงนั้นวัดบน NVIDIA L4 ตัวเดียว ซึ่งเป็นตัวเร่งความเร็วที่ใกล้เคียงกับดาต้าเซ็นเตอร์ ไม่ใช่โทรศัพท์

เหตุผลที่เรื่องนี้สำคัญก็คือ โมเดลนี้ถูกวางตำแหน่งไว้อย่างชัดเจนสำหรับแล็ปท็อป โทรศัพท์ และอุปกรณ์เอดจ์ — ซึ่งเป็นกรอบที่ IBM เองกำหนด — และยังไม่มีใครเผยแพร่ประสิทธิภาพแบบสตรีมเดียวบนอุปกรณ์เหล่านั้นเลย จนกว่าจะมีใครทำได้ ให้มอง "12,600×" เป็นข้อความเกี่ยวกับว่าคุณสามารถประมวลผลข้อมูลย้อนหลังบน GPU ที่เช่าได้ในต้นทุนต่ำแค่ไหน ซึ่งเป็นข้ออ้างที่มีคุณค่าจริงและมีหลักฐานรองรับดี และไม่ใช่ข้อความเกี่ยวกับว่าผู้ใช้หนึ่งคนจะได้ประโยคหนึ่งกลับมาเร็วแค่ไหน

สิ่งที่ IBM เอาออกไป และสิ่งที่คุณต้องเสียไปเพราะมัน

TurboCTC เป็นดีไซน์แบบ encoder-only: ตัวเข้ารหัสเสียง Conformer 16 เลเยอร์ที่ฝึกด้วย CTC ถอดรหัสแบบ greedy ในรอบเดียวแบบไม่ใช้ออโต้รีเกรสซีฟ พร้อมเลเยอร์เอาต์พุตซับเวิร์ดขนาด 16,384 ยูนิต ไม่มีโมเดลภาษาอยู่ในลูป นั่นคือที่มาของความเร็ว และก็เป็นที่มาของการตัดทอนความสามารถเช่นกัน และไม่ใช่เรื่องเล็ก ๆ เลย เมื่อเทียบกับโมเดล Granite Speech รุ่นก่อน ๆ TurboCTC ตัดการแปลเสียง ตัดการไบแอสคำสำคัญ และไม่มาพร้อมเครื่องมือประทับเวลาหรือเครื่องหมายวรรคตอน

เมื่อนำมาเทียบกับสิ่งที่โมเดลแบบมีการจัดการรวมไว้ในราคาตามรายการแล้ว รูปร่างของการแลกเปลี่ยนก็จะชัดเจนขึ้น:

• การให้น้ำหนักคำศัพท์สำคัญ — Granite Speech 5.0 470M TurboCTC ไม่มีเลย เทียบกับสูงสุด 100 คำศัพท์สำคัญต่อคำขอใน Grok Voice Transcribe 2.0

• การประทับเวลาระดับคำ — ไม่มีให้ใช้กับ TurboCTC เทียบกับมีให้ใช้พร้อมคะแนนความเชื่อมั่น

• การแปลเสียงพูด — มีอยู่ในโมเดล Granite Speech รุ่นก่อนหน้า แต่ถูกนำออกในรุ่นนี้ เทียบกับไม่ได้เสนอไม่ว่าทางใด

• ความครอบคลุมของภาษา — ภาษาอังกฤษเท่านั้น เทียบกับการตรวจจับอัตโนมัติจากชุดอินพุตที่มีความหลากหลายทางภาษาอย่างกว้างขวาง พร้อมการรองรับการจัดรูปแบบใน 25 ภาษา

• การแยกผู้พูด — ปัญหาแยกต่างหากที่คุณต้องแก้เอง เทียบกับรวมอยู่ในราคาที่ขอ

• แชนเนล — หนึ่งสตรีมต่อรอบเทียบกับสูงสุดแปดช่องสัญญาณเสียงในหนึ่งคำขอ

• การปรับข้อความให้เป็นมาตรฐาน — ไม่ทำ เทียบกับการปรับข้อความให้เป็นมาตรฐานแบบย้อนกลับ (inverse text normalization) ที่เปลี่ยนวันที่ สกุลเงิน และหมายเลขโทรศัพท์ที่พูด ให้อยู่ในรูปแบบเขียน

• การปรับใช้ — ค่าน้ำหนักที่คุณดาวน์โหลดและรันเอง เทียบกับปลายทางแบบมีการจัดการใน us-east-1

อ่านรายการนั้นในฐานะคำอธิบายของผลิตภัณฑ์สองแบบที่แตกต่างกัน ไม่ใช่ในฐานะใบให้คะแนน การเอาการแยกผู้พูด การไบแอส และการปรับมาตรฐานออกไปคือสิ่งที่ทำให้ได้ปริมาณงานมา การเติมข้อมูลย้อนหลังแบบเป็นชุดของบันทึกเสียงการโทร 40,000 รายการเข้าสู่ดัชนีค้นหาไม่จำเป็นต้องมีการประทับเวลาหรือการแบ่งช่วงผู้พูด — มันต้องมีต้นทุนต่ำและต้องทำจนเสร็จ — และสำหรับงานนั้น ฟีเจอร์ที่ขาดหายไปไม่ใช่สิ่งที่ขาดหายไป แต่เป็นน้ำหนักที่ถูกลบออกไป

สิ่งที่ตรงกันข้ามเป็นจริงสำหรับทุกอย่างที่เป็นแบบเรียลไทม์ หากคุณกำลังสร้าง voice agent รายการคำสำคัญคือวิธีที่ทำให้ "Kubernetes" และ "Granola" รวมถึงชื่อลูกค้าถูกสะกดอย่างถูกต้อง และตัวถอดเสียงที่ไม่มีกลไกสร้างความเอนเอียงจะทำให้คำเหล่านี้ผิดทุกครั้ง โดยไม่มีวิธีแก้ไขนอกจาก fine-tuning ซึ่งเป็นโครงการคนละโครงการกับงบประมาณคนละก้อน คุณสมบัติที่ขาดไปเพียงอย่างเดียวนั้นทำให้ TurboCTC ใช้ไม่ได้กับงานบางประเภท และไม่เกี่ยวข้องกับงานประเภทอื่นๆ ซึ่งเป็นเหตุผลว่าทำไมการเปรียบเทียบโมเดลจึงมีประโยชน์น้อยกว่าการเปรียบเทียบภาระงาน

Screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 licence tag, the English and automatic-speech-recognition tags, a model summary describing a 470 million parameter conformer acoustic encoder trained with CTC on 60,000 hours of English audio and decoded non-autoregressively, and a bar chart of Open ASR leaderboard WER by test set — LS Clean 1.42, LS Other 2.66, SPGISpeech 3.18, Voxpopuli-Cleaned-AA 4.88, Earnings22-Cleaned-AA-chunked 6.69, AMI-Cleaned 7.52 and Gigaspeech-Cleaned 8.67 — with an average WER of 5.00% and an average RTFx of 13,042.98 measured on one H200.

การเปรียบเทียบความแม่นยำที่ไม่สามารถทำได้อย่างหมดจด

IBM รายงานอัตราความผิดพลาดระดับคำแบบรวม 5.00% สำหรับเช็คพอยต์ Apache 2.0 และ 4.85% สำหรับรุ่นพี่น้องที่ไม่ใช่เชิงพาณิชย์บนลีดเดอร์บอร์ด Open ASR เหนือชุดข้อมูลภาษาอังกฤษแบบสั้นสาธารณะ นี่เป็นตัวเลขแบบแบตช์บนกระดานที่มีการประเมินรวมถึง AMI และ Earnings22 และชุดสนทนาแบบยาว และเป็นตัวเลขที่ผู้ขายรายงานเอง — ผ่านเครื่องมือของลีดเดอร์บอร์ดแล้ว แต่ยังไม่ถูกนำไปรวมในตารางทางการ ซึ่งรวมชุดทดสอบส่วนตัวไว้ด้วย รายละเอียดแยกตามชุดที่เผยแพร่บนการ์ดโมเดลนั้นน่าอ่าน เพราะค่าเฉลี่ยซ่อนรายละเอียดไว้มาก: LS Clean 1.42%, LS Other 2.66%, SPGISpeech 3.18%, Voxpopuli-Cleaned-AA 4.88%, Earnings22-Cleaned-AA-chunked 6.69%, AMI-Cleaned 7.52% และ Gigaspeech-Cleaned 8.67% เฉลี่ยได้ 5.00% พอดี การ์ดเดียวกันระบุค่าเฉลี่ย RTFx ที่ 13,042.98 ซึ่งวัดบน H200 หนึ่งตัว — สูงกว่าตัวเลข 12,600 ที่โพสต์เปิดตัวของ IBM ใช้ และตัวเลขทั้งสองก็เป็นของบริษัทเดียวกัน จากสัปดาห์เดียวกัน บนฮาร์ดแวร์เดียวกัน

ตัวเลข final-transcript 2.7% ของ Grok Voice Transcribe 2.0 ไม่ใช่การวัดที่เทียบเคียงกันได้ โดยมาจากบอร์ด AA-WER Streaming ของ Artificial Analysis ซึ่งเป็นค่าผสมแบบถ่วงน้ำหนักของ AA-AgentTalk ที่ 50%, VoxPopuli ที่ 25% และ Earnings22 ที่ 25% — ประมาณแปดชั่วโมงของเสียงสนทนาภาษาอังกฤษที่ถ่วงน้ำหนักตามเอเจนต์ วัดผ่านอินเทอร์เฟซแบบสตรีมมิง ชุดข้อมูลต่างกัน การถ่วงน้ำหนักต่างกัน รูปแบบการทำงานต่างกัน การนำ 2.7% ไปวางข้าง 5.00% แล้วสรุปว่าโมเดลแบบ managed มีความแม่นยำมากกว่าเกือบสองเท่า เป็นความผิดพลาดที่พบบ่อยที่สุดในบรรดาความผิดพลาดทั้งหมดที่อาจเกิดขึ้นได้ในการเปรียบเทียบนี้

สิ่งที่พูดได้อย่างตรงไปตรงมานั้นแคบกว่า แต่ก็ยังมีประโยชน์ โมเดลทั้งสองมีความแข็งแกร่งกับเสียงที่แต่ละตัวได้รับการวัดมา Grok Voice Transcribe 2.0 ครองอันดับหนึ่งบนกระดานจัดอันดับสตรีมมิ่งที่ดำเนินการโดยอิสระ ซึ่งโมเดลอื่น ๆ ก็ถูกวัดบนกระดานนี้เช่นกัน ทำให้อันดับของมันตรวจสอบได้ แม้ว่าค่าที่แน่นอนของมันจะไม่สามารถนำไปใช้เทียบข้ามบริบทได้ Granite Speech 5.0 470M TurboCTC มีค่า WER รวมบนชุด ASR เปิดมาตรฐาน และแยกต่างหาก มีผลลัพธ์ far-field โดยเช็กพอยต์ที่ไม่ใช่เชิงพาณิชย์อยู่อันดับที่ห้าด้านความแม่นยำ และตัว Apache อยู่อันดับที่เก้า — วัดบนเสียงที่มีสัญญาณรบกวนและเสียงก้อง ซึ่งเป็นเงื่อนไขที่ยากที่สุดในชุดนี้ และอาจกล่าวได้ว่าเป็นสิ่งที่ตรงไปตรงมาที่สุดในตัวเลขของโมเดลทั้งสอง

หากเสียงของคุณเป็นเสียงพูดภาษาอังกฤษแบบอ่านที่สะอาด ช่องว่างความแม่นยำระหว่างสองตัวนี้น่าจะเล็กกว่าที่ตำแหน่งบนตารางอันดับชี้ให้เห็น หากเสียงมีสัญญาณรบกวน มีสำเนียง เป็นเสียงจากโทรศัพท์ หรือไม่ใช่ภาษาอังกฤษ ไม่ว่าตารางไหนก็ไม่ได้บอกอะไรคุณมากนัก และชุดทดสอบของคุณเองเท่านั้นที่เป็นเครื่องมือเดียวที่บอกได้

เวทฟรี เทียบกับ $1.67 ต่อชั่วโมง

การเปรียบเทียบต้นทุนเป็นจุดเดียวที่สองโมเดลนี้แยกออกจากกันได้ง่ายจริง ๆ และตัวเลขที่คนมักอ้างถึงก็ผิดทั้งสองทาง

• การถอดเสียงแบบกลุ่ม — Grok Voice Transcribe 2.0 ราคา 0.10 ดอลลาร์ต่อชั่วโมงเสียง หรือประมาณ 1.67 ดอลลาร์ต่อ 1,000 นาที เทียบกับ Granite Speech 5.0 470M TurboCTC ที่ไม่มีค่าใบอนุญาต บวกค่าเวลา GPU

• การสตรีม — $0.20 ต่อชั่วโมงเสียง ประมาณ $3.33 ต่อ 1,000 นาที เทียบกับกรณีที่ IBM ไม่ได้เผยแพร่เส้นทางการสตรีมแบบโฮสต์

• สัญญาอนุญาต — API เชิงพาณิชย์ที่ไม่มีเวต เทียบกับ Apache 2.0 สำหรับเช็กพอยต์หลัก และ CC-BY-NC-SA-4.0 สำหรับรุ่นที่ไม่ใช่เชิงพาณิชย์ซึ่งแม่นยำกว่า

“Free” ทำงานหนักมากในแถวแรกนั้น โมเดลแบบ encoder-only ขนาด 470M เล็กพอที่จะรันบนฮาร์ดแวร์ระดับธรรมดาได้ — นั่นคือจุดประสงค์ของการออกแบบ และเป็นเหตุผลที่ IBM เทรนมันในสิบวันด้วย H100 แปดตัว แล้วปล่อยออกมาให้ใช้กับ `transformers>=5.16.0` พร้อมเดโม WebGPU — แต่ก็ยังมีใครสักคนที่ต้องจ่ายค่า GPU, สแตกการให้บริการ, การสเกลอัตโนมัติ, การลองใหม่ และการหมุนเวียนเวร on-call ที่ปริมาณน้อย ราคาแบบ managed มักถูกกว่าเวลาทางวิศวกรรม ที่ปริมาณมากและสม่ำเสมอ เส้นทางเช่าฮาร์ดแวร์จะเป็นฝ่ายชนะ และจุดเปลี่ยนผ่านเป็นฟังก์ชันของอัตราการใช้งานของคุณ ไม่ใช่ปริมาณเสียงของคุณ: GPU ที่คุณทำให้ busy อยู่เสมอมีราคาต่อชั่วโมงที่ถูก ส่วนตัวที่คุณอุ่นไว้สำหรับทราฟฟิกช่วงพีคไม่ใช่

มีรายละเอียดด้านสิทธิ์การใช้งานหนึ่งอย่างที่ควรกล่าวถึงก่อนที่ใครจะออกแบบสถาปัตยกรรมโดยอิงกับมัน เช็กพอยต์ที่แม่นยำกว่าจากสองตัว ซึ่งอยู่ที่ 4.85% WER เป็นตัวที่ไม่ใช่เชิงพาณิชย์ภายใต้ CC-BY-NC-SA-4.0 ส่วนเช็กพอยต์ Apache 2.0 คือตัวที่ 5.00% และเป็นตัวที่คุณสามารถนำไปใช้ในผลิตภัณฑ์ได้ นั่นคือความแตกต่างด้านความแม่นยำ 0.15 จุดที่ต้องแลกมาด้วยสิทธิ์ในการใช้โมเดลนี้เลย และยังหมายความว่าการเปรียบเทียบใดก็ตามที่อ้าง 4.85% สำหรับ "Granite Speech 5.0" แล้วพูดถึงการนำไปใช้เชิงพาณิชย์ กำลังอ้างเช็กพอยต์ผิดตัว

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: release September 18 2026, final WER 2.7% streaming, first partial 0.49s, 100 key terms included, diarization included, $0.20 per streaming hour. The right column gives Granite Speech 5.0 470M TurboCTC the rows: release August 25 2026, mean WER 5.00% Apache, speed 12,600 RTFx batched, no key terms, timestamps not shipped, Apache-2.0 weights where you pay compute. A footer reads 'Granite figures IBM-reported; Grok figures per Artificial Analysis.'

กฎการตัดสินใจ

สามคำถามแยกสองโมเดลนี้ออกจากกันได้เร็วกว่าตาราง benchmark ใด ๆ

ทรานสคริปต์ถูกใช้งานแบบสด ๆ ในขณะที่ผู้พูดยังพูดอยู่หรือไม่? ถ้าใช่ TurboCTC ไม่ใช่ตัวเลือก — ไม่ใช่เพราะมันช้า แต่เพราะมันไม่มีอินเทอร์เฟซแบบสตรีมมิงและไม่มีเอาต์พุตแบบบางส่วน และทรานสคริปต์แบบบางส่วนเป็นการตัดสินใจเชิงสถาปัตยกรรมที่แตกต่างจากการถอดรหัสแบบแบตช์ที่รวดเร็ว ถ้าไม่ใช่ ข้อได้เปรียบด้านทรูพุตก็กลายเป็นเรื่องทั้งหมด และโมเดลของ IBM นั้นยากมากที่จะเอาชนะในเรื่องต้นทุนต่อชั่วโมงของเสียงที่ประมวลผล

งานนี้ต้องใช้คำศัพท์เฉพาะทางหรือไม่ ถ้าใช่ โมเดลที่มี biasing ย่อมได้เปรียบโดยปริยาย และการที่ TurboCTC ไม่มี key-term biasing ก็ถือเป็นเหตุให้ตกรอบทันที ไม่ใช่แค่เรื่องไม่สะดวกเท่านั้น ถ้าไม่ใช่ คุณก็กำลังจ่ายเงินซื้อฟีเจอร์ที่คุณจะไม่ได้ใช้ในฝั่ง managed

เสียงที่ได้เป็นเสียงพูดภาษาอังกฤษแบบอ่านจากข้อความบนฮาร์ดแวร์ที่ใช้ได้หรือไม่? ถ้าใช่ ทั้งสองก็แข็งแกร่ง และการเลือกขึ้นอยู่กับเรื่องการดำเนินงาน ถ้าไม่ใช่ บอร์ดทั้งสองก็ไม่ให้ข้อมูลที่เป็นประโยชน์ และมีเพียงการประเมินของคุณเองเท่านั้นที่สำคัญ

ไม่ว่าผลจะออกมาทางไหน ชั้นปฏิบัติการคือจุดที่การตัดสินใจนี้ถูกลง OrcaRouter วางโมเดลกว่า 200 ตัวไว้เบื้องหลังคีย์เดียวที่เข้ากันได้กับ OpenAI พร้อมระบบสลับสำรองอัตโนมัติข้ามผู้ให้บริการ ดังนั้นการที่ endpoint เสียงแบบ managed ในภูมิภาคเดียวมีปัญหาช่วงบ่ายก็จะไม่ใช่ downtime ของคุณอีกต่อไป และราคาตามรายการของผู้ให้บริการก็ส่งผ่านมาที่เราด้วยมาร์กอัป 0% ซึ่งหมายความว่าการเปลี่ยนแปลงราคาจากผู้ขายหรือ checkpoint ใหม่จะพร้อมใช้งานฝั่งเราภายในวันเดียวกัน สำหรับงานที่คำตอบที่ถูกต้องยังไม่ชัดเจนจริง ๆ สิ่งนี้ช่วยลดต้นทุนของการตัดสินใจผิด: ลอง benchmark ทั้งสองแบบกับเสียงของคุณเองผ่าน endpoint เดียว เก็บตัวที่ชนะไว้ แล้วเปลี่ยนสตริงโมเดลเมื่อตัวถัดไปเปิดตัว

Screenshot of the SpaceXAI Speech to Text API documentation page showing the Quick Start section with a Python example posting an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0, alongside the API console navigation and an on-this-page index listing Supported Audio Formats, Limits, Streaming Speech-to-Text and Smart Turn.

แบบสั้น ๆ: Granite Speech 5.0 470M TurboCTC เป็นคำตอบที่ดีกว่าสำหรับคำถามที่ว่า “ถอดเสียงทุกอย่างที่เราเคยบันทึกไว้ ให้มีต้นทุนต่ำ บนฮาร์ดแวร์ที่เราควบคุมเอง” และ Grok Voice Transcribe 2.0 เป็นคำตอบที่ดีกว่าสำหรับคำถามที่ว่า “ถอดเสียงสิ่งนี้แบบทันทีที่เกิดขึ้น อย่างแม่นยำ โดยที่เราไม่ต้องรันสแตกให้บริการเอง” ตัวเลขพาดหัว 12,600× และตัวเลขพาดหัว 0.49 วินาที ต่างก็เป็นความจริง และไม่มีตัวเลขใดเป็นหลักฐานเกี่ยวกับอีกตัวเลขหนึ่ง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube