
Grok Voice Transcribe 2.0 กับ Granite Speech 5.0 470M TurboCTC: เร็วกว่าเรียลไทม์ 12,600 เท่า แตะครึ่งวินาที
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Granite Speech 5.0 470M TurboCTC ถอดเสียงประมาณ 3.5 ชั่วโมงต่อวินาทีบน H200 เพียงตัวเดียว และ Grok Voice Transcribe 2.0 ส่งคืนบทถอดความบางส่วนชุดแรกภายใน 0.49 วินาทีหลังจากคุณหยุดพูด ตัวเลขสองตัวนี้มักถูกนำมาใส่เคียงกันในโพสต์เปรียบเทียบ ราวกับว่าเป็นการวัดชนิดเดียวกัน ทั้งที่จริงไม่ใช่การวัดชนิดเดียวกันเลยแม้แต่น้อย — ตัวหนึ่งเป็นตัวเลขปริมาณงานในศูนย์ข้อมูลแบบแบตช์ที่ไม่ได้ผูกกับความหน่วง ส่วนอีกตัวเป็นตัวเลขความหน่วงของโมเดลที่ยังไม่มีใครเผยแพร่ปริมาณงาน IBM เปิดตัว Granite Speech 5.0 470M TurboCTC เมื่อวันที่ 25 สิงหาคม 2026 ภายใต้ Apache 2.0 โดยตัดตัวถอดรหัส language model ออกทั้งหมด และถอดรหัสด้วย CTC pass แบบ non-autoregressive เพียงรอบเดียว SpaceXAI เปิดตัว Grok Voice Transcribe 2.0 เมื่อวันที่ 18 กันยายน 2026 ในรูปแบบ managed API ราคา $0.10 ต่อชั่วโมงเสียงสำหรับแบบแบตช์ และ $0.20 ต่อชั่วโมงสำหรับสตรีมมิ่ง ทั้งสองเป็นโมเดลถอดเสียงที่ยอดเยี่ยม ซึ่งแก้ปัญหาคนละครึ่งที่ตรงข้ามกันของปัญหาเดียวกัน และการเลือกระหว่างสองตัวจะง่ายขึ้นเมื่อคุณเลิกเปรียบเทียบตัวเลขกันโดยตรง
12,600× เวลาจริง และคำที่ขยายความคำนั้น
ตัวเลขของ Granite คือ 12,600 RTFx ซึ่งวัดบน NVIDIA H200 ตัวเดียวด้วยการอนุมานแบบแบตช์ — เป็นตัวเลขของ IBM ที่รายงานตอนเปิดตัวและยังไม่มีการจำลองซ้ำโดยอิสระตั้งแต่นั้น RTFx คืออัตราส่วนระหว่างความยาวเสียงต่อเวลาที่ใช้ประมวลผล ดังนั้น 12,600 จึงหมายถึงเสียงประมาณ 3.5 ชั่วโมงต่อเวลาจริงหนึ่งวินาที กรอบที่ IBM เองใช้อธิบายคือสิ่งนี้มีอัตราการประมวลผลมากกว่า 20 เท่าของการเปิดตัว Granite Speech รุ่นก่อน ๆ ซึ่งนี่คือข้ออ้างที่สำคัญจริงในที่นี้: ความเร็วที่เพิ่มขึ้นมาจากการลดงานลง ไม่ใช่จากการเพิ่มฮาร์ดแวร์
สิ่งที่มันไม่ใช่ก็คือตัวเลขความหน่วง งานแบบแบตช์ที่ประมวลผลเสียง 3.5 ชั่วโมงต่อวินาที ก็ยังอาจใช้เวลานานในการส่งคืนโทเคนแรกของไฟล์ใดไฟล์หนึ่ง ขึ้นอยู่กับว่าการประกอบแบตช์เป็นอย่างไร และคุณป้อนเสียงให้มันมากแค่ไหนก่อนที่มันจะเริ่ม IBM ไม่ได้เผยแพร่ตัวเลขความหน่วงใด ๆ เลยสำหรับ TurboCTC บนลีดเดอร์บอร์ดแบบ far-field เช็คพอยต์ทั้งสองเป็นสองรายการที่เร็วที่สุด แต่ทรูพุตตรงนั้นวัดบน NVIDIA L4 ตัวเดียว ซึ่งเป็นตัวเร่งความเร็วที่ใกล้เคียงกับดาต้าเซ็นเตอร์ ไม่ใช่โทรศัพท์
เหตุผลที่เรื่องนี้สำคัญก็คือ โมเดลนี้ถูกวางตำแหน่งไว้อย่างชัดเจนสำหรับแล็ปท็อป โทรศัพท์ และอุปกรณ์เอดจ์ — ซึ่งเป็นกรอบที่ IBM เองกำหนด — และยังไม่มีใครเผยแพร่ประสิทธิภาพแบบสตรีมเดียวบนอุปกรณ์เหล่านั้นเลย จนกว่าจะมีใครทำได้ ให้มอง "12,600×" เป็นข้อความเกี่ยวกับว่าคุณสามารถประมวลผลข้อมูลย้อนหลังบน GPU ที่เช่าได้ในต้นทุนต่ำแค่ไหน ซึ่งเป็นข้ออ้างที่มีคุณค่าจริงและมีหลักฐานรองรับดี และไม่ใช่ข้อความเกี่ยวกับว่าผู้ใช้หนึ่งคนจะได้ประโยคหนึ่งกลับมาเร็วแค่ไหน
สิ่งที่ IBM เอาออกไป และสิ่งที่คุณต้องเสียไปเพราะมัน
TurboCTC เป็นดีไซน์แบบ encoder-only: ตัวเข้ารหัสเสียง Conformer 16 เลเยอร์ที่ฝึกด้วย CTC ถอดรหัสแบบ greedy ในรอบเดียวแบบไม่ใช้ออโต้รีเกรสซีฟ พร้อมเลเยอร์เอาต์พุตซับเวิร์ดขนาด 16,384 ยูนิต ไม่มีโมเดลภาษาอยู่ในลูป นั่นคือที่มาของความเร็ว และก็เป็นที่มาของการตัดทอนความสามารถเช่นกัน และไม่ใช่เรื่องเล็ก ๆ เลย เมื่อเทียบกับโมเดล Granite Speech รุ่นก่อน ๆ TurboCTC ตัดการแปลเสียง ตัดการไบแอสคำสำคัญ และไม่มาพร้อมเครื่องมือประทับเวลาหรือเครื่องหมายวรรคตอน
เมื่อนำมาเทียบกับสิ่งที่โมเดลแบบมีการจัดการรวมไว้ในราคาตามรายการแล้ว รูปร่างของการแลกเปลี่ยนก็จะชัดเจนขึ้น:
• การให้น้ำหนักคำศัพท์สำคัญ — Granite Speech 5.0 470M TurboCTC ไม่มีเลย เทียบกับสูงสุด 100 คำศัพท์สำคัญต่อคำขอใน Grok Voice Transcribe 2.0
• การประทับเวลาระดับคำ — ไม่มีให้ใช้กับ TurboCTC เทียบกับมีให้ใช้พร้อมคะแนนความเชื่อมั่น
• การแปลเสียงพูด — มีอยู่ในโมเดล Granite Speech รุ่นก่อนหน้า แต่ถูกนำออกในรุ่นนี้ เทียบกับไม่ได้เสนอไม่ว่าทางใด
• ความครอบคลุมของภาษา — ภาษาอังกฤษเท่านั้น เทียบกับการตรวจจับอัตโนมัติจากชุดอินพุตที่มีความหลากหลายทางภาษาอย่างกว้างขวาง พร้อมการรองรับการจัดรูปแบบใน 25 ภาษา
• การแยกผู้พูด — ปัญหาแยกต่างหากที่คุณต้องแก้เอง เทียบกับรวมอยู่ในราคาที่ขอ
• แชนเนล — หนึ่งสตรีมต่อรอบเทียบกับสูงสุดแปดช่องสัญญาณเสียงในหนึ่งคำขอ
• การปรับข้อความให้เป็นมาตรฐาน — ไม่ทำ เทียบกับการปรับข้อความให้เป็นมาตรฐานแบบย้อนกลับ (inverse text normalization) ที่เปลี่ยนวันที่ สกุลเงิน และหมายเลขโทรศัพท์ที่พูด ให้อยู่ในรูปแบบเขียน
• การปรับใช้ — ค่าน้ำหนักที่คุณดาวน์โหลดและรันเอง เทียบกับปลายทางแบบมีการจัดการใน us-east-1
อ่านรายการนั้นในฐานะคำอธิบายของผลิตภัณฑ์สองแบบที่แตกต่างกัน ไม่ใช่ในฐานะใบให้คะแนน การเอาการแยกผู้พูด การไบแอส และการปรับมาตรฐานออกไปคือสิ่งที่ทำให้ได้ปริมาณงานมา การเติมข้อมูลย้อนหลังแบบเป็นชุดของบันทึกเสียงการโทร 40,000 รายการเข้าสู่ดัชนีค้นหาไม่จำเป็นต้องมีการประทับเวลาหรือการแบ่งช่วงผู้พูด — มันต้องมีต้นทุนต่ำและต้องทำจนเสร็จ — และสำหรับงานนั้น ฟีเจอร์ที่ขาดหายไปไม่ใช่สิ่งที่ขาดหายไป แต่เป็นน้ำหนักที่ถูกลบออกไป
สิ่งที่ตรงกันข้ามเป็นจริงสำหรับทุกอย่างที่เป็นแบบเรียลไทม์ หากคุณกำลังสร้าง voice agent รายการคำสำคัญคือวิธีที่ทำให้ "Kubernetes" และ "Granola" รวมถึงชื่อลูกค้าถูกสะกดอย่างถูกต้อง และตัวถอดเสียงที่ไม่มีกลไกสร้างความเอนเอียงจะทำให้คำเหล่านี้ผิดทุกครั้ง โดยไม่มีวิธีแก้ไขนอกจาก fine-tuning ซึ่งเป็นโครงการคนละโครงการกับงบประมาณคนละก้อน คุณสมบัติที่ขาดไปเพียงอย่างเดียวนั้นทำให้ TurboCTC ใช้ไม่ได้กับงานบางประเภท และไม่เกี่ยวข้องกับงานประเภทอื่นๆ ซึ่งเป็นเหตุผลว่าทำไมการเปรียบเทียบโมเดลจึงมีประโยชน์น้อยกว่าการเปรียบเทียบภาระงาน

การเปรียบเทียบความแม่นยำที่ไม่สามารถทำได้อย่างหมดจด
IBM รายงานอัตราความผิดพลาดระดับคำแบบรวม 5.00% สำหรับเช็คพอยต์ Apache 2.0 และ 4.85% สำหรับรุ่นพี่น้องที่ไม่ใช่เชิงพาณิชย์บนลีดเดอร์บอร์ด Open ASR เหนือชุดข้อมูลภาษาอังกฤษแบบสั้นสาธารณะ นี่เป็นตัวเลขแบบแบตช์บนกระดานที่มีการประเมินรวมถึง AMI และ Earnings22 และชุดสนทนาแบบยาว และเป็นตัวเลขที่ผู้ขายรายงานเอง — ผ่านเครื่องมือของลีดเดอร์บอร์ดแล้ว แต่ยังไม่ถูกนำไปรวมในตารางทางการ ซึ่งรวมชุดทดสอบส่วนตัวไว้ด้วย รายละเอียดแยกตามชุดที่เผยแพร่บนการ์ดโมเดลนั้นน่าอ่าน เพราะค่าเฉลี่ยซ่อนรายละเอียดไว้มาก: LS Clean 1.42%, LS Other 2.66%, SPGISpeech 3.18%, Voxpopuli-Cleaned-AA 4.88%, Earnings22-Cleaned-AA-chunked 6.69%, AMI-Cleaned 7.52% และ Gigaspeech-Cleaned 8.67% เฉลี่ยได้ 5.00% พอดี การ์ดเดียวกันระบุค่าเฉลี่ย RTFx ที่ 13,042.98 ซึ่งวัดบน H200 หนึ่งตัว — สูงกว่าตัวเลข 12,600 ที่โพสต์เปิดตัวของ IBM ใช้ และตัวเลขทั้งสองก็เป็นของบริษัทเดียวกัน จากสัปดาห์เดียวกัน บนฮาร์ดแวร์เดียวกัน
ตัวเลข final-transcript 2.7% ของ Grok Voice Transcribe 2.0 ไม่ใช่การวัดที่เทียบเคียงกันได้ โดยมาจากบอร์ด AA-WER Streaming ของ Artificial Analysis ซึ่งเป็นค่าผสมแบบถ่วงน้ำหนักของ AA-AgentTalk ที่ 50%, VoxPopuli ที่ 25% และ Earnings22 ที่ 25% — ประมาณแปดชั่วโมงของเสียงสนทนาภาษาอังกฤษที่ถ่วงน้ำหนักตามเอเจนต์ วัดผ่านอินเทอร์เฟซแบบสตรีมมิง ชุดข้อมูลต่างกัน การถ่วงน้ำหนักต่างกัน รูปแบบการทำงานต่างกัน การนำ 2.7% ไปวางข้าง 5.00% แล้วสรุปว่าโมเดลแบบ managed มีความแม่นยำมากกว่าเกือบสองเท่า เป็นความผิดพลาดที่พบบ่อยที่สุดในบรรดาความผิดพลาดทั้งหมดที่อาจเกิดขึ้นได้ในการเปรียบเทียบนี้
สิ่งที่พูดได้อย่างตรงไปตรงมานั้นแคบกว่า แต่ก็ยังมีประโยชน์ โมเดลทั้งสองมีความแข็งแกร่งกับเสียงที่แต่ละตัวได้รับการวัดมา Grok Voice Transcribe 2.0 ครองอันดับหนึ่งบนกระดานจัดอันดับสตรีมมิ่งที่ดำเนินการโดยอิสระ ซึ่งโมเดลอื่น ๆ ก็ถูกวัดบนกระดานนี้เช่นกัน ทำให้อันดับของมันตรวจสอบได้ แม้ว่าค่าที่แน่นอนของมันจะไม่สามารถนำไปใช้เทียบข้ามบริบทได้ Granite Speech 5.0 470M TurboCTC มีค่า WER รวมบนชุด ASR เปิดมาตรฐาน และแยกต่างหาก มีผลลัพธ์ far-field โดยเช็กพอยต์ที่ไม่ใช่เชิงพาณิชย์อยู่อันดับที่ห้าด้านความแม่นยำ และตัว Apache อยู่อันดับที่เก้า — วัดบนเสียงที่มีสัญญาณรบกวนและเสียงก้อง ซึ่งเป็นเงื่อนไขที่ยากที่สุดในชุดนี้ และอาจกล่าวได้ว่าเป็นสิ่งที่ตรงไปตรงมาที่สุดในตัวเลขของโมเดลทั้งสอง
หากเสียงของคุณเป็นเสียงพูดภาษาอังกฤษแบบอ่านที่สะอาด ช่องว่างความแม่นยำระหว่างสองตัวนี้น่าจะเล็กกว่าที่ตำแหน่งบนตารางอันดับชี้ให้เห็น หากเสียงมีสัญญาณรบกวน มีสำเนียง เป็นเสียงจากโทรศัพท์ หรือไม่ใช่ภาษาอังกฤษ ไม่ว่าตารางไหนก็ไม่ได้บอกอะไรคุณมากนัก และชุดทดสอบของคุณเองเท่านั้นที่เป็นเครื่องมือเดียวที่บอกได้
เวทฟรี เทียบกับ $1.67 ต่อชั่วโมง
การเปรียบเทียบต้นทุนเป็นจุดเดียวที่สองโมเดลนี้แยกออกจากกันได้ง่ายจริง ๆ และตัวเลขที่คนมักอ้างถึงก็ผิดทั้งสองทาง
• การถอดเสียงแบบกลุ่ม — Grok Voice Transcribe 2.0 ราคา 0.10 ดอลลาร์ต่อชั่วโมงเสียง หรือประมาณ 1.67 ดอลลาร์ต่อ 1,000 นาที เทียบกับ Granite Speech 5.0 470M TurboCTC ที่ไม่มีค่าใบอนุญาต บวกค่าเวลา GPU
• การสตรีม — $0.20 ต่อชั่วโมงเสียง ประมาณ $3.33 ต่อ 1,000 นาที เทียบกับกรณีที่ IBM ไม่ได้เผยแพร่เส้นทางการสตรีมแบบโฮสต์
• สัญญาอนุญาต — API เชิงพาณิชย์ที่ไม่มีเวต เทียบกับ Apache 2.0 สำหรับเช็กพอยต์หลัก และ CC-BY-NC-SA-4.0 สำหรับรุ่นที่ไม่ใช่เชิงพาณิชย์ซึ่งแม่นยำกว่า
“Free” ทำงานหนักมากในแถวแรกนั้น โมเดลแบบ encoder-only ขนาด 470M เล็กพอที่จะรันบนฮาร์ดแวร์ระดับธรรมดาได้ — นั่นคือจุดประสงค์ของการออกแบบ และเป็นเหตุผลที่ IBM เทรนมันในสิบวันด้วย H100 แปดตัว แล้วปล่อยออกมาให้ใช้กับ `transformers>=5.16.0` พร้อมเดโม WebGPU — แต่ก็ยังมีใครสักคนที่ต้องจ่ายค่า GPU, สแตกการให้บริการ, การสเกลอัตโนมัติ, การลองใหม่ และการหมุนเวียนเวร on-call ที่ปริมาณน้อย ราคาแบบ managed มักถูกกว่าเวลาทางวิศวกรรม ที่ปริมาณมากและสม่ำเสมอ เส้นทางเช่าฮาร์ดแวร์จะเป็นฝ่ายชนะ และจุดเปลี่ยนผ่านเป็นฟังก์ชันของอัตราการใช้งานของคุณ ไม่ใช่ปริมาณเสียงของคุณ: GPU ที่คุณทำให้ busy อยู่เสมอมีราคาต่อชั่วโมงที่ถูก ส่วนตัวที่คุณอุ่นไว้สำหรับทราฟฟิกช่วงพีคไม่ใช่
มีรายละเอียดด้านสิทธิ์การใช้งานหนึ่งอย่างที่ควรกล่าวถึงก่อนที่ใครจะออกแบบสถาปัตยกรรมโดยอิงกับมัน เช็กพอยต์ที่แม่นยำกว่าจากสองตัว ซึ่งอยู่ที่ 4.85% WER เป็นตัวที่ไม่ใช่เชิงพาณิชย์ภายใต้ CC-BY-NC-SA-4.0 ส่วนเช็กพอยต์ Apache 2.0 คือตัวที่ 5.00% และเป็นตัวที่คุณสามารถนำไปใช้ในผลิตภัณฑ์ได้ นั่นคือความแตกต่างด้านความแม่นยำ 0.15 จุดที่ต้องแลกมาด้วยสิทธิ์ในการใช้โมเดลนี้เลย และยังหมายความว่าการเปรียบเทียบใดก็ตามที่อ้าง 4.85% สำหรับ "Granite Speech 5.0" แล้วพูดถึงการนำไปใช้เชิงพาณิชย์ กำลังอ้างเช็กพอยต์ผิดตัว

กฎการตัดสินใจ
สามคำถามแยกสองโมเดลนี้ออกจากกันได้เร็วกว่าตาราง benchmark ใด ๆ
ทรานสคริปต์ถูกใช้งานแบบสด ๆ ในขณะที่ผู้พูดยังพูดอยู่หรือไม่? ถ้าใช่ TurboCTC ไม่ใช่ตัวเลือก — ไม่ใช่เพราะมันช้า แต่เพราะมันไม่มีอินเทอร์เฟซแบบสตรีมมิงและไม่มีเอาต์พุตแบบบางส่วน และทรานสคริปต์แบบบางส่วนเป็นการตัดสินใจเชิงสถาปัตยกรรมที่แตกต่างจากการถอดรหัสแบบแบตช์ที่รวดเร็ว ถ้าไม่ใช่ ข้อได้เปรียบด้านทรูพุตก็กลายเป็นเรื่องทั้งหมด และโมเดลของ IBM นั้นยากมากที่จะเอาชนะในเรื่องต้นทุนต่อชั่วโมงของเสียงที่ประมวลผล
งานนี้ต้องใช้คำศัพท์เฉพาะทางหรือไม่ ถ้าใช่ โมเดลที่มี biasing ย่อมได้เปรียบโดยปริยาย และการที่ TurboCTC ไม่มี key-term biasing ก็ถือเป็นเหตุให้ตกรอบทันที ไม่ใช่แค่เรื่องไม่สะดวกเท่านั้น ถ้าไม่ใช่ คุณก็กำลังจ่ายเงินซื้อฟีเจอร์ที่คุณจะไม่ได้ใช้ในฝั่ง managed
เสียงที่ได้เป็นเสียงพูดภาษาอังกฤษแบบอ่านจากข้อความบนฮาร์ดแวร์ที่ใช้ได้หรือไม่? ถ้าใช่ ทั้งสองก็แข็งแกร่ง และการเลือกขึ้นอยู่กับเรื่องการดำเนินงาน ถ้าไม่ใช่ บอร์ดทั้งสองก็ไม่ให้ข้อมูลที่เป็นประโยชน์ และมีเพียงการประเมินของคุณเองเท่านั้นที่สำคัญ
ไม่ว่าผลจะออกมาทางไหน ชั้นปฏิบัติการคือจุดที่การตัดสินใจนี้ถูกลง OrcaRouter วางโมเดลกว่า 200 ตัวไว้เบื้องหลังคีย์เดียวที่เข้ากันได้กับ OpenAI พร้อมระบบสลับสำรองอัตโนมัติข้ามผู้ให้บริการ ดังนั้นการที่ endpoint เสียงแบบ managed ในภูมิภาคเดียวมีปัญหาช่วงบ่ายก็จะไม่ใช่ downtime ของคุณอีกต่อไป และราคาตามรายการของผู้ให้บริการก็ส่งผ่านมาที่เราด้วยมาร์กอัป 0% ซึ่งหมายความว่าการเปลี่ยนแปลงราคาจากผู้ขายหรือ checkpoint ใหม่จะพร้อมใช้งานฝั่งเราภายในวันเดียวกัน สำหรับงานที่คำตอบที่ถูกต้องยังไม่ชัดเจนจริง ๆ สิ่งนี้ช่วยลดต้นทุนของการตัดสินใจผิด: ลอง benchmark ทั้งสองแบบกับเสียงของคุณเองผ่าน endpoint เดียว เก็บตัวที่ชนะไว้ แล้วเปลี่ยนสตริงโมเดลเมื่อตัวถัดไปเปิดตัว

แบบสั้น ๆ: Granite Speech 5.0 470M TurboCTC เป็นคำตอบที่ดีกว่าสำหรับคำถามที่ว่า “ถอดเสียงทุกอย่างที่เราเคยบันทึกไว้ ให้มีต้นทุนต่ำ บนฮาร์ดแวร์ที่เราควบคุมเอง” และ Grok Voice Transcribe 2.0 เป็นคำตอบที่ดีกว่าสำหรับคำถามที่ว่า “ถอดเสียงสิ่งนี้แบบทันทีที่เกิดขึ้น อย่างแม่นยำ โดยที่เราไม่ต้องรันสแตกให้บริการเอง” ตัวเลขพาดหัว 12,600× และตัวเลขพาดหัว 0.49 วินาที ต่างก็เป็นความจริง และไม่มีตัวเลขใดเป็นหลักฐานเกี่ยวกับอีกตัวเลขหนึ่ง
