
Grok Voice Transcribe 2.0 مقابل NVIDIA Parakeet TDT 0.6B: لوحتان للصدارة، ومقارنة واحدة مضللة
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
إن NVIDIA Parakeet TDT 0.6B هو نموذج FastConformer-TDT للتحويل الصوتي يضم 600 مليون معامل، صدر في 14 أغسطس 2025 بموجب رخصة CC-BY-4.0، وظل التوصية الافتراضية لأي شخص يريد تشغيل النسخ الصوتي بنفسه لأكثر من عام. أما Grok Voice Transcribe 2.0 فهو نموذج تحويل الكلام إلى نص المُدار من SpaceXAI، طُرح في 18 سبتمبر 2026، بسعر 0.10 دولار لكل ساعة صوت للمعالجة الدفعية و0.20 دولار لكل ساعة للبث، مع معدل خطأ نهائي في الكلمات قدره 2.7% على لوحة البث الخاصة بـ Artificial Analysis. إذا بحثت عن مقارنة بينهما فستجد أن Parakeet مذكور بمعدل خطأ في الكلمات (WER) قدره 13.7% وGrok Voice Transcribe 2.0 بنسبة 2.7%، ما يجعل النموذج المُدار يبدو أدق بخمس مرات، وهو أمر مضلل حقًا عند قراءته. هذان الرقمان يأتيان من مؤشرين مختلفين لدى Artificial Analysis، مبنيين على مجموعات بيانات مختلفة، ونُشرا بفارق سنوات، وقد تجاوز أحدهما قياسات أحدث من البائع نفسه. المقارنة الحقيقية أكثر إثارة للاهتمام، وهي تتعلق بما يمنحك إياه 600 ميغابايت من الأوزان ولا تستطيع واجهة برمجة التطبيقات (API) تقديمه.
رقم 13.7%، ولماذا يجب ألا تستخدمه
وضَع تقرير Artificial Analysis بعنوان "حالة الذكاء الاصطناعي" للربع الثالث من عام 2025 نموذج NVIDIA Parakeet TDT في المرتبة الثالثة على مؤشر AA-WER الخاص به بنسبة 13.7%، خلف Chirp 2 من Google عند 11.6% وCanary Qwen من NVIDIA نفسها عند 13.2%. كان ذلك المؤشر متوسطًا مرجّحًا بمدة الصوت عبر نحو ساعتين لكل من VoxPopuli وEarnings-22 وAMI-SDM — كلام من العالم الواقعي بلهجات متنوعة ومفردات مجالية وظروف قنوات صعبة، ولهذا فإن كل رقم فيه مرتفع. إن معدل خطأ الكلمات (WER) البالغ 13.7% على AMI-SDM، وهو صوت اجتماعات بعيد المدى مُسجَّل في غرف ذات صدى، ليس نتيجة سيئة؛ بل هو اختبار صعب.
لم يعد ذلك المؤشر موجودًا بهذا الشكل. أعادت Artificial Analysis بناءه باسم AA-WER v2، مع ترجيح AA-AgentTalk بنسبة 50% وVoxPopuli-Cleaned-AA وEarnings22-Cleaned-AA بنسبة 25% لكل منهما، بنحو ثماني ساعات من الصوت، وقد غيّر التنظيف وإعادة الترجيح أرقام كل نموذج بشكل كبير. على لوحة القياس الحالية غير التدفقية، يقع Parakeet TDT 0.6B V3 في نطاق النسب الأحادية المنخفضة — النطاق نفسه الذي يقع فيه رواد النماذج ذات الأوزان المفتوحة الآخرون — وليس قريبًا بأي شكل من 13.7%، كما أن قمة اللوحة انخفضت إلى حوالي 2%. وأي شخص لا يزال يستشهد بـ13.7% لـ Parakeet فهو يستشهد بقياس متوقف عن الاستخدام، وإذا كان يقارنه برقم تدفقي لعام 2026 فهو أيضًا يقارن بين لوحتين مختلفتين.
إن ما يمكن وضعه جنبًا إلى جنب بإنصاف أضيق نطاقًا. تقييم NVIDIA نفسه على Open ASR Leaderboard — المجموعات القصيرة الإنجليزية العامة القياسية، التي تُمرَّر عبر أدوات تلك اللوحة — يُبلِغ عن متوسط WER قدره 6.32% لـ Parakeet TDT 0.6B V3 مع RTFx قدره 3,332.74، ومتوسط 6.05% لـ v2 الخاص بالإنجليزية فقط. نسبة 2.7% الخاصة بـ Grok Voice Transcribe 2.0 هي قيمة النص النهائي على لوحة البث التدفقي، مقيسة بعد نهاية الكلام، على صوت محادثة إنجليزي مرجّح حسب الوكيل. مجموعات مختلفة، ولوحة مختلفة، ونمط مختلف. من المرجح جدًا أن يكون النموذج المُدار أكثر دقة على الصوت الذي تشترك فيه اللوحتان؛ لكن حجم هذه الأفضلية ليس 5×، ولم ينشر أحد القياس الذي قد يحسم الأمر.
ما هو الشكل الذي يتخذه النموذجان في الواقع؟
يفسّر الاختلاف المعماري معظم الفرق العملي. إن Parakeet TDT 0.6B هو مُرمِّز FastConformer مزوَّد بفك ترميز مُحوِّل الرمز والمدة (token-and-duration transducer) — فهو يتنبأ برمز وبعدد الإطارات التي يجب التقدم بها، ما يتيح له التخطي بدلًا من إخراج فراغات، وهذا هو المصدر الرئيسي لكفاءته. يأتي مزوَّدًا بالكشف التلقائي عن اللغة عبر 25 لغة أوروبية، وطوابع زمنية على مستوى الكلمة والمقطع، وعلامات ترقيم وكتابة الأحرف الكبيرة، ويتعامل مع الصوت الطويل — حتى 24 دقيقة بانتباه كامل، أو نحو ثلاث ساعات بانتباه محلي. تُقدَّم خدمته عبر NeMo 2.2، وله مسار MLX لـ Apple Silicon، وهناك إصدارات ONNX INT8 تعمل على وحدات معالجة مركزية عادية.
Grok Voice Transcribe 2.0 خدمة مُدارة، لذا فالمقارنة بين نموذج ومنتج. وما الذي يتضمنه المنتج بسعره المدرج:
• البث — Grok Voice Transcribe 2.0 أصلي عبر WebSocket، أول نتيجة جزئية عند 0.49 ثانية مقابل أساليب Parakeet TDT 0.6B المُجزّأة أو المُخزّنة مؤقتًا، مع عدم وجود واجهة نصوص جزئية من الدرجة الأولى
• التحييز بالمصطلحات المفتاحية — حتى 100 مصطلح مفتاحي لكل طلب مقابل عدم كونها ميزة في Parakeet
• Diarization — مشمولة في سعر الطلب مقابل نظام منفصل تضيفه بنفسك
• القنوات — ما يصل إلى ثماني قنوات صوتية في طلب واحد مقابل دفق واحد لكل تمريرة
• تطبيع النص العكسي — مُضمَّن في 25 لغة مقابل علامات الترقيم والكتابة بالأحرف الكبيرة فقط
• النشر — نقطة نهاية مُدارة في us-east-1 مقابل أوزان تقوم بتنزيلها وتشغيلها وإدارتها في أي مكان
• الترخيص — شروط API التجارية مقابل CC-BY-4.0 مع الإسناد
• حجم النموذج — غير معلن مقابل حوالي 600 مليون معامل، أي ما يقارب 2.4 غيغابايت بصيغة fp32 أو 1.2 غيغابايت بصيغة fp16
الصف الأخير هو الذي يحدد الكثير من عمليات النشر. يتّسع Parakeet TDT 0.6B في بضعة غيغابايتات، ويعمل بشكل مقبول على معالج حاسوب محمول عبر مسار INT8 ONNX، ويتّسع بارتياح على أي وحدة معالجة رسومات استهلاكية. هذا ليس نسخة أصغر مما تفعله واجهة API — بل قدرة مختلفة، لأنه الفرق بين ميزة نسخ تعمل دون اتصال، على جهاز، بلا شبكة وبلا تكلفة لكل ساعة، وميزة لا تفعل ذلك.

حساب التكلفة الذي لا يجريها أحد على نحو صحيح
المقارنة التي تُنشر هي "0.10 دولار في الساعة مقابل مجانًا"، وهي خاطئة في كلا الاتجاهين — فالـ API ليست الشيء الوحيد الذي تدفع مقابله، والأوزان ليست الشيء الوحيد الذي توفّر عليه.
• النسخ على دفعات — Grok Voice Transcribe 2.0 بسعر 0.10 دولار لكل ساعة صوت، أي نحو 1.67 دولار لكل 1,000 دقيقة، مقابل Parakeet TDT 0.6B دون رسوم ترخيص، إضافة إلى وقت GPU أو CPU
• البث — 0.20 دولار لكل ساعة صوتية، حوالي 3.33 دولار لكل 1,000 دقيقة مقابل الاستضافة الذاتية، حيث يكون القيد هو سقف التزامن الخاص بك بدلاً من سعر معلن.
• حدود الخدمة — 10 طلبات في الثانية و100 جلسة بث متزامنة لكل فريق مقابل ما تسمح به أجهزتك، دون حد للمعدل ودون سقف للتزامن
• التكلفة التي لا تظهر في أيٍّ من الجدولين — لا هندسة، ولا منظومة تقديم، ولا توسّع تلقائي مقابل مناوبات الاستدعاء، ولا منطق إعادة المحاولة، ولا تحديثات النموذج، ولا وحدة معالجة الرسوميات التي تُبقيها دافئة من أجل الذروة
عند الأحجام الصغيرة، يكون الجانب المُدار أرخص دائمًا تقريبًا، لأن التكلفة الثابتة لمسار الاستضافة الذاتية هي شخص. وعند الأحجام الكبيرة المستقرة، يفوز جانب الاستضافة الذاتية بشكل حاسم، ونقطة التقاطع دالة على معدل الاستغلال لا على حجم الصوت: فوحدة GPU تُبقيها مشغولة تكون رخيصة جدًا لكل ساعة من الصوت، أما وحدة تُبقيها جاهزة لذروة الحركة فليست كذلك. فريق يعالج 20,000 ساعة شهريًا يدفع 2,000 دولار لمسار الدفعات المُدار، وحوالي شهر واحد من GPU متوسط المدى بالإضافة إلى وقت الهندسة لمسار الاستضافة الذاتية، وهو فارق غير ضئيل.
السبب في أن الحسابات تُجرى بشكل سيئ هو أن الجانب المستضاف ذاتيًا يُقارَن عادةً عند الصفر، والجانب المُدار يُقارَن عادةً بسعر القائمة. لا يُعد أيٌّ منهما رقمًا حقيقيًا. ما هو حقيقي هو أن رقم 3,332 RTFx الخاص بـ Parakeet TDT 0.6B — وهو رقم NVIDIA، محسوب بدفعات، على عتاد مراكز البيانات، وينبغي التعامل معه كحد أعلى لا كوعد — يعني أن وحدة GPU متواضعة واحدة يمكنها معالجة صوت أكثر مما تنتجه معظم المؤسسات.
حيث يتوقف Parakeet عن كونه الإجابة الصحيحة
هناك ثلاثة أشياء تدفع فريقًا إلى ترك النموذج المفتوح والانتقال إلى نموذج مُدار، ولا شيء منها يتعلق بالدقة.
الأول هو التحيّز للمصطلحات الرئيسية. إذا كانت نصوصك المفرّغة مليئة بأسماء المنتجات أو أسماء العائلات أو رموز الأسهم أو مصطلحات المجال، فإن نموذجًا يفتقر إلى آلية تحيّز سيفشل في التعامل معها دون حلّ سوى الضبط الدقيق. يتيح Grok Voice Transcribe 2.0 حتى 100 مصطلح رئيسي لكل طلب. أما Parakeet TDT 0.6B فلا يمتلك هذه الميزة. بالنسبة لمراكز الاتصال والرعاية الصحية والأعمال القانونية، تُعدّ تلك الفجوة الواحدة مُبطِلة للأهلية بغض النظر عما تقوله أي لوحة تصنيف.
الثاني هو تمييز المتحدثين. يمنحك Parakeet كلمات مع طوابع زمنية؛ لكنه لا يخبرك من قالها. النسخ متعدد المتحدثين يعني تشغيل نموذج تمييز متحدثين منفصل ومحاذاة المخرجات، وهو مشروع وليس خيار تكوين. النموذج المُدار يُرجع نصًا منسوبًا إلى المتحدث في نفس الطلب.
الثالث هو واجهة البثّ نفسها. فـ{{KEEP}}Parakeet{{/KEEP}} سريع بما يكفي ليبني الناس عليه أنظمة الزمن الحقيقي — تقطيع الصوت إلى مقاطع، وتشغيل النموذج على كل مقطع، ثم وصل المخرجات — لكن سلوك النصّ الجزئي، واكتشاف نهاية الدور، ودلالات الالتزام، كلها أمور تكتبها أنت وتصونها. أما {{KEEP}}Grok Voice Transcribe 2.0{{/KEEP}} فيعيد أول نصّ جزئي بعد 0.49 ثانية من توقّفك عن الكلام، بوصفه ميزةً في المنتج.
هناك أيضًا تفصيل ترخيصي يُفاجئ الفرق أحيانًا: Parakeet TDT 0.6B V3 مرخّص بموجب CC-BY-4.0، وهو ما يسمح بالاستخدام التجاري لكنه يتطلب الإسناد، كما أن بعض نماذج NVIDIA الصوتية انتقلت منذ ذلك الحين إلى رخصة النماذج المفتوحة الخاصة بالمورّد بدلًا من ذلك. إذا كان الإسناد يمثل مشكلة لمنتجك، فاقرأ بطاقة نقطة التحقق المحددة بدلًا من افتراض أن شروط العائلة تنطبق.

لماذا تفوز واجهة برمجة التطبيقات عادةً على أي حال، ومتى لا ينبغي لها ذلك
ظل النمط ثابتًا على مدار العام الماضي: تبدأ الفرق بنموذج مفتوح مثل Parakeet TDT 0.6B لأنه مجاني وقابل للتحكم، وتُطلق الميزة، ثم تكتشف أن التكلفة المستمرة ليست في GPU بل في الصيانة، فتَنتقل إلى نقطة نهاية مُدارة. وتحدث الهجرة العكسية أيضًا، عادةً عندما يتجاوز الحجم عتبةً يبدأ عندها الرسم بالساعة يبدو كإيجار لشيء يمكنك امتلاكه.
كلا الاتجاهين مكلفان في التنفيذ إذا كان النموذج موصولًا مباشرةً بتطبيقك، وهذه هي الحجة لإبقاء موضع الاستدعاء بسيطًا بلا تعقيد. يتيح OrcaRouter أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI، مع تجاوز تلقائي للفشل بين المزوّدين وهامش ربح 0% على سعر قائمة المزوّد، بحيث يمكن لنشر مستضاف ذاتيًا وآخر مُدار أن يقفا خلف الواجهة نفسها وأن يُستبدلا بتغيير سلسلة النموذج. وهذا يهم أكثر من المعتاد في مجال الصوت، حيث تنتقل الصدارة في قائمة المتصدرين كل بضعة أسابيع، وتكون الخدمة المُدارة في منطقة واحدة انقطاعًا في منطقة واحدة — فمسار تجاوز الفشل هو ما يمنع ميزة النسخ من أن تصبح انقطاعًا في النسخ.
بالنسبة للفرق التي تريد الإنتاجية التي يمنحها النموذج المفتوح دون منظومة تقديم الخدمة، فهذا أيضًا هو شكل القرار: قِس أداء Parakeet TDT 0.6B على تسجيلاتك الصوتية، وقِس أداء Grok Voice Transcribe 2.0 على التسجيلات نفسها، ودع الفائز يحتفظ بحركة الطلبات بينما تكفّ عن الاهتمام بالبائع الذي يظهر شعاره عليه.

إذا أردت النسخة المختصرة في سطر واحد: لا يزال Parakeet TDT 0.6B أفضل جواب على سؤال «فرّغ أي شيء، في أي مكان، دون أي تكلفة بالساعة، على عتاد أملكه بالفعل»، بينما Grok Voice Transcribe 2.0 هو الجواب على «التفريغ بدقة مع تسميات المتحدثين ومفرداتي الخاصة، دون تشغيل أي شيء». أما نسبة 13.7% التي تجعل الفجوة تبدو هائلة فهي قياس متقاعد، والفجوة الحقيقية — بين نقطة وثلاث نقاط من معدل خطأ الكلمات في الصوت المتراكب — صغيرة بما يكفي بحيث ينبغي أن يحسمها السؤال التشغيلي.
