
Grok Voice Transcribe 2.0 مقابل GPT Transcribe: نفس سعر البث، دقة مختلفة
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
المصادفة تكاد تكون مثالية بشكل مريب. على لوحة AA-WER Streaming الخاصة بـ Artificial Analysis، يظهر كل من Grok Voice Transcribe 2.0 و GPT Live Transcribe — نقطة نهاية النسخ المتدفق — بسعر 3.33 دولار بالضبط لكل 1,000 دقيقة من الصوت. Grok Voice Transcribe 2.0 من SpaceXAI، الذي صدر في 18 سبتمبر 2026، يُعيد نصًا نهائيًا بمعدل خطأ في الكلمات يبلغ 2.7%، بعد 0.49 ثانية من انتهاء الكلام، وأول نص جزئي بمعدل 3.4%. أما GPT Live Transcribe، الذي طُرح إلى جانب GPT Transcribe في 28 يوليو 2026، فيُعيد نصه النهائي بمعدل 3.9% وأول نص جزئي له بمعدل 6.3%. نفس السعر، مع فارق يقارب 1.2 نقطة في دقة النص النهائي و 2.9 نقطة في دقة النص الجزئي لصالح SpaceXAI. أما الجانب الدفعي من نفس المواجهة فليس مصادفة على الإطلاق: فـ GPT Transcribe يكلف 4.50 دولار لكل 1,000 دقيقة مقابل 1.67 دولار لـ Grok Voice Transcribe 2.0، أي فارق 63% في مسار الملفات المسجلة.
رهانان مختلفان على كيفية تحسّن النسخ
إجابة OpenAI عن الدقة هي السياق. يقبل كل من GPT Transcribe وGPT Live Transcribe مطالبات حرة الشكل، وقوائم كلمات مفتاحية، وقوائم اللغات المتوقعة، وفي جلسات Realtime تُعاد الأدوار المنسوخة سابقًا كسياق للأدوار اللاحقة. في معيار Context Aware ASR الخاص بـ OpenAI، رفع هذا التهيئة الدقة الدلالية لـ GPT Live Transcribe من 38.5% إلى 44.6% — وهو رقم مُبلَّغ عنه من البائع، ويقيس ما إذا كان المعنى قد نجا بدلًا من ما إذا كانت الكلمات صحيحة. المقايضة التي تقدمها OpenAI صريحة: أعطِ النموذج معلومات حول ما سيسمعه، وسينسخ مجالك بشكل أفضل مما سيفعله نموذج عام بنفس الدقة الخام.
إجابة SpaceXAI هي النموذج نفسه. يمتلك Grok Voice Transcribe 2.0 بالفعل آلية تحيّز — حتى 100 مصطلح مفتاحي لكل طلب، وكل منها يصل طوله إلى 50 حرفًا — لكنها قائمة مفردات، وليست توجيهًا نصيًا. يمكنك إخباره بأن "OrcaRouter" و"Kubernetes" كلمتان حقيقيتان؛ لكن لا يمكنك تسليمه فقرة تشرح أن هذه مكالمة دعم بخصوص استرداد. يأتي تحسّن الدقة في 2.0 بدلًا من ذلك من إعادة التدريب: على مجموعات التقييم المستمدة من الإنتاج الخاصة بـ SpaceXAI، انخفض معدل خطأ الكلمات من 8.7% إلى 3.3% في الصوت الحواري، ومن 10.6% إلى 7.1% في الاتصالات الهاتفية بتردد 8 kHz، ومن 7.2% إلى 3.2% في بيانات الاعتماد المنطوقة، ومن 20.6% إلى 6.8% في الأوامر القصيرة عبر 19 لغة. هذه أرقام الشركة على بياناتها الصوتية، ولم يُعِد أحد من خارجها إنتاجها، وهي تصف نموذجًا أصبح أفضل في معالجة المشكلة الصوتية بدلًا من نموذج أصبح أفضل في أن يُخبَر بما ينبغي توقّعه.
يظهر الفرق العملي في الساعة الثانية من العمل. يمكن أن يكون النموذج المشروط بالسياق أفضل بشكل كبير مما توحي به نتائجه المعيارية الخام، لأنك زوّدته بالمفردات والمجال. ويمكنه أيضًا أن يهلوس الكلمات المفتاحية التي زوّدته بها: ضع "OrcaRouter" في المطالبة، وقد ينتجه على أي حال نموذج لا يستطيع سماع الكلمة بوضوح. النموذج المتحيّز للمصطلحات الرئيسية يتدهور بشكل أكثر سلاسة، لأن التحيز يزيح احتمال المصطلح بدلًا من الجزم بوجوده. لا يظهر أي من نمطي الفشل هذين على لوحة الصدارة، وسيظهر كلاهما في سجلاتك.
الأرقام، جنبًا إلى جنب
• دقة النص النهائي (بث مباشر) — Grok Voice Transcribe 2.0 بنسبة 2.7% WER مقابل GPT Live Transcribe بنسبة 3.9% على AA-WER Streaming، وكلاهما وفقًا لـ Artificial Analysis
• الدقة الجزئية الأولى (البث التدفقي) — 3.4% مقابل 6.3%، أوسع فجوة في المقارنة وهي التي تحدد سلوك وكيل الصوت
• الوقت اللازم للوصول إلى النص النهائي — 0.49 ثانية مقابل 0.81 ثانية بعد انتهاء الكلام، لذا فإن النموذج الأكثر دقة هو أيضًا الأسرع في التثبيت النهائي
• الوقت حتى أول نتيجة جزئية — 0.49 ثانية مقابل 0.26 ثانية، العمود الوحيد في زمن الاستجابة الذي تفوز به OpenAI بشكل قاطع
• سعر البث — 3.33 دولار لكل 1,000 دقيقة لكليهما، تم تطبيعها بواسطة Artificial Analysis من 0.20 دولار/ساعة لـ Grok و0.017 دولار/دقيقة لـ OpenAI
• دقة الدُفعات (غير المتدفقة) — Grok Voice Transcribe 2.0 عند 2.3% AA-WER مقابل GPT Transcribe عند 3.31%
• سعر الدفعة — $1.67 لكل 1,000 دقيقة مقابل $4.50 لكل 1,000 دقيقة، بدءًا من $0.10/ساعة مقابل $0.0045/دقيقة
• إنتاجية الدفعات — نحو 162 ضعفًا للزمن الحقيقي مقابل نحو 41 ضعفًا على اللوحة نفسها
اقرأ تلك القائمة على أنها عمودان لا حكم واحد. تفوز OpenAI في زمن الاستجابة لأول نتيجة جزئية بفارق واضح، وتوفّر آلية سياق لا تملكها Grok. وتفوز SpaceXAI في الدقة النهائية في كلا الوضعين، والدقة الجزئية في البث، والإنتاجية، وسعر الدفعات بفارق كبير. لا يوجد عمود يكون فيه GPT Live Transcribe أسرع وأدق معاً من Grok Voice Transcribe 2.0؛ بل يوجد عمود واحد يكون فيه أسرع، وهو العمود الأول.

ما مسار الدفعة الذي أنت عليه فعليًا؟
إن الفجوة بين 1.67 دولار و4.50 دولار هي أقل الأرقام التباساً هنا، ويجدر بنا أن نكون دقيقين بشأن سبب وجودها. أعادت OpenAI تسعير هذا الخط من المنتجات بالخفض بنسبة 25% عند إطلاقها GPT Transcribe، من حقبة GPT-4o Transcribe، وكانت النتيجة 0.0045 دولار للدقيقة. أبقت SpaceXAI سعر الدفعات لديها دون تغيير عند 0.10 دولار للساعة عندما انتقلت من الإصدار 1.0 إلى 2.0 — فقد حسّنت النموذج وتقاضت السعر نفسه، وهو أمر أصعب تحقيقه وإشارة أفضل إلى أين يتجه السوق. ووصلت MAI-Transcribe-2 من مايكروسوفت عند السعر نفسه تماماً البالغ 0.10 دولار للساعة كعرض لفترة محدودة، لذا أصبحت نقطة 1.67 دولار لكل 1000 دقيقة هي الحد الأدنى لمختبرات الطليعة في النسخ بالدفعات، لا مجرد رقم ترويجي لمورّد واحد.
عند عشرة آلاف ساعة من الصوت شهريًا، تبلغ هذه الفجوة نحو 2,830 دولارًا مقابل 450 دولارًا. وبالنسبة لأرشيف بودكاست، أو تراكم تسجيلات المكالمات، أو مكتبة وسائط يجري نسخها نصيًا بأثر رجعي، فإن فرق السعر يطغى على أي فرق في الدقة بين 2.3% و3.31% من معدل خطأ الكلمات (WER). أما بالنسبة لوكيل بث مباشر، حيث يكلف المنتجان الشيء نفسه، فلم يتبقَّ سوى الدقة وزمن الاستجابة للجدال بشأنهما.
ثمة فرق بنيوي وراء هذه الأسعار يستحق التسمية: تحسب Grok Voice Transcribe 2.0 سعرًا ثابتًا لكل ساعة صوت، ويحسب GPT Live Transcribe لكل دقيقة، لكن Gemini 3.5 Transcribe Live يحسب لكل توكن على كل من إدخال الصوت وإخراج النص. واحد فقط من هؤلاء الثلاثة يجعل فاتورتك دالة على ما يختار النموذج قوله. إذا كان حجم استخدامك كبيرًا بما يكفي بحيث تصبح التوقعات مهمة، فإن الأسعار الثابتة أسهل في الدفاع عنها أمام من يوقّع الفاتورة — ولأن OrcaRouter يمرّر أسعار قوائم المزوّدين كما هي دون أي هامش ربح بنسبة 0%، فإن خصمًا من جانب المورّد مثل خصم OpenAI بنسبة 25% سيصبح ساريًا لدينا في اليوم نفسه الذي يُعلَن فيه، وليس عند التجديد التالي.

ما لا يكونه أيٌّ من النموذجين.
GPT Transcribe و GPT Live Transcribe منتجان، وليس منتجًا واحدًا بمفتاح تبديل. يتعامل النموذج الدفعي مع الملفات المكتملة، والتفريغات النصية للملفات المتدفقة، والأدوار المُثبَّتة في جلسات Realtime، ويعالج الصوت أسرع بنحو 34 مرة من الوقت الفعلي وفقًا لأرقام OpenAI نفسها — بينما يقيس Artificial Analysis 41× على منصة الاختبار الخاصة به. النموذج المتدفق هو الأغلى عند 0.017 دولار في الدقيقة وهو صاحب معدل الخطأ الأكبر بـ 10× في النصوص الجزئية. اختيار OpenAI يعني اختيار أي من هاتين المشكلتين لديك، لأن نقطة النهاية الأرخص لا يمكنها أداء وظيفة الأخرى.
Grok Voice Transcribe 2.0 هو نموذج واحد بوسيلتَي نقل: الأوزان نفسها تخدم /v1/sttعبر REST للملفات التي يصل حجمها إلى 500 ميغابايت وwss://api.x.ai/v1/sttعبر WebSocket للصوت المباشر، مع إصدار نتائج مؤقتة كل 500 مللي ثانية تقريبًا. معدل البث يساوي بالضبط ضعف معدل الدفعات، وليس منتجًا مُهندَسًا بشكل منفصل، ما يعني أن الدقة التي تقيسها على صوتك المؤرشف هي الدقة التي ينبغي أن تتوقعها في البث المباشر. كما يعني أنه لا يوجد نموذج ثانٍ لتقييمه — مجموعة واحدة من المطالبات، ومجموعة واحدة من المصطلحات الأساسية، ومجموعة واحدة من التوقعات.
التكافؤ في الميزات قريب لكنه ليس متطابقًا. كلاهما يُرجع طوابع زمنية على مستوى الكلمة؛ يُرفق Grok Voice Transcribe 2.0 درجة ثقة بكل كلمة، ما يتيح لك وضع حد أدنى للمقاطع منخفضة الثقة بدلًا من الوثوق بالنص الكامل بالقدر نفسه. كلاهما يجري فصل المتحدثين، وفصل المتحدثين في Grok مشمول دون تكلفة إضافية. كلاهما يتعامل مع التطبيع العكسي للنص للأرقام والتواريخ والعملات وبيانات الاتصال. يضيف Grok Voice Transcribe 2.0 النسخ متعدد القنوات عبر ما يصل إلى 8 قنوات مستقلة، وإزالة كلمات الحشو، وكشف نهاية الدور Smart Turn؛ أما الإضافات المميزة لـ GPT Transcribe فهي التكييف السياقي على مستوى الأمر التوجيهي، وعلى جانب Realtime، النقل التلقائي للأدوار السابقة. لم تنشر OpenAI عدد اللغات المدعومة لأي من الطرازين؛ يوثّق Grok Voice Transcribe 2.0 عشرات اللغات مع التبديل أثناء التسجيل والتنسيق بالشكل الكتابي عبر 25.

كيف تقرر، وكيف تختبره
إذا كنت تبني وكيلاً صوتياً يجب أن يستجيب قبل أن ينهي المتصل كلامه، فإن عمود النص الجزئي هو متغير القرار لديك، وهو يفصل بين النموذجين بوضوح: Grok Voice Transcribe 2.0 أدق بمقدار 2.9 نقطة في النصوص الجزئية لكنه أبطأ بمقدار 0.23 ثانية في إنتاجها. اختر SpaceXAI إذا كانت النتيجة الجزئية الخاطئة أسوأ من النتيجة المتأخرة — التوجيه، والتصعيد، والردود المفعّلة بالامتثال. واختر OpenAI إذا كانت النتيجة الجزئية المتأخرة أسوأ من الخاطئة، وإذا كانت لديك مفردات المجال لتغذية آلية السياق بحيث تضيق فجوة الدقة. ثم قِس كلا النموذجين، لأن سلوك النص الجزئي لدى أي من الموردين على ثماني ساعات من محادثات وكلاء بالإنكليزية لا يتنبأ بما سيفعله أي منهما مع لكنتك وترميزك ومصطلحاتك المتخصصة.
إذا كنت تقوم بتفريغ الملفات نصيًا، فإن القرار أسهل بكثير: $1.67 مقابل $4.50 لكل 1,000 دقيقة، و2.3% مقابل 3.31% لمعدل خطأ الكلمات (WER)، وكلاهما يشير في الاتجاه نفسه. السبب الوحيد للبقاء على GPT Transcribe للعمل بالدفعات هو ما إذا كانت آلية التكييف السياقي تفعل شيئًا لصوتك لا يمكن لفجوة الدقة الخام أن تعوّضه — وهو احتمال حقيقي في التسجيلات المتخصصة في مجالها بدرجة عالية، وقابل للاختبار.
لا يوجد أيٌّ من نموذجَي النسخ الصوتي في كتالوج OrcaRouter اليوم، لذا تذهب الاستدعاءات نفسها إلى واجهة API الخاصة بالمورّد. أما ما يقف فعلًا خلف مفتاح OrcaRouter واحد فهو كل ما يغذّيه النص المنسوخ: نموذج الوكيل، ونموذج التلخيص، والمصنِّف، والشيفرة التي تقرر ما يجب فعله بالنص. وهنا عادةً يظهر العقد الثاني — مورّد للكلام، وآخر للنموذج الذي يُجري الاستدلال على النص — وليس بالضرورة أن يكون الأمر كذلك. مفتاح واحد عبر أكثر من 200 نموذج، وتجاوز تلقائي للفشل إذا تدهور أداء مزوّد، ولغة توجيه DSL إذا أردت إرسال طلب عبر عدة نماذج ومقارنتها قبل الالتزام. إنه زعم أصغر من «نحن نوجّه النسخ الصوتي الخاص بك»، وهو الزعم الصحيح.
الأمر الذي يستحق المتابعة هو ما إذا كانت OpenAI ستجيب على مسألة الدقة بدلًا من السياق. فقد أطلقت الشركة الآن جيلين من تقنية التفريغ النصي خلال عام واحد، وخفضت الأسعار مرة واحدة؛ وآلية السياق متمايزة حقًا، لكنها على اللوحة التي تقيس التفريغ النصي الخام تأتي حاليًا خلف كل من SpaceXAI وMicrosoft. وإذا وصل GPT Transcribe 2 مع بقاء آلية السياق سليمة وانخفاض معدل الخطأ إلى نطاق 2%، فإن هذه المقارنة تنقلب على جانب المعالجة الدفعية بين ليلة وضحاها — كما أن سعر البث المباشر، المتطابق أصلًا، يجعل من ذلك سباقًا يستحق المتابعة.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
