
الموجز اليومي للذكاء الاصطناعي، 19 سبتمبر: ينطلق Grok Voice Transcribe 2.0 رسميًا، وMeta تفتح Muse للمطورين
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
أصبح Grok Voice Transcribe 2.0 متاحًا في Grok Voice API اعتبارًا من 18 سبتمبر 2026، بسعر 0.10 دولار لكل ساعة صوتية للنسخ المسجّل و0.20 دولار لكل ساعة للبث — وهي الأسعار نفسها التي فرضتها SpaceXAI على الإصدار 1.0. وفي الأسبوع نفسه، فتحت Meta منصة Muse connector platform للمطورين الخارجيين، مما يتيح لأي خدمة أن تكشف عن واجهة API الحالية الخاصة بها وتجعل وكيل Muse التابع لـ Meta يستدعيها نيابةً عن المستخدم. تبدو هذه عناوين غير مترابطة من شركتين مختلفتين حول منتجين مختلفين، وكانت لتبدو كذلك في معظم العامين الماضيين. لكن عند قراءتها معًا، فهي القصة نفسها: النسخ يتحول إلى مُدخَل، وقد انتقل الصراع إلى مَن يملك الاستدعاء الذي يستهلكه.
ابدأ بالأسعار، لأنها الجزء الذي يستطيع القارئ أن يتصرف بناءً عليه اليوم. ثم الدقة، وهي حقيقية لكنها أضيق مما يوحي به تأطير الإطلاق. ثم الجزء الخاص بـ Meta، وهو الذي سيكون مهمًا بعد ستة أشهر.
تسعير ثابت، وما يعنيه ذلك إذا كنت تدفع بالفعل مقابل النسخ
تبلغ تكلفة Grok Voice Transcribe 2.0 نفس تكلفة الإصدار 1.0. ليست التكلفة نفسها على سبيل «تبدأ من»، وليست سعرًا ترويجيًا ينتهي — بل مطابقة تمامًا، عند 0.10 دولار لكل ساعة من الصوت عند العمل على دفعات و0.20 دولار لكل ساعة عند البث، ما يعادل 1.67 دولار و3.33 دولار لكل 1000 دقيقة. إن فصل المتحدثين، والطوابع الزمنية على مستوى الكلمة مع درجات الثقة، والتطبيع العكسي للنص، وإزالة كلمات الحشو، والتحيز نحو المصطلحات الرئيسية كلها مشمولة ضمن هذا السعر بدلًا من إعادة بيعها كإضافات، وهو ما ليس معتادًا في هذه الفئة.
الأثر العملي حسابي لا دراماتيكي. فالفريق الذي يفرّغ 5,000 ساعة من الصوت الخاص بمركز اتصال شهريًا يدفع 500 دولار مقابل مسار المعالجة الدفعية في كل الأحوال، ويعيد النموذج الجديد الحجم نفسه بمعدل خطأ أقل جوهريًا. ولا شيء في الترحيل يغيّر ما تدفعه، وهذا بالضبط سبب سهولة تبرير الترحيل: لا يوجد قرار تكلفة يجب اتخاذه، بل قرار جودة فقط، وقد ارتفعت الجودة.
تنتقل التكاملات القائمة بتمرير grok-voice-transcribe-2.0 كوسيط model على /v1/stt، أو باختياره عند فتح جلسة WebSocket للبث. لا تغيير في المخطط، ولا نقطة نهاية جديدة، ولا إعادة ترميز لخط أنابيب الصوت لديك. أبقت SpaceXAI الإصدار 1.0 كافتراضي في الوقت الحالي، لذا يستمر أي تكامل لا يمس وسيط model في الحصول على الإصدار القديم حتى تَقلبه الشركة — وهو ما تقول إنه سيحدث خلال الأسابيع المقبلة، إلى جانب إهمال الإصدار 1.0. هذه النافذة تستحق الاستخدام عن قصد: وجّه نسخة ظلية من صوت الإنتاج لديك إلى 2.0 وقارن النصوص المفرغة بما تنشره اليوم، لأنه بمجرد أن ينقلب الافتراضي ستشغّله سواء اختبرته أم لم تختبره.
باقي ورقة المواصفات لم يتغير في بنيته ويستحق معرفته إذا كنت تحدد حجم نشر ما وليس فقط تقييم الدقة: 12 صيغة صوت إدخال من صوت هاتفي بتردد 8 kHz وصولاً إلى 48 kHz، وما يصل إلى ثماني قنوات صوتية مستقلة في طلب واحد، و100 مصطلح رئيسي لكل طلب للمفردات الخاصة بالمجال، وكشف تلقائي للغة مع إمكانية التبديل أثناء التسجيل، وتطبيع نصي عكسي عبر 25 لغة بحيث تعود التواريخ والعملات وأرقام الهواتف وعناوين البريد الإلكتروني المنطوقة مكتوبة بالطريقة التي يكتبها بها الإنسان. حدود الخدمة هي 10 طلبات في الثانية و100 جلسة بث متزامنة لكل فريق، وتعمل الخدمة في منطقة واحدة — us-east-1 — وهو السطر الوحيد في الورقة الذي ينبغي أن يجعل فريق الإنتاج يتريث، لأن واجهة برمجة تطبيقات الكلام أحادية المنطقة تعني انقطاعًا في منطقة واحدة.
أين تحركت الدقة فعليًا
ادعاء الإطلاق هو "أكثر دقة بمرتين"، والأرقام الكامنة وراءه أكثر تحديدًا وأقل انتظامًا من تلك العبارة. على لوحة AA-WER Streaming التابعة لـ Artificial Analysis، وهي القياس المستقل هنا، تتمايز النسختان على النحو التالي:
• دقة النص النهائي — Grok Voice Transcribe 2.0 بمعدل خطأ في الكلمات 2.7% مقابل Grok Voice Transcribe 1.0 عند 3.9%، وكلاهما مقيس بعد توقف المتحدث
• دقة أول نص جزئي — 3.4% WER مقابل 18.3%، وهو أكبر فارق منفرد بين النسختين بفارق كبير
• الوقت حتى النص النهائي — 0.49 ثانية مقابل 0.37 ثانية، لذا فإن 2.0 أبطأ وفق هذا المقياس وليس أسرع
• الوقت حتى أول تنفيذ جزئي — 0.49 ثانية مقابل 0.25 ثانية، لنفس الصفقة في الاتجاه الآخر
الزوج الأخير هو أكثر ما يثير الاهتمام في الجدول. لقد اشترت Grok Voice Transcribe 2.0 دقتها بنحو ربع ثانية من زمن الاستجابة، في كلا الاتجاهين. بالنسبة إلى وكيل صوتي، هذه تكلفة حقيقية — إنها الفرق بين وقفة طبيعية ووقفة يلاحظها المتصل — أما بالنسبة إلى خط معالجة دفعي فهي غير مرئية. التحسين في أول نص جزئي هو الذي يغيّر ما يمكنك بناؤه، لأن النص الجزئي هو النص الذي يستطيع الوكيل أن يفكر فيه بينما لا يزال المتصل يتحدث. الانتقال من 18.3% إلى 3.4% في هذا الرقم هو الفرق بين أن يكون النص الجزئي تلميحًا تقريبيًا وأن يكون صالحًا للاستخدام. أما تحسّن النص النهائي من 3.9% إلى 2.7% فهو تحسّن جيد لن يلاحظه أي مستخدم.

نشرت SpaceXAI أيضًا أربعة تقييمات داخلية، وهي جديرة بالقراءة مع الانتباه إلى التسمية المرفقة — فهذه أرقام الشركة نفسها عن موادها الصوتية الخاصة، وليست مُعادًا إنتاجها بشكل مستقل:
• مكالمات دعم العملاء بتردد 8 كيلوهرتز — معدل خطأ الكلمات (WER) من 10.6% في الإصدار 1.0 إلى 7.1% في الإصدار 2.0
• المحادثات مع Grok — انخفاض من 8.7% إلى 3.3%
• بيانات اعتماد منطوقة، أي أسماء ورسائل بريد إلكتروني وتفاصيل حساب تُقرأ بصوت عالٍ — من 7.2% إلى 3.2%
• عبارات قصيرة عبر 19 لغة — من 20.6% إلى 6.8%
صف 8 كيلوهرتز هو الصف الذي ينبغي التمسك به. الصوت الهاتفي هو أصعب مُدخل شائع في هذه الفئة، وهو المُدخل الذي يمتلكه فعليًا معظم مشتري مراكز الاتصال، كما أن الانخفاض من 10.6% إلى 7.1% فيه يُعد أمرًا أهم لهؤلاء المشترين من رقم لوحة الصدارة الرئيسي.
ادعاء لوحة المتصدرين، مقروءًا بأمانة.
تقول SpaceXAI إن النموذج يحتل المرتبة الأولى من بين 32 نموذجًا تدفقيًا من حيث الدقة. لكن لوحة Artificial Analysis تضع النموذج بالفعل في المرتبة الأولى في كلا تصنيفي النص النهائي والنص الجزئي الأول — غير أن صفحة اللوحة تعرض 27 من 33 نموذجًا، لذا فإن «32» هو العدد الذي تعتمده الشركة نفسها، والتصنيف يجري على مجموعة ينبغي للقارئ أن يفهم شكلها. إن AA-WER Streaming مركّب مرجّح من ثلاث مجموعات باللغة الإنجليزية: AA-AgentTalk بنسبة 50%، وVoxPopuli بنسبة 25%، وEarnings22 بنسبة 25%، أي نحو ثماني ساعات من الصوت إجمالًا، وهو مرجّح بشدة نحو الكلام الحواري على نمط الوكلاء. وهو لا يقيس اللكنات، أو الترميزات الهاتفية، أو مفردات المجال، أو الصوت متعدد القنوات في مراكز الاتصال بأي طريقة منظمة.
لا شيء من ذلك يجعل الرقم خاطئًا. بل يجعله محددًا. النموذج الذي يتصدّر لوحة إنجليزية مرجّحة بكلام الوكلاء هو الخيار الصحيح لصوت إنجليزي على شكل كلام الوكلاء، والسبب الصادق للاعتقاد بأن نتيجة 8 kHz هي تقييم المورّد الداخلي وليس اللوحة العامة. على المشترين ذوي ملف صوتي مختلف أن يختبروا على صوتهم الخاص بدلًا من قراءة الترتيب كحكم عام — وهذا كان صحيحًا قبل هذا الإطلاق وسيبقى صحيحًا بعد الإطلاق التالي.

تفتح Meta موصلات Muse أمام المطورين
القصة الثانية لهذا الأسبوع هي قصة Meta. أصبح Muse، الوكيل الشخصي الذي أطلقته Meta في 8 سبتمبر عبر iOS وAndroid وmuse.ai وWhatsApp، يقبل الآن موصلات طرف ثالث: تُتيح خدمة ما واجهتها البرمجية (API)، ويوفّر Muse الوكيل والمتصفح وسياق المستخدم التي تحوّل تلك الواجهة إلى شيء يستطيع الشخص استدعاءه بمجرد طلبه. الإطار الذي وضعت Meta لهذا هو تقسيم للعمل — أنت تأتي بواجهة API، ونحن نأتي بالنية والمستخدم. وكانت أول الموصلات المُسمّاة Notion وأداة تدوين ملاحظات الاجتماعات Granola، إضافة إلى تلك التي أطلقتها Meta بنفسها.
من الجدير أن نكون دقيقين بشأن ما يمثله هذا وما لا يمثله. فهو ليس بروتوكولًا مفتوحًا عابرًا للوكلاء. بناء موصِّل يمنحك انتشارًا داخل قاعدة مستخدمي Muse نفسها ولا مكان آخر؛ أما البناء وفق بروتوكول مفتوح فيمنحك وصولًا إلى كل وكيل متوافق، ومن دون أي قاعدة مستخدمين بعينها. كذلك لم تنشر Meta الأجزاء التي يحتاج المطوّر إلى أخذها في الحسبان عند التخطيط — عملية مراجعة الموصِّلات، وسطح التكامل التقني، وكيف تختار Muse بين موصِّلين متداخلين، أو كيف يقيس المطوّر ما إذا كان الموصِّل قد أحدث أي استخدام فعليًا.
ما لا شك فيه هو الاتجاه. تشغّل Muse وكيل كل مستخدم في آلة افتراضية خاصة به مع متصفحه الخاص وطبقة مراجعة منفصلة أمام الإجراءات الصادرة، وتحتفظ برموز بديلة بدلًا من مفاتيح API الحقيقية. لا معنى لهذه البنية إلا إذا كانت الخطة تقضي بأن يستدعي الوكيل أشياء كثيرة. وواجهات API للنسخ الصوتي من بين الأشياء التي يستدعيها الوكيل، ولدى Meta واجهتها الخاصة — Muse Voice Transcribe، النموذج الفوري الذي أطلقته Meta في أوائل سبتمبر بسعر 0.18 دولار لكل ساعة صوتية. منصة تملك كلاً من الوكيل ونموذج كلام لديها سبب واضح لتوجيه حركتها الخاصة إلى نموذجها الخاص، وعلى المطورين الذين يبنون على الموصلات أن يفترضوا أن هذا هو الوضع الافتراضي ما لم يجعل شيء ما الأمر ليس كذلك.

ما الذي ينبغي فعليًا على فريق يُطلق ميزة الصوت هذا الشهر أن يفعله
كلا القصتين تشيران في الاتجاه نفسه. دقة التعرّف على الكلام تتقارب — ثلاثة نماذج في نطاق نقطة ونصف نقطة من بعضها بعضًا على لوحة الترتيب نفسها خلال ثلاثة أسابيع — والعوامل الفارقة المتبقية هي السعر، وزمن الاستجابة، والترخيص، ومن يتحكم في التوجيه. وهذا يجعل اختيار الجهة التي يتوجه إليها استدعاء النسخ الصوتي لديك أكثر أهمية من اختيار النموذج الذي يستجيب له، لأنك سترغب في تغيير تلك الإجابة عدة مرات على مدار العام المقبل.
هذه هي الطبقة التي يقع فيها OrcaRouter. مفتاح API واحد يغطي أكثر من 200 نموذج خلف نقاط نهاية متوافقة مع OpenAI، مع تحويل تلقائي عند الفشل عبر المزوّدين، بحيث لا يعود تعثّر خدمة صوتية في منطقة واحدة ليصبح انقطاعك أنت. نمرّر سعر قائمة المزوّد بهوامش ربح 0%، ما يعني أن تخفيض سعر بائع أو إصدار نموذج جديد يصبح مباشرًا لدينا في اليوم نفسه بدلًا من انتظار إعادة تسعير. ولأن كل نموذج يقع خلف عقد واحد، فإن نقل عبء عمل النسخ الصوتي من نموذج إلى آخر يصبح تغييرًا في سلسلة النموذج بدلًا من عملية شراء ثانية.
ثلاثة إجراءات ملموسة لهذا الأسبوع. إذا كنت تستخدم Grok Voice Transcribe 1.0، فاختبر 2.0 اختبارًا ظلّيًا على صوتك الخاص الآن، ما دام 1.0 لا يزال الإعداد الافتراضي وما زلت تتحكم في التبديل. وإذا كنت تقيّم الكلام المتدفق لوكيل، فقِس زمن الوصول إلى أول نتيجة جزئية ضمن ميزانية الكمون الخاصة بك بدلًا من الوثوق بلوحة صدارة أي جهة — فرُبع الثانية الذي أنفقه هذا النموذج لشراء الدقة إما لا شيء أو قاتل، حسب ما يفعله وكيلك بالنص. وإذا كنت تبني أي شيء قد يستدعيه وكيل شخصي يومًا ما، فراقب برنامج موصل Muse عن كثب، لأن حجة التوزيع التي يطرحها أقوى من التفصيل التقني الذي شُحن معه.
