بطاقة عنوان رئيسية تقارن بين 'VibeVoice-ASR-Streaming-7B مقابل GPT-Transcribe'، مع سطر علوي 'تحويل الكلام إلى نص - سبتمبر 2026'، وعنوان فرعي ينص على أن نقطة تحقق من جلسة مباشرة تلتقي بنقطة نهاية الملفات المدققة من OpenAI - لحظتان مختلفتان في حياة الصوت، وشارات 'أوزان MIT - 2 سبتمبر' و'OpenAI API - 28 يوليو' و'GPT: 3.31% AA-WER'، وملاحظة في الحاشية السفلية 'الأدلة من طرف واحد'. شعار OrcaRouter مُركَّب في أسفل اليمين.
Guides & Insights

VibeVoice-ASR-Streaming-7B مقابل GPT-Transcribe: نقطة تحقق لجلسة مباشرة مقارنةً بنقطة نهاية الملفات في OpenAI

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

النموذجان في هذه الصفحة ليسا متنافسين بالمعنى الذي توحي به أسماؤهما؛ فقد صُمِّم كلٌّ منهما للحظة مختلفة في عمر التسجيل الصوتي، والمقارنة الصادقة تدور حول اللحظة التي يعيش فيها منتجك. GPT Transcribe هو نقطة نهاية OpenAI للنسخ غير المتزامن: ترفع ملفًا مكتملًا، فيعالِجُه أسرع بنحو 34 ضعفًا من الزمن الحقيقي، ثم يعيد نسخة نصية بسعر 0.0045 دولار لكل دقيقة من الصوت، مع معدل خطأ كلمات مقداره 3.31% جرى قياسه بشكل مستقل على معيار AA-WER التابع لـ Artificial Analysis. أما VibeVoice-ASR-Streaming-7B فشكله معاكس: إنه checkpoint البث من Microsoft Research، الذي رُفع بهدوء إلى Hugging Face في 2 سبتمبر 2026 بموجب رخصة MIT، وهو مصمَّم لنسخ الصوت بينما ما يزال قادمًا — جلسة WebSocket تُخرج النص على دفعات مع نمو التسجيل. ومقارنتهما على أساس الدقة وحدها ستكون بلا معنى، لأن أحد الجانبين يملك رقمًا مُدقَّقًا بينما لم ينشر الجانب الآخر أي رقم مكتوب على الإطلاق.

كل ما يلي مُصنَّف وفقًا لذلك. أرقام GPT Transcribe هي السعر الرسمي المنشور من OpenAI والقياس المستقل من Artificial Analysis، وكلاهما ضمن السجل العام منذ إطلاق النموذج في 28 يوليو 2026. أما جانب VibeVoice-ASR-Streaming-7B فهو ما يمكن معرفته من المستودع — إعداد نقطة التوقف (checkpoint)، وبطاقة النموذج، ووثائق البث من Microsoft — لأنه لا يوجد طرف ثالث اختبره، ولم تضع Microsoft معدل خطأ كلمات البث في نص قابل للقراءة.

لحظتان مختلفتان في حياة الصوت

تم تصميم GPT Transcribe للتسجيلات التي حدثت بالفعل. تقبل نقطة نهاية OpenAI ملفات صوتية يصل حجمها إلى 25 ميغابايت بالصيغ المعتادة — mp3 وmp4 وmpeg وmpga وm4a وwav وwebm — وتُرجع النص الكامل بعد المعالجة، بسرعة تعادل تقريبًا 34 ضعف الزمن الحقيقي، لذا فإن تسجيلًا مدته ساعة واحدة يُعالج في دقائق معدودة. إنه المسار المخصّص للمعالجة المجمّعة، وتسعّره OpenAI وفقًا لذلك: 0.0045 دولار للدقيقة الصوتية الواحدة، أي نحو 0.27 دولار للساعة الصوتية. إذا كانت حاجتك فعلًا إلى البث المباشر، تبيع OpenAI نموذجًا منفصلًا لذلك — GPT Live Transcribe بسعر 0.017 دولار للدقيقة، أي ما يقارب أربعة أضعاف سعر المسار المجمّع — وهو الأقرب على جانب OpenAI إلى ما يقدّمه VibeVoice-ASR-Streaming-7B.

يُزيل VibeVoice-ASR-Streaming-7B هذا التمييز في الاتجاه المعاكس: فهو checkpoint تدفقي يتعامل أيضًا مع ملفات كاملة. يُظهر إعداد المعالج المسبق العقد المباشر — صوت بتردد 24 كيلوهرتز، مضغوط بنسبة 3200× إلى تدفق رموز بتردد 7.5 هرتز، ثم يُعالج في أجزاء من 22 إطارًا مع نظرة استباقية من 4 إطارات، أي حوالي 2.9 ثانية من الصوت لكل جزء مع نصف ثانية تقريبًا من السياق المستقبلي، ويُصدر النص مع اكتمال كل جزء. يُرحَّل سياق الجلسة عبر ذاكرة التخزين المؤقت KV، فلا تُعاد الجلسة الطويلة الحساب من الصفر. يَعرِض مسار الخدمة الموثق (مكوّن إضافي لـ vLLM) نقطة نهاية WebSocket للجلسات المباشرة ونقطة نهاية لنسخ الملفات الكاملة، لذا تُخدم الأوزان نفسها كلا الشكلين — لكن سبب وجود النموذج هو الشكل المباشر، ولا يوجد عداد بالدقيقة لعدم وجود واجهة برمجية مستضافة. أنت تُحضر GPU.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

سجل الأدلة أحادي الجانب.

يُعد GPT Transcribe واحدًا من أكثر واجهات برمجة تطبيقات النسخ التي تم قياسها بدقة في الإنتاج. وضعه Artificial Analysis عند معدل خطأ كلمات يبلغ 3.31% على معيار AA-WER — في المرتبة التاسعة من بين نحو خمسين نظامًا مُتتبَعًا — مع نقطة ضعف معروفة مدفونة في النتائج الفرعية: على مجموعة Earnings22 الصوتية الصعبة عمدًا، ينخفض إلى 6.10%. هذه أرقام مدققة وقابلة للتكرار من لوحة صدارة محايدة، ولها حدود موثقة بذاتها. النموذج أُطلق بسعر أقل بنسبة 25% من سابقه GPT-4o Transcribe، وأفضل بنحو 0.7 نقطة على المعيار نفسه.

لا يملك VibeVoice-ASR-Streaming-7B أي رقم مكافئ في أي مكان. تتضمن بطاقة النموذج الخاصة به شكلًا بيانيًا لنتائج التقييم على هيئة صورة، وتقرير Microsoft الفني هو ملف PDF، لكن لا يوجد في نص مكتوب رقم قابل للاقتباس لـ WER التدفقي أو لزمن الاستجابة، ولا شيء يمكن التحقق منه بشكل مستقل. المرجع الرقمي الوحيد ضمن عائلة VibeVoice هو الجدول المبلغ عنه من المورد في بطاقة نموذج VibeVoice-ASR الدفعي، بمتوسط WER يبلغ 7.77% عبر ثماني مجموعات اختبار إنجليزية و2.20% على LibriSpeech clean، وهو ما يصف النموذج غير التدفقي ولا يجوز اعتباره دقة نقطة التفتيش هذه. إذا كان قرار الشراء لديك يحتاج إلى رقم يمكنك الدفاع عنه أمام زميل، فإن طرفًا واحدًا فقط من هذه المقارنة يملك رقمًا.

ما الذي يُرجعه كلٌّ منها بالإضافة إلى النص الحرفي؟

يختلف النموذجان في رهانهما على السياق، وهنا تصبح مقارنة الميزات مثيرة للاهتمام. طرح GPT Transcribe يعتمد على التلميح السياقي: يمكنك تمرير وصف حر للتسجيل، وقائمة من الكلمات المفتاحية وأسماء العلم، وقائمة باللغات المتوقعة، وتذكر OpenAI أنه في اختبارها المعياري للتعرف على الكلام السياقي (Context-Aware ASR) تحسنت الدقة الدلالية من 41.6% بدون سياق إلى 45.2% مع السياق. كما يُرجع اللغة المكتشفة. ما لا يقدمه هو تمييز المتحدثين أو طوابع زمنية على مستوى الكلمة — تشير OpenAI إلى نماذج منفصلة لذلك — لذا فإن محضر الاجتماع يعود ككتلة نصية واحدة غير مميزة ما لم تقم ببناء طبقة المتحدثين بنفسك.

VibeVoice-ASR-Streaming-7B يراهن على الاتجاه المعاكس. تدّعي بطاقة نموذجه تقديم مخرجات متدفقة منسوبة إلى المتحدث — أي من قال ماذا، تُبثّ لحظة اكتمال المقطع — إضافةً إلى كلمات مخصصة عبر موجه سياقي (علم واجهة الأوامر هو --context_info). وهذه هي الميزة التي يستبعدها GPT Transcribe صراحةً، ولذلك فالنموذجان غير قابلين للتبادل في بثّ صوتي مباشر متعدد المتحدثين. الثقل الموازن هو التحقق: فخصائص GPT Transcribe المفقودة قرارُ منتجٍ موثّق، بينما ادّعاء VibeVoice بإسناد الكلام إلى المتحدث هو مجرد بيان في بطاقة النموذج لم يؤكده أي اختبار مستقل. كما يختلف الجانبان في شأن الطوابع الزمنية — لا يقدّم أيٌّ من النموذجين موضع المقارنة طوابعَ زمنية على مستوى الكلمة، مع أن نموذج الدفعات لعائلة VibeVoice يقدّمها.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs GPT-Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): job shape - streaming session, live audio; throughput - emits per ~2.9 s chunk; WER published - none in text; speaker output - claimed who-said-what, unverified; context controls - hotwords via --context_info; cost - /bin/bash weights, ~18 GB bf16. Right column GPT-Transcribe (released Jul 28, 2026 - hosted API): async file endpoint, files up to 25 MB; ~34x faster than real time; 3.31% AA-WER (6.10% Earnings22); no speaker output; prompt + keywords + language hints; /bin/bash.27 per audio-hour hosted. Footer: 'GPT-Transcribe price per OpenAI; WER per Artificial Analysis. VibeVoice specs read from the HF repo.'

أشكال الأسعار ومسألة الملكية

هياكل التكلفة لا يمكن أن تكون أكثر اختلافًا، ولا يمكن الجزم بأن أيًّا منهما أفضل بشكل مطلق. GPT Transcribe هي واجهة برمجة تطبيقات تُحتسب بالاستخدام: 0.27 دولار لكل ساعة صوتية، بدون بنية تحتية، بدون GPU، حد أقصى 25 ميجابايت لكل طلب، مع ضمانات التشغيل من OpenAI — وهذا هو ثمن عدم تشغيل نموذج كلام بنفسك. أما VibeVoice-ASR-Streaming-7B فتكلفة أوزانه 0 دولار، لكنها تستهلك حوالي 18 جيجابايت بصيغة bf16 قبل احتساب KV cache، مما يعني الحاجة إلى GPU بفئة 24 جيجابايت، ورمز microsoft/VibeVoice التجريبي أو إضافة vLLM، إضافة إلى أنظمة المراقبة والتوسع الخاصة بك. ترخيص MIT هو الفارق الذي لا يلتقطه أي سعر لكل دقيقة: الأوزان ملكك تحتفظ بها، وتعدّلها، وتشغّلها على أجهزة تتحكم فيها، دون أي عدّاد استخدام لكل مقعد، ودون سقف الـ 25 ميجابايت.

تغطية اللغات هي المجال الذي يكون فيه الطرفان أكثر غموضًا مما يرغب فيه المشترون. يُدرج VibeVoice-ASR-Streaming-7B في بطاقة نموذجه 10 لغات — الإنجليزية والصينية والإسبانية والبرتغالية والألمانية واليابانية والكورية والفرنسية والروسية والإيطالية — في مقابل أكثر من 50 لغة في إصدار VibeVoice-ASR الدفعي. ولا تنشر OpenAI قائمة موثَّقة مماثلة من اللغات لنموذج GPT Transcribe؛ إذ تكتفي بذكر نتائج قوية عبر 22 لغة من لغات Common Voice في مواد إطلاقها، كما أن نقطة ضعفها الصوتية التي أظهرها التدقيق على Earnings22 تذكيرٌ بأن «مدعومة» و«يتعامل مع الصوت المليء بالضجيج في تلك اللغة» ادعاءان مختلفان. وإذا كانت احتياجاتك من التغطية واسعة، فلن تحسم أيٌّ من القائمتين المسألةَ؛ اختبر لهجاتك الفعلية.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

الخلاصة: اختر حسب المسار، وليس حسب النتيجة.

اختر GPT Transcribe عندما يكون الصوت ملفًا مكتملًا، أو عندما تريد رقم دقة موثقًا بحدود معروفة، أو عندما تبلغ قيمة عدم تشغيل بنيتك التحتية الخاصة بالتعرف على الكلام 0.27 دولار في الساعة — ولا تقرنه بـ GPT Live Transcribe إلا إذا كان التسليم الفوري يبرر سعرًا يبلغ نحو أربعة أضعاف. اختر VibeVoice-ASR-Streaming-7B عندما تكون المهمة مباشرة ومتعددة المتحدثين، وعندما تريد أن يصل النص المكتوب بينما لا يزال الحديث جاريًا، وعندما تكون مخرجات البث المنسوبة إلى المتحدث ميزة تريد تقييمها، أو عندما تكون الأوزان المفتوحة والتحكم في البيانات أكثر أهمية من معيار مُقاس.

ملاحظة هيكلية واحدة للفرق التي تبني على أيٍّ من الخيارين: طبقة النسخ الصوتي ليست شيئًا يوجّهه OrcaRouter اليوم — فلا يوجد أيٌّ من نماذج تحويل الكلام إلى نص الواردة في هذه الصفحة ضمن كتالوجه، لذا يبقى اختيار نظام التعرف التلقائي على الكلام (ASR) بين يديك بالكامل. ما يمنحك إيّاه التوجيه هو الطبقة الواقعة فوق النص المنسوخ. فبثّ النسخ المباشر لا يكون مفيدًا إلا عندما يتفاعل معه شيء ما — سواء كان المُلخِّص، أو قاعدة التنبيهات، أو مُخطِّط وكيل الصوت — وهذا هو المكدس الذي توفّر له OrcaRouter واجهة API واحدة تشمل أكثر من 200 نموذج بأسعار قوائم المزوّدين نفسها ودون أي زيادة، مع تجاوز تلقائي للأعطال. النمط الذي يجعل تجربة نموذج غير مُثبَت مثل VibeVoice-ASR-Streaming-7B ميسورة التكلفة هو بالضبط هذا: أبقِ نقطة النهاية التي تستهلك نصوصك المنسوخة قابلة للتبديل، وعندها يستطيع نموذج لم يُختبر بعد على أي معيار مرجعي أن يكسب حركة مرورك أو يخسرها استنادًا إلى أدائه على صوتك أنت، لا إلى ادعاءٍ يُطلَق يوم الإطلاق.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube