
AuK: تينسنت أطلقت سراً نموذج كلام بحجم 1.5B مفتوح المصدر يعامل كل مهمة صوتية كأمر نصي
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
هاك جملة لا تستطيع أي أداة صوتية واحدة يمكنك تنزيلها اليوم إنجازها في مسار واحد: خذ هذا التسجيل، واستبدل كلمة "house" بكلمة "home"، وارفع طبقة الصوت بنصف نغمة، وأزل النفس قبل العبارة الأخيرة، ونظّف ضجيج الخلفية، ثم أعد قراءة النتيجة بصوت جديد تمامًا يُوصف فقط بأنه «رجل في منتصف العمر دافئ وله لكنة كانتونية خفيفة». إجابة تينسنت على هذه الجملة هي AuK، وهو «نموذج أساسي لتوليد الكلام وتحريره» يضم 1.5 مليار معامل، أصبح مفتوح المصدر هذا الأسبوع دون منشور إطلاق ودون بيان صحفي؛ أما شقيقه المُقطّر AuK-Flash فيأتي الآن بالشيء الذي كانت تفتقر إليه هذه القصة عندما كتبناها أول مرة: تقرير فني بأرقام مرفقة. التقرير الفني «AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing» (arXiv:2609.08936, cs.SD، مقدم في 2026-09-08) يُستشهد به الآن في بطاقة نموذج Hugging Face وفي ملف README على GitHub، مع تاريخ إدراج الورقة 2026-09-08 وسطر الأخبار الخاص بمستودع الكود بتاريخ 2026/09/09. ما لا يفعله التقرير هو حسم السؤال الجوهري؛ فكل رقم فيه خاص بتينسنت، وأُجريت مقارناته مع خطوط أساس اختارتها تينسنت، وحتى تاريخ 2026-09-10 لم يعيد أحد خارج الشركة إنتاج رقم واحد منها.
هذه مقالة تلخيصية لما نعرفه حتى الآن، وقد نُقحت مرة واحدة. لم تعلن Tencent بعد عن AuK على أي من قنواتها الرئيسية التي يمكننا العثور عليها، لذا فإن السجل المتاح هو: بطاقات نماذج Hugging Face والمستودعات الخاصة بـ AuK وAuK-Flash، ومستودع الكود المصدري ضمن منظمة Tencent-Hunyuan، وموقع المشروع على auk-project.github.io، والآن الورقة البحثية. هذه الإضافة الأخيرة تغيّر ما يمكن معرفته — البنية المعمارية، وصفة التدريب، وأرقام التقييم موصوفة بالتفصيل لأول مرة — دون تغيير ما تم التحقق منه. تعامل مع كل الأرقام الواردة أدناه باعتبارها من تقارير البائع، لأن هذا هو واقعها تمامًا، ولاحظ أن مقارنات التقرير تتم بالكامل مع نماذج مفتوحة أخرى، وليس مع منصات الكلام المستضافة المغلقة التي ستنافسها AuK فعليًا.
ما الذي تم إطلاقه فعليًا، وبأي هدوءٍ
الجدول الزمني لا يزال الملخص الأكثر صدقًا للإصدار، مع تصحيح واحد من مراجعتنا الأولى. تم إنشاء مستودعات Hugging Face في منتصف أغسطس — AuK في 2026-08-18 — لكنها بقيت مظلمة حتى هذا الأسبوع. عندما قرأنا بطاقة نموذج AuK في 2026-09-09 كان سطر أخبارها الوحيد مؤرخًا في 2026-09-07؛ وبعد يوم واحد يقرأ السطر نفسه 2026/09/09 ويوجّه القراء إلى الورقة البحثية ومساحات العرض التوضيحية. تم إنشاء مستودع GitHub، الذي يحتوي على رمز الاستدلال والتدريب، في 2026-08-19 وآخر دفعة كانت في 2026-09-09. بمعنى آخر: الأوزان، ثم الرمز، ثم تقرير فني — ثلاث إصدارات متدرجة في أربعة أيام، وما زال لا يوجد إعلان من القنوات الرئيسية لـ Tencent حتى وقت كتابة هذا التقرير.
• الأوزان مستضافة على Hugging Face ضمن منظمة tencent، ولها نسخة مرآة على ModelScope تحت Tencent-Hunyuan — مرآتان، بنفس رخصة MIT.
يحمل كل مستودع نموذج نقطة فحص safetensors واحدة بالإضافة إلى ملف إعدادات وVAE: auk_base.safetensors بحجم 6.12 جيجابايت وvae.safetensors بحجم 0.64 جيجابايت لـ AuK؛ وينطبق نفس التخطيط على AuK-Flash. وتطلب بطاقة النموذج أيضًا تنزيل Qwen/Qwen2.5-Omni-3B، وهو برنامج ترميز النصوص الذي يحمّله AuK بشكل منفصل وقت التشغيل.
لقد انتهى إطار "لم يلاحظه أحد"، وبسرعة. كان مستودع الكود عند صفر نجوم وصفر نسخ متفرعة عندما فحصناه في 2026-09-09؛ بحلول 2026-09-10 يُظهر 216 نجمة و12 نسخة متفرعة وأول مشكلة مفتوحة. يبلّغ بطاقة AuK عن حوالي ثلاثين تنزيلًا في الشهر الماضي مع 26 إعجابًا. ما لم يتغير: علامات التبويب الخاصة بالمناقشات فارغة، والبطاقة لا تزال تشير إلى أن نقطة التفتيش غير منشورة من قبل أي مزود استدلال.
{{1}}كل من بطاقات النماذج وملف README وورقة البحث تربط مساحات العرض التجريبي على Hugging Face وModelScope.{{/1}} {{2}}لم تكن مساحة Hugging Face قابلة للوصول علنًا دون تسجيل الدخول عند فحصنا، لذا تعامل مع مسار "جرّبه في متصفحك" باعتباره غير مؤكد للمستخدمين المجهولين.{{/2}}

بطاقة Hugging Face أعلاه لا تزال السطح العام الكامل لإصدار قابل للتثبيت: بطاقة نموذج، إعداد، ملفا safetensors وترخيص. ما تمت إضافته منذ ذلك الحين هو طبقة التوثيق حولها — ورقة بحثية، جدول معايير وكتلة استشهاد — ولا شيء من ذلك يغير حقيقة أنه لا يوجد سجل تغييرات، ولا خيط نقاش، ولا قائمة موفري استدلال خلفها.
العرض: واجهة تعليمات واحدة، وستة عشر مهمة كلامية.
ادعاء AuK ليس أنه أفضل نموذج لتحويل النص إلى كلام تم إطلاقه على الإطلاق. بل إن التوليد هو واحد فقط من خمس عائلات من مهام الكلام التي دُرِّب النموذج على أدائها عبر واجهة لغوية طبيعية واحدة، حيث يكون الطلب رسالة دردشة يمكن أن تحمل نصًا بالإضافة إلى ملف صوتي مرجعي اختياري. تصوغ الورقة بدقة التصنيف الذي كان موقع المشروع يعلن عنه بالفعل:
• توليد الكلام — تحويل النص إلى كلام بدون تدريب مسبق (نطق هذا النص بصوت المقطع المرجعي) وتحويل النص إلى كلام بالتوجيهات (توليد الكلام من مجرد وصف للصوت فقط، دون أي صوت مرجعي على الإطلاق).
• تحرير المحتوى — إعادة كتابة ما قيل: استبدال أو إدراج أو حذف كلمات في تسجيل موجود؛ وتحرير الكلمات، الذي يعيد كتابة الكلمات المغناة {{1}}مع الحفاظ على اللحن والصوت{{/1}}، {{2}}وذلك من خلال استبدال المقاطع الصوتية بدقة مع الحفاظ على الخصائص الطبيعية للصوت{{/2}}.
• التحرير الصوتي — ضبط طبقة الصوت بنصف النغمات، وتغيير سرعة الكلام، ومستوى الصوت بالديسيبل.
• التحرير شبه اللغوي — تغييرات العاطفة، تغييرات الجرس الصوتي بناءً على وصف، إزالة اللهجة، إضافة أو إزالة الأصوات غير اللفظية (التنفس، الضحك، السعال)، والتحويل بين الكلام العادي والهمس مع الحفاظ على المتحدث.
• التحسين والفصل — إزالة ضوضاء الكلام وإزالة الصدى، وفصل الكلام حسب ترتيب التحدث، وفصل الموسيقى/الغناء، واستخراج المتحدث المستهدف المُعرَّف بما يقوله المتحدث.
حالة TTS القائمة على التعليمات هي ما يميز هذا الإصدار عن إصدارات استنساخ الصوت النمطية: سيقرأ AuK جملة بصوت لا يوجد إلا كوصف نصي — مثال الوثائق نفسه يحدد امرأة في العشرينات من عمرها تتحدث إلى شريك عائد للتو إلى المنزل، دافئة وحنونة ومتغنجة قليلاً، بجرس ناعم حلو ونبرة نهائية ترتفع قليلاً، كل ذلك دون إرفاق مقطع مرجعي. هذا يلغي الحاجة إلى تسجيل مرجعي، وهو التكلفة التي تُعد عادةً بوابة الدخول إلى الاستنساخ. التقرير يضع رقمًا كميًا لهذه المهمة لأول مرة، وهي واحدة من الأماكن القليلة التي يتفوق فيها AuK على المنافسين بشكل كامل وليس بهامش ضئيل.
داخل "1.5B": الرقم يقلل من شأن وقت التشغيل.
يصف عدد معلمات AuK محول الانتشار وليس خط الأنابيب بأكمله، وتوضح الورقة البحثية الآن كلا الجزأين. الهيكل الأساسي هو محول تدفق مصحح هجين — يتكون من ثلاثين طبقة: عشر كتل MMDiT ثنائية التدفق تليها عشرون كتلة DiT أحادية التدفق الموحدة، بحجم كامن 1536، و24 رأس انتباه ببعد 64، وعرض وسيط SwiGLU يبلغ 3072، وهذا هو مصدر رقم "حوالي 1.5 مليار معلم". حوله يوجد مكونان يُحمّلان بشكل منفصل: نموذج لغوي كبير متعدد الوسائط (Qwen/Qwen2.5-Omni-3B) يحوّل التعليمات وأي صوت مرجعي إلى تهيئة دلالية، وVAE صوتي سببي بتردد 24 كيلوهرتز — يسميه الإعداد BigVGANFlowVAE — يشغّل كمونات ذات 64 بُعدًا بمعدل إطارات 50 هرتز، مع عرض قنوات ترميز يصل إلى 768 وفك ترميز يصل إلى 1536. وبالتالي فإن وقت التشغيل الكامل هو الهيكل الأساسي البالغ ~1.5 مليار معلم بالإضافة إلى وحدة ترميز 3B بالإضافة إلى VAE، وتعليمات التنزيل صريحة في أن وحدة الترميز نقطة تفتيش منفصلة لها شروطها الخاصة.
وفقًا للتقرير، جرى التدريب على مراحل وبحجم لم يلمّح إليه موقع المشروع إلا بشكل جزئي: إحماء للجيل فقط بمقدار 50,000 تحديث، ثم 600,000 تحديث مشترك للجيل والتحرير، على حوالي 3.03 مليار عيّنة تعليمات–صوتية تمثل حوالي 1.95 مليون ساعة من الإشراف الفعّال، عبر 256 وحدة معالجة رسومية، مع 1.24 مليون تحديث إضافي على نموذج الترميز التلقائي المتغير (VAE). أما مرحلة ما بعد التدريب فقد جمعت بين تحسين التفضيلات بالتغذية الراجعة البشرية والتعلم المعزز القائم على المكافآت، بُنيت على 818 مجموعة تفضيلات معلوماتية و9,080 مرشحًا مُقيَّمًا، ومجموعات مطالبات للتعلم المعزز تضم 10,000 مطالبة صفرية السياق و5,000 مطالبة متابعة للتعليمات، و30,000 عينة تحكيم أسلوبية، ونموذج مكافآت خضع لضبط دقيق انطلاقًا من Qwen2.5-Omni-7B. إنها مجموعة أدوات ما بعد تدريب جادة لإصدار مفتوح بحجم 1.5 مليار معامل، وهي أيضًا تذكير بأن «الأوزان المفتوحة» تصف الناتج النهائي، لا القدرة الحاسوبية التي أنتجته — وهي نقطة جديرة بالتذكر عند تقييم ما إذا كان بإمكانك إعادة إنتاجه.

كل رقم في ورقة المواصفات تلك مقروء من مستودعات Tencent الخاصة وموقعها الإلكتروني وليس مقاسًا من قبلنا، ولم تغيّر الورقة ذلك — بل نقلت المزيد من تلك البنود من "مُدَّعًى" إلى "موثّق". الرقم الوحيد الذي اختُبر فعليًا منذ نشرنا لأول مرة هو نشاط المستودع نفسه، الذي انتقل من صفر نجوم إلى بضع مئات في يوم واحد.

يظل موقع المشروع هو المكان الذي توجد فيه مخططات البنية والعلامة التجارية الأكاديمية المشتركة، ولا يزال أرخص طريقة للاطلاع على شكل النموذج: نموذج لغوي متعدد الوسائط للتهيئة الدلالية، وشبكة ترميز تلقائي متغير (VAE) بتردد 50 هرتز للصوتيات، ومحوّل هجين يعتمد على هدف مطابقة التدفق. أما قسم المعايير الخاص به، الذي كان يعرض أداة تقييم بدون درجات عندما اطّلعنا عليه لأول مرة، فقد أصبح الآن يضم ورقة بحثية يمكن الرجوع إليها.
يصل التقرير الفني، والأرقام تخص تينسنت نفسها.
هذا هو جوهر التحديث. تعرض الورقة نتائج عبر سبع مجموعات تقييم — وهي نفس القائمة التي كان موقع المشروع يروّج لها دون أرقام — وفي معظم محاور التوليد وتحرير المحتوى، يتصدر AuK المجال المفتوح. اقرأوا هذه النتائج كجدول معايير من بائع، لأن هذا ما هي عليه: أجرت tencent كل المقارنات، واختارت كل خط أساس، ولم تنشر أي كود لإعادة إنتاج المنهجية حتى الآن.
• توليد الكلام بدون عينات تدريب على Seed-TTS-Eval: يحقق AuK متوسط 2.65 في معدل الخطأ في الكلمات WER مع تشابه متحدث 0.795، مقابل Qwen3-TTS عند 3.07 و0.745، وSeed-TTS عند 3.65 و0.778، وVoxCPM2 عند 3.65 و0.767. بينما يسجل AuK-Flash 2.85 و0.790. أفضل النتائج الفردية هي 1.02 في معدل الخطأ في الكلمات على مجموعة الاختبار الإنجليزية و5.91 على المجموعة الصينية الصعبة.
• تقنية TTS الموجهة بالتعليمات على معيار InstructTTSEval: سجل AuK 83.37 على الصينية و81.60 على اتباع الأوصاف بالإنجليزية، مقابل Qwen3-TTS-VD عند 81.10 و82.40 وMOSS-VoiceGenerator عند 80.00 و82.00. أما AuK-Flash فحصل على 78.80 على الصينية لكنه يعادل أفضل نتيجة إنجليزية في المجال عند 82.40.
• تحرير المحتوى على SpeechEditBench: دقة 91.83 مقابل 76.46 لنظام Ming-UniAudio، و71.33 في العروض مقابل 26.50 — وهي أكبر فجوتين في التقرير.
التحرير الموجَّه بالتعليمات على Ming-Freeform-Audio-Edit، بالإعداد الكامل: ينخفض خطأ الكلمات من 10.46 إلى 3.09 في اللغة الصينية ومن 14.28 إلى 3.96 في الإنجليزية مقارنةً بـ Ming-UniAudio، مع ارتفاع دقة التحرير من 79.62 إلى 91.47 ومن 70.98 إلى 85.25. وفي التحريرات الصوتية، يُظهر المقارنة نفسها انخفاض خطأ الكلمات من 5.01 إلى 2.02 في الصينية ومن 10.75 إلى 3.48 في الإنجليزية.
• التحرير الشبه لغوي على MMAE-Speech: معدل اتباع التعليمات 48.23 وإعادة كتابة المحتوى 88.11 مقابل Step-Audio-EditX عند 43.52 و77.27، وMing-UniAudio عند 34.13 و76.01. يحقق AuK-Flash أفضل استرجاع لنموذج التحرير في الجدول عند 13.85.
• الترميم، حيث يكون النموذج منافسًا وليس مهيمنًا: خطأ الكلمة غير المتزامن في تحدي DNS هو 2.66 مع تشابه متحدث 0.99 مقابل RE-USE عند 3.31؛ خطأ كلمة CHiME-4 هو 7.98 مقابل RE-USE عند 10.71؛ خطأ كلمة Libri2Mix هو 9.12 مقابل MossFormer2-SS عند 9.34؛ وخطأ كلمة VCTKSR هو 3.06 مع تشابه 0.97.
• نموذج VAE نفسه، عند تقييمه بشكل منفصل: يحقق AuK-VAE درجة 4.143 PESQ على الكلام، و3.833 على الصوت العام، و3.884 على الموسيقى، مقابل MiniMax-H3-AudioVAE الذي يسجل 3.633 و2.835 و2.801 — وهو اكتساح كامل له أهمية أكبر مما يبدو، لأن الكامن الصوتي المفقود يحدّ من كل مهمة مبنية فوقه.
النمط عبر تلك النقاط أكثر إثارة للاهتمام من الانتصارات التي تتصدر العناوين. AuK متقدم بفارق كبير على أي شيء يعني "تغيير ما يُقال أو كيف يبدو الصوت، وإبقاء كل شيء آخر" — تحرير المحتوى، العروض اللحنية، التعديلات الصوتية، إعادة البناء. وهو أقرب بكثير إلى بقية النماذج في التحرير العاطفي واللغوي المصاحب، حيث إن دقة العواطف لديه في SpeechEditBench البالغة 9.94 لا يمكن تمييزها تقريبًا عن 3.43 لدى Ming-UniAudio على معيار يكون فيه كلاهما ضعيفًا، كما أن درجته الصوتية الإجمالية البالغة 37.07 تقع في نفس نطاق خطوط الأساس. لذا فإن "نموذج واحد لكل مهمة كلامية" هو تأطير Tencent؛ أما ما يُظهره التقرير فعليًا فهو نموذج واحد ممتاز في العديد من هذه المهام وحاضر فقط في الباقي.
نقطتا تفتيش: AuK وAuK-Flash
أصدرت Tencent نسختين بموجب رخصة MIT نفسها. AuK هو النموذج الأساسي عالي الجودة، ويحدد التقرير إعدادات أخذ العينات الخاصة به عند 32 تقييمًا للدالة مع مقياس توجيه خالٍ من المصنف قيمته 2.0. أمّا AuK-Flash فهو الإصدار المقطّر: تهيئة التناسق وهدف DMD المنفصل المُوجَّه بالمهمة، بحيث يولّد في أربع خطوات ثابتة مع إيقاف التوجيه تمامًا، وهو ما يذكره التقرير على أنه تسريع في زمن التنفيذ بمقدار 4.5× مقارنةً بالنموذج الكامل في ظلّ شروط متطابقة. أرقام التقرير نفسها تُبقي Flash قريبًا في معظم مهام التوليد — 2.85 كمتوسط خطأ في الكلمات و0.790 في التشابه على Seed-TTS-Eval — وهذا هو ما يجعل ادعاء السرعة جديرًا بالاختبار بدلًا من رفضه: الانتشار في أربع خطوات بجودة قريبة من المعلم هو ما سيجعل محرر كلام بحجم 1.5B يبدو تفاعليًا على وحدة معالجة رسومية واحدة. ومع ذلك، فإن عبارة "شروط متطابقة" هي صيغة Tencent لوصف معيار Tencent الخاص، ورقم 4.5× الذي قاسه المؤلفون هو بالضبط النوع من الادعاءات التي تحتاج إلى طرف ثالث قبل أن يغيّر أي قرار شراء.
ما يمكنك تشغيله اليوم
السطح العملي أوسع من مجرد خفض وزن صامت نموذجي، لأن الكود جاء معه. يستهدف التثبيت Python 3.10 عبر uv أو Conda، ويقدم ملف README أهداف تثبيت إضافية تسحب Gradio أو عقد ComfyUI أو مجموعة الضبط الدقيق. أداة سطر الأوامر auk-infer تغطي كل مهمة بنفس شكل الرسالة: تعليمات --instruction مطلوبة دائمًا، و--audio اختياري حسب المهمة. يكشف خادم Gradio (auk-gradio) عن النماذج مع محدد، وهناك عقد ComfyUI مخصصة مع سير عمل قابل لإعادة الاستخدام، على الرغم من أن التكامل موثق بحد أقصى لتسلسل المصدر والهدف يبلغ 30 ثانية. تعكس واجهة برمجة التطبيقات Python واجهة سطر الأوامر، وخط أنابيب ضبط دقيق خفيف يتدرب على JSONL من أزواج التعليمات والصوت باستخدام نفس تنسيق الرسالة المستخدم في الاستدلال. يصف README أيضًا محسّن المطالبات (Prompt Enhancer) الذي يحول الطلبات الحرة إلى أوامر auk-infer جاهزة للتشغيل؛ ويتوقع نقطة نهاية دردشة متوافقة مع OpenAI، ويعود إلى نموذج SenseVoiceSmall المحلي للتعرف على الكلام عندما لا يتم تعيين بيانات اعتماد سحابية لـ ASR. أحد القيود الحالية موثق بوضوح: Qwen3-Omni غير مدعوم كمسار تشفير بعد، لذا تظل نقطة التحقق Qwen2.5-Omni-3B هي التي يجب تنزيلها.
ما زالت الوثائق لا تمنحك حدًا أدنى للعتاد. لا يُنشر أي رقم لذاكرة VRAM الخاصة بالاستدلال. تحمل ملفات الإعداد ملاحظة حول تدقيق التدرج (gradient-checkpointing) تفيد بأن الذروة تنخفض من ~91 جيجابايت إلى ~75 جيجابايت، وهو ما يصف نطاق الذاكرة أثناء التدريب لا رقمًا واقعيًا للاستدلال الأحادي، كما أن الأمر المرجعي الذي يُحمِّل AuK وAuK-Flash معًا يوزّعهما على وحدتي معالجة رسومية (GPU) — مع الإشارة إلى أن كلاهما يمكن أن يتشارك في وحدة واحدة. خصّص ميزانية للتنزيل نفسه: نحو 6.8 جيجابايت لكل نسخة إضافةً إلى مشفِّر Qwen2.5-Omni-3B، ثم قِس الذاكرة على وحدة GPU لديك.
ما الذي لم يتم تأكيده؟
إن الدقة بشأن المجهول لا تزال هي الهدف من تغطية نموذج في هذه المرحلة المبكرة، وقد أزال التقرير عنصرًا واحدًا بالضبط من هذه القائمة مع إبقاء الباقي على حاله:
• لا توجد أي عملية تشغيل مستقلة يمكننا العثور عليها. لا توجد عينات صوتية من طرف ثالث، ولا تكرار لمعايير القياس، ولا انطباعات في سلاسل النقاش. أول مشكلة مفتوحة في المستودع تم تقديمها دون إجابة، ولا يزال عدد تنزيلات بطاقة النموذج في العشرات، لذا فإن الفجوة بين الجدول المنشور والجدول المُعاد إنتاجه هي القصة بأكملها حاليًا.
التقييم مُدار ذاتيًا وضيّق من ناحية محددة. كل خط أساس في التقرير هو نموذج آخر مفتوح الأوزان — Qwen3-TTS, Seed-TTS, VoxCPM2, Ming-UniAudio, Step-Audio-EditX, MOSS-VoiceGenerator, RE-USE, MossFormer2-SS. لا يظهر أي من منصات الكلام المستضافة المغلقة التي قد يوازن المشتري بينها وبين AuK فعليًا، لذا فإن "يتصدّر المجال" هنا تعني "يتصدّر المجال المفتوح الذي اختارته Tencent".
• اسم "AuK" لا يزال غير موسّع في أي مكان في الورقة أو البطاقات أو الكود، ويصطدم بشدة في البحث مع الطائر البحري والجامعة الأمريكية في الكويت والمستودعات غير ذات الصلة.
الفريق أصبح الآن مرئيًا على الأقل — تضم الورقة 33 مؤلفًا بقيادة زيانغ ما، مع انتماءات تمتد عبر منظمة تينسنت هونيوان، وجامعة شنغهاي جياو تونغ، ومعهد شنغهاي للابتكار، وجامعة نانيانغ التكنولوجية — لكن من يملك النموذج يوميًا داخل تينسنت، وما إذا كان خط هونيوان أم تعاونًا أكاديميًا منفصلًا، لا يزال غير مذكور.
تغطية اللغات ما زالت موثقة جزئيًا فقط: بطاقة AuK-Flash تعلن دعم الصينية والإنجليزية، وأمثلة الكود تمزج بينهما، لكن النموذج الأساسي لا يحتوي على قائمة لغات رسمية. الترخيص له نفس الشكل — AuK نفسه مرخص بترخيص MIT، بينما مُشفّر Qwen المُنزّل بشكل منفصل يحمل شروطه الخاصة، لذا فإن "نموذج MIT" و"MIT كل ما تحتاجه لتشغيله" ليسا بنفس المعنى.
لماذا يُعدّ نموذج الكلام الموحّد مفتوح الأوزان مهمًا
اقرأ قائمة مهام AuK في مقابل ما يفعله المُنشِئ فعليًا اليوم، وسيصبح الرهان أوضح مما كان عليه قبل وصول الأرقام. إن تنفيذ كل تلك المهام بالأدوات الحالية يعني الربط بين عدة نماذج متخصصة — نقطة تفتيش مفتوحة للاستنساخ، وأخرى مختلفة للتحسين، وفاصل منفصل، وتحرير يدوي أو بمساعدة النماذج للمحتوى — أو استئجار عدة واجهات برمجية مغلقة ومستضافة، كل منها مُسعَّر لكل مهمة ولكل دقيقة من الصوت، ولا يمكن تحرير أيٍّ منها بالطريقة التي يصفها AuK. إن نقطة تفتيش واحدة مفتوحة الأوزان تتعامل مع كل ذلك بوصفها مسألة توليد موحّدة مشروطة بالنص هي فعلاً كيان مختلف، والتقرير الآن يدعم نسخة أكثر وضوحًا من هذا الادعاء مما قدّمه التسويق: جانب التحرير حقيقي وليس مجرد طموح. لقد تحوّل استنساخ الصوت إلى سلعة في العام الماضي، لكن تحرير المحتوى والإيقاع الصوتي الموجه بالتعليمات هو المكان الذي لا تزال فيه المنصات المغلقة المستضافة تحقق أرباحها، ونتيجة 91.83 مقابل 76.46 في تحرير المحتوى هي الدليل الأول على أن نموذجًا مفتوحًا يمكنه امتلاك هذه الأرضية.
التحفّظ الصادق هو أن هذا نموذج انتشار مع نموذج لغوي بحجم 3B مُثبَّت عليه للتكييف، وأنه يرث تكاليف تلك البنية. الجودة متفاوتة من مهمة إلى أخرى — ممتازة عندما تكون المهمة «الحفاظ على كل شيء باستثناء التعديل»، وأضعف في نقل المشاعر — ولا توجد نقطة نهاية مستضافة، ولا خطة معلنة للمعالجة بالدفعات، ولا زمن استجابة منشور لأي شيء سوى المقارنة الداخلية لنسخة Flash. أما بالنسبة لمكوّنات خط أنابيب الصوت المحيطة به — نموذج اللغة الكبير (LLM) الذي يقرر ما ينبغي قوله، ونقطة نهاية الدردشة المتوافقة مع OpenAI في Prompt Enhancer — فإن واجهة برمجة تطبيقات للتوجيه هي الخيار الطبيعي، إذ توفر OrcaRouter أكثر من 200 نموذج بسعر قائمة المزود دون أي رسوم إضافية، بحيث يحتاج نصف البنية التقنية إلى مفتاح واحد فقط ولا يتطلب عقدًا ثانيًا. أما النصف الصوتي فما زال وحدة معالجة رسومية (GPU) تتحكم فيها بنفسك، ونقطة checkpoint لم يقم بمراجعتها أحد من خارج Tencent.
من الذي ينبغي أن ينظر الآن، ومن الذي ينبغي أن ينتظر؟
للباحثين في مجال الكلام، ولصانعي الأدوات، ولكل من وظيفته تقييم نماذج الصوت الجديدة، فإن مبررات تحميل AuK هذا الأسبوع أقوى مما كانت عليه في اليوم الأول، وما تزال مصحوبة بالتحذير نفسه. لقد أصبح لديك الآن بنية موثّقة، ووصفة تبدو قابلة لإعادة الإنتاج، وجدولًا كاملًا بالأهداف التي يجب تجاوزها — وهذا هو بالضبط ما يجعل الادعاء غير المُعاد إنتاجه جديرًا بالهجوم. تبقى تكلفة التبكير عطلة نهاية أسبوع للإعداد وبطاقة GPU واحدة. أما لمن يختار حزمة صوتية للإنتاج، فإن التقرير يغيّر شكل القرار دون أن يحسمه: هناك الآن أرقام يمكن المجادلة حولها، لكنها أرقام البائع، وهي تستبعد المنصات المغلقة التي كنت ستقارن بها فعليًا، وما زال لا يوجد API، ولا حد أدنى لذاكرة VRAM، ولا سجل أداء. راقب، بالترتيب: إعادة إنتاج مستقلة لصفوف Seed-TTS-Eval وSpeechEditBench؛ أو عيّنات منشورة أو Space تجريبي يمكن الوصول إليه؛ ثم موفّر استدلال أو API مستضاف يعتمد AuK، وعندها يكون سعر المرور من جانبنا هو السعر الرسمي للموفّر، في نفس اليوم، لأن هذا هو معنى هامش ربح 0%. السؤال المثير للاهتمام لم يعد ما إذا كانت Tencent أصدرت نموذج TTS آخر — بل ما إذا كان نموذج واحد مفتوح يمكنه حقًا أن يحتضن عائلات المهام الخمس جميعها في آن واحد، والآن بعد أن نشرت Tencent إجابتها الخاصة، لم يتبقَّ سوى أن يتحقق منها شخص آخر.
