
تسريب صوت Claude: علامة تبويب "معاينة" مخفية في تطبيق Claude، والموافقة الاختيارية على بيانات الصوت التي ظهرت إلى جانبها
- OrcaجديدOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 لكل مليون رمز · 79 tok/s
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 355 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
في مرحلة ما قبل 4 أكتوبر 2026، ظهر عنصر تنقّل لم يكن ينبغي أن يكون مرئيًا بعد في واجهة Claude على الويب: الصوت، وهي علامة تبويب منفصلة تحمل معاينة، وهي تسمية داخلية. لا يوجد إعلان عنه، ولا بطاقة نموذج، ولا سطر تسعير، ولا مدخل API، ولا تاريخ. وفي الفترة نفسها تقريبًا — أُبلغ عنها في 5 أكتوبر — أضافت الشركة بهدوء شيئًا آخر لم تعلنه: موافقة اختيارية للمستهلكين تتيح للمستخدمين تسليم تسجيلات صوتية وبيانات دردشة صوتية "لتحسين نماذجنا للذكاء الاصطناعي"، منفصلة عن الموافقة التي تطلبها بالفعل للمحادثات النصية. ولا تزال التشكيلة المطروحة أربعة نماذج ذات مخرجات نصية — Claude Fable 5.1، Claude Opus 5.5، Claude Sonnet 5.5 وClaude Haiku 5.5 — ولم تُطلق قط نموذج كلام خاصًا بها. لذا فالسؤال المفيد الذي يطرحه هذا التسريب ليس "هل تُطلق الشركة نموذجًا صوتيًا؟". بل هو أضيق: تُثبت علامة التبويب أنه يجري بناء واجهة، وتُعد الموافقة الاختيارية أول دليل ملموس على أن الشركة تريد بيانات تدريب صوتية. هذان ادّعاءان مختلفان، وثانيهما فقط يمكن تأريخه.
كل ما يلي مُصنَّف إلى ما هو مؤكَّد، وما هو منقول وغير مُتحقَّق منه، وما هو استنتاج. لم تقل Anthropic أي شيء عن التبويب على الإطلاق، مما يعني أن مصدر الحقيقة المحورية هو لقطة شاشة وليس بيانًا صحفيًا.
ما الذي رُصد فعلاً، وما الذي لا يخبرنا به
جاء هذا الاكتشاف من @testingcatalog على منصة X، ونُشر في 4 أكتوبر 2026، وكُتب عنه في المنصة نفسها في 10 أكتوبر. وبحسب ما ورد في المقال: «ظهر عنصر Voice منفصل في واجهة تنقل Claude على الويب مع وسم Preview داخلي»، و«لا تزال قدراته وتوافره العام غير معروفة». هذا هو كل الدليل المباشر. ويوضح التقرير صراحةً أن الوسم يشير إلى بيئة معاينة داخلية وليس إلى طرح تدريجي.
ثلاثة أمور تترتب على الأثر، ولا شيء منها يمثل مواصفة:
• النطاق — تشير تسمية معاينة داخلية إلى وجود نسخة تجريبية في مكان ما داخل Anthropic. لكنها لا تقول إن هذه النسخة تحتوي على نموذج جديد. فتبويب التنقل هو واجهة مستخدم.
• المزوّد — يلاحظ التقرير أن Anthropic "لم تؤكد مزوّد الصوت الأساسي"، ولم تُصدر نماذج تحويل النص إلى كلام مخصّصة عبر واجهة برمجة التطبيقات الخاصة بها، ولم تُطلق نموذجًا صوتيًا أصليًا للزمن الحقيقي من طرف إلى طرف. الأخيران قابلان للتحقق وصحيحان. توثيق النماذج العام الخاص بـ Anthropic يسرد أربعة نماذج حالية ويصف الأربعة جميعًا بالطريقة نفسها: إدخال نص وصورة، وإخراج نص.
• التوقيت — لم يُذكر أو يُلمَّح إلى أي تاريخ. «لا معلومات عن موعد الإتاحة العامة»، وفقاً لما ورد في التقرير.
هناك سابقة جديرة بالمعرفة، لأنها ذات حدين. فقد شحنت Anthropic أشياء تحت لافتة معاينة من قبل — خرج خط Mythos كمعاينة قبل الوصول العام — لذا فإن تسمية المعاينة الداخلية ليست خيطًا مضللًا تلقائيًا. لكن Anthropic أيضًا ظلت لديها أعلام وضع الصوت موجودة دون شحن في كود الإنتاج لأشهر: أظهر تسريب في أبريل 2026 لحزمة مصدر Claude Code مجموعة من أعلام الميزات غير الصادرة، بما في ذلك وضع صوتي، إلى جانب عمل الجسر والوكيل الخلفي. كان الصوت قيد التقدم بشكل مرئي في Anthropic لأكثر من عام بكثير دون أن يظهر نموذج صوتي. التبويب متسق مع ذلك التاريخ ولا يدفعه إلى الأمام.
الاشتراك الاختياري هو الإشارة التي تحمل تاريخًا.
النصف الثاني من التسريب أكثر موثوقية، لأنه تغيير في الخصوصية وليس لقطة شاشة. في 5 أكتوبر 2026، أضافت Anthropic إعدادًا اختياريًا يسمح للمستخدمين بالمساهمة بتسجيلات صوتية وبيانات الدردشة الصوتية لتحسين النموذج، وفقًا لما أوردته عدة منافذ إخبارية. نص المطالبة كما ورد هو "اسمح لنا باستخدام بياناتك الصوتية لتحسين نماذج الذكاء الاصطناعي لدينا"، مع نص مصاحب يقول إن البيانات الصوتية وبيانات الدردشة الصوتية تساعد في تحسين كيفية تعامل النماذج مع الكلام. التفاصيل المذكورة، وكلها من نفس مجموعة التغطية:
• أين يوجد — في إعدادات Claude، ضمن الخصوصية، ويظهر كمفتاح موافقة صريحة.
• الوضع الافتراضي — معطّل. يُسأل المستخدمون؛ ولا يتم تسجيلهم.
• نطاقه — منفصل عن آلية الموافقة الحالية للمحادثات النصية، وهذا هو التفصيل الأكثر أهمية.
• قابلية التراجع — يمكن إيقاف تشغيله لاحقًا وحذف بيانات الصوت من الإعدادات، وفقًا للتغطية.
لماذا تهمّ الموافقة المنفصلة: لو كانت منظومة الصوت بأكملها تكاملًا مع مورّد ولا يشارك فيها أي نموذج من Anthropic، لكان المكان الطبيعي لتوحيد الموافقة موجودًا أصلًا. أمّا استحداث قناة مستقلة لبيانات الصوت فهو ما تفعله عندما تنوي التدريب على الكلام — لنموذج جديد، أو لطبقة كلام متخصصة داخل نموذج قائم. هذه حجة تنطلق من الحافز، لا من الأدلة، وينبغي قراءتها على هذا النحو. والقراءة المضادة الأمينة هي أنّ شركة تشغّل ميزة صوتية على نطاق واسع تحتاج إلى مجموعة تقييم خاصة بها وتحليل إخفاقات خاص بها بصرف النظر عمّن يوفّر الصوت، كما أنّ الموافقة الاختيارية المصمَّمة ليُوقف تفعيلها لاحقًا هي أيضًا أرخص سبيل للامتثال بينما تقرر.
سياق إضافي واحد، لأنه يجعل التغيير يبدو على غير ما هو عليه. توثيق Anthropic نفسه للمنتجات التجارية يقول بصراحة، في مقال بتاريخ 16 مارس 2026، إننا "لا نستخدم صوتك لتدريب نماذجنا"، وإنه بعد نسخ الكلام نصيًا يُحذف التسجيل الصوتي. ذلك المقال يقتصر نطاقه على Claude for Work وAnthropic API وواجهات تجارية مماثلة. أما الموافقة الاختيارية الجديدة فهي إعداد على جهة المستهلك. يمكن أن يكون كلا البيانين صحيحين في الوقت نفسه — وهذا بالضبط هو شكل شركة تنشئ خط أنابيب لبيانات التدريب في أحد جانبي النشاط التجاري، بينما تحافظ على الوعد التعاقدي في الجانب الآخر.

لدى Anthropic منتج صوتي منذ عام، لكن ليس لديها نموذج صوتي خلال أي جزء من تلك الفترة.
هذا هو الجزء الذي تميل تغطية التسريبات إلى تخطيه، وهو السياق الذي تحتاجه لقراءة علامة التبويب بشكل صحيح.
أُطلق وضع الصوت في Claude في مايو 2025 كميزة محادثة منطوقة في تطبيقات الهاتف المحمول. ومنذ البداية كان مجرد غلاف: كانت نماذج Anthropic اللغوية تتولى الاستدلال، بينما جاء الصوت نفسه من مكان آخر. ولم يُكشف قط عن حزمة التقنيات المستخدمة. وعندما غطّت TechCrunch ترقية وضع الصوت في 23 يوليو 2026، أشارت إلى أن "Anthropic لم تُجرِ أي تغييرات على نموذج الصوت في هذا الإصدار"، وأن الشركة "لم تُفصّل نوع حزمة تقنيات الصوت التي تستخدمها". وقد أشارت التقارير منذ عام 2025 إلى ElevenLabs كمورّد تقنية الكلام، واستُنتج ذلك إلى حد كبير من إفصاحات Anthropic عن المعالجين الفرعيين، وليس من أي شيء أكّدته Anthropic. تعامل مع المورّد على أنه غير مُتحقق منه.
ترقية يوليو 2026 تحمل دروسًا بسبب ما لم تتضمنه. فقد أضافت اختيار النموذج — إذ كان بإمكانك الاختيار بين Claude Opus وClaude Sonnet وClaude Haiku بدلًا من Claude Haiku فقط — بالإضافة إلى موصلات إلى Gmail وCalendar وSlack وCanva وNotion، ومحادثات أطول، ودعم متعدد اللغات صدر بنسخة تجريبية. كل واحد من تلك التغييرات يقع في المنبع قبل الصوت. أما الصوت فلم يتحرك.
ما هو وضع الصوت اليوم، على وثائق المساعدة الخاصة بـ Anthropic:
• النماذج — «يمكن لوضع الصوت استخدام نماذج Claude نفسها التي تستخدمها في الدردشة النصية»، وهو «يبدأ بالنموذج الذي استخدمته آخر مرة في الدردشة النصية». هناك استثناء واحد: Claude Fable غير متاح في وضع الصوت.
• الإتاحة — ميزة تجريبية على جميع الخطط، من المجانية إلى Enterprise، على Claude Mobile وسطح المكتب والويب، مع أنها مصممة لتعمل على أفضل وجه من الهاتف.
• الأصوات — "اختيار محدود ومُعدّ مسبقًا"، وذلك صراحةً لمنع استنساخ الصوت أو انتحال الشخصية.
• الفوترة — تُحتسب المحادثات الصوتية ضمن حدود خطتك المعتادة. لا يوجد عدّاد منفصل للصوت.
• القيود — يتوفّر الإملاء الصوتي في Claude Cowork وClaude Code، لكن وضع الصوت لا يتوفّر.
• اللغات — الإنجليزية بالإضافة إلى لغات أخرى، مع بقاء مجموعة اللغات غير الإنجليزية مصنّفة كنسخة تجريبية.
يصف كل واحد من تلك الأسطر منتجًا يلتفّ حول كلام شخص آخر. لا يصف أيٌّ منها نموذج كلام.
ثلاثة أشياء قد يكون تبويب Voice أحدها، وواحد منها فقط هو نموذج
سبب سهولة الإفراط في قراءة هذا التسريب هو أن السيناريوهات المستقبلية الثلاثة المحتملة كلها تبدو متطابقة في شريط تنقل.
• تغيير في الواجهة — شاشة صوت مخصصة، وزر صوت في شريط الأوامر، ومنتقٍ للصوت في الإعدادات. سبق أن ذُكر أن Anthropic كانت تعدّ شيئًا من هذا القبيل في فبراير 2026. إذا كان هذا كل ما في الأمر، فإن علامة التبويب إعادة تصميم، وبنية الصوت الأساسية لم تُمَس.
• تبديل المزوّد — البنية المتتالية نفسها، لكن مورّد الكلام وراءها مختلف. لا يُرى من الخارج. هذا قد يفسّر الموافقة على استخدام بيانات التدريب بحد ذاته، لأنه لا يمكنك تقييم تبديل مورّد دون صوت يُسمح لك بالاحتفاظ به.
• نموذج أصلي من الكلام إلى الكلام — تدرّب Anthropic نموذجها الصوتي الخاص بها وتتخلى عن البنية المتسلسلة. هذا هو التفسير المكلف، وهو التفسير الذي سيهم أي شخص يبني على Claude، والوحيد الذي يحتاج إلى مدونة من الكلام الموافَق عليه. وهو أيضًا التفسير الذي لا تدعمه الأدلة بعد.
لا تستطيع علامة التبويب التمييز بينهما. الأمران التاليان القابلان للتحقق سيفعلان ذلك: معرّف نموذج Anthropic في قائمة نماذجها، وخطاب على صفحتها الفرعية. لم يحدث هذا بعد.
حيث لا تكون Anthropic
أوضح طريقة لرؤية مدى بُعد Anthropic عن امتلاك هذه الطبقة هي النظر إلى المواضع التي لا يظهر فيها، ثم إلى ما تنشره بالفعل. المقارنات المستقلة من كلام إلى كلام — يدير Artificial Analysis واحدة منها تغطي نحو أربعين نموذجًا عبر الاستدلال والديناميكيات الحوارية وأداء الوكلاء — تمتلئ بنماذج صوتية أصلية من Gemini 3.8 Live وGPT-Realtime-2 وGPT-Live-1 وQwen Audio 3.0 Realtime وGrok Voice Think Fast 2.0 وStepAudio 3 Realtime وNova 2.0 Sonic وNVIDIA وKyutai وعدد قليل من الجهود المفتوحة. ولا يظهر اسم Anthropic في أي مكان على قائمة من هذا القبيل. وهناك مجموعة منفصلة من المدخلات تغطي مسارات وكلاء صوتية متسلسلة — نموذج تحويل الكلام إلى نص، ونموذج لغوي كبير (LLM)، ونموذج تحويل النص إلى كلام، موصولة معًا — وهي البنية التي يشبهها وضع الصوت الخاص بـ Anthropic أكثر من غيرها. وفي مقابل ذلك، فإن توثيق Anthropic لنماذجه الخاصة لا لبس فيه: أربعة نماذج حالية، توصف كلها بالطريقة نفسها — إدخال نص وصورة، وإخراج نص، مع عدم وجود أي معرّف لنموذج صوتي في أي مكان من الصفحة.

هذا ليس المنتج. إنه تصريح عن المكان الذي تُخلَق فيه القيمة، ويشرح لماذا يوجد تبويب صوتي في المنتج أصلًا: الصوت هو المجال الوحيد الذي يمتلك فيه كل مختبر آخر نموذجًا خاصًا به بينما لا يمتلكه أنثروبيك.
ماذا نفعل بشأنه هذا الشهر، وهو لا يختلف عن غيره
الترجمة العملية لكل هذا هي أنه لم يتغير شيء بالنسبة لأي مطوّر في 4 أكتوبر. وضع الصوت هو المنتج نفسه الذي كان عليه في يوليو. لم يُضَف أي معرّف نموذج أو يُسحَب. ولم يتحرك أي سعر. إذا كنت تشحن الصوت على Claude اليوم، فأنت تشحن سلسلة متتالية: نموذج Claude للتفكير، ونموذج منفصل للتحدث، وطبقة ربط بينهما. لا يغيّر التسريب ذلك، وبناء الأمور حول تبويب يقول Preview هو كيف تنتهي الفرق بتبعية في خارطة الطريق على فرع داخلي يخص شخصًا ما.
لكن ما يدعو إليه حقًا هو إبقاء نصف الكلام في المنظومة قابلاً للاستبدال، لأن التسلسل هو حيث يقع الارتباط الفعلي — ليس في نموذج Claude، الذي يمكنك استدعاؤه من أي مكان، بل في الكود الرابط الذي كتبته لمورّد الكلام. وعلى نحو ملموس، فإن جانب Claude قابل للتوجيه بالفعل: Claude Opus 5.5 وClaude Sonnet 5.5 وClaude Fable 5.1 وClaude Haiku 4.5 موجودة في كتالوج OrcaRouter بسعر قائمة Anthropic دون هامش ربح — سعر قائمة المورّد يُمرَّر كما هو، فإذا خفّضت Anthropic سعرًا يصبح ساريًا لدينا في اليوم نفسه — كما أن نماذج تحويل النص إلى كلام التي ستقرنها بها (معاينات TTS من Gemini، وtts-1-hd، من بين أخرى) تقع خلف المفتاح نفسه. نقطة نهاية واحدة لنصفَي خط أنابيب صوتي تعني أن تبديل مورّد يصبح تغييرًا في سلسلة النموذج لا عقدًا ثانيًا، والتجاوز التلقائي يعني أن النصف غير المُثبَت من خط أنابيبك يتراجع إلى بديل عامل بدلًا من إفشال المكالمة.
ما الذي قد يؤكده فعلاً؟
تخطَّ التكهنات وراقب أربعة مواضع محددة قابلة للتحقق. كل واحد منها حدث يمكن تأريخه، وأي منها ينقل هذا من تسريب إلى خبر:
• مُدخل جديد في وثائق نماذج Anthropic أو قائمة واجهة Models API مع إدخال صوتي أو إخراج صوتي. هذا هو الأثر الوحيد الذي يُثبت وجود نموذج كلام من الطرف الأول.
• إضافة متعلقة بالكلام إلى صفحة المعالجين الفرعيين الخاصة بـ Anthropic. وهذا يثبت العكس — مورّد خارجي جديد وليس نموذجًا داخليًا.
• تبويب Voice يفقد علامة Preview الخاصة به في تطبيقات المستهلكين. هذا هو الطرح، وهي اللحظة التي تصبح فيها الميزة قابلة للمراجعة بدلًا من أن تكون قابلة للملاحظة.
• صفّ تسعير. تُحدّد Anthropic أسعار ما تبيعه؛ وسعر الدقيقة للكلام سيحسم مسألة البنية أسرع من أي اختبار مرجعي.
حتى يتحقق أحد هذه الأمور، فإن الملخص الدقيق لأكتوبر 2026 هو هذا: Anthropic تبني واجهة صوتية، وتجمع بيانات كلام بموافقة لأول مرة، ولم تُصدر بعد أي نموذج كلام. التبويب هو الأقل إفادة من هذه الحقائق الثلاث وهو الذي انتشر أكثر من غيره.

السؤال المطروح ليس ما إذا كانت Anthropic تريد تجربة صوتية أفضل — فالاشتراك الاختياري يجيب عن ذلك. بل ما إذا كان "الصوت الأفضل" في Anthropic يعني نموذجًا تملكه أم مورّدًا تديره بعناية أكبر. يبدو هذان المساران متماثلين من الخارج لفترة، ثم لا يعودان متشابهين على الإطلاق.
