بطاقة عنوان رئيسية مولّدة تحمل: موجز واحد، نموذجان، فيديو واحد مُروى، مقسّمة إلى عمودين. العمود الأيسر، بعنوان Claude Opus 5.5، يحمل: يكتب النص؛ صدر في 22 سبتمبر 2026؛ 4.00 دولارات للإدخال و20.00 دولارًا للإخراج لكل مليون رمز. العمود الأيمن، بعنوان Gemini 3.8 Flash TTS، يحمل: يقرؤه بصوت عالٍ؛ متاح للعموم في 22 سبتمبر 2026؛ 9.00 دولارات لكل مليون رمز صوتي. سطر تذييل يحمل: فيديو مُنتَج مدته 5 دقائق و51 ثانية يبلغ نحو 8,775 رمزًا صوتيًا، أي ما يقارب 8 سنتات مقابل التعليق الصوتي.
Guides & Insights

كلود أوبوس 5.5 وGemini 3.8 Flash TTS أنتجا فيديو إخباريًا مُعلَّقًا عليه: الموجز، وبطاقتا الأسعار، وكم يكلّف الصوت

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

نموذجان، مورّدان، فيديو واحد مكتمل، ومطالبة قصيرة بما يكفي للصقها في صندوق محادثة. في 2 أكتوبر 2026، نشر الكاتب الصيني العامل في مجال الذكاء الاصطناعي 宝玉 (X/@dotey) نسختين مُصدّرتين من موجز القيل والقال نفسه — واحدة بالإنجليزية وأخرى بالصينية — وقال إن كليهما بُنيَ من البداية إلى النهاية بواسطة Claude Opus 5.5، الذي وجد مادته بنفسه وكتب نصّه السردي بنفسه، مع صوت وفّره Gemini 3.8 Flash TTS باستخدام مفتاح API قدّمه المؤلف. لا أحد من النموذجين جديد: فقد أطلقت Anthropic نموذج Claude Opus 5.5 في 22 سبتمبر 2026، وتؤرّخ ملاحظات إصدار Google نماذج تحويل النص إلى كلام Gemini 3.8 باليوم نفسه. أما ما لا يتجاوز عمره بضعة أيام فهو التغليف — موجز المُنتِج نفسه، ومجموعة من المستودعات أُنشئت بين 30 سبتمبر و3 أكتوبر تحوّل ذلك الموجز إلى مهارة Claude Code يمكنك تثبيتها. هذا مقال عن سير العمل، لا عن إطلاق.

ما يحدده الموجز فعليًا

القالب جملة واحدة فيها ثلاث خانات. وعند ترجمته إلى الإنجليزية عن الصينية الأصلية، يُقرأ هكذا: اصنع لي فيديو نميمة عن {الموضوع} (مواد تكميلية: {الروابط/لقطات الشاشة، اختياري}؛ نسخة مجهولة الهوية: احذف {اسم الشخص}، اختياري). كل ما هو مثير للاهتمام في هذا القالب مخفيّ في تلك الخانات الثلاث، لأن موجزًا بهذا القِصر لا يكون قابلًا للتفويض إلا إذا كان بإمكان المتلقّي أن يفعل ثلاثة أشياء دون أن يُقال له: أن يجد مادته المصدرية بنفسه، وأن يقرّر ما هي القصة، وأن يعيد عملاً منتهيًا بدلًا من خطة.

الموضوع عبارة عن سلسلة نصية حرة، لذا يقوم النموذج باختيار تحريري — ما الذي يُعدّ القصة، وما المقاطع التي يجب تضمينها، وبأي ترتيب ترد. وهذه مهمة مختلفة عن التلخيص، وهي الجزء من خط المعالجة الذي يملك المشغّل أقل قدرة على التحكم فيه. المادة التكميلية الاختيارية هي مخرج الطوارئ: الصق رابطًا أو لقطة شاشة وسيعمل النموذج انطلاقًا من مصدر ثابت بدلًا من البحث، وهذا هو الفرق بين إخراج قابل لإعادة الإنتاج وفيديو مختلف في كل مرة تشغّله. الخانة الثالثة، 去敏، هي التي تستحق التوقف عندها وسنعود إليها.

اقرأ الموجز كمواصفة، وسيخبرك بما يفترضه عن منظومة التشغيل. إنه يفترض أن النموذج يستطيع الوصول إلى العالم الخارجي — فخطوة الاستكشاف مُفوَّض بها، لا موصوفة — وأن ما يستطيع النموذج الوصول إليه خاصية من خصائص الأدوات التي يثبّتها المشغّل، لا من خصائص Claude Opus 5.5 نفسه. وهو يفترض وجود حزمة صور أو تصيير، لأن الأثر المُسلَّم فيديو، وClaude Opus 5.5 لا يُصدر فيديو. ويفترض وجود صوت.

تقسيم العمل هو القصة

هذا الافتراض الأخير هو الحقيقة البنيوية لسير العمل هذا. إن مدخل الكتالوج الخاص بنا لـ anthropic/claude-opus-5.5 يُدرج طرائق إدخاله كنص وصورة وملف، وطريقة إخراجه كنص — أي طريقة واحدة ناقصة. لا يستطيع النموذج توليد الكلام، ولا يستطيع سماع مسار صوتي بمجرد أن يوجد. لذلك فإن كل فيديو مُعلّق صوتيًا يُبنى بهذه الطريقة لديه على الأقل تبعيتان لنموذجين، مع قائمتَي أسعار ومورّدين اثنين وبيانَي اعتماد، ويجب أن يوفّر إنسان الثاني منهما. يستطيع Opus 5.5 كتابة النص وربط التصيير؛ لكنه لا يستطيع فتح حساب Google أو تجهيز مفتاح. ويقول مؤلف منشور 2 أكتوبر ذلك بالضبط: كان مفتاح Gemini ملكًا له.

للقيد حدّ ثانٍ يسهل تفويته حتى تصل إلى مرحلة الإطلاق. ولأن Claude Opus 5.5 لا يستقبل صوتًا، فإن النموذج الذي كتب التعليق الصوتي لا يستطيع التحقق من التعليق الصوتي. أسماء يُخطئ في نطقها، وتشديد غريب، وجملة يجعلها المُركّب الصوتي مسطّحة — لا شيء من ذلك يصل إلى النموذج الذي ألّفه. ضبط الجودة على الصوت هو إنسان يستمع إلى الناتج، في كل مرة، وهذه هي الخطوة التي تمنع هذا من أن يكون خط أنابيب غير مأهول بالكامل مهما كان النص جيدًا. وحيث يكون ناتج النموذج نفسه برنامجًا، تكون المراجعة استماعًا لا مقارنة فروقات.

A screenshot of Google's Gemini API documentation for the Gemini 3.8 Flash TTS model, captured in English on 3 October 2026, showing the model identifier gemini-3.8-flash-tts, the studio-grade voice fidelity and long-form multi-turn stability description, voice design and voice replication support, and a supported-languages count of over 130 languages.

ما يكلفه الصوت — وهو ليس الجزء المكلف

تنشر صفحة أسعار Google معامل التحويل الذي يجعل هذه الحسابات بسيطة: تقابل رموز الصوت 25 رمزًا لكل ثانية من الإخراج. تستغرق عمليتا العرض في منشور 2 أكتوبر 351 ثانية و332 ثانية، بحسب بيانات الوسائط الوصفية الخاصة بالتغريدة نفسها — أي نحو خمس دقائق وواحدة وخمسين ثانية، وخمس دقائق واثنتين وثلاثين ثانية. وعند 25 رمزًا في الثانية، يصبح ذلك 8,775 و8,300 رمز صوتي، وعند سعر الصوت الحالي في Flash TTS البالغ 9.00 دولارات لكل مليون رمز، فإن ذلك يعادل نحو ثمانية سنتات من التعليق الصوتي لكل فيديو، ونحو خمسة عشر سنتًا لكلا النسختين اللغويتين معًا.

ضع ذلك بجانب الجانب الاستدلالي لنفس المهمة. سعر القائمة لـ Claude Opus 5.5 هو 4 دولارات لكل مليون رمز إدخال و20 دولارًا لكل مليون إخراج، مع احتساب رموز التفكير كإخراج، وقراءات الذاكرة المؤقتة بسعر 0.20 دولار لكل مليون. إن التعليق الصوتي لفيديو مدته ست دقائق لا يُذكر مقارنة بالرموز التي يستهلكها النموذج في تحديد ماهية القصة، وقراءة المصادر، وكتابة النص الذي يقرأه الصوت. الاستنتاج العملي ليس أن "TTS رخيص" — بل هو أنه في هذا المسار، الصوت هو البند الوحيد الذي لا يجب عليك تحسينه، والجهد يجب أن يُوجَّه إلى الجزء الذي يكلف الدولارات.

سيغيّر تفصيلان في بطاقة الأسعار تلك الحسابات، لذا خطّط لمواجهتهما الآن:

• تُغلق نافذة العرض الترويجي — سعر Flash TTS standard هو 0.50 دولار لكل مليون رمز نصي مُدخل و9.00 دولارات لكل مليون رمز صوتي مُخرج حتى 31 ديسمبر 2026، ثم يصبح 1.00 دولار و18.00 دولارًا. ويكلّف التعليق الصوتي للفيديو نفسه نحو ستة عشر سنتًا في يناير، أي ضعف ذلك تمامًا.

• توجد فئة أرخص مع مقايضة حقيقية — إذ تتقاضى Gemini 3.8 Flash-Lite TTS مبلغ $0.50 و$6.00 وفق الجدول نفسه، وترتفع إلى $1.00 و$12.00، وتغطي 101 لغة مقابل 130 لدى Flash TTS. بالنسبة لفيديو توضيحي براوٍ واحد بالإنجليزية، فإن Lite تمثّل ثلثي سعر الصوت، وسقف اللغات غير ذي صلة؛ أما بالنسبة للنسخة ثنائية اللغة في منشور 2 أكتوبر، فليس من الواضح أنها غير ذي صلة، وهو القرار الذي يطلب منك تقسيم الفئات اتخاذه.

تبلغ تكلفة فئة Batch وFlex من Google 0.25 دولار للإدخال و4.50 دولار للإخراج، بينما تبلغ Priority 0.90 دولار و16.20 دولار — وهذا أمر يستحق معرفته إذا كانت عمليات التصيير لديك تدخل في قائمة انتظار بدلًا من أن تكون تفاعلية، لأنه لا شيء في ملخص للقيل والقال يتطلب الإجابة في الوقت الفعلي.

A two-column rate-card panel titled The voice versus the reasoner. The left column, Gemini 3.8 Flash TTS, reads: text input 0.50 dollars per million through 31 December 2026 then 1.00; audio output 9.00 dollars per million through 31 December 2026 then 18.00; metering 25 audio tokens per second of speech; six-minute narration about 8 cents today, about 16 cents from 1 January 2027. The right column, Claude Opus 5.5, reads: input 4.00 dollars per million; output 20.00 dollars per million with thinking billed as output; cache reads 0.20 dollars per million; output modality text only, so it cannot hear the track it commissioned. A footer line reads: Google and Anthropic published rates, read 3 October 2026, vendor-reported.

هذا الأسبوع أصبح الموجز مهارة

الموجّه في تغريدة هو عرض توضيحي؛ أما المستودع فهو شيء يمكنك تثبيته. والمستودعات التي ظهرت حول هذا النمط هي الجزء الذي يقع فعلاً ضمن الأيام السبعة الماضية، وهي جديرة بالقراءة كلٌّ على حدة لا كمجموعة، لأن كل واحد منها يضع رهاناً مختلفاً على مقدار ما ينبغي تثبيته من خط المعالجة في الشيفرة.

• hoangduong92/idea-to-film-skill — أُنشئ في 30 سبتمبر 2026، برخصة MIT، وهو الأقرب تطابقًا إلى منشور 2 أكتوبر: مهارة لـ Claude Code تأخذ فكرة وتحوّلها إلى فيلم قصير بصيغة MP4 مرويّ بصوت، مع رسوم متحركة مرسومة بالكود، وموسيقى، ومؤثرات صوتية، وصوت Gemini TTS، وترجمات. يُذكر اسم الصوت في الوصف، وهذه هي الطريقة الصادقة لنشر هذا: فالمزوّد الثاني تبعية معلنة، لا خفية.

• samuelstroschein/opus-video-generator — أُنشئ في 2 أكتوبر، بترخيص MIT، وهو الأكثر تشدّدًا فيما يتعلق ببيانات الاعتماد: فهو يصنع فيديوهات الإطلاق في متصفحك على اشتراكك الخاص في Claude، ويُشغَّل عبر npx. وهذا جواب مختلف للمشكلة الأساسية المذكورة أعلاه — إبقاء استحقاق المستخدم القائم ضمن الحلقة بدلًا من إصدار مفتاح API جديد لوكيل ما.

• makevoid/motion-graphics-music-video-skill-noimage — أُنشئ في 2 أكتوبر، بترخيص MIT، وهو المشروع صاحب الانضباط الجدير بالاقتداء: يذكر في وصفه نفسه أنه لا يستخدم أي نموذج صور ولا نموذج فيديو، بل ينتج رسومات حركية من مقطع موسيقي وموجّه نصي. عندما تكون خطوة التوليد الوحيدة هي الشيفرة، يصبح الناتج قابلاً لإعادة الإنتاج، ويكون كل ترخيص أصول في العمل النهائي متروكًا لك لتفكر فيه.

• RohanRatwani/explainer-video-opus-5.5 — أُنشئ في 2 أكتوبر، بترخيص MIT، ويستهدف الفيديو التفسيري بنسبة 16:9 وShorts بدلًا من ملخص الشائعات، ويسمّي مشكلة التوقيت صراحةً: كل رسم متحرك موقوت وفق التعليق الصوتي. هذا الترتيب مهم، لأنه يعني أن الصوت يُنتَج قبل وضع العناصر المرئية.

• zhuyansen/awesome-opus-5.5-video — أُنشئ في 27 سبتمبر، دون إعلان أي رخصة، وهو الأكثر بروزًا في المجموعة بفارق كبير عند 67 نجمة، بينما يبقى الآخرون بأرقام أحادية أو عند الصفر. إنه فهرس لا أداة، بالإنكليزية والصينية، ووجوده إشارة مفيدة إلى طبيعة الاهتمام: فما يريده الناس أولًا هو كتالوج لما يدّعي آخرون أنهم صنعوه، ثم تتبعهم الأدوات.

لا شيء من هذه يُعد تبعية مستقرة. عمرها أيام قليلة، ومؤلّفة من شخص واحد، وشروط ترخيصها هي الشيء الوحيد الواقف بينك وبين مقطع مصوّر لا يمكنك استخدامه. لكن الاتجاه هو المهم: المطالبة النصية في التغريدة هي النموذج الأولي، والمهارة في المستودع هي ما سيتبنّاه أي فريق فعليًا.

نسختان لغويتان، قصة واحدة

منشور 2 أكتوبر ثنائي اللغة عمدًا — نسخة إنجليزية وأخرى صينية عن الموضوع نفسه. هذا غير معتاد بالنسبة لعرض توضيحي، وهو يكشف شيئًا حقيقيًا عن هذا الشكل، ألا وهو أن القيل والقال لا ينتقل عبر الترجمة. المقاطع التي تحمل قصة في سوق ما (من قال ماذا لمن، وأي نفي صدر، وكيف يبدو التسلسل الزمني) ليست هي المقاطع التي تحملها في سوق آخر، لذا فإن النسخة الثانية إعادة كتابة بحكم تحريري مختلف، وليست عملية ترجمة. ما ينتقل هو الهيكل: بنية القصة نفسها، ومنظومة العرض نفسها، والصوت نفسه.

النتيجة المترتبة على التكلفة صغيرة وفي الاتجاه الصحيح. بناءً على الحساب أعلاه، تُضيف اللغة الثانية نحو ثمانية سنتات من الصوت الإضافي مقابل قصة سبق أن بحث فيها النموذج مرة واحدة. وعندما يكون الجزء المكلف في خط سير العمل هو الاستدلال والجزء الرخيص هو المخرجات، فإن إنتاج نسخة ثانية بلغة أخرى يكون شبه مجاني — وهذه حجة لمعاملة الترجمة المحلية كمخرَج من الدرجة الأولى لسير العمل بدلاً من مشروع منفصل.

إخفاء الهوية هو تعديل، وليس حذفًا.

الخانة الثالثة في الموجز هي التي ينبغي أن تجعلك تتأنّى. «إزالة الحساسية» — أي إزالة التحسّس، نسخة منزوعة الهوية تُزيل شخصًا مذكورًا بالاسم — تُعرض كمعامل اختياري، وكأن حذف اسمٍ ما مرشّحٌ تقوم بتشغيله. لكنه ليس كذلك. فتجميعٌ للقيل والقال عن حدث قابل للتحديد، مع إزالة الاسم، يظل عادةً عن ذلك الشخص: يستنتج القارئ الاسم من السياق، وكل شيء من العنوان إلى الصورة المصغّرة يمكن أن يحمل المعرّف. إن إزالة السلسلة النصية تغيّر الموضوع الذي يقول الفيديو إنه عنه دون أن تغيّر الشخص الذي هو عنه، وإذا كان سببك لإزالة الاسم قانونيًا أو متعلقًا بالسمعة، فالسلسلة النصية ليست الجزء الذي كان يخلق التعرّض.

ثمة أمران يترتبان على أي شخص يطلق هذا التنسيق. أولًا، واجب الإشارة إلى المصادر لا ينتقل بعيدًا عنك لمجرد أن المقدّم اصطناعي: فالتجميع المولَّد الذي يستند إلى تقارير الآخرين يرث الالتزام ببيان مصدر تلك التقارير، والموجز الوارد في منشور 2 أكتوبر لا يحتوي على خانة للمصادر على الإطلاق — وهذه فجوة على المشغِّل أن يملأها يدويًا. ثانيًا، الناتج اصطناعي بشكل مشروع، ولا يُخبَر المستمع بذلك إلا إذا أخبرته أنت. الملصق سطر نصي واحد، وهو الفرق بين عرض تجريبي ومحتوى يضلّل المشاهد بشأن ما يشاهده. إذا أردت أن تحمل المعلمات هذا العبء، فضع الإفصاح في الموجز واعتبره غير اختياري، بالطريقة التي ينبغي بها تسمية مورّد الصوت بدلًا من إخفائه.

The OrcaRouter model page for anthropic/claude-opus-5.5, captured in English on 3 October 2026, showing a 1,000,000-token context window, 128,000-token maximum output, text, image and file input with text output, a release date of 22 September 2026, capability chips for vision, tools, JSON and reasoning, and pricing of 4.00 dollars per million input tokens and 20.00 dollars per million output tokens.

تشغيله على مفتاح واحد، والمفتاح الوحيد الذي لا يغطيه بعد

إذا كنت تبني هذا الخط من العمل، فإن تكلفة التكامل ليست استدعاءات النموذج — بل بيانات الاعتماد الثانية. يمكن توجيه Claude Opus 5.5 اليوم باسم anthropic/claude-opus-5.5 بسعر Anthropic المعلن الخاص به، وهو 4 دولارات و20 دولارًا لكل مليون رمز، ويُمرَّر بهامش ربح 0%، لذا يصل أي تغيير في سعر المورّد إلى فاتورتك في اليوم نفسه بدلًا من موعد مراجعة العقد التالية. وتوجيهه جنبًا إلى جنب مع بقية منظومتك التقنية عبر نقطة نهاية واحدة متوافقة مع OpenAI هو ما يزيل حزمة SDK الثانية، والتجاوز التلقائي عند الفشل هو ما يتيح لك تجربة نموذج أحدث أو أقل إثباتًا في تشغيل داخلي دون وضع مسار الإنتاج خلفه.

الحدّ الصادق هو الصوت. نقاط نهاية Gemini 3.8 Flash TTS وFlash-Lite TTS من Google ليست في كتالوجنا اليوم — إذ تُرجع واجهة برمجة النماذج العامة استجابة not-found للمعرّف google/gemini-3.8-flash-tts — لذا فإن سير العمل في منشور 2 أكتوبر يحتاج فعلاً إلى مفتاح Google الخاص بالمؤلف، وهذا قيد حقيقي وليس قيدًا مؤقتًا يمكننا تجاهله بتلويح.نقطة نهاية TTS التي نوفّرها فعلاً هي google/gemini-3.1-flash-tts-preview الأقدم، بسعر 1.00 دولار لكل مليون رمز نصي مُدخل و20.00 دولار لكل مليون رمز صوتي مُخرج: قابلة للاستخدام في الشكل نفسه لخط الأنابيب، وبتسعير يناسب الجيل الأقدم، وليست النموذج الذي بُني عليه سير العمل هذا. اختر مسارك بوعي — مفتاح واحد لمحرّك الاستدلال ومفتاح ثانٍ للصوت، أو مفتاح واحد وTTS الأقدم.

ماذا تشاهد

الأمر الذي سيجعل هذا التنسيق مملًا، بالمعنى الجيد، هو وجود نمط صوتي على النموذج المنتِج. وحتى يستطيع Claude Opus 5.5 — أو أي شيء يحل محله — سماع المقطع الذي كلّفه به وتعديله، يبقى الصوت خطوة تُراجَع يدويًا، وتبقى هذه المسارات تضم الإنسان في الحلقة بحكم البنية لا بحكم السياسة. راقب مستودعات المهارات خلال الأسبوعين القادمين بدلًا من العروض التوضيحية: فالمستودعات التي ستنجو هي التي تفصح عن مورديها، وتحمل ترخيصًا، وتتيح لك إعادة تشغيل الموجز نفسه والحصول على الفيديو نفسه. سيبدو الطلب النصي في منشور 2 أكتوبر الجزء السهل، لأنه كان كذلك.

بالنسبة لمسار إنتاج يمتلك بالفعل مواده ونصّه، استخرج رقمك الخاص بدلًا من استعارة رقم من X: عند 25 توكنًا في الثانية، كل دقيقة من التعليق الصوتي النهائي تساوي 1,500 توكن صوتي وحوالي 1.35 سنت وفق سعر Flash TTS اليوم — رقم يمكنك التحقق منه مقابل بطاقة أسعار قبل أن تخصص خانة إنتاج لمضيف اصطناعي.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا