بطاقة عنوان رئيسية لـ 'AstaBrief 8B مقابل Qwen3-8B: ما الذي يضيفه الضبط الدقيق من Ai2 إلى نموذجه الأساسي الخاص'، مع ذكر بنية Qwen3 المشتركة ومتوسطات SQABench-CS2 البالغة 87.0 مقابل 77.3، مع شعار OrcaRouter في الزاوية.
Guides & Insights

AstaBrief 8B مقابل Qwen3-8B: ما الذي يضيفه ضبط دقيق من Ai2 إلى نموذجه الأساسي الخاص

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

لا توجد هنا قصة معمارية، وهذا هو بيت القصيد. إن AstaBrief 8B ضبط دقيق لـ Qwen/Qwen3-8B، ويشترك النموذجان في تهيئة تصل إلى آخر رأس انتباه: Qwen3ForCausalLM، و36 طبقة، وحجم مخفي 4096، و32 رأس انتباه مع 8 رؤوس مفتاح-قيمة، ومفردات من 151,936 رمزًا، وسقف موضعي من 40,960 رمزًا. كل ما يفصل إصدار Ai2 بتاريخ 2026-10-02 عن قاعدة أبريل 2025 هو التدريب اللاحق. لذا فالسؤال المثير ليس أيهما أفضل عمومًا — بل ما الذي يمنحك إياه تشغيل تدريب لاحق محدد وجيد التمويل فوق نموذج أساسي يمكنك تنزيله مجانًا بالفعل، وما الذي يكلفك في المقابل.

إجابة Ai2 هي كاتب تقارير يُنتج توليفًا موثّق الاستشهادات متعدد الأقسام في نحو 51 ثانية، مقابل 178.5 ثانية لخط الأنابيب المدعوم بـ Claude الذي حلّت محله داخل منصة Asta — أسرع بنحو 3.5 أضعاف، مع تأكيد Ai2 أن جودة التقارير ظلت ثابتة وفق المقاييس التي تتبّعتها. إجابة Qwen3-8B هي نموذج عام متعدد الاستخدامات يمتلك وضعي تفكير هجين وغير تفكيري، وأكثر من مئة لغة، وسنة ونصف من الاستخدام في التطبيقات اللاحقة. كلاهما بترخيص Apache-2.0. المقايضة هي قدرة ضيقة وسرعة مقابل قدرة واسعة ومرونة، والبيانات أدناه تجعل ملامحها محددة بما فيه الكفاية.

صف البنية المعمارية لا تأثير له، لذا فإن الموجّه ليس كذلك.

لأن هندسة نقطة التحقق متطابقة، فإن كل حدس تشغيلي لديك حول Qwen3-8B ينتقل دون تغيير إلى AstaBrief 8B. فهو نموذج كثيف بحجم 8B بدقة BF16، ويتّسع على بطاقة 24GB، ويعمل على vLLM أو Transformers دون نوى مخصّصة، ويرث سقف الموضع 40K الخاص بالنموذج الأساس — لا يُعد أي من النموذجين نموذج سياق طويل، كما أن نافذة التدريب 32K تمتد باستخدام YaRN تمامًا كما يمتد الأساس. التخطيط للنشر الخاص بالضبط الدقيق هو التخطيط للنشر الخاص بالنموذج الأساس. يجدر قول ذلك بوضوح لأنه ليس صحيحًا دائمًا بشأن النماذج المضبوطة ضبطًا دقيقًا، وهو يعني أن الشيء الوحيد الذي تقيّمه هو السلوك.

السلوك هو موطن الارتباط القسري. تحمل بطاقة AstaBrief تحذيرًا بخط عريض: جرى ضبط النموذج ضبطًا دقيقًا على تنسيق موجّه واحد محدد، نُشر باسم sft_prompt.txt في مجموعة بيانات AstaBrief_prompts، وتقول Ai2 إن استخدام موجّه مختلف أو تنسيق تفاعل مختلف قد يؤدي إلى سلوك متدهور أو غير متسق. هذا الموجّه ليس قالب دردشة عاديًا. اقرأه فتجد عقدًا صارمًا — خانة استعلام محاطة بأقواس، وكتلة section_references من اقتباسات مفهرسة بمعرّف، وبنية استشهاد صريحة تتطلب أن يتبع مفتاح المرجع الجملة التي يدعمها، وعلامة مخصصة لمعرفة النموذج يجب ألا تُدمج مع مصدر آخر، وتعليمة بافتتاح كل قسم بملخص TLDR من جملتين. سيقبل Qwen3-8B أي شيء تكتبه. أما AstaBrief 8B فهو مضبوط على شكل واحد من المدخلات وسيقل أداؤه إذا سلّمته شكلًا آخر.

ما الذي اشترته 47,000 مثال و6,000 تفضيل؟

عملية الضبط الدقيق هي بالكامل بعد التدريب، والوصفة تقليدية عن قصد: ضبط دقيق خاضع للإشراف يتبعه تحسين التفضيل المباشر دون اتصال، دون تعلم معزز. بدأت Ai2 من استعلامات حقيقية مقدمة عبر نظامها Asta، وفلترت 90,000 مطالبة بحثية من حيث الجودة والملاءمة والخصوصية، وولّدت أهداف التقارير باستخدام خط أنابيب ScholarQA متعدد الخطوات باستعمال Claude 3.5 Sonnet وClaude 3.7 Sonnet وo3 وo4-mini وGPT-4.1، واحتفظت بـ 47,000 مثال. ثم بنت مرحلة التفضيل ما يقرب من 6,000 زوج، مع تحكيم GPT-4.1 وDeepSeek-R1، ولم يبق سوى الأزواج المتفق عليها.

عند القياس على SQABench-CS2 — وهو 100 سؤال بحثي في علوم الحاسوب كتبها المستخدمون — مقابل النموذج الأساسي، إليك ما الذي جلبه ذلك، مع كون كل رقم مُبلَّغًا عنه من المورّد ولم يُعَد إنتاج أيٍّ منها بشكل مستقل:

• المتوسط الإجمالي — AstaBrief 8B 87.0 مقابل Qwen3-8B 77.3، بزيادة 9.7 نقطة.

• تذكّر المكوّنات — 90.2 مقابل 77.8.

• دقة الاستشهاد — 90.5 مقابل 76.2.

• استدعاء الاستشهادات — 78.2 مقابل 64.6.

• دقة الإجابة — 89.0 مقابل 90.6، خسارة بمقدار 1.6 نقطة مقارنة بالأساس.

الصف الأخير هو الذي ينبغي أن يشكّل التوقعات. فالضبط الدقيق من أجل جودة التقرير لم يحسّن كل شيء على نحو موحّد؛ بل قايض قدرًا صغيرًا من ملاءمة كل فقرة مقابل مكاسب كبيرة في التغطية والاستناد إلى المراجع. وإذا كانت مهمتك تكافئ الفقرات الملائمة قبل كل شيء، فالنموذج الأساسي ليس بالضرورة الخيار الأسوأ، والنموذج المضبوط بدقة ليس تلقائيًا إجابتك.

شيئان آخران لم يشترهما المال. لا يمتلك AstaBrief 8B أي نتيجة مُبلَّغ عنها على DeepScholarBench تتفوق على بدائل Ai2 نفسها — إذ تأتي نتيجته 53.50 خلف Asta ScholarQA عند 60.25 وDR-Tulu-8B عند 56.26 — كما أن التحقق البشري الخاص به هو أربعة عشر سؤالًا من ثلاثة باحثين، وقد فاز DR-Tulu فيها بالأفضلية الإجمالية. يمكن أن يخسر نموذج متخصص أمام نموذج بحثي عام الأغراض على معيار المتخصص نفسه، وقد نشرت Ai2 ذلك.

A two-column scoreboard headed 'AstaBrief 8B vs Qwen3-8B — the scoreboard'. The AstaBrief column reads 'identity: fine-tune of Qwen3-8B', 'job: cited report writing', 'context: 40K inherited', 'prompt: one fixed format', 'licence: Apache 2.0', 'evidence: vendor-reported SQA-CS2'; the Qwen column reads 'identity: the base model', 'job: generalist, thinking modes', 'context: 40K, YaRN to 131K', 'prompt: open', 'licence: Apache 2.0', 'evidence: 11M downloads, established'. A footer reads 'AstaBrief SQA-CS2 average 87.0 vs base 77.3 per Ai2; unreproduced.'

ما الذي لا يزال الأساس يفعله بشكل أفضل

المقارنة ليست أحادية الاتجاه، ويسهل التقليل من شأن جانبها العام.

يأتي Qwen3-8B مزوّدًا بوضعين هجينين: وضع التفكير ووضع عدم التفكير، بحيث يمكنه استهلاك الرموز في الاستدلال عندما تستدعي المسألة ذلك، والإجابة مباشرةً عندما لا تستدعيه. دُرّب AstaBrief 8B على كتابة التقارير من محاولة واحدة، ولا يرث أيًا من سلوك الاستدلال المتعمّد هذا كميزة من ميزات المنتج. كما يحمل Qwen3-8B التغطية متعددة اللغات الخاصة بالنموذج الأساس — أكثر من مئة لغة — بينما دُرّب AstaBrief على مدونة نصية مُرشّحة صراحةً نحو الاستعلامات العلمية الإنجليزية، لذا فإن كفاءته خارج هذا المسار غير معروفة، وليست مجرد غير مُختبرة.

ثم هناك سطح التعليمات. إن النموذج العام هو ما تريده عندما تتغير المهمة الأسبوع المقبل، أو عندما تحتاج إلى استدعاء الأدوات، أو عندما يكون مخطط المخرجات ملكك أنت لا ملك Ai2، أو عندما تكون في مرحلة النماذج الأولية ولا تعرف بعد كيف سيبدو الموجّه النهائي. وفيما يتعلق بمسألة المصدر الخام — تلك التي تهم عندما يسأل أحدهم لماذا تثق بالنموذج — فقد حصل Qwen3-8B على أكثر من أحد عشر مليون عملية تنزيل وعلى سنة ونصف من الاستخدام المستقل. أما AstaBrief 8B فلم يمضِ على إطلاقه سوى أسبوع.

ما يملكه AstaBrief 8B ولا يستطيع النموذج الأساسي مجاراته هو انضباط الاستشهاد. دقة الاستشهادات واستدعاؤها هما المقياسان اللذان يكون فيهما تفوق النموذج المضبوط ضبطًا دقيقًا أكبر وأكثر اتساقًا مع رواية التدريب — فقد كان أقوى مُرشِّح منفرد في خط أنابيب بيانات Ai2 هو كثافة الاستشهاد، أي نسبة العبارات التي تحمل استشهادًا واحدًا على الأقل، والنموذج الناتج يعكس هذه الأولوية. إن جعل نموذج عام يستشهد ضمن النص بتنسيق مفاتيح ثابت، وبشكل موثوق، ودون إسقاط دعم الادعاءات، هو هندسة تلقين تكتبها وتصونها. أما الضبط الدقيق من Ai2 فيجعل ذلك السلوك الافتراضي للنموذج.

A screenshot of the Hugging Face model card for Qwen/Qwen3-8B showing the TextGeneration tag, the apache-2.0 licence line, the qwen3 tag, the 8B parameter size in BF16 and a downloads-last-month figure of 11,020,586.

شهد خط Qwen تطورًا منذ أبريل 2025.

ثمة تعقيد إضافي، وهو تعقيد عملي: Qwen3-8B عمره سنة ونصف، ومقارنة نموذج جديد مُضبَّط ضبطًا دقيقًا به ليست كالمقارنة بنموذج قائم حالي صالح.

يمتد خط Qwen الآن عبر Qwen3.5 وQwen3.6 وQwen3.7 وQwen3.8، ويمكن الوصول إلى الجيل الحالي دون تنزيل أي شيء. Qwen3.8 27B هو مسار مباشر في كتالوجنا بنافذة سياق تبلغ 262,144 رمزًا بسعر 0.33 دولار لكل مليون رمز إدخال و2.40 دولار لكل مليون رمز إخراج؛ ويوفّر Qwen3.8 Flash نافذة بمليون رمز بسعر 0.15 و0.47 دولار؛ ويغطي Qwen3 VL 8B Instruct الحالات متعددة الوسائط بسعر 0.18 و0.70 دولار لكل مليون مع نافذة تبلغ 131,072 رمزًا، وقد أصبح متاحًا كمسار منذ أكتوبر 2025. أما Qwen3-8B نفسه فليس مسارًا نقدمه، وكذلك AstaBrief 8B — فكلاهما أوزان تُنزَّل وتُشغَّل محليًا، والصياغة الصادقة هي أن النموذج الأساسي مكانه عتادك، بينما لا يضطر الجيل الحديث من Qwen إلى ذلك.

يمنحك ذلك ذراعًا ثالثة للتقييم الذي لم تستطع Ai2 تشغيله. شغّل AstaBrief 8B على وحدة معالجة الرسومات الخاصة بك، وأقم قاعدة Qwen3-8B بجانبه لتأكيد الفروق المُبلَّغ عنها، ووجّه أداة الاختبار نفسها نحو نموذج Qwen3.8 مستضاف من أجل التوسّع. الأذرع الثلاثة كلها على بُعد نقطة نهاية واحدة، وهذا ما يجعل الأمر تمرينًا في التهيئة لا مشروع شراء — واجهة API واحدة عبر أكثر من 200 نموذج، سعر قائمة المزوّد يُمرَّر بهامش ربح 0% بحيث يصبح تخفيض سعر المورّد ساريًا لديك في اليوم نفسه، التبديل التلقائي عند الفشل، ولغة توجيه DSL إذا أردت أن يتشارك عدة نماذج في الإجابة عن سؤال واحد. تبقى الأذرع المستضافة ذاتيًا مستضافة ذاتيًا لأسباب تتعلق بحساسية البيانات؛ ويبقى كل ما هو مستضاف قابلًا للتبديل، وهذا مهم عندما يصدر الجيل التالي من Qwen خلال ربع سنة.

كيف تقرر

اختر AstaBrief 8B إذا كان منتجك هو تركيب الأدبيات المُستشهد بها وكنت تريد أن يكون سلوك الاستشهاد هو الافتراضي لدى النموذج بدلًا من أن يكون مسؤولية التوجيه الخاص بك. تعني هندسة النموذج الأساسي عدم وجود مفاجآت في التقديم، كما أن رخصة Apache-2.0 وخلطات SFT وDPO المنشورة تجعله قابلًا للتدقيق، كما أن تصدّره في دقة الاستشهاد واستدعائه هو النتيجة الأكبر والأكثر قابلية للتفسير في جداول Ai2.

ابقَ على Qwen3-8B، أو انتقل إلى إصدار Qwen3.x حالي، إذا كانت مهامك متنوعة، أو إذا كنت بحاجة إلى وضع التفكير أو الأدوات أو تغطية متعددة اللغات، أو إذا كنت لا تزال تستكشف المطالبة، أو إذا كنت تفضّل ألّا تكون مقيّدًا بكتلة تعليمات من ستة عشر ألف حرف لم تكتبها. خسر النموذج الأساسي في التغطية والاستناد إلى الاستشهادات، لا في الصلة، واحتفظ بشيء تخلّى عنه الضبط الدقيق.

ما ينبغي تجنّبه هو التعامل مع متوسط 87.0 مقابل 77.3 على أنه القصة كاملة. يُظهر جدول Ai2 نفسه أن الضبط الدقيق يتخلى عن دقة الإجابات ليكسب انضباط الاستشهادات، وتشير ملاحظات مختبره الخاصة إلى أن معظم التدريب والتقييم أُنجز في 2025 ولم يُعَد تشغيله مقابل الطليعة الحالية، كما أن النموذج الأساسي الذي يحسّنه لم يعد الجيل الذي تختاره لأي غرض إلا هذه المقارنة. ما يضيفه الضبط الدقيق بشكل مُثبت هو شكل من أشكال المخرجات؛ وما إذا كان هذا الشكل يستحق هذا الضيق يتوقف كليًا على ما إذا كان يتطابق مع شكل منتجك.