
AstaBrief 8B: كاتب التقارير المفتوح من Ai2 يعمل أسرع بمقدار 3.5 مرة من خط الأنابيب الذي يستبدله
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 216 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 42 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
الرقم الرئيسي في إعلان Ai2 عن AstaBrief 8B هو قراءة ساعة توقيت، وليس نتيجة معيار: عبر خط أنابيب Asta الكامل، يولّد النموذج الجديد تقريرًا بحثيًا موثّقًا بالاستشهادات في متوسط 51.1 ثانية، مقابل 178.5 ثانية للمسار المدعوم من Claude الذي يجاوره الآن. وهذا أسرع بنحو 3.5 مرة، وهو ناتج عن قرار معماري واحد — كتابة التقرير كاملًا في تمريرة واحدة بدلًا من التلخيص والتجميع ثم الكتابة قسمًا تلو الآخر. AstaBrief 8B هو نموذج مفتوح الأوزان بحجم 8B، مرخّص تحت Apache-2.0، ومُدرّب تدريبًا دقيقًا من Qwen3-8B، يتلقى سؤالًا بحثيًا مع مقتطفات أدبيات مُسترجعة ويعيد تقريرًا يتضمن استشهادات مضمّنة. وقد أُطلق ضمن منصة Asta من Ai2 باسم "Fast mode" في 2026-10-02، وأصبحت الأوزان وبيانات التدريب وسير عمل محلي نموذجي متاحة للعموم في اليوم نفسه.
المستودع أقدم من الإعلان، وهذا مهم
تفصيل واحد في هذا الإصدار يستحق أن يُقال بصراحة، لأنه يغيّر الطريقة التي ينبغي أن تقرأ بها كل شيء آخر: مستودع Hugging Face على allenai/AstaBrief_8B يحمل طابعًا زمنيًا داخليًا لوقت الإنشاء بتاريخ 2026-02-09، كما تعود مجموعة بيانات DPO المرافقة إلى نوفمبر 2025. إعلان الثاني من أكتوبر حقيقي — فقد نُشرت تدوينة المدونة، وتغريدة AI2، وبطاقة النموذج جميعها في ذلك اليوم — لكن تاريخ المستودع أطول مما توحي به دورة الأخبار.
ما حدث في 2 أكتوبر هو أن Ai2 أطلقت هذا الشيء ووثّقته، وأجرت تعديلاً على المستودع ليتوافق معه: وصلت ثلاث عمليات إيداع إلى بطاقة النموذج بين 16:18:06 و16:18:20 بتوقيت UTC يوم الإصدار، مضيفةً قالب استجابة إلى قالب الدردشة وحاذفةً رمزًا لا يؤدي أي عملية. هذا عمل صيانة على بطاقة، وليس إعادة تدريب. كما تُصرّح Ai2 في المدونة بوضوح أن "معظم التدريب والتقييم الموصوفين أُنجزا في 2025"، وأن النماذج المملوكة المستخدمة لتوليد بيانات التدريب وكنقاط مقارنة "تعكس الطليعة في ذلك الوقت". ويقول المختبر إنه لم يُعِد تشغيل التقييم الكامل مقابل نماذج الطليعة اليوم.

إذن، هذا إصدار GA لعمل كان قد اكتمل إلى حد كبير في 2025 — إطلاق، بتوثيق الإطلاق وتكامل المنصة الخاص بالإطلاق، فوق نقطة حفظ ظلّت موجودة في حساب المختبر لأشهر. لا شيء في ذلك ينطوي على عدم أمانة، والنموذج جديد على كل من هم خارج Ai2. لكن هذا يعني أن أرقام المقارنة أدناه تصف حدود عام 2025 المتقدمة، وAi2 تقول ذلك بنفسها.
ماذا يفعل AstaBrief 8B فعليًا
تمتلك منصة Asta من Ai2 ميزة توليد التقارير حيث يجلب الباحثون سؤالًا جوهريًا ومجموعة من الأدبيات، ثم يستلمون توليفًا موثّقًا بالاقتباسات يتعاملون معه كأثر عملي. كانت هذه الميزة تعمل سابقًا بالكامل على ما تسميه Ai2 وضع Thinking: مسار متعدد الخطوات يلخّص المقتطفات المسترجَعة، ويجمّعها حسب الموضوع، ويكتب الإجابة قسمًا قسمًا، مدعومًا بنماذج Claude. وضع Thinking شامل وبطيء.
AstaBrief 8B هو الوضع السريع. عند إعطائه نفس السؤال ونفس المقتطفات المسترجعة، يكتب التقرير النهائي في تمريرة أمامية واحدة. ادعاء Ai2 هو الجزء المثير للاهتمام: تجاوز تلخيص المقتطفات، والتجميع، والحلقة قسمًا تلو الآخر لم يكلف جودة التقرير، على الأقل وفقًا للمقاييس التي تتبعها المختبر. النموذج ليس محرك بحث ولا يسترجع — إنه الكاتب في نهاية مسار الاسترجاع، ويتوقع أن تُسلَّم إليه الأدلة.
هذا يجعله مكوّنًا وليس منتجًا. ولهذا أيضًا أطلقت Ai2 سير عمل نموذجيًا إلى جانب الأوزان: مكتبة صغيرة تحوّل ملفات PDF الخاصة بك إلى تقارير، في مستودع ai2-scholarqa-lib، وتمنحك نقطة انطلاق للتوليد المحلي.
وصفة التدريب مملة عن قصد، وهذا هو المقصود.
أظهر عمل Ai2 السابق، DR Tulu، أن التعلم المعزز يمكنه تحسين إنشاء التقارير الطويلة في النماذج مفتوحة الأوزان. بالنسبة لـ AstaBrief، نظر الفريق في هذا المسار واختار عدم اتباعه، على أساس أن RL غير مستقر ومكلف وأرادوا شيئًا يسهل تصحيحه. ما بنوه بدلاً من ذلك هو الضبط الدقيق الخاضع للإشراف متبوعًا بتحسين التفضيل المباشر دون اتصال. مرحلتان، كلاهما تقليدي.
بدأت مرحلة SFT من استعلامات حقيقية قُدّمت عبر نظام Asta التابع لـ Ai2 بدلاً من مطالبات اصطناعية. ومن السجلات التي جُمعت، قام الفريق بالتصفية من حيث الجودة والملاءمة والخصوصية — بإزالة حركة المرور الخاصة بالروبوتات والمختبِرين التجريبيين، وحذف الاستعلامات القصيرة جداً بحيث لا تكون ذات معنى، وتشغيل تمريرة LLM لالتقاط الاستعلامات غير الإنجليزية والطلبات غير العلمية والمطالبات التي تحتوي على معلومات شخصية. ونتج عن ذلك مجموعة من 90,000 استعلام تركز على البحث. وتم توليد أهداف التقارير الكاملة لتلك الاستعلامات عبر مسار ScholarQA المتعدد الخطوات، باستخدام Claude 3.5 Sonnet وClaude 3.7 Sonnet وo3 وo4-mini وGPT-4.1 كنماذج داعمة. وبعد التصفية حسب الجودة: 47,000 مثال تدريبي قابل للاستخدام.
احتاجت مرحلة DPO شيئًا مختلفًا — أزواجًا من التقارير مع تفضيل بينها. جاء تقرير واحد لكل استعلام من مسار ScholarQA؛ أما التقرير المنافس فجاء من إدخال المقتطفات المسترجَعة بواسطة ScholarQA إلى نموذج مختلف، مأخوذ من o3 أو o4-mini أو DeepSeek-V3 أو DeepSeek-R1. اختار حكمان، هما GPT-4.1 وDeepSeek-R1، فائزًا لكل زوج، ولم يبقَ إلا الأزواج التي اتفق فيها الحكمان. وتُبلِغ Ai2 عن اتفاق بنسبة 95% بين حكام LLM والتفضيلات البشرية. بلغت مجموعة التفضيلات النهائية نحو 6,000 مثال. وكل من مزيج SFT ومزيج DPO متاحان على Hugging Face للفحص.

الاستنتاج الأكثر قابلية للنقل هو أيضًا الأقل بريقًا. أنتجت تجارب SFT المبكرة تقارير أفضل لكنها تأخرت في دقة الإجابات وجودة الاستشهادات، لذلك اختبر الفريق أربعة مرشحات قائمة على الإحصاءات على بيانات التدريب الاصطناعية: نسبة الرموز من المخرجات إلى المدخلات، ومتوسط ملاءمة الاسترجاع للأوراق المُستشهد بها، وكثافة الاستشهادات (نسبة العبارات التي تحمل استشهادًا واحدًا على الأقل)، وتنوع الاستشهادات. جاءت أقوى المكاسب من استبعاد التقارير الاصطناعية ذات كثافة الاستشهادات المنخفضة — ولم تُضف تصفية أكثر عدوانية، أو توليفات من المرشحات، أو مسوح معدلات التعلم مكاسب ذات معنى. يستحق استنتاج Ai2 أن يُحمَل إلى ما هو أبعد من هذا النموذج: فالتخصص لم يكن مسألة صب المزيد من النصوص العلمية في التدريب المسبق، بل مسألة تركيب بيانات ما بعد التدريب وجودتها.
لوحة النتائج التي نشرتها Ai2، وكيفية قراءتها

كل رقم أدناه مُبلَّغ عنه من قِبَل المورّد. وهو مستمد من بطاقة نموذج Ai2 ومدونتها، أنتجتها منظومة التقييم الخاصة بالمختبر نفسها، ولم يُعَد إنتاج أيٍّ منه بشكل مستقل. كان الهدف الأساسي هو SQABench-CS2، وهي مجموعة من 100 سؤال بحثي في علوم الحاسوب كتبها مستخدمون، تُتابَع وفق أربعة مقاييس: استدعاء المكوّنات (تغطية المحتوى الضروري)، ودقة الإجابة (ما إذا كانت كل فقرة ذات صلة)، ودقة الاستشهاد (ما إذا كان كل استشهاد يدعم ادعاءه)، واستدعاء الاستشهاد (ما إذا كانت الادعاءات مدعومة بالكامل بالاستشهادات المقدَّمة).
• المتوسط الإجمالي — AstaBrief 8B 87.0، ونقطة التحقق SFT الخاصة به 83.7، وQwen3-8B الأساسي 77.3
• استدعاء المكوّنات — AstaBrief 8B 90.2، SFT 85.2، Qwen3-8B 77.8
• دقة الإجابة — AstaBrief 8B 89.0، SFT 90.4، Qwen3-8B 90.6
• دقة الاستشهاد — AstaBrief 8B 90.5، SFT 87.7، Qwen3-8B 76.2
• استدعاء الاستشهادات — AstaBrief 8B 78.2، SFT 71.3، Qwen3-8B 64.6
اقرأ الصفوف معًا وستبدو مرحلة DPO موجهة بدلًا من أن تكون أفضل بشكل موحد. يرتفع المتوسط العام، ويرتفع استرجاع المكونات وكلا مقياسي الاستشهاد بشكل حاد، وتنخفض دقة الإجابة بشكل طفيف دون كل من نقطة تفتيش SFT والنموذج الأساسي. إذا كانت حالة الاستخدام الخاصة بك هي الصلة لكل فقرة قبل كل شيء، فإن الضبط الدقيق ليس تلقائيًا هو إجابتك.
في التقييمات الثانوية، اختبرت Ai2 النموذج النهائي مقابل مسار ScholarQA الخاص بها ومقابل DR-Tulu-8B. في قسم التطوير من SQABench-CS2، سجّل Asta ScholarQA 87.6، وDR-Tulu-8B 86.5، وAstaBrief 8B 86.3؛ وفي شق الاختبار، سجّل ScholarQA 86.2، وDR-Tulu-8B 88.8، وAstaBrief 87.0. وفي DeepScholarBench، وهو معيار توليف طويل من 63 استعلامًا، سجّل ScholarQA 60.25، وDR-Tulu-8B 56.26، وAstaBrief 53.50 — وهو الصف الوحيد الذي يتخلف فيه كاتب التقرير المفتوح عن البديلين كليهما. وفي مقارنتين زوجيتين يحكمهما نموذج لغوي كبير مقابل المسار المدعوم بـ Claude، حصد AstaBrief 55% من مقارنات التطوير و72% من مقارنات الاختبار. وشملت دراسة بشرية منفصلة 14 سؤالًا فقط من ثلاثة باحثين، وفي التفضيل العام فاز DR-Tulu، رغم أن اثنين من الباحثين الثلاثة فضّلا AstaBrief في دقة الاستشهادات. إن أربعة عشر سؤالًا من ثلاثة أشخاص إشارة، وليست حكمًا نهائيًا، وهكذا تقدّمها Ai2.
نشر المختبر أيضًا بيانات استخدام مبكرة من تكامل Asta: من بين 374 مستخدمًا جرّبوا الوضع السريع، استخدمه 29.1% في يومين أو أكثر، وأنشأ المستخدمون 3.67 سلسلة تقارير في المتوسط، ولم يعد 23% منهم أبدًا إلى وضع التفكير، وتنقّل 18% بين الوضعين حسب المهمة. بلغت الملاحظات الإيجابية 84.2% للوضع السريع مقابل 85.2% لوضع التفكير — وهو تقارب كافٍ ليجعل Ai2 يصف الملاحظات بأنها متناثرة جدًا لاستخلاص استنتاجات قوية منها. هذا هو التأطير الصادق، لذا أبقوه.
تشغيله بنفسك
AstaBrief 8B مرخّص بموجب Apache-2.0 ومبني على Qwen/Qwen3-8B، لذا فهو يقع في فئة GPU الواحد بدلاً من فئة مركز البيانات: نموذج كثيف بحجم 8B على معمارية Qwen3، و36 طبقة، وحجم مخفي 4096، و32 رأس انتباه مع 8 رؤوس مفتاح-قيمة، ومفردات من 151,936 رمزًا، وسقف الموضع الأساسي البالغ 40,960 رمزًا. في BF16، يتناسب بشكل مريح مع بطاقة بسعة 24GB، ويستخدم المثال الخاص بالبطاقة vLLM مع درجة حرارة 0.7، وtop-p 0.95، وحد أقصى للإخراج يبلغ 4096 رمزًا.
يوجد تحذير تشغيلي واحد مطبوع بخط عريض على بطاقة النموذج ويسهل إغفاله: فقد ضُبطت نقطة التحقق ضبطًا دقيقًا وفق صيغة توجيه واحدة محددة، نُشرت باسم sft_prompt.txt في مجموعة بيانات AstaBrief_prompts. استخدم توجيهًا أو صيغة تفاعل مختلفة، وتتوقع Ai2 سلوكًا متدهورًا أو غير متسق. إذا قيّمت هذا النموذج باستخدام أداة الاختبار الخاصة بك وحصلت على نتائج ضعيفة، فتحقق من التوجيه قبل أن تستنتج أي شيء بشأن الأوزان.
كما أن البطاقة صريحة بشأن النطاق. إن AstaBrief مخصص للاستخدام البحثي والتعليمي، وليس كمساعد للأغراض العامة، ولا توجد نقطة نهاية استدلال مستضافة من Ai2 — فإما أن تنزّله، أو تستخدمه داخل Asta. لا يوفّره أي مزوّد في كتالوجنا، بما في ذلك نحن، لذا لا يوجد مسار يمكن توجيهه إليه؛ والطريقة الصادقة لاستخدامه هي على عتادك الخاص أو خلف جدار الحماية الخاص بك، وهذا بالتحديد هو ما تطرحه Ai2 كحجة لصالح الأوزان المفتوحة من الأساس.
أين يندرج الموجّه ضمن مسار معالجة التقارير
AstaBrief يشغل خانة واحدة في سلسلة أطول. هناك شيء يسترجع الأدبيات، وشيء يقرر أي المقتطفات تستحق تمريرها، وشيء قد يحكم أو يتحقق من التقرير النهائي. تلك الاستدعاءات هي استدعاءات نماذج مستضافة عادية، وهي الجزء من المنظومة حيث تريد فعلاً اختياراً من الموردين: واجهة برمجة تطبيقات واحدة تغطي أكثر من 200 نموذج، سعر قائمة المزود يُمرر بهامش ربح 0% بحيث يظهر تخفيض سعر المزود على فاتورتك في نفس اليوم، تحويل تلقائي عند تدهور أحد المزودين، ولغة توجيه DSL إذا أردت دمج عدة نماذج في استدعاء واحد. استضف الكاتب بنفسك لأنه الجزء الذي له تأثيرات حساسية البيانات وتكلفة ثابتة؛ وجه التنسيق لأنه الجزء الذي تكون فيه المرونة أهم من الملكية.
هناك أيضًا تجربة رخيصة هنا. مجموعة المقارنة الخاصة بـ Ai2 هي Claude 3.5 Sonnet وClaude 3.7 Sonnet وo3 وo4-mini وGPT-4.1 — طليعة عام 2025 بشكل متعمد، ويقول المختبر إنه لم يُعِد تشغيلها. إن وضع مخرجات AstaBrief بجانب النماذج المستضافة اليوم على أسئلتك هو تمرين بضغطة زر إذا كان كلا الذراعين يمكن الوصول إليهما عبر نفس نقطة النهاية، وهو يجيب عن السؤال الذي تتركه تدوينة المدونة مفتوحًا.
ما الذي قد يغيّر الصورة؟
ثلاثة أمور ستحوّل هذا من إطلاق موثّق جيدًا إلى نتيجة محسومة. إعادة إنتاج مستقلة لأرقام SQABench-CS2، لأن كل رقم ورد أعلاه مُبلَّغ عنه ذاتيًا. وإعادة تشغيل مقابل النماذج الرائدة الحالية، لأن مجموعة المقارنة متقادمة بعام واحد بحسب اعتراف المختبر نفسه. وتقييم بشري أكبر من أربعة عشر سؤالًا من ثلاثة باحثين — إذ تختتم مدونة Ai2 نفسها بالحجة بأن المجال يحتاج إلى تقييمات تتجاوز دعم الاستشهادات لتسأل ما إذا كان النموذج يحافظ على النطاق الإثباتي لمصادره، بما في ذلك ما إذا كان يحوّل بهدوء نتائج خاصة بعينة ما إلى تعميمات واسعة. هذا نقد عادل لفئة التقييم بأكملها، وينطبق على هذا الإصدار أيضًا.
في الوقت الحالي، الخلاصة العملية بسيطة. إذا كنت تولّد تقارير موثّقة بالمراجع من الأدبيات وتريد أداة الكتابة على عتادك الخاص، بترخيص Apache-2.0، مع بيانات تدريب مفتوحة، فإن AstaBrief 8B هو الخيار المفتوح الأكثر مباشرةً في تصميمه لغرض محدد من بين ما نشره أي طرف، وتقليل الزمن الفعلي (wall-clock) بمقدار 3.5× هو السبب وراء وجوده. إذا كان عملك يعتمد على أدق توليف ممكن، فلاحظ أن جدول Ai2 نفسه يضع DR-Tulu في الصدارة من حيث التفضيل البشري الإجمالي، ويضع ScholarQA في الصدارة على DeepScholarBench — وأن وضع Thinking لا يزال موجودًا، في المنتج نفسه، لهذا السبب تحديدًا.
