بطاقة عنوان مُولّدة عنوانها 'TwIL-LM3-Pro'، وعنوانها الفرعي 'نموذج منطق صوري بحجم 3.66B'، مع ثلاث بطاقات إحصائية مستديرة الزوايا مكتوب عليها '3.66B معامل'، و'2.09 GiB Q4_K_M'، و'سياق من 131,072 رمزًا'. ويقول سطر التذييل 'اختبارات أداء المورّد: webAI Track A / Track B harness'. وشعار OrcaRouter مركّب في الزاوية اليمنى السفلى.
Guides & Insights

TwIL-LM3-Pro: نموذج منطق صوري بـ3.66 مليار معامل يُتاح عند الطلب عبر البريد الإلكتروني

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

TwIL-LM3-Pro هو نموذج استدلال يضم 3.66 مليار معامل من webAI، صُمّم خصيصًا للمنطق الصوري لا للمحادثة العامة، وهو موجود على Hugging Face منذ 3 سبتمبر 2026. وهو ليس إصدارًا جديدًا، والطرح المتداول حوله هذا الأسبوع — بأن webAI «أطلقت نموذجًا بحجم 3.66B» — متأخر عن الأوزان بشهر. ما تغيّر فعليًا في الأيام القليلة الماضية أصغر وأكثر فائدة: نُقّحت نقطة التحقق في 30 سبتمبر، وفي 1 أكتوبر نشرت webAI إصدار LiteRT-LM من النموذج للاستدلال على الجهاز بنظامي Android وiOS. لذا فالسؤال المثير ليس ما هو TwIL-LM3-Pro، بل هل يمكنك الحصول عليه، وتعتمد الإجابة على أيٍّ من قنوات التوزيع الثلاث تقف فيها — لأن إحداها استمارة.

هذا التمييز مهم أكثر مما سيكون عليه عادةً، لأن TwIL-LM3-Pro ليس منتجًا يمكنك ببساطة استدعاؤه. إنه نقطة تحقق (checkpoint) تقوم بتنزيلها وتشغيلها على عتادك الخاص، وتقبل شروط ترخيص يحظر الاستخدام التجاري. المقارنة التي تدعو إليها بطاقة النموذج الخاصة به — مقابل Qwen3-8B، وهو نموذج يزيد عدد معاملاته على الضعف — مقارنة حقيقية، لكنها مقارنة بين اختبارات معيارية يشغّلها البائع على أداة اختبار بناها البائع، وبطاقة النموذج تقول ذلك بنفسها في مواضع أكثر مما تفعل معظم البطاقات. تقرأ هذه المقالة تلك البطاقة عن كثب وتفصل ما قاسه webAI عما لدى أي طرف آخر.

ما هو النموذج في الواقع

` keep exact. "evaluated with greedy decoding" -> تم تقييمه باستخدام فك ترميز جشع. "at a 2,048-token budget" -> بميزانية قدرها 2,048 رمزًا. Numbers preserve? Arabic can use Western digits or Arabic-Indic? Typically numbers as given. Keep 40, 2,560, 8, 3.66B, 3,659,737,600, 131,072, 2,048. Maybe "3.66B" -> 3.66 مليار. "parameter count" -> عدد المعاملات. "real total" -> الإجمالي الحقيقي. "base model's 131,072 tokens" -> 131,072 رمزًا الخاصة بالنموذج الأساسي. Need output only translation. No markers. Ensure backticks around code names? We can keep backticks. Arabic with code spans perhaps. No preamble. Potential issue: "TwIL-LM3-Pro" maybe should remain. "Granite" brand? Keep "Granite". "IBM's" -> من IBM. "granite-4.2-3b" keep. "GraniteForCausalLM" keep. Let's compose natural Arabic. "TwIL-LM3-Pro هو مفكك ترميز Granite كثيف — `GraniteForCausalLM`، 40 طبقة، حجم مخفي 2,560، 40 رأس انتباه مقابل 8 رؤوس مفاتيح وقيم — مشتق من `granite-4.2-3b` الخاصة بـ IBM." Note IBM possessive: من `granite-4.2-3b` التابع لـ IBM. Better: مشتق من `granite-4.2-3b` الخاص بـ IBM. "The 3.66B parameter count is the real total, 3,659,737,600" -> يبلغ عدد المعاملات 3.66 مليار وهو الإجمالي الحقيقي، 3,659,737,600، ونافذة السياق هي 131,072 رمزًا الخاصة بالنموذج الأساسي منقولة كما هي دون تغيير. "context window is the base model's 131,072 tokens carried through unchanged" -> ونافذة السياق هي نفسها 131,072 رمزًا للنموذج الأساسي محمولة كما هي دون تغيير. Maybe "تبلغ نافذة السياق 131,072 رمزًا..." But base model's. "ونافذة السياق هي 131,072 رمزًا الخاصة بالنموذج الأساسي، منقولة كما هي دون تغيير." "It emits a `<think>…</think>` block before answering and was evaluated with greedy decoding at a 2,048-token budget." -> وهو يصدر كتلة `<think>…</think>` قبل الإجابة، وتم تقييمه بفك ترميز جشع بميزانية قدرها 2,048 رمزًا. Need ensure `<think>…</think>` exactly? It contains ellipsis character. Keep exactly? The instruction says any text inside KEEP spans exact, but no KEEP markers. However preserve code? We can keep `<think>…</think>` exactly. Good. No markers. Final only Arabic. Need maybe use "المفاتيح والقيم" not "key-value". Good. Need maybe "40 attention heads against 8 key-value heads" -> "40 رأس انتباه مقابل 8 رؤوس مفاتيح وقيم". Good. "dense Granite decoder" -> "مفكك ترميز Granite كثيف" or "مفكّك ترميز كثيف من Granite". Better: "هو مفكّك ترميز Granite كثيف". Fine. "GraniteForCausalLM" maybe not translated. "hidden size" -> "حجم مخفي". Good. "parameter count" -> "عدد المعاملات". Good. "real total" -> "الإجمالي الحقيقي". Good. "context window" -> "نافذة السياق". Good. "carried through unchanged" -> "منقولة كما هي دون تغيير". Good. "greedy decoding" -> "فك الترميز الجشع". Good. "budget" -> "ميزانية". Good. Need maybe "2,048" Arabic comma? Keep as 2,048. "131,072". Good. Let's final.TwIL-LM3-Pro هو مفكّك ترميز Granite كثيف — `GraniteForCausalLM`، 40 طبقة، حجم مخفي 2,560، 40 رأس انتباه مقابل 8 رؤوس مفاتيح وقيم — مشتق من `granite-4.2-3b` الخاص بـ IBM. عدد المعاملات 3.66 مليار هو الإجمالي الحقيقي، 3,659,737,600، ونافذة السياق هي 131,072 رمزًا الخاصة بالنموذج الأساسي منقولة كما هي دون تغيير. وهو يصدر كتلة `<think>…</think>` قبل الإجابة، وتم تقييمه بفك ترميز جشع بميزانية قدرها 2,048 رمزًا.

مكدس ما بعد التدريب هو الجزء الذي تريدك webAI فعلاً أن تنظر إليه، وهو موثّق بشكل غير معتاد بالنسبة لنموذج بهذا الحجم: ضبط دقيق بإشراف عبر LoRA برتبة 64 على مجموعة بيانات اصطناعية للمنطق الصوري، وتقطير متعدد المسارات لإنتاج عدة آثار استدلال لكل مُدخل، ودمج نقاط التحقق في فضاء المعلمات بدلاً من أخذ نقطة التحقق النهائية، واستيفاء WiSE-FT عند α = 0.15 يُدمج عائداً نحو الأساس المُدرَّب مسبقاً باستخدام TIES وDARE-SLERP، وأخيراً مرحلة GRPO المرجّحة بالإنتروبيا — تسميها webAI بـ MGPO — مقابل مُتحقق برمجي، نُفِّذت حتى الخطوة 2580، وهي نقطة التحقق التي تم شحنها.

الناتج المنشور هو السياسة المدموجة وليس محوّل LoRA، وهذه هي التفصيلة العملية: يمكنك تشغيله كنموذج قائم بذاته، بصيغة bf16 بحجم 6.82 GiB، أو بصيغة Q4_K_M GGUF بحجم 2.09 GiB على وحدة معالجة مركزية أو 4 GB من VRAM. هذا هو ادعاء "يعمل على حاسوب محمول"، وهو الادعاء الوحيد في البطاقة بأكملها القابل للتحقق بشكل بديهي وبالتالي يستحق الثقة.

مقارنة Qwen3-8B، اقرأ بعناية

العنوان الرئيسي الذي تضعه webAI على النموذج هو أن TwIL-LM3-Pro يتصدّر صفوف ملخص Track A الخاصة به عند 3.66B معلمة. صفوف الملخص الأربعة هي بوابة macro البالغة 0.5539، وstrict-7 البالغ 0.2879، ومتوسط six-lane البالغ 0.5389، وmacro_primary البالغ 0.5875. وبالمقارنة مع Qwen3-8B، تبلغ بوابة macro 0.5539 مقابل 0.5336 — بل إن بطاقة النموذج نفسها تكتب الجملة التي كانت صفحة تسويقية ستحذفها: "تفوق البوابة على Qwen3-8B هو 0.020 — أصغر من ضوضاء أخذ العينات عند n = 200 لكل مسار — لذا اقرأ ذلك على أنه تعادل، لا فوز."

هذا هو السطر الأهم على الإطلاق في الصفحة. إنّ الطريقة التي تصوغ بها webAI نتيجتها الرئيسية هي أنها تعادل. أما حيث لا تكون المقارنة متعادلة:

• Strict-7 — TwIL-LM3-Pro 0.2879 مقابل Qwen3-8B 0.2093، ولا يستخدم هذا الصف أي رصيد للمطابقة المتسامحة في أي مكان، لذا لا يمكن أن يكون ناتجًا عن حظ التنسيق.

• اختيار من متعدد صارم — TwIL-LM3-Pro 0.4100 مقابل Qwen3-8B 0.0000، أوسع فجوة مسار بين الصفوف الأحد عشر المُبلَّغ عنها.

• استقراء القواعد — TwIL-LM3-Pro 0.4195 مقابل Qwen3-8B 0.3680.

• ملاءمة المدونة — أدنى ارتباك `lm_corpus` لأي ذراع عند 2.3130، مع Qwen3-8B عند 2.5478.

• المعلمات — 3.66B مقابل نحو 8B، وهو الأساس الكامل لادعاء "أقل من نصف المعلمات".

هناك تحفظان يتعلقان بذلك الجدول، و webAI تذكر كليهما. توليدات المسار A من TwIL-LM3-Pro تبلغ في المتوسط 1,902 توكن، و 24.2% منها تصل إلى حد الطول، مقابل 564 توكن لسلفها TwIL-LM3؛ وكلمة البطاقة للفجوة الناتجة هي "إرشادية وليست دقيقة". وقد قيست أرقام الإنتاجية في الجدول في جلسة لاحقة على vLLM أحدث (0.19.1) من الإصدار المستخدم في أعمدة المقارنة (0.11.2)، لذا فإن صفوف التوكن في الثانية قابلة للمقارنة مع بعضها البعض، ومع الباقي بشكل تقريبي فقط.

حيث لا يفوز

في مجموعة التقييم المحجوزة، بطاقة النموذج صريحة: "TwIL-LM3-Pro لا يتصدّرها". المتوسط الماكروي لعشر مجموعات بيانات هو 0.7901، وهو متعادل إحصائيًا مع نموذجه الأساسي الخاص عند 0.7942، ومتأخر كثيرًا عن Qwen3-8B عند 0.8493 وgpt-oss-120b عند 0.8689. متوسطه الماكروي لـ14 مجموعة بيانات البالغ 0.7425 يتفوق على نموذجه الأساسي بمقدار 0.0093، وتأتي هذه الزيادة بأكملها من BBH-logic (0.9540 مقابل 0.9013 للنموذج الأساسي) — وإذا استبعدت ذلك الصف الواحد، يصبح متوسط النموذج 0.7263 عبر المجموعات الثلاث عشرة المتبقية، أي أقل من 0.7350 لدى VibeThinker-3B.

هناك ثلاث نقاط ضعف حقيقية داخل التخصص، جميعها مُفصح عنها: المطابقة الدقيقة لترجمة FOL عند 0.0100، و`procedural` عند 0.1200 في المقياس الصارم، والمطابقة الدقيقة للتحليل الدلالي عند 0.0000. لا يحلل استقراء القواعد سوى 56.5% من مخرجاته. والنموذج مطوّل بحكم بنيته — نحو 792 توكنًا لكل إجابة في Track B مقابل 482 لسابقه — وهو تكلفة، لا قدرة.

لا شيء من هذا يُعد انتقادًا للإصدار. فهكذا تبدو بطاقة نموذج مكتوبة جيدًا، ولهذا يمكن الاقتباس من الأرقام الواردة هنا على الإطلاق.

ثلاث طرق للحصول عليه، وإحداها نموذج

إن وضع التوزيع هو الخبر الفعلي لهذا الأسبوع، ويستحق أن يُذكر بدقة.

إنّ الأوزان متاحة على Hugging Face، من دون قيود وصول، بموجب رخصة webAI Non-Commercial License ver. 1.0 — التي تسمح بالاستخدام البحثي والشخصي وتتطلب اتفاقًا منفصلًا مع webAI للنشر الذي يدرّ إيرادات. تلك الرخصة هي القيد الملزم للإصدار بأكمله، وهي السبب في أن TwIL-LM3-Pro ليس نموذجًا يمكن لمعظم فرق المنتجات أن تتبناه ببساطة.

تقول webAI إن العائلة تجاوزت نصف مليون عملية تنزيل خلال شهر واحد، وهو رقم نشرته الشركة في إعلانها الخاص ولم يخضع لتدقيق مستقل. وتنزيلات نقطة تحقق مجانية غير تجارية ليست مؤشرًا بديلًا عن الاستخدام الإنتاجي، ولا تقدّمها webAI على هذا النحو.

في المقابل، ليست منصة البائع نفسها نقطة نهاية عامة. تصف webAI نفسها بأنها منصة مؤسسية تجلب الذكاء الاصطناعي إلى بياناتك، مع تطبيق نموذج محلي أولًا، ومسارها التجاري هو اتفاق مؤسسي بدلًا من بطاقة أسعار منشورة لكل رمز. كما يغيب TwIL-LM3-Pro عن منصات الاستدلال الكبيرة التابعة لجهات خارجية التي تفهرس نقاط التحقق المفتوحة — وقد تحققنا، وهو ليس موجودًا في كتالوج OrcaRouter أيضًا — لذا فإن الإجابة العملية عن سؤال «من أين أستدعي هذا من واجهة API؟» هي أنك في الوقت الحالي في الغالب لا تفعل ذلك؛ بل تنزّله.

القناة الثالثة هي الجديدة. ظهر مستودع `TwIL-LM3-Pro-LiteRT-LM` في 1 أكتوبر 2026، حاملًا مخرجات `.litertlm` وموسومًا لـ Android و iOS — حزمة تشغيل LiteRT-LM الخاصة بـ webAI للأوزان نفسها. ما إذا كان ذلك البناء يرث الترخيص غير التجاري هو السؤال الذي يجب الإجابة عنه قبل التخطيط على أساسه، لأن المستودع الأصلي يرثه.

لماذا يستحق متخصص في المنطق الصوري بهذا الحجم المتابعة

السبب في أن هذا الإصدار يواصل الظهور مجددًا ليس جدول المعايير. بل إن webAI نشرت خط الأنابيب بأكمله، وشغّلت الوصفة نفسها على خمسة نماذج أساسية مختلفة، وأبلغت بما حدث. يسجّل جدول المقارنة العائلي حركة البوابة الكلية في Track A من +0.012 إلى +0.145 حسب النموذج الأساسي، مع بقاء المجموعة المحجوزة داخل نطاق ±0.013 — النسخة الموثّقة من عبارة "هذا يعمّم". المعامل الوحيد المختار لكل نموذج هو وزن الدمج، الذي مُسح على الأداء المحجوز: 0.15 لـ SmolLM3، و0.20 لـ Granite وقاعدة TwIL، و0.50 لـ VibeThinker-3B.

تلك وصفة قابلة لإعادة الاستخدام لتحويل نموذج عام صغير إلى متخصص ضيق النطاق دون تدمير ما كان يعرفه سابقًا، نُشرت مع النتائج السلبية مرفقة بها. وبالنسبة لأي شخص يحتاج إلى وسوم الاستلزام، أو صياغة عبارات Lean رسميًا، أو تحليلات دلالية بدلًا من نص سلس، فإن ملف GGUF بحجم 2.09 GiB يعمل دون اتصال بالإنترنت وبدون رسوم لكل استدعاء وبدون اعتماد على الشبكة يمثل عرضًا مختلفًا عن أي نموذج مستضاف، مهما قال جدول Elo.

السؤال المطروح هو ما إذا كانت الأوزان ستظهر يومًا ما في ظل ترخيص يسمح بالاستخدام التجاري، وما إذا كانت نسخة LiteRT-LM تأتي بالقيد نفسه. وإلى أن يحدث ذلك، يبقى TwIL-LM3-Pro أثرًا بحثيًا مصحوبًا ببطاقة نموذج صادقة على نحو غير معتاد — وهذا ليس بالأمر الهيّن.

A generated single-column scoreboard headed 'TwIL-LM3-Pro - the scoreboard' with six rows: Macro gate 0.5539; Strict-7 0.2879; Strict MCQ 0.4100; Rule induction 0.4195; Held-out 10-set macro 0.7901; Parameters 3.66B dense. A footer line reads 'All figures vendor-reported by webAI; no independent evaluation yet.' The OrcaRouter logo is composited in the bottom-right corner.

إذا كنت بحاجة إلى هذه الإمكانية في بيئة الإنتاج اليوم

في أي نشر تجاري، تكون العقبة هي الترخيص لا معايير الأداء، والبديل العملي هو نموذج مستضاف يمكنك توجيه الطلبات إليه. تلك هي الطبقة التي تعمل عليها OrcaRouter: نقطة نهاية واحدة متوافقة مع OpenAI أمام أكثر من 200 نموذج بسعر قائمة المزوّد دون إضافة أي هامش، بحيث يسري تخفيض سعر المورّد في اليوم نفسه بدلًا من بعد دورة تعاقدية. وفي الأماكن القليلة التي تناسبها فعلاً نقطة تفتيش صغيرة للمنطق الصوري — وسم دفعي دون اتصال، ومرور استلزام في بيئة معزولة عن الشبكة، وخطوة معالجة مسبقة يكون ناتجها وسمًا لا نثرًا — فإن التقسيم الصادق هو تشغيل النموذج المحلي حيث يكون عبء العمل تحويل نص إلى وسم، وتوجيه الاستدلال المحيط وتوسيع المطالبات وضمان الجودة إلى نماذج مستضافة بالمفتاح نفسه.

تحذير واحد يستحق التكرار في هذا القسم تحديدًا: مع التبديل التلقائي عند الفشل، يمكنك أيضًا توجيه الطلبات إلى نموذج قبل أن تثق به في مسار الإنتاج، ويمكنك التراجع بتعديل قاعدة توجيه بدلًا من إعادة النشر. هذا هو النمط المناسب لنموذج مثل هذا عندما تكون حالته التجارية غير محسومة.

A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the tags for Text Generation, Transformers, Safetensors, GGUF, English, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.

ماذا تشاهد

ثلاثة أمور ستغيّر هذه القصة. تغيير الترخيص، أو نسخة منقولة من LiteRT-LM بترخيص واضح، سينقل TwIL-LM3-Pro من كونه نتاجًا بحثيًا إلى مكوّن قابل للنشر. وظهوره على منصة استدلال مستضافة كبرى سيمنحه واجهة برمجة تطبيقات حقيقية. وتقييم مستقل — أي شخص غير webAI يشغّل منظومة Track A — سيخبرنا ما إذا كان تفوق strict-7 على Qwen3-8B سيصمد عند قياسه من قبل شخص لم يبنِ منظومة الاختبار. لم يحدث أي من الثلاثة بعد، وبطاقة النموذج صادقة بما يكفي لترى بالضبط ما الذي يجب أن يتحقق لكي تكون لها أهمية.

A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro-LiteRT-LM, created 1 October 2026, showing the tags TextGeneration, LiteRT-LM, on-device, android, ios, granite, granite-4.2 and reasoning, and the card text describing TwIL-LM3-Pro converted to Google's LiteRT-LM (.litertlm) format for on-device inference, requiring LiteRT-LM 0.16 or newer, preserving the ChatML prompt format and pre-opening the think block.