
إنكلينج-سمول: النموذج الذي يبلغ ربع الحجم يتفوق على نسخته الرئيسية، ولا يزال يتخلف عن المؤشر
- qwenجديدQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 لكل مليون رمز · 56 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Flash 07312026-07-3150الذكاء69البرمجة
- qwenجديدQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 201 tok/s
- orcaجديدOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicجديدAnthropic: Claude Opus 52026-07-2461الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2150الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1651الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1557الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0951الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0955الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0959الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0854الذكاء72البرمجة
- tencentTencent: Hy32026-07-0641الذكاء59البرمجة
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232الذكاء42البرمجة
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226الذكاء39البرمجة
- anthropicAnthropic: Claude Sonnet 52026-06-3053الذكاء72البرمجة
- klingKling: Kling 3.0 Turbo2026-06-1757الذكاء52البرمجة57الرياضيات
- z-aiZ.ai: GLM 5.22026-06-1651الذكاء69البرمجة60الرياضيات
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242الذكاء61البرمجة61الرياضيات
قضى مختبر Thinking Machines أسبوعين بعد إطلاق أول نموذج مفتوح الأوزان في بناء نموذج يبلغ نحو ربع حجمه، ووفقًا لبطاقة أداء المختبر الخاصة يفوز النموذج الأصغر.Inkling-Smallيسجّل 80.2% على SWE-bench Verified مقابل Inklingالذي حقّق 77.6%، و89.5% على GPQA Diamond مقابل 87.2%، و64.7% على Terminal-Bench 2.1 مقابل 63.8%، و31.6% على Humanity's Last Exam مقابل 29.7% — من إجمالي معاملات 276B مع تنشيط 12B، بدلًا من 975B مع 41B. ومن بين الأرقام الرئيسية التي يتشاركها بطاقا النموذجين، يحتفظ النموذج الرائد 975B بواحدٍ فقط: AIME 2026، بفارق 1.6 نقطة.
ثم أجرت Artificial Analysis اختبارات مستقلة على النموذجين ووضعت Inkling-Small عند 40 على مؤشر الذكاء الخاص بها مقابل 41 لـ Inkling — النموذج الأصغر بفارق نقطة خلف. كلتا النتيجتين حقيقيتان، والفارق بينهما هو أكثر شيء مفيد في هذا الإطلاق. كل ما يلي يفصل بين ما تبلغ عنه Thinking Machines حول نموذجها وما قاسه شخص آخر: أرقام البائع تأتي من الإعلان وبطاقتي النموذجين على Hugging Face، والأرقام المستقلة من اختبارات Artificial Analysis الخاصة، وأرقام التسعير والسياق من بيانات نقطة نهاية OpenRouter المباشرة، وقد تحققت منها في اليوم الذي كُتب فيه هذا المقال. وحيثما تختلف هذه المصادر الثلاثة — وهي تختلف في طول السياق — فنحن نقول ذلك بدلاً من اختيار الرقم المُرضي.
ما الذي تم إصداره فعليًا في 30 يوليو
Inkling-Small هو محول متناثر مختلط الخبراء: إجمالًا 276 مليار معامل، و12 مليار معامل نشط لكل رمز، و42 طبقة، حيث يُوجَّه كل رمز إلى 6 من أصل 256 خبيرًا، بالإضافة إلى خبيرين مشتركين يعملان على كل شيء. يتناوب الانتباه بين الطبقات المحلية والعالمية. الأوزان متاحة على Hugging Face بموجب ترخيص Apache 2.0 دون قيود تجارية، ويمكن ضبطه بدقة عبر واجهة Tinker API من Thinking Machines، ويمكنك التحدث معه نصًا وصورةً وصوتًا في Tinker Playground. ويقول المختبر إنه تم تدريبه على أنظمة NVIDIA GB300 NVL72.

تعدد الوسائط أصيل وليس مُلحقًا، والبطاقة محددة بشكل غير معتاد في كيفية ذلك. لا يوجد مشفِّر منفصل للرؤية أو الصوت: يصل الصوت كمخططات طيفية dMel، والصور كرقع بحجم 40×40 بكسل تمر عبر hMLP من أربع طبقات، ويُضمَّن كلاهما مباشرة في نفس تدفق الرموز كنص. الإدخال نص وصور وصوت؛ الإخراج نص فقط، وهو أمر يستحق الذكر صراحةً لأن "متعدد الوسائط" يُقرأ على أنه "يمكنه الكلام" في كثير من الأحيان بما يكفي لإفساد بعد ظهر أحد الأيام. الجهد الفكري قرص بخمسة إعدادات — الحد الأدنى، المنخفض، المتوسط، المرتفع، المرتفع جدًا — بحيث يمكن تشغيل الأوزان نفسها بتكلفة منخفضة أو بجهد كبير.
الجزء المثير للاهتمام في هذه الوصفة هو مرحلة ما بعد التدريب. فقد تم تقطير إنكلينغ-سمول أثناء اتباع السياسة نفسها، مع استخدام إنكلينغ الكامل كمعلم لها، ثم أُعطيت نحو أسبوعين إضافيين من التعلم المعزز على نطاق موسع في البرمجة الوكيلة. وهذا الترتيب يفسر شكل النتائج: الطالبة ورثت الكفاءة العامة لمعلمها، ثم تلقت تدريبًا إضافيًا على المحور ذاته الذي تتفوق فيه الآن على المعلم.
لوحة الصدارة التي نشرتها Thinking Machines
معايير البائعين تسويقٌ محض حتى يُعيد شخصٌ ما إنتاجها، لذا اقرأ هذا القسم على أنه ما يدّعيه المختبر لا ما ثبُت بالتحقق. إنها مجموعة واسعة، وهي واسعة في اتجاه غير مُجمِلٍ للجهاز الرائد.

بعيدًا عن الأرقام الأربعة المشتركة، تُكمل البطاقة بقية الصورة — كلها من تشغيلات Thinking Machines الخاصة.
• العمل الوكيلي — 1269 Elo في GDPval-AA v2، وهو معيار للمهام الاقتصادية الواقعية بدلاً من الألغاز.
• الرسوم البيانية والمستندات — 77.4% على CharXiv RQ، لترتفع إلى 81.3% عندما يُسمح للنموذج بكتابة وتشغيل Python. هذه القفزة البالغة 3.9 نقطة هي تلميح مفيد إلى أن الوصول إلى الأدوات يحقق أكثر في أعمال الاستدلال البصري من هندسة المطالبات.
• Vision — 74.0% على MMMU Pro، أعلى بقليل من 73.5% الخاصة بـ Inkling.
• الصوت — 90.1% في VoiceBench و77.0% في MMAU، وكلاهما بشكل طفيف أقل من 91.4% و77.2% في النسخة الرئيسية. الصوت هو أحد المجالين اللذين دفعا ثمن التصغير بوضوح.
• السلامة — 98.4% على StrongREJECT و96.9% على الاستفسارات الحميدة لـ FORTRESS، لكن 71.6% على الاستفسارات العدائية لـ FORTRESS مقارنةً بنسبة 78.0% للطراز الرئيسي. هذه هي التكلفة الأخرى: تراجع بمقدار 6.4 نقاط في المتانة ضد الهجمات العدائية، وهو ما يهم أكثر من أي مكسب في البرمجة إذا كان النموذج سيُوضع خلف صندوق نص عام.
• التنبؤ — مؤشر براير 61.3 ± 0.46 على ForecastBench بدون الوصول إلى البحث، ودرجة براير 0.1238 ± 0.0086 على Prophet Arena. إن مجرد الإبلاغ عن أشرطة الخطأ هو أكثر انضباطاً مما تفعله معظم منشورات الإطلاق.
الفجوة الوحيدة: بطاقة الطراز الرائد تسرد 54.3% على SWE-bench Pro، وهو النسخة الأصعب من SWE-bench Verified. بطاقة Inkling-Small لا تذكر SWE-bench Pro. ونظرًا للبروز الكبير لرقم Verified، فإن غيابه هو الرقم الذي نود أن نراه مكتملًا أكثر من أي شيء آخر.
ما يقوله المؤشر المستقل بدلاً من ذلك
تُصنّف Artificial Analysis نموذج {{1}}Inkling-Small{{/1}} عند 40 على الإصدار 4.1 من مؤشر الذكاء الخاص بها، أي بنقطة واحدة أقل من {{2}}Inkling{{/2}} عند 41. المؤشر مركّب من تسعة تقييمات — {{3}}GDPval-AA v2، τ³-Banking، Terminal-Bench v2.1، SciCode، Humanity's Last Exam، GPQA Diamond، CritPt، AA-Omniscience وAA-LCR{{/3}} — وهذه القائمة تفسّر معظم التناقض الظاهر. اثنان فقط من التقييمات التسعة يتداخلان مع عرض الاستدلال على {{4}}بطاقة Thinking Machines{{/4}}. أما البقية فترجّح كفة استخدام الأدوات الوكيلية، واسترجاع السياق الطويل، ومقاومة الهلوسة، ويمكن للنموذج أن يفوز في المعايير التي تختار المختبرات نشرها بينما يخسر في تلك التي يختار طرف ثالث تشغيلها. لا يكذب أي من الطرفين؛ إنهما يقيسان أشياء مختلفة.

هناك أيضًا في التفاصيل الدقيقة ما يفوق في قيمته العنوان الرئيسي عن فارق النقطة الواحدة: تُدرج Artificial Analysis إدخال الطراز الرائد على أنهInkling (xhigh) — وهو أعلى إعداد لجهد التفكير — بينما لا يحمل صف Inkling-Small أي لاحقة جهد. لذا فقد سُجّل تفوق الطراز الرائد بفارق نقطة واحدة بينما كان إعداد التفكير عند أقصاه. وإذا كانت مطابقة الجهد قد أزاحت تلك المقارنة ولو قليلًا، فستزول معها آخر حجة للطراز الأكبر على أساس القدرة وحدها.
في حين أن البيانات المستقلة ليست متقاربة على الإطلاق في السرعة والتكلفة، وهنا تُرجَّح الكفّة لصالح النموذج الصغير بهوامش لا يعبّر عنها أي جدول معايير:
• سرعة الإخراج — 133 رمزًا في الثانية مقابل 80 لـ Inkling (xhigh). يصنّف Artificial Analysis نموذج Inkling-Small في المرتبة #7 من أصل 101 نموذج في فئته من حيث السرعة، مقابل متوسط الفئة البالغ 66.
• الوقت حتى أول رمز — 1.63 ثانية مقابل 1.84 ثانية. ميزة حقيقية وإن كانت طفيفة.
• السعر المخلوط لكل مليون رمز — 0.22 دولار مقابل 0.72 دولار على أساس أوزانها. أي ما يعادل ثلث التكلفة تقريبًا، مع نقطة مؤشر واحدة أقل.
• ترتيب الذكاء — #15 من 101، مقابل وسيط درجات الفئة البالغ 25. أعلى من المتوسط بفارقٍ مريح، لكنه بعيدٌ عن الطليعة.
• الإسهاب — وهنا بيت القصيد. لقد استهلك 130 مليون توكن إخراج لاجتياز الفهرس، مقابل وسيط قدره 100 مليون. ملخص Artificial Analysis نفسه يصفه بأنه «سريع بشكل ملحوظ، لكنه مطوّل إلى حد ما.» إنه يفكر حوالي 30% أكثر من المعتاد، مما يلتهم بهدوء جزءًا من الخصم لكل توكن.
ملاحظة محاسبية صغيرة، نظرًا لأن أي شخص يقارن المصادر سيواجهها: تُدرج Artificial Analysis عدد المعاملات على أنه 266B إجمالاً، بينما يذكر الإعلان وبطاقتا النموذج وOpenRouter جميعًا 276B. لقد استخدمنا 276B في كل مكان. لا يغير ذلك أي استنتاج، لكنه نوع الاختلاف الذي يستحق معرفته قبل أن تقتبس رقمًا في مستند تصميم.
ما يمكنك استئجاره فعليًا اليوم، وهو ليس ما تقوله ورقة المواصفات
الفجوة بين الإعلان عن أوزان مفتوحة ووجود نقطة وصول قابلة للاستخدام هي حيث تتوقف معظم التغطيات الإخبارية عن الاهتمام. تعلن Thinking Machines عن نافذة سياق تصل إلى مليون توكن، وتدرج Artificial Analysis مليونًا أيضًا. على OpenRouter، يحدّها كلا المزوّدين اللذين يقدّمان Inkling-Small حاليًا عند 524,288 توكن — أي نصف الرقم المُعلن عنه. هذا ليس تناقضًا بقدر ما هو فرق بين ما تدعمه البنية وما قام أي شخص بتشغيله في الإنتاج. على سبيل المقارنة، يمتلك Inkling الرئيسي نقطة وصول واحدة بالسعة الكاملة البالغة 1,048,576 توكن، غير أن نقطة الوصول نفسها تحدّ المخرجات إلى 32,768 توكن.
بقية الصورة الحية، تُقرأ من بيانات نقطة نهاية OpenRouter:
• مزوّدان، سعران — $0.45 لكل 1M إدخال و$1.20 لكل 1M إخراج من أحد المزوّدين، و$0.50 و$1.20 من الآخر. يُدرج Artificial Analysis سعر الطرف الأول الخاص بـ Thinking Machines عند مستوى أقل يبلغ $0.30 و$1.20، مع الإدخال المخزّن مؤقتًا بسعر $0.06. تفرض الاستضافة من طرف ثالث علاوة تتراوح بين 50–67% على الإدخال لنفس الأوزان.
• التخزين المؤقت للمطالبات — 0.10 دولار لكل مليون رمز إدخال مخزّن مؤقتًا عبر OpenRouter، مقابل 0.17 دولار للطراز الرائد.
• الأرقام التي تستأجرها ليست الأرقام التي خضعت للاختبارات المعيارية — تسرد بطاقة النموذج BF16 وNVFP4. الطرف الأرخص يقدّم fp8؛ أما الآخر فلا يصرّح بأي تكميم على الإطلاق. لم تُقاس نتائج اختبارات البائع المعيارية على خدمة fp8 لهذه الأوزان، وتأثيرات التكميم على التشغيلات الطويلة للوكلاء هي بالضبط نوع الأشياء التي لا يمكن أن تتحمّلها فجوة قدرها 0.9 نقطة في Terminal-Bench. إذا كنت تكرّر رقمًا، فاذكر أي طرف استخدمته.
• تغطية الميزات متفاوتة حسب المزود — تعرض كلتا نقطتي النهاية الاستدلال و reasoning_effort، لذا فإن قرص التفكير ذو الإعدادات الخمسة يعمل. لكن واحدًا فقط يعلن عن استدعاء الأدوات وlogprobs، و لا يعلن أي منهما حاليًا عن response_format، المعلمة الخاصة بالمخرجات المنظمة/وضع JSON. تمتلك Inkling الرائدة نقطة نهاية تدعم ذلك. إذا كان خط أنابيبك يعتمد على JSON المقيد بالمخطط، فهذه هي التفاصيل التي ستسبب المشكلة في اليوم الأول، وهذا قيد من المزود وليس من النموذج.
• سقف الإكمال — 262,144 توكنًا على نقطة النهاية fp8؛ والآخر يصرح بعدم وجود سقف.
حالة التكلفة، بناءً على عدد الرموز المُقاس
إن أسعار كل مليون رمز هي طريقة سيئة لمقارنة نماذج الاستدلال، لأن المتغير الوحيد هو عدد الرموز التي تحرقها هذه النماذج أثناء التفكير. تنشر Artificial Analysis الإنفاق الفعلي، وهو أداة أفضل بكثير: تشغيل Inkling-Small عبر مؤشر Intelligence Index الكامل استهلك ما يقارب 130 مليون رمز مخرج وكلف $192.37، وهو ما يعادل حوالي $0.07 لكل مهمة وفقًا لمتوسطهم المرجح.
قارن ذلك بنفس القياس للنماذج التي ينشرها الناس فعليًا: DeepSeek V4 Flash بسعر 0.03 دولار لكل مهمة، gpt-oss-120b بسعر 0.08 دولار، Gemini 3.6 Flash بسعر 0.56 دولار، GLM-5.2 بسعر 0.57 دولار، Kimi K3 بسعر 0.86 دولار، GPT-5.6 Sol بسعر 1.23 دولار، Claude Opus 5 بسعر 2.34 دولار، Claude Fable 5 بسعر 3.15 دولار. Inkling-Small هو ثاني أرخص نموذج في تلك المجموعة وأرخص بحوالي 18 ضعفًا لكل مهمة من GPT-5.6 Sol، الذي يسجل 59 مقابل 40 له.
هناك أيضًا طريقة أنظف لمعرفة سبب انخفاض السعر إلى ما وصل إليه. انخفضت المعلمات النشطة من 41 مليارًا إلى 12 مليارًا، أي بمعامل 3.4. وانخفض سعر المخرجات من 4.05 دولار إلى 1.20 دولار لكل مليون، أي بمعامل 3.375. سعر استئجار نموذج MoE المتفرق هو في الأساس مجرد تكلفة الحساب لكل توكن، وقد قامت Thinking Machines بالتسعير وفقًا لذلك بدلاً من التسعير على أساس المعيار.
ملاحظة عملية حول إجراء هذه المقارنة بنفسك: Inkling-Small ليس في كتالوج OrcaRouter اليوم، لذا ستستأجره من نقاط النهاية الخاصة به. النماذج المغلقة التي ستقيسها ضده — GPT-5.6 Sol وClaude Opus 5 وGemini 3.6 Flash وبقية تلك القائمة — موجودة على OrcaRouter خلف مفتاح واحد بتكلفة 0% هامش ربح، أي أنك تدفع السعر الرسمي لكل مزوّد دون أي إضافة. هذا مهم لنموذج التكلفة تحديدًا: الرقم الذي تضعه في جدول البيانات هو الرقم الذي يُفوتر، وعندما يخفض مزوّد أسعاره يظهر ذلك على جانبنا في نفس اليوم وليس بعد إعادة تفاوض. كما يغطي التبديل التلقائي بين المزوّدين النصف الآخر من التقييم، وهو ذراع الأساس الذي يتعطل في منتصف التشغيل ويفسد أرقامك بهدوء.
أين يقع فعليًا بين النماذج مفتوحة الأوزان
بالمقارنة مع النموذج الرائد، يبدو Inkling-Small بمثابة انتصار. وبالمقارنة مع بقية النماذج، يبدو نموذجًا متينًا بوزن مفتوح في منتصف الترتيب، وقد أغفلت التغطية الإعلامية للإطلاق القراءة الثانية في معظمها.
في مؤشر Artificial Analysis Intelligence Index، النماذج التي تسبق كلًا من Inklings تشمل Claude Opus 5 عند 61، وClaude Fable 5 عند 60، وGPT-5.6 Sol عند 59، وKimi K3 عند 57، وGrok 4.5 عند 54، وGLM-5.2 وMuse Spark 1.1 عند 51، وGemini 3.6 Flash عند 50. هذا متوقع — فهذه أنظمة متطورة، معظمها مغلق، وبعضها ضخم جدًا.
الذي يجب أن يغيّر القرار فعليًا هو DeepSeek V4 Flash، الذي يسجّل 50 مقابل 40 لـ Inkling-Small بحجم إجمالي 284B و13B نشطًا — وهو بنفس فئة الحجم تقريبًا وبنفس صفقة الأوزان المفتوحة، وبتكلفة تقل عن النصف لكل مهمة. إذا كنت تبحث عن أرخص نموذج مفتوح الأوزان قادر، فالأرقام المستقلة تشير إلى هناك وليس هنا. كما أنه، على عكس Inkling-Small، متوفر عبر OrcaRouter، لذا فإن اختبار هذا البديل على عبء العمل الخاص بك هو مجرد تغيير سلسلة النموذج وليس عملية شراء.
ما تمتلكه Inkling-Small ولا تمتلكه DeepSeek V4 Flash هو إدخال صوتي وصوري أصلي في نفس الأوزان، وقرص تفكير بخمسة مستويات، وضبط Tinker الدقيق من المختبر الذي درّبه. هذه عوامل تمييز حقيقية لوكيل متعدد الوسائط، وهي السبب الصادق لاختياره — وليس درجة المؤشر.
من يجب أن ينتقل، ومن يجب أن يبقى في مكانه
ينقسم القرار انقسامًا نظيفًا، وهو أمر غير مألوف بما يكفي لأن يُذكر على هذا النحو.
• انتقل من Inkling إلى Inkling-Small إذا كنت تشغّل وكلاء البرمجة. أرقام المورّد تفضّل النموذج الصغير على SWE-bench Verified و Terminal-Bench، والتعلم المعزز الوكالي الإضافي هو السبب الموثّق، وتكلفته نحو الثلث ويُرجع الرموز المميزة أسرع بمقدار 1.66×. من الصعب تبرير دفع 3.3× مقابل نقطة مؤشر واحدة تُقاس عند أقصى جهد تفكير.
• انتقل إذا كانت التكلفة لكل مهمة استدلال هي القيد الملزم ويمكنك القبول بـ 40 على المؤشر. إن سعر 0.07 دولار لكل مهمة مع معدل إصابة ذاكرة التخزين المؤقت البالغ 0.06 دولار لكل مليون على نقطة نهاية الطرف الأول هو تسعير تنافسي لنموذج يتمتع بدعم أصلي للصوت والرؤية.
• انتقل إذا كنت تقوم بالضبط الدقيق. نموذج 276B/12B أرخص بشكل كبير في التكييف والتقديم من 975B/41B، ويدعم Tinker كليهما.
• استمر في استخدام Inkling إذا كنت بحاجة إلى صوت طويل. هذا أكبر تراجع في هذا الإصدار وهو مدفون في بطاقات النماذج: النموذج الرائد يوصي بمدخلات صوتية أقل من 20 دقيقة، بينما توصي بطاقة Inkling-Small بـ أقل من دقيقتين. إنه خفض بمقدار عشرة أضعاف. إذا كنت تنسخ أو تحلل الاجتماعات، فإن النموذج الصغير ليس بديلًا جاهزًا بأي ثمن.
• ابقَ إذا كنت بحاجة إلى سياق يتجاوز 512K من نقطة نهاية مستضافة، أو إكمالات أطول من 262K رمزًا. اليوم، فقط الطراز الرائد لديه نقطة نهاية تخدم المليون الكامل.
• ابقَ إذا كنت بحاجة إلى JSON مُقيَّد بمخطط دون كتابة حلقة التحقق وإعادة المحاولة بنفسك، إلى أن يطرح مزوّد response_format للنموذج الصغير.
• ابقَ إذا كانت المتانة ضد الهجمات العدائية عنصرًا حاسمًا. 71.6% مقابل 78.0% في FORTRESS للهجمات العدائية هو الاتجاه الخاطئ لأي شيء مواجه للمستخدم، وهو رقم المختبر نفسه.
ثلاثة أسئلة تركتها تغطية الإطلاق مفتوحة
هل Inkling-Small مجرد نسخة مقطرة من Inkling؟
جزئيًا، والجزء الذي ليس كذلك هو الجزء المهم. كان التقطير على السياسة (on-policy distillation) باستخدام Inkling كمعلم إحدى مراحل ما بعد التدريب، لذا فإن الكثير من القدرة العامة موروثة فعلًا. لكن هذا نموذج ذو معمارية منفصلة — 42 طبقة مقابل 66 لدى النموذج الرئيسي، مع نفس طوبولوجيا التوجيه: 6 خبراء نشطين من أصل 256 بالإضافة إلى 2 مشتركين، مما يعني أن الخبراء أنفسهم أضيق لا أقل عددًا. وقد تلقى حوالي أسبوعين من التعلم المعزز للبرمجة الوكيلية (agentic-coding RL) لم يتلقها المعلم قط. تلك المرحلة الأخيرة هي ما يجعل الطالب المقطر يتفوق على معلمه في معايير البرمجة، وهو أمر لما كان ليحدث بخلاف ذلك.
هل يمكنني فعليًا استضافته بنفسي؟
فقط على أجهزة قوية بحق. معاملات 276B تعادل تقريبًا 276 جيجابايت من الأوزان بصيغة 8-bit وحوالي 552 جيجابايت بصيغة BF16، قبل احتساب أي KV cache — عقدة متعددة وحدات معالجة رسومية في كلتا الحالتين، وليست محطة عمل. الميزة في MoE المتفرقة هي تكلفة الاستدلال، وليس حجم الذاكرة؛ فأنت تخزّن كل 276B وتحسب بـ 12B. تذكر البطاقة SGLang وvLLM وTokenSpeed وUnsloth وHugging Face Transformers كمسارات خدمة مدعومة، وتورد أرقام BF16 وNVFP4. لاحظ أيضًا أن نقطتي الاستضافة الحاليتين تقدمان نسخة مكمّمة، لذا فإن "النموذج نفسه" المستضاف ذاتيًا بصيغة BF16 لن يتصرف بشكل مطابق لواجهة API التي اختبرتها.
هل لا يزال لدى 975B Inkling سبب للوجود؟
ثلاثة، وكلها ضيقة: السياق الكامل المُقدَّم بسعة 1M-token، ومدخلات صوتية أطول من دقيقتين، وسلوك أمان أفضل ضد الهجمات الخصومية. ومن الجدير بالذكر أن «إنه أذكى» ليس عنصرًا مؤكدًا في تلك القائمة — نقطة مؤشر واحدة عند أقصى جهد تفكير، مقابل مجموعة من معايير البائعين التي يفوز فيها النموذج الأصغر في معظمها، لا تُعتبر حجة على القدرات. بعد أسبوعين من إطلاق النموذج الرئيسي 975B، أصدرت Thinking Machines النموذج الذي يجعل من الصعب التوصية به. هذا إما صراحة غير معتادة أو سرعة غير معتادة، وفي كلتا الحالتين فهي علامة جيدة على المختبر.
ماذا تشاهد بعد ذلك
{{1}}ثلاثة أمور ستحسم كيف ستُقيَّم هذه النسخة مع مرور الوقت.{{/1}} {{2}}ما إذا كانت نقطة النهاية ستظهر لتخدم سياق 1M المُعلن عنه، وهو ما سيزيل الميزة الأوضح المتبقية للطراز الرائد.{{/2}} {{3}}ما إذا كان أي شخص سينشر مقارنة مستقلة متكافئة الجهد بين النموذجين، وهي الطريقة الوحيدة لمعرفة ما إذا كانت نقطة المؤشر تلك حقيقية.{{/3}} {{4}}وما إذا كانت توصية الصوت البالغة دقيقتين قيدًا تدريبيًا أم إعدادًا افتراضيًا للتشغيل — لأنه إذا كان الخيار الأخير، فإن السبب الأكبر الوحيد للبقاء على النموذج الأكبر يتبخر.{{/4}} {{5}}وإلى ذلك الحين، فإن الملخص الصادق هو أن Thinking Machines أصدرت نموذجًا بثلث السعر، وأسرع بثلثين، وأفضل في البرمجة وفق أدلتها الخاصة، ومتأخر قليلًا في التقييمات المستقلة المجمعة، ومتأخر بوضوح عن منافس بنفس الحجم لم تذكره معظم التغطيات.{{/5}}
