
Perceptron Mk1.5 مقابل Gemma 4 12B: أحدهما يجيب بجمل، والآخر يجيب بإحداثيات
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 610 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 189 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
هذا هو الرقم الذي ينبغي أن يوقفك أولًا: Perceptron Mk1.5. إنه نموذج مبني للفيديو والوكلاء المتجسدين، ونافذة سياقه 36,864 توكن. أما Gemma 4 12B فهو نموذج عام مفتوح الأوزان بحجم 12B ونافذة تبلغ 256K. وعلى المحور الذي يستخدمه معظم الناس لمقارنة نماذج الرؤية — أي مقدار اللقطات الذي يمكنني تسليمه لها — يخسر النموذج الأصغر، المغلق، المخصص لغرض محدد أمام النموذج القابل للتنزيل بمعامل سبعة. هذا الانقلاب ليس عيبًا في أي من المنتجين. إنه يخبرك بما بُني كل منهما فعليًا ليفعله، والمهمتان أبعد عن بعضهما مما يوحي به السطر المشترك «الإدخال متعدد الوسائط» في أوراق مواصفاتهما.
بيرسيترون Mk1.5 هو نموذج الاستدلال المُجسّد الذي أطلقته Perceptron في 25 سبتمبر 2026، وهو خليفة Perceptron Mk1 من مايو، ويستقبل النص والصور والفيديو والصوت ويعيد النص بالإضافة إلى هندسة قابلة للتحليل آليًا. Gemma 4 12B هو نموذج Google DeepMind متعدد الوسائط مفتوح الأوزان وخالٍ من المُشفّر بحجم 11.96B، صدر في 3 يونيو 2026 بموجب Apache 2.0، ويستقبل النص والصورة والصوت والفيديو ويعيد النص. كلاهما رخيص، وكلاهما يقرأ بث الكاميرا، وواحد فقط منهما سيسلّم وحدة التحكم لديك مربعًا محيطًا دون مرحلة تحليل ثانية. الاختيار بينهما اختيار يتعلق بما يجب أن يعود.
ما الذي صُمِّم كل واحد منها ليعيده
ضعهما جنبًا إلى جنب وستجد أن الفرق ليس في الدقة، بل في نوع المخرجات. اسأل Gemma 4 12B عن مكان الرافعة الشوكية وستحصل على جملة، وفي معظم التطبيقات تكون تلك الجملة هي المنتج — وصفًا أو ملخصًا أو إجابةً عن سؤال حول صورة. اسأل Perceptron Mk1.5 ويمكنك، إلى جانب نصه النثري، أن تطلب نقطة أو مربع إحاطة أو مضلعًا أو مقطعًا أو عنصر <track> يحمل ملاحظة مكانية والطابع الزمني الذي تنتمي إليه. يعود مقطع مدته 60 ثانية كسلسلة من المواضع عبر الزمن بدلًا من تخمين متوسط واحد عن المشهد.
تلك هي الحجة كاملةً وراء وجود Mk1.5، ويجدر بنا أن نكون دقيقين بشأن لماذا يهم ذلك. وصف المشهد مخرَج مكتمل. أما الإحداثي فهو مُدخَل لشيء آخر — مخطط إمساك، أو فحص عيوب، أو سجل تدقيق مختوم بطوابع زمنية. إذا كان على الكود اللاحق لديك أن يقرأ نثرًا ويستنتج الموضع منه، فأنت قد بنيت محللًا بين نموذجين، وهذا المحلل هو الآن سطح الفشل لديك. طرح Mk1.5 هو أن الهندسة تصل مُنمّطة.
الحجة المضادة لدى Gemma 4 12B ليست أنه يفعل هذا أيضًا، بل إنه يمكنك امتلاك الأوزان. Apache 2.0، و11.96B معلمة، منشورة بنسختين مُدرَّبتين مسبقًا ومضبوطتين بالتعليمات، تعمل على عتاد تتحكم به، مع بطاقة تقييم منشورة ومؤشر طرف ثالث يدعمها. هذان نوعان مختلفان من الأصول، ولا يغني أحدهما عن الآخر.
حيث يتوافق الاثنان فعلاً
عدد أقل من الأماكن مما يوحي به وصف «متعدد الوسائط 2026»، لكن الأرضية المشتركة حقيقية وتستحق الذكر تحديدًا لأنها حيث تبدأ عادة قائمة تحقق المشتري.
• نمط الإدخال — كلاهما رباعي الأنماط حقًّا. يقبل Perceptron Mk1.5 النص والصور والفيديو والصوت (WAV، MP3، FLAC). ويقبل Gemma 4 12B النص والصورة والصوت والفيديو عبر مسار موحّد بلا مُرمِّز.
• طريقة الإخراج — لا يولّد أيٌّ منهما صوتًا أو صورًا. كِلاهما يُخرِج نصًا. الفرق هو أن نصّ Mk1.5 يمكن أن يحمل تعليقات مكانية مُهيكلة، بينما نصّ Gemma 4 12B لا يفعل ذلك.
• استدعاء الدوال — كلاهما يدعمه. يوفّر Mk1.5 استدعاء الدوال في إكمالات المحادثة ويقبل الاستجابات المقيّدة عبر JSON Schema والتعبيرات النمطية. وتأتي Gemma 4 12B مزوّدةً باستدعاء الدوال في نسختها المضبوطة بالتعليمات ووضع التفكير القابل للتهيئة.
• التحكم في الاستدلال — يستبدل Mk1.5 القيمة القديمة لـ vision_config.enable_thinking المنطقية بـ reasoning_effort، وهو حقل يقبل high، medium، low، minimal أو none، ويُعيّن افتراضيًا إلى high. تكشف Gemma 4 12B عن متغيرات تفكير وغير استدلالية تُحرز درجات مختلفة على أداة الاختبار نفسها لأنها تؤدي كميات مختلفة من العمل.
• السياق — 36,864 رمزًا لـ Mk1.5 مقابل 256K لـ Gemma 4 12B. هذه أوسع فجوة في القائمة، والقسم التالي مخصص لها.
• الأوزان والترخيص — Mk1.5 نموذج مستضاف مغلق مع SDK، وليس تنزيلًا. Gemma 4 12B بترخيص Apache 2.0، لذا فإن السعر المستضاف خيار من بين عدة خيارات وليس الطريقة الوحيدة لتشغيله.

نافذة 36K هي قرار تصميمي، وليست نقصًا.
نموذج مجسد بنافذة 36,864 رمزًا يبدو وكأنه خطأ حتى تنظر إلى ما بنته Perceptron إلى جانبه. يقبل Mk1.5 asset_idx كحقل، لذا يمكن لطلب واحد الإشارة إلى عدة صور أو مقاطع فيديو ومعالجة كل منها على حدة. يحد من الصوت عند 16,384 رمزًا لكل عنصر — وتشير وثائق Perceptron إلى أن ذلك يعادل حوالي 21.8 دقيقة من الكلام بمعدل 750 رمزًا في الدقيقة. والسبب في أن النافذة يمكن أن تبقى صغيرة هو أن المهمة ضيقة: ابحث وتتبع أشياء محددة في الإطارات، وأجب عنها، وتوقف.
هذا شكل مختلف من العمل عن شكل عمل Gemma 4 12B. نافذة 256K مخصّصة لاحتواء مستند أو مستودع أو محادثة طويلة والاستدلال عبر كل ذلك. نافذة Mk1.5 هي ميزانية لمهمة إدراك واحدة ذات إجابة منظّمة، وقد قدّرت Perceptron حجمها لتلك المهمة لا للوحة الصدارة. وتظهر أهمية الفرق في اللحظة التي تكون فيها مهمتك "شاهد كل فيديو الفحص هذا الذي مدته 40 دقيقة وأخبرني بكل شيء" — نافذة 36K لن تستوعب النص المكتوب والإطارات والإجابة في آنٍ واحد، ونافذة Gemma 4 12B مع درجة استرجاعها للسياق الطويل هي الأداة الصادقة لذلك.
النصف الثاني من تلك المقايضة هو السرعة. تُفيد Perceptron بأن السرعة من طرف إلى طرف تصل إلى 4.7×، استنادًا إلى وسيط ثلاث تشغيلات على وحدة H100 واحدة، مع التحفظ بأن 4.7× هو أفضل ثلاث قياسات وليس الحالة المعتادة: فقد انتقلت إجابات الدردشة من 5.2 ثانية إلى 1.1، وانتقلت الأسئلة والأجوبة حول الصور من 1.7 ثانية إلى 0.51 (نحو 3.3×)، وانتقل فيديو مدته 60 ثانية عند تزامن ثمانية مسارات من 19 ثانية إلى 9.1 (نحو 2.1×). وفي عبء عمل الفيديو الذي يشغّله وكيل متجسّد فعليًا، يكون المضاعف الصادق نحو اثنين.
تم قياس أحد هذه من قبل شخص آخر.

هذا هو أوضح تباين غير متكافئ في المواجهة، والفرق ليس ضئيلًا بأي حال.
بطاقة تقييم من المورّد لدى Gemma 4 12B، ومؤشر من طرف ثالث. تحمل البطاقة أرقامًا مبلّغًا عنها من المورّد — MMLU Pro 77.2، وGPQA Diamond 78.8، وMMMU Pro 69.1، وLiveCodeBench v6 72.0، وAIME 2026 دون أدوات 77.5، وTau2 بمتوسط ثلاث تشغيلات 69.0 — ونقطة ضعف صادقة واحدة في MRCR v2 8-needle عند 128k، التي تبلغ 43.4 وهي السطر الذي ينبغي قراءته قبل افتراض أن نافذة 256K تتصرف مثل نافذة عند الطرف الأقصى. وفوق ذلك يوجد قياس مستقل: يضع Artificial Analysis نموذج Gemma 4 12B عند مؤشر ذكاء قدره 14، في المرتبة 22 من 142 طرازًا في فئته، بسرعة 113.7 رمزًا مُخرَجًا في الثانية — المرتبة 20 من 142 في السرعة — بسعر قائمة قدره 0.10 دولار للإدخال و0.30 دولار للإخراج لكل مليون رمز.
لا يمتلك Perceptron Mk1.5 أي شيء من هذا القبيل. لا يوجد إدخال في مؤشر Artificial Analysis ولا نتيجة في الساحة لـ Mk1.5 أو لـ Mk1، لذا فإن كل رقم قدرة موجود لهذا النموذج تم إنتاجه من قبل الشركة التي تبيعه. تلك المجموعة محددة وليست غامضة، وتستحق القراءة: 0.9433 على الذاتي hand_box مقابل 0.4467 لـ Gemini 3.1 Pro و0.6179 لأفضل Gemini في اختبار Perceptron الخاص؛ EgoSchema 80.40 مقابل 81.20 لنفس المنافس، خسارة 0.80 نقطة في معيار الفهم الواسع مع ادعاء أفضلية 12% على مجموعة EgoSchema-hard الفرعية عند 63.75؛ 0.647 centre-F1 و0.628 point-HOTA على Molmo2-Track؛ DailyOmni 74.67 وAVHBench 80.56 على الجانب الصوتي. النمط في تلك الأرقام — حاسم في الهندسة الدقيقة، متعادل تقريبًا أو متأخر قليلاً في فهم الفيديو العام — متماسك ويتطابق مع قصة المنتج. لكن معيار البائع لنموذجه الخاص هو ادعاء، والنموذجان في هذا المقال لا يتم وصفهما بنفس النوع من الأدلة.
صف واحد في ذلك الجدول يستحق تحذيرًا محددًا. تُدرج مقارنة التتبع الخاصة بـ Perceptron Qwen3-VL-8B عند 0.180 centre-F1، مأخوذة من ورقة ذلك النموذج، إلى جانب أرقام مقاسة لنموذجها الخاص، وتقرنها بـ Qwen3.5-27B عند 0.530 و0.476 عبر نقاط تحقق وإعدادات تقييم مختلفة. رقم من ورقة بحثية في عمود من الأرقام المقاسة ليس صفًا متماثلًا، وهو نوع السطر الذي يُقتبس دون ذكر مصدره. ينطبق التحذير نفسه في الاتجاه المعاكس على منشورات 56.0 Mk1.5 على LiveVQA-W مع تمكين الأدوات — ذلك الرقم يأتي من تصويت الأغلبية بأربع عينات، بينما 53.2 الذي يُقارن به لـ Gemini 3.8 Flash مع الاستناد إلى البحث ليس كذلك، والتصويت بالأغلبية على أربع عينات تقنية مشروعة تُجمّل النتيجة مقارنة بتمريرة جشعة واحدة.
احتساب تكلفة عبء عمل فعلي
بطاقات الأسعار أقرب إلى بعضها مما هي عليه المنتجات. Perceptron Mk1.5 بسعر 0.15 دولار لكل مليون رمز إدخال و1.50 دولار لكل مليون رمز إخراج، مع إدخال مخزّن مؤقتاً عند 0.0375 دولار — أي ربع سعر الإدخال القياسي بالضبط، وأرخص لكل رمز مخزّن مؤقتاً من سعر الإدخال القياسي لدى Gemma 4 12B البالغ 0.10 دولار. Gemma 4 12B مُدرَج بسعر 0.10 دولار و0.30 دولار على منصة الاختبار التابعة لطرف ثالث التي تقيسه، وهو متاح بموجب Apache 2.0، لذا فإن الاستضافة الذاتية تلغي التكلفة الحدية بالكامل إذا كانت لديك العتاد.
هناك أمران يعقّدان المقارنة المباشرة ويشيران في اتجاهين متعاكسين. أولًا، في Mk1.5، reasoning_effort يُضبط افتراضيًا على high، ما يعني أن كل استدعاء لا يتم تهيئته يشتري أغلى مسار استدلال يقدّمه النموذج؛ وخفضه إلى medium أو low تغيير من سطر واحد وله تأثير مباشر على الفاتورة، وهو أرخص تجربة في الإصدار. ثانيًا، يتيح لك Gemma 4 12B إيقاف خطوة التفكير كليًا، ما يغيّر الفاتورة وزمن الاستجابة معًا، وفي مهمة ثابتة مثل التصنيف على مستوى الإطار غالبًا ما تكون تمريرة بلا استدلال هي الصحيحة.
أجرِ الحساب على شيء واقعي: خط أنابيب رؤية يعالج 40,000 إطار يوميًا بحوالي ألف رمز من مدخلات الصورة لكل إطار. هذا يعني 40 مليون رمز إدخال يوميًا. ووفق سعر الإدخال البالغ 0.15 دولار لدى Mk1.5، مع تخزين الإطارات مؤقتًا حيث يتكرر المشهد نفسه، ستكون تكلفة الإدخال في حدود دولارات قليلة جدًا يوميًا — رخيصة بأي معيار. أما Gemma 4 12B بسعر إدخال 0.10 دولار فهو أرخص بعد، ومجاني على الهامش إذا استضفته بنفسك. لا يعد أي من النموذجين مكلفًا. القرار هنا ليس قرار ميزانية؛ بل مسألة ما إذا كنت تحتاج إلى إحداثيات، أو نافذة 256K، أو كليهما.
استدعاء كليهما دون تكامل ثانٍ

العقبة العملية أمام إجراء هذه المقارنة ليست السعر — بل إن Perceptron Mk1.5 وGemma 4 12B ليسا في الكتالوج نفسه. لا يُوجَّه أي منهما عبر OrcaRouter اليوم: فإدخالات Gemma 4 التي نقدّمها هي نسختا 31B Instruct و26B-A4B، ولا يوجد لـMk1.5 مسار على الإطلاق، لذا فالإرشاد الأمين هو الوصول إلى Mk1.5 عبر واجهة API الخاصة بالبائع على api.perceptron.inc — pip install "perceptron>=0.4.0"، والمفتاح في PERCEPTRON_API_KEY — وإلى Gemma 4 12B إما عبر مضيف طرف ثالث أو عبر تقديم أوزان Apache-2.0 بنفسك.
إن ما تُوجد طبقة التوجيه من أجله حقًا في هذه الحالة هو القرار الذي لم تتخذه بعد. إذا كان المخرَج المُهيكل لدى Mk1.5 هو ما يحتاجه تطبيقك، وكانت نافذة Gemma 4 12B هي ما يحتاجه عبء العمل الآخر لديك، فهذان تكاملان ونطاقا فشل اثنان؛ ووضعهما خلف نقطة نهاية واحدة متوافقة مع OpenAI مع تجاوز الفشل التلقائي يعني أن أي تعثّر لدى المزوّد على أي من الجانبين يتدهور إلى مسار احتياطي بدلًا من مهمة فاشلة، ويمكن لقاعدة توجيه أن ترسل عمل الهندسة وعمل السياق الطويل إلى نموذجين مختلفين دون أن يعرف تطبيقك أيّ نموذج يؤدي أي دور. وعندما يحرّك أحد المورّدين بطاقة أسعاره، فإن الموجّه المارّر يفوتر بسعر القائمة لدى المزوّد دون أي إضافة لكل رمز، فيستقر التغيير في اليوم نفسه بدلًا من دورة الفوترة التالية لديك. كما أن لغة التوجيه هي أيضًا وسيلتك لإعداد مقارنة على مراحل — حصة من حركة المرور الحقيقية لكل نموذج، تُقاس على إطاراتك الخاصة، بدلًا من جدال حول المعايير المرجعية.
أيّ واحد تريده فعلاً؟
اختر Perceptron Mk1.5 إذا كان يجب أن تكون الإجابة قابلة للقراءة آلياً. وإذا كنت تقود شيئاً، أو تسجّل شيئاً يكون فيه الموضع والزمن هما المقصود، فلا يمكن لأي قدر إضافي من نافذة السياق أن يعوّض عن إحداثي مكتوب، وMk1.5 هو النموذج الوحيد في هذا الاقتران الذي ينتج واحداً. أقدِم عليه وأنت منتبه إلى ثلاثة أمور: ميزانية 36,864 رمزاً، والإعداد الافتراضي العالي للاستدلال، وأن كل رقم قدرة مرتبط به هو من المورّد نفسه.
أرخص طريقة لحسم الأمر هي توجيه حصة من حركة المرور الحقيقية إلى كل منهما والقياس على إطاراتك الخاصة؛ كلاهما يعمل خلف نقطة نهاية واحدة متوافقة مع OpenAI على OrcaRouter، وهذا ما يجعل اختبار المقارنة الجانبية سطر إعدادات واحدًا بدلًا من تكامل ثانٍ.
اختر Gemma 4 12B إذا كنت بحاجة إلى استيعاب قدر كبير من المواد، أو إذا كنت بحاجة إلى الأوزان، أو إذا كنت بحاجة إلى تبرير الاختيار لشخص لا يتعامل مع مقاييس أداء المورّد كمسلّمة. فهو يمتلك مؤشرًا مستقلًا، وبطاقة تقييم منشورة، وترخيص Apache 2.0، ونافذة سياق أكبر بسبع مرات — وسيصف مشهدًا بدلًا من قياسه. هذه العبارة الأخيرة هي القرار بأكمله. أحد هذين النموذجين عام يمكنك امتلاكه وتدقيقه؛ والآخر متخصص تستأجره لأنه يُرجع الهندسة، وكون المتخصص يمتلك النافذة الأصغر ولا توجد له نتيجة من طرف ثالث ليس تناقضًا. هكذا تبدو أداة مبنية لتخصص ضيّق من الخارج.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
