
بيرسبترون Mk1.5 يجلب مخرجات مكانية منظمة إلى الوكلاء المجسدين — ويُحيل إسحاق على التقاعد في اليوم نفسه
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 578 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 182 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
أصبح Perceptron Mk1.5 متاحًا للعموم الآن، والشيء المثير للاهتمام فيه ليس جدول القياسات المعيارية — بل ما يعود في جسم الاستجابة. اسأل نموذجًا عاديًا للرؤية واللغة عن مكان الرافعة الشوكية فتحصل على جملة. اسأل Perceptron Mk1.5 عن إطار فيديو، وإلى جانب نصه، يمكنك الحصول على هندسة قابلة للتحليل آليًا: نقطة، أو مربع إحاطة، أو مضلع، أو مقطع، أو <track> عنصر يحمل ملاحظات مكانية موقوتة عبر الملف بأكمله. هذا هو الفرق بين نموذج يصف مشهدًا ونموذج يمكن لوحدة تحكم روبوت استهلاكه دون مرحلة تحليل ثانية. إنه الخلف المباشر لـ Perceptron Mk1، أول إصدار للشركة في مايو 2026، وتم إطلاقه في 25 سبتمبر إلى جانب إيقاف نقاط التفتيش Isaac 0.1 و0.2 التي سبقته.
ما الذي يُرجعه Mk1.5 فعليًا
النموذج هو نظام استدلال مُجسَّد للوكلاء الفيزيائيين. من جهة الإدخال، يستقبل النصوص والصور والفيديو والصوت. ومن جهة الإخراج، يُنتج نصًا بالإضافة إلى تعليقات توضيحية منظمة اختيارية: نقاط، ومربعات، ومضلعات، ومقاطع، ومسارات. ومخرجات التتبع هي الجزء الذي يستحق التوقف عنده. تصف وثائق Perceptron كتلة <track> تحمل مدخلاتها كلاً من ملاحظة مكانية والطابع الزمني الذي تنتمي إليه، بحيث يعود مقطع مدته 60 ثانية كسلسلة من مواضع الكائنات بمرور الوقت بدلاً من تخمين متوسط واحد حول المشهد.
تفصيل ثانٍ يهم أي شخص يربط هذا في خط أنابيب يحتوي على أكثر من أصل واحد: يدعم Mk1.5 حقل asset_idx، بحيث يمكن لطلب واحد الإشارة إلى عدة صور أو مقاطع فيديو والتعامل معها كل على حدة. إذا كانت مهمتك مقارنة صورة مرجعية بإطار كاميرا مباشر — حلقة فحص العيوب، خطوة التحقق من التجميع — فإن ذلك يندرج في استدعاء واحد، لا اثنين.
يدعم النموذج أيضًا الاستجابات المقيّدة، سواءً عبر JSON Schema أو regex، وهكذا تحوّل «قريب بما يكفي» إلى مخطط يمكن لكودك اللاحق التحقق من صحته. استدعاء الدوال مدعوم في إكمالات الدردشة، وخادم MCP المستضاف من Perceptron يُعيّن الآن افتراضيًا إلى perceptron-mk1.5؛ وتمرير model: "perceptron-mk1" صراحةً هو ما يثبّت الافتراضي السابق.
ورقة المواصفات، وكم تكلّف

تجدر الإشارة إلى هذه الأرقام بوضوح لأنها متواضعة في مواضع قد لا يتوقعها القارئ. نافذة السياق هي 36,864 توكنًا — ليس مليونًا، ولا 256 ألفًا. الحد الأقصى للإخراج هو 8,192 توكنًا. هذا ليس نموذجًا تُسلّمه فيديو مدته ساعتان ودليلًا من 300 صفحة. إنه بحجم يناسب مهمة إدراكية ضيقة النطاق مع إجابة مُهيكلة.
Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.
• السياق — 36,864 رمزًا، مقابل نافذة 32K التي شُحن بها Perceptron Mk1
• الحد الأقصى للإخراج — 8,192 رمزًا
• الإدخال — نص، وصور، وفيديو، وصوت (WAV، MP3، FLAC)
• الإدخال المخزّن مؤقتًا — $0.0375/M، ربع سعر الإدخال القياسي البالغ $0.15/M
• الإخراج — $1.50/M
• التحكم في الاستدلال — reasoning_effort عند high أو medium أو low أو minimal أو none، مع القيمة الافتراضية high
هذا الصف الأخير تغيير كاسر متنكّر. يستبدل Mk1.5 القديم vision_config.enable_thinking المنطقي بـreasoning_effort، لذا فإن أي طلب بنيته على النموذج السابق يحتاج إلى تعديل بدلًا من مجرد إعادة توجيهه. القيمة الافتراضية لـhigh تستحق الملاحظة لسبب مختلف: إذا لم تضبط الحقل، فأنت تشتري أغلى مسار تفكير في كل نداء.
الصوت، والفيديو الذي يحمل مساره الصوتي الخاص به
إدخال الصوت جديد تمامًا هنا. يقبل Perceptron ذلك بثلاث طرق — عبر input_audio المضمّن، أو audio_url، أو audio_file_id — بحد أقصى 16,384 رمزًا صوتيًا لكل عنصر. وتقدّر الوثائق ذلك بنحو 21.8 دقيقة من الكلام بمعدل نحو 750 رمزًا في الدقيقة، وهي ميزانية معقولة لتسجيل تسليم وردية أو سجل صيانة.
الأكثر غرابة هو مسار الفيديو. افتراضيًا، يقرأ Mk1.5 الفيديو كإطارات ويتجاهل المسار الصوتي. ضبط vision_config.enable_audio_in_video: true يعيد تشغيل المسار الصوتي، وهو الإعداد الذي تريده لأي شيء يكون فيه الضجيج هو الإشارة — آلة تبدو خاطئة صوتيًا قبل أن تبدو خاطئة بصريًا، أو تعليمة منطوقة تصدر خارج الكاميرا، أو إنذار في خلفية جولة ميدانية. إنه معطّل افتراضيًا، لذا سيُحلّل فيديو به عطل مسموع بصمت كفيلم صامت ما لم تطلب خلاف ذلك.
الصورة المرجعية، مع جعل المصادر صريحة

كل رقم أدناه مستمَد من إعلان Perceptron نفسه، وقد قاسه Perceptron. لا يوجد أي مُدخل في مؤشر Artificial Analysis ولا أي درجة Arena سواء لـ Mk1.5 أو لسلفه، لذا لا يوجد أي رقم من طرف ثالث في هذه المقارنة يمكن مقارنته بها. اعتبر هذه الأرقام ادعاءً من بائع حول منتجه، وليست نتيجة محايدة.
في تتبع اليد من منظور الشخص الأول، الفجوة واسعة ومحددة: يسجل Mk1.5 نتيجة 0.9433 على hand_boxمقابل 0.4467 لـ Gemini 3.1 Pro و0.6179 لأفضل Gemini في تشغيل Perceptron، الذي يحدده الإعلان بأنه Gemini 3.8 Flash. وهذان هما +111% و+53% اللذان يتصدر بهما منشور الإطلاق، وهو أقوى رقم منفرد في الإصدار.
في ما يتعلق بالفهم العام للفيديو من منظور الشخص الأول، فإن الصورة أقرب بكثير. يُبلِغ Perceptron عن نتيجة EgoSchema عند 80.40 لـ Mk1.5 مقابل 81.20 لـ Gemini 3.8 Flash — بخسارة 0.80 نقطة — بينما يدّعي تفوقًا بنسبة 12% على المجموعة الفرعية EgoSchema-hard عند 63.75. النموذج الذي يفوز بشكل حاسم في الهندسة الدقيقة لليد ويخسر بفارق ضئيل في معيار الفهم الواسع هو نوع محدد من الأدوات، ويُسوَّق بوصفه كذلك.
تسجّل تجزئة الكائنات في الفيديو 0.647 في center-F1 و0.628 في point-HOTA على Molmo2-Track. يقول Perceptron إن ذلك يتقدم على Molmo2-Track وRef-DAVIS17 وReasonVOS، بينما يتخلف عن MolmoPoint-8B على MeViS valid_u. مقابل سلسلة Qwen البصرية، تستحق مقارنة التتبع قراءة متأنية: يدرج الإعلان Qwen3-VL-8B عند 0.180 في center-F1 من ورقته، وQwen3.5-27B عند 0.530 و0.476 — نقاط حفظ مختلفة، وإعدادات تقييم مختلفة، ورقم من ورقة بحثية يقع في العمود نفسه الذي توجد فيه أرقام مقيسة. هذا ليس صفًا متكافئًا للمقارنة.
تُبلَّغ نتائج الصوت على النحو التالي: DailyOmni 74.67، وWorldSense 50.32، وOmniBench 51.05، وAVHBench 80.56، دون إرفاق صف مقارنة. وفي البحث متعدد الوسائط مع تمكين الأدوات، يسجّل Mk1.5 نتيجة 56.0 على LiveVQA-W استنادًا إلى تصويت الأغلبية بأربع عينات، مقابل 53.2 لـ Gemini 3.8 Flash مع الاستناد إلى بحث Google، و51.0 لـ GPT-6 sol مع بحث OpenAI على الويب، و33.2 لـ GPT-5.2 عبر الإنترنت. كما تدّعي Perceptron تحقيق زيادة قدرها 36.1 نقطة على MMSearch بمجرد تشغيل الأدوات. يُعد التصويت بالأغلبية على أربع عينات تقنية مشروعة، وهو يجعل النتيجة تبدو أفضل مقارنةً بتمريرة جشعة واحدة، لذا فإن 56.0 و53.2 لم تُقاسا بالطريقة نفسها.
زمن الاستجابة، وكيف تم قياس 4.7×
الادعاء بالسرعة هو الأكثر عرضة لأن يُقتبس دون سياقه، لذا إليك السياق. يذكر Perceptron سرعة أعلى تصل إلى 4.7× من البداية إلى النهاية، استنادًا إلى وسيط ثلاث تشغيلات على وحدة H100 واحدة، باستخدام مطالبات LMArena محدودة بإجابات من 256 توكن، إضافة إلى MIA-Bench وVideo-MME مع Perception Test. نسبة 4.7× تخص حالة الدردشة: من 5.2 ثانية إلى 1.1. أما الإجابة عن أسئلة الصور فتنتقل من 1.7 ثانية إلى 0.51، أي نحو 3.3×. ومعالجة فيديو مدته 60 ثانية، ثمانية في المرة، تنتقل من 19 ثانية إلى 9.1، أي نحو 2.1×.
إذن، المضاعف الرئيسي هو الأفضل بين الثلاثة، وليس الحالة النموذجية. على وحدة H100 واحدة، ومع الإجابات القصيرة، يكون مسار الدردشة أسرع فعلًا بمقدار 4.7×. أما في عبء عمل الفيديو الذي قد يشغّله وكيل مُجسَّد فعليًا، فهو أقرب إلى 2×. كلا الرقمين جيدان؛ واحد فقط منهما هو الرقم الرئيسي.
إسحاق 0.1 و0.2 تم إيقافهما في نفس اليوم

يتضمّن سجل تغييرات Mk1.5 مدخلًا ثانيًا بتاريخ 25 سبتمبر، وهو المدخل الذي يهمّ حقًا أي شخص يعمل بالفعل في الإنتاج. إن isaac-0.1، isaac-0.2-1b وisaac-0.2-2b-preview معرّفات الطرز هذه قد أُلغيت من واجهة Perceptron API. ولم تعد تظهر في GET /v1/models، كما اختفت من خادم MCP المستضاف، وأصبحت الطلبات التي تذكرها الآن تفشل مع HTTP 404 model_not_found.
ثمة تغيير سلوكي ثانٍ مدفون في الإدخال نفسه سيعضّ الشيفرة التي لم تذكر نماذج Isaac إطلاقًا: صارت معرّفات النماذج غير المعروفة تُرجع 404 بدلًا من 400 السابق. أي منطق إعادة محاولة أو فرع خطأ أو قاعدة تنبيه كانت تُطابق على 400 لاسم نموذج غير صالح باتت الآن لا تُطابق شيئًا. مسار الترحيل الذي يقدمه Perceptron هو perceptron-mk1.5.
إن إحالة عائلة نماذج إلى التقاعد في اليوم نفسه الذي تطلق فيه بديلها هي قصة ترحيل نظيفة وقاسية في الوقت نفسه. إذا كنت قد ثبّت Isaac لأنه كان يعمل، فلديك موعد نهائي قد فات بالفعل.
أين يمكن تشغيله، وكيف يمكن تجربته دون المراهنة عليه
التوفر يتم عبر واجهة برمجة التطبيقات الخاصة بالمورّد وعدة منصات طرف ثالث. لا يقوم OrcaRouter حاليًا بتوجيه Perceptron Mk1.5 — النموذج ليس في كتالوجنا — لذا فإن الإرشاد الصادق هو التوجه مباشرة إلى api.perceptron.inc للحصول عليه، وهذا بالضبط ما الغرض من SDK ومتغير البيئة PERCEPTRON_API_KEY.
ما يستحق القول على أي حال، لأنه ينطبق على القرار لا على النموذج: نقطة تفتيش عمرها يومان على نافذة سياق من 36,864 رمزًا مع إعداد افتراضي للاستدلال مضبوط على high هو تحديدًا الملف التعريفي لشيء لا ينبغي وضعه على مسار الإنتاج دون رؤيته أولًا. شغّله على إطاراتك الخاصة أولًا، وقِس أمرين تحديدًا — ما إذا كانت المخرجات المهيكلة تصمد أمام حالاتك الحدّية الفعلية، وما الذي يكلّفه لك reasoning_effort: "high" لكل استدعاء مقابل خفضه إلى medium أو low. الثاني تغيير من سطر واحد له تأثير مباشر على فاتورتك، وهو أرخص تجربة في هذا الإصدار.
النمط الأوسع الذي يندرج هذا ضمنه — نماذج الإدراك التي تُعيد هندسة بدلاً من صفات — هو أحد الأنماط التي بُني OrcaRouter لاستيعابها. واجهة API واحدة تغطي أكثر من 200 نموذج مع تمرير أسعار قوائم المزوّدين بهامش 0%، لذا فإن أي تغيير في سعر أي منها من جانب المزوّد يصبح ساريًا لدينا في اليوم نفسه، والتحويل التلقائي عند الفشل يعني أن استدعاء الإدراك يمكن أن يتحول إلى نموذج ثانٍ بدلاً من فشل الطلب. إذا كان Mk1.5 هو الشيء الوحيد الذي يجتاز معيار الدقة لديك، فلن يفيدك أي من ذلك اليوم. وإذا كان أحد المرشحين بين عدة مرشحين، فإن إجراء المقارنة عبر نقطة نهاية واحدة أرخص من ربط SDK ثانٍ لمعرفة ذلك.
ما هو هذا الإصدار وما ليس كذلك
Perceptron Mk1.5 أداة مركّزة تحمل مجموعة حدود تتسم بصراحة غير معتادة. فهي تُعيد إحداثيات، وليس مجرد وصف. وتقرأ الصوت، بما في ذلك المسار الصوتي لفيديو إذا فعّلته. وهي سريعة في إجابات الدردشة القصيرة. كما أنها نموذج بـ36,864 رمزًا مع سقف إخراج يبلغ 8,192 رمزًا، ومسعّرة عند 0.15 دولار و1.50 دولار، ومقيّمة بالكامل من بائعها نفسه، وتبيعها شركة أحالت الجيل السابق إلى التقاعد في نفس مُدخل سجل التغييرات.
إذا كانت مشكلتك هي «العثور على اليد، وتتبّعها عبر المقطع، وإخباري أين ذهبت ومتى»، فإن رقم مربع اليد هو ما ينبغي اختباره. وإذا كانت مشكلتك هي الفهم الواسع للفيديو مقابل نموذج عام رائد، فإن سطر EgoSchema — 80.40 مقابل 81.20 — يشير إلى أنك تشتري متخصصًا بتكافؤ تقريبي، ولا بد أن تأتي حجة التبديل من المخرجات المنظمة وزمن الاستجابة، لا من الدقة.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
