
Pokee-Isaac 28B: 10 ملايين توكن من السياق، وبنية معمارية لن يصفها Pokee
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenجديدQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekجديدDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxجديدMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 2237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
- tencentTencent: Hy32026-07-0642الذكاء59البرمجة
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232الذكاء42البرمجة
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226الذكاء39البرمجة
- anthropicAnthropic: Claude Sonnet 52026-06-3055الذكاء72البرمجة
- klingKling: Kling 3.0 Turbo2026-06-1757الذكاء52البرمجة57الرياضيات
يوجد عمود في Pokee-Isaac 28B، أي في مقارنة إطلاقه حيث سجّل خمسة من النماذج الستة 0.0، والملاحظة أسفله أكثر إثارة للاهتمام من الرقم أعلاه. عند طول سياق يبلغ 10 ملايين رمز، يسجّل نموذج Pokee AI الجديد 28B درجة 93.3 في RULER وكل خط أساس قيس ضده — GPT-5.6 Luna، Gemini 3.5 Flash Lite، Claude Haiku 4.5، Nemotron 3 Super 120B، Qwen 3.5 122B — لا يعيد شيئًا قابلًا للاستخدام. وتوضح الملاحظة أن ثلاثة من هؤلاء الخمسة لا يمكن شراؤها بأي طول سياق يتجاوز 262K أصلًا. لذا فالدرجة حقيقية، والغرفة فارغة. وهذان ادعاءان مختلفان، ومعظم التغطية المنشورة منذ ظهور النموذج في 5 أغسطس 2026 خلط بينهما.
ذلك ليس سببًا لرفض ما طرحته Pokee. بل هو سببٌ للدقة في تحديد أيِّ أجزائه مُثبَت، وأيِّها غير متنازَع عليه فحسب، وأيِّها غير موصوف أصلًا. كل ما يلي مستمدٌّ من أربعة مصادر أساسية: صفحة نموذج Pokee-Isaac على وحدة تحكم Pokee الخاصة، ووثائق مطوّري Pokee، وقائمة إعادة البيع للنموذج على NanoGPT، والتصريحات الصادرة عند الإطلاق من Pokee AI والمؤسس Zheqing (Bill) Zhu. كل رقم معياري في هذه المقالة أنتجته Pokee AI. تقول Pokee ذلك صراحةً — تنص وحدة التحكم على أن كل رقم «قيس بواسطة Pokee AI في بيئة واحدة خاضعة للتحكم، ولـ Isaac ولكل خط أساسي على حد سواء، ما لم يُنص على خلاف ذلك» — ولها الفضل في ذلك، فهذا يعني أن خطوط الأساس أُعيد تشغيلها بدلًا من نسخها من إعلانات بائعين آخرين. ويعني أيضًا أنه لا يوجد مختبر مستقل أعاد إنتاج أيٍّ من هذه النتائج، وحتى اليوم لم ينشر أيٌّ منها محاولةً.
ما الذي شحنه Pokee فعليًا
الواجهة العامة للنموذج موثقة بشكل جيد بشكل غير معتاد بالنسبة لإطلاق حديث العهد إلى هذا الحد، لذا يجدر توضيحها قبل الانتقال إلى الأجزاء المتنازع عليها.
• النموذج — Pokee-Isaac 28B، بإصدار v0، مُقدَّم باسم pokee-isaac من api.pokee.ai خلف نقطة نهاية متوافقة.
• الحجم والسياق — 28 مليار معامل مع نافذة إدخال تبلغ 10,000,000 رمزًا؛ يصفه Pokee بأنه «قابل للاستخدام من البداية إلى النهاية، وليس مجرد قابل للعنونة».
• المخرجات — 60,000 توكن، وهو الحد الافتراضي والحد الأقصى.
• الأنماط — نص في المدخلات، ونص في المخرجات. لا يتم دعم الصور والصوت والفيديو كمدخلات، وهذا جدير بالملاحظة بالنظر إلى ما بُني عليه النموذج.
• السعر — 0.15 دولار لكل مليون توكن إدخال و1.00 دولار لكل مليون توكن إخراج، على قائمة Pokee الخاصة.
• الميزات الوكيلية — استدعاء الدوال والمخرجات المهيكلة في مخطط chat-completions القياسي؛ يتم وضع النموذج كوكيل يخطط وينفذ ويراجع بدلاً من كونه نموذج محادثة.
• حدود الطلبات — حد أقصى لحمولة الطلب 45 ميغابايت، مع ضرورة استخدام بث SSE لأي شيء يتجاوز 16 ميغابايت (stream: true بالإضافة إلى Accept: text/event-stream ترويسة).
• حدود المعدل — 500 طلب و20 مليون رمز في الدقيقة، مع 10 طلبات متزامنة على الحسابات المجانية و25 على المدفوعة.
• النشر — مركز بيانات B200، محطات عمل RTX 4090/5090، بطاقات عملاء Intel Arc Pro، معالجات NPU الطرفية (Qualcomm وIntel Panther Lake، مع AMD مدرجة كمعلقة)، وعلى الجهاز، مع ترخيص VPC وترخيص محلي (on-premises) والذي، على حد تعبير Pokee، "لا يغادر أي طلب محيطك."
• حِزم الخدمة — دعم من اليوم الأول في vLLM وSGLang.
• الشركة — Pokee AI، تأسست في 2024 على يد Zheqing (Bill) Zhu، الذي كان سابقًا رئيسًا للتعلم المعزز التطبيقي في Meta؛ جولة تمويل أولي بقيمة 12 مليون دولار بقيادة Point72 Ventures بمشاركة Qualcomm Ventures وSamsung NEXT.
الأوزان مغلقة. وصفت Coverage النموذج بأنه مغلق المصدر "حاليًا"، وهو تحفظ من Pokee نفسه وليس التزامًا، ولا يوجد تاريخ أو ترخيص معلن للإصدار.

البنية التي لن يصفها أحد
تُعزي Pokee نافذة الـ10 ملايين رمز إلى «بنية خاصة لا تعتمد على وحدة فك التشفير فقط». هذه العبارة هي الإفصاح التقني بأكمله. توفر وحدة التحكم رابطًا لتقرير فني بعنوان Pokee-Isaac 28B v0: A 10M-Token Context Efficient Agentic Model، بتاريخ 3 أغسطس 2026؛ ولم نتمكن من الوصول إلى نسخة عامة منه، ولا تذكر المواد الإطلاقية المتاحة آلية الانتباه أو نظام الذاكرة أو وصفة التدريب.
ما قاله Pokee عن النسب أكثر تحديدًا، وهو قول محرج بعض الشيء: بعض أوزان Isaac مضبوطة بدقة انطلاقًا من Qwen3.6-27B بموجب ترخيص Apache-2.0 الخاص بها، بينما تم تدريب أوزان أخرى من الصفر بواسطة Pokee، والنتيجة هي "ليست ضبطًا دقيقًا تقليديًا." إنها جملة حذرة. إنها تعترف بالأساس وتنفي التوصيف في الوقت نفسه.
كما أنه كافٍ لتقييد التخمين، وهو ما بدأ مجتمع أبحاث الذكاء الاصطناعي في فعله فورًا. الباحث الذي ينشر باسم @teortaxesTex وضع مجموعة القيود في يوم الإطلاق — مشتق جزئيًا من Qwen3.6-27B، وليس decoder-only فقط، وسياق 10M، وإجمالي 28B — واقترح مرشحين: "نوعًا من Memory Sparse Attention المُحسَّن" أو "مجرد مشفر مستندات 1B". كلا التخمينين يستحقان الفهم، لأنهما ليسا عابرين.
ابدأ بالحسابات. Qwen3.6-27B هو نموذج كثيف بحجم 27B مع نافذة أصلية تبلغ 262K، وانتباه هجين من نوع gated-delta، ومشفّر رؤية يمكن تخطيه لتشغيل النموذج نصيًا فقط. Isaac بحجم 28B ونصي فقط. إذا أسقطت برج الرؤية الخاص بالنموذج الأساسي وأضفت ما يقارب مليار معامل من شيء آخر، فستهبط بالضبط عند 28B. إن تثبيت مشفّر مستندات أو ذاكرة بحجم ~1B على وحدة فك ترميز بحجم 27B هو القراءة الأكثر اقتصادية لعدد المعاملات التي نشرها Pokee، وهذا يجعل وسم «غير المقتصر على فك الترميز» صحيحًا حرفيًا دون أن يكون ادعاءً جديدًا.
تخمين "انتباه الذاكرة المتناثر" يشير إلى خط بحثي حقيقي وحديث: ورقة MSA (arXiv:2603.23516) تجمع بين الانتباه المتناثر القابل للتوسع مع RoPE على مستوى المستند لتحقيق تعقيد خطي في التدريب والاستدلال، وتضيف ضغطًا لذاكرة التخزين المؤقت KV بالإضافة إلى مخطط "الذاكرة المتوازية"، وتبلغ عن تدهور أقل من 9% من 16K وصولًا إلى 100M رمزًا، مع تشغيل استدلال 100M رمزًا على جهازين A800. هذا هو نفس نمط النتيجة التي يدّعيها Pokee، لكن بمسافة أبعد بمرتبة من حيث الحجم، ومن مجموعة بحثية مختلفة. لا شيء يربط بين الأمرين سوى النمط — MSA ليست من عمل Pokee ولم يستشهد بها Pokee — لكنها تثبت أن تصميم الذاكرة المنفصلة الذي يبلغ هذه الأطوال على أجهزة متواضعة هو أمر منشور ومعقول وليس استحالة تسويقية.
هناك رقم واحد في مواد Pokee الخاصة يدعم قراءة الترميز المنفصل بهدوء. تبلغ إنتاجية التعبئة المسبقة على شريحة B200 واحدة 42,400 رمزًا في الثانية بسياق مليون رمز، و137,200 رمزًا في الثانية عند 10 ملايين. الإنتاجية ترتفع أكثر من ثلاثة أضعاف عندما يصبح السياق أطول بعشر مرات. أمّا وحدة فك الترميز التي تدفع تكلفة الانتباه التربيعي فتفعل العكس. كل ما يستهلك تلك الرموز يصبح أكثر كفاءة لكل رمز كلما أضفت المزيد منها، وهي بصمة مرور ترميز جماعي على المستندات بدلاً من تعبئة مسبقة عادية.
لماذا يهم أيٌّ من هذا لمن يقرر استخدام النموذج: إذا كانت نافذة الـ10M مشفِّرًا للمستندات مع ذاكرة مضغوطة، وليست مخزنًا مؤقتًا للـKV بسعة 10M مدخلات، فإن "السياق" هنا ليس الشيء الذي بُنيت حوله حدوسك. كيفية تصرّفه عند الإلحاق بمحادثة، أو تعديل مستند في منتصف مجموعة مستندات، أو توقّع عمل التخزين المؤقت للبادئات، أمر غير محدد، وتوثيق Pokee لا يذكر أي آلية تخزين مؤقت إطلاقًا. لا يمكنك الاستدلال على هذه السلوكيات من ورقة المواصفات، ولا يمكنك حاليًا الاستدلال عليها من البنية المعمارية أيضًا.
المسطرة عند 10M هي عدد حقيقي في غرفة فارغة
دليل بوكي طويل السياق هو RULER، تم تشغيله عند 256K و512K و1M و2M و4M و10M، مع عشر عينات لكل تكوين. سجل Isaac 96.9 و96.7 و95.0 و95.8 و96.7 و93.3 عبر تلك الأطوال الستة — النموذج الوحيد في المجموعة الذي يعيد نتيجة عند كل واحد.
اللوحة الموجودة أسفل {{1}}1M{{/1}} هي المكان الذي تعيش فيه القراءة الصادقة:
• عند 256K — Isaac 96.9، Nemotron 3 Super 120B 96.3، GPT-5.6 Luna 95.0، Gemini 3.5 Flash Lite 94.5، و0.0 لكل من Claude Haiku 4.5 وQwen 3.5 122B، اللذين تتوقف نوافذهما دون ذلك الطول.
• عند 512K — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.
• عند 1M — Isaac 95.0، Nemotron 91.8، Gemini 3.5 Flash Lite 29.4، وGPT-5.6 Luna 0.0، وقد تم تصنيف الأخيرين كأخطاء تجاوز السياق.
• عند 2M وما بعدها — إسحاق وحده، كل شيء آخر 0.0.
ثلاثة أمور تلي. أولاً، حتى 1M، هامش إسحاق على المنافسين هو نقطة أو نقطتان، وليس جيلًا كاملًا — والخط الأساسي الوحيد الذي يبقى قريبًا، Nemotron 3 Super 120B، هو نموذج 120B أرقامه من 256K إلى 1M هي أرقام NVIDIA المُبلَّغة ذاتيًا، والتي يضعها Pokee علامة عليها ويستبعدها من مقارنة الصفوف بدلاً من تمريرها كمقاييس مُقاسة. لذا فإن أقرب منافس عند تلك الأطوال ليس في الواقع قياسًا مطابقًا، في أي من الاتجاهين.
ثانيًا، يبدو أن واحدًا على الأقل من الفراغات هو أثر من آثار النشر وليس حدًا للنموذج. قام Pokee بتشغيل GPT-5.6 Luna عبر Azure ووصف نافذته بأنها ">272K سياقًا"، مسجلًا خطأ تجاوز السياق عند 1M. النافذة التي وثّقها البائع نفسه لهذا النموذج تبلغ حوالي 1.05M توكن، وهو ما تعرضه صفحة النموذج الخاصة بنا لهذا النموذج. القارئ الذي يأخذ عمود 1M بظاهره سيستنتج أن Luna لا يمكنها معالجة 1M؛ أما الاستنتاج الأكثر دقة فهو أن نشر Azure الذي اختبره Pokee هو الذي لم يتمكن من ذلك.
ثالثًا، RULER عبارة عن مجموعة اصطناعية للاسترجاع والتجميع، وليست معيارًا للاستدلال. Pokee شفاف بشأن تعقيد منهجي هنا أيضًا: يحسب العمودان 256K و512K متوسط جميع تكوينات المهام الثلاثة عشر، لكن استخراج الكلمات الشائعة غير متاح من 1M فصاعدًا، لذا فإن العمودين الطويلين يحسبان متوسط الاثني عشر المتبقية. وبالتالي، فإن 93.3 عند 10M و96.9 عند 256K لا تُسجَّلان على نفس مزيج المهام تمامًا.
اختبار السياق الطويل الأكثر صعوبة يتوقف عند 1M
المعيار الأكثر كشفًا في صفحة Pokee ليس RULER. بل هو MRCR v2، وهي مهمة إحالة مشتركة متعددة الجولات بإبرٍ ثماني، حيث تتوزع عدة أهداف عبر محادثة طويلة ويجب على النموذج استرجاع هدف محدد وتمييزه عن غيره، لذا فإن الاسترجاع الجزئي والتداخل بين الإبر كلاهما يكلفك. على مقياس من 0 إلى 1، عند 1M توكن:
• Pokee-Isaac 28B — 0.500
• Gemini 3.5 Flash Lite — 0.205
• Nemotron 3 Super 120B — 0.067
• GPT-5.6 Luna — 0.050
• Claude Haiku 4.5 و Qwen 3.5 122B — 0.000، لا شيء قابل للاستخدام بهذا الطول
هذه فجوة أوسع بكثير وأكثر مصداقية مما تنتجه RULER، وهي حيث يتحقق عرض النموذج فعليًا. تحصل Luna على 95.0 في اختبار RULER عند 256K، و0.050 في اختبار MRCR عند 1M؛ فإن استدعاء الهدف الواحد وفك التباس الإبر المتعددة ليسا نفس المهارة، والثانية تنهار أولًا. يتدهور Isaac بشكل أكثر أناقة بكثير.
كما أنها أكبر ثغرة إثباتية على الإطلاق في الإطلاق. تم تشغيل MRCR v2 عند 256K و512K و1M — ثم توقف. درجات إسحاق الخاصة هناك هي 0.607 و0.743 و0.500: غير رتيبة، وعند 1M يسترجع نصف الإبر. لا توجد نتيجة منشورة متعددة الإبر عند 2M أو 4M أو 10M من أي شخص، بما في ذلك Pokee. يعتمد ادعاء 10M بالكامل على الاختبار الأسهل من الاختبارين، عند الأطوال التي لم يتم فيها محاولة الاختبار الأصعب. إذا كنت تفكر في هذا النموذج لأنك تريد وضع مجموعة نصوص من 25,000 صفحة في موجه واحد وطرح سؤال يتم تجميع إجابته من أربعة أماكن فيه، فإن هذه القدرة المحددة غير مقاسة عند ذلك الطول المحدد.

في العمل القائم على الوكلاء، إسحاق نظير لونا، وليس أفضل منها
أجرت شركة Pokee أربعة اختبارات معيارية للوكلاء، وهنا تكون صراحة الشركة استثنائية حقًا: صفحتها الخاصة تختصر النتيجة في أن Isaac يتصدر اثنين، ويحتل المركز الثاني في واحد، والثالث في واحد. هذا وصف دقيق، وليس هو الوصف الذي ظهر في تغطية الإطلاق.
• BFCL v4، استدعاء الدوال (تم تقييمه عبر مطابقة AST وانتقال الحالة بدلاً من حكم LLM) — Isaac 70.94 مقابل GPT-5.6 Luna 70.61، مع Claude Haiku 4.5 عند 67.52، وQwen 3.5 122B عند 64.88، وGemini 3.5 Flash Lite عند 64.85، وNemotron 3 Super عند 33.13.
• τ³-bench، متوسط أربعة مجالات (مهام خدمة عملاء متعددة الجولات ضد مستخدم محاكى تتغير متطلباته في منتصف المحادثة) — Isaac 0.662 مقابل Gemini 3.5 Flash Lite 0.631، وQwen 3.5 122B 0.611، وGPT-5.6 Luna 0.527، وNemotron 0.426، وClaude Haiku 4.5 0.408.
• Terminal-Bench 2.1، المجموعة الفرعية النصية فقطGPT-5.6 Luna 69.8% مقابل Isaac 65.1%، ثم تعادل Gemini 3.5 Flash Lite وQwen 3.5 122B عند 46.5%، وClaude Haiku 4.5 34.9%، وNemotron 24.4%.
• MCP-Atlas، تغطية الادعاءات عبر خوادم الأدوات المباشرة — GPT-5.6 Luna 77.90%, Gemini 3.5 Flash Lite 76.67%, Isaac 74.59%, Qwen 3.5 122B 70.24%, Claude Haiku 4.5 56.45%, Nemotron 48.95%.
فارق 0.33 نقطة في BFCL v4 هو تعادل، وصفحة Pokee تقول ذلك بدلاً من أن تسميه فوزًا. عند النظر إلى جميع الاختبارات الأربعة، نجد أن نموذجًا بحجم 28B يتبادل التفوق مع الطبقة السريعة لمورد من الطراز الأول في المهام الوكيلية. بالنسبة لنموذج بحجم 28B، هذه نتيجة قوية. إنها ليست النتيجة التي يوحي بها توصيف "نموذج وكيلي من الطراز الأول" لدى معظم القراء، كما أنها تعني أن سبب اختيار Isaac هو النافذة وحزمة النشر، وليس القدرة الوكيلية.
درجة الأمان هي أفضل تقييم من اللجنة وما زالت غير جيدة
في منصة DTAP، وهي مجموعة اختبارات حقن الأوامر، يسجّل Isaac أدنى معدل نجاح للهجمات بين النماذج المُختبرة بمعدل إجمالي يبلغ 35.6، متقدماً على Claude Haiku 4.5 الذي سجّل 37.9، وGPT-5.6 Luna بـ 50.1، وQwen 3.5 122B بـ 54.0، وNemotron بـ 60.4، وGemini 3.5 Flash Lite بـ 66.3. يقلّ الفرق بين المعدلين المباشر وغير المباشر عن نقطة واحدة، ما يعني أن المتانة متكافئة على الأقل عبر كلا المسارين.
ثلاثة تحفظات، وكلها من تقارير Pokee نفسها وليس من النقاد. أُجريت القياسات غير المباشرة مع تعطيل الحراسات. لم يُطلق رفض صريح إلا على 1.5% فقط من المهام الخبيثة، وهو ما تصفه Pokee بأن معظم الدفاع الحالي «عرضي وليس مرفوضًا» — أي أن النموذج لا يتعرف على الهجمات ويرفضها بقدر ما يفشل في أن يُوجَّه بها بشكل مفيد. وبالمقارنة مع قائمة ترتيب أوسع تضم 16 نظامًا بدلًا من هذه المجموعة المكونة من ستة نماذج، يحتل Isaac المرتبة الخامسة في الهجمات المباشرة، والسادسة في غير المباشرة، والتاسعة في القدرة: فهو في منتصف الميدان، وليس في الصدارة.
هناك أيضًا تكلفة للسلامة. معدل النجاح غير الضار لـ Isaac هو 82.5، وهو أقل من 85.1 لنموذج GPT-5.6 Luna — إذ يرفض أو يخفق قليلًا في قدر أكبر من العمل المشروع مقارنة بالنموذج الذي يتفوق عليه في صد الهجمات. ويعني 35.6 أن نحو محاولة حقن واحدة من كل ثلاث لا تزال تنجح. وبالنسبة لنموذج يقوم مبدأه بالكامل على قراءة عشرة ملايين رمز من مستندات لم تكتبها أنت، فهذا هو الرقم الذي يجب تصميم الحواجز الواقية حوله، لا الرقم الذي يبعث على الطمأنينة. أما DTAP بحد ذاته فيستحق الإشارة: فعلى عكس RULER وBFCL وτ³-bench، فإنه ليس لوحة تصنيف عامة راسخة، ولم نعثر على توثيق مستقل لهذه المجموعة.
كم تبلغ تكلفة استدعاء بعشرة ملايين رمز، وكم من الوقت تنتظر
عشرة ملايين توكن تعادل تقريبًا 7.5 مليون كلمة، أو حوالي 25,000 صفحة. بسعر Pokee البالغ 0.15 دولار لكل مليون، ملء النافذة مرة واحدة يكلف 1.50 دولار. أضف إجابة بطول أقصى يبلغ 60,000 توكن بسعر 1.00 دولار لكل مليون، وستصل تكلفة الاستدعاء الأقصى الواحد إلى حوالي 1.56 دولار. هذا رخيص حقًا بالنسبة لحجم النص المعني، وهو أقوى حجة بسيطة لصالح النموذج.
{{1}}الوقت هو الثمن الحقيقي.{{/1}} {{2}}على B200 واحد، تبلغ Pokee عن 72.9 ثانية حتى أول رمز عند 10M — وهو بالضبط ناتج قسمة 10,000,000 على رقم التعبئة المسبقة البالغ 137,200 رمز/ثانية، لذا فهو رقم عتاد المعيار وليس زمن استجابة API مُقاسًا.{{/2}} {{3}}وثائق مطوّري Pokee الخاصة تروي قصة مختلفة للمطورين: اسمح بمهلة زمنية لا تقل عن عشر دقائق للعميل عند معالجة طلبات بملايين الرموز، لأن الطلب الكبير قد يستغرق "حوالي سبع دقائق عند 10 ملايين رمز."{{/3}} {{4}}وهذه فجوة تبلغ ستة أضعاف تقريبًا بين شريحة الإنتاجية ودليل التكامل.{{/4}} {{5}}كلاهما رقمان من Pokee؛ الرقم الموجود في الوثائق هو الذي يجب أن يعتمد عليه إعداد المهلة الزمنية لديك.{{/5}}
فك الترميز ثابت عند حوالي 335 رمزًا في الثانية بغض النظر عن حجم السياق المقيم، وهذا خبر جيد من الناحية المعمارية وخبر محرج عمليًا: إخراج كامل يبلغ 60,000 رمز يستغرق حوالي ثلاث دقائق فوق مرحلة التعبئة المسبقة (prefill). أما على الأجهزة الاستهلاكية فتتغير الصورة مجددًا — على Intel Arc Pro B70، يبلّغ Pokee عن سرعة 1,087–1,500 رمزًا في الثانية في التعبئة المسبقة (أي 3.6–5 أضعاف llama.cpp القياسي) و58.8 رمزًا في الثانية في فك الترميز. هذه أرقام محترمة بالنسبة لوحدة معالجة رسوميات موجهة للعملاء، لكنها ليست أرقامًا بمقياس 10 ملايين رمز.
ينشأ حدّان عمليّان من حجم الإدخال نفسه. عشرة ملايين توكن من الإنجليزية يعادل تقريبًا 38 MiB من النص، وهو ما يقع تحت سقف حجم جسم الطلب البالغ 45 MiB لكنه يتجاوز بكثير عتبة 16 MiB، لذا فإن كل استدعاء بكامل النافذة فعليًا يجب أن يكون مُدفَّقًا — لا يوجد مسار غير مُدفَّق إلى الميزة الرئيسية. ومع عدم وجود تخزين مؤقت موثّق للاستدعاءات على واجهة Pokee البرمجية، فإن كل إعادة استعلام عن نفس المجموعة النصية تكلف 1.50 دولارًا إضافيًا وتستغرق عدة دقائق إضافية في التعبئة المسبقة. قائمة البائعين المُعيدين على NanoGPT تنشر سعر قراءة من التخزين المؤقت بمقدار 0.079 دولار لكل مليون، وإذا كان ذلك ينطبق على Isaac فستكلف إعادة القراءة المخزّنة مؤقتًا حوالي 0.79 دولار — أي نصف السعر تقريبًا، وليس خصمًا بمقدار عشرة أضعاف كما يوحي التخزين المؤقت للاستدعاءات في أماكن أخرى.
تصحيح واحد لمقارنة الأسعار، لأنه يغيّر العنوان الرئيسي. تضع Pokee سعر GPT-5.6 Luna عند 0.40 دولار/1.80 دولار لكل مليون، بحسب التسعير من Azure. سعر القائمة الرسمي من البائع نفسه لـ Luna بعد تخفيض 31 يوليو 2026 هو 0.20 دولار/1.20 دولار، وهو ما تعرضه صفحة النموذج لدينا له، لأن OrcaRouter يمرّر أسعار قائمة المزوّدين بهامش ربح 0% بدلاً من إعادة البيع بهامش ربح. وبمقارنة الرقم الصحيح، فإن Isaac أرخص بنسبة 25% على المدخلات و17% على المخرجات من الطبقة الحدودية السريعة — ما يزال أرخص، لكنه تفوّق أضيق بكثير مما يوحي به الجدول، وأرخص سعر مخرجات إجمالي في الجدول يعود إلى Nemotron 3 Super بسعر 0.65 دولار. الميزة السعرية لـ Isaac حقيقية؛ لكنها فقط ليست الجزء اللافت في هذا الإطلاق.

الجزء الجديد فعلياً
أزل تأطير المعايير ويبقى شيء غير مألوف. نموذج 28B بسياق طويل جدًا يعمل داخل VPC، وعلى محطة عمل RTX 4090، وعلى بطاقة Intel Arc Pro، وعلى سيليكون محمول من فئة NPU، مع دعم في اليوم الأول لـ vLLM وSGLang وترخيص للتشغيل المحلي — هذه التركيبة شبه مستحيلة التوفر في مكان آخر. كما تدّعي Pokee كفاءة تبلغ نحو 5 أضعاف لذاكرة KV-cache مقارنة بالتنفيذات القياسية، وهو رقم من جهة البائع دون إعادة إنتاج، لكنه النوع من الأرقام التي يجب أن تكون صحيحة لكي تصمد قصة النشر.
العميل المستهدف هنا ليس شخصًا يتسوق لشراء وكيل أفضل. بل هو شخص يملك مجموعة نصوص ضخمة وحساسة وشبه ثابتة — مجموعات عقود، وملفات قضايا، وقاعدة أكواد ضخمة متجانسة، وأشهرًا من السجلات — لا يمكنها قانونيًا أو سياسيًا تجاوز حدود المؤسسة، وكان سيبني نظام استرجاع للتغلب على قيود نافذة السياق البالغة 200 ألف رمز. وفي مقابل هذا البديل، لا يتمثل العرض في أنه "أرخص من نظام RAG". فتحويل أكثر من 25,000 صفحة إلى تمثيلات رقمية واسترجاعها يكلف سنتات لكل استعلام، وسيظل كذلك دائمًا. العرض هو أنه لا توجد استراتيجية تقسيم يجب ضبطها، ولا استدعاء استرجاع يمكن أن تفقده، ولا نظام ثانٍ يجب أن يبقى متزامنًا مع النظام الأول. ما إذا كانت هذه المقايضة تستحق 1.50 دولار وعدة دقائق لكل استعلام يعتمد كليًا على عدد مرات استعلامك.
من يجب أن يجربها الآن، ومن يجب أن ينتظر؟
جرّبه الآن إذا كنت تختبر نموذجًا أوليًا على مجموعة نصوص ضمن نطاق 1M–4M، حيث تكون أرقام Isaac في أقوى حالاتها وتكون البدائل شحيحة حقًا، أو إذا كان النشر المحلي بسعة 28B هو المتطلب الذي كان يعيقك. الطلبات العشرة المتزامنة في الباقة المجانية كافية لمعرفة ما إذا كان النموذج يقرأ مستنداتك بالطريقة التي تحتاجها.
انتظر إذا كنت تحتاج إلى الرقم 10M تحديداً والأسئلة التي تطرحها متعددة الخطوات، لأن هذا المزيج بالتحديد لم يقسه أحد. انتظر إذا كنت تحتاج إلى مدخلات متعددة الوسائط، وهو ما لا يقبله النموذج. انتظر إذا كان زمن الاستجابة مهمًا، لأن استدعاء النافذة الكاملة يستغرق دقائق وليس ثوانٍ. وازن بين مخاطر الاعتماد الواضحة: هذا نموذج v0 بأوزان مغلقة، من شركة حصلت على تمويل أولي بقيمة 12 مليون دولار، وهو النموذج الوحيد في العالم الذي يقدم القدرة التي يبيعها. لا يوجد مزود ثانٍ يمكن التحويل إليه إذا اختفى.
هذه النقطة الأخيرة هي السبب العملي لإبقاء المقارنة نزيهة. Pokee-Isaac 28B ليس متاحًا على OrcaRouter اليوم — إذا أردته، فهو موجود عبر واجهة برمجة تطبيقات Pokee الخاصة أو عبر أحد الموزعين. لكن ثلاثة من خطوط الأساس الخمسة التي يقيس نفسه مقابلها، وهي GPT-5.6 Luna وGemini 3.5 Flash Lite وClaude Haiku 4.5، متاحة على مفتاح OrcaRouter واحد بسعر القائمة من المزود، مما يجعل التجربة المفيدة رخيصة الإعداد: شغّل مهمة السياق الطويل الفعلية الخاصة بك ضد هذه الثلاثة عند الأطوال التي تدعمها، وانظر ما إذا كان مجموع نصوصك يحتاج حقًا إلى عشرة ملايين توكن أم أنه يحتاج إلى 400,000 مع مطالبة أفضل. إذا كان يحتاج إلى عشرة ملايين، فقد تعلمت شيئًا يستحق 1.50 دولارًا للمكالمة الواحدة. إذا لم يكن كذلك، فقد تجنبت بناء مسار إنتاج يعتمد على إصدار v0 من مصدر واحد.
ثلاثة أسئلة تستحق الإجابة
هل Pokee-Isaac 28B مجرد ضبط دقيق؟
ليس بأي استخدام عادي للعبارة، وإن لم يكن مستقلًا عن ذلك الأساس أيضًا. موقف Pokee هو أن بعض الأوزان خضعت لضبط دقيق انطلاقًا من Qwen3.6-27B بموجب ترخيص Apache-2.0 بينما دُربت أخرى من الصفر، وأن البنية ليست decoder-only فقط. كلا الشقّين متسقان مع عدد المعاملات: Qwen3.6-27B نموذج كثيف بـ27 مليار معامل مع مُرمِّز رؤية قابل للتخطي، بينما Isaac بـ28 مليار معامل ونصي فقط، لذا فقد حل نحو مليار معامل من آليات جديدة محل برج الرؤية. لم يُكشف عن ماهية هذه الآليات، وحتى يُكشف عنها، فإن "ليس ضبطًا دقيقًا تقليديًا" ادعاء يستند إلى قول Pokee لا إلى أي شيء قابل للتحقق. ترخيص Apache-2.0 على الأساس يجعل الاشتقاق قانونيًا؛ لكنه لا يجعل الإصدار المغلق من النتيجة أمرًا غير معتاد، وهو ما يجدر ملاحظته أساسًا لأن سلالة بهذه الخصوصية نادرًا ما يُتطوع بذكرها.
هل يمكنه حقًا تشغيل 10M توكن على RTX 4090؟
الادعاء المتعلق ببطاقة رسومية واحدة والادعاء المتعلق بـ10M ينبعان من نفس الإطلاق، لكن ليس من نفس القياس. كل رقم إنتاجية تنشره Pokee عند سياق 10M — 137,200 رمزًا في الثانية للملء المسبق، و72.9 ثانية للوقت حتى أول رمز — يكون على بطاقة B200 واحدة. أرقام RTX 4090 وArc Pro حقيقية ولكنها مذكورة على نطاق أصغر بكثير؛ أرقام Arc Pro B70 هي 1,087–1,500 رمزًا في الثانية للملء المسبق، وهو ما سيجعل الملء المسبق لـ10M رمزًا يستغرق ساعات. من الأفضل فهم عبارة "قابلة للنشر على بطاقة رسومية واحدة بدءًا من RTX 4090" على أنها ادعاء بأن الأوزان تتسع وأن النموذج يعمل بشكل مفيد، وليس أن طول السياق الرئيسي عملي على تلك البطاقة.
هل يجب أن أستبدل خط أنابيب RAG به؟
ليس بناءً على هذا الدليل، مع استثناء واحد. يكون مبرر استبدال الاسترجاع أقوى ما يكون عندما تكون استعلاماتك متعددة القفزات — وهذا بالضبط نمط الفشل الذي يعالجه الاسترجاع المجزأ بشكل سيئ — والأداء متعدد القفزات بعد 1M رمز هو الشيء الذي لم يقسه Pokee. يتوقف MRCR v2 عند 1M، حيث يستعيد Isaac نصف الإبر. الاستثناء هو مجموعة نصوص تتسع بشكل مريح ضمن 1M–2M رمزًا، حيث تكون الأرقام المقاسة لـ Isaac قوية، والانتظار يكون عشرات الثواني بدلاً من الدقائق، وإزالة طبقة الاسترجاع تزيل تعقيدًا تشغيليًا حقيقيًا. وفوق هذا الحد، تعامل مع النافذة كوسيلة لتجنب بناء استرجاع لنموذج أولي، وليس كسبب لحذف طبقة استرجاع تعمل.
ما الذي سيحسم الأمر؟
أربعة أشياء، لا يتطلب أيٌّ منها الثقة بأي شخص. تشغيل مستقل لـ RULER أو MRCR عند 2M أو أكثر، بواسطة أي شخص، على واجهة برمجة التطبيقات العامة. نتيجة MRCR v2 من Pokee بالأطوال التي يعلن عنها بالفعل. تقرير فني يمكن الوصول إليه يسمّي الآلية، وعندها تتوقف مسألة المُرمِّز عن كونها حسابية وتصبح حقيقة. وإصدار للأوزان، وهو ما تلمح إليه عبارة «مغلق المصدر حاليًا» دون أن تعد به.
حتى ذلك الحين، الملخص العادل أضيق من الإطلاق وأكثر إثارة للاهتمام من الشكوك. لقد أصدرت Pokee AI نموذجًا بحجم 28B يحافظ بشكل قابل للقياس على استرجاع السياق الطويل لمدى أبعد من أي شيء يمكنك شراؤه حاليًا، ويتعادل مع الطبقة السريعة الرائدة في العمل القائم على الوكلاء، وهو الأكثر أمانًا ضمن تقييمه الخاص وفي منتصف المجال مقارنة بتقييم أوسع، ويعمل في بيئات لا يعمل فيها أي شيء بمثل قدراته. كما اختارت نشر الأرقام الوحيدة الموجودة حول القدرة التي لا يقدمها أي شخص آخر، مع عدم الكشف عن كيفية عملها. كلاهما خيارات يحق لشركة ناشئة اتخاذها. لكن لا شيء منهما بديلاً عن قيام شخص من خارج الشركة بتشغيل الاختبار.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
