Pokee-Isaac 28B-1
Engineering & Research

Pokee-Isaac 28B: 10 מיליון טוקנים של קונטקסט, וארכיטקטורה ש-Pokee לא יתאר

מחבר

Jim Song

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

יש עמודה בהשוואת ההשקה של Pokee-Isaac 28B שבה חמישה מתוך ששת המודלים מקבלים ציון 0.0, וההערה מתחתיה מעניינת יותר מהמספר שמעליה. באורך הקשר של עשרה מיליון טוקנים, המודל החדש 28B של Pokee AI מקבל ציון 93.3 ב-RULER, וכל קו בסיס שנמדד מולו — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super 120B, Qwen 3.5 122B — לא מחזיר שום דבר שמיש. ההערה מסבירה ששלושה מתוך חמשת אלה אי אפשר לרכוש בכל אורך הקשר מעל 262K מלכתחילה. אז הציון אמיתי, והחדר ריק. אלה שתי טענות שונות, ורוב הסיקור שפורסם מאז שהמודל הופיע ב-5 באוגוסט 2026 ערבב ביניהן.

זו לא סיבה לבטל את מה ש-Pokee שחררה. זו סיבה לדייק אילו חלקים ממנו מוכחים, אילו רק אינם שנויים במחלוקת, ואילו פשוט אינם מתוארים. כל מה שלהלן מגיע מארבעה מקורות ראשוניים: עמוד המודל Pokee-Isaac בקונסולה של Pokee עצמה, תיעוד המפתחים של Pokee, רישום המשווק של המודל ב-NanoGPT, והצהרות ההשקה מטעם Pokee AI ומטעם המייסד Zheqing (Bill) Zhu. כל נתון אמת מידה במאמר זה הופק על ידי Pokee AI. Pokee מצהירה זאת במפורש — הקונסולה מציינת שכל נתון "נמדד על ידי Pokee AI בסביבה מבוקרת אחת, עבור Isaac וכל קו בסיס כאחד, אלא אם צוין אחרת" — ולזכותה ייאמר שמשמעות הדבר היא שקווי הבסיס הופעלו מחדש ולא הועתקו מהכרזות ספקים אחרים. זה גם אומר שאף מעבדה עצמאית לא שחזרה אף אחד מהנתונים, ונכון להיום אף אחד לא פרסם ניסיון שכזה.

מה Pokee שלח בפועל

המשטח הציבורי של המודל מתועד היטב במידה יוצאת דופן עבור השקה כה צעירה, ולכן כדאי לפרוס אותו לפני שנגיע לחלקים השנויים במחלוקת.

דגם — Pokee-Isaac 28B, בגרסה v0, מוגש כ-pokee-isaac מ-api.pokee.ai באמצעות נקודת קצה תואמת.

גודל והקשר — 28 מיליארד פרמטרים מול חלון קלט של 10,000,000 אסימונים; Pokee מתאר אותו כ"שמיש מקצה לקצה, לא רק נגיש."

פלט — 60,000 טוקנים, שזה גם ברירת המחדל וגם המגבלה המקסימלית.

מודאליות — טקסט פנימה, טקסט החוצה. קלטי תמונה, אודיו ווידאו אינם נתמכים, דבר שראוי לציון לאור מה שהמודל בנוי ממנו.

מחיר — $0.15 למיליון אסימוני קלט ו-$1.00 למיליון פלט, ברשימה של Pokee עצמו.

תכונות סוכן — קריאת פונקציות ופלט מובנה בסכמת chat-completions הסטנדרטית; המודל מוצב כסוכן מתכנן-מבצע-בודק, ולא כמודל צ'אט.

מגבלות בקשות — מגבלת גוף בקשה של 45 MiB, כאשר כל מה שמעל 16 MiB נדרש להשתמש בהזרמת SSE (stream: true ובנוסף Accept: text/event-stream כותרת).

מגבלות קצב — 500 בקשות ו-20 מיליון טוקנים בדקה, כולל 10 בקשות במקביל בחשבונות חינמיים ו-25 בחשבונות בתשלום.

פריסה — מרכז נתונים B200, תחנות עבודה RTX 4090/5090, כרטיסי לקוח Intel Arc Pro, מעבדי NPU קצה (Qualcomm ו-Intel Panther Lake, עם AMD שמוגדר כממתין), ועל-גבי המכשיר, עם רישוי VPC ו-on-premises שתחתיו, במילותיו של Pokee, "אף בקשה לא יוצאת מההיקף שלך."

מחסניות שירות — תמיכה מיום אפס ב-vLLM וב-SGLang.

חברה — Pokee AI, שנוסדה ב-2024 על ידי Zheqing (Bill) Zhu, לשעבר ראש תחום למידת חיזוק יישומית ב-Meta; סבב סיד של 12 מיליון דולר בהובלת Point72 Ventures עם Qualcomm Ventures ו-Samsung NEXT.

המשקלים סגורים. Coverage תיאר את המודל כסגור-מקור "לעת עתה", וזו ההתחמקות של Pokee עצמו ולא התחייבות, ואין תאריך מוכרז או רישיון לשחרור.

Pokee-Isaac 28B-2

הארכיטקטורה שאף אחד לא יתאר

Pokee מייחסת את חלון ה-10M ל"ארכיטקטורה קניינית שאינה מבוססת על מפענח בלבד". המשפט הזה הוא כל החשיפה הטכנית. הקונסולה מקשרת לדוח טכני שכותרתו Pokee-Isaac 28B v0: A 10M-Token Context Efficient Agentic Model, מ-3 באוגוסט 2026; לא הצלחנו להשיג עותק ציבורי שלו, וחומרי ההשקה הנגישים אינם מציינים את מנגנון הקשב, את שיטת הזיכרון או את מתכון האימון.

{{1}}מה שפוקי אמר על המוצא הוא ספציפי יותר, וזו אמירה מעט מביכה: חלק מהמשקלים של אייזק עברו כוונון עדין מ-Qwen3.6-27B תחת רישיון Apache-2.0, משקלים אחרים אומנו מאפס על ידי פוקי, והתוצאה היא "לא כוונון עדין קונבנציונלי." זהו משפט זהיר. הוא מודה בבסיס ושולל את האפיון בו-זמנית.{{/1}}

זה גם מספיק כדי לרסן את הניחושים, וזה מה שקהילת חוקרי הבינה המלאכותית החלה לעשות מיד. החוקר שמפרסם תחת השם @teortaxesTex הניח את מערך האילוצים ביום ההשקה — בין השאר כוונון עדין מ-Qwen3.6-27B, לא decoder-only, 10M קונטקסט, 28B בסך הכול — והציע שני מועמדים: "סוג של Memory Sparse Attention משודרג" או "מקודד מסמכים של 1B בלבד." שני הניחושים ראויים להבנה, כי הם אינם בטלים.

התחילו בחשבון. Qwen3.6-27B הוא מודל דחוס בגודל 27B עם חלון מקורי של 262K, תשומת לב היברידית מסוג gated-delta, ומקודד ראייה שאפשר לדלג עליו כדי להריץ את המודל בטקסט בלבד. Isaac הוא 28B וטקסט בלבד. אם מורידים את מגדל הראייה של מודל הבסיס ומוסיפים בערך מיליארד פרמטרים של דבר אחר, נוחתים בדיוק על 28B. מקודד מסמכים או זיכרון של כ-1B שחובר לדיקודר של 27B הוא הקריאה החסכונית ביותר של ספירת הפרמטרים שפוקי פרסם, וזה היה הופך את התווית 'לא-רק-דיקודר' לנכונה פשוטו כמשמעו, מבלי להיות טענה חדשה.

הניחוש של Memory Sparse Attention מצביע על קו מחקר אמיתי ועדכני: מאמר ה-MSA (arXiv:2603.23516) משלב קשב דליל סקלבילי עם RoPE ברמת מסמך כדי להשיג מורכבות לינארית באימון ובהסקה, מוסיף דחיסת מטמון KV ובנוסף סכמת "Memory Parallel", ומדווח על פחות מ-9% ירידה מ-16K ועד 100M טוקנים, כאשר הסקה של 100M טוקנים רצה על שני A800. זו אותה צורת תוצאה שפוקי טוען לה, בסדר גודל אחד רחוק יותר, מקבוצה אחרת. שום דבר לא מקשר בין השניים מלבד הצורה — MSA אינו עבודתו של פוקי ופוקי לא ציטט אותו — אבל זה מבסס שעיצוב עם זיכרון מנותק המגיע לאורכים אלה על חומרה צנועה הוא דבר שפורסם וסביר, ולא בלתי אפשרי שיווקי.

יש מספר אחד בחומרים של Pokee עצמם שתומך בשקט בקריאת המקודד הנפרד. תפוקת ה-prefill על B200 יחיד היא 42,400 אסימונים/שנייה בהקשר של 1M אסימונים ו-137,200 אסימונים/שנייה ב-10M. התפוקה עולה ביותר מפי שלוש כשההקשר מתארך פי עשר. מפענח שעלות הקשב שלו ריבועית עושה את ההפך. כל מה שצורך את האסימונים האלה נעשה יעיל יותר לכל אסימון ככל שמוסיפים אותם, וזו החתימה של מעבר קידוד בתפזורת על מסמכים במקום prefill רגיל.

מדוע כל זה משנה למי שמחליט אם להשתמש במודל: אם חלון ה-10M הוא מקודד מסמכים בתוספת זיכרון דחוס, ולא מטמון KV בעל 10M רשומות, אז "{{1}}קונטקסט{{/1}}" כאן אינו האובייקט שהאינטואיציות שלך בנויות סביבו. האופן שבו הוא מתנהג כשמוסיפים לשיחה, עורכים מסמך אחד באמצע קורפוס, או מצפים שמטמון קידומות יעבוד אינו {{2}}מוגדר{{/2}}, והתיעוד של Pokee אינו מפרט שום מנגנון מטמון {{3}}בכלל{{/3}}. לא ניתן להסיק את ההתנהגויות האלה מגיליון המפרט, וכרגע {{4}}גם{{/4}} לא ניתן להסיק אותן מהארכיטקטורה.

RULER ב-10 מטרים הוא מספר ממשי בחדר ריק.

ראיות ההקשר הארוך של Pokee הן RULER, שהורץ ב-256K, 512K, 1M, 2M, 4M ו-10M, עם עשר דגימות לכל תצורה. Isaac משיג ציונים של 96.9, 96.7, 95.0, 95.8, 96.7 ו-93.3 על פני ששת האורכים הללו — המודל היחיד בפאנל שמצליח להשיג ציון בכל אחד מהם.

הפאנל מתחת ל-1M הוא המקום שבו שוכנת הקריאה הכנה:

ב־256K — Isaac 96.9, Nemotron 3 Super 120B 96.3, GPT-5.6 Luna 95.0, Gemini 3.5 Flash Lite 94.5, ו-0.0 עבור שניהם Claude Haiku 4.5 ו-Qwen 3.5 122B, שחלונותיהם נעצרים מתחת לאורך זה.

ב־512K — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.

ב-1M — Isaac 95.0, Nemotron 91.8, Gemini 3.5 Flash Lite 29.4, ו-GPT-5.6 Luna 0.0, כאשר שני האחרונים סומנו כשגיאות גלישת הקשר.

ב-2M ומעבר — יצחק לבדו, כל השאר 0.0.

שלושה דברים להלן. ראשית, עד 1M, הפער של אייזק על פני שאר השדה הוא נקודה או שתיים, לא דור — וקו הבסיס היחיד שנשאר קרוב, Nemotron 3 Super 120B, הוא מודל 120B שהנתונים שלו מ-256K עד 1M הם דיווחים עצמיים של NVIDIA, שפוקי מסמן ומוציא מהשוואת השורות במקום להעביר אותם כמדודים. אז המתחרה הקרוב ביותר באורכים האלה אינו למעשה מדידה תואמת, בשני הכיוונים.

שנית, לפחות אחד מהתאים הריקים נראה כמו חפץ פריסה (deployment artifact) ולא מגבלת מודל. Pokee הריץ את GPT-5.6 Luna דרך Azure וסימן את החלון שלו כ-">272K context," ורשם שגיאת הצפת קשר ב-1M. החלון המתועד של הספק עבור המודל הזה הוא בערך 1.05M טוקנים, וזה מה שעמוד המודל שלנו מדווח עבורו. קורא שלוקח את עמודת ה-1M כערך נקוב יסיק שלונה לא יכולה לבצע 1M; המסקנה המוצדקת יותר היא שהפריסה של Azure ש-Pokee בדק לא יכלה.

שלישית, RULER היא חבילת אחזור ואגרגציה סינתטית, לא benchmark של חשיבה. Pokee שקוף לגבי קמט מתודולוגי גם כאן: עמודות ה-256K וה-512K ממצעות את כל 13 תצורות המשימות, אך חילוץ מילים נפוצות אינו זמין מ-1M והלאה, כך שהעמודות הארוכות ממצעות את 12 הנותרות. לכן ה-93.3 ב-10M וה-96.9 ב-256K אינם נמדדים בדיוק על אותו תמהיל משימות.

מבחן ההקשר הארוך הקשה יותר נעצר ב-1M

המדד החושפני יותר בעמוד של Pokee אינו RULER. זהו MRCR v2, משימת קו-התייחסות רב-סיבובית בעלת 8 מחטים, שבה כמה מטרות מפוזרות לאורך שיחה ארוכה, והמודל חייב לאתר את המטרה המבוקשת ולהבדיל בינה לבין האחרות, כך שגם זכירה חלקית וגם הפרעות בין-מחטיות פוגעות בתוצאה. בסולם 0–1, ב-1M טוקנים:

Pokee-Isaac 28B — 0.500

Gemini 3.5 Flash Lite — 0.205

Nemotron 3 Super 120B — 0.067

GPT-5.6 Luna — 0.050

Claude Haiku 4.5 ו-Qwen 3.5 122B — 0.000, אין שום דבר שמיש באורך הזה

זהו פער רחב הרבה יותר ואמין הרבה יותר ממה ש-RULER מייצר, וזה המקום שבו ההבטחה של המודל מתממשת בפועל. Luna משיגה 95.0 ב-RULER ב-256K ו-0.050 ב-MRCR ב-1M; שליפה של מטרה בודדת והבחנה בין מחטים מרובות אינן אותה מיומנות, והשנייה קורסת ראשונה. Isaac מתדרדר בחן רב יותר.

זוהי גם הפער הראייתי הגדול ביותר בהשקה. MRCR v2 הופעל ב-256K, 512K ו-1M – ונעצר. הציונים של אייזק עצמו שם הם 0.607, 0.743 ו-0.500: לא מונוטוניים, וב-1M הוא מאחזר מחצית מהמחטים. אין תוצאת רב-מחט שפורסמה ב-2M, 4M או 10M מאף אחד, כולל Pokee. טענת ה-10M נשענת כולה על הקל מבין שני המבחנים, בדיוק באורכים שבהם המבחן הקשה יותר לא נוסה. אם אתה שוקל את המודל הזה כי אתה רוצה להכניס קורפוס של 25,000 עמודים להנחיה אחת ולשאול שאלה שהתשובה עליה מורכבת מארבעה מקומות בתוכו, היכולת הספציפית הזו לא נמדדה באורך הספציפי הזה.

Pokee-Isaac 28B-3

בעבודה האגנטית, אייזק הוא עמית של לונה, לא עדיף עליה.

Pokee הריץ ארבעה בנצ'מרקים אייג'נטיים, וכאן הכנות של החברה באמת יוצאת דופן: העמוד שלה מסכם את התוצאה כך ש-Isaac מוביל בשניים, במקום השני באחד, ובמקום השלישי באחד. זהו תיאור מדויק, וזה לא התיאור בסיקור ההשקה.

BFCL v4, קריאה לפונקציות (הניקוד נעשה על ידי התאמת AST והתאמת מעברי מצבים, ולא על ידי שופט מבוסס LLM) — Isaac 70.94 לעומת GPT-5.6 Luna 70.61, עם Claude Haiku 4.5 על 67.52, Qwen 3.5 122B על 64.88, Gemini 3.5 Flash Lite על 64.85, Nemotron 3 Super על 33.13.

τ³-bench, ממוצע ארבעה תחומים (משימות שירות לקוחות מרובות-פניות מול משתמש מדומה שהדרישות שלו משתנות באמצע השיחה) — Isaac 0.662 לעומת Gemini 3.5 Flash Lite 0.631, Qwen 3.5 122B 0.611, GPT-5.6 Luna 0.527, Nemotron 0.426, Claude Haiku 4.5 0.408.

Terminal-Bench 2.1, תת-קבוצת טקסט בלבדGPT-5.6 Luna 69.8% לעומת Isaac 65.1%, ואז Gemini 3.5 Flash Lite ו-Qwen 3.5 122B בשוויון של 46.5%, Claude Haiku 4.5 34.9%, Nemotron 24.4%.

MCP-Atlas, טענת כיסוי על פני שרתי כלים חיים — GPT-5.6 Luna 77.90%, Gemini 3.5 Flash Lite 76.67%, Isaac 74.59%, Qwen 3.5 122B 70.24%, Claude Haiku 4.5 56.45%, Nemotron 48.95%.

מרווח של 0.33 נקודות ב-BFCL v4 הוא שקילות, והעמוד של Pokee אומר זאת במפורש במקום להציג זאת כניצחון. בקריאה על פני כל ארבעת המבחנים, מודל 28B מחליף ניצחונות עם השכבה המהירה של ספק מוביל במשימות סוכנות. עבור מודל 28B זו תוצאה חזקה. זו אינה התוצאה שהביטוי "מודל סוכן ברמת frontier" מרמז עליה עבור רוב הקוראים, ומשמעות הדבר היא שהסיבה לבחור ב-Isaac היא החלון ומעטפת הפריסה, לא יכולת הסוכנות.

מספר הבטיחות הוא הטוב ביותר של הפאנל ובכל זאת אינו טוב

ב-DTAP, חבילת בדיקות להזרקת הנחיות, אייזק רושם את שיעור ההצלחה הנמוך ביותר בהתקפות בפאנל, עם 35.6 בסך הכל, ומקדים את Claude Haiku 4.5 עם 37.9, את GPT-5.6 Luna עם 50.1, את Qwen 3.5 122B עם 54.0, את Nemotron עם 60.4 ואת Gemini 3.5 Flash Lite עם 66.3. ההפרש בין שיעורי ההתקפות הישירות והעקיפות הוא פחות מנקודה אחת, כך שהחוסן אחיד לפחות בשני הווקטורים.

שלוש הסתייגויות, כולן מהדיווחים של Pokee עצמו ולא ממבקרים. המדידות העקיפות בוצעו כשההגנות מושבתות. סירובים מפורשים הופעלו רק על 1.5% מהמשימות הזדוניות, ש-Pokee מתאר כרוב ההגנה הנוכחית "אגבית במקום סירוב" — המודל אינו מזהה ודוחה התקפות, אלא פשוט אינו מונחה על ידן באופן מועיל. ובהשוואה ללוח תוצאות רחב יותר של 16 מערכות, במקום פאנל זה של שישה מודלים, Isaac מדורג חמישי בהתקפות ישירות, שישי בהתקפות עקיפות ותשיעי ביכולת: אמצע הטבלה, לא מוביל.

לגבי DTAP עצמה יש להרים דגל: בניגוד ל-RULER, BFCL ו-τ³-bench, היא אינה לוח תוצאות ציבורי מבוסס, ולא יכולנו למצוא תיעוד עצמאי של החבילה.

כמה עולה קריאה של עשרה מיליון טוקנים, וכמה זמן ממתינים?

עשרה מיליון טוקנים הם בערך 7.5 מיליון מילים, או כ-25,000 עמודים. במחיר של Pokee's של $0.15 למיליון, מילוי החלון פעם אחת עולה $1.50. הוסף תשובה באורך מקסימלי של 60,000 טוקנים ב-$1.00 למיליון, וקריאה מקסימלית אחת מגיעה לכ-$1.56. זה באמת זול עבור כמות הטקסט המעורבת, וזה הטיעון הפשוט החזק ביותר בעד המודל.

הזמן הוא המחיר האמיתי. על B200 בודד, Pokee מדווחת על 72.9 שניות עד לטוקן הראשון ב-10M — שזה בדיוק 10,000,000 חלקי נתון ה-prefill של 137,200 טוקנים לשנייה, כך שמדובר במספר חומרת-בנצ'מרק ולא בחביון API שנמדד בפועל. תיעוד המפתחים של Pokee עצמה מספר סיפור אחר למפתחים: יש לאפשר לפחות פסק זמן (timeout) של עשר דקות בצד הלקוח עבור prompts של מיליוני טוקנים, כי prompt גדול יכול לקחת "בערך שבע דקות ב-10 מיליון טוקנים." זה פער של בערך פי שישה בין שקופית התפוקה למדריך האינטגרציה. שני המספרים הם של Pokee; זה שבמסמכים הוא זה שתצורת ה-timeout שלך חייבת להאמין לו.

הפענוח (decode) יציב בכ-335 טוקנים בשנייה ללא תלות בכמות ההקשר שנמצא בזיכרון — וזו חדשות טובות מבחינה ארכיטקטונית, אבל חדשות מביכות מבחינה מעשית: פלט מלא של 60,000 טוקנים אורך כשלוש דקות בנוסף לפרפיל (prefill). בחומרה צרכנית התמונה משתנה שוב — ב-Intel Arc Pro B70, Pokee מדווח על 1,087–1,500 טוקנים בשנייה בפרפיל (פי 3.6–5 מ-llama.cpp הסטנדרטי) ו-58.8 טוקנים בשנייה בפענוח. אלה מספרים מכובדים למעבד גרפי לקוח (client GPU), אבל הם לא מספרים בקנה מידה של 10M טוקנים.

שני מגבלות מעשיות נובעות מגודל הקלט עצמו. עשרה מיליון טוקנים של אנגלית הם בערך 38 MiB של טקסט, מה שמתאים מתחת למגבלת גודל גוף הבקשה של 45 MiB אך נמצא הרבה מעל לסף של 16 MiB, ולכן כל קריאה אמיתית של חלון מלא חייבת להיות מוזרמת (streamed) — אין נתיב שאינו מוזרם לתכונה המרכזית. ובנוסף, ללא מטמון הנחיות (prompt caching) מתועד ב-API של Pokee, כל שאילתה חוזרת על אותו קורפוס עולה עוד $1.50 ועוד prefill של מספר דקות. רישום המשווק ב-NanoGPT אכן מפרסם תעריף קריאה ממטמון של $0.079 למיליון, שאם הוא חל על Isaac, קריאה חוזרת ממטמון עולה בערך $0.79 — בערך חצי מחיר, לא הנחה בסדר גודל שמשתמעת ממטמון הנחיות במקומות אחרים.

תיקון אחד להשוואת המחירים, כי הוא משנה את הכותרת הראשית. Pokee מתמחר את GPT-5.6 Luna ב-$0.40/$1.80 למיליון, לפי מקור מ-Azure. מחיר הרשימה הרשמי של הספק עבור Luna לאחר הקיצוץ ב-31 ביולי 2026 הוא $0.20/$1.20, וזה מה שמוצג בעמוד המודל שלנו, מכיוון ש-OrcaRouter מעביר את מחירי הרשימה של הספקים במרווח של 0% במקום למכור במחיר מוגדל. לפי המספר הנכון, Isaac זול ב-25% בקלט וב-17% בפלט לעומת שכבת ה-frontier המהירה — עדיין זול יותר, אבל היתרון צר בהרבה ממה שהפאנל מצביע עליו, ומחיר הפלט הזול ביותר בפאנל שייך ל-Nemotron 3 Super ב-$0.65. יתרון המחיר של Isaac אמיתי; הוא פשוט לא החלק הבולט של ההשקה הזו.

Pokee-Isaac 28B-4

החלק שבאמת חדש

כשמסירים את מסגרת הבנצ'מרק, נשאר משהו יוצא דופן. מודל 28B עם קונטקסט ארוך מאוד שרץ בתוך VPC, על תחנת עבודה עם RTX 4090, על כרטיס Intel Arc Pro, ועל סיליקון נייד מסוג NPU, עם תמיכה ב-vLLM וב-SGLang מהיום הראשון ורישיון on-premises — השילוב הזה כמעט לא זמין בשום מקום אחר. Pokee גם טוען ליעילות KV-cache של פי 5 בערך לעומת מימושים סטנדרטיים, נתון שמגיע מהיצרן ללא שחזור עצמאי, אבל זה מסוג הנתונים שחייבים להיות נכונים כדי שסיפור הפריסה יחזיק מעמד.

הלקוח כאן אינו מי שקונה סוכן טוב יותר. הוא מי שיש ברשותו קורפוס גדול, רגיש ובעיקר סטטי — קבוצות חוזים, תיקי מקרים, בסיס קוד מונוליטי, חודשים של לוגים — שמשפטית או פוליטית לא יכול לצאת מגבול, ושבמצב אחר היה בונה צינור אחזור כדי לעקוף חלון של 200K. מול החלופה הזאת, המסר אינו "זול יותר מ-RAG." הטמעה ואחזור על פני 25,000 עמודים עולים אגורות לשאילתה ותמיד יעלו. המסר הוא שאין אסטרטגיית chunking לכוונן, אין זכירות אחזור לאבד, ואין מערכת שנייה שצריך לשמור בסינכרון עם הראשונה. האם העסקה הזאת שווה $1.50 וכמה דקות לכל שאילתה תלוי לחלוטין בתדירות השאילתות.

מי צריך לנסות את זה עכשיו, ומי צריך לחכות

נסו זאת עכשיו אם אתם בונים אב-טיפוס מול קורפוס בטווח 1M–4M, שבו המספרים של אייזק הם החזקים ביותר והחלופות באמת דלות, או אם פריסה מקומית (on-premises) בגודל 28B היא הדרישה שחסמה אתכם. עשר הבקשות המקבילות בשכבה החינמית מספיקות כדי לגלות אם המודל קורא את המסמכים שלכם בדרך שאתם צריכים.

רגע, אם אתה צריך את המספר 10M ספציפית והשאלות שאתה שואל הן מרובות-שלבים, כי השילוב הזה הוא בדיוק מה שאיש לא מדד. רגע, אם אתה צריך קלט מולטי-מודאלי, שהמודל לא מקבל. רגע, אם זמן האחזור חשוב, מאחר שקריאה בחלון מלא אורכת דקות, לא שניות. וגם שקול את סיכון התלות הברור: זהו מודל v0, עם משקלים סגורים, מחברה עם סבב גיוס של 12 מיליון דולר, וזהו המודל היחיד בעולם שמשרת את היכולת שהוא מוכר. אין ספק משני שאפשר לעבור אליו אם הוא ייעלם.

הנקודה האחרונה היא הסיבה המעשית לשמור על השוואה הוגנת. Pokee-Isaac 28B אינו זמין כיום ב-OrcaRouter — אם אתם רוצים אותו, הוא נמצא ב-API של Pokee עצמו או אצל משווק מורשה. אבל שלוש מתוך חמש קווי הבסיס שהוא נמדד מולם, GPT-5.6 Luna, Gemini 3.5 Flash Lite ו-Claude Haiku 4.5, זמינים במפתח OrcaRouter אחד במחיר הרשום של הספק, מה שהופך את הניסוי השימושי לזול להקמה: הריצו את המשימה האמיתית שלכם עם הקשר ארוך מול שלושתם באורכים שהם תומכים בהם, ותראו אם הקורפוס שלכם באמת צריך עשרה מיליון טוקנים או שהוא צריך 400,000 ופרומפט טוב יותר. אם הוא צריך עשרה מיליון, למדתם משהו ששווה $1.50 לכל קריאה. אם לא, נמנעתם מבניית נתיב ייצור על מקור יחיד v0.

שלוש שאלות ששווה לענות עליהן

האם Pokee-Isaac 28B הוא רק כוונון עדין?

לא בשום מובן רגיל של הביטוי, אם כי גם אינו בלתי-תלוי בבסיס הזה. עמדת Pokee היא שחלק מהמשקלים מכווננים עדין מ-Qwen3.6-27B תחת רישיון Apache-2.0, בעוד שאחרים אומנו מאפס, וכי הארכיטקטורה אינה מבוססת על מפענח בלבד. שני חלקי הטענה עולים בקנה אחד עם מספר הפרמטרים: Qwen3.6-27B הוא מודל 27B דחוס עם מקודד ראייה שאפשר לדלג עליו, ואילו Isaac הוא 28B ומוגבל לטקסט בלבד, כך שכמיליארד פרמטרים של מנגנון חדש החליפו את מגדל הראייה. מהו אותו מנגנון — לא נחשף, ועד שייחשף, "לא כוונון עדין קונבנציונלי" היא טענה הנשענת על דברי Pokee ולא על משהו שניתן לבדוק. רישיון Apache-2.0 על הבסיס הופך את היצירה הנגזרת לחוקית; הוא אינו הופך את השחרור הסגור של התוצאה לחריג, דבר שראוי לציון בעיקר משום שייחוס ספציפי כל כך לעתים נדירות נמסר מרצון.

האם זה באמת יכול להריץ 10M טוקנים על RTX 4090?

{{1}}הטענה על GPU יחיד וטענת ה-10M מגיעות מאותה השקה, אבל לא מאותה מדידה.{{/1}} {{2}}כל נתון תפוקה שפוקי מפרסמת בקונטקסט של 10M{{/2}} — {{3}}מילוי מקדים של 137,200 טוקנים לשנייה, 72.9 שניות עד לטוקן הראשון{{/3}} — {{4}}מבוסס על B200 יחיד.{{/4}} {{5}}הנתונים של RTX 4090 ו-Arc Pro אמיתיים, אבל הם מצוטטים בקנה מידה קטן בהרבה;{{/5}} {{6}}המספרים של Arc Pro B70 הם 1,087–1,500 טוקנים לשנייה במילוי מקדים,{{/6}} {{7}}מה שאומר שמילוי מקדים של 10M טוקנים היה נמשך שעות.{{/7}} {{8}}"ניתן לפריסה על GPU יחיד החל מ-RTX 4090"{{/8}} {{9}}עדיף לקרוא זאת כטענה על כך שהמשקלים מתאימים והמודל מספק שירות מועיל,{{/9}} {{10}}ולא כטענה על כך שאורך הקונטקסט המרכזי מעשי על אותו כרטיס.{{/10}}

האם כדאי לי להחליף צינור RAG בזה?

לא על סמך ראיה זו, למעט חריג אחד. הטיעון להחלפת שליפת המידע הוא החזק ביותר כשהשאילתות שלך הן רב-שלביות — בדיוק מצב הכשל ששליפת מקטעים מטפלת בו גרוע — וביצועים רב-שלביים מעבר ל־1M טוקנים הם מה שפוקי לא מדדה. MRCR v2 עוצר ב־1M, כשאייזק שולף מחצית מהמחטים. החריג הוא קורפוס שנכנס בנוחות לתוך 1M–2M טוקנים, שבו הנתונים שאייזק מדד חזקים, ההמתנה היא עשרות שניות במקום דקות, והסרת שכבת שליפת המידע מסירה מורכבות תפעולית אמיתית. מעבר לכך, התייחס לחלון ההקשר כדרך להימנע מבניית שליפת מידע עבור אב־טיפוס, לא כסיבה למחוק שליפה שעובדת.

מה יפתור את זה?

ארבעה דברים, שאף אחד מהם אינו דורש אמון באיש. הרצה עצמאית של RULER או MRCR ב-2M ומעלה, על ידי כל אחד, על גבי ה-API הציבורי. תוצאת MRCR v2 מ-Pokee באורכים שהוא כבר מפרסם. דוח טכני נגיש שמציין את המנגנון, ואז שאלת המקודד מפסיקה להיות אריתמטיקה והופכת לעובדה. ושחרור משקלים, ש"סגור-מקור לעת עתה" רומז עליו בלי להבטיח.

עד אז, הסיכום ההוגן צר יותר מההשקה ומעניין יותר מהספקנות. Pokee AI שיגרה מודל 28B שמחזיק באופן מדיד שליפה בהקשר ארוך רחוק יותר מכל מה שניתן כיום לרכוש, משתווה לשכבה מהירה מובילה בעבודה אייג'נטית, הוא הבטוח ביותר בפאנל שלו ובינוני מול פאנל רחב יותר, ורץ במקומות ששום דבר ברמת היכולת שלו לא רץ. היא גם בחרה לפרסם את המספרים היחידים שקיימים על היכולת שאף אחד אחר לא מציע, ולא לומר כיצד זה עובד. שתי אלה הן בחירות שחברה צעירה זכאית לקבל. אף אחת מהן אינה תחליף למישהו מחוץ לבניין שיריץ את הבדיקה.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube