כרטיס כותרת ראשי עבור Perceptron Mk1.5 עם כותרת משנה 'פלט מרחבי מובנה עבור סוכנים מגולמים' ושלושה אייקוני קו שטוחים מעל הכותרת: תיבת תיחום שמצוירת סביב עצם קטן, מסלול תנועה מנוקד עם שתי נקודות ציון, וגל קול. הלוגו של OrcaRouter נמצא בפינה הימנית התחתונה.
Guides & Insights

Perceptron Mk1.5 מביא פלט מרחבי מובנה לסוכנים מגולמים — ומוציא את Isaac לפנסיה באותו היום

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Perceptron Mk1.5 זמין כעת באופן כללי, והדבר המעניין בו אינו טבלת הבנצ'מרקים — אלא מה שחוזר בגוף התגובה. שאלו מודל ראייה-שפה רגיל היכן המלגזה ותקבלו משפט. שאלו את Perceptron Mk1.5 על פריים וידאו, ולצד הפרוזה שלו תוכלו לקבל גאומטריה ניתנת לפענוח מכונה: נקודה, תיבת תיחום, מצולע, קליפ, או <track> אלמנט הנושא תצפיות מרחביות עם חותמות זמן על פני כל הקובץ. זה ההבדל בין מודל שמתאר סצנה למודל שבקר רובוט יכול לצרוך בלי שלב פענוח נוסף. זה הממשיך הישיר של Perceptron Mk1, השחרור הראשון של החברה במאי 2026, והוא הושק ב-25 בספטמבר לצד הוצאתם משימוש של צ'קפוינטים Isaac 0.1 ו-0.2 שקדמו לו.

מה Mk1.5 למעשה מחזיר

המודל הוא מערכת הסקה מגולמת עבור סוכנים פיזיים. בצד הקלט הוא מקבל טקסט, תמונות, וידאו ואודיו. בצד הפלט הוא מייצר טקסט בתוספת הערות מובנות אופציונליות: נקודות, תיבות, מצולעים, קליפים ומסלולים. פלט המעקב הוא החלק שכדאי להתעכב עליו. התיעוד של Perceptron מתאר<track> בלוק שרשומותיו נושאות גם תצפית מרחבית וגם את חותמת הזמן שאליה היא שייכת, כך שקליפ באורך 60 שניות מוחזר כרצף של מיקומי אובייקטים לאורך זמן במקום ניחוש ממוצע יחיד לגבי הסצנה.

פרט שני שחשוב לכל מי שמחבר את זה לצינור עיבוד עם יותר מנכס אחד: Mk1.5 תומך בasset_idx כשדה, כך שבקשה אחת יכולה להתייחס למספר תמונות או סרטונים ולפנות אליהם בנפרד. אם המשימה שלך היא להשוות תמונת ייחוס לפריים ממצלמה חיה — לולאת בדיקת פגמים, שלב אימות הרכבה — זה שייך לקריאה אחת, לא לשתיים.

המודל תומך גם בתגובות מוגבלות, הן ב-JSON Schema והן ב-regex, וכך אתם הופכים "בערך שם" לסכימה שקוד ההמשך שלכם יכול לאמת. קריאה לפונקציות נתמכת ב-chat completions, ושרת ה-MCP המתארח של Perceptron מציג כעת כברירת מחדל את perceptron-mk1.5; העברת model: "perceptron-mk1" במפורש היא הדרך לקבע את ברירת המחדל הקודמת.

דף המפרט, וכמה זה עולה

A single-column scoreboard titled 'Perceptron Mk1.5 — the scoreboard' listing Context window 36,864 tokens, Max output 8,192 tokens, Input price $0.15 per million tokens, Output price $1.50 per million tokens, Cached input $0.0375 per million, Reasoning default high, with a footer reading 'Figures per Perceptron's own documentation, September 25, 2026.'

המספרים כאן ראויים להיאמר בפשטות, משום שהם צנועים במקומות שקורא אולי לא יצפה להם. חלון ההקשר הוא 36,864 טוקנים — לא מיליון, לא 256K. הפלט המרבי הוא 8,192 טוקנים. זה לא מודל שמגישים לו סרטון של שעתיים ומדריך של 300 עמודים. הוא מותאם בגודלו למשימת תפיסה מהודקת עם תשובה מובנית.

Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.

• הקשר — 36,864 טוקנים, לעומת חלון של 32K שאיתו הגיע Perceptron Mk1
• פלט מקסימלי — 8,192 טוקנים
• קלט — טקסט, תמונות, וידאו, אודיו (WAV, MP3, FLAC)
• קלט שמור במטמון — $0.0375/M, רבע משיעור הקלט הרגיל של $0.15/M
• פלט — $1.50/M
• שליטה בחשיבה — reasoning_effort ב-high, medium, low, minimal או none, כאשר ברירת המחדל היא high

השורה האחרונה הזו היא שינוי שובר בתחפושת. Mk1.5 מחליף את ה-vision_config.enable_thinking הבוליאני הישן ב-reasoning_effort, כך שכל בקשה שבנית מול המודל הקודם צריכה עריכה ולא רק כיוון מחדש. ברירת המחדל של highכדאי לשים לב אליה מסיבה אחרת: אם לא תגדיר את השדה, אתה קונה את מסלול החשיבה היקר ביותר בכל קריאה.

אודיו, ווידאו שנושא פסקול משלו

קלט אודיו הוא באמת חדש כאן. Perceptron מקבל אותו בשלוש דרכים — מוטבע input_audio, audio_url, או audio_file_id — עם תקרה של 16,384 אסימוני אודיו לכל פריט. התיעוד מציין שזה בערך 21.8 דקות דיבור בקצב של כ-750 אסימונים לדקה, וזה תקציב סביר להקלטת מסירת משמרת או יומן תחזוקה.

יוצא דופן יותר הוא נתיב הווידאו. כברירת מחדל, Mk1.5 קורא וידאו כפריימים ומתעלם מרצועת האודיו. הגדרת vision_config.enable_audio_in_video: true מפעילה מחדש את פס הקול, וזו ההגדרה הרצויה לכל דבר שבו הרעש הוא האות — מכונה שנשמעת לא נכון לפני שהיא נראית לא נכון, הוראה מדוברת שנאמרת מחוץ למצלמה, אזעקה ברקע של סיור באתר. היא כבויה כברירת מחדל, כך שווידאו עם תקלה נשמעת ינותח בשקט כסרט אילם אלא אם תבקש אחרת.

התמונה של הבנצ'מרק, עם ייחוס מקורות מפורש

A single-column results scoreboard titled 'Perceptron Mk1.5 — the benchmark picture' listing hand_box 0.9433 against Gemini 3.8 Flash 0.6179, EgoSchema 80.40 against Gemini 3.8 Flash 81.20, EgoSchema-hard 63.75, Molmo2-Track centre-F1 0.647, LiveVQA-W with tools 56.0 against Gemini 3.8 Flash 53.2, and Audio DailyOmni 74.67, with a footer reading 'All figures reported by Perceptron, September 25, 2026. No independent scores.'

כל נתון שלהלן מגיע מהודעה של Perceptron עצמה ונמדד על ידי Perceptron. אין רשומת אינדקס של Artificial Analysis ואין ציון ארנה עבור Mk1.5 או עבור קודמו, ולכן אין בהשוואה הזו שום מספר של צד שלישי שניתן להעמיד מולם. התייחסו לנתונים כאל טענה של ספק לגבי המוצר שלו עצמו, לא כתוצאה ניטרלית.

במעקב אחר ידיים אגוצנטרי הפער רחב וספציפי: Mk1.5 משיג 0.9433 על hand_box לעומת 0.4467 עבור Gemini 3.1 Pro ו-0.6179 עבור ה-Gemini הטוב ביותר בהרצה של Perceptron, שאותו ההכרזה מזהה כ-Gemini 3.8 Flash. זהו ה-+111% וה-+53% שפוסט ההשקה מוביל איתם, וזה המספר הבודד החזק ביותר בשחרור.

בהבנת וידאו אגוצנטרי כללי התמונה הרבה יותר צמודה. Perceptron מדווחת על EgoSchema ב-80.40 עבור Mk1.5 לעומת 81.20 עבור Gemini 3.8 Flash — הפסד של 0.80 נקודות — בעוד שהיא טוענת ליתרון של 12% בתת-הקבוצה EgoSchema-hard ב-63.75. מודל שמנצח באופן מכריע בגיאומטריית ידיים עדינה ומפסיד באופן צר במדד ההבנה הרחב הוא סוג מסוים של כלי, והוא נמכר ככזה.

פילוח עצמים בווידאו מגיע ל-0.647 center-F1 ול-0.628 point-HOTA ב-Molmo2-Track. Perceptron אומר שזה מוביל את Molmo2-Track, Ref-DAVIS17 ו-ReasonVOS, בעוד שהוא מפגר אחרי MolmoPoint-8B ב-MeViS valid_u. לעומת סדרת הראייה של Qwen, השוואת המעקב שווה קריאה מדוקדקת: ההודעה מפרטת את Qwen3-VL-8B ב-0.180 center-F1 מתוך המאמר שלו, ואת Qwen3.5-27B ב-0.530 וב-0.476 — צ'קפוינטים שונים, מערכי הערכה שונים, ומספר מתוך מאמר שיושב באותה עמודה עם מספרים מדודים. זו אינה שורה של השוואה שקולה.

תוצאות האודיו מדווחות כ-DailyOmni 74.67, WorldSense 50.32, OmniBench 51.05 ו-AVHBench 80.56, ללא שורת השוואה מצורפת. בחיפוש מולטימודלי עם כלים מופעלים, Mk1.5 רושם 56.0 ב-LiveVQA-W מהצבעת רוב על ארבע דגימות, לעומת 53.2 עבור Gemini 3.8 Flash עם Google Search grounding, 51.0 עבור GPT-6 sol עם OpenAI web search, ו-33.2 עבור GPT-5.2 online. Perceptron גם טוען לרווח של 36.1 נקודות ב-MMSearch ברגע שהכלים מופעלים. הצבעת רוב על ארבע דגימות היא טכניקה לגיטימית והיא מייפה את הציון ביחס למעבר חמדני בודד, כך ש-56.0 וה-53.2 אינם נמדדים באותה צורה.

השהיה, וכיצד נמדד ה-4.7×

טענת המהירות היא זו שסביר ביותר שתוצג ללא ההקשר שלה, אז הנה ההקשר. Perceptron מדווחת על מהירות קצה-לקצה של עד פי 4.7, לפי חציון של שלוש הרצות על H100 בודד, תוך שימוש בפרומפטים מ-LMArena שתשובותיהם מוגבלות ל-256 טוקנים, ובנוסף MIA-Bench ו-Video-MME עם Perception Test. ה-4.7× הוא מקרה הצ'אט: מ-5.2 שניות ל-1.1. מענה על שאלות בתמונות עובר מ-1.7 שניות ל-0.51, שהם בערך פי 3.3. סרטון בן 60 שניות המעובד שמונה בכל פעם עובר מ-19 שניות ל-9.1, בערך פי 2.1.

אז מכפיל הכותרת הוא הטוב מבין השלושה, לא המקרה האופייני. על H100 בודד, בתשובות קצרות, מסלול הצ׳אט אכן מהיר פי 4.7. בעומס העבודה של וידאו שסוכן מגולם באמת יריץ, זה קרוב יותר לפי 2. שניהם מספרים טובים; רק אחד מהם הוא הכותרת.

Isaac 0.1 ו-0.2 הוצאו משימוש באותו יום

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the specifications table (Model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video and audio, audio formats WAV/MP3/FLAC, audio limit 16,384 tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, constrained JSON Schema and regex responses) and the pricing table (input $0.15, output $1.50, cached input $0.0375 per million tokens).

ביומן השינויים של Mk1.5 מופיעה רשומה שנייה מתאריך 25 בספטמבר, והיא זו שקריטית לכל מי שכבר בפרודקשן. המזהים הבאים: isaac-0.1, isaac-0.2-1b ו-isaac-0.2-2b-preview הוצאו משימוש מ-API של Perceptron. הם כבר לא מופיעים ב-GET /v1/models, הם נעלמו משרת ה-MCP המתארח, ובקשות שמציינות אותם נכשלות כעת עם HTTP 404 model_not_found.

יש שינוי התנהגותי שני שטמון באותה רשומה, והוא יפגע בקוד שמעולם לא הזכיר כלל את דגמי Isaac: מזהי מודלים לא ידועים מחזירים כעת 404 במקום ה-400 הקודם. כל לוגיקת ניסיון חוזר, ענף שגיאה או כלל התראות שהתאים ל-400 עבור שם מודל שגוי כבר לא תואם דבר. מסלול המיגרציה ש-Perceptron מספק הוא perceptron-mk1.5.

להוציא משפחת מודלים מכלל שימוש באותו יום שבו אתה משחרר את המחליף שלה הוא סיפור הגירה נקי ואכזרי גם יחד. אם קיבעת את Isaac כי זה עבד, יש לך מועד אחרון שכבר עבר.

איפה להריץ את זה, ואיך לנסות את זה בלי להמר על זה

הזמינות היא דרך ה-API של הספק עצמו ומספר פלטפורמות של צד שלישי. OrcaRouter לא מנתבת כרגע את Perceptron Mk1.5 — המודל אינו בקטלוג שלנו — ולכן ההנחיה הכנה היא לפנות ישירות אל api.perceptron.inc עבורו, שזה בדיוק מה שה-SDK וה-PERCEPTRON_API_KEY משתנה הסביבה נועדו לו.

מה ששווה לומר בכל זאת, מפני שזה נוגע להחלטה ולא למודל: צ'קפוינט בן יומיים על חלון של 36,864 טוקנים עם ברירת מחדל של reasoning שמוגדרת ל-גבוה הוא בדיוק הפרופיל של משהו שאסור לשים על מסלול ייצור בלי לראות אותו קודם. הריצו אותו קודם מול הפריימים שלכם, ומדדו ספציפית שני דברים — האם הפלטים המובנים שורדים את מקרי הקצה האמיתיים שלכם, ומה reasoning_effort: "high" עולה לכם לכל קריאה לעומת הורדה ל-בינוני או נמוך. השני הוא שינוי של שורה אחת עם השפעה ישירה על החשבון שלכם, והוא הניסוי הזול ביותר בגרסה הזו.

הדפוס הרחב יותר שזה משתלב בו — מודלי תפיסה שמחזירים גאומטריה ולא שמות תואר — הוא דפוס ש-OrcaRouter נבנתה לספוג. API אחד מכסה יותר מ-200 מודלים, כאשר מחירי המחירון של הספקים מועברים הלאה במרווח של 0%, כך ששינוי מחיר של ספק באחד מהם נכנס לתוקף אצלנו באותו היום, ומעבר אוטומטי לגיבוי פירושו שקריאת תפיסה יכולה לעבור למודל שני במקום להיכשל בבקשה. אם Mk1.5 הוא הדבר היחיד שעומד ברף הדיוק שלך, שום דבר מזה לא עוזר לך היום. אם הוא מועמד אחד מבין כמה, הרצת ההשוואה דרך נקודת קצה אחת זולה יותר מלחבר SDK שני כדי לגלות.

מהי מהדורה זו ומה אינה

Perceptron Mk1.5 הוא כלי ממוקד שעימו כרוכה סדרת מגבלות כנה באופן יוצא דופן. הוא מחזיר קואורדינטות, לא רק תיאור. הוא קורא אודיו, כולל את פס הקול של וידאו אם תפעילו אותו. הוא מהיר בתשובות צ'אט קצרות. הוא גם מודל של 36,864 טוקנים עם תקרת פלט של 8,192 טוקנים, מתומחר ב-$0.15 וב-$1.50, נבחן כולו על ידי הספק שלו בלבד, ונמכר על ידי חברה שהוציאה משירות את הדור הקודם באותה רשומת יומן שינויים.

אם הבעיה שלך היא "מצא את היד, עקוב אחריה לאורך כל הסרטון, אמור לי לאן היא הלכה ומתי", מספר תיבת היד הוא זה שכדאי לבדוק. אם הבעיה שלך היא הבנה רחבה של וידאו מול מודל כללי מוביל, השורה של EgoSchema — 80.40 מול 81.20 — מרמזת שאתה קונה מומחה בקירוב לשוויון, והטיעון בעד מעבר חייב לבוא מהפלט המובנה ומהשהיה, לא מהדיוק.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית