כרטיס כותרת שנוצר להשוואה בין Perceptron Mk1.5 ל-Gemma 4 12B, עם כותרת ראשית 'Perceptron Mk1.5 מול Gemma 4 12B' וכתובית משנה 'אחד עונה במשפטים. האחר עונה בקואורדינטות.', ושלושה כרטיסים עם הכיתוב 'הקשר של Mk1.5: 36,864 טוקנים', 'הקשר של Gemma 4 12B: 256K' ו'פלט של Mk1.5: תיבות ומסלולים', עם הערת שוליים 'נתוני Mk1.5 לפי דיווח הספק.'
Guides & Insights

Perceptron Mk1.5 לעומת Gemma 4 12B: האחד עונה במשפטים, והאחר עונה בקואורדינטות

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הנה המספר שאמור לעצור אותך קודם: Perceptron Mk1.5 הוא מודל שנבנה עבור וידאו וסוכנים מגולמים, וחלון ההקשר שלו הוא 36,864 טוקנים. Gemma 4 12B הוא מודל כללי במשקלים פתוחים בנפח 12B עם חלון של 256K. בציר שרוב האנשים משתמשים בו כדי להשוות מודלי ראייה — כמה חומרי וידאו אני יכול להעביר לו — המודל הקטן יותר, הסגור והייעודי מפסיד פי שבעה למודל הניתן להורדה. ההיפוך הזה אינו פגם באף אחד מהמוצרים. הוא מספר לך למה כל אחד מהם נבנה בפועל, ושתי המשימות רחוקות זו מזו יותר ממה שמרמזת השורה המשותפת "קלט רב־מודלי" בגיליונות המפרט שלהם.

Perceptron Mk1.5 הוא מודל החשיבה המגולמת ש-Perceptron שחררה ב-25 בספטמבר 2026, היורש של Perceptron Mk1 ממאי, שקולט טקסט, תמונות, וידאו ואודיו ומחזיר טקסט בתוספת גאומטריה הניתנת לפענוח מכונה. Gemma 4 12B הוא המודל הרב-מודאלי ללא מקודד ובמשקלים פתוחים של Google DeepMind, בעל 11.96B, ששוחרר ב-3 ביוני 2026 תחת Apache 2.0, וקולט טקסט, תמונה, אודיו ווידאו ומחזיר טקסט. שניהם זולים, שניהם קוראים פיד ממצלמה, ורק אחד מהם ימסור לבקר שלך תיבת תיחום בלי שלב פענוח נוסף. הבחירה ביניהם היא בחירה בשאלה מה שחייב לחזור.

מה כל אחד מהם בנוי להחזיר

העמידו את השניים זה לצד זה וההבדל אינו בדיוק. הוא סוג הפלט. שאלו את Gemma 4 12B היכן המלגזה ותקבלו משפט, וברוב היישומים המשפט הזה הוא התוצר — תיאור, סיכום, תשובה לשאלה על תמונה. שאלו את Perceptron Mk1.5 ולצד הפרוזה שלו, תוכלו לבקש נקודה, תיבה חוסמת, מצולע, קליפ, או <track> אלמנט שנושא תצפית מרחבית ואת חותמת הזמן שאליה היא שייכת. קליפ של 60 שניות חוזר כרצף מיקומים לאורך זמן במקום ניחוש ממוצע אחד על הסצנה.

זו כל הטענה לקיומו של Mk1.5, וכדאי להיות מדויקים לגבי למה זה חשוב. תיאור של סצנה הוא חפץ מוגמר. קואורדינטה היא קלט למשהו אחר — מתכנן אחיזה, בדיקת פגמים, נתיב ביקורת עם חתימות זמן. אם הקוד במורד הזרם שלך צריך לקרוא פרוזה ולהסיק ממנה מיקום, בנית מפרסר בין שני מודלים, והמפרסר הזה הוא כעת משטח הכשל שלך. הפיץ' של Mk1.5 הוא שהגאומטריה מגיעה עם טיפוס.

הטיעון הנגדי של Gemma 4 12B אינו שהוא עושה זאת גם. הטיעון הוא שאתה יכול לקבל את המשקולות. Apache 2.0, 11.96B פרמטרים, פורסם בגרסאות מאומנות מראש ומכווננות להוראות, פועל על חומרה שאתה שולט בה, עם כרטיס הערכה מפורסם ואינדקס של צד שלישי מאחוריו. אלה סוגים שונים של נכסים, ואף אחד מהם לא מחליף את האחר.

איפה שהשניים באמת מתיישרים

פחות מקומות ממה שהתווית "multimodal 2026" מרמזת, אבל הבסיס המשותף הוא אמיתי וראוי לציין אותו במדויק, מפני ששם בדרך כלל מתחילה רשימת הבדיקה של הקונה.

• מודאליות קלט — שתיהן באמת בעלות ארבע מודאליות. Perceptron Mk1.5 מקבל טקסט, תמונות, וידאו ואודיו (WAV, MP3, FLAC). Gemma 4 12B מקבל טקסט, תמונה, אודיו ווידאו דרך נתיב מאוחד אחד ללא מקודד.

• מודאליות פלט — אף אחד מהם לא מייצר אודיו או תמונות. שניהם פלט טקסטואלי. ההבדל הוא שהטקסט של Mk1.5 יכול לשאת אנוטציות מרחביות מובנות, וזה של Gemma 4 12B לא.

• קריאה לפונקציות — שניהם תומכים בכך. Mk1.5 חושף קריאה לפונקציות ב-Chat Completions ומקבל תגובות מוגבלות באמצעות JSON Schema ו-regex. Gemma 4 12B מגיע עם קריאה לפונקציות בגרסתו המותאמת להוראות ומצב חשיבה הניתן להגדרה.

• בקרת חשיבה — Mk1.5 מחליף את הישן vision_config.enable_thinking הבוליאני עם reasoning_effort כשדה שמקבל high, medium, low, minimal או none, וברירת המחדל היא high. Gemma 4 12B חושף וריאנטים עם חשיבה וללא חשיבה שמקבלים ציון שונה באותה מערכת בדיקות כי הם מבצעים כמויות שונות של עבודה.

• הקשר — 36,864 טוקנים עבור Mk1.5 לעומת 256K עבור Gemma 4 12B. זהו הפער הרחב ביותר ברשימה, והסעיף הבא עוסק בכך.

משקולות ורישיון — Mk1.5 הוא מודל מתארח סגור עם SDK, ולא הורדה. Gemma 4 12B מופץ תחת רישיון Apache 2.0, ולכן המחיר של הגרסה המתארחת הוא אחת מכמה אפשרויות ולא הדרך היחידה להריץ אותו.

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Gemma 4 12B - the scoreboard', comparing six dimensions: context window 36,864 tokens vs 256K tokens; input text, image, video, audio vs text, image, audio, video; output text plus boxes, tracks and timestamps vs text only; reasoning control 'reasoning_effort, high default' vs thinking on and off; price $0.15 in / $1.50 out per 1M tokens vs $0.10 in / $0.30 out; and independent score 'none yet' vs AA Index 14 of 142. Footnoted that Mk1.5 figures are vendor-reported with no independent index and that the Gemma index is per Artificial Analysis.

חלון ה-36K הוא החלטה תכנונית, לא חיסרון

מודל מגולם עם חלון של 36,864 טוקנים נשמע כמו טעות עד שמסתכלים על מה ש-Perceptron בנתה לצידו. Mk1.5 מקבל שדה asset_idx, כך שבקשה אחת יכולה להתייחס למספר תמונות או סרטונים ולפנות לכל אחד בנפרד. היא מגבילה אודיו ל-16,384 טוקנים לכל פריט — התיעוד של Perceptron מעריך שזה בערך 21.8 דקות של דיבור בקצב של כ-750 טוקנים לדקה. והסיבה שהחלון יכול להישאר קטן היא שהמשימה מצומצמת: למצוא ולעקוב אחר דברים ספציפיים בפריימים, לענות עליהם, לעצור.

זהו סוג עבודה שונה מזה של Gemma 4 12B. חלון של 256K נועד להחזיק מסמך, מאגר קוד או שיחה ארוכה, ולבצע הסקה על פני כולו. החלון של Mk1.5 הוא תקציב למשימת תפיסה אחת עם תשובה מובנית, ו-Perceptron כיוון את גודלו לאותה משימה ולא לטבלת דירוג. המקום שבו ההבדל מורגש הוא ברגע שבו המשימה שלך היא "צפה בכל סרטון הבדיקה הזה באורך 40 דקות וספר לי הכול" — חלון של 36K לא יכיל בבת אחת את התמלול, את הפריימים ואת התשובה, והחלון של Gemma 4 12B יחד עם ציון שחזור ההקשר הארוך שלו הוא הכלי ההוגן למשימה הזאת.

המחצית השנייה של אותה עסקה היא מהירות. Perceptron מדווחת על מהירות מקצה לקצה של עד פי 4.7 מהר יותר מחציון של שלוש הרצות על H100 בודד, עם הסתייגות שפי 4.7 הוא הטוב מבין שלוש מדידות ולא המקרה הטיפוסי: תשובות צ'אט עברו מ-5.2 שניות ל-1.1, QA של תמונות עבר מ-1.7 שניות ל-0.51 (בערך פי 3.3), וסרטון של 60 שניות במקביליות של שמונה עבר מ-19 שניות ל-9.1 (בערך פי 2.1). בעומס העבודה של הווידאו שסוכן מגולם באמת מריץ, המכפיל האמיתי הוא בערך פי שניים.

אחד מאלה נמדד על ידי מישהו אחר

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing the Apache 2.0 licence, Google DeepMind authorship, the gemma4_unified image-text-to-text pipeline tag, and the card text that Gemma 4 models handle text, image and audio input (audio supported on E2B, E4B and 12B) and generate text output, with a context window of up to 256K tokens and multilingual support in over 140 languages.

זו האסימטריה הנקייה ביותר במפגש, וזה בכלל לא צמוד.

ל-Gemma 4 12B יש כרטיס הערכה של ספק ומדד של צד שלישי. הכרטיס נושא נתונים שדווחו על ידי הספק — MMLU Pro 77.2, GPQA Diamond 78.8, MMMU Pro 69.1, LiveCodeBench v6 72.0, AIME 2026 ללא כלים 77.5, Tau2 בממוצע על פני שלוש הרצות 69.0 — ויש נקודת חולשה כנה אחת ב-MRCR v2 8-needle ב-128k, שמגיעה ל-43.4 והיא השורה שכדאי לקרוא לפני שמניחים שחלון 256K מתנהג כמו כזה בקצה המרוחק. מעל זה יושבת מדידה בלתי תלויה: Artificial Analysis מציבה את Gemma 4 12B במדד אינטליגנציה של 14, במקום ה-22 מתוך 142 מודלים בקטגוריה שלו, ב-113.7 טוקני פלט לשנייה — מקום 20 מתוך 142 במהירות — עם מחיר מחירון של $0.10 לקלט ו-$0.30 לפלט למיליון טוקנים.

ל-Perceptron Mk1.5 אין שום דבר מהסוג הזה. אין רשומה במדד Artificial Analysis ואין ציון בזירה ל-Mk1.5 או ל-Mk1, כך שכל נתון יכולת שקיים עבור המודל הזה הופק בידי החברה שמוכרת אותו. הסט הזה ספציפי ולא מעורפל, וכדאי לקרוא אותו: 0.9433 ב-egocentric hand_box לעומת 0.4467 עבור Gemini 3.1 Pro ו-0.6179 עבור ה-Gemini הטוב ביותר בהרצה של Perceptron עצמה; EgoSchema 80.40 לעומת 81.20 עבור אותה מתחרה, הפסד של 0.80 נקודות במדד ההבנה הרחב, עם יתרון נטען של 12% בתת-הקבוצה EgoSchema-hard עם 63.75; 0.647 centre-F1 ו-0.628 point-HOTA ב-Molmo2-Track; DailyOmni 74.67 ו-AVHBench 80.56 בצד האודיו. הדפוס במספרים האלה — מכריע בגיאומטריה עדינה, בערך באותה רמה או מעט מאחור בהבנת וידאו כללית — עקבי, והוא תואם את סיפור המוצר. אבל בנצ'מרק של ספק על המודל שלו עצמו הוא הצהרה בלבד, ושני המודלים במאמר הזה אינם מתוארים באותו סוג של ראיות.

שורה אחת בטבלה הזו ראויה לאזהרה ספציפית. השוואת המעקב של Perceptron מפרטת את Qwen3-VL-8B ב-0.180 centre-F1, שמקורו במאמר של אותו מודל, לצד מספרים מדודים עבור המודל שלה עצמה, ומצוותת אותו עם Qwen3.5-27B ב-0.530 וב-0.476 על פני צ'קפוינטים ומערכי הערכה שונים. נתון ממאמר בעמודה של נתונים מדודים אינו שורה להשוואה בתנאים זהים, והוא מסוג השורות שמצוטטות בלי ייחוס המקור שלהן. אותה זהירות חלה במהופך על תוצאות 56.0 של Mk1.5 ב-LiveVQA-W עם כלים מופעלים — הנתון הזה מגיע מהצבעת רוב על ארבע דגימות, בעוד שה-53.2 שאיתו הוא מושווה עבור Gemini 3.8 Flash עם עיגון חיפוש אינו כזה, והצבעת רוב על ארבע דגימות היא טכניקה לגיטימית שמחמיאה לציון ביחס למעבר חמדני בודד.

תמחור עומס עבודה ממשי

המחירונים קרובים יותר זה לזה מאשר המוצרים. Perceptron Mk1.5 עומד על $0.15 למיליון טוקני קלט ו-$1.50 למיליון טוקני פלט, כשקלט במטמון עומד על $0.0375 — בדיוק רבע מתעריף הקלט הסטנדרטי, וזול יותר לכל טוקן במטמון מאשר הקלט הסטנדרטי של Gemma 4 12B במחיר $0.10. Gemma 4 12B רשום במחיר $0.10 ו-$0.30 בהרנס של צד שלישי שמודד אותו, והוא Apache 2.0, כך שאירוח עצמי מסיר לחלוטין את העלות השולית אם יש לך את החומרה.

שני דברים מסבכים השוואה ישרה והם מצביעים בכיוונים מנוגדים. ראשית, ב-Mk1.5, ה-reasoning_effortמוגדר כברירת מחדל ל-high, מה שאומר שכל קריאה שאינך מגדיר קונה את מסלול החשיבה היקר ביותר שהמודל מציע; הורדה ל-medium או ל-low היא שינוי של שורה אחת עם השפעה ישירה על החשבון, וזה הניסוי הזול ביותר בגרסה. שנית, Gemma 4 12B מאפשר לך לכבות את שלב החשיבה לחלוטין, מה שמשנה גם את החשבון וגם את ההשהיה, ובמשימה קבועה כמו סיווג ברמת פריים, הרצה ללא חשיבה היא לעתים קרובות ההרצה הנכונה.

בואו נעשה את החשבון על משהו אמיתי: צינור ראייה ממוחשבת שמעבד 40,000 פריימים ביום, בכאלף טוקנים של קלט תמונה כל אחד. אלה 40 מיליון טוקני קלט ביום. לפי תעריף הקלט של Mk1.5, 0.15 דולר, עם פריימים במטמון כשהסצנה אותה סצנה חוזרת, אתם בטווח של ספרות בודדות נמוכות של דולרים ביום עבור קלט — זול בכל קנה מידה. Gemma 4 12B בתעריף קלט של 0.10 דולר זול עוד יותר, ובחינם בשוליים אם אתם מארחים בעצמכם. אף אחד מהמודלים אינו יקר. ההחלטה כאן אינה החלטת תקציב; זו שאלה של האם אתם צריכים קואורדינטות, חלון של 256K, או את שניהם.

קריאה לשניהם ללא אינטגרציה נוספת

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, and JSON Schema and regex constrained responses) and the Pricing table beneath it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

המכשול המעשי להרצת ההשוואה הזו אינו המחיר — הוא ש-Perceptron Mk1.5 ו-Gemma 4 12B אינם באותו קטלוג. אף אחד מהם אינו מנותב ב-OrcaRouter כיום: פריטי Gemma 4 שאנו מגישים הם גרסאות 31B Instruct ו-26B-A4B, ול-Mk1.5 אין נתיב כלל, לכן ההנחיה הכנה היא להגיע אל Mk1.5 דרך ה-API של הספק עצמו בכתובת api.perceptron.inc — pip install "perceptron>=0.4.0", עם מפתח ב-PERCEPTRON_API_KEY — ואת Gemma 4 12B, בין אם דרך מארח צד שלישי ובין אם על ידי הגשת משקולות Apache-2.0 בעצמך.

למה שכבת ניתוב באמת נועדה בסיטואציה הזו היא ההחלטה שטרם קיבלת. אם הפלט המובנה של Mk1.5 הוא מה שהאפליקציה שלך צריכה והחלון של Gemma 4 12B הוא מה שעומס העבודה האחר שלך צריך, אלו שתי אינטגרציות ושני תחומי כשל; הצבתן מאחורי נקודת קצה אחת תואמת OpenAI עם מעבר אוטומטי לגיבוי פירושה שתקלה של ספק באחד מהצדדים הופכת לגיבוי במקום לעבודה שנכשלה, וכלל ניתוב יכול לשלוח את עבודת הגיאומטריה ואת עבודת ההקשר הארוך למודלים שונים בלי שהאפליקציה שלך תדע מה זה מה. כאשר ספק משנה את מחירון התעריפים שלו, נתב מעביר מחייב לפי מחיר המחירון של הספק, כאשר לא מתווסף דבר לכל טוקן, כך שהשינוי נכנס לתוקף באותו יום ולא במחזור החיוב הבא שלך. ה-DSL של הניתוב הוא גם הדרך שבה היית עורך השוואה — הקצאת חלק מהתעבורה האמיתית לכל מודל, נמדדת על הפריימים שלך, במקום ויכוח על בנצ'מרק.

איזה מהם אתה בעצם רוצה

בחר ב-Perceptron Mk1.5 אם התשובה חייבת להיות קריאה למכונה. אם אתה מפעיל משהו, או מתעד משהו שבו מיקום וזמן הם העיקר, שום כמות של חלון הקשר נוסף לא מהווה תחליף לקואורדינטה מוקלדת, ו-Mk1.5 הוא המודל היחיד בזיווג הזה שמייצר אחת. היכנס לזה בעיניים פקוחות לגבי שלושה דברים: תקציב של 36,864 טוקנים, הגבוהה, ברירת המחדל של חשיבה, והעובדה שכל מספר יכולת שמצורף אליו הוא של הספק עצמו.

הדרך הזולה ביותר להכריע בכך היא לנתב חלק מהתעבורה האמיתית לכל אחד ולמדוד על הפריימים שלך; שניהם נמצאים מאחורי נקודת קצה אחת תואמת OpenAI ב-OrcaRouter, וזה מה שהופך בדיקה זה לצד זה לשורת קונפיגורציה במקום אינטגרציה שנייה.

קח את Gemma 4 12B אם אתה צריך להכיל הרבה חומר, אם אתה צריך את המשקולות, או אם אתה צריך להצדיק את הבחירה בפני מישהו שלא מאמין לבנצ'מרקים של ספקים בעיניים עצומות. יש לו אינדקס עצמאי, כרטיס הערכה שפורסם, רישוי Apache 2.0 וחלון גדול פי שבעה — והוא יתאר סצנה במקום למדוד אותה. המשפט האחרון הזה הוא כל ההחלטה. אחד מהמודלים האלה הוא ג'נרליסט שאתה יכול להחזיק בבעלותך ולבקר; האחר הוא מומחה שאתה שוכר כי הוא מחזיר גאומטריה, והעובדה שלמומחה יש חלון קטן יותר ואין לו ציון מצד שלישי אינה סתירה. כך נראה מבחוץ כלי שנבנה באופן צר.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית