
Jev לעומת Laya: 33 מילישניות על T4, וקו בסיס אקראי
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
כרטיס המודל של Laya מכיל את המשפט שמכריע בהשוואה הזו, והוא נכתב על ידי האנשים שיצרו את Laya. "Laya הוא בסיס מהיר להתמחות, לא מנוע החלטות zero-shot." Convai Innovations שחררה את Laya ב-18 בספטמבר 2026, שלושה ימים לאחר ש-TypeSafe AI השיקה את Jev, תחת Apache 2.0, עם משקלות ב-Hugging Face וגם pip install laya כנקודת כניסה. זה עונה על שאלות מוקלדות במעבר קדימה אחד ללא פענוח טוקן-אחר-טוקן, וזה אותו הימור ארכיטקטוני ש-Jev עושה. הטענה המרכזית היא השהיית p50 של 32.8 מילישניות להחלטה על Tesla T4, שממוסגרת כבערך פי 7.8 מהירה יותר מ-p50 שפורסם של Jev של 236–276 מ"ש דרך ה-API המתארח שלו. הטענה אמיתית והיא גם מודדת שני דברים שונים — GPU מקומי מול קריאת רשת — ותמונת הדיוק שמתחתיה היא החלק שאמור לקבוע אם תורידו אותה. Zero-shot, Laya מקבלת 0.362 במבחן ההחלטות המוקלדות של TypeSafe. ניחוש אקראי מקבל 0.318. קו הבסיס של מחלקת הרוב מקבל 0.461. Laya, מחוץ לקופסה, קרובה יותר לאקראי מאשר לקו הבסיס הטריוויאלי.
מהי לייה בעצם

Laya מגיעה כשני צ'קפוינטים מאחורי נתב מובנה שמנתב כל קלט אל הנכון מביניהם. צ'קפוינט האנגלי הוא ModernBERT-large עם 421M פרמטרים וחלון הקשר של 512 טוקנים. הווריאנט הרב-לשוני הוא mmBERT-base עם 322M פרמטרים וחלון של 1,024 טוקנים בלמעלה מ-100 שפות. שניהם אינם אוטורגרסיביים: מעבר קדימה בודד מחזיר את התשובה, כך שאין לולאת פענוח, אין JSON לפענח, ואין מרחב שבו ניתן לפלוט טקסט מחוץ לטיפוס המוצהר. התכונה האחרונה הזו היא אותה ערובה מבנית ש-Jev מציע, שהושגה מכיוון אחר, והיא באמת בעלת ערך לכל מי שכתב לוגיקת ניסיונות חוזרים סביב מודל שלעתים שוכח לסגור סוגר מסולסל.
Jev הוא המקבילה הסגורה: המודל הראשון של TypeSafe AI מסוג System One, שהושק ב-15 בספטמבר 2026, מתארח בגישה מוקדמת, עם שלושה פרימיטיבים טיפוסיים — Choice מתוך רשימה שאתה מספק, Score על רובריקה מסודרת, ו-Noul, טענת כן/לא עם הסתברות מכוילת. כל השאלות מוערכות במקביל מול קריאה משותפת אחת של המצב, הפלט הוא בחינם כי אין טוקנים של פלט, והקלט הוא $0.042 למיליון טוקנים. הארכיטקטורה, מספר הפרמטרים וחישוב האימון שלו אינם נחשפים, ו-TypeSafe אמרה שהפרטים נשמרים קרוב לחזה, עם מאמר שאולי יופיע מאוחר יותר.
טענת ההשהיה, מדודה כראוי
ה-32.8ms p50 של Laya על T4 הוא מספר אמיתי וטוב. ההשוואה של פי 7.8 מול 236–276ms של Jev היא המקום שבו נדרשת זהירות, והכרטיס של Laya עצמה כנה באופן יוצא דופן לגבי הסיבה: נתוני Jev הם מספרים שפורסמו על ידי צד שלישי ש-Convai מעולם לא מדדה בעצמה, וההשוואה מעמידה מעבר קדימה מקומי על GPU מול קריאת API מתארחת שכוללת הלוך-חזור ברשת ותורים. אם מוציאים את הרשת מהמשוואה, ההשוואה הארכיטקטונית היא בין שני מודלים חד-מעבריים, אחד עם 421M פרמטרים ואחד בגודל שלא נחשף ואשר TypeSafe מעולם לא פרסמה.
יש גם מספר באצ'ינג שכדאי להכיר: בבאצ' של עשרה, Laya מדווחת 7.2 מ״ש לשאלה. זה האופי של המוצר. Laya בנויה לרוץ מקומית בהיקף גבוה, ופורטים קהילתיים על המכשיר כמו laya-mlx מרחיבים זאת ל-Apple Silicon. טענות ויראליות ל"מהירות פי 50 מ-Jev" אינן נתמכות על ידי מדדי הביצועים המפורסמים של הפרויקט עצמו, והמסגור הכנה הוא פער גדול בין מקומי לענן, שחלקו ארכיטקטוני וחלקו פשוט ההבדל בין ה-GPU שלך ל-API של מישהו אחר.
מה מספרי הדיוק אומרים, לפי הסדר
כאן ההשוואה מפסיקה להיות מחמיאה, וכדאי לפרוס אותה ברצף, מפני שלסדר יש חשיבות.
• זירו-שוט בבנצ'מרק typed-decisions של TypeSafe — Laya 0.362, אקראי 0.318, מחלקת-רוב 0.461, Jev 0.727. Laya מעל לרמת הניחוש ומתחת לקו הבסיס הטריוויאלי.
• מכוונן עדין על מחיצת האימון של הבנצ'מרק עצמו — Laya 0.766 לעומת 0.727 של Jev. Laya מנצחת, והניצחון מגיע מצ'קפוינט שראה את נתוני האימון של הבנצ'מרק, מה שהופך את זה להצהרה על כיוונון עדין, לא על מודל הבסיס.
• סיווג כוונות Banking77, שבו מערך האפשרויות גדול — Laya 0.425 לעומת 0.870 של Jev. Laya מתדרדרת בחדות מעבר ל-20 אפשרויות בערך, ושדות ה-Choice של Jev מתועדים להתמודד עם עד 255 לפני שנדרש דפוס הניקוד הדו-שלבי.
• כיול — Laya מגיעה עם שגיאת כיול צפויה ממוצעת של 0.466, המשתפרת ל-0.081 רק לאחר התאמת טמפרטורה מחדש לפי סוג שאלה. Jev מאומן בשיטה ש-TypeSafe מכנה RLCD, Reinforcement Learning for Calibrated Decisions, ומספק כל תשובה עם התפלגות הסתברות — אם כי TypeSafe גם אומרת למשתמשים לאמת ספים על הנתונים המתויגים שלהם, וביקורת בלתי תלויה אחת מצאה כי הכיול של Jev משתנה בחדות לפי משימה.
התבנית חד-משמעית. Laya הוא בסיס חזק לכוונון עדין ומנוע החלטות חלש ב-zero-shot, וזה גם מה שהוא מצהיר על עצמו. Jev הוא מנוע החלטות חזק ב-zero-shot, אך הכיול שלו עדיין צריך להיבדק בכל פריסה. אלה מוצרים שונים עם מבני תמחור שונים, והבחירה ביניהם היא בעיקר שאלה של האם יש לך נתונים מתויגים ולולאת אימון.
חשבון העלויות אינו באותה צורה כמו זה של ג׳ב
Jev עולה $0.042 למיליון טוקני קלט, כשהפלט בחינם, שהם $42 למיליארד, וקריאה בגודל מקסימלי בתקציב הבקשה המתועד של כ-32,000 טוקנים עולה הרבה פחות מסנט. בבדיקה העצמאית של Every, 777 שיפוטים על פני 37 מסמכים הסתכמו בכרבע סנט בערך.
העלות לכל קריאה של Laya היא אפס בשוליים ולא-אפס במצטבר, והמצטבר אינו קטן. מודל עם 421 מיליון פרמטרים על T4 זול להרצה ועדיין עולה לך GPU, ושלב הכיוונון העדין שהופך את Laya לתחרותי הוא המקום שבו יושבת ההוצאה האמיתית — תיוג הנתונים, הרצת האימון, מערך ההערכה, והתאמת הטמפרטורה מחדש לפי סוג שאלה, שלוקחת את שגיאת הכיול מ-0.466 ל-0.081. עבור טקסונומיה קבועה שלעולם אינה משתנה, זוהי עלות חד-פעמית שמחזירה את עצמה בנפח שימוש. עבור טקסונומיה שנסחפת, זוהי עלות חוזרת, וקו הבסיס זירו-שוט של Jev של 0.727 הופך לעסקה טובה בהרבה.
יש עלות שלישית שקל לפספס: לצ'קפוינט האנגלי של Laya יש חלון הקשר של 512 טוקנים. זה אינו מודל החלטות עם תקציב הקשר קטן — זהו מודל החלטות שמותאם לפסקה. תקציב הבקשות של Jev, כ-32,000 טוקנים, גדול פי שישים, ואפילו הוא קטן בסדר גודל מהמודלים הגנרטיביים ששניהם מתומחרים לעומתם. אם המצב שלך הוא שרשור תמיכה ולא הודעת תמיכה, החלון של אף אחד מהמודלים אינו האילוץ שכנגדו כדאי לך לבצע אופטימיזציה.
שאלת הפריסה היא ההבדל האמיתי

הטיעון החזק ביותר של Laya אינו השהיה. אלא שמשקולות Apache 2.0 ב-Hugging Face פירושן שההחלטה לעולם אינה יוצאת מהתשתית שלך ולנקודת הקצה אין לעולם מגבלת קצב. עבור החלטת ניתוב שמתקבלת על בסיס רשומה רפואית, מסמך משפטי או היסטוריית חשבון של לקוח, אין מדובר בהעדפה — זהו הגורם המכריע, ואף נקודת קצה מתארחת בכל מחיר לא תנצח בטיעון הזה. Jev של TypeSafe נמצא בגישה מוקדמת וברשימת המתנה, והתיעוד שלו עצמו מציין שמגבלות הקצב עשויות להשתנות ללא הודעה מוקדמת.
הטיעון הנגדי הוא מה שאתה מוותר עליו. הארכיטקטורה הגדולה יותר של Jev, שלא נחשפה, עושה את העבודה שפרמטרי ה-421M של Laya לא יכולים לעשות: פער ה-zero-shot של 0.727 לעומת 0.362 ופער ה-Banking77 של 0.870 לעומת 0.425 הם שניהם מדדים לכמה ידע טמון בתוך המודל לפני שאתה מאמן אותו. התשובה של Laya היא שאתה מספק את הידע הזה בעצמך באמצעות כיוונון עדין, ובתחום צר וקבוע התשובה הזו עובדת — תוצאת ה-0.766 לאחר כיוונון עדין היא ההוכחה.
היכן שכבת ההחלטה יושבת בסטאק אמיתי
אף אחד מהמודלים לא מייצר טקסט, כך שאף אחד מהם אינו מהווה את כל תהליך העבודה. התבנית ששניהם מיועדים לה היא שני מודלים: שכבת החלטה שמבצעת קריאה עם טיפוס, ומודל גנרטיבי שמטפל בחלק שדורש פרוזה, קוד או הסבר. OrcaRouter לא משרת את Jev או Laya — Jev הוא נקודת קצה בגישה מוקדמת של TypeSafe ו-Laya הם משקולות שאתה מריץ בעצמך — אבל החצי הגנרטיבי של התבנית הזו הוא בדיוק מה שאנחנו מכסים: יותר מ-200 מודלים מאחורי מפתח יחיד תואם OpenAI במחיר מחירון של ספק מועבר עם 0% תוספת, כך ששינוי מחיר של ספק נכנס לתוקף אצלנו באותו יום. ניתן לבחון את הארכיטקטורה של שני המודלים ללא חוזה עם ספק שני, ועם failover אוטומטי המסלול הגנרטיבי אינו הופך לנקודת כשל יחידה בזמן שאתה מחליט אם שכבת ההחלטה הזולה מכוילת מספיק טוב כדי להסתמך עליה באוטומציה.
פסק הדין
אם יש לך טקסונומיה קבועה וצרה, דוגמאות מתויגות, ודרישת פרטיות או השהיה ששוללת API באירוח חיצוני, Laya היא הבחירה המוצדקת יותר והמספרים של הכוונון העדין תומכים בכך. אם אתה צריך שההחלטה תעבוד מיד ללא הגדרה, אם מערכי האפשרויות שלך חורגים מעשרים קטגוריות, או אם המצב ארוך מפסקה, כרטיס המודל של Laya עצמה אומר לך שזה לא המוצר למשימה הזאת — וציון ה-zero-shot של 0.362 לעומת בסיס רוב של 0.461 הוא המספר שכדאי לשמור לנגד העיניים כאשר מישהו מצטט בפניך את נתון ההשהיה של פי 7.8.
מה שמשותף לשניים שימושי יותר ממה שמפריד ביניהם. שניהם מחסלים את סוג השגיאה שנובע מעיצוב הפלט, ואינם עושים דבר בנוגע לסוג הנובע משיקול דעת. שניהם מספקים הסתברויות, ולאף אחד מהם אין תרשים מהימנות מפורסם שאפשר לסמוך עליו בלי לבדוק. בדקו את הכיול על מקרים מתויגים משלכם לפני שאתם מאוטמטים מול מי מהם — זמן האחזור כבר הפך לסחורה זולה, וערך הביטחון הוא החלק שצריך להרוויח בכל פריסה.

