כרטיס כותרת מיוצר להשוואה בין Laya ל-Kev, הנושא את כותרת המשנה של מאמר זה ואת שורת הכותרת התחתונה שמציינת אילו נתונים של כל צד מדווחים על ידי הספק ואילו הם של צד שלישי.
Engineering & Research

Laya מול Kev: שני מתכונים למודל החלטה מקומי

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

המספר השימושי ביותר בהשוואה בין Laya ל-Kev הוא קבלה. ג'ארד פאלמר אימן את משפחת Kev תמורת כ-95 דולר של זמן H100 על Modal, בתוספת כשלושה סנטים של קריאות API עבור נתוני הערכה, ופרסם את המתכון לצד המשקלים. Convai Innovations בחרה בדרך האחרת עם Laya: שוחררה ב-18 בספטמבר 2026, שלושה ימים אחרי Jev של TypeSafe AI, Apache 2.0, משקלים ב-Hugging Face, pip install laya כנקודת כניסה, וללא צינור אימון — צ'קפוינט אנגלי ModernBERT-large עם 421M, צ'קפוינט רב-לשוני mmBERT-base עם 322M, ונתב שבוחר ביניהם. Kev היא משפחה של שלושה מודלים קטנים בגודל 0.8B, 4B ו-9B, שכל אחד מהם כולל בסיס קפוא בתוספת מתאם LoRA בדרגה 16 וראש מצביע קטן. שניהם עונים על שאלות עם טיפוסים במעבר קדימה אחד, ואף אחד מהם לא מייצר טקסט. ההחלטה ביניהם היא למעשה החלטה לגבי איזה ארטיפקט ברצונך להחזיק בבעלותך: צ'קפוינט או מתכון.

מה כל פרויקט למעשה משחרר

Laya כוללת הסקה. הצ׳קפוינט האנגלי הוא מקודד דו-כיווני עם חלון של 512 טוקנים; הרב-לשוני מכסה יותר מ-100 שפות בחלון של 1,024 טוקנים ורץ בערך פי שניים מהר יותר; הנתב מזהה כתב בתוך פחות מחצי מילי-שנייה. היא עונה choice, score ו-noul — בחירה מתוך רשימה, רמה צפויה במחוון סדור, והסתברות מכוילת לכך שטענה נכונה. יש צ׳קפוינט שלישי, laya-typed-decisions, שהוא אותו שלד של 421M שעבר כיוונון עדין על חלוקת האימון של בנצ׳מרק typed-decisions. כרטיס המודל של Convai עצמה מכיל את המשפט שאמור להכתיב כיצד לקרוא כל נתון של Laya: "Laya היא בסיס מהיר להתמחות, לא מנוע החלטות ללא דוגמאות."

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.A screenshot of the Kev repository on GitHub, showing the description "tiny Jev-like family of decision models built on top of Qwen3.5 you can train and run on your own", the Apache-2.0 licence, and the Kev-0.8B, Kev-4B and Kev-9B releases.

Kev מספקת שיטה. המאגר מתעד את decision-v7: שני אפוקים על 10,000 דוגמאות שנלקחו מעשרה מערכי נתונים ציבוריים, 896 דוגמאות מדיניות שנוצרו, ו-1,680 דוגמאות שנבנו מ-60 מבני כללים שנוצרו. הראש מדרג כל אפשרות שסופקה מול אסימון ה-decide של השאלה ומחיל softmax על התוצאה. מכיוון שצ'קפוינטים של Qwen3.5 משלבים קשב עם שכבות Gated DeltaNet רקורנטיות שמתעלמות ממסכות קשב, כל שאלה רצה כשורה נפרדת משל עצמה כאשר המצב המשותף מחושב פעם אחת ונשמר במטמון — וכך המודל שומר על בידוד השאלות זו מזו בלי לשלם על prefill חדש לכל שאלה. Kev משקפת את החוזה הציבורי /v1/systemone של TypeSafe, כך שלקוח TypeSafe SDK קיים יכול להצביע על שרת Kev מקומי על ידי שינוי כתובת הבסיס. קובץ ה-README מציין שלא נעשה שימוש בפלטים של Jev באימון.

שני מצבי הכשל שונים, וזה הסיפור האמיתי

שני המודלים מפסידים לג'ב במשימות שדורשות ידע, אבל הם מפסידים בדרכים שמחייבות מיטיגציות שונות.

החולשות שפורסמו של Laya נוגעות לצורת הקלט. במבחן typed-decisions של TypeSafe היא משיגה 0.362 ב-zero-shot, לעומת 0.318 לניחוש אקראי ו-0.461 לקו הבסיס של מחלקת הרוב — קרוב יותר למקריות מאשר לתשובה הטריוויאלית. מעבר לכ-עשרים אפשרויות היא מתפרקת: 0.425 ב-Banking77 לעומת 0.870 של Jev. היא רגישה כל כך לסדר, שפשוט היפוך סדר האפשרויות הוריד את הדיוק ב-13.75 נקודות באחד ממבחני צד שלישי, והותיר שיעור תשובות זהות של 42.5%. ונקודות הביקורת המסופקות מגיעות עם טמפרטורות לא תקינות — הספרייה מזהירה בעת הייבוא, מה שאומר שנתון הכיול על הכרטיס, שגיאת כיול צפויה של 0.466, הוא המספר שאתם מקבלים בפועל לפני שאתם מכיילים מחדש. כיול מחדש לפי סוג שאלה מביא אותו ל-0.081, אבל זו עבודה שאתם עושים, לא עבודה שההורדה עושה. יש כשל רב-לשוני שפורסם ששווה לקרוא במלואו: בכתבים לא-לטיניים נקודת הביקורת האנגלית היא בעלת ביטחון עצמי מופרז באופן קטסטרופלי, עם דוגמת חמר שמראה דיוק של 0.000 בביטחון ממוצע של 0.952.

החולשות המפורסמות של Kev הן בידע ובחשבון. Kev-9B משיג 0.837 במבחן המקורות החדשים הנעול שלו — 0.832 עבור ה-4B ו-0.668 עבור ה-0.8B — וכ-0.822 מחוץ לתחום בפיצול ה-dev לעומת 0.857 של Jev. הפער נפתח במקום שבו נדרש ידע עולם: MMLU סביב 70% לעומת 90% של Jev, MMLU-Pro 0.515 לעומת 0.840, וחשבון תאריכים בדיוק יומי 60% לעומת 93%. על סט ניתוב צר עם תוויות קבועות הוא מנצח — הערכת ניתוב של כרטיסי תמיכה הציבה את Kev-9B ב-0.952 לעומת 0.897 של Jev — אבל המחבר מבהיר שזה ההרנס שלו, שנתוני האימון של Jev אינם גלויים, ולכן לא ניתן לבנות השוואה מבוקרת. Kev גם נשאר בטוח מדי במקורות חדשים; הגדרת KEV_TEMPERATURE=2.0 הפחיתה שגיאות בטוחות מ-8.7% ל-4.4% בבדיקות של הפרויקט עצמו, מה שאומר לך שברירת המחדל אינה ההגדרה הבטוחה.

התרגום המעשי: הכשל של Laya נגרם על ידי מערך האפשרויות שלך ועיצוב הפרומפט שלך, ואתה מתקן אותו באמצעות כיוונון עדין והתאמה מחדש. הכשל של Kev נגרם על ידי שאלות שדורשות עובדות, ואתה מתקן אותו על ידי תיחום המודל לניתוב ולסיווג והשארת הקריאות התלויות בידע במקום אחר. אף אחד מהתיקונים אינו דגל תצורה.

מה שנדרש כדי לשרת אותם

• חומרה — Laya: מקודדים 421M/322M, אמינים על CPU בתפוקה נמוכה ובצריכת זיכרון מיושב של פחות מג'יגה-בייט עבור פורט ה-MLX על Apple silicon. Kev: 0.8B עד 9B, כשעבור ה-9B נדרש BF16 CUDA GPU, כאשר ארכיטקטורת Qwen3.5 דורשת flash-linear-attention על CUDA ו-ROCm.

• השהיה — Laya: 32.8ms p50 לכל החלטה על Tesla T4, 7.2ms לכל שאלה באצווה 10. Kev: כ-300ms עבור חמש שאלות מוקלדות ממודל 4B על Mac עם 32GB ב-bf16, בקירוב 40ms על H100.

• תקרות — Laya: חלון אנגלי של 512 טוקנים, 1,024 רב-לשוני. Kev: בחירה מבין 1–255 אפשרויות, ניקוד על 2–255 רמות, 384 טוקנים של מצב אימון עם 8,192 בזמן הגשה.

• שרת — Laya: Python בתהליך, בתוספת פורטים קהילתיים ל-ONNX, Go ו-Apple MLX. Kev: שרת מקומי הכבול ל-127.0.0.1 ללא אימות, SDK של npm, ומתאמים ל-LangChain ול-LlamaIndex.

• רישיון — Apache 2.0 עבור שניהם.

שתי הערות תפעוליות שאינן מופיעות במספרים הכותרתיים. השרת של Kev מטפל בבקשה אחת בלבד וללא אימות מעצם התכנון — זהו sidecar מקומי, לא משהו שחושפים. והשהיה של Kev ב-Mac גרועה באופן מהותי מהשהיית ה-H100 שלו, מפני שקרנלי DeltaNet המהירים עדיין לא קיימים עבור MLX, וזה בדיוק סוג הפרט שהופך טענה של "רץ מקומית" לטענה של "רץ מקומית על החומרה הנכונה".

החצי הגנרטיבי של התבנית

שני המודלים האלה נועדו להחליף קריאה אחת ספציפית: הפעלת ה-LLM שביצעת אך ורק כדי לקבל בחזרה תווית או הסתברות. הם לא מחליפים את הקריאות שבהן אתה באמת צריך פרוזה. מערכת תמיכה שמשתמשת ב-Kev-9B כדי לנתב כרטיס עדיין זקוקה למודל שיסכם את השרשור וינסח את התגובה, והמודל הזה לא הולך להיות LoRA 9B עם ראש מצביע.

זהו התפר ש-OrcaRouter יושבת בו, ולא טענה שהיא מארחת את מי מהשניים. לא Laya ולא Kev נמצאים ברשימת המודלים שלנו — הם משקלים שאתם מורידים — והמאמר היה מטעה אילו רמז אחרת. מה שכן נמצא ברשימה הוא למעלה מ-200 מודלים גנרטיביים מאחורי מפתח יחיד תואם OpenAI במחיר המחירון של הספק מועבר הלאה עם תוספת של 0%. אם אתם משתמשים ב-Kev כדי להחליט לאיזו משלוש דרגות סיכום בקשה שייכת, או משתמשים ב-Laya כדי לדרג האם טיוטת תשובה מקובלת, הצד הגנרטיבי של שתי הלולאות הוא נקודת קצה אחת עם מעבר אוטומטי לגיבוי במקום חוזה שני ו-SDK שני. ה-DSL של הניתוב הוא הרכיב שהכי מתאים לארכיטקטורת מודל החלטות: חברו מודל זול ומודל יקר לקריאה אחת ותנו לפלט של מודל ההחלטות לבחור את הענף.

מה לצפות בהמשך

הפער בראיות זהה לשניהם, והוא לא ייסגר על ידי אף אחד מהפרויקטים. אף אחד לא הריץ את Laya ואת Kev על קלטים זהים ברמת הבייטים, עם אותם פרומפטים, אותו סדר אפשרויות ואותה סריקת סף ביטחון. הניצחונות הבולטים של Laya מגיעים מהארנס שלה עצמה; טענות הכמעט-שוויון של Kev מגיעות מהארנס של מחברו; ביקורת הכיול שמצאה שהכיול של Jev משתנה בחדות לפי משימה — דיוק של 44.7% ושגיאת כיול צפויה של 0.325 במשימת עדיפות עם מדיניות נסתרת — הייתה של צד שלישי, ולא Laya ולא Kev קיבלו את הטיפול הזה. עד שמישהו יעשה זאת, המספרים שלעיל הם הטובים ביותר הזמינים והם אינם ניתנים להשוואה זה לזה.

אם אתם מחליטים היום: בחרו ב-Kev אם אתם רוצים מודל ניתוב עובד כבר השבוע על GPU שאתם כבר שוכרים, וקבלו את העובדה שהוא לא ידע דברים. בחרו ב-Laya אם הקלטים שלכם רב-לשוניים או שתקציב החומרה שלכם הוא מחשב נייד, ותקצבו את הכוונון העדין כחלק מהפרויקט ולא כאופטימיזציה מאוחרת יותר. כך או כך, מדדו על הנתונים המתויגים שלכם לפני שאתם שמים סף ביטחון לפני תעבורת ייצור — שני הפרויקטים, בתיעוד שלהם עצמם, אומרים לכם לעשות זאת.

A generated two-column scoreboard comparing Laya and Kev across backbone, context window, latency, benchmark accuracy, many-option performance and licence, with a footer reading "Kev figures are the author's own harness; Laya figures per its model card."