מדורג לפי תעבורת ייצור אמיתית של OrcaRouter והצבעות במצב קרב (Battle Mode) של הקהילה — לא לפי בנצ'מרקים המדווחים על ידי הספקים.
עודכן 2026-07-245 מקורות ראיותמודלים חדשים מופיעים תוך 48 שעות
נמדד על תעבורה אמיתית
100.0%
אחוז ההצלחה הגבוה ביותר (7 ימים)
openai/gpt-5.1-chat-latest
361 ms
זמן השהיה p50 המהיר ביותר
OpenAI: GPT-5.1-Codex
80.1%
אחוז הניצחון הגבוה ביותר בקהילה
Qwen3.7 Max (2026-05-20)
דירוג מאוחד
דירוג משולב אחד לכל מודל — הצבעות LMArena, בנצ'מרקים עצמאיים, אימוץ אקוסיסטמה וראיות ייצור של OrcaRouter, עם משקלים ציבוריים קבועים. מודלים חדשים נכנסים מראיות חיצוניות מהיום הראשון.
AA 46.0מדד האינטליגנציה של Artificial Analysis — בנצ'מרק משולב עצמאי (0–100).Win 80.1%שיעור ניצחון בקרב עיוור של OrcaRouter — הקהילה שלנו, הצבעות זוגיות עיוורות.
AA 66.0מדד האינטליגנציה של Artificial Analysis — בנצ'מרק משולב עצמאי (0–100).Win 58.7%שיעור ניצחון בקרב עיוור של OrcaRouter — הקהילה שלנו, הצבעות זוגיות עיוורות.
AA 51.1מדד האינטליגנציה של Artificial Analysis — בנצ'מרק משולב עצמאי (0–100).Win 63.4%שיעור ניצחון בקרב עיוור של OrcaRouter — הקהילה שלנו, הצבעות זוגיות עיוורות.
AA 44.3מדד האינטליגנציה של Artificial Analysis — בנצ'מרק משולב עצמאי (0–100).Win 67.9%שיעור ניצחון בקרב עיוור של OrcaRouter — הקהילה שלנו, הצבעות זוגיות עיוורות.
AA 53.8מדד האינטליגנציה של Artificial Analysis — בנצ'מרק משולב עצמאי (0–100).Win 56.1%שיעור ניצחון בקרב עיוור של OrcaRouter — הקהילה שלנו, הצבעות זוגיות עיוורות.
AA 55.7מדד האינטליגנציה של Artificial Analysis — בנצ'מרק משולב עצמאי (0–100).Win 50.0%שיעור ניצחון בקרב עיוור של OrcaRouter — הקהילה שלנו, הצבעות זוגיות עיוורות.
AA 38.2מדד האינטליגנציה של Artificial Analysis — בנצ'מרק משולב עצמאי (0–100).Win 66.2%שיעור ניצחון בקרב עיוור של OrcaRouter — הקהילה שלנו, הצבעות זוגיות עיוורות.
AA 54.8מדד האינטליגנציה של Artificial Analysis — בנצ'מרק משולב עצמאי (0–100).Win 50.0%שיעור ניצחון בקרב עיוור של OrcaRouter — הקהילה שלנו, הצבעות זוגיות עיוורות.
AA 53.5מדד האינטליגנציה של Artificial Analysis — בנצ'מרק משולב עצמאי (0–100).Win 50.0%שיעור ניצחון בקרב עיוור של OrcaRouter — הקהילה שלנו, הצבעות זוגיות עיוורות.
AA 51.4מדד האינטליגנציה של Artificial Analysis — בנצ'מרק משולב עצמאי (0–100).Win 50.2%שיעור ניצחון בקרב עיוור של OrcaRouter — הקהילה שלנו, הצבעות זוגיות עיוורות.
אחוזי ניצחון זוגיים במצב קרב — באיזו תדירות כל מודל מנצח כל יריב ראש בראש.
בנצ'מארקים — אינטליגנציה מול מחיר
ציוני אינטליגנציה בלתי תלויים מוצגים מול מחיר הקלט. הקו המקווקו הוא חזית פארטו של מחיר/אינטליגנציה.
קרב עיוור
שתי תשובות אנונימיות, הצבעה אחת. הקרבות שלכם מזינים את משקל ראיות הייצור של 20% בדירוג המאוחד.
⚔️ קרב עיוור
שני מודלים אנונימיים עונים על אותה הנחיה. קראו את שתי התשובות, הצביעו למנצח, ואז גלו מי כתב מה — ההצבעה שלכם משפיעה על הדירוג למעלה.
מתודולוגיה — איך לוח המובילים הזה עובד
כל מספר בדף הזה נמדד, לעולם לא מדווח עצמית. זוהי השיטה המלאה מאחורי הדירוג המאוחד — אותם כללים לכל מודל, כל יום.
ציון משולב אחד, משקלים ציבוריים קבועים
כל מודל מקבל ציון משולב מארבע משפחות ראיות עצמאיות: העדפה אנושית עיוורת 40%, בנצ'מרקים עצמאיים 30%, ראיות ייצור של OrcaRouter 20% ואימוץ אקוסיסטמה 10%. המשקלים קבועים וציבוריים — ללא התאמות עריכה, ללא מיקום בתשלום, ללא הגשות מספקים.
מה מזין כל משפחה
ההעדפה האנושית מגיעה מהאלו הקהילתי של LMArena — הצבעות זוגיות עיוורות בזירות הטקסט והראייה (CC-BY-4.0). הבנצ'מרקים העצמאיים משלבים את Artificial Analysis (מדד האינטליגנציה בתוספת כתיבת קוד, מתמטיקה, GPQA Diamond ו-τ²-Bench) עם SWE-bench Verified, חלק בעיות GitHub האמיתיות שמודל פותר. ראיות הייצור הן של OrcaRouter עצמו: שיעורי ניצחון בקרב עיוור בתוספת טלמטריית שער חיה — שיעור הצלחה, השהיה ונפח טוקנים מנותבים. האימוץ משתמש בחלק הטוקנים המפורסם של OpenRouter.
איך ציונים הופכים להיות ניתנים להשוואה
מקורות מדרגים בסולמות שונים (Elo, מדדי 0–100, אחוז נפתר), כך שכל אות מתוקנן מול הלוח הנוכחי וממופה ל-0–100: 50 הוא ממוצע הלוח וכל 15 נקודות הן סטיית תקן אחת, מוגבלות בקצוות. מודל צריך לפחות שתי משפחות ראיות עצמאיות כדי להיות מדורג בכלל, והלוח מציג את 25 המובילים לפי ציון משולב.
לוחות לפי מקרה שימוש
הלוחות של טקסט, כתיבת קוד, ראייה, מתמטיקה, חשיבה ואגנטי מריצים מחדש את אותו תמהיל על אותות מתאימים למקטע — כתיבת קוד מחליפה לבנצ'מרקים של כתיבת קוד ו-SWE-bench Verified, ראייה משתמשת בזירת הראייה של LMArena — וקרבות עיוורים תמיד מזווגים מודלים רק בתוך אותו מקטע.
רעננות ומשחק הוגן
פידים חיצוניים מתרעננים יומית וטלמטריה מהצד הראשון פועלת בזמן אמת; מודלים חדשים נכנסים מראיות חיצוניות תוך 48 שעות מהשחרור. לא נעשה שימוש במספרים מדווחים עצמית מספקים בשום מקום, באזז קהילתי מוצג כהקשר אך לעולם לא מזין דירוג, וכל מקור חיצוני מיוחס תחת הלוח.
שאלות נפוצות
איך מדורג לוח מובילי מודלי ה-AI?
כל מודל מקבל ציון משולב אחד מארבע משפחות ראיות — העדפה אנושית עיוורת (LMArena), בנצ'מרקים עצמאיים (Artificial Analysis, SWE-bench), אמינות ייצור של OrcaRouter, ואימוץ אקוסיסטמה (OpenRouter) — משולבים עם משקלים ציבוריים קבועים של 40 / 30 / 20 / 10.
למה למודל חדש לגמרי כבר יש דירוג?
מודלים חדשים נכנסים ללוח מראיות חיצוניות תוך 48 שעות מהשחרור. הדירוג מתייצב ככל שקרבות קהילה ותעבורת ייצור מצטברים.
באיזו תדירות לוח המובילים מתעדכן?
פידים חיצוניים מתרעננים יומית והטלמטריה של OrcaRouter פועלת בזמן אמת; הלוח מציג את תאריך העדכון האחרון שלו בכותרת.
למה מודל חסר מהלוח?
מודל צריך לפחות שני מקורות ראיות עצמאיים כדי להיות מדורג, והלוח מציג את 25 המובילים לפי ציון משולב — מודלים עם ראיות דלות יותר נשארים לא רשומים עד שמקור נוסף יאסוף אותם.
מקרי שימוש שונים מדורגים בנפרד?
כן — הכפתורים מעל הטבלה המאוחדת עוברים בין טקסט, כתיבת קוד, ראייה, מתמטיקה, חשיבה ולוחות אגנטיים, וקרבות מזווגים רק בין דומים לדומים.
מתי הדירוג של מודל חדש מתייצב?
ברגע שמודל נושא שלוש משפחות ראיות כולל נתוני קרב ותעבורה משלו של OrcaRouter, הדירוג שלו נשען על התמהיל המלא ולא רק על ראיות חיצוניות.
מאיפה מגיעים הנתונים?
דירוגי LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench ו-OpenRouter, בתוספת טלמטריית ייצור של OrcaRouter — כולם מיוחסים תחת הלוח.
ספקים יכולים לתמרן את הדירוג הזה?
קשה: המשקלים ציבוריים, לא נעשה שימוש במספרים המדווחים על ידי הספקים עצמם, וקרבות קהילה עיוורים בתוספת תעבורה חיה מעגנים כל ציון.
אפשר לייצא או להטמיע את הנתונים האלה?
כן — ייצוא JSON ו-CSV, תג דירוג להטמעה לכל מודל, ופיד RSS של שינויי דירוג חינמיים עם ייחוס. הקישורים בכותרת התחתונה למטה.