טבלת דירוג מודלי AI

מדורג לפי תעבורת ייצור אמיתית של OrcaRouter והצבעות במצב קרב (Battle Mode) של הקהילה — לא לפי בנצ'מרקים המדווחים על ידי הספקים.

עודכן 2026-08-225 מקורות ראיותמודלים חדשים מופיעים תוך 48 שעות
נמדד על תעבורה אמיתית
100.0%
אחוז ההצלחה הגבוה ביותר (7 ימים)
Qwen: Qwen3 VL 235B A22B Thinking
416 ms
זמן השהיה p50 המהיר ביותר
DeepSeek: DeepSeek V3
80.1%
אחוז הניצחון הגבוה ביותר בקהילה
Qwen3.7 Max (2026-05-20)

דירוג מאוחד

דירוג משולב אחד לכל מודל — הצבעות LMArena, בנצ'מרקים עצמאיים, אימוץ אקוסיסטמה וראיות ייצור של OrcaRouter, עם משקלים ציבוריים קבועים. מודלים חדשים נכנסים מראיות חיצוניות מהיום הראשון.

דירוגמודלמשולבאמינות$/1M משוקללנפחמומנטוםראיות
#1Google: Gemini 3.6 Flash65.999.19% · 4146ms$4.50$1.5 → $7.5 per 1M tokens<1%Vision 1311אלו של זירת הראייה של LMArena — הצבעות אנושיות עיוורות על תשובות מולטימודליות.OR 1.7%חלק טוקנים ב-OpenRouter — אימוץ אקוסיסטמה בעולם האמיתי.
#2Anthropic: Claude Fable 564.999.26% · 6787ms$30.00$10 → $50 per 1M tokens<1%Vision 1331אלו של זירת הראייה של LMArena — הצבעות אנושיות עיוורות על תשובות מולטימודליות.OR 0.3%חלק טוקנים ב-OpenRouter — אימוץ אקוסיסטמה בעולם האמיתי.
#3Anthropic: Claude Opus 4.763.399.09% · 4345ms$15.00$5 → $25 per 1M tokens<1%Vision 1316אלו של זירת הראייה של LMArena — הצבעות אנושיות עיוורות על תשובות מולטימודליות.OR 0.5%חלק טוקנים ב-OpenRouter — אימוץ אקוסיסטמה בעולם האמיתי.
#4Qwen: Qwen3.8 Max62.599.49% · 5607ms$4.00$2 → $6 per 1M tokens<1%Vision 1315אלו של זירת הראייה של LMArena — הצבעות אנושיות עיוורות על תשובות מולטימודליות.OR 0.4%חלק טוקנים ב-OpenRouter — אימוץ אקוסיסטמה בעולם האמיתי.
#5Anthropic: Claude Opus 4.661.199.15% · 4592ms$15.00$5 → $25 per 1M tokens<1%Vision 1311אלו של זירת הראייה של LMArena — הצבעות אנושיות עיוורות על תשובות מולטימודליות.OR 0.2%חלק טוקנים ב-OpenRouter — אימוץ אקוסיסטמה בעולם האמיתי.
#6Google: Gemini 3.1 Pro Preview58.899.37% · 10000ms$7.00$2 → $12 per 1M tokens<1%Vision 1294אלו של זירת הראייה של LMArena — הצבעות אנושיות עיוורות על תשובות מולטימודליות.OR 0.3%חלק טוקנים ב-OpenRouter — אימוץ אקוסיסטמה בעולם האמיתי.
#7Anthropic: Claude Opus 4.858.799.32% · 8070ms$15.00$5 → $25 per 1M tokens<1%Vision 1290אלו של זירת הראייה של LMArena — הצבעות אנושיות עיוורות על תשובות מולטימודליות.OR 0.4%חלק טוקנים ב-OpenRouter — אימוץ אקוסיסטמה בעולם האמיתי.
#8Anthropic: Claude Sonnet 4.658.799.16% · 2675ms$9.00$3 → $15 per 1M tokens<1%Vision 1282אלו של זירת הראייה של LMArena — הצבעות אנושיות עיוורות על תשובות מולטימודליות.OR 0.8%חלק טוקנים ב-OpenRouter — אימוץ אקוסיסטמה בעולם האמיתי.
#9xAI: Grok 4.558.499.20% · 10000ms$4.00$2 → $6 per 1M tokens<1%Vision 1295אלו של זירת הראייה של LMArena — הצבעות אנושיות עיוורות על תשובות מולטימודליות.OR 0.2%חלק טוקנים ב-OpenRouter — אימוץ אקוסיסטמה בעולם האמיתי.
#10MiniMax: MiniMax M357.799.95% · 10000ms$0.75$0.3 → $1.2 per 1M tokens<1%Vision 1258אלו של זירת הראייה של LMArena — הצבעות אנושיות עיוורות על תשובות מולטימודליות.OR 2.0%חלק טוקנים ב-OpenRouter — אימוץ אקוסיסטמה בעולם האמיתי.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

חלק מהטוקנים המנותבים לפי מעבדה
deepseek 54.1%openai 23.5%tencent 7.8%obsidian 6.2%אחרים 8.5%
40%
העדפה אנושית
LMArena · Bradley–Terry
30%
בנצ'מרקים עצמאיים
Artificial Analysis · SWE-bench
20%
ראיות ייצור
OrcaRouter battles & traffic
10%
אימוץ אקוסיסטמה
OpenRouter token share

ראש בראש

אחוזי ניצחון זוגיים במצב קרב — באיזו תדירות כל מודל מנצח כל יריב ראש בראש.

בנצ'מארקים — אינטליגנציה מול מחיר

ציוני אינטליגנציה בלתי תלויים מוצגים מול מחיר הקלט. הקו המקווקו הוא חזית פארטו של מחיר/אינטליגנציה.

קרב עיוור

שתי תשובות אנונימיות, הצבעה אחת. הקרבות שלכם מזינים את משקל ראיות הייצור של 20% בדירוג המאוחד.

⚔️ קרב עיוור

שני מודלים אנונימיים עונים על אותה הנחיה. קראו את שתי התשובות, הצביעו למנצח, ואז גלו מי כתב מה — ההצבעה שלכם משפיעה על הדירוג למעלה.

מתודולוגיה — איך לוח המובילים הזה עובד

כל מספר בדף הזה נמדד, לעולם לא מדווח עצמית. זוהי השיטה המלאה מאחורי הדירוג המאוחד — אותם כללים לכל מודל, כל יום.

ציון משולב אחד, משקלים ציבוריים קבועים

כל מודל מקבל ציון משולב מארבע משפחות ראיות עצמאיות: העדפה אנושית עיוורת 40%, בנצ'מרקים עצמאיים 30%, ראיות ייצור של OrcaRouter 20% ואימוץ אקוסיסטמה 10%. המשקלים קבועים וציבוריים — ללא התאמות עריכה, ללא מיקום בתשלום, ללא הגשות מספקים.

מה מזין כל משפחה

ההעדפה האנושית מגיעה מהאלו הקהילתי של LMArena — הצבעות זוגיות עיוורות בזירות הטקסט והראייה (‏CC-BY-4.0). הבנצ'מרקים העצמאיים משלבים את Artificial Analysis (‏מדד האינטליגנציה בתוספת כתיבת קוד, מתמטיקה,‏ GPQA Diamond ו-τ²-Bench) עם SWE-bench Verified, חלק בעיות GitHub האמיתיות שמודל פותר. ראיות הייצור הן של OrcaRouter עצמו: שיעורי ניצחון בקרב עיוור בתוספת טלמטריית שער חיה — שיעור הצלחה, השהיה ונפח טוקנים מנותבים. האימוץ משתמש בחלק הטוקנים המפורסם של OpenRouter.

איך ציונים הופכים להיות ניתנים להשוואה

מקורות מדרגים בסולמות שונים (‏Elo, מדדי 0–100, אחוז נפתר), כך שכל אות מתוקנן מול הלוח הנוכחי וממופה ל-0–100: 50 הוא ממוצע הלוח וכל 15 נקודות הן סטיית תקן אחת, מוגבלות בקצוות. מודל צריך לפחות שתי משפחות ראיות עצמאיות כדי להיות מדורג בכלל, והלוח מציג את 25 המובילים לפי ציון משולב.

לוחות לפי מקרה שימוש

הלוחות של טקסט, כתיבת קוד, ראייה, מתמטיקה, חשיבה ואגנטי מריצים מחדש את אותו תמהיל על אותות מתאימים למקטע — כתיבת קוד מחליפה לבנצ'מרקים של כתיבת קוד ו-SWE-bench Verified, ראייה משתמשת בזירת הראייה של LMArena — וקרבות עיוורים תמיד מזווגים מודלים רק בתוך אותו מקטע.

רעננות ומשחק הוגן

פידים חיצוניים מתרעננים יומית וטלמטריה מהצד הראשון פועלת בזמן אמת; מודלים חדשים נכנסים מראיות חיצוניות תוך 48 שעות מהשחרור. לא נעשה שימוש במספרים מדווחים עצמית מספקים בשום מקום, באזז קהילתי מוצג כהקשר אך לעולם לא מזין דירוג, וכל מקור חיצוני מיוחס תחת הלוח.

שאלות נפוצות

איך מדורג לוח מובילי מודלי ה-AI?

כל מודל מקבל ציון משולב אחד מארבע משפחות ראיות — העדפה אנושית עיוורת (LMArena), בנצ'מרקים עצמאיים (Artificial Analysis,‏ SWE-bench), אמינות ייצור של OrcaRouter, ואימוץ אקוסיסטמה (OpenRouter) — משולבים עם משקלים ציבוריים קבועים של 40 / 30 / 20 / 10.

למה למודל חדש לגמרי כבר יש דירוג?

מודלים חדשים נכנסים ללוח מראיות חיצוניות תוך 48 שעות מהשחרור. הדירוג מתייצב ככל שקרבות קהילה ותעבורת ייצור מצטברים.

באיזו תדירות לוח המובילים מתעדכן?

פידים חיצוניים מתרעננים יומית והטלמטריה של OrcaRouter פועלת בזמן אמת; הלוח מציג את תאריך העדכון האחרון שלו בכותרת.

למה מודל חסר מהלוח?

מודל צריך לפחות שני מקורות ראיות עצמאיים כדי להיות מדורג, והלוח מציג את 25 המובילים לפי ציון משולב — מודלים עם ראיות דלות יותר נשארים לא רשומים עד שמקור נוסף יאסוף אותם.

מקרי שימוש שונים מדורגים בנפרד?

כן — הכפתורים מעל הטבלה המאוחדת עוברים בין טקסט, כתיבת קוד, ראייה, מתמטיקה, חשיבה ולוחות אגנטיים, וקרבות מזווגים רק בין דומים לדומים.

מתי הדירוג של מודל חדש מתייצב?

ברגע שמודל נושא שלוש משפחות ראיות כולל נתוני קרב ותעבורה משלו של OrcaRouter, הדירוג שלו נשען על התמהיל המלא ולא רק על ראיות חיצוניות.

מאיפה מגיעים הנתונים?

דירוגי LMArena (‏CC-BY-4.0),‏ Artificial Analysis,‏ SWE-bench ו-OpenRouter, בתוספת טלמטריית ייצור של OrcaRouter — כולם מיוחסים תחת הלוח.

ספקים יכולים לתמרן את הדירוג הזה?

קשה: המשקלים ציבוריים, לא נעשה שימוש במספרים המדווחים על ידי הספקים עצמם, וקרבות קהילה עיוורים בתוספת תעבורה חיה מעגנים כל ציון.

אפשר לייצא או להטמיע את הנתונים האלה?

כן — ייצוא JSON ו-CSV, תג דירוג להטמעה לכל מודל, ופיד RSS של שינויי דירוג חינמיים עם ייחוס. הקישורים בכותרת התחתונה למטה.

מודלים חדשים, שינויי דירוג וירידות — עקבו:X · @OrcaRouterDiscord