하나의 융합 점수, 고정 공개 가중치
각 모델은 네 가지 독립 근거 계열로부터 복합 점수를 받습니다: 블라인드 인간 선호 40%, 독립 벤치마크 30%, OrcaRouter 프로덕션 근거 20%, 생태계 채택도 10%. 가중치는 고정이며 공개됩니다 — 편집 조정도, 유료 배치도, 벤더 제출도 없습니다.
OrcaRouter의 실제 운영 트래픽과 커뮤니티 Battle Mode 투표를 기준으로 순위를 매깁니다. 공급업체가 발표한 벤치마크가 아닙니다.
모델당 하나의 통합 랭킹 — LMArena 투표, 독립 벤치마크, 생태계 채택도, OrcaRouter 프로덕션 데이터를 고정 공개 가중치로 융합합니다. 신규 모델은 출시 첫날부터 외부 근거로 진입합니다.
| 순위 | 모델 | 종합 점수 | 신뢰성 | $/1M 혼합 | 사용량 | 모멘텀 | 근거 |
|---|---|---|---|---|---|---|---|
| #1 | Anthropic: Claude Opus 5 | 74.2 | 99.77% · 3883ms | $15.00$5 → $25 per 1M tokens | <1% | — | AA 63.1Artificial Analysis 지능 지수 — 독립 종합 벤치마크(0–100).OR 1.9%OpenRouter 토큰 점유율 — 실제 생태계 채택도. |
| #2 | OpenAI: GPT-5.6 Luna | 73.8 | 99.44% · 3256ms | $0.70$0.2 → $1.2 per 1M tokens | 12% | — | AA 52.3Artificial Analysis 지능 지수 — 독립 종합 벤치마크(0–100).OR 6.7%OpenRouter 토큰 점유율 — 실제 생태계 채택도. |
| #3 | OpenAI: GPT-5.4 Pro | 72.2 | 99.25% · 9000ms | $165.00$60 → $270 per 1M tokens | <1%▼ | — | AA 66.0Artificial Analysis 지능 지수 — 독립 종합 벤치마크(0–100).Win 58.7%OrcaRouter 블라인드 배틀 승률 — 자체 커뮤니티의 블라인드 투표. |
| #4 | MoonshotAI: Kimi K3 | 72.2 | 99.40% · 7738ms | $9.00$3 → $15 per 1M tokens | 8% | — | AA 59.7Artificial Analysis 지능 지수 — 독립 종합 벤치마크(0–100).OR 2.0%OpenRouter 토큰 점유율 — 실제 생태계 채택도. |
| #5 | Z.ai: GLM 5.2 | 71.6 | 99.62% · 5211ms | $2.90$1.4 → $4.4 per 1M tokens | 3%▼ | — | AA 52.6Artificial Analysis 지능 지수 — 독립 종합 벤치마크(0–100).OR 4.9%OpenRouter 토큰 점유율 — 실제 생태계 채택도.Win 63.6%OrcaRouter 블라인드 배틀 승률 — 자체 커뮤니티의 블라인드 투표. |
| #6 | OpenAI: GPT-5.6 Sol | 69.8 | 99.34% · 6136ms | $17.50$5 → $30 per 1M tokens | <1% | — | AA 60.9Artificial Analysis 지능 지수 — 독립 종합 벤치마크(0–100).OR 0.9%OpenRouter 토큰 점유율 — 실제 생태계 채택도. |
| #7 | Qwen3.7 Max (2026-05-20) | 69.2 | 99.14% · 10000ms | $2.50$1.25 → $3.75 per 1M tokens | <1%▲ | — | AA 46.7Artificial Analysis 지능 지수 — 독립 종합 벤치마크(0–100).OR 0.1%OpenRouter 토큰 점유율 — 실제 생태계 채택도.Win 80.1%OrcaRouter 블라인드 배틀 승률 — 자체 커뮤니티의 블라인드 투표. |
| #8 | OpenAI: GPT-5.6 Terra | 68.0 | 99.94% · 2586ms | $7.00$2 → $12 per 1M tokens | 16% | — | AA 56.6Artificial Analysis 지능 지수 — 독립 종합 벤치마크(0–100).OR 1.2%OpenRouter 토큰 점유율 — 실제 생태계 채택도. |
| #9 | Anthropic: Claude Fable 5 | 67.3 | 99.41% · 4144ms | $30.00$10 → $50 per 1M tokens | <1%▲ | — | Arena 1494LMArena 커뮤니티 Elo — 텍스트 아레나 블라인드 투표(CC-BY-4.0).AA 62.1Artificial Analysis 지능 지수 — 독립 종합 벤치마크(0–100).OR 0.3%OpenRouter 토큰 점유율 — 실제 생태계 채택도. |
| #10 | Google: Gemini 3.6 Flash | 66.6 | 99.35% · 3928ms | $4.50$1.5 → $7.5 per 1M tokens | <1% | — | Arena 1480LMArena 커뮤니티 Elo — 텍스트 아레나 블라인드 투표(CC-BY-4.0).AA 51.6Artificial Analysis 지능 지수 — 독립 종합 벤치마크(0–100).OR 3.5%OpenRouter 토큰 점유율 — 실제 생태계 채택도. |
LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai
Battle Mode 1:1 승률 — 각 모델이 맞대결에서 각 상대를 이기는 빈도입니다.
독립적인 지능 점수를 입력 가격에 대해 표시했습니다. 점선은 가격/지능 파레토 경계입니다.
익명의 두 답변에 한 표. 당신의 배틀이 통합 랭킹의 20% 운영 근거 가중치에 반영됩니다.
두 익명 모델이 같은 프롬프트에 답합니다. 둘 다 읽고 승자에게 투표한 뒤 누가 무엇을 썼는지 확인하세요. 투표는 위 순위에 반영됩니다.
이 페이지의 모든 숫자는 실측값이며, 벤더의 자체 보고는 없습니다. 통합 랭킹 뒤에 있는 전체 방법을 공개합니다 — 모든 모델에, 매일, 같은 규칙을 적용합니다.
각 모델은 네 가지 독립 근거 계열로부터 복합 점수를 받습니다: 블라인드 인간 선호 40%, 독립 벤치마크 30%, OrcaRouter 프로덕션 근거 20%, 생태계 채택도 10%. 가중치는 고정이며 공개됩니다 — 편집 조정도, 유료 배치도, 벤더 제출도 없습니다.
인간 선호는 LMArena 커뮤니티 Elo에서 옵니다 — 텍스트·비전 아레나의 블라인드 쌍대 투표(CC-BY-4.0). 독립 벤치마크는 Artificial Analysis(Intelligence Index와 코딩, 수학, GPQA Diamond, τ²-Bench)와 실제 GitHub 이슈 해결 비율인 SWE-bench Verified를 결합합니다. 프로덕션 근거는 OrcaRouter 자체 데이터입니다: Blind Battle 승률과 게이트웨이 라이브 텔레메트리 — 성공률, 지연 시간, 라우팅된 토큰량. 채택도는 OpenRouter가 공개한 토큰 점유율을 사용합니다.
출처마다 척도가 다르므로(Elo, 0–100 지수, 해결률 %) 각 신호를 현재 보드 기준으로 표준화해 0–100으로 사상합니다: 50이 보드 평균이고 15점마다 표준편차 1이며 양 끝은 클램프합니다. 모델이 랭크되려면 최소 두 개의 독립 근거 계열이 필요하고, 보드는 복합 점수 상위 25개를 표시합니다.
텍스트, 코딩, 비전, 수학, 추론, 에이전트 보드는 세그먼트에 맞는 신호로 같은 융합을 다시 계산합니다 — 코딩은 코딩 벤치마크와 SWE-bench Verified로 교체하고, 비전은 LMArena 비전 아레나를 사용합니다 — Blind Battle은 언제나 같은 세그먼트의 모델끼리만 대전합니다.
외부 피드는 매일 갱신되고 자체 텔레메트리는 실시간입니다. 신규 모델은 출시 후 48시간 이내에 외부 근거로 진입합니다. 벤더 자체 보고 수치는 어디에도 쓰지 않고, 커뮤니티 화제성은 맥락으로만 표시할 뿐 순위에 절대 반영하지 않으며, 모든 외부 출처는 보드 아래에 명시합니다.
각 모델은 네 가지 근거군 — 블라인드 인간 선호(LMArena), 독립 벤치마크(Artificial Analysis, SWE-bench), OrcaRouter 운영 신뢰성, 생태계 채택도(OpenRouter) — 를 고정 공개 가중치 40/30/20/10으로 결합한 점수를 받습니다.
신규 모델은 출시 후 48시간 이내에 외부 근거를 바탕으로 보드에 진입합니다. 커뮤니티 배틀과 프로덕션 트래픽이 쌓일수록 순위는 견고해집니다.
외부 피드는 매일, OrcaRouter 텔레메트리는 실시간으로 갱신되며 최근 업데이트 날짜가 상단에 표시됩니다.
모델이 순위에 오르려면 독립적인 근거 소스가 최소 두 개 필요하며, 보드는 종합 점수 상위 25개를 표시합니다. 근거가 부족한 모델은 다른 소스가 커버할 때까지 목록에 오르지 않습니다.
네 — 통합 테이블 위의 버튼으로 텍스트, 코딩, 비전, 수학, 추론, 에이전트 보드를 전환할 수 있으며, 배틀은 동종 모델끼리만 진행됩니다.
모델이 OrcaRouter 자체 배틀·트래픽 데이터를 포함한 세 가지 근거 계열을 갖추면, 순위는 외부 근거만이 아닌 전체 융합 점수에 기반하게 됩니다.
LMArena(CC-BY-4.0), Artificial Analysis, SWE-bench, OpenRouter 랭킹과 OrcaRouter 운영 텔레메트리이며 모두 보드 아래에 표기됩니다.
어렵습니다. 가중치는 공개되고 자가 보고 수치는 쓰지 않으며, 블라인드 배틀과 실제 트래픽이 점수를 고정합니다.
네 — JSON/CSV 내보내기, 임베드 가능한 순위 배지, 순위 변동 RSS를 출처 표기 조건으로 무료 제공합니다. 링크는 페이지 하단에 있습니다.