Bảng xếp hạng mô hình AI

Xếp hạng dựa trên lưu lượng sản xuất thực tế của OrcaRouter và phiếu bầu cộng đồng trong Battle Mode — không phải benchmark do nhà cung cấp công bố.

Cập nhật 2026-08-095 nguồn bằng chứngMô hình mới lên bảng trong 48 giờ
Đo trên lưu lượng thực tế
100.0%
Tỷ lệ thành công cao nhất (7 ngày)
openai/gpt-4-turbo-2024-04-09
450 ms
Độ trễ p50 nhanh nhất
OpenAI: GPT-4o (2024-08-06)
80.1%
Tỷ lệ thắng cộng đồng cao nhất
Qwen3.7 Max (2026-05-20)

Bảng xếp hạng tổng hợp

Một thứ hạng tổng hợp cho mỗi mô hình — phiếu bầu LMArena, các benchmark độc lập, mức độ sử dụng trong hệ sinh thái và dữ liệu vận hành của OrcaRouter, với trọng số công khai cố định. Mô hình mới được xếp hạng từ ngày đầu dựa trên bằng chứng bên ngoài.

HạngMô hìnhĐiểm tổng hợpĐộ tin cậy$/1M hỗn hợpLưu lượngĐà tăngBằng chứng
#1Anthropic: Claude Opus 574.299.77% · 3883ms$15.00$5 → $25 per 1M tokens<1%AA 63.1Chỉ số trí tuệ Artificial Analysis — benchmark tổng hợp độc lập (0–100).OR 1.9%Thị phần token OpenRouter — mức dùng thực tế.
#2OpenAI: GPT-5.6 Luna73.899.44% · 3256ms$0.70$0.2 → $1.2 per 1M tokens12%AA 52.3Chỉ số trí tuệ Artificial Analysis — benchmark tổng hợp độc lập (0–100).OR 6.7%Thị phần token OpenRouter — mức dùng thực tế.
#3OpenAI: GPT-5.4 Pro72.299.25% · 9000ms$165.00$60 → $270 per 1M tokens<1%AA 66.0Chỉ số trí tuệ Artificial Analysis — benchmark tổng hợp độc lập (0–100).Win 58.7%Tỷ lệ thắng Blind Battle OrcaRouter — phiếu bầu mù của cộng đồng chúng tôi.
#4MoonshotAI: Kimi K372.299.40% · 7738ms$9.00$3 → $15 per 1M tokens8%AA 59.7Chỉ số trí tuệ Artificial Analysis — benchmark tổng hợp độc lập (0–100).OR 2.0%Thị phần token OpenRouter — mức dùng thực tế.
#5Z.ai: GLM 5.271.699.62% · 5211ms$2.90$1.4 → $4.4 per 1M tokens3%AA 52.6Chỉ số trí tuệ Artificial Analysis — benchmark tổng hợp độc lập (0–100).OR 4.9%Thị phần token OpenRouter — mức dùng thực tế.Win 63.6%Tỷ lệ thắng Blind Battle OrcaRouter — phiếu bầu mù của cộng đồng chúng tôi.
#6OpenAI: GPT-5.6 Sol69.899.34% · 6136ms$17.50$5 → $30 per 1M tokens<1%AA 60.9Chỉ số trí tuệ Artificial Analysis — benchmark tổng hợp độc lập (0–100).OR 0.9%Thị phần token OpenRouter — mức dùng thực tế.
#7Qwen3.7 Max (2026-05-20)69.299.14% · 10000ms$2.50$1.25 → $3.75 per 1M tokens<1%AA 46.7Chỉ số trí tuệ Artificial Analysis — benchmark tổng hợp độc lập (0–100).OR 0.1%Thị phần token OpenRouter — mức dùng thực tế.Win 80.1%Tỷ lệ thắng Blind Battle OrcaRouter — phiếu bầu mù của cộng đồng chúng tôi.
#8OpenAI: GPT-5.6 Terra68.099.94% · 2586ms$7.00$2 → $12 per 1M tokens16%AA 56.6Chỉ số trí tuệ Artificial Analysis — benchmark tổng hợp độc lập (0–100).OR 1.2%Thị phần token OpenRouter — mức dùng thực tế.
#9Anthropic: Claude Fable 567.399.41% · 4144ms$30.00$10 → $50 per 1M tokens<1%Arena 1494Elo cộng đồng LMArena — phiếu bầu mù trên đấu trường văn bản (CC-BY-4.0).AA 62.1Chỉ số trí tuệ Artificial Analysis — benchmark tổng hợp độc lập (0–100).OR 0.3%Thị phần token OpenRouter — mức dùng thực tế.
#10Google: Gemini 3.6 Flash66.699.35% · 3928ms$4.50$1.5 → $7.5 per 1M tokens<1%Arena 1480Elo cộng đồng LMArena — phiếu bầu mù trên đấu trường văn bản (CC-BY-4.0).AA 51.6Chỉ số trí tuệ Artificial Analysis — benchmark tổng hợp độc lập (0–100).OR 3.5%Thị phần token OpenRouter — mức dùng thực tế.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Tỷ trọng token theo hãng
deepseek 44.8%openai 29.5%tencent 11.0%kimi 7.9%Khác 6.8%
40%
Sở thích con người
LMArena · Bradley–Terry
30%
Benchmark độc lập
Artificial Analysis · SWE-bench
20%
Bằng chứng vận hành
OrcaRouter battles & traffic
10%
Mức độ sử dụng
OpenRouter token share

Đối đầu trực tiếp

Tỷ lệ thắng từng cặp trong Battle Mode — mỗi mô hình thắng từng đối thủ trong đối đầu trực tiếp thường xuyên đến mức nào.

Điểm chuẩn — trí tuệ so với giá

Điểm trí tuệ độc lập được vẽ theo giá đầu vào. Đường nét đứt là biên Pareto giá/trí tuệ.

Đấu trường ẩn danh

Hai câu trả lời ẩn danh, một phiếu bầu. Các trận đấu của bạn đóng góp 20% trọng số bằng chứng vận hành trong thứ hạng tổng hợp.

⚔️ Đấu trường ẩn danh

Hai mô hình ẩn danh trả lời cùng một câu lệnh. Đọc cả hai, bình chọn người thắng, rồi xem ai đã viết gì — phiếu bầu của bạn được tính vào bảng xếp hạng phía trên.

Phương pháp — bảng xếp hạng này hoạt động ra sao

Mọi con số trên trang này đều được đo thực tế, không bao giờ do nhà cung cấp tự khai. Đây là toàn bộ phương pháp đằng sau thứ hạng tổng hợp — cùng một quy tắc cho mọi mô hình, mỗi ngày.

Một điểm hợp nhất, trọng số công khai cố định

Mỗi mô hình nhận điểm tổng hợp từ bốn nhóm bằng chứng độc lập: sở thích con người đánh giá mù 40%, benchmark độc lập 30%, bằng chứng vận hành của OrcaRouter 20% và mức độ sử dụng trong hệ sinh thái 10%. Trọng số cố định và công khai — không chỉnh sửa biên tập, không trả phí để xếp hạng, không nhận hồ sơ từ nhà cung cấp.

Nguồn của từng nhóm bằng chứng

Sở thích con người đến từ Elo cộng đồng của LMArena — phiếu bầu mù theo cặp trên đấu trường văn bản và thị giác (CC-BY-4.0). Benchmark độc lập kết hợp Artificial Analysis (Intelligence Index cùng lập trình, toán, GPQA Diamond và τ²-Bench) với SWE-bench Verified — tỷ lệ giải quyết issue GitHub thực. Bằng chứng vận hành là của chính OrcaRouter: tỷ lệ thắng Blind Battle cùng telemetry trực tiếp của gateway — tỷ lệ thành công, độ trễ và lượng token định tuyến. Mức độ sử dụng lấy từ tỷ trọng token do OpenRouter công bố.

Cách các điểm số trở nên so sánh được

Các nguồn chấm theo thang khác nhau (Elo, chỉ số 0–100, % giải quyết), nên mỗi tín hiệu được chuẩn hóa theo bảng hiện tại và ánh xạ về 0–100: 50 là trung bình bảng, mỗi 15 điểm là một độ lệch chuẩn, chặn ở hai đầu. Một mô hình cần ít nhất hai nhóm bằng chứng độc lập mới được xếp hạng, và bảng liệt kê top 25 theo điểm tổng hợp.

Bảng theo từng trường hợp sử dụng

Các bảng văn bản, lập trình, thị giác, toán, suy luận và tác tử chạy lại cùng công thức hợp nhất trên tín hiệu phù hợp từng phân khúc — lập trình thay bằng benchmark lập trình và SWE-bench Verified, thị giác dùng đấu trường thị giác của LMArena — và Blind Battle chỉ ghép các mô hình trong cùng phân khúc.

Độ tươi mới và sự công bằng

Nguồn dữ liệu ngoài làm mới hằng ngày và telemetry nội bộ là trực tiếp; mô hình mới vào bảng dựa trên bằng chứng bên ngoài trong vòng 48 giờ sau phát hành. Không dùng bất kỳ số liệu tự khai nào của nhà cung cấp, độ thảo luận cộng đồng chỉ hiển thị làm ngữ cảnh và không bao giờ ảnh hưởng thứ hạng, mọi nguồn ngoài đều được ghi công dưới bảng.

Câu hỏi thường gặp

Bảng xếp hạng mô hình AI được tính như thế nào?

Mỗi mô hình có một điểm hợp nhất từ bốn nhóm bằng chứng — đánh giá mù của con người (LMArena), benchmark độc lập (Artificial Analysis, SWE-bench), độ tin cậy vận hành của OrcaRouter và mức độ sử dụng trong hệ sinh thái (OpenRouter) — với trọng số công khai cố định 40/30/20/10.

Vì sao mô hình mới ra mắt đã có thứ hạng?

Mô hình mới được đưa vào bảng dựa trên bằng chứng bên ngoài trong vòng 48 giờ sau khi phát hành. Thứ hạng dần vững chắc khi các trận đấu cộng đồng và lưu lượng vận hành tích lũy.

Bảng xếp hạng cập nhật bao lâu một lần?

Nguồn ngoài làm mới hằng ngày, telemetry của OrcaRouter là trực tiếp; ngày cập nhật hiển thị ở đầu trang.

Vì sao một mô hình không có trên bảng?

Một mô hình cần ít nhất hai nguồn bằng chứng độc lập để được xếp hạng, và bảng hiển thị top 25 theo điểm tổng hợp — các mô hình thiếu bằng chứng sẽ chưa được liệt kê cho đến khi có nguồn mới bao phủ.

Các trường hợp sử dụng có xếp hạng riêng không?

Có — các nút phía trên bảng tổng hợp chuyển giữa các bảng văn bản, lập trình, thị giác, toán học, suy luận và tác tử, và các trận đấu chỉ ghép các mô hình cùng loại.

Khi nào thứ hạng của mô hình mới trở nên vững chắc?

Khi một mô hình có đủ ba nhóm bằng chứng, bao gồm dữ liệu trận đấu và lưu lượng của chính OrcaRouter, thứ hạng của nó dựa trên toàn bộ điểm hợp nhất thay vì chỉ dựa trên bằng chứng bên ngoài.

Dữ liệu đến từ đâu?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench, xếp hạng OpenRouter và telemetry vận hành của OrcaRouter — đều được ghi nguồn dưới bảng.

Nhà cung cấp có thể thao túng xếp hạng không?

Rất khó: trọng số công khai, không dùng số liệu tự khai, trận đấu mù và lưu lượng thật neo mọi điểm số.

Tôi có thể xuất hoặc nhúng dữ liệu này không?

Có — xuất JSON/CSV, huy hiệu thứ hạng nhúng được và RSS thay đổi thứ hạng đều miễn phí kèm ghi nguồn. Liên kết ở cuối trang.

Mô hình mới, biến động hạng và ra mắt — theo dõi tại:X · @OrcaRouterDiscord