กระดานจัดอันดับโมเดล AI

จัดอันดับจากทราฟฟิกการใช้งานจริงของ OrcaRouter และคะแนนโหวตจากชุมชนใน Battle Mode ไม่ใช่จากเกณฑ์มาตรฐานที่ผู้ให้บริการรายงานเอง

อัปเดตเมื่อ 2026-09-23แหล่งข้อมูล 5 แหล่งโมเดลใหม่ขึ้นบอร์ดภายใน 48 ชม.
วัดจากทราฟฟิกจริง
100.0%
อัตราสำเร็จสูงสุด (7 วัน)
MiniMax: MiniMax M2.5
156 ms
ค่าหน่วง p50 เร็วที่สุด
Orca: OrcaVerify Text 1.0 (Free)
80.1%
อัตราการชนะจากชุมชนสูงสุด
Qwen3.7 Max (2026-05-20)

อันดับแบบรวมทุกแหล่ง

หนึ่งอันดับรวมต่อโมเดล — คะแนนโหวต LMArena เบนช์มาร์กอิสระ การใช้งานในระบบนิเวศ และหลักฐานการใช้งานจริงของ OrcaRouter ด้วยน้ำหนักสาธารณะคงที่ โมเดลใหม่เข้าอันดับตั้งแต่วันแรกจากหลักฐานภายนอก

อันดับโมเดลคะแนนรวมความเสถียร$/1M ผสมความเร็วโมเมนตัมหลักฐาน
#1OpenAI: GPT-5.4 Pro81.199.46% · 10000ms$165.00$60 → $270 per 1M tokens132 โทเคนต่อวินาทีAA 66.0ดัชนีความฉลาด Artificial Analysis — เบนช์มาร์กรวมอิสระ (0–100)Win 58.7%อัตราชนะ Blind Battle ของ OrcaRouter — โหวตปิดตาจากชุมชนของเรา
#2DeepSeek: DeepSeek V4.1 Flash78.699.90% · 2532ms$0.38$0.15 → $0.6 per 1M tokens184 โทเคนต่อวินาทีAA 39.5ดัชนีความฉลาด Artificial Analysis — เบนช์มาร์กรวมอิสระ (0–100)OR 13.5%ส่วนแบ่งโทเคน OpenRouter — การใช้งานจริงในระบบนิเวศ
#3OpenAI: GPT-6 Astra75.899.16% · 10000ms$30.00$10 → $50 per 1M tokens56 โทเคนต่อวินาทีAA 52.7ดัชนีความฉลาด Artificial Analysis — เบนช์มาร์กรวมอิสระ (0–100)OR 1.4%ส่วนแบ่งโทเคน OpenRouter — การใช้งานจริงในระบบนิเวศ
#4Anthropic: Claude Opus 5.573.4100.00% · 10000ms$12.00$4 → $20 per 1M tokens1784 โทเคนต่อวินาทีAA 57.6ดัชนีความฉลาด Artificial Analysis — เบนช์มาร์กรวมอิสระ (0–100)OR 0.0%ส่วนแบ่งโทเคน OpenRouter — การใช้งานจริงในระบบนิเวศ
#5Anthropic: Claude Opus 572.699.17% · 6222ms$15.00$5 → $25 per 1M tokens84 โทเคนต่อวินาทีAA 50.8ดัชนีความฉลาด Artificial Analysis — เบนช์มาร์กรวมอิสระ (0–100)OR 0.9%ส่วนแบ่งโทเคน OpenRouter — การใช้งานจริงในระบบนิเวศ
#6Anthropic: Claude Fable 5.172.399.26% · 8014ms$30.00$10 → $50 per 1M tokens61 โทเคนต่อวินาทีAA 53.4ดัชนีความฉลาด Artificial Analysis — เบนช์มาร์กรวมอิสระ (0–100)OR 0.4%ส่วนแบ่งโทเคน OpenRouter — การใช้งานจริงในระบบนิเวศ
#7Z.ai: GLM 5.372.199.86% · 3910ms$2.61$1.26 → $3.96 per 1M tokens74 โทเคนต่อวินาทีAA 44.8ดัชนีความฉลาด Artificial Analysis — เบนช์มาร์กรวมอิสระ (0–100)OR 2.4%ส่วนแบ่งโทเคน OpenRouter — การใช้งานจริงในระบบนิเวศ
#8gpt-5.6-luna72.199.08% · 1200ms$0.90$0.2 → $1.6 per 1M tokens82 โทเคนต่อวินาทีAA 37.3ดัชนีความฉลาด Artificial Analysis — เบนช์มาร์กรวมอิสระ (0–100)OR 6.6%ส่วนแบ่งโทเคน OpenRouter — การใช้งานจริงในระบบนิเวศ
#9Z.ai: GLM 5.3 Flash71.599.55% · 6861ms$0.16$0.075 → $0.25 per 1M tokens93 โทเคนต่อวินาทีArena 1472Elo ชุมชน LMArena — โหวตปิดตาในสนามข้อความ (CC-BY-4.0)AA 41.8ดัชนีความฉลาด Artificial Analysis — เบนช์มาร์กรวมอิสระ (0–100)OR 13.9%ส่วนแบ่งโทเคน OpenRouter — การใช้งานจริงในระบบนิเวศ
#10OpenAI: GPT-5.6 Sol71.499.14% · 10000ms$12.00$4 → $20 per 1M tokens1625 โทเคนต่อวินาทีAA 47.0ดัชนีความฉลาด Artificial Analysis — เบนช์มาร์กรวมอิสระ (0–100)OR 1.4%ส่วนแบ่งโทเคน OpenRouter — การใช้งานจริงในระบบนิเวศ

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

สัดส่วนของ 20 อันดับแรกแยกตามแล็บ
openai 20.0%anthropic 20.0%z-ai 15.0%google 10.0%อื่น ๆ 35.0%
40%
ความชอบของมนุษย์
LMArena · Bradley–Terry
30%
เบนช์มาร์กอิสระ
Artificial Analysis · SWE-bench
20%
ข้อมูลการใช้งานจริง
OrcaRouter Blind Battle win rate
10%
การใช้งานในระบบนิเวศ
OpenRouter token share

การดวลแบบตัวต่อตัว

อัตราชนะแบบจับคู่ใน Battle Mode — แต่ละโมเดลเอาชนะคู่แข่งแต่ละรายในการดวลตรงบ่อยเพียงใด

เกณฑ์มาตรฐาน — ความฉลาดเทียบกับราคา

คะแนนความฉลาดอิสระเทียบกับราคาอินพุต เส้นประคือเส้นพรมแดนพาเรโตของราคา/ความฉลาด

ศึกปิดตา

สองคำตอบนิรนาม หนึ่งโหวต การต่อสู้ของคุณคิดเป็นน้ำหนัก 20% ของหลักฐานการใช้งานจริงในอันดับรวม

⚔️ ศึกปิดตา

โมเดลนิรนามสองตัวตอบพรอมป์เดียวกัน อ่านทั้งสองฝั่ง โหวตผู้ชนะ แล้วดูว่าใครเขียนอะไร — คะแนนโหวตของคุณจะถูกนับรวมในอันดับด้านบน

ระเบียบวิธี — ลีดเดอร์บอร์ดนี้ทำงานอย่างไร

ตัวเลขทุกตัวบนหน้านี้มาจากการวัดจริง ไม่ใช่การรายงานเองของผู้ผลิต นี่คือวิธีการทั้งหมดเบื้องหลังอันดับรวม — กติกาเดียวกันกับทุกโมเดล ทุกวัน

หนึ่งคะแนนรวม น้ำหนักสาธารณะคงที่

แต่ละโมเดลได้คะแนนรวมจากหลักฐานอิสระสี่กลุ่ม: ความชอบของมนุษย์แบบปิดตา 40% เบนช์มาร์กอิสระ 30% หลักฐานการใช้งานจริงของ OrcaRouter 20% และการใช้งานในระบบนิเวศ 10% น้ำหนักคงที่และเปิดเผย — ไม่มีการปรับแต่งโดยกองบรรณาธิการ ไม่มีการจ่ายเงินเพื่ออันดับ ไม่มีการยื่นจากผู้ผลิต

แหล่งข้อมูลของแต่ละกลุ่ม

ความชอบของมนุษย์มาจาก Elo ชุมชนของ LMArena — โหวตแบบจับคู่ปิดตาในสนามข้อความและวิชัน (CC-BY-4.0) เบนช์มาร์กอิสระรวม Artificial Analysis (Intelligence Index พร้อมโค้ดดิ้ง คณิตศาสตร์ GPQA Diamond และ τ²-Bench) กับ SWE-bench Verified คือสัดส่วน issue จริงบน GitHub ที่แก้ได้ หลักฐานการใช้งานจริงคืออัตราชนะใน Blind Battle ของ OrcaRouter เอง ส่วนการใช้งานใช้สัดส่วนโทเคนที่ OpenRouter เผยแพร่ อัตราสำเร็จ เวลาแฝง และอัตราการส่งออกแสดงข้างแต่ละโมเดลเป็นข้อมูลประกอบ ไม่ได้ใช้จัดอันดับ

ทำให้คะแนนเทียบกันได้อย่างไร

แต่ละแหล่งให้คะแนนคนละสเกล (Elo, ดัชนี 0–100, % ที่แก้ได้) จึงต้องทำให้แต่ละสัญญาณเป็นมาตรฐานเทียบกับบอร์ดปัจจุบันแล้วแปลงเป็น 0–100: 50 คือค่าเฉลี่ยของบอร์ด และทุก 15 คะแนนคือหนึ่งส่วนเบี่ยงเบนมาตรฐาน โดยตัดขอบที่ปลายทั้งสอง โมเดลต้องมีหลักฐานอิสระอย่างน้อยสองกลุ่มจึงจะติดอันดับ และบอร์ดแสดง 25 อันดับแรกตามคะแนนรวม

บอร์ดตามกรณีใช้งาน

บอร์ดข้อความ โค้ดดิ้ง วิชัน คณิตศาสตร์ การใช้เหตุผล และเอเจนต์ คำนวณส่วนผสมเดียวกันใหม่บนสัญญาณที่เหมาะกับแต่ละเซกเมนต์ — โค้ดดิ้งสลับไปใช้เบนช์มาร์กโค้ดกับ SWE-bench Verified วิชันใช้สนามวิชันของ LMArena — และ Blind Battle จับคู่เฉพาะโมเดลในเซกเมนต์เดียวกันเท่านั้น

ความสดใหม่และความยุติธรรม

แหล่งข้อมูลภายนอกรีเฟรชทุกวันและเทเลเมทรีของเราเป็นเรียลไทม์ โมเดลใหม่เข้าบอร์ดจากหลักฐานภายนอกภายใน 48 ชั่วโมงหลังเปิดตัว ไม่ใช้ตัวเลขที่ผู้ผลิตรายงานเองในทุกกรณี กระแสชุมชนแสดงเป็นบริบทเท่านั้นไม่ถูกนำไปคิดอันดับ และทุกแหล่งภายนอกมีการให้เครดิตใต้บอร์ด

คำถามที่พบบ่อย

อันดับโมเดล AI คำนวณอย่างไร?

แต่ละโมเดลได้คะแนนรวมจากหลักฐานสี่กลุ่ม — ความชอบของมนุษย์แบบปิดตา (LMArena) เบนช์มาร์กอิสระ (Artificial Analysis, SWE-bench) ความเสถียรการใช้งานจริงของ OrcaRouter และการใช้งานในระบบนิเวศ (OpenRouter) — ด้วยน้ำหนักสาธารณะคงที่ 40 / 30 / 20 / 10

ทำไมโมเดลที่เพิ่งเปิดตัวถึงมีอันดับแล้ว?

โมเดลใหม่เข้าสู่ตารางจากหลักฐานภายนอกภายใน 48 ชั่วโมงหลังเปิดตัว อันดับจะมั่นคงขึ้นเมื่อการแข่งขันของชุมชนและทราฟฟิกการใช้งานจริงสะสมมากขึ้น

อันดับอัปเดตบ่อยแค่ไหน?

แหล่งข้อมูลภายนอกรีเฟรชทุกวัน ส่วน telemetry ของ OrcaRouter เป็นแบบสด วันที่อัปเดตแสดงที่ส่วนหัว

ทำไมบางโมเดลไม่อยู่บนบอร์ด?

โมเดลต้องมีแหล่งหลักฐานอิสระอย่างน้อยสองแหล่งจึงจะติดอันดับ และบอร์ดแสดง 25 อันดับแรกตามคะแนนรวม — โมเดลที่หลักฐานยังไม่พอจะไม่ถูกแสดงจนกว่าจะมีแหล่งใหม่ครอบคลุม

แยกอันดับตามกรณีใช้งานไหม?

ใช่ — ปุ่มเหนือตารางรวมสลับระหว่างบอร์ดข้อความ โค้ดดิ้ง วิชัน คณิตศาสตร์ การใช้เหตุผล และเอเจนต์ และการแข่งขันจะจับคู่เฉพาะโมเดลประเภทเดียวกัน

อันดับของโมเดลใหม่จะมั่นคงเมื่อใด?

เมื่อโมเดลมีหลักฐานครบสามกลุ่ม รวมถึงข้อมูลการแข่งขันและทราฟฟิกของ OrcaRouter เอง อันดับจะอิงคะแนนรวมทั้งหมดแทนที่จะอิงหลักฐานภายนอกเพียงอย่างเดียว

ข้อมูลมาจากไหน?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench, อันดับ OpenRouter และ telemetry การใช้งานจริงของ OrcaRouter — ระบุที่มาใต้บอร์ดทั้งหมด

ผู้ผลิตปั่นอันดับได้ไหม?

ยาก: น้ำหนักเปิดเผย ไม่ใช้ตัวเลขที่รายงานเอง และการต่อสู้แบบปิดตากับทราฟฟิกจริงยึดทุกคะแนนไว้

ส่งออกหรือฝังข้อมูลนี้ได้ไหม?

ได้ — ส่งออก JSON/CSV ป้ายอันดับแบบฝังได้ และ RSS การเปลี่ยนอันดับ ใช้ฟรีโดยระบุที่มา ลิงก์อยู่ท้ายหน้า

โมเดลใหม่ การเปลี่ยนอันดับ และการเปิดตัว — ติดตามได้ที่:X · @OrcaRouterDiscord