
Claude Opus 5.5 ขึ้นแท่นอันดับหนึ่งใน Epoch Capabilities Index ด้วยคะแนนนำ 0.84 คะแนน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 221 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ตัวเลขคือ 0.84. Claude Opus 5.5อยู่ที่ 167.35 บน Epoch Capabilities Index ณ ไฟล์ที่เราอ่านเมื่อวันที่ 2 ตุลาคม 2026 โดยมี GPT-6 Astraที่ 166.51 — ช่องว่างน้อยกว่าหนึ่งจุดบนสเกลที่ช่วง 95% ที่เผยแพร่ของทั้งสองโมเดลทับซ้อนกันเกือบทั้งหมด โดย Opus 5.5 อยู่ที่ 164.0 ถึง 172.0 เทียบกับ Astra ที่ 163.14 ถึง 171.05 ถัดลงมา Claude Sonnet 5.5ทำได้ 165.2 และ Claude Fable 5.1164.82 ดังนั้นสี่อันดับแรกในคอมโพสิตอิสระจากมากกว่าห้าสิบเบนช์มาร์กจึงห่างกัน 2.53 จุด และสามในนั้นมีชื่อผู้จำหน่ายรายเดียวกัน ลำดับนี้เป็นจริงในแง่ที่ว่าค่าประมาณจุดนั้นเรียงลำดับกัน มันไม่เป็นจริงในแง่ที่ว่าคะแนนนำ 0.84 จุดจะรอดพ้นจากแถบความคลาดเคลื่อนของตัวเอง และทุกสิ่งที่น่าพูดถึงเกี่ยวกับตารางอันดับนี้ล้วนตามมาจากการยึดข้อเท็จจริงทั้งสองนี้ไว้พร้อมกัน
ดัชนีคืออะไร และ 0.84 ของจุดไม่ใช่อะไร
Epoch Capabilities Index ไม่ใช่กระดานคะแนนที่ผู้ให้บริการจัดทำขึ้นเอง มันถูกสร้างโดย Epoch AI องค์กรวิจัยอิสระ ในรูปแบบคอมโพสิตที่ร้อยเรียงคะแนนจากเบนช์มาร์กที่แตกต่างกันมากกว่าห้าสิบรายการเข้าเป็นสเกลความสามารถทั่วไปหนึ่งเดียว โดยอนุมานความยากสัมพัทธ์ของแต่ละเบนช์มาร์กจากโมเดลที่บังเอิญปรากฏอยู่ในหลายเบนช์มาร์กพร้อมกัน วิธีการนี้ระบุไว้ในบทความที่เขียนร่วมกับนักวิจัยจากทีม AGI Safety & Alignment ของ Google DeepMind และได้รับทุนสนับสนุนจาก DeepMind แต่ Epoch ระบุชัดเจนว่าดัชนีนี้เป็นผลิตภัณฑ์ของตัวเอง และตนถือสิทธิ์เต็มเหนือดัชนีนี้ — ความแตกต่างที่ควรค่าแก่การจดจำเมื่อแหล่งทุนและผู้เผยแพร่คะแนนไม่ใช่ฝ่ายเดียวกัน โค้ดเป็นสาธารณะ
คุณสมบัติสองประการของมาตรานี้สำคัญกว่าพาดหัวข่าว ประการแรกคือ ECI ถูกยึดโยงโดยเจตนาแทนที่จะเป็นแบบสัมบูรณ์: คะแนนดิบถูกปรับสเกลใหม่เพื่อให้ Claude 3.5 Sonnet อยู่ที่ 130 และ GPT-5 อยู่ที่ 150 ซึ่งหมายความว่าตัวเลขบนดัชนีนี้จะมีความหมายก็ต่อเมื่ออยู่ข้างตัวเลขอื่นจากไฟล์เดียวกันเท่านั้น ไม่มีความหมายในตัวเอง ประการที่สองคือดัชนีนี้ไม่มีเพดาน ไม่มี 100 ให้เข้าใกล้ ดังนั้น "จุดสูงสุดของดัชนี" จึงเป็นข้อความเกี่ยวกับวันที่ ไม่ใช่เกี่ยวกับขีดจำกัดที่ใครคนใดคนหนึ่งไปถึงแล้ว
ซึ่งเป็นเหตุผลว่าทำไมการอ่านค่า 167.35 เทียบกับ 166.51 อย่างตรงไปตรงมาจึงไม่ใช่ “Claude Opus 5.5 เป็นโมเดลที่เก่งที่สุดในโลก” แต่เป็นข้อสรุปที่แคบกว่าและนำไปอ้างได้น้อยกว่า: จากการจำลองหลักฐานที่มีอยู่ ณ วันที่ 2 ตุลาคม 2026 ของ Epoch โมเดลทั้งสองแยกออกจากกันไม่ได้ที่ตำแหน่งสูงสุด และลำดับระหว่างทั้งสองเป็นเพียงการตัดสินกรณีเสมอมากกว่าการวัด ช่วงค่าที่เผยแพร่ระบุเช่นนั้นโดยตรง — 164.0 ถึง 172.0 และ 163.14 ถึง 171.05 มีช่วงพิสัยร่วมกันเป็นส่วนใหญ่ ใครก็ตามที่อ้าง 0.84 เป็นคำตัดสินกำลังอ้างสิ่งที่เกิดจากการปัดเศษ
บล็อก Anthropic และขนาดของรีลีส
ลักษณะที่ให้ข้อมูลมากกว่าของตารางไม่ใช่ว่าใครเป็นที่หนึ่ง แต่เป็นแถวที่สามและสี่ Claude Sonnet 5.5 ซึ่งเปิดตัวเมื่อวันที่ 28 กันยายนและทำคะแนนได้ 165.2 อยู่สูงกว่า Claude Fable 5.1 ซึ่งเปิดตัวเมื่อวันที่ 1 กันยายนที่ 164.82 อยู่ 0.38 คะแนน — ใกล้กันพอที่ทั้งสองจะอยู่ในตำแหน่งเดียวกันในทางปฏิบัติ และใกล้กันพอที่ทั้งคู่จะอยู่ต่ำกว่ายอดตารางเพียง 2.15 คะแนน Sonnet เป็นผลิตภัณฑ์ระดับกลางในสายของ Anthropic และ Fable เป็นโมเดลที่บริษัทเคยชี้ไปที่งานการใช้เหตุผลทั่วไป การที่ทั้งสองตอนนี้ขนาบแนวหน้าจากด้านล่างเพียงเล็กน้อยคือการเปลี่ยนแปลงที่มีสาระสำคัญในการรีเฟรชครั้งนี้ มากกว่าตัวตนของผู้นำ
ความก้าวหน้าตามรุ่นของ Anthropic เองก็มองเห็นได้เช่นกัน Claude Opus 5.5 เป็นรุ่นสืบทอดของ Claude Opus 5 ซึ่ง Epoch ให้คะแนนไว้ที่ 162.94 โดยมีช่วงความเชื่อมั่น 160.2 ถึง 166.7 นั่นคือการพัฒนาขึ้น 4.41 จุดภายในเวลาราวสองเดือน จากการเปิดตัวเมื่อวันที่ 24 กรกฎาคมถึงการเปิดตัวเมื่อวันที่ 22 กันยายน ซึ่งเป็นการขยับที่ใหญ่กว่าช่องว่าง 0.84 จุดที่แยกอันดับหนึ่งกับอันดับสองในปัจจุบันออกจากกัน เมื่ออ่านเช่นนี้ ปริมาณที่น่าสนใจในตารางนี้คือความชันภายในเส้นของผู้จำหน่ายรายเดียว ไม่ใช่ช่องว่างระหว่างผู้จำหน่ายสองรายที่อยู่บนสุด
เส้นแบ่งของ open-weights อยู่ตรงไหน
Epoch แยกโมเดลตามระดับการเข้าถึง ซึ่งทำให้เส้นแบ่งของน้ำหนักเปิด (open-weights) ชัดเจนโดยไม่ต้องเดา รายการน้ำหนักเปิดที่ดีที่สุดคือ Kimi K3 ที่ 157.61 ลงวันที่ 16 กรกฎาคม และติดป้ายว่าไม่ใช่เชิงพาณิชย์ รองลงมาคือ DeepSeek V4 Pro 0813 ที่ 155.38 และ DeepSeek V4.1 Flash ที่ 155.0 ซึ่งทั้งคู่ไม่มีข้อจำกัด จากนั้นคือ GLM-5.3-Flash ที่ 151.94 และ GLM-5.2 ที่ 151.78 ดังนั้นโมเดลเปิดที่ใกล้ที่สุดกับอันดับต้นจึงตามหลังอยู่ 9.74 คะแนน — ช่องว่างที่กว้างกว่าช่องว่างระหว่างอันดับหนึ่งกับอันดับสองถึง 18 เท่า และกว้างพอที่ช่วงต่าง ๆ จะไม่เข้าใกล้กันเลย
ความไม่สมมาตรนั้นเป็นข้อค้นพบเดียวที่ยั่งยืนในตารางนี้ พรมแดนปิดนั้นเบียดเสียดกันอยู่ภายในสามจุดเท่านั้น ส่วนระยะห่างจากพรมแดนปิดไปจนถึงน้ำหนักที่ดาวน์โหลดได้ดีที่สุดนั้นใหญ่กว่าถึงหนึ่งอันดับขนาด ดัชนีเชิงประกอบที่ช่วยให้คุณเปรียบเทียบข้ามรุ่นของเบนช์มาร์กได้นั้นเป็นเครื่องมือที่เหมาะสำหรับการสังเกตเรื่องนี้พอดี เพราะมันสามารถบอกสิ่งเดียวกันได้ทั้งในเดือนกรกฎาคมและเดือนกันยายน แทนที่จะรายงานว่าเบนช์มาร์กที่อิ่มตัวแล้วได้เงียบไป
บางแถวที่อยู่ใกล้เคียงนั้นคุ้มค่าที่จะปักหมุดไว้เพื่อให้เห็นบริบท เนื่องจากมันคือโมเดลที่ผู้อ่านนำมาเทียบกับ Opus 5.5 จริง ๆ:
• Claude Sonnet 5 — 156.34 เปิดตัวเมื่อวันที่ 30 มิถุนายน ช่วง 153.61 ถึง 158.81
• Grok 4.6 — 156.61 เปิดตัวเมื่อวันที่ 12 สิงหาคม ช่วง 154.66 ถึง 158.93
• Gemini 3.8 Flash — 156.93, เปิดตัววันที่ 2 กันยายน, ช่วง 154.64 ถึง 160.42
• Muse Spark 1.3 — 156.86 เปิดตัวเมื่อวันที่ 2 กันยายน ช่วง 154.73 ถึง 159.56
• GPT-5.6 Sol — 161.8 เปิดตัวเมื่อวันที่ 9 กรกฎาคม ช่วง 159.26 ถึง 165.26
ตำแหน่งดัชนีไม่ใช่ตั๋วเงิน

ตรงนี้ ลีดเดอร์บอร์ดไม่ได้เป็นเรื่องราวทั้งหมดอีกต่อไป เพราะสองโมเดลอันดับต้น ๆ มีค่าใช้จ่ายไม่ใกล้เคียงกันเลย จากแค็ตตาล็อกของเราเอง ซึ่งมีทั้งสองรุ่นในราคาที่ผู้ให้บริการประกาศไว้โดยไม่บวกเพิ่ม Claude Opus 5.5 ที่ $4.00/$20.00 โดยมีค่าอ่านแคช $0.20 และ GPT-6 Astra ที่ $10.00/$50.00 โดยมีค่าอ่านแคช $1.00 ห่างกัน 2.5 เท่าในทั้งสองทิศทางของตารางราคา Astra ยังปรับขึ้นเมื่อพรอมป์ต์เกิน 272,000 โทเคน โดยอินพุตจะอยู่ที่ $20.00 และเอาต์พุตที่ $75.00; Opus 5.5 คงราคา $4.00/$20.00 แบนราบตลอดหน้าต่าง 1M โทเคนทั้งหมด ทั้งสองให้บริการ 128,000 โทเคนเอาต์พุต
ลองคำนวณตัวเลขที่งานเวิร์กโหลดบริบทยาวต้องจ่ายจริง — พรีฟิกซ์ 180,000 โทเคนที่เสิร์ฟจากแคช และโทเคนที่สร้างขึ้น 5,000 โทเคน บน Opus 5.5 นั่นคือ 180,000 โทเคนในราคา $0.20 ต่อล้าน หรือประมาณ 3.6 เซนต์ บวกกับ 5,000 โทเคนในราคา $20 ต่อล้าน หรือ 10 เซนต์: รวมประมาณ 13.6 เซนต์ บน GPT-6 Astra คือ 180,000 โทเคนในราคา $1.00 หรือ 18 เซนต์ บวกกับ 5,000 โทเคนในราคา $50 หรือ 25 เซนต์: รวมประมาณ 43 เซนต์ ความได้เปรียบ 0.84 จุด กับช่องว่างต้นทุน 3.2 เท่า ไม่ใช่ข้อเท็จจริงประเภทเดียวกัน และการตัดสินใจจัดซื้อที่ชั่งน้ำหนักเฉพาะอย่างแรก ก็เท่ากับได้ชั่งน้ำหนักตัวเลขที่น้อยกว่า
Fable 5.1 ตอกย้ำประเด็นนี้จากอีกด้านของตารางราคาของผู้ขายรายเดียวกัน: ที่ราคา $10.00/$50.00 มันถูกตั้งราคาเหมือน Astra ทุกประการ และได้คะแนน 164.82 — ต่ำกว่า Opus 5.5 อยู่ 2.53 คะแนนในราคาเดียวกัน ดัชนีจัดให้สามรายการระดับแนวหน้าของ Anthropic ห่างกันไม่เกิน 2.53 คะแนน ขณะที่ตารางราคาของบริษัททำให้รายการเหล่านี้มีราคาต่างกัน 2.5 เท่า ซึ่งอธิบายทางเลือกที่อยู่ตรงหน้าผู้ซื้อได้ดีกว่าการจัดอันดับใดๆ เพียงอย่างเดียวมาก
ถ้าคุณจะเถียงเรื่องตัวเลข ก็ไปเถียงบนทราฟฟิกของคุณเอง

เหตุผลที่ดัชนีนี้คุ้มค่าจะอ่านเลยก็คือ มันถูกวัดโดยคนอื่นที่ไม่ใช่ผู้ขาย — แต่โครงสร้างของตัวคอมโพสิตเองต่างหากที่กำหนดเงื่อนไขของการโต้แย้ง การปรับเทียบของ Epoch การประเมินความยาก และวิธีจัดการกับโมเดลที่ข้ามเบนช์มาร์ก ล้วนอยู่ต้นน้ำของตัวเลขในตาราง และไม่มีสิ่งใดในนั้นที่ผู้อ่านจะคำนวณย้อนกลับได้จากภาพหน้าจอ เช่นเดียวกันกับเบนช์มาร์กพาดหัวของทุกเจ้า ซึ่งเป็นเหตุผลว่าการเคลื่อนไหวที่มีประโยชน์จึงไม่ใช่การเลือกข้างระหว่างพวกมัน แต่เป็นการเปรียบเทียบพวกมันบนทราฟฟิกที่คุณควบคุมเอง
ทั้งสองโมเดลนี้เข้าถึงได้จากคีย์ API เดียวบน OrcaRouter ซึ่งส่งราคาตามรายการของผู้ให้บริการผ่านมาโดยบวกกำไร 0%: Claude Opus 5.5 ราคา $4.00/$20.00 โดยอ่านแคชที่ $0.20 และ GPT-6 Astra ราคา $10.00/$50.00 โดยมีระดับเกิน 272K นำมาใช้ตรงตามที่ผู้ให้บริการกำหนดไว้ทุกประการการส่งชุดพรอมป์เดียวกันไปยังทั้งสองโมเดลเป็นการเปลี่ยนการตั้งค่า ไม่ใช่สัญญาฉบับที่สอง และในจุดที่ทั้งสองถูกจัดเส้นทางไว้ การสลับไปใช้ระบบสำรองอัตโนมัติจะทำงานอยู่เบื้องหลัง ซึ่งสำคัญสำหรับการตัดสินใจที่ใกล้กับระดับพื้นสัญญาณรบกวนเช่นนี้ ตารางอันดับอาจบอกคุณได้ว่าสองโมเดลนี้แยกกันไม่ออก มีเพียงการประเมินของคุณเองเท่านั้นที่บอกได้ว่าโมเดลใดแยกไม่ออกในงานของคุณ

อะไรจะทำให้ตัวเลขนี้เปลี่ยนแปลงในเดือนหน้า
ไฟล์ของ Epoch เป็นไฟล์ที่มีชีวิต และมีสามสิ่งที่จะเปลี่ยนการตีความได้อย่างรวดเร็ว สิ่งแรกคือการประเมินโมเดลแนวหน้าใหม่ใด ๆ ที่ติดหนึ่งในสี่อันดับแรก เนื่องจากเมื่อกลุ่มคะแนนแน่นขนาดนี้ ข้อสังเกตจาก benchmark ที่เพิ่มเข้ามาเพียงรายการเดียวจะขยับคะแนนรวมได้มากกว่าในกรณีที่มีผู้นำที่ชัดเจน สิ่งที่สองคือการคลื่อนของช่วงความเชื่อมั่น — รายการล่าสุดมีช่วงที่กว้างที่สุด เพราะถูกประเมินบน benchmark ที่ทับซ้อนกันน้อยที่สุด ดังนั้นรุ่นที่เปิดตัวในเดือนกันยายนจึงมีแนวโน้มที่จะขยับมากที่สุด และของเดือนกรกฎาคมน้อยที่สุด สิ่งที่สามคือ benchmark ที่ถึงจุดอิ่มตัว ซึ่งเป็นความล้มเหลวแบบเฉพาะเจาะจงที่ดัชนีนี้ถูกสร้างขึ้นมาเพื่อรับมือ: เมื่อองค์ประกอบใดหยุดแยกแยะ Epoch จะถ่วงน้ำหนักองค์ประกอบใหม่ แทนที่จะปล่อยให้ความได้เปรียบของโมเดลหายไปพร้อมกับแบบทดสอบ
สำหรับตอนนี้ บทสรุปที่พอจะยืนยันได้คือบทสรุปแบบจำกัดขอบเขต Claude Opus 5.5 ครองอันดับหนึ่งบน Epoch Capabilities Index ที่ 167.35 ด้วยคะแนนนำ 0.84 จุด ซึ่งช่วงความเชื่อมั่นของตัวมันเองไม่สนับสนุน Claude Sonnet 5.5 ไต่ขึ้นมาจนเหลือห่างจากผู้นำเพียง 2.15 จุด จากระดับกลางของตระกูลเดียวกัน และกลุ่มโมเดลโอเพนเวตตามหลังพวกเขาทั้งหมดอยู่มากกว่ากว่าเก้าจุด การชิงตำแหน่งผู้นำเป็นการโยนเหรียญระหว่างสองผู้ให้บริการ แต่ช่องว่างด้านราคาสี่จุดระหว่างทั้งสองไม่ใช่เช่นนั้น
การเปรียบเทียบในบทความนี้4
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
