การ์ดหัวเรื่องที่สร้างขึ้นสำหรับบทความเกี่ยวกับ Epoch Capabilities Index โดยมีพาดหัวว่า 'Claude Opus 5.5 Tops the Epoch Capabilities Index' อยู่เหนือบรรทัดตัวอักษรโมโนสเปซสีฟ้าอ่อนที่อ่านว่า '167.35 vs 166.51' และบรรทัดย่อยสีเทาที่อ่านว่า 'Top two on a composite of 50+ benchmarks' พร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Claude Opus 5.5 ขึ้นแท่นอันดับหนึ่งใน Epoch Capabilities Index ด้วยคะแนนนำ 0.84 คะแนน

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ตัวเลขคือ 0.84. Claude Opus 5.5อยู่ที่ 167.35 บน Epoch Capabilities Index ณ ไฟล์ที่เราอ่านเมื่อวันที่ 2 ตุลาคม 2026 โดยมี GPT-6 Astraที่ 166.51 — ช่องว่างน้อยกว่าหนึ่งจุดบนสเกลที่ช่วง 95% ที่เผยแพร่ของทั้งสองโมเดลทับซ้อนกันเกือบทั้งหมด โดย Opus 5.5 อยู่ที่ 164.0 ถึง 172.0 เทียบกับ Astra ที่ 163.14 ถึง 171.05 ถัดลงมา Claude Sonnet 5.5ทำได้ 165.2 และ Claude Fable 5.1164.82 ดังนั้นสี่อันดับแรกในคอมโพสิตอิสระจากมากกว่าห้าสิบเบนช์มาร์กจึงห่างกัน 2.53 จุด และสามในนั้นมีชื่อผู้จำหน่ายรายเดียวกัน ลำดับนี้เป็นจริงในแง่ที่ว่าค่าประมาณจุดนั้นเรียงลำดับกัน มันไม่เป็นจริงในแง่ที่ว่าคะแนนนำ 0.84 จุดจะรอดพ้นจากแถบความคลาดเคลื่อนของตัวเอง และทุกสิ่งที่น่าพูดถึงเกี่ยวกับตารางอันดับนี้ล้วนตามมาจากการยึดข้อเท็จจริงทั้งสองนี้ไว้พร้อมกัน

ดัชนีคืออะไร และ 0.84 ของจุดไม่ใช่อะไร

Epoch Capabilities Index ไม่ใช่กระดานคะแนนที่ผู้ให้บริการจัดทำขึ้นเอง มันถูกสร้างโดย Epoch AI องค์กรวิจัยอิสระ ในรูปแบบคอมโพสิตที่ร้อยเรียงคะแนนจากเบนช์มาร์กที่แตกต่างกันมากกว่าห้าสิบรายการเข้าเป็นสเกลความสามารถทั่วไปหนึ่งเดียว โดยอนุมานความยากสัมพัทธ์ของแต่ละเบนช์มาร์กจากโมเดลที่บังเอิญปรากฏอยู่ในหลายเบนช์มาร์กพร้อมกัน วิธีการนี้ระบุไว้ในบทความที่เขียนร่วมกับนักวิจัยจากทีม AGI Safety & Alignment ของ Google DeepMind และได้รับทุนสนับสนุนจาก DeepMind แต่ Epoch ระบุชัดเจนว่าดัชนีนี้เป็นผลิตภัณฑ์ของตัวเอง และตนถือสิทธิ์เต็มเหนือดัชนีนี้ — ความแตกต่างที่ควรค่าแก่การจดจำเมื่อแหล่งทุนและผู้เผยแพร่คะแนนไม่ใช่ฝ่ายเดียวกัน โค้ดเป็นสาธารณะ

คุณสมบัติสองประการของมาตรานี้สำคัญกว่าพาดหัวข่าว ประการแรกคือ ECI ถูกยึดโยงโดยเจตนาแทนที่จะเป็นแบบสัมบูรณ์: คะแนนดิบถูกปรับสเกลใหม่เพื่อให้ Claude 3.5 Sonnet อยู่ที่ 130 และ GPT-5 อยู่ที่ 150 ซึ่งหมายความว่าตัวเลขบนดัชนีนี้จะมีความหมายก็ต่อเมื่ออยู่ข้างตัวเลขอื่นจากไฟล์เดียวกันเท่านั้น ไม่มีความหมายในตัวเอง ประการที่สองคือดัชนีนี้ไม่มีเพดาน ไม่มี 100 ให้เข้าใกล้ ดังนั้น "จุดสูงสุดของดัชนี" จึงเป็นข้อความเกี่ยวกับวันที่ ไม่ใช่เกี่ยวกับขีดจำกัดที่ใครคนใดคนหนึ่งไปถึงแล้ว

ซึ่งเป็นเหตุผลว่าทำไมการอ่านค่า 167.35 เทียบกับ 166.51 อย่างตรงไปตรงมาจึงไม่ใช่ “Claude Opus 5.5 เป็นโมเดลที่เก่งที่สุดในโลก” แต่เป็นข้อสรุปที่แคบกว่าและนำไปอ้างได้น้อยกว่า: จากการจำลองหลักฐานที่มีอยู่ ณ วันที่ 2 ตุลาคม 2026 ของ Epoch โมเดลทั้งสองแยกออกจากกันไม่ได้ที่ตำแหน่งสูงสุด และลำดับระหว่างทั้งสองเป็นเพียงการตัดสินกรณีเสมอมากกว่าการวัด ช่วงค่าที่เผยแพร่ระบุเช่นนั้นโดยตรง — 164.0 ถึง 172.0 และ 163.14 ถึง 171.05 มีช่วงพิสัยร่วมกันเป็นส่วนใหญ่ ใครก็ตามที่อ้าง 0.84 เป็นคำตัดสินกำลังอ้างสิ่งที่เกิดจากการปัดเศษ

บล็อก Anthropic และขนาดของรีลีส

ลักษณะที่ให้ข้อมูลมากกว่าของตารางไม่ใช่ว่าใครเป็นที่หนึ่ง แต่เป็นแถวที่สามและสี่ Claude Sonnet 5.5 ซึ่งเปิดตัวเมื่อวันที่ 28 กันยายนและทำคะแนนได้ 165.2 อยู่สูงกว่า Claude Fable 5.1 ซึ่งเปิดตัวเมื่อวันที่ 1 กันยายนที่ 164.82 อยู่ 0.38 คะแนน — ใกล้กันพอที่ทั้งสองจะอยู่ในตำแหน่งเดียวกันในทางปฏิบัติ และใกล้กันพอที่ทั้งคู่จะอยู่ต่ำกว่ายอดตารางเพียง 2.15 คะแนน Sonnet เป็นผลิตภัณฑ์ระดับกลางในสายของ Anthropic และ Fable เป็นโมเดลที่บริษัทเคยชี้ไปที่งานการใช้เหตุผลทั่วไป การที่ทั้งสองตอนนี้ขนาบแนวหน้าจากด้านล่างเพียงเล็กน้อยคือการเปลี่ยนแปลงที่มีสาระสำคัญในการรีเฟรชครั้งนี้ มากกว่าตัวตนของผู้นำ

ความก้าวหน้าตามรุ่นของ Anthropic เองก็มองเห็นได้เช่นกัน Claude Opus 5.5 เป็นรุ่นสืบทอดของ Claude Opus 5 ซึ่ง Epoch ให้คะแนนไว้ที่ 162.94 โดยมีช่วงความเชื่อมั่น 160.2 ถึง 166.7 นั่นคือการพัฒนาขึ้น 4.41 จุดภายในเวลาราวสองเดือน จากการเปิดตัวเมื่อวันที่ 24 กรกฎาคมถึงการเปิดตัวเมื่อวันที่ 22 กันยายน ซึ่งเป็นการขยับที่ใหญ่กว่าช่องว่าง 0.84 จุดที่แยกอันดับหนึ่งกับอันดับสองในปัจจุบันออกจากกัน เมื่ออ่านเช่นนี้ ปริมาณที่น่าสนใจในตารางนี้คือความชันภายในเส้นของผู้จำหน่ายรายเดียว ไม่ใช่ช่องว่างระหว่างผู้จำหน่ายสองรายที่อยู่บนสุด

เส้นแบ่งของ open-weights อยู่ตรงไหน

Epoch แยกโมเดลตามระดับการเข้าถึง ซึ่งทำให้เส้นแบ่งของน้ำหนักเปิด (open-weights) ชัดเจนโดยไม่ต้องเดา รายการน้ำหนักเปิดที่ดีที่สุดคือ Kimi K3 ที่ 157.61 ลงวันที่ 16 กรกฎาคม และติดป้ายว่าไม่ใช่เชิงพาณิชย์ รองลงมาคือ DeepSeek V4 Pro 0813 ที่ 155.38 และ DeepSeek V4.1 Flash ที่ 155.0 ซึ่งทั้งคู่ไม่มีข้อจำกัด จากนั้นคือ GLM-5.3-Flash ที่ 151.94 และ GLM-5.2 ที่ 151.78 ดังนั้นโมเดลเปิดที่ใกล้ที่สุดกับอันดับต้นจึงตามหลังอยู่ 9.74 คะแนน — ช่องว่างที่กว้างกว่าช่องว่างระหว่างอันดับหนึ่งกับอันดับสองถึง 18 เท่า และกว้างพอที่ช่วงต่าง ๆ จะไม่เข้าใกล้กันเลย

ความไม่สมมาตรนั้นเป็นข้อค้นพบเดียวที่ยั่งยืนในตารางนี้ พรมแดนปิดนั้นเบียดเสียดกันอยู่ภายในสามจุดเท่านั้น ส่วนระยะห่างจากพรมแดนปิดไปจนถึงน้ำหนักที่ดาวน์โหลดได้ดีที่สุดนั้นใหญ่กว่าถึงหนึ่งอันดับขนาด ดัชนีเชิงประกอบที่ช่วยให้คุณเปรียบเทียบข้ามรุ่นของเบนช์มาร์กได้นั้นเป็นเครื่องมือที่เหมาะสำหรับการสังเกตเรื่องนี้พอดี เพราะมันสามารถบอกสิ่งเดียวกันได้ทั้งในเดือนกรกฎาคมและเดือนกันยายน แทนที่จะรายงานว่าเบนช์มาร์กที่อิ่มตัวแล้วได้เงียบไป

บางแถวที่อยู่ใกล้เคียงนั้นคุ้มค่าที่จะปักหมุดไว้เพื่อให้เห็นบริบท เนื่องจากมันคือโมเดลที่ผู้อ่านนำมาเทียบกับ Opus 5.5 จริง ๆ:

• Claude Sonnet 5 — 156.34 เปิดตัวเมื่อวันที่ 30 มิถุนายน ช่วง 153.61 ถึง 158.81

• Grok 4.6 — 156.61 เปิดตัวเมื่อวันที่ 12 สิงหาคม ช่วง 154.66 ถึง 158.93

• Gemini 3.8 Flash — 156.93, เปิดตัววันที่ 2 กันยายน, ช่วง 154.64 ถึง 160.42

• Muse Spark 1.3 — 156.86 เปิดตัวเมื่อวันที่ 2 กันยายน ช่วง 154.73 ถึง 159.56

• GPT-5.6 Sol — 161.8 เปิดตัวเมื่อวันที่ 9 กรกฎาคม ช่วง 159.26 ถึง 165.26

ตำแหน่งดัชนีไม่ใช่ตั๋วเงิน

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra on the Epoch Capabilities Index. Left column Claude Opus 5.5: ECI 167.35 with interval 164.0 to 172.0, released 22 September 2026, input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K output. Right column GPT-6 Astra: ECI 166.51 with interval 163.14 to 171.05, released 3 September 2026, input $10.00, output $50.00, cache read $1.00, context 1.05M tokens with 128K output and a long-context tier above 272K tokens. A footer line reads 'Index figures per the Epoch Capabilities Index file read 2 October 2026; prices per the OrcaRouter catalogue.'

ตรงนี้ ลีดเดอร์บอร์ดไม่ได้เป็นเรื่องราวทั้งหมดอีกต่อไป เพราะสองโมเดลอันดับต้น ๆ มีค่าใช้จ่ายไม่ใกล้เคียงกันเลย จากแค็ตตาล็อกของเราเอง ซึ่งมีทั้งสองรุ่นในราคาที่ผู้ให้บริการประกาศไว้โดยไม่บวกเพิ่ม Claude Opus 5.5 ที่ $4.00/$20.00 โดยมีค่าอ่านแคช $0.20 และ GPT-6 Astra ที่ $10.00/$50.00 โดยมีค่าอ่านแคช $1.00 ห่างกัน 2.5 เท่าในทั้งสองทิศทางของตารางราคา Astra ยังปรับขึ้นเมื่อพรอมป์ต์เกิน 272,000 โทเคน โดยอินพุตจะอยู่ที่ $20.00 และเอาต์พุตที่ $75.00; Opus 5.5 คงราคา $4.00/$20.00 แบนราบตลอดหน้าต่าง 1M โทเคนทั้งหมด ทั้งสองให้บริการ 128,000 โทเคนเอาต์พุต

ลองคำนวณตัวเลขที่งานเวิร์กโหลดบริบทยาวต้องจ่ายจริง — พรีฟิกซ์ 180,000 โทเคนที่เสิร์ฟจากแคช และโทเคนที่สร้างขึ้น 5,000 โทเคน บน Opus 5.5 นั่นคือ 180,000 โทเคนในราคา $0.20 ต่อล้าน หรือประมาณ 3.6 เซนต์ บวกกับ 5,000 โทเคนในราคา $20 ต่อล้าน หรือ 10 เซนต์: รวมประมาณ 13.6 เซนต์ บน GPT-6 Astra คือ 180,000 โทเคนในราคา $1.00 หรือ 18 เซนต์ บวกกับ 5,000 โทเคนในราคา $50 หรือ 25 เซนต์: รวมประมาณ 43 เซนต์ ความได้เปรียบ 0.84 จุด กับช่องว่างต้นทุน 3.2 เท่า ไม่ใช่ข้อเท็จจริงประเภทเดียวกัน และการตัดสินใจจัดซื้อที่ชั่งน้ำหนักเฉพาะอย่างแรก ก็เท่ากับได้ชั่งน้ำหนักตัวเลขที่น้อยกว่า

Fable 5.1 ตอกย้ำประเด็นนี้จากอีกด้านของตารางราคาของผู้ขายรายเดียวกัน: ที่ราคา $10.00/$50.00 มันถูกตั้งราคาเหมือน Astra ทุกประการ และได้คะแนน 164.82 — ต่ำกว่า Opus 5.5 อยู่ 2.53 คะแนนในราคาเดียวกัน ดัชนีจัดให้สามรายการระดับแนวหน้าของ Anthropic ห่างกันไม่เกิน 2.53 คะแนน ขณะที่ตารางราคาของบริษัททำให้รายการเหล่านี้มีราคาต่างกัน 2.5 เท่า ซึ่งอธิบายทางเลือกที่อยู่ตรงหน้าผู้ซื้อได้ดีกว่าการจัดอันดับใดๆ เพียงอย่างเดียวมาก

ถ้าคุณจะเถียงเรื่องตัวเลข ก็ไปเถียงบนทราฟฟิกของคุณเอง

Screenshot of the Epoch Capabilities Index leaderboard page, showing the ranking list of models by capability score with the composite index chart above it.

เหตุผลที่ดัชนีนี้คุ้มค่าจะอ่านเลยก็คือ มันถูกวัดโดยคนอื่นที่ไม่ใช่ผู้ขาย — แต่โครงสร้างของตัวคอมโพสิตเองต่างหากที่กำหนดเงื่อนไขของการโต้แย้ง การปรับเทียบของ Epoch การประเมินความยาก และวิธีจัดการกับโมเดลที่ข้ามเบนช์มาร์ก ล้วนอยู่ต้นน้ำของตัวเลขในตาราง และไม่มีสิ่งใดในนั้นที่ผู้อ่านจะคำนวณย้อนกลับได้จากภาพหน้าจอ เช่นเดียวกันกับเบนช์มาร์กพาดหัวของทุกเจ้า ซึ่งเป็นเหตุผลว่าการเคลื่อนไหวที่มีประโยชน์จึงไม่ใช่การเลือกข้างระหว่างพวกมัน แต่เป็นการเปรียบเทียบพวกมันบนทราฟฟิกที่คุณควบคุมเอง

ทั้งสองโมเดลนี้เข้าถึงได้จากคีย์ API เดียวบน OrcaRouter ซึ่งส่งราคาตามรายการของผู้ให้บริการผ่านมาโดยบวกกำไร 0%: Claude Opus 5.5 ราคา $4.00/$20.00 โดยอ่านแคชที่ $0.20 และ GPT-6 Astra ราคา $10.00/$50.00 โดยมีระดับเกิน 272K นำมาใช้ตรงตามที่ผู้ให้บริการกำหนดไว้ทุกประการการส่งชุดพรอมป์เดียวกันไปยังทั้งสองโมเดลเป็นการเปลี่ยนการตั้งค่า ไม่ใช่สัญญาฉบับที่สอง และในจุดที่ทั้งสองถูกจัดเส้นทางไว้ การสลับไปใช้ระบบสำรองอัตโนมัติจะทำงานอยู่เบื้องหลัง ซึ่งสำคัญสำหรับการตัดสินใจที่ใกล้กับระดับพื้นสัญญาณรบกวนเช่นนี้ ตารางอันดับอาจบอกคุณได้ว่าสองโมเดลนี้แยกกันไม่ออก มีเพียงการประเมินของคุณเองเท่านั้นที่บอกได้ว่าโมเดลใดแยกไม่ออกในงานของคุณ

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.

อะไรจะทำให้ตัวเลขนี้เปลี่ยนแปลงในเดือนหน้า

ไฟล์ของ Epoch เป็นไฟล์ที่มีชีวิต และมีสามสิ่งที่จะเปลี่ยนการตีความได้อย่างรวดเร็ว สิ่งแรกคือการประเมินโมเดลแนวหน้าใหม่ใด ๆ ที่ติดหนึ่งในสี่อันดับแรก เนื่องจากเมื่อกลุ่มคะแนนแน่นขนาดนี้ ข้อสังเกตจาก benchmark ที่เพิ่มเข้ามาเพียงรายการเดียวจะขยับคะแนนรวมได้มากกว่าในกรณีที่มีผู้นำที่ชัดเจน สิ่งที่สองคือการคลื่อนของช่วงความเชื่อมั่น — รายการล่าสุดมีช่วงที่กว้างที่สุด เพราะถูกประเมินบน benchmark ที่ทับซ้อนกันน้อยที่สุด ดังนั้นรุ่นที่เปิดตัวในเดือนกันยายนจึงมีแนวโน้มที่จะขยับมากที่สุด และของเดือนกรกฎาคมน้อยที่สุด สิ่งที่สามคือ benchmark ที่ถึงจุดอิ่มตัว ซึ่งเป็นความล้มเหลวแบบเฉพาะเจาะจงที่ดัชนีนี้ถูกสร้างขึ้นมาเพื่อรับมือ: เมื่อองค์ประกอบใดหยุดแยกแยะ Epoch จะถ่วงน้ำหนักองค์ประกอบใหม่ แทนที่จะปล่อยให้ความได้เปรียบของโมเดลหายไปพร้อมกับแบบทดสอบ

สำหรับตอนนี้ บทสรุปที่พอจะยืนยันได้คือบทสรุปแบบจำกัดขอบเขต Claude Opus 5.5 ครองอันดับหนึ่งบน Epoch Capabilities Index ที่ 167.35 ด้วยคะแนนนำ 0.84 จุด ซึ่งช่วงความเชื่อมั่นของตัวมันเองไม่สนับสนุน Claude Sonnet 5.5 ไต่ขึ้นมาจนเหลือห่างจากผู้นำเพียง 2.15 จุด จากระดับกลางของตระกูลเดียวกัน และกลุ่มโมเดลโอเพนเวตตามหลังพวกเขาทั้งหมดอยู่มากกว่ากว่าเก้าจุด การชิงตำแหน่งผู้นำเป็นการโยนเหรียญระหว่างสองผู้ให้บริการ แต่ช่องว่างด้านราคาสี่จุดระหว่างทั้งสองไม่ใช่เช่นนั้น

การเปรียบเทียบในบทความนี้4

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube