การ์ดชื่อเรื่องที่อ่านว่า “Claude Opus 5.5 ครองอันดับสูงสุดใน Coding Agent Index ด้วยคะแนน 66” พร้อมคำโปรยย่อย “โทเค็นถูกลง แต่บิลต่องานแพงขึ้น” และการ์ดมุมโค้งสามใบด้านล่าง: Coding Agent Index 66, ต้นทุนต่องาน $13.04 เพิ่มขึ้น 21% และ Claude Opus 5: 60 ที่ $10.79
Guides & Insights

Claude Opus 5.5 ครองอันดับ 1 ดัชนี Coding Agent ที่ 66 — และค่าดำเนินงานต่องานเพิ่มขึ้น 21%

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ผู้ขายลดราคาโทเค็นของClaude Opus 5.5ลง 20% เมื่อวันที่ 22 กันยายน 2026 สองวันต่อมา Artificial Analysis เผยแพร่ผลการวัด coding agent ที่แสดงให้เห็นว่าการลดราคาครั้งนี้ส่งผลต่อบิลของเอเจนต์อย่างไร: ต้นทุนต่อหนึ่งงาน เพิ่มขึ้น 21% เป็น$13.04 จาก$10.79ที่ดัชนีเดียวกันเรียกเก็บสำหรับClaude Opus 5คะแนนก็เพิ่มขึ้นเช่นกัน — 66บน Coding Agent Index ซึ่ง Artificial Analysis อธิบายว่าเป็นค่าสูงสุดที่เคยวัดได้ สูงกว่า Claude Opus 5 อยู่หกคะแนน และสูงกว่าClaude Fable 5.1สี่คะแนนในการตั้งค่าเดียวกัน ทั้งสองอย่างนี้เป็นจริงในเวลาเดียวกัน และเหตุผลที่ทั้งสองอย่างเป็นจริงพร้อมกันก็คือเรื่องราวทั้งหมดของการจัดอันดับครั้งนี้ โทเค็นที่ถูกลงซึ่งโมเดลใช้มากขึ้นไม่ใช่ภาระงานที่ถูกลง และเมื่อใช้ความพยายามในการคิดในระดับสูงสุดกับ agent run ที่ยาวนาน Claude Opus 5.5 ก็ใช้โทเค็นเหล่านั้นมากขึ้นมาก

สิ่งที่ Coding Agent Index ให้คะแนนจริง ๆ

นี่ไม่ใช่ตารางจัดอันดับโมเดล ทุกแถวบนนี้คือ คู่ฮาร์เนสและโมเดล — เช็กพอยต์ที่รันอยู่ภายในเอเจนต์เขียนโค้ดเฉพาะตัว ภายใต้การตั้งค่าความพยายามเฉพาะค่า แถวที่ทุกคนกำลังอ้างถึงคือ Claude Opus 5.5 ที่ max ความพยายาม ภายใน Claude Code ซึ่งเป็นฮาร์เนสที่ Anthropic สร้างขึ้นและใช้ปรับแต่งให้เข้ากับมัน คะแนน 60 ของ Claude Opus 5 และ 62 ของ Claude Fable 5.1 มาจากฮาร์เนสเดียวกันและการตั้งค่าความพยายามเดียวกัน ซึ่งเป็นสิ่งที่ทำให้การเปรียบเทียบเหล่านี้ตรงไปตรงมา แถวของโมเดลใดโมเดลหนึ่งในเอเจนต์เขียนโค้ดอื่นเป็นการวัดที่แตกต่างกัน และไม่ได้ถูกพิมพ์ไว้ที่นี่ราวกับว่าเป็นแถวเดียวกัน

ดัชนีนี้มีการกำหนดเวอร์ชัน และเวอร์ชันสำคัญกว่าชื่อแบรนด์ที่ติดอยู่บนนั้น บอร์ดที่เผยแพร่ในปัจจุบันในชื่อ v1.5เฉลี่ยจากการประเมินสามครั้ง โดยแต่ละครั้งมีน้ำหนักเท่ากัน และแต่ละครั้งรายงานเป็น pass@1 ที่เฉลี่ยจากการลองสามครั้งต่องาน:

Terminal-Bench 4.0 — งานเชลล์และคอมมานด์ไลน์แบบเอเจนต์: การนำทางในระบบไฟล์ การใช้เครื่องมืออย่างถูกต้อง การกู้คืนจากความล้มเหลวระหว่างทาง และการทำเวิร์กโฟลว์หลายขั้นตอนให้เสร็จสมบูรณ์

DeepSWE v1.1 — งานวิศวกรรมซอฟต์แวร์ งานแก้ไขรีโพซิทอรี

SWE-Atlas-QnA — คำถามเกี่ยวกับความเข้าใจในรีพอซิทอรี ซึ่งคำตอบนั้นได้มาจากการอ่านโค้ดเบสแทนที่จะเป็นการแก้ไขโค้ด

การประเมินสามรายการ ตัวเลขหนึ่งตัว และคอลัมน์ต้นทุนต่องานที่พิมพ์อยู่ข้าง ๆ คอลัมน์ต้นทุนนั้นคือเหตุผลที่ดัชนีนี้มีประโยชน์มากกว่าคะแนนเพียงอย่างเดียว และยังเป็นเหตุผลที่ทำให้ตัวเลขพาดหัวอ่านได้ยากกว่าที่เห็น

A two-column scoreboard comparing Claude Opus 5.5 against Claude Opus 5, both in the Claude Code harness at max reasoning effort: Coding Agent Index 66 vs 60, Terminal-Bench 4.0 63.1% vs 54.5%, DeepSWE v1.1 68.4% vs 62.5%, SWE-Atlas-QnA 66.4% vs 62.1%, cost per task $13.04 vs $10.79, and tokens per task 15.6M vs 11.4M.

องค์ประกอบทั้งสาม และที่มาของจุดทั้งหก

Artificial Analysis เผยแพร่แถวขององค์ประกอบต่าง ๆ ควบคู่ไปกับค่าคอมโพสิต และสิ่งเหล่านี้ไม่ได้เคลื่อนไหวอย่างสม่ำเสมอ

Terminal-Bench 4.063.1%สำหรับ Claude Opus 5.5 เมื่อเทียบกับ54.5%ของ Claude Opus 5 ซึ่งเพิ่มขึ้น8.6 คะแนน นี่ถือเป็นการพัฒนาครั้งใหญ่ที่สุดเพียงครั้งเดียวในชุดนี้

DeepSWE v1.168.4%เทียบกับ 62.5% เพิ่มขึ้น 5.9 จุด

SWE-Atlas-QnA66.4% เทียบกับ 62.1%, เพิ่มขึ้น 4.3 จุด.

หาค่าเฉลี่ยของทั้งสามตัวนั้น แล้วคุณจะได้ 66.0 ซึ่งเป็นค่าคอมโพสิต ลักษณะของการเพิ่มขึ้นต่างหากที่เป็นส่วนน่าสนใจ: โมเดลพัฒนาน้อยที่สุดในการอ่านโค้ดเบส และพัฒนามากที่สุดในการขับเคลื่อนเชลล์ Terminal-Bench คือการประเมินที่ใกล้เคียงที่สุดกับสิ่งที่ผู้คนหมายถึงจริง ๆ เมื่อพูดว่า “coding agent” — วงวนที่ทำงานต่อเนื่องยาวนาน โดยโมเดลเลือกคำสั่ง อ่านผลลัพธ์ และตัดสินใจว่าจะทำอะไรต่อไป โดยไม่มีมนุษย์อยู่ในวงวนระหว่างแต่ละขั้น การกระโดดขึ้น 8.6 จุดตรงนั้นเป็นการกล่าวถึงการใช้เครื่องมืออย่างต่อเนื่อง ไม่ใช่การสร้างโค้ด

สังเกตว่าสิ่งนั้นสื่อถึงอะไรเกี่ยวกับจุดที่ควรคาดว่าจะเห็นการปรับปรุง หากภาระงานของคุณคือ "อธิบายรีโพซิทอรีนี้" Claude Opus 5.5 ถือเป็นการอัปเกรดเล็กน้อยจาก Claude Opus 5 — สี่คะแนน หากภาระงานของคุณคือ "รันจนกว่าชุดการทดสอบจะผ่าน โดยแก้ไขสิ่งที่พัง" มันคือการกระโดดที่ใหญ่ที่สุดในตาราง

Screenshot of the Artificial Analysis Coding Agent Benchmarks page, showing the Coding Agent Index v1.5 composite of three equally weighted evaluations — DeepSWE v1.1 at 113 tasks by Datacurve, Terminal-Bench 4.0 at 66 tasks by Laude Institute and SWE-Atlas-QnA at 124 tasks by Scale AI — with Claude Opus 5.5 at 66 at the top of the index highlight chart and a cost-per-task bar of about $13.

ตัวเลขที่พิมพ์ไว้ข้างการจัดอันดับ: $13.04 ต่องาน

นี่คือเลขคณิตที่ทำให้การลดราคาดูไม่เหมือนกับวิธีที่มันถูกประกาศ$4.00 ต่อล้านโทเคนอินพุต และ $20.00 ต่อล้านโทเคนเอาต์พุต ลดลงจาก $5.00 และ $25.00 สำหรับ Claude Opus 5 โดยการอ่านจากแคชลดลง 60% เหลือ $0.20 ต่อล้าน ทุกบรรทัดเหล่านั้นล้วนถูกลง แต่การประมาณการของ Artificial Analysis ว่าหนึ่งงานมีค่าใช้จ่ายเท่าไรเมื่อใช้ความพยายามสูงสุดกลับสูงกว่าเดิม:

ต้นทุนต่องาน — $13.04 สำหรับ Claude Opus 5.5 เทียบกับ $10.79 สำหรับ Claude Opus 5 เพิ่มขึ้น 21% บนดัชนีเดียวกัน ฮาร์เนสเดียวกัน และการตั้งค่าความพยายามเดียวกัน

จำนวนโทเค็นทั้งหมดต่องาน — ประมาณ 15.6 ล้าน เทียบกับ 11.4 ล้าน เพิ่มขึ้นประมาณ 37%

โทเคนเอาต์พุตต่องาน — ประมาณ 333,000เทียบกับ 137,000 ซึ่งมากกว่าสองเท่า เอาต์พุตเป็นทิศทางที่มีต้นทุนสูง และเป็นเส้นที่ขยับมากที่สุด

อินพุตที่แคชไว้ต่องาน — ประมาณ 14.6M เทียบกับ 10.9M เพิ่มขึ้นราว 34% การลดการอ่านแคชลง 60% ได้ผลจริงในกรณีนี้ เพียงแต่ยังไม่มากพอที่จะชดเชยงานที่อ่านบริบทเพิ่มขึ้นหนึ่งในสาม

ลองคำนวณด้วยอัตราที่ประกาศไว้ แล้วภาพรวมก็จะปรากฏออกมาเอง พิจารณาเฉพาะโทเค็นเอาต์พุต: 333,000 โทเค็นที่ราคา $20.00 ต่อล้าน คิดเป็นประมาณ $6.66 — ประมาณครึ่งหนึ่งของตัวเลขประเมินทั้งหมดที่ $13.04 จากรายการเดียวที่เพิ่มขึ้นเป็นสองเท่า รายการอ่านแคชมีปริมาณมหาศาลและราคาแทบฟรี: 14.6 ล้านโทเค็นที่ $0.20 ต่อล้าน คิดเป็นต่ำกว่า $3 การลด 20% นั้นมีจริง และการลดค่าแคชก็มีจริง แต่เมื่อใช้ความพยายามสูงสุดกับลูปของเอเจนต์ สิ่งเหล่านี้มีน้ำหนักไม่พอเมื่อเทียบกับโมเดลที่คิดนานขึ้นและเขียนมากขึ้น

สิ่งนั้นมีผลโดยตรงต่อวิธีที่คุณจัดงบประมาณ หากทีมของคุณรันงานเอเจนต์เขียนโค้ด 500 งานต่อวันด้วยความพยายามสูงสุด ความแตกต่างระหว่าง $10.79 กับ $13.04 อยู่ที่ประมาณ $1,125 ต่อวัน — ประมาณ $34,000 ต่อเดือน — สำหรับจำนวนงานเท่ากัน นั่นคือตัวเลขที่ต้องนำไปวางตรงหน้าผู้ที่มีอำนาจอนุมัติการเปลี่ยนโมเดล และไม่ใช่ตัวเลขที่การลดราคาสื่อเป็นนัย

ทำไม $5.98 และ $13.04 ถึงเป็นความจริงทั้งคู่

Artificial Analysis เผยแพร่ตัวเลขที่แตกต่างของต้นทุนต่องานสำหรับโมเดลเดียวกันเมื่อไม่กี่วันก่อน และเมื่ออ่านทั้งสองอย่างร่วมกันโดยไม่มีป้ายกำกับ ก็ทำให้ดูเหมือนเป็นความขัดแย้งกัน ทั้งสองไม่ใช่ความขัดแย้ง — มันเป็นการประเมินที่แตกต่างกันสองแบบ และความแตกต่างนั้นให้แง่คิด

ในIntelligence Index บทวิเคราะห์เมื่อวันที่ 22 กันยายน ระบุว่าต้นทุนต่องานของ Claude Opus 5.5 อยู่ที่ $5.98 อยู่ในระดับใกล้เคียงกับ $5.86 ของ Claude Opus 5 แม้จะมีโทเคนเอาต์พุตต่องานประมาณ 119,000 โทเคน เทียบกับ 73,000 ของ Opus 5 ตรงนี้ การลดราคาและโทเคนที่เพิ่มขึ้นหักลบกันเกือบพอดี ใน Coding Agent Index ที่ระดับความพยายามสูงสุด ใน Claude Code โมเดลเดียวกันมีค่าใช้จ่าย $13.04 เทียบกับ $10.79

ทั้งสองเป็นการวัดที่ซื่อสัตย์ของภาระงานที่แตกต่างกัน การประเมินแบบถาม-ตอบคือการแลกเปลี่ยนสั้น ๆ ส่วนงานของเอเจนต์คือลูปยาวของการเรียกใช้เครื่องมือที่มีบริบทเพิ่มขึ้น และการเติบโตนั้นทบทวีในทิศทางเอาต์พุต ซึ่งราคาสูงที่สุด บทเรียนในทางปฏิบัติคือ "การลดราคาชดเชยโทเค็นส่วนเกินหรือไม่?" ไม่มีคำตอบเดียว — ขึ้นอยู่กับความยาวของงาน และยิ่งงานยาวและเป็นแบบเอเจนต์มากเท่าไร การชดเชยก็ยิ่งแย่ลงเท่านั้น หากคุณจัดงบประมาณจากเกณฑ์มาตรฐานคำตอบสั้น คุณจะประเมินบิลของเอเจนต์ต่ำเกินไป

ข้อควรระวังสามข้อที่ควรอยู่ในแถวนั้น

เลข 66 เป็นตัวเลขของ Claude Code ไม่ใช่ตัวเลขของโมเดลล้วน ๆดัชนีนี้จงใจจับคู่โมเดลกับฮาร์เนส ด้วยเหตุผลว่าการจัดเส้นทางเครื่องมือ ลอจิกการลองใหม่ และการจัดการบริบท แยกออกจากประสิทธิภาพที่วัดได้ของเอเจนต์ไม่ได้ สิ่งนี้เอื้อประโยชน์ให้ Anthropic ในกรณีนี้ เพราะฮาร์เนสที่ใช้ให้คะแนนมันคือของตัวเอง Artificial Analysis ระบุว่ามุมมองเปรียบเทียบฮาร์เนสจะมาในเร็ว ๆ นี้ และจนกว่าจะมีมุมมองนั้น ก็ไม่มีใครบอกได้ว่าคะแนนนำหกคะแนนนั้นมาจากเช็กพอยต์มากแค่ไหน และมาจากโครงค้ำที่ห่อหุ้มมันอยู่มากแค่ไหน

ตัวเลข Terminal-Bench 4.0 ของ Anthropic เองนั้นสูงกว่าคอมโพเนนต์นี้ และถูกรันโดย Anthropic เอกสารเปิดตัวรายงานว่า 66.4% ที่xhigh ระดับความพยายาม; คอมโพเนนต์ Coding Agent Index อยู่ที่ 63.1% ที่ระดับ max และการรันแบบอิสระแยกต่างหากของ Artificial Analysis วัดได้ 59.6% ในฮาร์เนสของตัวเองบนเวอร์ชันเบนช์มาร์กเดียวกัน สามตัวเลข สามการตั้งค่า สามผู้ผลิต 63.1% ในแถวด้านบนคือคอมโพเนนต์ของดัชนีเอง และควรนำไปเปรียบเทียบกับตัวเลขอื่น ๆ บนดัชนีนั้นเท่านั้น ส่วน 66.4% ของผู้จำหน่ายเป็นตัวเลขที่ผู้จำหน่ายรายงานเอง ยังไม่ถูกทำซ้ำโดยบุคคลที่สาม และอยู่ในระดับความพยายามที่แตกต่างกัน

การแก้ไขดัชนีมีการขยับ บล็อกนี้รายงานแถวของ Coding Agent Index ที่แตกต่างออกไปในช่วงต้นเดือนกันยายน บนเวอร์ชันก่อนหน้าของบอร์ดเดียวกัน และตัวเลขเก่าเหล่านั้นไม่สามารถนำมาเปรียบเทียบกับ v1.5 ได้ — ชุดการประเมินเองก็เปลี่ยนไปเมื่อ Terminal-Bench 4.0 เข้ามาแทนที่เวอร์ชันก่อนหน้า มิเรอร์ของบุคคลที่สามยังคงมีสแนปช็อตที่ล้าสมัยพร้อมป้ายเวอร์ชันเก่าอยู่ หากตัวเลขของ Claude Opus 5.5 บนดัชนีนี้ไม่ได้มาจากแถว v1.5 ปัจจุบัน อย่านำไปวางไว้ข้างตัวเลข v1.5 และอย่าคำนวณผลต่างระหว่างทั้งสอง

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the 2026-09-22 date by Anthropic, a 1M-token context window with 128K max output, text plus image plus file input, input $4.00 and output $20.00 per 1M tokens, and a Python snippet calling the model through api.orcarouter.ai.

สิ่งที่ต้องปรับใช้จริง ๆ

อันดับนี้เป็นตัวเลขที่วัดที่ระดับความพยายามสูงสุด (max effort) และ max effort คือค่าตั้งค่าที่แทบไม่มีใครควรใช้เป็นค่าเริ่มต้นในการปล่อยใช้งาน Claude Opus 5.5 มีค่าตั้งค่าความพยายามห้าระดับ — low, medium, high, xhigh และ max — และโมเดลนี้ตั้งค่าเริ่มต้นไว้ที่ medium Artificial Analysis ยังไม่ได้เผยแพร่แถวข้อมูลของ Coding Agent Index ที่ค่าตั้งค่าต่ำกว่าเหล่านี้ ดังนั้นการประหยัดต้นทุนในส่วนนั้นจึงยังไม่ถูกวัดเป็นตัวเลขบนดัชนีนี้ ส่วนบน Intelligence Index โมเดลเดียวกันที่ค่า medium ทำคะแนนได้ 51 — เท่ากับค่า max ของ Claude Opus 5 — ที่ $1.34 ต่องาน นั่นคือทิศทางที่การประหยัดอยู่ และมันเป็นเพียงค่าตั้งค่า ไม่ใช่โมเดลคนละตัว

รูปแบบที่เป็นจริงคือการแยกออกเป็นสองทาง: เก็บ max effort ไว้กับลูปอัตโนมัติแบบยาวที่กำไร 8.6 จุดบน Terminal-Bench คือสิ่งที่คุณกำลังซื้อ และให้งานตามปกติรันที่ effort ต่ำลง ซึ่งโมเดลยังนำหน้าจุดที่ Claude Opus 5 จบอยู่มาก เพราะ effort เป็นพารามิเตอร์ของคำขอ ไม่ใช่การดีพลอย การแยกแบบนั้นจึงเป็นกฎการจัดเส้นทาง และทั้งสองโมเดลอยู่ในแคตตาล็อกเดียวกัน — ของ Anthropic ราคาที่ประกาศไว้ซึ่งส่งผ่านด้วยมาร์กอัป 0% ดังนั้นการลดราคาของผู้ขายจึงมีผลทันทีบน anthropic/claude-opus-5.5 ในวันเดียวกับที่ประกาศ และไม่ต้องมีสัญญาฉบับที่สองหรือแก้โค้ดใด ๆ ในการ A/B ทั้งสองกับงานของคุณเอง สำหรับเส้นทาง max-effort โดยเฉพาะ ที่งานเดียวอาจเป็นการรันแบบไม่มีคนดูแลเป็นเวลานาน automatic failover คือสิ่งที่ทำให้ผู้ให้บริการที่หยุดชะงักไม่ทำให้คุณต้องเสียลูปทั้งลูปไป

อะไรที่ยังไม่ถูกวัด

มีสามสิ่งที่จะเปลี่ยนภาพนี้ได้ และยังไม่มีสิ่งใดเกิดขึ้นจริงในตอนนี้ ยังไม่มีการเปรียบเทียบแบบใช้ความพยายามเท่ากันและฮาร์เนสเดียวกันระหว่าง Claude Opus 5.5 กับเช็กพอยต์ของคู่แข่ง — การเปรียบเทียบข้ามผู้ขายทุกรายที่มีอยู่ล้วนเป็นตารางของผู้ขายสองรายที่วางเรียงข้างกัน ยังไม่มีการเผยแพร่ผลรัน Coding Agent Index ที่ระดับความพยายามปานกลางหรือสูง ซึ่งเป็นระดับที่ทราฟฟิกในโปรดักชันส่วนใหญ่น่าจะอยู่ และคำถามเรื่องการระบุที่มาของฮาร์เนส — ว่า 66 นั้นเป็นของโมเดลเท่าใด และเป็นของ Claude Code เท่าใด — ทางดัชนีได้รับทราบแล้วและเลื่อนออกไป

สิ่งที่คุณลงมือทำได้วันนี้แคบกว่าและมีประโยชน์มากกว่าการจัดอันดับ Claude Opus 5.5 เก่งงานที่ขับเคลื่อนด้วยเชลล์อย่างต่อเนื่องมากกว่า Claude Opus 5 จริง ๆ นั่นคือองค์ประกอบเดียวที่มีกำไรจำนวนมาก สม่ำเสมอ และเกิดขึ้นอย่างเป็นอิสระ นอกจากนี้ยังมีต้นทุนต่องานสูงกว่าในการตั้งค่าที่วัดกำไรนั้น ประมาณ {{1}}$2.25{{/1}} ต่อหนึ่งงาน และการลดราคาต่อโทเคนไม่ครอบคลุมถึงตัวเลขนั้น ควรนำไปใช้งานที่ความพยายามสูงสุดในจุดที่วงจรยาวนานและต้นทุนความล้มเหลวสูง ส่วนที่อื่นให้ใช้การตั้งค่าที่ถูกกว่า และตรวจสอบดัชนีอีกครั้งเมื่อแถวที่ใช้ความพยายามต่ำกว่าปรากฏขึ้น เพราะนั่นคือการกำหนดค่าที่ทีมส่วนใหญ่จะจ่ายจริง หากคุณเปลี่ยนเพียงเพราะการลดราคา คุณกำลังซื้อสิ่งผิด — โมเดลมีราคาถูกกว่าต่อโทเคนและแพงกว่าต่องาน และมีเพียงหนึ่งในสองตัวเลขนั้นที่ปรากฏในใบแจ้งหนี้ของคุณ

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube