การ์ดชื่อเรื่องแบบฮีโร่สำหรับ Claude Opus 5.5 vs Claude Opus 5 โดยมีหัวข้อว่า 'ระดับความพยายามไม่ได้หมายถึงสิ่งเดียวกัน' พร้อมป้ายที่ระบุค่าเริ่มต้นระดับกลาง vs ระดับสูง, $4.00 vs $5.00 และแคช $0.20 vs $0.50 และโลโก้ OrcaRouter ที่มุมขวาล่าง
Engineering & Research

Claude Opus 5.5 กับ Claude Opus 5: ระดับความพยายามไม่ได้หมายถึงสิ่งเดียวกัน

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สิ่งแรกที่ต้องรู้ก่อนเปรียบเทียบ Claude Opus 5.5กับClaude Opus 5คือ สองโมเดลนี้ไม่ได้ใช้สเกล effort ร่วมกัน และแทบทุกการเปรียบเทียบแบบตัวต่อตัวที่คุณจะได้อ่านในสัปดาห์นี้ต่างมองข้ามข้อนี้ไป Opus 5 ตั้งค่าเริ่มต้นที่ effort high ส่วน Opus 5.5 ตั้งค่าเริ่มต้นที่ medium และที่ระดับชื่อเดียวกัน มันคิดต่อเทิร์นมากกว่ารุ่นก่อน ดังนั้น "Opus 5.5 ที่ค่าเริ่มต้น เทียบกับ Opus 5 ที่ค่าเริ่มต้น" จึงไม่ใช่การทดลองที่ควบคุมตัวแปรได้ แต่เป็นการเปรียบเทียบระหว่างปริมาณการคิดที่แตกต่างกันสองแบบ ผู้ขายระบุไว้ในคู่มือการย้ายรุ่นของตัวเองเช่นนั้น: ให้ทดสอบหลายระดับ effort และอย่านำการตั้งค่าของ Opus 5 มาใช้ซ้ำ เพราะระดับที่ชื่อเหมือนกันไม่ได้แมปกับงบประมาณการคิดเดียวกัน เมื่อคุณควบคุมตัวแปรนี้ได้แล้ว ช่องว่างระหว่างสองโมเดลจะแคบลงในบางจุด กว้างขึ้นในจุดอื่น และการตัดสินใจอัปเกรดจะขึ้นอยู่กับสิ่งอื่นที่ไม่ใช่ความสามารถดิบ — ต้นทุนต่องานที่ทำเสร็จ และการเปลี่ยนแปลง API สี่อย่างที่จะทำให้โค้ดที่รันบน Opus 5 ในปัจจุบันพังทันที

จริง ๆ แล้วอะไรที่แตกต่างกัน เมื่อเทียบกันทีละสเปก

A two-column scoreboard for Claude Opus 5.5 and Claude Opus 5. Left column: price $4.00 / $20.00, cache read $0.20 per million, default effort medium, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.6% at medium effort, GDPval-AA 1846 Elo. Right column: price $5.00 / $25.00, cache read $0.50 per million, default effort high, Terminal-Bench 4.0 52.3%, FrontierCode v1.1 48.0%, GDPval-AA 1708 Elo. A sourcing footer notes the figures are vendor-reported and the effort settings differ between runs.

โมเดลทั้งสองใกล้เคียงกันเมื่อดูจากสเปกมากกว่าที่ตัวเลขเวอร์ชันบ่งชี้:

• ราคา — Claude Opus 5.5 อยู่ที่ $4.00 ต่ออินพุต / $20.00 ต่อเอาต์พุต ต่อล้านโทเค็น เทียบกับ Claude Opus 5 ที่ $5.00 / $25.00

• การอ่านแคช — $0.20 ต่อล้าน เทียบกับ $0.50 ต่อล้าน ลดลง 60% ในรายการค่าใช้จ่ายที่มีสัดส่วนโดดเด่นที่สุดในการรันแบบ Agentic

• การเขียนแคช — $5 ต่อล้านสำหรับหน้าต่าง 5 นาที และ $8 สำหรับหน้าต่าง 1 ชั่วโมงบน 5.5 เทียบกับ $6.25 บน Opus 5

• บริบทและเอาต์พุต — บริบท 1M โทเค็น และเอาต์พุต 128K ทั้งสองรุ่น; ทั้งสองรุ่นให้เอาต์พุตได้ถึง 300K บน Batch API เมื่อใช้ output-300k-2026-03-24 เฮดเดอร์เบต้า

• ระดับความพยายามเริ่มต้น — ปานกลาง บน Opus 5.5 เทียบกับ สูง บน Opus 5

• Thinking — ปรับตัวได้และเปิดอยู่ตลอดในทั้งสองแบบ แต่บน Opus 5.5 ไม่สามารถปิดใช้งานได้เลยอีกต่อไป

• จุดตัดข้อมูลความรู้ — มิถุนายน 2026 กับ พฤษภาคม 2026

• ความหน่วง — Anthropic จัดให้ Opus 5.5 อยู่ในระดับ "ปานกลาง" เมื่อเทียบกับกลุ่มผลิตภัณฑ์ปัจจุบัน และระบุว่าสามารถสร้างเอาต์พุตได้เร็วกว่า Opus 5 มากกว่า 30%

• การปลดระวาง — ไม่เร็วกว่า 22 กันยายน 2027 สำหรับ Opus 5.5 และไม่เร็วกว่า 24 กรกฎาคม 2027 สำหรับ Opus 5

โปรดสังเกตว่าไม่แตกต่างตรงไหน: หน้าต่างบริบท เพดานผลลัพธ์ ส่วนลดแบบแบตช์ และโมเดลการคิดแบบปรับตัวที่เปิดทำงานตลอดเวลา Opus 5.5 ไม่ใช่โมเดลที่บริบทใหญ่ขึ้นหรือให้ผลลัพธ์ยาวขึ้น แต่เป็นโมเดลที่ถูกกว่า เร็วกว่า และประหยัดโทเค็นมากกว่าบนกรอบขอบเขตเดิม

เกณฑ์เปรียบเทียบ และเครื่องหมายดอกจันเรื่องความพยายามที่กำกับอยู่บนทุกตัว

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

ตัวเลขเหล่านี้มาจากเอกสารเปิดตัวของ Anthropic — เป็นข้อมูลที่ผู้ขายรายงานเอง ทดสอบกับโมเดลของตัวเอง — และการตั้งค่าระดับความพยายาม (effort) สำคัญตรงนี้มากกว่าชื่อโมเดล:

• Terminal-Bench 4.0 — 66.4% เทียบกับ 52.3% โดยรัน Opus 5.5 ที่ระดับความพยายาม xhigh แทนที่จะเป็นค่าเริ่มต้น

• FrontierCode v1.1 (Main) — 54.4% เทียบกับ 48.0% และ 54.6% สำหรับ Opus 5.5 ที่ระดับความพยายามปานกลางซึ่งเป็นค่าเริ่มต้น

• CursorBench 4.0 — 57.8% เทียบกับ 46.6% และ 52.5% ที่ระดับ medium

• GDPval-AA v2.1 — 1846 Elo เทียบกับ 1708

• AutomationBench — 40.0% เทียบกับ 26.9%

• Humanity's Last Exam เมื่อใช้เครื่องมือ — 67.7% เทียบกับ 63.6%

• Terminal-Bench-Science 0.1 — 58.7% เทียบกับ 29.0% ซึ่งเป็นช่องว่างที่กว้างที่สุดในชุดนี้

• OSWorld 2.0 — 81.8% แบบบางส่วน เทียบกับ 74.0%

• การทำแผนภูมิ ด้วยเครื่องมือ — 89.0% เทียบกับ 83.4%

ผลลัพธ์ของ FrontierCode คือสิ่งที่ควรศึกษา Opus 5.5 ทำคะแนนได้ 54.4% ที่ xhigh และ 54.6% ที่ medium — ในเชิงสถิติเป็นตัวเลขเดียวกัน โดยใช้งบประมาณการคิดเพียงเศษเสี้ยว ไม่ว่า Anthropic จะปรับปรุงอะไรมา บนเบนช์มาร์กนั้น การปรับปรุงไม่ได้มาจากการคิดให้หนักขึ้น CursorBench ให้ผลตรงกันข้าม: 57.8% ที่ xhigh เทียบกับ 52.5% ที่ medium ซึ่งเป็นส่วนต่างห้าจุดที่บอกว่าความพยายามยังแลกมาซึ่งความแม่นยำจริงได้ในบางงาน บทเรียนไม่ใช่ "ใช้ medium" หรือ "ใช้ xhigh" แต่คือระดับความพยายามที่เหมาะสมตอนนี้ต้องวัดแยกตามเวิร์กโหลด และนิสัยเดิม ๆ ที่ปล่อย Opus 5 ไว้ที่ค่าเริ่มต้น high ก็ไม่สามารถบอกอะไรคุณเกี่ยวกับโมเดลใหม่ได้อีกต่อไป

Anthropic เสริมข้อควรระวังที่ควรกล่าวซ้ำว่า: ในระดับขีดความสามารถนี้ ช่องว่างของผลการวัดจากเบนช์มาร์กเป็น "แนวทางที่เชื่อถือได้น้อยลงสำหรับความแตกต่างในโลกจริง" และบริษัทกล่าวว่าช่องว่างภายในของตนกับ Claude Fable 5.1 นั้นแคบกว่าที่คะแนนที่เผยแพร่บ่งชี้ นั่นคือผู้ขายที่กำลังบอกคุณว่าอย่าตีความตารางของตัวเองมากเกินไป

ต้นทุนต่องานที่เสร็จสมบูรณ์คือการเปรียบเทียบที่ใช้ตัดสินใจ

ราคาต่อโทเคนเป็นหน่วยที่ไม่ถูกต้องสำหรับเอเจนต์ และการเปรียบเทียบนี้คือจุดที่แสดงให้เห็น ตัวอย่างที่ Anthropic คิดเอง: การวิเคราะห์การควบรวมกิจการที่ใช้ Opus 5.5 63 นาที และมีค่าใช้จ่ายน้อยกว่างานเดียวกันบน Opus 5 ถึง 50% ซึ่งใช้เวลา 93 นาที อัตราค่าบริการอธิบายส่วนหนึ่งของเรื่องนั้น — การลดลง 20% สำหรับอินพุตและเอาต์พุต, 60% สำหรับการอ่านแคช — แต่ไม่ใช่ทั้งหมด ส่วนที่เหลือคือโมเดลใช้โทเคนและเทิร์นน้อยลงเพื่อไปถึงจุดเดียวกัน คำพูดของลูกค้าที่เผยแพร่พร้อมการเปิดตัวชี้ไปในทิศทางเดียวกัน: Box รายงานว่าใช้โทเคนหนึ่งในสาม และคำตอบสั้นลงประมาณ 40% Kiro ใช้โทเคนประมาณครึ่งหนึ่งโดยมีการเรียกใช้ลดลง 40% Factory ใช้โทเคนเอาต์พุตน้อยลง 20–25% GitHub อยู่ในกลุ่มที่ใช้โทเคนและขั้นตอนน้อยที่สุดเท่าที่วัดได้

นั่นคือคำรับรองจากลูกค้าที่ผู้ขายเผยแพร่ ไม่ใช่ผลลัพธ์ที่ผ่านการตรวจสอบ และข้อความรวม ๆ ว่า "ถูกกว่าประมาณ 40% สำหรับงานทั่วไป" ก็เป็นคำอธิบายของ Anthropic เกี่ยวกับค่าเฉลี่ยจากงานต่าง ๆ ที่มันเลือกมาเอง ฉบับที่ซื่อตรงสำหรับการวางแผนของคุณเองคือ สมมติว่าส่วนลดป้ายราคา 20% นั้นเป็นของจริงและนำไปใช้ได้จริง แล้วมองอีก 20% ที่เหลือเป็นสมมติฐานที่คุณทดสอบได้ในบ่ายเดียว ด้วยการรันงานเดียวกันบนทั้งสองโมเดลแล้วนับโทเค็น

หมายเหตุเชิงโครงสร้างข้อหนึ่งว่าทำไมการลดราคาแคชจึงให้ผลมากกว่าที่ตัวเลขดูเหมือนบอก เอเจนต์ที่ส่งพรอมป์ระบบยาว ๆ พร้อมโครงสร้างไฟล์ซ้ำใหม่ทุกเทิร์น จะจ่ายในอัตราการอ่านจากแคชสำหรับอินพุตส่วนใหญ่ของมัน ไม่ใช่อัตราอินพุตใหม่ การลดราคาส่วนนั้นจาก $0.50 เหลือ $0.20 ต่อล้าน เปลี่ยนเศรษฐศาสตร์ของเซสชันที่รันยาวนานมากกว่าที่อัตราแบบพาดหัวข่าวทำเสียอีก — และนี่คือเหตุผลที่เวิร์กโหลดซึ่งแทบจะคุ้มทุนบน Opus 5 สามารถกลายเป็นคุ้มทุนอย่างชัดเจนบน Opus 5.5 ได้โดยไม่ต้องแก้พรอมป์ของคุณเลยแม้แต่นิดเดียว

การเปลี่ยนแปลงแบบ breaking change ทั้งสี่ข้อ ในรูปแบบเช็กลิสต์สำหรับการโยกย้าย

Opus 5.5 เป็นโมเดลใหม่ ไม่ใช่ Opus 5 ที่ถูกเปลี่ยนชื่อ และบันทึกการ Migration ของ Anthropic ระบุการเปลี่ยนแปลงสี่อย่างที่จะทำให้โค้ดที่รันอยู่ในโปรดักชันแล้วพัง:

• ไม่สามารถปิด Thinking ได้ เส้นทางโค้ดใด ๆ ที่เคยปิด Thinking จะเกิดข้อผิดพลาดหรือเปลี่ยนพฤติกรรม และตอนนี้ความลึกถูกควบคุมผ่านพารามิเตอร์ effort เท่านั้น

• การบังคับใช้เครื่องมือจะส่งคืนข้อผิดพลาด tool_choice ที่บังคับให้ใช้เครื่องมือที่ระบุชื่อนั้นไม่ได้รับการรองรับ

• บล็อก Thinking ถูกผูกติดกับโมเดลที่สร้างบล็อกเหล่านั้นและกับบทสนทนา ดังนั้นจึงไม่สามารถนำมาเล่นซ้ำข้ามโมเดลได้ในแบบที่ไปป์ไลน์บางระบบสันนิษฐานไว้

• ก่อนหน้านี้ computer_20251124 เครื่องมือสำหรับการใช้งานคอมพิวเตอร์ไม่ได้รับการยอมรับบน Claude API หรือบน Google Cloud

มีการเปลี่ยนแปลงอย่างที่ห้า ซึ่งไม่ทำให้อะไรล้มเหลวเลย และด้วยเหตุนี้จึงอันตรายกว่า ข้อความระหว่างการเรียกเครื่องมือขณะนี้ถูกส่งกลับมาภายในบล็อกความคิดซึ่งมีข้อความว่างเปล่าที่ค่าการแสดงผลเริ่มต้น หากแอปพลิเคชันของคุณสตรีมข้อความนั้นให้ผู้ใช้เป็นอัปเดตความคืบหน้า มันจะเงียบไประหว่างการเรียกเครื่องมือจนกว่าคุณจะตั้งค่าการแสดงผลที่ส่งข้อความนั้นกลับมา ทุกการทดสอบผ่าน อินเทอร์เฟซก็เพียงหยุดเล่าเรื่อง

สามข้อแรกยังใช้กับ Claude Fable 5.1 ด้วย ดังนั้นทีมที่ย้ายไปใช้โมเดลนั้นแล้วก็ได้ทำงานส่วนนี้ไปแล้วบางส่วน ส่วนทีมที่ยังใช้ Opus 5 อยู่ยังไม่ได้ทำ

เมื่อ Opus 5 ยังคงเป็นตัวเลือกที่ใช่

การอัปเกรดไม่ได้เกิดขึ้นโดยอัตโนมัติ และมีเหตุผลจริงสี่ประการที่ควรอยู่ต่อ:

• ความสามารถในการคาดการณ์ต้นทุน Opus 5 เป็นโมเดลที่คุณจำแนกลักษณะไว้แล้ว หากงบประมาณของคุณถูกสร้างแบบจำลองจากการใช้โทเคนของมัน การเปลี่ยนไปใช้โมเดลที่คิดมากน้อยต่างออกไปในระดับความพยายามที่เรียกชื่อเดียวกัน จะทำให้แบบจำลองนั้นใช้ไม่ได้จนกว่าคุณจะวัดใหม่

• ความเข้ากันได้ หากส่วนใดส่วนหนึ่งของสแต็กของคุณต้องพึ่งพาการปิดการคิด การบังคับใช้เครื่องมือ หรือเครื่องมือใช้คอมพิวเตอร์รุ่นเก่า การย้ายระบบครั้งนี้คืองานเขียนโค้ด ไม่ใช่แค่การสลับสตริง

• การกำหนดเส้นทางเพื่อความปลอดภัย Opus 5.5 มาพร้อมมาตรการป้องกันระดับ Fable 5.1 ซึ่งหมายความว่าคำขอด้านความปลอดภัยไซเบอร์ส่วนใหญ่จะถูกส่งต่อไปยัง Claude Opus 4.8 และงานด้านชีววิทยาจะถอยกลับไปใช้ Claude Opus 5 เว้นแต่บัญชีของคุณจะได้รับการยืนยัน หากผลิตภัณฑ์ของคุณอยู่ในโดเมนใดโดเมนหนึ่งจากสองโดเมนนี้ "การอัปเกรด" อาจหมายความว่าผู้ใช้ของคุณได้รับคำตอบจากโมเดลที่เล็กกว่า Opus 5 ไม่มีการกำหนดเส้นทางดังกล่าว

• อายุการใช้งานที่ยาวนาน Opus 5 ยังไม่ไปไหนในเร็ว ๆ นี้ — Anthropic ระบุว่าการเลิกให้บริการจะไม่เร็วกว่าวันที่ 24 กรกฎาคม 2027 ซึ่งห่างออกไปสิบเดือน

สำหรับคนอื่นๆ แล้ว การคำนวณนั้นตรงไปตรงมา: ความสามารถมากขึ้น ราคาถูกลง โทเค็นน้อยลง และเช็กลิสต์การโยกย้ายที่วิศวกรคนเดียวสามารถทำเสร็จได้ภายในหนึ่งวัน

running both during the switch

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'by Anthropic - 2026-07-24', and the model description.

ส่วนที่น่าอึดอัดของการย้ายโมเดลเรือธงคือช่วงกลาง: คุณอยากให้ Opus 5.5 รับทราฟฟิกใหม่ โดยไม่เดิมพันเส้นทางโปรดักชันกับโมเดลที่คุณยังไม่ได้ทำความเข้าใจลักษณะเฉพาะภายใต้การตั้งค่า effort ของคุณเอง และคุณอยากให้ Opus 5 ให้บริการต่อไประหว่างที่คุณหาคำตอบ นี่เป็นปัญหาด้าน routing มากกว่าการย้ายแพลตฟอร์ม และคุ้มค่าที่จะพูดให้ชัดว่าอะไรอยู่ตรงไหน Claude Opus 5 อยู่บน OrcaRouter แล้ววันนี้ ในราคาตามที่ Anthropic ตั้งไว้เองโดยบวกเพิ่ม 0% — ราคาตามที่ผู้ให้บริการตั้งไว้ถูกส่งผ่านมาตรง ๆ ดังนั้นหากผู้ให้บริการเปลี่ยนราคา ฝั่งเราก็อัปเดตทันทีในวันเดียวกัน ไม่ต้องรอการซิงก์ Claude Opus 5.5 ยังไม่ใช่หนึ่งในเส้นทางของเรา แต่มันใช้ได้ผ่าน API ของ Anthropic เองและคลาวด์รายใหญ่ เมื่อมันมาถึง มันจะกลายเป็นอีกหนึ่งเส้นทางบนคีย์เดียวกัน แทนที่จะเป็นสัญญาฉบับที่สองกับ SDK ตัวที่สอง ซึ่งเป็นสิ่งที่ทำให้คุณสามารถส่งทราฟฟิกเป็นเปอร์เซ็นต์ไปยังโมเดลใหม่ได้ ขณะที่การ failover อัตโนมัติ ทำให้ส่วนที่เหลืออยู่บนโมเดลที่คุณทำความเข้าใจลักษณะเฉพาะไว้แล้ว การประกอบการเรียกข้ามทั้งสอง — ร่างจากตัวหนึ่งและรอบตรวจสอบจากอีกตัว — เป็นเพียงบรรทัดหนึ่งใน routing DSL

จงพูดให้ชัดเจนว่าสิ่งนั้นให้อะไรกับคุณ มันไม่ได้ให้ผลวัดมาตรฐานที่เป็นอิสระของ Opus 5.5 แก่คุณ ยังไม่มีสิ่งใดทำได้ เพราะการเปรียบเทียบแบบตัวต่อตัวที่เผยแพร่แล้วมีเพียงของ Anthropic เอง และผู้ติดตามอิสระยังคงหาข้อสรุปเรื่องการตั้งค่าความพยายาม สิ่งที่มันให้คุณคือการวัดเพียงหนึ่งเดียวที่ทำนายค่าใช้จ่ายของคุณได้จริง บนพรอมป์ของคุณ ที่ระดับความพยายามซึ่งคุณจะนำไปใช้งาน

กฎการตัดสินใจ

หากคุณกำลังเริ่มต้นสิ่งใหม่ ให้ใช้ Claude Opus 5.5 และเริ่มที่ระดับความพยายามปานกลาง แล้ววัดว่า ต่ำยังใช้ได้ดีกับงานของคุณหรือไม่ — Anthropic รายงานว่าการตั้งค่าระดับต่ำให้ผลใกล้เคียงกับการตั้งค่าที่สูงกว่าในการประเมินการเขียนโค้ดหลายรายการด้วยต้นทุนที่ต่ำกว่ามาก และตัวเลข FrontierCode ข้างต้นบ่งชี้ว่าค่าเริ่มต้นไม่ได้ทำให้พลาดอะไรไปมากนัก

หากคุณกำลังรัน Claude Opus 5 ในสภาพแวดล้อมโปรดักชัน สิ่งที่กระตุ้นให้คุณย้ายระบบไม่ใช่ตารางเบนช์มาร์ก แต่มันคือว่าคุณสามารถรองรับการเปลี่ยนแปลง API สี่รายการได้หรือไม่ และภาระงานของคุณอยู่ในด้านความมั่นคงปลอดภัยไซเบอร์หรือชีววิทยาหรือไม่ ซึ่งการจัดเส้นทางของระบบป้องกันจะเงียบ ๆ ส่งทราฟฟิกบางส่วนของคุณไปยังโมเดลที่เล็กกว่า ทุกอย่างอื่นเกี่ยวกับการอัปเกรดครั้งนี้คือการลดราคาที่สวมชุดของการเปิดตัวโมเดล และสิ่งเหล่านั้นก็คุ้มค่าที่จะคว้าไว้

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube