
Claude Opus 5.5 กับ Claude Opus 5: ระดับความพยายามไม่ได้หมายถึงสิ่งเดียวกัน
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
สิ่งแรกที่ต้องรู้ก่อนเปรียบเทียบ Claude Opus 5.5กับClaude Opus 5คือ สองโมเดลนี้ไม่ได้ใช้สเกล effort ร่วมกัน และแทบทุกการเปรียบเทียบแบบตัวต่อตัวที่คุณจะได้อ่านในสัปดาห์นี้ต่างมองข้ามข้อนี้ไป Opus 5 ตั้งค่าเริ่มต้นที่ effort high ส่วน Opus 5.5 ตั้งค่าเริ่มต้นที่ medium และที่ระดับชื่อเดียวกัน มันคิดต่อเทิร์นมากกว่ารุ่นก่อน ดังนั้น "Opus 5.5 ที่ค่าเริ่มต้น เทียบกับ Opus 5 ที่ค่าเริ่มต้น" จึงไม่ใช่การทดลองที่ควบคุมตัวแปรได้ แต่เป็นการเปรียบเทียบระหว่างปริมาณการคิดที่แตกต่างกันสองแบบ ผู้ขายระบุไว้ในคู่มือการย้ายรุ่นของตัวเองเช่นนั้น: ให้ทดสอบหลายระดับ effort และอย่านำการตั้งค่าของ Opus 5 มาใช้ซ้ำ เพราะระดับที่ชื่อเหมือนกันไม่ได้แมปกับงบประมาณการคิดเดียวกัน เมื่อคุณควบคุมตัวแปรนี้ได้แล้ว ช่องว่างระหว่างสองโมเดลจะแคบลงในบางจุด กว้างขึ้นในจุดอื่น และการตัดสินใจอัปเกรดจะขึ้นอยู่กับสิ่งอื่นที่ไม่ใช่ความสามารถดิบ — ต้นทุนต่องานที่ทำเสร็จ และการเปลี่ยนแปลง API สี่อย่างที่จะทำให้โค้ดที่รันบน Opus 5 ในปัจจุบันพังทันที
จริง ๆ แล้วอะไรที่แตกต่างกัน เมื่อเทียบกันทีละสเปก

โมเดลทั้งสองใกล้เคียงกันเมื่อดูจากสเปกมากกว่าที่ตัวเลขเวอร์ชันบ่งชี้:
• ราคา — Claude Opus 5.5 อยู่ที่ $4.00 ต่ออินพุต / $20.00 ต่อเอาต์พุต ต่อล้านโทเค็น เทียบกับ Claude Opus 5 ที่ $5.00 / $25.00
• การอ่านแคช — $0.20 ต่อล้าน เทียบกับ $0.50 ต่อล้าน ลดลง 60% ในรายการค่าใช้จ่ายที่มีสัดส่วนโดดเด่นที่สุดในการรันแบบ Agentic
• การเขียนแคช — $5 ต่อล้านสำหรับหน้าต่าง 5 นาที และ $8 สำหรับหน้าต่าง 1 ชั่วโมงบน 5.5 เทียบกับ $6.25 บน Opus 5
• บริบทและเอาต์พุต — บริบท 1M โทเค็น และเอาต์พุต 128K ทั้งสองรุ่น; ทั้งสองรุ่นให้เอาต์พุตได้ถึง 300K บน Batch API เมื่อใช้ output-300k-2026-03-24 เฮดเดอร์เบต้า
• ระดับความพยายามเริ่มต้น — ปานกลาง บน Opus 5.5 เทียบกับ สูง บน Opus 5
• Thinking — ปรับตัวได้และเปิดอยู่ตลอดในทั้งสองแบบ แต่บน Opus 5.5 ไม่สามารถปิดใช้งานได้เลยอีกต่อไป
• จุดตัดข้อมูลความรู้ — มิถุนายน 2026 กับ พฤษภาคม 2026
• ความหน่วง — Anthropic จัดให้ Opus 5.5 อยู่ในระดับ "ปานกลาง" เมื่อเทียบกับกลุ่มผลิตภัณฑ์ปัจจุบัน และระบุว่าสามารถสร้างเอาต์พุตได้เร็วกว่า Opus 5 มากกว่า 30%
• การปลดระวาง — ไม่เร็วกว่า 22 กันยายน 2027 สำหรับ Opus 5.5 และไม่เร็วกว่า 24 กรกฎาคม 2027 สำหรับ Opus 5
โปรดสังเกตว่าไม่แตกต่างตรงไหน: หน้าต่างบริบท เพดานผลลัพธ์ ส่วนลดแบบแบตช์ และโมเดลการคิดแบบปรับตัวที่เปิดทำงานตลอดเวลา Opus 5.5 ไม่ใช่โมเดลที่บริบทใหญ่ขึ้นหรือให้ผลลัพธ์ยาวขึ้น แต่เป็นโมเดลที่ถูกกว่า เร็วกว่า และประหยัดโทเค็นมากกว่าบนกรอบขอบเขตเดิม
เกณฑ์เปรียบเทียบ และเครื่องหมายดอกจันเรื่องความพยายามที่กำกับอยู่บนทุกตัว

ตัวเลขเหล่านี้มาจากเอกสารเปิดตัวของ Anthropic — เป็นข้อมูลที่ผู้ขายรายงานเอง ทดสอบกับโมเดลของตัวเอง — และการตั้งค่าระดับความพยายาม (effort) สำคัญตรงนี้มากกว่าชื่อโมเดล:
• Terminal-Bench 4.0 — 66.4% เทียบกับ 52.3% โดยรัน Opus 5.5 ที่ระดับความพยายาม xhigh แทนที่จะเป็นค่าเริ่มต้น
• FrontierCode v1.1 (Main) — 54.4% เทียบกับ 48.0% และ 54.6% สำหรับ Opus 5.5 ที่ระดับความพยายามปานกลางซึ่งเป็นค่าเริ่มต้น
• CursorBench 4.0 — 57.8% เทียบกับ 46.6% และ 52.5% ที่ระดับ medium
• GDPval-AA v2.1 — 1846 Elo เทียบกับ 1708
• AutomationBench — 40.0% เทียบกับ 26.9%
• Humanity's Last Exam เมื่อใช้เครื่องมือ — 67.7% เทียบกับ 63.6%
• Terminal-Bench-Science 0.1 — 58.7% เทียบกับ 29.0% ซึ่งเป็นช่องว่างที่กว้างที่สุดในชุดนี้
• OSWorld 2.0 — 81.8% แบบบางส่วน เทียบกับ 74.0%
• การทำแผนภูมิ ด้วยเครื่องมือ — 89.0% เทียบกับ 83.4%
ผลลัพธ์ของ FrontierCode คือสิ่งที่ควรศึกษา Opus 5.5 ทำคะแนนได้ 54.4% ที่ xhigh และ 54.6% ที่ medium — ในเชิงสถิติเป็นตัวเลขเดียวกัน โดยใช้งบประมาณการคิดเพียงเศษเสี้ยว ไม่ว่า Anthropic จะปรับปรุงอะไรมา บนเบนช์มาร์กนั้น การปรับปรุงไม่ได้มาจากการคิดให้หนักขึ้น CursorBench ให้ผลตรงกันข้าม: 57.8% ที่ xhigh เทียบกับ 52.5% ที่ medium ซึ่งเป็นส่วนต่างห้าจุดที่บอกว่าความพยายามยังแลกมาซึ่งความแม่นยำจริงได้ในบางงาน บทเรียนไม่ใช่ "ใช้ medium" หรือ "ใช้ xhigh" แต่คือระดับความพยายามที่เหมาะสมตอนนี้ต้องวัดแยกตามเวิร์กโหลด และนิสัยเดิม ๆ ที่ปล่อย Opus 5 ไว้ที่ค่าเริ่มต้น high ก็ไม่สามารถบอกอะไรคุณเกี่ยวกับโมเดลใหม่ได้อีกต่อไป
Anthropic เสริมข้อควรระวังที่ควรกล่าวซ้ำว่า: ในระดับขีดความสามารถนี้ ช่องว่างของผลการวัดจากเบนช์มาร์กเป็น "แนวทางที่เชื่อถือได้น้อยลงสำหรับความแตกต่างในโลกจริง" และบริษัทกล่าวว่าช่องว่างภายในของตนกับ Claude Fable 5.1 นั้นแคบกว่าที่คะแนนที่เผยแพร่บ่งชี้ นั่นคือผู้ขายที่กำลังบอกคุณว่าอย่าตีความตารางของตัวเองมากเกินไป
ต้นทุนต่องานที่เสร็จสมบูรณ์คือการเปรียบเทียบที่ใช้ตัดสินใจ
ราคาต่อโทเคนเป็นหน่วยที่ไม่ถูกต้องสำหรับเอเจนต์ และการเปรียบเทียบนี้คือจุดที่แสดงให้เห็น ตัวอย่างที่ Anthropic คิดเอง: การวิเคราะห์การควบรวมกิจการที่ใช้ Opus 5.5 63 นาที และมีค่าใช้จ่ายน้อยกว่างานเดียวกันบน Opus 5 ถึง 50% ซึ่งใช้เวลา 93 นาที อัตราค่าบริการอธิบายส่วนหนึ่งของเรื่องนั้น — การลดลง 20% สำหรับอินพุตและเอาต์พุต, 60% สำหรับการอ่านแคช — แต่ไม่ใช่ทั้งหมด ส่วนที่เหลือคือโมเดลใช้โทเคนและเทิร์นน้อยลงเพื่อไปถึงจุดเดียวกัน คำพูดของลูกค้าที่เผยแพร่พร้อมการเปิดตัวชี้ไปในทิศทางเดียวกัน: Box รายงานว่าใช้โทเคนหนึ่งในสาม และคำตอบสั้นลงประมาณ 40% Kiro ใช้โทเคนประมาณครึ่งหนึ่งโดยมีการเรียกใช้ลดลง 40% Factory ใช้โทเคนเอาต์พุตน้อยลง 20–25% GitHub อยู่ในกลุ่มที่ใช้โทเคนและขั้นตอนน้อยที่สุดเท่าที่วัดได้
นั่นคือคำรับรองจากลูกค้าที่ผู้ขายเผยแพร่ ไม่ใช่ผลลัพธ์ที่ผ่านการตรวจสอบ และข้อความรวม ๆ ว่า "ถูกกว่าประมาณ 40% สำหรับงานทั่วไป" ก็เป็นคำอธิบายของ Anthropic เกี่ยวกับค่าเฉลี่ยจากงานต่าง ๆ ที่มันเลือกมาเอง ฉบับที่ซื่อตรงสำหรับการวางแผนของคุณเองคือ สมมติว่าส่วนลดป้ายราคา 20% นั้นเป็นของจริงและนำไปใช้ได้จริง แล้วมองอีก 20% ที่เหลือเป็นสมมติฐานที่คุณทดสอบได้ในบ่ายเดียว ด้วยการรันงานเดียวกันบนทั้งสองโมเดลแล้วนับโทเค็น
หมายเหตุเชิงโครงสร้างข้อหนึ่งว่าทำไมการลดราคาแคชจึงให้ผลมากกว่าที่ตัวเลขดูเหมือนบอก เอเจนต์ที่ส่งพรอมป์ระบบยาว ๆ พร้อมโครงสร้างไฟล์ซ้ำใหม่ทุกเทิร์น จะจ่ายในอัตราการอ่านจากแคชสำหรับอินพุตส่วนใหญ่ของมัน ไม่ใช่อัตราอินพุตใหม่ การลดราคาส่วนนั้นจาก $0.50 เหลือ $0.20 ต่อล้าน เปลี่ยนเศรษฐศาสตร์ของเซสชันที่รันยาวนานมากกว่าที่อัตราแบบพาดหัวข่าวทำเสียอีก — และนี่คือเหตุผลที่เวิร์กโหลดซึ่งแทบจะคุ้มทุนบน Opus 5 สามารถกลายเป็นคุ้มทุนอย่างชัดเจนบน Opus 5.5 ได้โดยไม่ต้องแก้พรอมป์ของคุณเลยแม้แต่นิดเดียว
การเปลี่ยนแปลงแบบ breaking change ทั้งสี่ข้อ ในรูปแบบเช็กลิสต์สำหรับการโยกย้าย
Opus 5.5 เป็นโมเดลใหม่ ไม่ใช่ Opus 5 ที่ถูกเปลี่ยนชื่อ และบันทึกการ Migration ของ Anthropic ระบุการเปลี่ยนแปลงสี่อย่างที่จะทำให้โค้ดที่รันอยู่ในโปรดักชันแล้วพัง:
• ไม่สามารถปิด Thinking ได้ เส้นทางโค้ดใด ๆ ที่เคยปิด Thinking จะเกิดข้อผิดพลาดหรือเปลี่ยนพฤติกรรม และตอนนี้ความลึกถูกควบคุมผ่านพารามิเตอร์ effort เท่านั้น
• การบังคับใช้เครื่องมือจะส่งคืนข้อผิดพลาด tool_choice ที่บังคับให้ใช้เครื่องมือที่ระบุชื่อนั้นไม่ได้รับการรองรับ
• บล็อก Thinking ถูกผูกติดกับโมเดลที่สร้างบล็อกเหล่านั้นและกับบทสนทนา ดังนั้นจึงไม่สามารถนำมาเล่นซ้ำข้ามโมเดลได้ในแบบที่ไปป์ไลน์บางระบบสันนิษฐานไว้
• ก่อนหน้านี้ computer_20251124 เครื่องมือสำหรับการใช้งานคอมพิวเตอร์ไม่ได้รับการยอมรับบน Claude API หรือบน Google Cloud
มีการเปลี่ยนแปลงอย่างที่ห้า ซึ่งไม่ทำให้อะไรล้มเหลวเลย และด้วยเหตุนี้จึงอันตรายกว่า ข้อความระหว่างการเรียกเครื่องมือขณะนี้ถูกส่งกลับมาภายในบล็อกความคิดซึ่งมีข้อความว่างเปล่าที่ค่าการแสดงผลเริ่มต้น หากแอปพลิเคชันของคุณสตรีมข้อความนั้นให้ผู้ใช้เป็นอัปเดตความคืบหน้า มันจะเงียบไประหว่างการเรียกเครื่องมือจนกว่าคุณจะตั้งค่าการแสดงผลที่ส่งข้อความนั้นกลับมา ทุกการทดสอบผ่าน อินเทอร์เฟซก็เพียงหยุดเล่าเรื่อง
สามข้อแรกยังใช้กับ Claude Fable 5.1 ด้วย ดังนั้นทีมที่ย้ายไปใช้โมเดลนั้นแล้วก็ได้ทำงานส่วนนี้ไปแล้วบางส่วน ส่วนทีมที่ยังใช้ Opus 5 อยู่ยังไม่ได้ทำ
เมื่อ Opus 5 ยังคงเป็นตัวเลือกที่ใช่
การอัปเกรดไม่ได้เกิดขึ้นโดยอัตโนมัติ และมีเหตุผลจริงสี่ประการที่ควรอยู่ต่อ:
• ความสามารถในการคาดการณ์ต้นทุน Opus 5 เป็นโมเดลที่คุณจำแนกลักษณะไว้แล้ว หากงบประมาณของคุณถูกสร้างแบบจำลองจากการใช้โทเคนของมัน การเปลี่ยนไปใช้โมเดลที่คิดมากน้อยต่างออกไปในระดับความพยายามที่เรียกชื่อเดียวกัน จะทำให้แบบจำลองนั้นใช้ไม่ได้จนกว่าคุณจะวัดใหม่
• ความเข้ากันได้ หากส่วนใดส่วนหนึ่งของสแต็กของคุณต้องพึ่งพาการปิดการคิด การบังคับใช้เครื่องมือ หรือเครื่องมือใช้คอมพิวเตอร์รุ่นเก่า การย้ายระบบครั้งนี้คืองานเขียนโค้ด ไม่ใช่แค่การสลับสตริง
• การกำหนดเส้นทางเพื่อความปลอดภัย Opus 5.5 มาพร้อมมาตรการป้องกันระดับ Fable 5.1 ซึ่งหมายความว่าคำขอด้านความปลอดภัยไซเบอร์ส่วนใหญ่จะถูกส่งต่อไปยัง Claude Opus 4.8 และงานด้านชีววิทยาจะถอยกลับไปใช้ Claude Opus 5 เว้นแต่บัญชีของคุณจะได้รับการยืนยัน หากผลิตภัณฑ์ของคุณอยู่ในโดเมนใดโดเมนหนึ่งจากสองโดเมนนี้ "การอัปเกรด" อาจหมายความว่าผู้ใช้ของคุณได้รับคำตอบจากโมเดลที่เล็กกว่า Opus 5 ไม่มีการกำหนดเส้นทางดังกล่าว
• อายุการใช้งานที่ยาวนาน Opus 5 ยังไม่ไปไหนในเร็ว ๆ นี้ — Anthropic ระบุว่าการเลิกให้บริการจะไม่เร็วกว่าวันที่ 24 กรกฎาคม 2027 ซึ่งห่างออกไปสิบเดือน
สำหรับคนอื่นๆ แล้ว การคำนวณนั้นตรงไปตรงมา: ความสามารถมากขึ้น ราคาถูกลง โทเค็นน้อยลง และเช็กลิสต์การโยกย้ายที่วิศวกรคนเดียวสามารถทำเสร็จได้ภายในหนึ่งวัน
running both during the switch

ส่วนที่น่าอึดอัดของการย้ายโมเดลเรือธงคือช่วงกลาง: คุณอยากให้ Opus 5.5 รับทราฟฟิกใหม่ โดยไม่เดิมพันเส้นทางโปรดักชันกับโมเดลที่คุณยังไม่ได้ทำความเข้าใจลักษณะเฉพาะภายใต้การตั้งค่า effort ของคุณเอง และคุณอยากให้ Opus 5 ให้บริการต่อไประหว่างที่คุณหาคำตอบ นี่เป็นปัญหาด้าน routing มากกว่าการย้ายแพลตฟอร์ม และคุ้มค่าที่จะพูดให้ชัดว่าอะไรอยู่ตรงไหน Claude Opus 5 อยู่บน OrcaRouter แล้ววันนี้ ในราคาตามที่ Anthropic ตั้งไว้เองโดยบวกเพิ่ม 0% — ราคาตามที่ผู้ให้บริการตั้งไว้ถูกส่งผ่านมาตรง ๆ ดังนั้นหากผู้ให้บริการเปลี่ยนราคา ฝั่งเราก็อัปเดตทันทีในวันเดียวกัน ไม่ต้องรอการซิงก์ Claude Opus 5.5 ยังไม่ใช่หนึ่งในเส้นทางของเรา แต่มันใช้ได้ผ่าน API ของ Anthropic เองและคลาวด์รายใหญ่ เมื่อมันมาถึง มันจะกลายเป็นอีกหนึ่งเส้นทางบนคีย์เดียวกัน แทนที่จะเป็นสัญญาฉบับที่สองกับ SDK ตัวที่สอง ซึ่งเป็นสิ่งที่ทำให้คุณสามารถส่งทราฟฟิกเป็นเปอร์เซ็นต์ไปยังโมเดลใหม่ได้ ขณะที่การ failover อัตโนมัติ ทำให้ส่วนที่เหลืออยู่บนโมเดลที่คุณทำความเข้าใจลักษณะเฉพาะไว้แล้ว การประกอบการเรียกข้ามทั้งสอง — ร่างจากตัวหนึ่งและรอบตรวจสอบจากอีกตัว — เป็นเพียงบรรทัดหนึ่งใน routing DSL
จงพูดให้ชัดเจนว่าสิ่งนั้นให้อะไรกับคุณ มันไม่ได้ให้ผลวัดมาตรฐานที่เป็นอิสระของ Opus 5.5 แก่คุณ ยังไม่มีสิ่งใดทำได้ เพราะการเปรียบเทียบแบบตัวต่อตัวที่เผยแพร่แล้วมีเพียงของ Anthropic เอง และผู้ติดตามอิสระยังคงหาข้อสรุปเรื่องการตั้งค่าความพยายาม สิ่งที่มันให้คุณคือการวัดเพียงหนึ่งเดียวที่ทำนายค่าใช้จ่ายของคุณได้จริง บนพรอมป์ของคุณ ที่ระดับความพยายามซึ่งคุณจะนำไปใช้งาน
กฎการตัดสินใจ
หากคุณกำลังเริ่มต้นสิ่งใหม่ ให้ใช้ Claude Opus 5.5 และเริ่มที่ระดับความพยายามปานกลาง แล้ววัดว่า ต่ำยังใช้ได้ดีกับงานของคุณหรือไม่ — Anthropic รายงานว่าการตั้งค่าระดับต่ำให้ผลใกล้เคียงกับการตั้งค่าที่สูงกว่าในการประเมินการเขียนโค้ดหลายรายการด้วยต้นทุนที่ต่ำกว่ามาก และตัวเลข FrontierCode ข้างต้นบ่งชี้ว่าค่าเริ่มต้นไม่ได้ทำให้พลาดอะไรไปมากนัก
หากคุณกำลังรัน Claude Opus 5 ในสภาพแวดล้อมโปรดักชัน สิ่งที่กระตุ้นให้คุณย้ายระบบไม่ใช่ตารางเบนช์มาร์ก แต่มันคือว่าคุณสามารถรองรับการเปลี่ยนแปลง API สี่รายการได้หรือไม่ และภาระงานของคุณอยู่ในด้านความมั่นคงปลอดภัยไซเบอร์หรือชีววิทยาหรือไม่ ซึ่งการจัดเส้นทางของระบบป้องกันจะเงียบ ๆ ส่งทราฟฟิกบางส่วนของคุณไปยังโมเดลที่เล็กกว่า ทุกอย่างอื่นเกี่ยวกับการอัปเกรดครั้งนี้คือการลดราคาที่สวมชุดของการเปิดตัวโมเดล และสิ่งเหล่านั้นก็คุ้มค่าที่จะคว้าไว้
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
