
Claude Sonnet 5.5 กับ Claude Opus 5: ถูกกว่าทุกไลน์ และนำหน้าในดัชนี
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 984 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 195 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
Claude Opus 5 เปิดตัวเมื่อวันที่ 24 กรกฎาคม 2026 ในราคา $5.00 ต่อโทเค็นอินพุต 1 ล้านโทเค็น และ $25.00 ต่อโทเค็นเอาต์พุต 1 ล้านโทเค็น Claude Sonnet 5.5 เปิดให้ใช้งานทั่วไปเมื่อวันที่ 28 กันยายน 2026 ในราคา $2.00 และ $10.00 นั่นคือการลดลง 60% สำหรับอินพุตและ 60% สำหรับเอาต์พุตสำหรับโมเดลที่ใหม่กว่าสองรุ่น และบนชุดทดสอบที่ Artificial Analysis ใช้กับทั้งสอง โมเดลที่ได้ 56 คะแนนบน Intelligence Index v4.3 เทียบกับ 51 ของ Claude Opus 5 นี่คือการเปรียบเทียบที่หาได้ยากซึ่งโมเดลที่ใหม่กว่าและถูกกว่ายังเป็นโมเดลที่ได้คะแนนสูงกว่าบนดัชนีของบุคคลที่สาม และกรณีที่เหลืออยู่สำหรับโมเดลเดิมไม่ใช่ลำดับบนเบนช์มาร์ก แต่เป็นงานประเภทเฉพาะ ทั้งสองโมเดลรองรับบริบท 1 ล้านโทเค็น ทั้งคู่ส่งออกได้ถึง 128K โทเค็น ทั้งคู่อ่านข้อความ รูปภาพ และไฟล์ และทั้งคู่กำหนดค่าการให้เหตุผลผ่านพารามิเตอร์ effort แทนที่จะเป็นงบโทเค็นการคิด เนื่องจากพื้นผิวเหมือนกัน การเลือกใช้ระหว่างสองโมเดลจึงเป็นเพียงคำถามว่างานที่เสร็จสมบูรณ์มีค่าใช้จ่ายเท่าใด และงานใดล้มเหลว
สองเวอร์ชัน หนึ่งอินเทอร์เฟซ
เริ่มจากจุดที่เปลี่ยนแปลงเพียงเล็กน้อยก่อน เพราะมันยังมากกว่าที่เห็นในการก้าวกระโดดข้ามรุ่นส่วนใหญ่
• หน้าต่างบริบท — 1,000,000 โทเค็นบนทั้งคู่
• เอาต์พุตสูงสุด — 128,000 โทเค็นบนทั้งสอง
• รูปแบบการป้อนข้อมูล — ข้อความ รูปภาพ และไฟล์มีบนทั้งสอง; ไม่มีเสียง ไม่มีวิดีโอในทั้งคู่
• การให้เหตุผล — การคิดแบบปรับเปลี่ยนได้พร้อมความพยายามที่กำหนดค่าได้บนทั้งสอง ดังนั้นความลึกจึงเป็นพารามิเตอร์ของคำขอแทนที่จะเป็นสตริงโมเดลแยกต่างหาก
• ความสามารถ — วิชัน, เครื่องมือ, JSON และการให้เหตุผลบนทั้งสอง ตามรายการแค็ตตาล็อกของ OrcaRouter สำหรับ anthropic/claude-opus-5 และตระกูล Sonnet
ผลลัพธ์ในทางปฏิบัติก็คือ พรอมป์ที่เขียนสำหรับ Claude Opus 5 ไม่จำเป็นต้องเขียนใหม่เพื่อรันบน Claude Sonnet 5.5 และลูปเอเจนต์ที่ปรับจูนโดยอิงเพดานเอาต์พุต 128K ก็ไม่จำเป็นต้องมีระดับใหม่ การย้ายระบบเป็นเพียงการสลับสตริงชื่อโมเดล บวกกับการตรวจสอบอีกครั้งว่าคุณปักหมุดการตั้งค่า effort ใดไว้ — เท่านั้นเอง สำหรับทีมที่ผ่านการเปลี่ยนผ่านแบบหลายโมดัลและหลายพารามิเตอร์ในสองปีที่ผ่านมา นั่นคือพาดหัวข่าว ไม่ใช่เบนช์มาร์ก
สิ่งเดียวที่เปลี่ยนแปลงจริง ๆ ก็คือราคา และมันเปลี่ยนในทุกบรรทัด ไม่ใช่แค่สองบรรทัดบนสไลด์การตลาด
• อินพุต — 2.00 ดอลลาร์ต่อล้าน เทียบกับ 5.00 ดอลลาร์ ลดลง 60%
• เอาต์พุต — $10.00 ต่อล้าน เทียบกับ $25.00 ลดลง 60%
• การอ่านแคช — $0.20 ต่อล้าน เทียบกับ $0.50 ลดลง 60%
• การเขียนแคช — $2.50 ต่อล้าน เทียบกับ $10.00 สำหรับหน้าต่างห้านาที ลดลง 75%
หากคุณรันเอเจนต์ที่อ่านคำนำหน้ายาว ๆ ซ้ำใหม่ทุกเทิร์น บรรทัดการอ่านแคชคือส่วนที่ทำให้การย้ายระบบคุ้มค่า ที่ราคา $0.20 เทียบกับ $0.50 โทเคนที่แคชไว้ทุกตัวในเซสชันยาวจะอยู่ที่ 40% ของค่าใช้จ่ายเดิม และการอ่านแคชเป็นสัดส่วนหลักของจำนวนโทเคนในลูปแบบเอเจนต์ส่วนใหญ่ การประหยัดนี้ทบต้นในแบบที่ตัวเลขพาดหัวต่อโทเคนไม่ได้สะท้อน
จุดทั้งห้ามาจากไหน
Artificial Analysis ให้คะแนน Claude Sonnet 5.5 ที่ 56 และ Claude Opus 5 ที่ 51 บน Intelligence Index v4.3 โดยทั้งคู่วัดภายใต้การตั้งค่า "Adaptive Reasoning, Max Effort" ห้าคะแนนไม่ใช่ความคลาดเคลื่อนจากการปัดเศษในมาตรานั้น — เพื่อให้เห็นภาพ ผู้ประเมินรายเดียวกันจัด Sonnet 5 ไว้ที่ 38 และ Gemini 3.1 Pro Preview ที่ 30 ดังนั้นช่องว่างระหว่าง Claude Opus 5 กับ Claude Sonnet 5.5 จึงคิดเป็นหนึ่งในสามของช่องว่างระหว่าง Claude Opus 5 กับ Sonnet รุ่นก่อนหน้า
ตัวเลขการเปิดตัวของ Anthropic เองสำหรับ Claude Sonnet 5.5 ชี้ไปในทิศทางเดียวกันด้วยเครื่องมือวัดที่ต่างออกไป บริษัทรายงาน 70.6% บน Terminal-Bench 4.0 — การทดสอบเดียวกันกับที่ Claude Opus 5 มีบันทึกไว้ที่ 89.1% ในตารางของ Anthropic ฉบับก่อนหน้า ซึ่งเป็นตัวเลขที่ใช้ฮาร์เนสเวอร์ชันแก้ไขที่ต่างกัน และไม่ควรนำไปลบออกจากตัวเลขที่ใหม่กว่า นั่นคือข้อควรระวังด้านแหล่งที่มาที่สำคัญที่สุดในบทความนี้: Terminal-Bench เปลี่ยนเป็น 4.0 กลางปี 2026 ดัชนีที่บรรจุมันได้รับการแก้ไขเป็น v4.3 เพื่อให้สอดคล้องกัน และการเปรียบเทียบข้ามเวอร์ชันของเบนช์มาร์กนั้นไม่ใช่การคำนวณทางคณิตศาสตร์ เมื่อตัวเลขใดมีเวอร์ชันกำกับอยู่ ให้ระบุเวอร์ชันนั้นด้วย
สิ่งที่สามารถเปรียบเทียบได้อย่างชัดเจนคือความก้าวหน้าฝั่ง Sonnet ของผู้ขายเอง — 10.3% บน Terminal-Bench 4.0 สำหรับ Sonnet 5 ไปเป็น 70.6% สำหรับ Sonnet 5.5 — และค่าที่อ่านได้จากดัชนีของบุคคลที่สาม ซึ่งตัวเลขทั้งสองมาจากชุดทดสอบเดียวกันในวันเดียวกัน จากหลักฐานนั้น รุ่นสืบทอดได้แซงหน้าเรือธงเดือนกรกฎาคมอย่างแท้จริงในด้านการให้เหตุผลทั่วไป ซึ่งเป็นข้อกล่าวอ้างที่หนักแน่นกว่าที่สไลด์ของผู้ขายรายใดทำไว้
กับดักความยาวของผลลัพธ์
นี่คือจุดที่การคำนวณเริ่มไม่เข้าข้างโมเดลที่ใหม่กว่า
Artificial Analysis รายงานว่าการประเมิน Claude Sonnet 5.5 บนชุดดัชนีของบริษัทมีค่าใช้จ่าย $7.60 ต่องาน Claude Opus 5 มีค่าใช้จ่าย $5.86 ต่องานบนชุดเดียวกัน โมเดลใหม่กว่า ซึ่งมีส่วนลด 60% จากทุกรายการในตารางราคา กลับมีค่าใช้จ่ายแพงกว่าประมาณ 30% ในการทำงานหนึ่งงานให้เสร็จ เหตุผลอยู่ในรายงานเดียวกัน: Sonnet 5.5 ปล่อยโทเค็น 410 ล้านโทเค็นทั่วทั้งชุด เทียบกับค่ามัธยฐาน 88 ล้านโทเค็นในบรรดาโมเดลที่ติดตาม ซึ่งผู้ประเมินระบุว่า "ใช้คำฟุ่มเฟือยมาก" Claude Opus 5 ปล่อย 140 ล้านโทเค็นบนชุดเดียวกัน
พอแยกคำนวณออกมา กลไกก็ง่ายมาก Sonnet 5.5 ให้โทเคนเอาต์พุตประมาณสามเท่าของ Claude Opus 5 เมื่อทำงานเดียวกัน ในราคา 40% ของราคาเอาต์พุต สามคูณ 0.4 เท่ากับ 1.2 — เป็นการเสียเปรียบ 20% ก่อนผลของแคช ซึ่งใกล้เคียงกับผลลัพธ์ 7.60 ดอลลาร์เทียบกับ 5.86 ดอลลาร์ ราคาต่อโทเคนไม่ได้ผิด แค่มันไม่ใช่ตัวเลขที่กำหนดใบแจ้งหนี้
สิ่งนี้ไม่ได้ทำให้โมเดลใหม่กว่าเป็นตัวเลือกที่แย่กว่า แต่มันทำให้การตัดสินใจขึ้นอยู่กับบางสิ่งที่การเปรียบเทียบส่วนใหญ่ละเลย: ว่าภาระงานของคุณเปิดทางให้คุณจำกัดขอบเขตเอาต์พุตได้หรือไม่ งานสรุปที่มีคำสั่งกำหนดความยาว, ไปป์ไลน์สกัดข้อมูลแบบมีโครงสร้างที่สร้าง JSON, ตัวจำแนกประเภทที่คืนค่าป้ายกำกับ — ในทุกกรณีเหล่านั้น ความยืดยาวไม่เกิดขึ้น และส่วนลด 60% จากเรตการ์ดคือเงินจริง เอเจนต์แบบปลายเปิดที่ถูกสั่งให้ "fix the repo" โดยไม่มีวินัยด้านเอาต์พุต ย่อมมอบเชือกให้ Sonnet 5.5 ถึงสามเท่า
การตั้งค่าความพยายามและการโยกย้ายที่ไม่มีใครตั้งงบไว้
ทั้งสองโมเดลให้ควบคุมความพยายามในการให้เหตุผลผ่านพารามิเตอร์ effort ที่มีหลายระดับ และทั้งคู่มีค่าเริ่มต้นแทนที่จะต้องตั้งค่า — สูงบน Claude Platform, ปานกลางภายในแอป Claude สิ่งล่อใจเมื่อทำการย้ายคือการปล่อยการตั้งค่าไว้ที่เดิมบนโมเดลเก่าแล้วถือว่างานเสร็จ
นั่นเป็นความผิดพลาดด้วยเหตุผลที่วัดผลได้ เชิงอรรถของ Anthropic เองสำหรับ Claude Sonnet 5.5 ระบุว่าคอนฟิกูเรชันระดับความพยายาม Max ได้คะแนนต่ำกว่า Xhigh บน FrontierCode ซึ่งหมายความว่าระดับความพยายามไม่ใช่มาตรวัดแบบโมโนโทนิก และการตั้งค่าสูงสุดไม่ใช่การอัปเกรดฟรี จงกำหนดระดับความพยายามโดยการวัดงานของคุณ ไม่ใช่โดยเลือกตัวเลือกที่แพงที่สุดที่มี
ยังมีความแตกต่างเชิงพฤติกรรมที่ชัดเจนในฝั่ง Sonnet ที่ควรรู้ก่อนการเปิดใช้งานจริง Anthropic ระบุว่า Claude Sonnet 5.5 เป็น Sonnet รุ่นแรกที่มาพร้อมมาตรการป้องกันและกลไกสำรองด้านไซเบอร์ที่เทียบเท่ากับโมเดลระดับสูงสุดของตน ดังนั้นคำขอด้านความปลอดภัยที่มีความเสี่ยงสูงจะถูกเปลี่ยนเส้นทางกลับไปยัง Sonnet รุ่นก่อนหน้าอย่างเห็นได้ชัด แทนที่จะได้รับการให้บริการจากโมเดลที่คุณระบุ หากภาระงานของคุณอยู่ในขอบเขตนั้น บันทึกของคุณจะแสดงโมเดลที่คุณไม่ได้ร้องขอ Claude Opus 5 เกิดขึ้นก่อนการจัดวางลักษณะนั้นในสาย Sonnet ถึงแม้ว่าการกำหนดเส้นทางประเภทเดียวกันจะมีอยู่ทั่วทั้งผลิตภัณฑ์ของ Anthropic สำหรับงานด้านชีววิทยาและความมั่นคงปลอดภัยไซเบอร์ในระดับเรือธง
บน OrcaRouter ปลายทางทั้งสองพร้อมใช้งานแล้ววันนี้ — anthropic/claude-opus-5 และ anthropic/claude-sonnet-5อยู่ในแคตตาล็อกเดียวกับอย่างอื่น ๆ ทั้งหมด โดยคิดราคาตามราคาตั้งของผู้ให้บริการบวกกำไร 0% — และ Claude Sonnet 5.5 จะเข้าถึงได้ด้วยข้อมูลรับรองชุดเดียวกันทันทีที่ถูกขึ้นทะเบียน ความสามารถที่เกี่ยวข้องในระหว่างนี้คือการสลับไปใช้ตัวสำรองอัตโนมัติ (automatic failover) หากระดับใดระดับหนึ่งของ Anthropic ถูกจำกัดอัตราการเรียกใช้หรือส่งข้อผิดพลาดกลับมา คำขอสามารถถูกชี้ไปยังอีกระดับหนึ่งได้โดยไม่ต้องแก้โค้ด ซึ่งเป็นการป้องกันความเสี่ยงที่คุ้มค่าที่สุดเท่าที่จะเป็นไปได้ต่อการคาดเดาผิดในการเปรียบเทียบนี้
การตัดสินใจ ซึ่งระบุไว้เป็นกฎ
ถ้างานของคุณมีขอบเขตจำกัด — คุณควบคุมรูปแบบผลลัพธ์ พรอมป์มีโครงสร้างชัดเจน และจำนวนโทเคนต่องานคาดเดาได้ — ให้ย้ายไปใช้ Claude Sonnet 5.5 แล้วประหยัดไป 60% ดัชนีเห็นด้วย ตารางราคาเห็นด้วย และไม่มีข้อโต้แย้งเรื่องความสามารถเหลืออยู่ในอีกฝั่งอีกแล้ว
ถ้างานของคุณเป็นแบบปลายเปิดและทำงานแบบเอเจนต์ จงทำการทดลองก่อนที่คุณจะเชื่อตารางราคาใด ๆ วัดจำนวนโทเคนต่องานที่เสร็จสมบูรณ์จากทราฟฟิกของคุณเองเป็นเวลาหนึ่งสัปดาห์ในแต่ละโมเดล ผลลัพธ์จากบุคคลที่สามที่ $7.60 เทียบกับ $5.86 เป็นคำเตือนเฉพาะเจาะจงว่าอัตราค่าบริการที่ถูกกว่าอาจสร้างบิลที่สูงกว่า Claude Opus 5 ยังคงเป็นค่าเริ่มต้นที่ปลอดภัยกว่าสำหรับงานอัตโนมัติระยะยาว จนกว่าคุณจะมีตัวเลขนั้น
คำตัดสินอย่างตรงไปตรงมาคือ นี่เป็นรุ่น Sonnet รุ่นแรกที่ความได้เปรียบของเรือธงขึ้นอยู่กับรูปร่างของงานมากกว่าความสามารถดิบ และใครก็ตามที่ยังตัดสินใจจากชื่อโมเดลเพียงอย่างเดียว ตอนนี้กำลังปล่อยโอกาส 60% ให้หลุดมือไป หรือไม่ก็จ่ายแพงขึ้น 30% ต่อหนึ่งงานที่ทำเสร็จ ขึ้นอยู่กับว่าเขาเดาไปทางไหนเท่านั้น



การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
