
Claude Sonnet 5.5 กับ Claude Opus 5.5: เบนช์มาร์กมาบรรจบกัน แต่บิลไม่
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 984 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 195 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
Claude Sonnet 5.5 เปิดให้ใช้งานทั่วไปเมื่อวันที่ 28 กันยายน 2026 ในราคา 2.00 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 10.00 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน Claude Opus 5.5 เรือธงของ Anthropic เปิดตัวก่อนหน้านั้นหกวันเมื่อวันที่ 22 กันยายน ที่ราคา 4.00 และ 20.00 ดอลลาร์ — เป็นสองเท่าพอดีในทั้งสองบรรทัด การอ่านที่ชัดเจนที่สุดคือ Opus 5.5 คือเพดาน และ Sonnet 5.5 คือการประนีประนอมที่คุณต้องทำเมื่องบประมาณเป็นเรื่องจริง ตารางเปิดตัวของ Anthropic เองไม่ได้สนับสนุนการอ่านแบบนั้น จากตัวเลขที่บริษัทเผยแพร่ Claude Sonnet 5.5 ทำได้ 1844 เทียบกับ 1846 ของ Opus 5.5 บน GDPval-AA v2.1, 1811 เทียบกับ 1822 บน AA-Briefcase v1.1 และ 70.6% เทียบกับ 66.4% บน Terminal-Bench 4.0 — มันชนะในเบนช์มาร์กเดียวที่วัดงานที่ทำจริงภายในเทอร์มินัล สองบรรทัดถัดจากตัวเลขเหล่านั้น คำบรรยายของ Anthropic เองระบุว่า Opus 5.5 "ยังคงแข็งแกร่งกว่าอย่างชัดเจนในงานที่ซับซ้อนและเปิดกว้าง" ทั้งสองข้อความเป็นความจริง และการหาว่าจะยึดทั้งสองไว้พร้อมกันได้อย่างไรคือส่วนใหญ่ของสิ่งที่การเปรียบเทียบนี้มีไว้เพื่อ
สิ่งที่ตารางเปิดตัวบอก และสิ่งที่มันเลือกที่จะไม่บอก
รูปแบบที่เห็นในกลุ่มผลการทดสอบมาตรฐานของ Anthropic คือโมเดลที่ปิดช่องว่างไปเกือบหมด มากกว่าจะเป็นโมเดลที่ขึ้นนำ GDPval-AA v2.1 ซึ่งเป็นชุดงานที่ถ่วงน้ำหนักเชิงเศรษฐกิจ เป็นการเสมอกันที่สองจุด AA-Briefcase v1.1 ซึ่งเป็นการประเมินเอกสารและสิ่งส่งมอบ เป็นการเสมอกันที่สิบเอ็ดจุด CursorBench 4.0 ไปในทางตรงกันข้าม: 55.5% สำหรับ Sonnet 5.5 เทียบกับ 57.8% สำหรับ Opus 5.5 OSWorld 2.1 อยู่ที่ 80.1% เทียบกับ 81.8% และ Humanity's Last Exam อยู่ที่ 64.5% เมื่อใช้เครื่องมือ เทียบกับ 67.7% มีเพียง Terminal-Bench 4.0 เท่านั้นที่ทำลายรูปแบบนี้ และทำลายอย่างชัดเจน — 70.6% เทียบกับ 66.4% ซึ่งเป็นความได้เปรียบสี่จุดของ Sonnet ในงานบนคอมมานด์ไลน์แบบเอเจนต์
อ่านป้ายชื่อแถวแทนที่จะดูตัวเลข แล้วจะมีอย่างอื่นปรากฏขึ้น รายการ Opus 5.5 หลายรายการมีคำกำกับระดับความพยายาม — 66.4% ที่ Xhigh — และมีเชิงอรรถระบุว่าการตั้งค่า Max ได้คะแนนต่ำกว่า Xhigh บน FrontierCode ไม่ใช่สูงกว่า ความพยายามที่สูงขึ้นไม่ได้ให้ผลดีขึ้นตามลำดับอย่างสม่ำเสมอ ทีมที่คำนึงถึงงบประมาณซึ่งสมมติว่า "ความพยายามสูงสุด" คือการอัปเกรดฟรี กำลังซื้อโทเค็นเพื่อแลกกับคำตอบที่แย่ลงในอย่างน้อยหนึ่งการทดสอบของ Anthropic เอง และบน FrontierCode 1.1 เชิงอรรถเดียวกันระบุว่า Sonnet 5.5 อยู่ที่ 46.2% ในการตั้งค่า Max เทียบกับ 54.4% ของ Opus 5.5 ซึ่งเป็นตัวเลขเดียวที่ชัดเจนที่สุดว่ายอดเรือธงยังคงทิ้งห่างตรงจุดไหน: งานเขียนโค้ดระยะยาวภายใต้นิยามภารกิจที่ให้รางวัลกับความมุ่งมั่นอดทน
ยังมีข้อแม้อีกข้อหนึ่งที่ควรพูดให้ชัด ๆ มากกว่าจะเก็บงำไว้ Anthropic ระบุว่าการรัน GDPval-AA และ AA-Briefcase ที่ตนเผยแพร่นั้นดำเนินการบนดีพลอยเมนต์ก่อนเปิดตัวซึ่งมีบั๊ก structured outputs อยู่ สิ่งนี้ส่งผลต่อทั้งสองโมเดลในตารางเดียวกัน ดังนั้นการเปรียบเทียบจึงไม่เสียความสมบูรณ์ไป แต่ก็หมายความว่าตัวเลขสัมบูรณ์ควรถูกมองเป็นภาพ ณ ขณะหนึ่ง มากกว่าจะเป็นผลลัพธ์ที่สรุปแน่นอนแล้ว ตารางเบนช์มาร์กของผู้ขายเป็นวัสดุทางการตลาดที่มีภาคผนวกอธิบายระเบียบวิธี และตารางนี้ก็แนบภาคผนวกมาด้วย
จุดที่การวัดอิสระลงเอย
Artificial Analysis ให้คะแนนทั้งสองโมเดลภายใต้ฮาร์เนสเดียวกัน ในคอนฟิกูเรชันเดียวกับที่มันเรียกชื่อว่า “Adaptive Reasoning, Max Effort, Default Fallback” บน Intelligence Index v4.3 Claude Opus 5.5 อยู่ที่ 58 Claude Sonnet 5.5 อยู่ที่ 56 นั่นคือช่องว่างสองจุดบนสเกลที่ผู้ประเมินรายเดียวกันจัดให้ Opus 5 อยู่ที่ 51, Sonnet 5 อยู่ที่ 38, DeepSeek V4 Pro อยู่ที่ 36 และ Gemini 3.1 Pro Preview อยู่ที่ 30 การที่ Sonnet ใหม่เข้ามาต่ำกว่าเรือธงสองจุดและสูงกว่ารุ่น Opus ก่อนหน้าถึงห้าจุดคือข้ออ้างที่มีสาระสำคัญของการเปิดตัวครั้งนี้ และเป็นข้ออ้างจากบุคคลที่สาม ไม่ใช่จากผู้ขาย
จากนั้นหน้าเดียวกันก็พลิกเศรษฐศาสตร์ของเรื่องนี้กลับกัน Artificial Analysis รายงานว่าการรันประเมินของ Sonnet 5.5 มีค่าใช้จ่าย $7.60 ต่องาน เทียบกับ $5.98 สำหรับ Opus 5.5 แม้ว่า Sonnet 5.5 จะมีราคาต่อโทเคนเพียงครึ่งเดียว สาเหตุอยู่ตรงนั้นในหน้านั้นเอง: Sonnet 5.5 สร้างโทเคน 410 ล้านโทเคนทั่วทั้งชุดดัชนี เทียบกับค่ามัธยฐานที่ 88 ล้านสำหรับโมเดลที่มันติดตาม — “ช่างพูดเยิ่นเย้อมาก” ตามคำของผู้ประเมิน Opus 5.5 สร้าง 260 ล้านโทเคนในชุดเดียวกัน ที่ $10 ต่อล้านโทเคนเอาต์พุต เทียบกับ $20 ปัจจัยด้านความเยิ่นเย้อประมาณ 1.6 ยังทำให้ Sonnet 5.5 ต้องจ่ายมากกว่าประมาณ 27% ต่องานที่ทำเสร็จ
นี่คือส่วนของการเปรียบเทียบที่ตารางราคาต่อโทเคนไม่สามารถแสดงให้คุณเห็นได้ และเป็นเหตุผลที่ตัวเลขสองตัวนี้อยู่ร่วมกันได้โดยไม่ขัดแย้งกัน เมื่อคิดต่อโทเคน Sonnet 5.5 ถูกกว่าเป็นครึ่งหนึ่ง เมื่อคิดต่องานที่ทำเสร็จ บนชุดการประเมินที่มีพรอมป์ต์ปลายเปิดและไม่มีวินัยเรื่องความยาวเอาต์พุต มันอาจมีราคาแพงกว่าได้ ข้อใดในสองข้อนี้อธิบายภาระงานของคุณ นั่นคือการตัดสินใจที่แท้จริง
ระดับความพยายาม เพดานเอาต์พุต และลักษณะของการผสานรวม
สำหรับผู้ซื้อ คุณสมบัติที่สำคัญในเชิงกลไกแทบจะเหมือนกันทุกประการระหว่างสองรุ่นนี้
• Context — 1,000,000 โทเคนทั้งสองตัว จากผู้ให้บริการรายเดียวกัน ดังนั้นสมมติฐานด้าน prompt engineering จึงถ่ายโอนมาได้โดยไม่เปลี่ยนแปลง
• เอาต์พุตสูงสุด — 128,000 โทเค็นสำหรับทั้งสอง; การสร้างเนื้อหาจำนวนมากไม่ใช่จุดสร้างความแตกต่างในบริบทนี้
• รูปแบบข้อมูลนำเข้า — ทั้งสองรองรับการป้อนข้อความ รูปภาพ และไฟล์; แต่ไม่รองรับเสียงหรือวิดีโอ
• การควบคุมการให้เหตุผล — การคิดแบบปรับตัวบนทั้งสอง โดยความลึกถูกกำหนดด้วยพารามิเตอร์ effort แทนที่จะเป็นงบประมาณโทเค็นการคิด บน Claude Platform ค่าเริ่มต้นคือ high; ภายในแอป Claude คือ medium
• การเขียนแคช — $5.00 ต่อล้านสำหรับ Claude Opus 5.5 เทียบกับ $2.50 สำหรับ Claude Sonnet 5.5 ซึ่งเป็นบรรทัดเดียวที่โมเดลที่ถูกกว่ายังเป็นโมเดลที่ถูกกว่าในการป้อนด้วย prefix ที่สร้างใหม่
• การอ่านแคช — $0.20 ต่อล้านเท่ากันทั้งสองฝ่าย เสมอกันพอดีในบรรทัดที่เป็นตัวกำหนดค่าใช้จ่ายหลักของการรันเอเจนต์แบบยาว
เนื่องจาก surface ตรงกัน การย้ายระหว่างทั้งสองจึงเป็นเพียงการเปลี่ยนสตริงชื่อโมเดลและการวัดปริมาณงานใหม่ ไม่ใช่โปรเจกต์การผสานรวม นั่นเป็นเรื่องที่พบได้ยากเมื่อเทียบข้ามผู้ให้บริการ และเป็นเหตุผลที่การจับคู่นี้คุ้มค่าที่จะนำมาเปรียบเทียบกันตั้งแต่แรก: สองตัวเลือกนี้ต่างกันที่ราคาและความลึก ไม่ใช่ที่ API ที่คุณต้องเขียน
ความแตกต่างด้านการดำเนินงานประการหนึ่งสมควรได้รับการอธิบายเป็นบรรทัดของตัวเอง Anthropic ระบุว่า Claude Sonnet 5.5 เป็น Sonnet รุ่นแรกที่เปิดตัวโดยมีมาตรการป้องกันและกลไกสำรองด้านไซเบอร์อยู่ในระดับเดียวกับโมเดลระดับสูงสุดของบริษัท ซึ่งหมายความว่าคำขอด้านความมั่นคงปลอดภัยไซเบอร์ที่มีความเสี่ยงสูงจะถูกส่งต่อไปยัง Sonnet รุ่นก่อนหน้าอย่างเห็นได้ชัด แทนที่จะได้รับการตอบจากโมเดลที่คุณระบุชื่อไว้ หากภาระงานของคุณเกี่ยวข้องกับขอบเขตนั้น สตริงชื่อโมเดลก็ไม่ใช่หลักประกันว่าโมเดลใดเป็นผู้ตอบ — ไม่ว่าจะเป็นระดับใดก็ตาม Anthropic ยังระบุด้วยว่า หากคุณรัน Sonnet โดยปิดการคิด (thinking) คุณต้องเปลี่ยนไปใช้พฤติกรรมระหว่างเครื่องมือ (between-tools behaviour) ซึ่งเป็นการแก้ไขโค้ด ไม่ใช่เพียงการตั้งค่าธงกำหนดค่า ทั้งสองข้อนี้ไม่ใช่เหตุผลให้หลีกเลี่ยงโมเดล แต่ทั้งคู่เป็นเหตุผลให้คุณรู้ไว้ก่อนที่จะปล่อยงานออกไป
บน OrcaRouter Claude Opus 5.5 สามารถ route ได้แล้ววันนี้ด้วย credential ชุดเดียวกับโมเดลอื่นทุกตัวในแคตตาล็อก, ในราคาตามที่ผู้ให้บริการประกาศ โดยบวกกำไร 0%, พร้อมระบบ failover อัตโนมัติที่รองรับอยู่ด้านล่าง ส่วน Claude Sonnet 5.5 ยังไม่ใช่ route บนแพลตฟอร์มของเรา — โมเดลเพิ่งเปิดตัวได้เพียงวันเดียว และจนกว่าจะถูกเพิ่มเข้าไป คำกล่าวที่ตรงไปตรงมาคือคุณจะเข้าถึงมันได้ผ่าน API ของ Anthropic เอง ใครก็ตามที่กำลังรัน Opus 5.5 ผ่านเราอยู่จะสามารถประเมินราคาของการสลับได้ในวันที่มันมาถึง โดยไม่ต้องเปลี่ยนแปลงสิ่งอื่นใดใน integration ของตน
อันไหนใส่ตรงไหน
การแบ่งการใช้งานที่ตามมาจากตัวเลข: Claude Sonnet 5.5 สำหรับงานเอเจนต์ที่ผูกกับเทอร์มินัล ซึ่งเป็นตัวที่แข็งแกร่งกว่าในสองตัวนี้จากตัวเลข Terminal-Bench 4.0 ของ Anthropic เอง และมีราคาถูกกว่าครึ่ง; Claude Sonnet 5.5 สำหรับงานที่เน้นปริมาณงาน (throughput) ใดก็ตาม เนื่องจากความต่างของราคาจะแคบลงก็ต่อเมื่องานนั้นบังคับให้ต้องสร้างเอาต์พุตยาว ๆ; Claude Opus 5.5 สำหรับงานระดับ FrontierCode การรีแฟกเตอร์ระยะยาวในโค้ดเบสขนาดใหญ่ และปริมาณงานใดก็ตามที่ส่วนต่าง 54.4% ถึง 46.2% สะท้อนรูปร่างของปัญหาจริงของคุณมากกว่าจะสะท้อนแถวในลีดเดอร์บอร์ด
ถ้างานของคุณเป็นแบบปลายเปิดและคุณไม่อาจคาดการณ์ความยาวของผลลัพธ์ได้ ให้ถือว่าราคาต่อโทเคนเป็นตัวเลขที่ผิดไปทั้งหมด วัดจำนวนโทเคนต่องานที่ทำเสร็จจากทราฟฟิกของคุณเองเป็นเวลาหนึ่งสัปดาห์ก่อนที่คุณจะตัดสินใจไปทางใดทางหนึ่ง ตัวเลขจาก artificial-analysis ที่ $7.60 เทียบกับ $5.98 เป็นสัญญาณเตือนว่าโมเดลราคาถูกอาจแพ้ในตัวชี้วัดที่คุณจ่ายจริง
คำตัดสินอย่างตรงไปตรงมาคือ นี่ไม่ใช่การแลกระหว่างความสามารถกับต้นทุนอีกต่อไป แต่เป็นคำถามว่างานของคุณมีขอบเขตจำกัดหรือไม่ สำหรับงานที่มีขอบเขตจำกัด ปริมาณมาก และขับเคลื่อนด้วยเครื่องมือ โมเดลที่ถูกกว่าก็เป็นตัวเลือกที่ดีกว่าเช่นกันจากหลักฐานที่มีอยู่ และรุ่นเรือธงก็ไม่คุ้มค่ากับราคาที่แพงเป็นสองเท่า สำหรับงานปลายเปิดที่ต้องใช้เวลายาวนาน ประโยคของ Anthropic เอง — ที่ว่า Opus 5.5 ยังคงแข็งแกร่งกว่าอย่างชัดเจน — คือสิ่งที่ควรเชื่อ และไม่ว่าผลทดสอบมาตรฐานจะลู่เข้าหากันมากแค่ไหน ก็ยังไม่เปลี่ยนข้อนี้ในตอนนี้



