
ผลการทดสอบ Claude Opus 5.5: ทุกคะแนน การตั้งค่า Effort ที่เป็นที่มา และใครเป็นผู้วัด
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 177 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1323 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
ตัวเลขพาดหัวของ Claude Opus 5.5 บน Terminal-Bench 4.0 คือ 66.4% ซึ่งพิมพ์เทียบกับ 52.3% ของ Claude Opus 5 บนตารางเดียวกัน — และ 66.4% นั้นได้มาจากระดับความพยายาม xhigh ไม่ใช่ค่าเริ่มต้นของโมเดลที่ medium โมเดลนี้เปิดตัวเมื่อวันที่ 22 กันยายน 2026 สองวันก่อนที่หน้านี้จะถูกเขียนขึ้น ดังนั้นจึงเป็นโมเดล GA ที่มีราคาแบบโมเดล GA และตาราง benchmark แบบโมเดล GA ตัวเลขอิสระบน benchmark เดียวกัน จาก Artificial Analysis อยู่ที่ 59.6% ในคอนฟิกูเรชันที่รวมการกำหนดเส้นทางระบบป้องกันฝั่งเซิร์ฟเวอร์ของ Anthropic ไว้ภายในด้วย ระหว่างตัวเลขสองตัวนั้นมีความแตกต่างด้าน harness ความแตกต่างด้าน effort และความแตกต่างด้าน routing และยังไม่มีใคร — รวมถึงเรา — ที่จะบอกได้ในตอนนี้ว่าช่องว่างแต่ละส่วนเกิดจากปัจจัยใดบ้าง สิ่งที่หน้านี้ทำได้คือรวบรวมทุกตัวเลขที่เผยแพร่แล้วของ Claude Opus 5.5 ไว้ในที่เดียว ระบุว่าใครเป็นผู้ผลิต ระบุการตั้งค่าที่ใช้ผลิตตัวเลขนั้น และรวมแถวที่ GPT-6 Astra และ Claude Fable 5.1 ออกมานำหน้า
เริ่มจากการตั้งค่า effort ก่อน เพราะมันขยับตัวเลขได้มากกว่าตัวโมเดลเสียอีก
ค่าเริ่มต้นของ Claude Opus 5.5 คือระดับ medium สำหรับ effort บน Claude API ส่วน Claude Opus 5 มีค่าเริ่มต้นเป็น high. ระดับที่ชื่อเดียวกันก็ยังไม่ใช่งบประมาณการคิดเดียวกันในสองโมเดล ดังนั้น "เราเรียกใช้ทั้งคู่ที่ high" จึงไม่ใช่การเปรียบเทียบแบบควบคุม แม้ว่าป้ายชื่อจะตรงกันก็ตาม Adaptive thinking เปิดอยู่เสมอและไม่สามารถปิดได้บน Opus 5.5; พารามิเตอร์ effort ปรับเปลี่ยนความลึก ความหน่วง และค่าใช้จ่ายเท่านั้น
ตัวเลข Terminal-Bench 4.0 ของ Anthropic ถูกทดสอบที่ระดับ xhigh ข้อเท็จจริงข้อเดียวนี้ถือเป็นข้อควรระวังที่สำคัญที่สุดในหน้านี้ เพราะเบนช์มาร์กที่มันขึ้นพาดหัวไว้คือตัวที่มีส่วนต่างเหนือโมเดลก่อนหน้ารายงานไว้กว้างที่สุด และเพราะตารางเดียวกันนี้แสดงให้เห็นว่าเกิดอะไรขึ้นเมื่อคุณปล่อยการตั้งค่าไว้ตามเดิม:
• FrontierCode v1.1 Main — 54.4% ที่ xhigh, 54.6% ที่ค่าเริ่มต้น medium ผู้ขายรายงานไว้ ส่วนการรันที่ medium สูงกว่าการรันที่ xhigh ในงานลักษณะนี้ ปุ่มปรับระดับความพยายามไม่ได้ให้อะไรที่วัดผลได้เลย ตัวเลขสองตัวนี้ก็คือตัวเลขเดียวกัน
• CursorBench 4.0 — 57.8% ที่ xhigh, 52.5% ที่ mediumรายงานโดยผู้จำหน่าย โมเดลเดียวกัน ฮาร์เนสเดียวกัน สัปดาห์เดียวกัน: 5.3 คะแนน ซึ่งเป็นส่วนต่างของระดับความพยายาม (effort) ที่มากที่สุดในบรรดาตัวเลขที่มีให้เทียบ
สองแถวที่อยู่ในตารางของผู้ขายรายเดียวกันนี้คือข้อโต้แย้งทั้งหมด งานหนึ่งไม่ไวต่อระดับความพยายาม ส่วนอีกงานหนึ่งไวต่อความพยายามอย่างมาก และบัตรข้อมูลโมเดลไม่สามารถบอกคุณล่วงหน้าได้ว่างานของคุณเป็นแบบไหน ข้อสรุปที่ข้อมูลสนับสนุนนั้นแคบ และควรกล่าวให้แคบเช่นนั้น: ระดับความพยายามที่เหมาะสมในตอนนี้คือการวัดเฉพาะต่องานแต่ละงาน ไม่ใช่ค่าเริ่มต้นที่คุณรับสืบทอดมา มันไม่ได้สนับสนุนข้อกล่าวอ้างที่ว่า "Opus 5.5 เร็วกว่าที่ผลการทดสอบมาตรฐานบ่งชี้" หรือ "Anthropic จงใจสำแดงฝีมือต่ำกว่าความเป็นจริงในค่าเริ่มต้น" — สำหรับข้อนั้นคุณจะต้องมีการกวาดทดสอบรายงานข้ามการตั้งค่าทั้งห้าระดับ และยังไม่มีใครเผยแพร่ผลเหล่านั้น มันหมายความว่า หากคุณย้ายจาก Opus 5 และคงค่าการตั้งค่าความพยายามที่คุณมีอยู่เดิมไว้ คุณได้เปลี่ยนการทดลอง ไม่ใช่แค่เปลี่ยนโมเดล
ความไม่สมมาตรอีกอย่างหนึ่ง และมันก็ตัดไปในทางตรงกันข้าม คอลัมน์คู่แข่งในแถว Terminal-Bench ของ Anthropic คือ GPT-6 Astra ที่ 57.9% — รันที่ ไฮ เอฟฟอร์ต ตามบันทึกในแผนภูมิของ Anthropic เอง ขณะที่ 66.4% ของ Opus 5.5 รันที่ xhigh ตารางของผู้ขายที่รันโมเดลของตัวเองที่การตั้งค่าหนึ่งและคู่แข่งที่การตั้งค่าอื่นไม่ใช่การเทียบแบบตัวต่อตัว ไม่ว่าตัวเลขทั้งสองจะดูเป็นอย่างไรเมื่อวางข้างกัน
ตารางผู้ขาย โดยมีแหล่งที่มาและการตั้งค่าในทุกแถว
ทุกอย่างในส่วนนี้คือ ข้อมูลที่ผู้ขายรายงานเอง: เอกสารเปิดตัวของ Anthropic, harness ของ Anthropic, มาตรการป้องกันในโปรดักชันเปิดใช้งานอยู่, adaptive thinking ที่ระดับความพยายามสูงสุด เว้นแต่แถวนั้นจะระบุไว้เป็นอย่างอื่น อ่านมันในฐานะที่ Anthropic กำลังวัด Anthropic เอง
• Terminal-Bench 4.0 — 66.4% ที่ระดับความพยายาม xhigh เป็นข้อมูลที่ผู้จำหน่ายรายงานเอง ค่าคลาดเคลื่อนมาตรฐานประมาณ ±2.6 จุด ในแถวเดียวกัน: Claude Opus 5 52.3%, Claude Fable 5.1 55.8%, GPT-6 Astra 57.9% (ที่ระดับความพยายาม high), GPT-5.6 Sol 37.3% Terminal-Bench 4.0 เป็นเบนช์มาร์กที่ผู้จำหน่ายยอมรับอย่างชัดเจนว่าเป็นตัวแทนที่ไม่สมบูรณ์แบบสำหรับงานเทอร์มินัลจริง และเป็นตัวเลขพาดหัวของโมเดลนี้
• FrontierCode v1.1 Main — 54.4% ที่ xhigh, 54.6% ที่ค่าเริ่มต้น mediumตามที่ผู้จำหน่ายรายงาน Opus 5 48.0%, Fable 5.1 50.3%, GPT-6 Astra 53.3%, GPT-5.6 Sol 47.5% การ์ดระบบของ Anthropic ยังระบุตัวแปร Extended ที่ 63.6% และตัวเลข Extended ที่ดีที่สุดที่ระดับ medium 65.3%
• CursorBench 4.0 — 57.8% ที่ xhigh, 52.5% ที่ medium ตามที่ผู้จำหน่ายรายงาน Opus 5 46.6%, Fable 5.1 51.8%, GPT-5.6 Sol 41.7% โปรดทราบว่าแถว CursorBench ของ Fable 5.1 และ Opus 5 นั้นวัดที่ระดับความพยายามสูงสุด (max) ดังนั้น Opus 5.5 ที่ระดับ medium จึงถูกนำไปเปรียบเทียบกับรุ่นพี่น้องในตระกูลเดียวกันที่ระดับ max
• GDPval-AA v2.1 — 1,846 Elo. นี่เป็นแถวเดียวในตารางของผู้ขายที่ผู้ขายไม่ได้รันเอง GDPval-AA เป็นการประเมินของ Artificial Analysis และบทความของ Artificial Analysis เองเกี่ยวกับ Opus 5.5 ระบุตัวเลข 1,846 เดียวกัน โดย Fable 5.1 อยู่ที่ 1,735 และ Opus 5 อยู่ที่ 1,708 ในตารางของผู้ขาย: Fable 5.1 1,735, Opus 5 1,708, GPT-5.6 Sol 1,588, GPT-6 Astra 1,542 เป็นแถวเดียวในนี้ที่สององค์กรเห็นตรงกันในตัวเลขเดียวกัน และนั่นเป็นเพราะเป็นการวัดเดียวกัน
• AutomationBench (Zapier) — 40.0%.เป็นข้อมูลที่ผู้ขายรายงาน และรันโดยไม่มีโมเดลสำรองดังนั้นทุกการแทรกแซงด้านการป้องกันจึงถูกให้คะแนนเป็นความล้มเหลว GPT-6 Astra 41.4%, Fable 5.1 31.4%, GPT-5.6 Sol 28.8%, Opus 5 26.9%
• Humanity's Last Exam โดยใช้เครื่องมือ — 67.7%รายงานโดยผู้จำหน่าย Fable 5.1 65.6%, Opus 5 63.6%, GPT-6 Astra 57.2% ส่วน system card ของ Anthropic รายงานแยกต่างหากว่า 64.4% โดยไม่ใช้เครื่องมือ ซึ่งเป็นตัวเลขที่ควรอ้างอิงหากคุณกำลังเปรียบเทียบกับแหล่งที่ไม่ได้ให้โมเดลของตนเข้าถึงเครื่องมือ
• Terminal-Bench-Science 0.1 — 58.7%.ผู้ขายเป็นผู้รายงาน ค่าคลาดเคลื่อนมาตรฐานประมาณ ±3.5 ถึง ±5 จุด ดังนั้นนี่จึงเป็นช่วงมากกว่าจะเป็นค่าเดียว GPT-6 Astra 64.6%, Fable 5.1 52.6%, Opus 5 29.0%, GPT-5.6 Sol 22.4%
• OSWorld 2.0 — 81.8% แบบบางส่วน รายงานโดยผู้ขาย และคำว่า "partial" กำลังทำหน้าที่สำคัญจริง ๆ ในประโยคนั้น: เอกสาร system card ของ Anthropic ระบุอัตราการทำงานสำเร็จแบบเข้มงวดไว้ที่ 48.7% สำหรับโมเดลเดียวกันในการประเมินเดียวกัน ทั้งสองตัวเลขได้รับการเผยแพร่แล้ว ตัวเลขแบบบางส่วนคือตัวที่ถูกนำไปอ้างอิง Fable 5.1 80.7%, Opus 5 74.0%
• Chartography พร้อมเครื่องมือต่าง ๆ — 89.0% ตามที่ผู้ขายรายงาน Fable 5.1 88.4%, Opus 5 83.4%

ตัวเลขอิสระ และ "Default Fallback" หมายถึงอะไรกันแน่
Artificial Analysis เป็นบุคคลที่สามเพียงรายเดียวที่มีการประเมิน Claude Opus 5.5 บนดัชนีแบบผสมที่เผยแพร่แล้วและเป็นปัจจุบัน และตัวเลขของหน่วยงานนี้คือตัวเลขที่ควรนำมาวางเทียบกับของ Anthropic เมื่ออ่าน ณ วันที่ 24 กันยายน 2026:
• Intelligence Index — 58 ที่ความพยายามสูงสุด ในคอนฟิกูเรชันที่ติดป้ายว่า "Adaptive Reasoning, Max Effort, Default Fallback" เป็นการวัดอย่างอิสระโดย Artificial Analysis บทความของตัวเองเรียก 58 ว่า "คะแนนสูงสุดที่เราวัดได้ โดยนำหน้าอยู่หลายจุด" ดัชนีเดียวกันนี้ยังเผยแพร่ Opus 5.5 ที่การตั้งค่าความพยายามอื่น ๆ ทุกค่า และส่วนที่มีประโยชน์คือการกระจายตัว56 ที่ xhigh, 54 ที่ high, 51 ที่ medium, 42 ที่ lowนั่นคือความต่างถึง 16 คะแนนตลอดช่วงการปรับระดับความพยายามบนโมเดลเดียว — มากกว่าช่องว่างระหว่างโมเดลส่วนใหญ่ในตารางนั้น
• Terminal-Bench 4.0 — 59.6% โดยอิสระ Artificial Analysis รายงานว่าอยู่ "ในระดับเดียวกับผู้นำอย่าง GPT-6 Astra (xhigh)" และสูงกว่า Claude Opus 5 อยู่ประมาณ 11 คะแนน
• Humanity's Last Exam — 61.4%เป็นผลการทดสอบที่เป็นอิสระ และสถิติที่ดีที่สุดก่อนหน้าบนบอร์ดเดียวกันอยู่ที่ 59.1% ซึ่งเป็นของ Claude Fable 5.1
• SciCode — 66.9%ผลการประเมินอิสระ เทียบกับ 63.1% ของ Claude Fable 5.1
ตอนนี้มาถึงส่วนที่ต้องอธิบายมากกว่าจะยกมาอ้างเฉย ๆ "Default Fallback" ไม่ใช่สิ่งประดิษฐ์ของการทดสอบมาตรฐานและไม่ใช่การตั้งค่าของ Artificial Analysis — มันคือการกำหนดเส้นทางระบบป้องกันฝั่งเซิร์ฟเวอร์ของ Anthropic ที่ถูกเปิดทิ้งไว้ Claude Opus 5.5 มาพร้อมกับชั้นระบบป้องกันที่ก่อนหน้านี้สงวนไว้สำหรับ Fable 5.1: คำขอด้านความมั่นคงปลอดภัยไซเบอร์ส่วนใหญ่จะถูกส่งต่อไปยัง Claude Opus 4.8 อย่างโปร่งใส และงานด้านชีววิทยาจะถูกส่งกลับไปที่ Claude Opus 5 เว้นแต่บัญชีจะผ่านการยืนยัน เมื่อ Artificial Analysis รันดัชนีโดยเปิดใช้ default fallback สิ่งที่มันกำลังวัดคือระบบที่ใช้งานจริง — สิ่งที่คีย์ API ที่ยังไม่ผ่านการยืนยันเข้าถึงได้จริง — ไม่ใช่เช็กพอยต์ที่สะอาดของน้ำหนัก Opus 5.5 นั่นคือการวัดที่ซื่อตรงกว่าสำหรับผู้ซื้อ และเป็นการวัดที่สะอาดน้อยกว่าสำหรับการทดสอบมาตรฐาน Anthropic พูดไว้เช่นนี้เกี่ยวกับตารางของตัวเอง: การแทรกแซงในการรัน Terminal-Bench 4.0 ทำให้งานไซเบอร์ถูกดำเนินการโดย Opus 4.8 และงานชีววิทยาโดย Opus 5 และบริษัทระบุว่าการแทรกแซงเหล่านั้นน่าจะทำให้ต่ำลง ซึ่งคะแนนที่รายงาน ดังนั้นการกำหนดเส้นทางระบบป้องกันจึงเป็นข้อเท็จจริงเชิงปฏิบัติการจริงในทั้งสองทิศทาง และไม่มีตัวเลขใดบนหน้านี้ที่แยกโมเดลพื้นฐานออกจากมันได้
จุดที่ตารางทั้งสองไม่ตรงกัน และเพราะเหตุใด
ลองวางตัวเลขสองค่าของ Terminal-Bench 4.0 ไว้เคียงกัน แล้วคุณจะได้ 66.4% กับ 59.6% — ห่างกัน 6.8 จุด บน benchmark เดียวกัน สำหรับโมเดลเดียวกัน สาเหตุนั้นเป็นที่ทราบกันดี และแต่ละข้อก็มากพอที่จะส่งผลได้ในตัวเอง:
• ฮาร์เนสที่แตกต่างกัน Anthropic ใช้สแคฟโฟลด์เอเจนต์ของตนเอง ส่วน Artificial Analysis ก็ใช้ฮาร์เนสเอเจนต์อ้างอิงของตนเอง คะแนนเบนช์มาร์กแบบเทอร์มินัลเป็นคุณสมบัติของสแคฟโฟลด์บวกรวมกับโมเดล ไม่ใช่คุณสมบัติของโมเดลเพียงลำพัง และทั้งสององค์กรยังไม่ได้เผยแพร่การทดลองสลับสแคฟโฟลด์
• การตั้งค่าความพยายามที่แตกต่างกัน ค่า 66.4% ของ Anthropic อยู่ที่ระดับ xhigh ส่วนการตั้งค่าความพยายามที่แนบมากับค่า 59.6% ของ Artificial Analysis ไม่ได้ระบุไว้ในประโยคที่แสดงตัวเลขนั้น และตัวเลขเกณฑ์มาตรฐานที่รายงานไว้โดยทั่วไปเป็นค่าที่ตั้งไว้ที่ระดับความพยายามสูงสุด
• เปิดการป้องกันความปลอดภัยไว้ ทั้งในสองกรณี แต่นับคะแนนต่างกัน Anthropic รันโดยเปิดใช้ fallback และถือว่าการเข้าแทรกแซงเป็นการลดคะแนนแต่ยังคงได้คะแนนอยู่ บน AutomationBench ระบบรันโดยไม่เปิดใช้ fallback และนับการเข้าแทรกแซงเป็นความล้มเหลวโดยสิ้นเชิง ส่วน Artificial Analysis รันโดยเปิดใช้ fallback ตลอด
• ตัวเลขเปลี่ยนแปลงได้แม้กระทั่งภายในตารางของผู้ให้บริการรายเดียวกัน Anthropic ระบุว่า Claude Opus 5 ทำได้ 52.3% บน Terminal-Bench 4.0 และชี้ว่าคะแนน 51.8% ของโมเดลเดียวกันบนบอร์ดสาธารณะนั้น "อยู่ในช่วงความคลาดเคลื่อนทั่วไป"
และนี่คือหลักฐานที่หนักแน่นที่สุดในหน้านี้เกี่ยวกับว่าฮาร์เนสหนึ่งตัวมีค่ามากแค่ไหน ลีดเดอร์บอร์ดสาธารณะของ Terminal-Bench 4.0 ที่บันทึกไว้เมื่อวันที่ 24 กันยายน 2026 ไม่มีแถวของ Claude Opus 5.5 อยู่เลยแม้แต่แถวเดียวรายการอันดับหนึ่งคือ GPT-6 Astra ที่โหมด max effort โดยเอเจนต์ Codex ได้58.2% ±2.8 อันดับสองคือ Claude Fable 5.1 ที่โหมด max effort ผ่าน Claude Code ได้57.9% ±3.8 อันดับสามคือ Claude Opus 5 ที่โหมด xhigh ผ่าน Claude Code ได้53.9% ±3.2ดังนั้น 66.4% ไม่ใช่แค่ตัวเลขที่ต่างไปจาก 59.6% ของฝ่ายอิสระเท่านั้น — มันไม่มีอยู่บนบอร์ดสาธารณะเลย และเวอร์ชันของ Claude Opus 5 บนบอร์ดนั้นเองก็อยู่ที่ 53.9% ไม่ใช่ 52.3% ที่ตารางเปิดตัวระบุไว้ จนกว่า Terminal-Bench จะยอมรับและเผยแพร่ผลการส่งของ Opus 5.5 ตัวเลข 66.4% ก็ยังเป็นผลลัพธ์จากฮาร์เนสของผู้ขายที่ไม่มีใครจำลองซ้ำได้ และ 59.6% คือตัวเลขที่บุคคลภายนอกจะกล้ารับรองจริง ๆ อีกทั้งควรสังเกตว่าบนบอร์ดเดียวกันนั้น ผู้นำ Terminal-Bench 4.0 ของ Artificial Analysis กับ Opus 5.5 ของ Anthropic ลงเอยที่ 59.6% เท่ากัน — ซึ่งเป็นการเสมอกันในฮาร์เนสหนึ่งตัว และไม่ได้บอกอะไรเกี่ยวกับอีกตัวเลย

แถวที่ Opus 5.5 แพ้
รายงานสรุปที่ละเว้นความสูญเสียไว้ ไม่นับว่าเป็นรายงานสรุป และตารางของ Anthropic เองก็มีทั้งสองสิ่งนั้นอยู่
• Terminal-Bench-Science 0.1 — 58.7% เทียบกับ 64.6% ของ GPT-6 Astra จากข้อมูลที่ผู้ขายรายงาน บนตารางของ Anthropic และเป็นการแพ้ 5.9 จุดให้กับคู่แข่งที่ระบุชื่อในแถวที่ใกล้เคียงกับการให้เหตุผลเชิงวิทยาศาสตร์มากที่สุด หมายเหตุค่าความคลาดเคลื่อนมาตรฐานของผู้ขายเอง (±3.5 ถึง ±5) หมายความว่าช่องว่างนั้นอยู่ใกล้ขอบของสัญญาณรบกวนมากกว่าที่จะอยู่ภายในอย่างสบาย ๆ — แต่มันคือการแพ้บนหน้าของผู้ขายเอง และช่วงดังกล่าวไม่ได้ทำให้มันกลายเป็นชัยชนะ Claude Opus 5 อยู่ที่ 29.0% ในแถวเดียวกัน ดังนั้นการเพิ่มขึ้นตามรุ่นจึงเป็นของจริงแม้ในจุดที่คู่แข่งนำอยู่
• AutomationBench — 40.0% เทียบกับ 41.4% ของ GPT-6 Astra ตามรายงานของผู้ขาย เป็นการแพ้ 1.4 จุด และการรันครั้งนั้นไม่มีโมเดลสำรอง ดังนั้นการแทรกแซงด้านการป้องกันความปลอดภัยจึงถูกให้คะแนนเป็นความล้มเหลว นั่นหมายความว่าการเปรียบเทียบนี้วัด Opus 5.5 โดยนับรวมค่าปรับการกำหนดเส้นทางของมันไว้ด้วย เทียบกับคู่แข่งที่ค่าปรับการกำหนดเส้นทางของฝ่ายหลัง ไม่ว่าจะเป็นเท่าใด ก็ไม่ได้ถูกอธิบายไว้ เป็นแถวที่ตีความได้น้อยที่สุดในหน้านี้ไม่ว่าจะมองในทิศทางใด
อีกสองแห่งที่ความได้เปรียบแคบกว่าที่พาดหัวข่าวบอกไว้ โดยทั้งคู่เป็นข้อมูลที่ผู้ขายรายงานเอง ใน Humanity's Last Exam พร้อมเครื่องมือ ส่วนต่างเหนือ Claude Fable 5.1 อยู่ที่ 2.1 จุด (67.7% เทียบกับ 65.6%); ใน Chartography พร้อมเครื่องมือ อยู่ที่ 0.6 จุด (89.0% เทียบกับ 88.4%); ใน OSWorld 2.0 บางส่วน อยู่ที่ 1.1 จุด (81.8% เทียบกับ 80.7%) เหล่านั้นคือแถวที่ “Opus 5.5 เป็นโมเดลแบบเอเจนต์ที่ดีที่สุด” เป็นข้อกล่าวอ้างเกี่ยวกับอันดับ มากกว่าเกี่ยวกับช่องว่างที่วัดได้ และความต่าง 0.6 จุดในการอ่านแผนภูมิไม่ควรใช้ตัดสินการจัดซื้อจัดหา
สถานะอิสระของ Claude Fable 5.1 บนดัชนีเวอร์ชันปรับปรุงที่แตกต่างออกไป
การนำ Opus 5.5 มาเทียบกับพี่น้องของมันเองจำเป็นต้องมีส่วนของตัวเอง และต้องมีคำเตือนแนบมาด้วย เพราะการเปรียบเทียบนี้ยากกว่าที่ดูเหมือน
เมื่อ Artificial Analysis เผยแพร่บทวิเคราะห์ Claude Fable 5.1 ของตนเมื่อวันที่ 1 กันยายน 2026 โมเดลนี้ได้คะแนน 66 ที่ระดับความพยายามสูงสุดบน Intelligence Index ของตน และเรียกคะแนนนี้ว่าคะแนนสูงสุดที่ตนเคยวัดได้ — แซงหน้า Claude Opus 5 ที่ 63 และ GPT-5.6 Sol ที่ 61 บนดัชนีตามที่ระบุไว้ ณ วันที่ 24 กันยายน 2026 โมเดลเดียวกันปรากฏที่ 53 ที่ระดับความพยายามสูงสุดพร้อมกลไกสำรอง และ Opus 5.5 ปรากฏที่ 58 ในการกำหนดค่าที่เทียบเท่า บทวิเคราะห์เมื่อวันที่ 22 กันยายนเกี่ยวกับ Opus 5.5 เรียก 58 ว่า "คะแนนสูงสุดที่เราเคยวัดได้ โดยนำอยู่หลายจุด"
สองข้อความนั้นเป็นจริงพร้อมกันบนสเกลเดียวกันไม่ได้ และทางออกก็คือพวกมันไม่ได้อยู่บนสเกลเดียวกัน ดัชนีเป็นวัตถุที่มีชีวิตซึ่ง Artificial Analysis ปรับปรุงแก้ไข บทความที่ตีพิมพ์สองชิ้นของสำนักนี้ ห่างกันห้าสัปดาห์ วางคู่พี่น้องคู่เดียวกันไว้คนละด้านของตำแหน่งสูงสุด นั่นเป็นข้อความเกี่ยวกับการปรับปรุงดัชนี ไม่ใช่เกี่ยวกับโมเดลใดโมเดลหนึ่งถดถอย และมันหมายความว่า 66 กับ 58 ต้องไม่ถูกพิมพ์เคียงข้างกันเด็ดขาด เมื่ออ่านในวันเดียวกัน รายการเดียวกัน การกำหนดค่าที่ติดป้ายเดียวกัน ลำดับปัจจุบันมี Opus 5.5 นำ Fable 5.1 อยู่ห้าคะแนน — และแม้แต่นั้นก็เป็นการเปรียบเทียบในดัชนีเดียวกัน โดยผู้จัดทำดัชนีรายเดียวกัน ไม่ใช่การเทียบแบบตัวต่อตัวที่ผ่านการตรวจสอบ สิ่งที่พูดได้อย่างปลอดภัยนั้นแคบกว่า: บนการปรับปรุงปัจจุบันของคอมโพสิตอิสระหนึ่งเดียวที่วัดทั้งสองโมเดล Opus 5.5 เป็นโมเดลที่แข็งแกร่งกว่าในสองโมเดลของ Anthropic และเลข 66 ที่เป็นที่รู้จักมากกว่าของ Fable 5.1 นั้นเป็นของการปรับปรุงดัชนีรุ่นก่อนหน้า
การตั้งค่าเหล่านี้สมควรได้รับอีกหนึ่งประโยค เพราะเป็นเรื่องง่ายที่จะทำให้สับสนปนกัน Fable 5.1 ที่ 66 กับ Opus 5.5 ที่ 58 ต่างก็เป็นแถวที่ใช้ความพยายามสูงสุด — แต่การตั้งค่าความพยายามห้าระดับของ Fable 5.1 ครอบคลุมช่วงกว้างถึง 11 เท่าในการใช้โทเคนเอาต์พุต จาก 13.1M ที่ระดับต่ำ ไปจนถึง 143.7M ที่ระดับสูงสุด โดยมีคะแนนดัชนีตั้งแต่ 58 ถึง 66 คะแนนดัชนีเพียงจุดเดียวสำหรับโมเดลที่มีการกระจายภายในมากขนาดนั้นถือเป็นสิ่งทดแทนที่ไม่ดีนักสำหรับแถวที่คุณจะรันจริง
ต้นทุนโทเคนถือเป็นแกนการวัดผลในตัวเอง
ตัวเลขทุกตัวข้างบนนี้คือคะแนน ไม่มีสักตัวที่เป็นบิล และในโมเดลนี้ บิลคือจุดที่การเคลื่อนไหวที่น่าสนใจอยู่
Artificial Analysis วัด Claude Opus 5.5 ที่ความพยายามสูงสุดโดยใช้โทเคนเอาต์พุตประมาณ 119,000 โทเคนต่องาน Intelligence Index — ซึ่งสูงที่สุดในดัชนีของตน เมื่อเทียบกัน บนกระดานเดียวกันที่การตั้งค่าเดียวกัน: Claude Opus 5 อยู่ที่ราว 73,000, Claude Fable 5.1 ราว 78,000, และ GPT-6 Astra ราว 27,000 โทเคนที่ใช้คิดถูกคิดราคาเป็นโทเคนเอาต์พุต และไม่สามารถปิด adaptive thinking ได้บน Opus 5.5 ดังนั้นโทเคนที่โมเดลใช้ครุ่นคิดจึงไม่ใช่แค่หมายเหตุประกอบราคา — แต่เป็นราคาส่วนใหญ่ของมัน
ลองคำนวณดู เพราะราคาที่ติดป้ายไว้ทำให้เข้าใจผิดหากดูเพียงลำพัง Opus 5.5 ตั้งราคาไว้ที่ $4.00 อินพุต / $20.00 เอาต์พุต ซึ่งลดลง 20% จาก $5.00 / $25.00 ของ Opus 5 Artificial Analysis ยังคงวัดว่า Opus 5.5 ที่ความพยายามสูงสุดมีค่าใช้จ่ายประมาณ $5.98 ต่องานดัชนี เทียบกับ $5.86 สำหรับ Opus 5 ในการตั้งค่าเดียวกัน — มากกว่าเล็กน้อย ไม่ใช่น้อยลง เพราะจำนวนโทเค็นเอาต์พุตที่มากกว่าประมาณ 1.6 เท่ากินส่วนลดราคา 20% ทั้งหมดจนหมดและยังเกินด้วยซ้ำ เมื่อพิจารณาทั้งดัชนี Opus 5.5 สร้าง 260M โทเค็นเอาต์พุต เทียบกับค่ามัธยฐานของบอร์ดที่ 88M ซึ่งผู้ประเมินติดป้ายว่า “ละเอียดเกินจำเป็นอย่างมาก”
ดังนั้น เรื่องต้นทุนจึงขึ้นอยู่กับการตั้งค่า effort ทั้งหมด และมันจะได้ผลก็ต่อเมื่อคุณใช้มัน ที่ระดับ max effort, Opus 5.5 มีต้นทุนต่อหนึ่งงานที่ทำสำเร็จสูงกว่าโมเดลที่มันเข้ามาแทนที่ ส่วนที่ระดับ medium — ซึ่งเป็นค่าเริ่มต้นจริงของผลิตภัณฑ์ และเป็นขอบเขตที่คำกล่าวอ้างของ Anthropic ที่ว่า "ต้นทุนการรันต่ำลงประมาณ 40% บนเวิร์กโหลดทั่วไป" ใช้ได้ — การประหยัดนั้นมีจริง แต่มันเป็นข้อความเกี่ยวกับค่าเฉลี่ยจากเวิร์กโหลดที่ผู้ขายเลือกไว้ ไม่ใช่ผลลัพธ์ต่องานที่ผ่านการตรวจสอบแล้ว การตีความในทางปฏิบัติ: การลดราคา 20% เป็นส่วนลดบนเรตการ์ด และเป็นออปชันบนปุ่มปรับ effort ไม่ใช่การประหยัดโดยอัตโนมัติ หากแผนการย้ายระบบของคุณคือ "สลับ model id แล้วคงการตั้งค่าเดิมไว้" คุณกำลังซื้อเวอร์ชันแพง
อะไรที่ไม่ได้รับการกำหนดขึ้นเลย
นี่คือส่วนที่เนื้อหาส่วนอื่นของหน้าทั้งหมดมีอยู่เพื่อสนับสนุน
• ยังไม่มีการเผยแพร่การเปรียบเทียบแบบตัวต่อตัวที่เป็นอิสระซึ่งควบคุมทั้งความพยายามและฮาร์เนสให้เท่ากัน ระหว่าง Claude Opus 5.5 กับคู่แข่งที่มีชื่อใด ๆ การเปรียบเทียบข้ามผู้จำหน่ายทุกกรณีบนหน้านี้ — Opus 5.5 กับ GPT-6 Astra, กับ GPT-5.6 Sol, กับ Claude Fable 5.1 — ล้วนเป็นการเปรียบเทียบตารางสองตารางที่จัดทำโดยสองบริษัทที่แตกต่างกัน บนฮาร์เนสสองแบบที่แตกต่างกัน ในการตั้งค่าความพยายามสองแบบที่แตกต่างกัน ซึ่งหนึ่งในนั้นมักเป็นโมเดลของผู้จำหน่ายเองในการตั้งค่าที่เอื้อประโยชน์ ไม่มีงานทดลองใดในบันทึกสาธารณะที่ตรึงโครงสร้างพื้นฐาน (scaffold) และความพยายามให้คงที่ข้ามสองผู้จำหน่าย แล้วรายงานทั้งสองค่า
• การแยกจำนวนโทเคนรายปัญหานั้นไม่ได้ถูกเผยแพร่ ตัวเลขรวมของโทเคนเอาต์พุตนั้นถูกวัดอย่างเป็นอิสระ แต่ไม่มีใครที่เราหาเจอเผยแพร่ว่ามีสัดส่วนเท่าใดที่เป็นข้อความคิดและเท่าใดที่เป็นข้อความคำตอบ หน้าเว็บใดที่ให้ตัวเลขโทเคนความคิดที่แม่นยำสำหรับโมเดลนี้ กำลังให้ตัวเลขที่ไม่มีใครวัดไว้จริง
• การ์ดระบบส่วนใหญ่ยังไม่ได้รับการทดสอบ benchmark โดยบุคคลที่สาม SWE-bench Pro 89.9%, Multilingual 93.9%, DeepSWE v1.1 74.2%, ProgramBench 91.2%, OfficeQA 78.9%, HealthBench Professional 65.6% เมื่อปรับตามความยาว, GMMLU 94.3%, ArXivMath 96.9% เมื่อใช้เครื่องมือ — ทั้งหมดเป็นข้อมูลที่ผู้ขายรายงานเอง ไม่มีรายการใดถูกทำซ้ำโดยอิสระ ณ เวลาที่เขียน
• ตัวเลขพาดหัวของ Terminal-Bench 4.0 ไม่ได้อยู่บนกระดานสาธารณะได้กล่าวถึงข้างต้นแล้ว และก็ควรอยู่ในรายการนี้ด้วย: ตัวเลขที่ถูกอ้างถึงมากที่สุดเพียงหนึ่งเดียวเกี่ยวกับโมเดลนี้ คือตัวเลขที่ไม่มีใครนอกจากผู้ขายได้รันมัน
• Anthropic รายงานว่า Claude Opus 5.5 "มักสงสัยว่าตนกำลังถูกประเมิน" — นี่คือคำพูดของบริษัทเอง ที่ยกมาเป็นข้อจำกัดของการประเมินความปลอดภัยของตน จงจริงจังกับเรื่องนี้ในฐานะปัญหาด้านการวัด ไม่ใช่เรื่องน่าฉงน: หากโมเดลมีพฤติกรรมที่แตกต่างออกไปเมื่อมันเชื่อว่ากำลังถูกทดสอบ ตัวเลข benchmark ทุกตัวบนหน้านี้ ไม่ว่าจะจากผู้จำหน่ายหรือจากฝ่ายอิสระ ล้วนเป็นการวัดโมเดลภายใต้การเฝ้าสังเกต และระดับที่พฤติกรรมนั้นแตกต่างจากพฤติกรรมเมื่อนำไปใช้งานจริงนั้นไม่อาจทราบได้และไม่ได้ถูกวัดปริมาณ ข้อนี้ใช้ได้กับทั้งแถวที่ดีและแถวที่แย่อย่างเท่าเทียมกัน มันเป็นข้อแม้เพียงข้อเดียวที่วิธีการแบบจับคู่ความพยายาม (matched-effort) ไม่ว่ามากเพียงใดก็ไม่อาจแก้ไขได้
• Sonnet 5.5 และ Haiku 5.5 ยังไม่พร้อมใช้งาน Anthropic ได้ประกาศว่าจะเปิดตัวใน "อีกไม่กี่สัปดาห์ข้างหน้า" ทั้งสองรุ่นยังไม่เปิดตัว ไม่มีผลการทดสอบมาตรฐานที่เผยแพร่ และไม่มีข้อมูลใดในหน้านี้ที่ใช้กับทั้งสองรุ่นได้
ราคา ขอบเขต และส่วนของสเปกที่ทำให้โค้ดของคุณต้องเปลี่ยน
อ่านจากตารางราคาที่เผยแพร่อย่างเป็นทางการของ Anthropic เมื่อวันที่ 24 กันยายน 2026: $4.00 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น, $20.00 ต่อหนึ่งล้านโทเค็นเอาต์พุต, $0.20 ต่อหนึ่งล้านการอ่านแคช, $5.00 ต่อหนึ่งล้านการเขียนแคชแบบ 5 นาที, $8.00 ต่อหนึ่งล้านการเขียนแคชแบบ 1 ชั่วโมง และลด 50% ทั้งสองทิศทางบน Batch API อัตราค่าการอ่านแคชคือรายการที่เงียบที่สุด — อยู่ที่ 5% ของอินพุตฐาน ขณะที่โมเดล Claude ส่วนใหญ่อยู่ที่ 10% และ Fable 5.1 อยู่ที่ 2.5% โหมดเร็ว (Fast mode) ตั้งราคาแยกต่างหากที่ $8.00 / $40.00 และ Anthropic อธิบายว่าเป็นพรีวิวสำหรับงานวิจัย ไม่ใช่ระดับการให้บริการทั่วไป
นี่คือส่วนที่ตารางราคาเลิกเป็นเรื่องเล่น ๆ และกลายเป็นเลขคณิตที่เราเตอร์คำนวณให้คุณได้Claude Opus 5.5ให้บริการในชื่อanthropic/claude-opus-5.5บน OrcaRouter ในราคาเดียวกันที่ $4.00 / $20.00 โดยราคาตามรายการถูกส่งผ่านโดยบวกเพิ่ม 0% — ดังนั้นทันทีที่ Anthropic ปรับราคา ราคาที่นี่ก็จะเป็นราคานั้นในวันเดียวกัน โดยไม่มีความล่าช้าในการปรับราคาให้ต้องนำมาคำนวณ สิ่งที่ตัดสินบิลจริงคือรายละเอียดที่แคตตาล็อกระบุไว้ข้างราคา ได้แก่ การอ่านแคชที่ $0.20 ซึ่งคิดเป็น 5% ของอินพุตฐาน เทียบกับ 2.5% ของ Fable 5.1, หน้าต่างบริบท 1 ล้านโทเคน และเพดานเอาต์พุต 128K เพราะพารามิเตอร์ effort คือจุดที่ต้นทุนของโมเดลนี้ขยับจริง — ดัชนีแกว่ง 16 จุด และเอาต์พุตประมาณ 119,000 โทเคนต่องานที่ระดับสูงสุด เทียบกับประมาณ 73,000 สำหรับ Opus 5 — การย้ายระบบที่ช่วยประหยัดเงินคือการย้ายที่ให้คุณปรับ effort ต่อเวิร์กโหลด ไม่ใช่ต่อบัญชี และวางเส้นทาง Opus 5.5 ไว้หลังระบบสลับสำรองอัตโนมัติระหว่างที่คุณวัดว่าทราฟฟิกของคุณต้องการการตั้งค่าแบบใด
• Envelope — บริบทขนาด 1M โทเคน, เอาต์พุตสูงสุด 128K, เอาต์พุต 300K บน Batch API เมื่อใช้ output-300k-2026-03-24 เฮดเดอร์เบต้า, ข้อมูลความรู้ถึงเดือนมิถุนายน 2026, ปลดระวางไม่เร็วกว่า 22 กันยายน 2027 เอาต์พุตเร็วกว่า Claude Opus 5 มากกว่า 30%.
• การเปลี่ยนแปลงที่ทำให้เข้ากันไม่ได้เมื่อเทียบกับ Opus 5 — ไม่สามารถปิดการคิดได้อีกต่อไป; การบังคับให้ใช้เครื่องมือ (tool_choice ที่ระบุเครื่องมือเฉพาะ) จะส่งคืนข้อผิดพลาด; บล็อกการคิดผูกกับโมเดลและบทสนทนาที่สร้างบล็อกเหล่านั้น; เครื่องมือ computer-use รุ่นเก่า computer_20251124 ไม่ได้รับการยอมรับบน Claude API หรือ Google Cloud สามข้อแรกมีผลกับ Fable 5.1 ด้วย มีข้อที่ห้าที่ไม่ได้แจ้งไว้: ข้อความระหว่างการเรียกใช้เครื่องมือตอนนี้จะมาอยู่ภายในบล็อกการคิดซึ่งข้อความในบล็อกว่างเปล่าเมื่อใช้การตั้งค่าการแสดงผลเริ่มต้น ดังนั้น UI ที่สตรีมข้อความนั้นเป็นตัวบ่งชี้ความคืบหน้าจะเงียบลงโดยไม่มีข้อผิดพลาดใด ๆ เกิดขึ้น
• การกำหนดเส้นทางเพื่อความปลอดภัยอีกครั้ง เพราะมันเป็นรายการในสเปก ไม่ใช่เชิงอรรถ — คำขอด้านความมั่นคงปลอดภัยไซเบอร์ส่วนใหญ่จะถูกส่งไปยัง Claude Opus 4.8 และงานด้านชีววิทยาจะถูกส่งต่อไปยัง Claude Opus 5 เว้นแต่บัญชีจะได้รับการยืนยันแล้ว ในการประเมินเหล่านั้น คำตอบที่คุณได้รับอาจไม่ได้มาจาก Opus 5.5 เลย ดังนั้นคะแนนที่เผยแพร่ในแบบทดสอบที่เกี่ยวข้องกับไซเบอร์และชีววิทยาจึงไม่ใช่การวัดที่แม่นยำของโมเดลนี้
• ข้ออ้างเรื่องประสิทธิภาพ ซึ่งเป็นข้อมูลที่ผู้ขายรายงานทั้งหมด — ค่าใช้จ่ายในการรันต่ำลงประมาณ 40% บนเวิร์กโหลดทั่วไป เทียบกับการลดราคาป้าย 20%; ตัวอย่างการวิเคราะห์การควบรวมกิจการที่ทดลองแล้วใช้เวลา 63 นาทีบน Opus 5.5 เทียบกับ 93 นาทีบน Opus 5 โดยมีค่าใช้จ่ายน้อยลง 50%; และคำกล่าวของลูกค้าจาก Box (ใช้โทเคนหนึ่งในสาม คำตอบยาวน้อยลงประมาณ 40%), Kiro (ใช้โทเคนราวครึ่งหนึ่ง จำนวนการเรียกน้อยลง 40%), Factory (โทเคนเอาต์พุตน้อยลง 20–25%) และ GitHub (อยู่ในกลุ่มที่ใช้โทเคนและขั้นตอนน้อยที่สุดเท่าที่วัดมา) ค่าเหล่านี้เป็นค่าเฉลี่ยจากเวิร์กโหลดที่ผู้ขายและพันธมิตรเปิดตัวเลือกไว้ สิ่งเหล่านี้เป็นข้อกล่าวอ้าง ไม่ใช่ผลลัพธ์ที่ผ่านการตรวจสอบ และสวนทางกันอย่างเห็นได้ชัดกับตัวเลขค่าใช้จ่ายต่องานแบบอิสระด้านบน — ซึ่งตัวมันเองเป็นการวัดที่ระดับความพยายามสูงสุด ไม่ใช่ที่ค่าเริ่มต้น ทั้งสองอย่างอาจเป็นจริงได้ โดยไม่มีอย่างใดเป็นการกล่าวอ้างทั่วไปเกี่ยวกับเวิร์กโหลดของคุณ

สถานะของหลักฐาน
Claude Opus 5.5 เป็นโมเดลจริงพร้อมการลดราคาจริง ขอบเขตบริบท 1M tokens และเอาต์พุต 128K จริง และเป็นการเปลี่ยนแปลงที่มีนัยสำคัญจริงในวิธีกำหนดค่าการคิดและ effort อีกทั้งยังมาพร้อมตาราง benchmark ที่วัด Anthropic เป็นหลัก ตารางอิสระที่วัดการดีพลอยแบบ routed มากกว่า checkpoint และปัญหาการตระหนักรู้ในตนเองที่มีการบันทึกไว้ ซึ่งบั่นทอนทั้งสองอย่าง ยังไม่มีการเผยแพร่การเปรียบเทียบแบบตัวต่อตัวโดยอิสระที่จับคู่ effort และ harness กันระหว่าง Claude Opus 5.5 กับคู่แข่งที่ระบุชื่อได้ จนกว่าจะมี ให้อ่านทุกการเปรียบเทียบข้ามค่ายบนหน้านี้ตามที่มันเป็น: ตารางจากผู้ขายสองรายจากสองบริษัท ณ การตั้งค่าสองแบบ ที่เรานำมาวางเรียงข้างกัน — และวัดการตั้งค่า effort ของคุณเองใหม่ก่อนที่คุณจะวัดโมเดลใหม่อีกครั้ง
การเปรียบเทียบในบทความนี้4
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
