
Claude Opus 5.5 กับ Claude Fable 5.1: โมเดลที่ถูกกว่าคว้าชัยใน Independent Index
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 177 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1323 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
Anthropic ตอนนี้ขายโมเดลสองตัวที่อยู่บนสุดของไลน์อัป และตัวที่ราคาแพงกว่าถึงสองเท่าครึ่งก็ไม่ใช่ตัวที่อยู่บนสุดของตาราง Claude Opus 5.5 เปิดตัวเมื่อวันที่ 22 กันยายน 2026 ในราคา 4 ดอลลาร์ต่ออินพุต 1 ล้านโทเคน และ 20 ดอลลาร์ต่อเอาต์พุต 1 ล้านโทเคน ทำคะแนนได้ 58 บน Artificial Analysis Intelligence Index Claude Fable 5.1 ซึ่งครองตำแหน่งเรือธงมาตั้งแต่วันที่ 1 กันยายน ด้วยราคา 10 ดอลลาร์สำหรับอินพุต และ 50 ดอลลาร์สำหรับเอาต์พุต ทำคะแนนได้ 53 ตัวเลขทั้งสองมาจากผู้ประเมินรายเดียวกัน ทั้งคู่วัดในกลุ่มการตั้งค่าเดียวกัน และช่องว่างกลับสวนทางกับป้ายราคา นั่นคือข้อเท็จจริงที่การเปรียบเทียบนี้ต้องเริ่มต้นจากมัน เพราะบทความเปิดตัวเกือบทุกชิ้นในสัปดาห์ที่ผ่านมานำเสนอ Opus 5.5 ว่าเป็นเวอร์ชันราคาถูกของ Fable 5.1 — โมเดลที่ถูกกว่าซึ่ง "เทียบเท่า" ตัวที่แพงกว่าในงานส่วนใหญ่ ตัวเลขจากแหล่งอิสระกลับบอกว่าโมเดลราคาถูกกว่านำอยู่
การที่เรื่องนี้ควรเปลี่ยนสิ่งที่คุณนำไปใช้งานหรือไม่นั้นเป็นอีกคำถามหนึ่ง และคำตอบขึ้นอยู่กับช่องว่าง 5 คะแนนน้อยกว่าการตั้งค่าสองอย่างที่ไม่มีใครใส่ไว้ในพาดหัวข่าว นั่นคือ ระดับความพยายามใดที่แต่ละโมเดลใช้เป็นค่าเริ่มต้น และตัวไหนที่สามารถทำให้เร็วได้
ตัวเลขที่เป็นอิสระ และสิ่งเดียวที่พวกมันมีร่วมกัน

Artificial Analysis เผยแพร่หนึ่งการตั้งค่าต่อโมเดล และสำหรับทั้งสองโมเดลนี้ มันถูกกำกับว่า "Adaptive Reasoning, Max Effort, Default Fallback" ป้ายเดียวกัน ผู้ประเมินรายเดียวกัน การรันครั้งเดียวกัน — ซึ่งทำให้สิ่งนี้เป็นการเปรียบเทียบแบบตัวต่อตัวที่สะอาดที่สุดเท่าที่โมเดลใดโมเดลหนึ่งเคยมี:
• ดัชนีความฉลาด — Claude Opus 5.5 ได้ 58 คะแนน อยู่อันดับที่ 1 จาก 210 เมื่อเทียบกับ Claude Fable 5.1 ได้ 53 คะแนน อยู่อันดับที่ 4
• ความเร็วในการส่งออก — Claude Fable 5.1 65.8 โทเคน/วินาที ต่ำกว่าค่ามัธยฐานของบอร์ดที่ 71.0 เมื่อเทียบกับ Claude Opus 5.5 ที่ยังไม่เผยแพร่บนบอร์ด
• เวลาถึงโทเคนแรก — Claude Fable 5.1 274.43 วินาที เทียบค่ามัธยฐานของบอร์ดที่ 3.83 วินาที; Claude Opus 5.5 ยังไม่เผยแพร่
• ความเยิ่นเย้อบนดัชนี — Claude Opus 5.5 สร้างโทเค็นเอาต์พุต 260 ล้าน เมื่อเทียบกับค่ามัธยฐานที่ 88 ล้านในทุกโมเดล
• ราคา — Claude Opus 5.5 $4.00 / $20.00 ต่อล้าน เทียบกับ Claude Fable 5.1 $10.00 / $50.00
สองในแถวเหล่านั้นต้องอ่านมากกว่าอ้างอิง แถวแรกคือป้าย "Max Effort": คะแนนของทั้งสองโมเดลไม่ได้สะท้อนค่าเริ่มต้นที่ใช้งานจริง และค่าเริ่มต้นทั้งสองก็ไม่เหมือนกัน — มีรายละเอียดเพิ่มเติมด้านล่าง แถวที่สองคือแถวความเยิ่นเย้อ ซึ่งขัดกับวิธีที่ Opus 5.5 ถูกนำเสนอ เรื่องราวด้านประสิทธิภาพของ Anthropic คือโมเดลให้คำตอบเดียวกันด้วยโทเค็นน้อยลง และเอกสารเปิดตัวอ้างถึงพาร์ตเนอร์ที่รายงานว่าใช้โทเค็นเอาต์พุตน้อยลงหนึ่งในสามถึงครึ่งหนึ่ง บน Index ซึ่งเป็นการวัดมากกว่าการอ้างอิง Opus 5.5 ปล่อย 260M โทเค็น เทียบกับค่ามัธยฐานบนบอร์ดที่ 88M — พูดมากกว่าโมเดลทั่วไปที่ถูกนำมาเปรียบเทียบด้วยราวสามเท่า ทั้งสองอย่างเป็นจริงได้: มันอาจใช้โทเค็นน้อยกว่า Claude Opus 5 แต่ก็ยังเป็นโมเดลที่พูดเยิ่นเย้อในเชิงสัมบูรณ์ แต่ถ้าคุณตั้งงบจากวลี "โทเค็นน้อยลง" ไม่ใช่จากบิลของคุณเอง การวัดที่เป็นอิสระคือสิ่งที่ควรตรวจสอบ
เงิน $6 ต่อล้านที่จ่ายเพิ่มซื้ออะไรได้บ้าง

ตัดเรื่องการเปรียบเทียบประสิทธิภาพออกไป สิ่งที่เหลือก็คือตารางราคา ทุกอย่างในนี้มาจากหน้าข้อมูลราคาที่ Anthropic เผยแพร่ ซึ่งตรวจสอบได้ในวันนี้:
• อินพุต — $4.00 ต่อล้านบน Opus 5.5 เทียบกับ $10.00 บน Fable 5.1
• เอาต์พุต — $20.00 ต่อล้าน เทียบกับ $50.00
• การอ่านแคช — $0.20 ต่อล้านบน Opus 5.5 เทียบกับ $0.25 บน Fable 5.1
• ตัวคูณแคช — Opus 5.5 คิดค่าฮิตแคชที่ 0.05 เท่าของอินพุตพื้นฐาน ส่วน Fable 5.1 คิดที่ 0.025 เท่า ซึ่งเป็นตัวคูณที่ดีกว่าบนฐานราคาที่สูงกว่า
• การเขียนแคช — $5 ต่อล้านสำหรับช่วงเวลา 5 นาที และ $8 ต่อหนึ่งชั่วโมงบน Opus 5.5 เทียบกับ $12.50 และ $20 บน Fable 5.1
• Batch API — Opus 5.5 ลดลงครึ่งหนึ่งเหลือ $2.00 / $10.00; Fable 5.1 ลดลงครึ่งหนึ่งเหลือ $5.00 / $25.00
• โหมดเร็ว — Opus 5.5 รองรับโหมดนี้ในราคา $8.00 / $40.00 เพื่อความเร็วในการสร้างเอาต์พุตสูงสุดประมาณ 2.5 เท่า ส่วน Fable 5.1 ไม่รองรับโหมดเร็วเลย
บรรทัดที่ว่าด้วยแคชคือจุดที่ต้องดูให้ดีเป็นพิเศษ เพราะสองโมเดลนี้พลิกรูปแบบที่ปกติเป็นกันอยู่ Fable 5.1 มีตัวคูณที่ดุดันกว่า — 2.5% ของอินพุตฐาน เทียบกับ 5% ของ Opus 5.5 — แต่เนื่องจากฐานของมันคือ $10 ไม่ใช่ $4 การอ่านแคชของมันจึงยังแพงกว่าอีกตัวในหน่วยดอลลาร์สัมบูรณ์อยู่ดี ไม่มีการตั้งค่าแบบใดที่โมเดลระดับพรีเมียมจะชนะในโทเคนของบริบทที่แคชไว้ได้ และตัวคูณไม่ใช่สิ่งที่ยกไปใช้ได้ทันที: ลูปเอเจนต์ที่ปรับจูนกับพฤติกรรมการแคชของ Fable 5.1 จะจ่ายแพงขึ้นต่อการแคชหนึ่งครั้งบน Opus 5.5 ตามสัดส่วน ถึงแม้จะจ่ายน้อยลงต่อโทเคนใหม่แต่ละตัวก็ตาม
โหมดเร็วคือความไม่สมมาตรที่คมชัดกว่า เอกสารของ Anthropic ระบุโหมดเร็วไว้สำหรับ Claude Opus 5.5, Claude Opus 5 และ Claude Opus 4.8 — Fable 5.1 ไม่ปรากฏอยู่ในรายการนั้น ดังนั้นโมเดลที่ถูกกว่าจึงมีคันโยกด้านความหน่วงที่โมเดลแพงกว่าไม่มีเลย ในราคา $8/$40 ซึ่งยังต่ำกว่าอัตราการส่งออกมาตรฐาน $10/$50 ของ Fable 5.1 หากภาระงานของคุณเป็นแบบโต้ตอบมากพอจนโทเคนแรกที่ช้าเป็นปัญหาต่อผลิตภัณฑ์ พึงทราบว่าเวลาถึงโทเคนแรกที่วัดได้ของ Fable 5.1 คือ 274 วินาที ตัวเลขนั้นเป็นผลพลอยได้จากการให้เหตุผลแบบเต็มกำลังสูงสุด ไม่ใช่ข้อบกพร่อง แต่ก็เป็นตัวเลขที่ผู้ประเมินบันทึกไว้
ค่าเริ่มต้นไม่เหมือนกัน และนั่นคือกับดัก
เอกสารโมเดลของ Anthropic เองวางสองโมเดลนี้ไว้เคียงข้างกัน และแถวที่ชี้ขาดการเปรียบเทียบจริงส่วนใหญ่ไม่ใช่ราคา แต่เป็นระดับความพยายามเริ่มต้น: medium สำหรับ Claude Opus 5.5, high สำหรับ Claude Fable 5.1 ทั้งคู่ใช้การคิดแบบปรับตัวที่ปิดไม่ได้ ความลึกถูกควบคุมผ่านพารามิเตอร์ effort เท่านั้น โดยอยู่ในสเกลที่ไล่จาก low, medium, high, xhigh, max
นี่คือสาเหตุที่ประโยคเปิดตัว "Opus 5.5 ทำงานส่วนใหญ่ได้เทียบเท่า Fable 5.1" และตาราง benchmark ที่อยู่ใต้นั้นดูเหมือนจะขัดแย้งกัน แถวเปรียบเทียบแบบตัวต่อตัวของ Anthropic สำหรับ Opus 5.5 มักถูกติดป้ายด้วยการตั้งค่า effort ที่สูงกว่าค่าเริ่มต้น — ตัวเลข Terminal-Bench 4.0 ที่ 66.4% เทียบกับ 55.8% ของ Fable 5.1 ถูกทดสอบที่ xhigh effort ไม่ใช่ medium ในขณะที่ตัวเลขของ Fable 5.1 เองนั้นถูกสร้างขึ้นที่ค่าเริ่มต้นที่สูงกว่าของมัน สองโมเดลที่ถูกเปรียบเทียบกันด้วยการตั้งค่า effort ต่างกันย่อมไม่ใช่การเปรียบเทียบกันเลย และ Anthropic ก็พูดไว้เช่นนั้นในสื่อเปิดตัวของตัวเอง เมื่อเตือนว่าส่วนต่างของ benchmark ที่ระดับความสามารถนี้เป็นแนวทางที่เชื่อถือได้น้อยกว่าที่คะแนนบ่งชี้ สำหรับความแตกต่างในโลกจริง
ในทางปฏิบัติแล้ว นั่นทำให้การตัดสินใจกลายเป็นงานปรับจูนมากกว่าการเลือก หากคุณย้ายจาก Fable 5.1 ไปยัง Opus 5.5 และนำการตั้งค่าeffortของคุณข้ามมาโดยไม่เปลี่ยนแปลง คุณก็ได้เปลี่ยนปริมาณการคิดของโมเดลไปอย่างเงียบ ๆ และตัวเลขคุณภาพกับต้นทุนทุกตัวที่คุณได้หลังจากนั้นก็ปนกันจนแยกไม่ออก คำแนะนำของ Anthropic คือให้ทดสอบหลายระดับ effort แทนที่จะยกการตั้งค่าของโมเดลเดิมมาใช้ ซึ่งทำได้ในราคาถูกและแทบไม่มีใครทำ เพราะมันหมายถึงการรัน eval ของคุณเองสองรอบ
จุดเดียวที่การจับคู่นี้พิสูจน์คุณค่าของตัวเอง
รูปแบบที่สมเหตุสมผลในการเก็บทั้งสองไว้คือลูปที่ปรึกษา: Opus 5.5 ทำงาน ส่วน Fable 5.1 ถูกปรึกษาในเรื่องการตัดสินใจที่ยาก Anthropic วัดผลแล้ว และมันเพิ่มความแม่นยำจริง — แต่ด้วยต้นทุนที่สูงขึ้นและความหน่วงที่สูงขึ้น ซึ่งเป็นข้อแลกเปลี่ยนที่คุณคาดหวังได้จากการนำโมเดลที่ช้ากว่าเข้าสู่ลูป สิ่งที่เปลี่ยนไปคือคณิตศาสตร์เบื้องหลังมัน เมื่อช่องว่างความสามารถกว้างกว่าเดิม การจ่าย $10/$50 เพื่อดูแลผู้ปฏิบัติงานที่ราคา $5/$25 นั้นคุ้มค่าอย่างชัดเจน ตอนนี้ที่ผู้ปฏิบัติงานทำคะแนนได้สูงกว่าที่ปรึกษาในดัชนีอิสระ การมีส่วนร่วมของที่ปรึกษาจะแคบลงเหลือเฉพาะงานที่การประเมินของมันเองเอาชนะ Opus 5.5 ได้ และนั่นคืองานที่คุณต้องระบุเอง ลูปยังคงสมเหตุสมผลสำหรับงานยากบางส่วน; มันหมดความสมเหตุสมผลในฐานะการตั้งค่าแบบครอบคลุมทั้งหมด
ทั้งคู่ห่างกันแค่ปุ่มเดียว
รายละเอียดการย้ายระบบที่ทำให้ทีมพลาดตรงนี้ไม่ใช่พื้นผิว API — แต่เป็นเพราะโมเดลเหล่านี้เป็นโมเดลของผู้ขายรายเดียวกันที่มีสเกลความพยายามต่างกัน ตัวคูณแคชต่างกัน และการตั้งค่าเริ่มต้นต่างกัน และการเปรียบเทียบอย่างตรงไปตรงมาหมายถึงการรันทั้งสองตัวกับพรอมป์ของคุณเองในการตั้งค่าที่จับคู่กัน Claude Opus 5.5 อยู่บน OrcaRouter ในราคา $4.00 / $20.00 ของ Anthropic เอง, และ Claude Fable 5.1 อยู่บน OrcaRouter ในราคา $10.00 / $50.00 — ราคาตามรายการของผู้ให้บริการส่งผ่านมาพร้อมมาร์กอัป 0% ดังนั้นตัวเลขทั้งสองจะเปลี่ยนในวันที่ Anthropic เปลี่ยน และไม่มีอันใดต้องมีสัญญาฉบับที่สองหรือ SDK ตัวที่สอง

นั่นคือสิ่งที่ทำให้การแยกนี้เป็นเรื่องปฏิบัติได้จริงมากกว่าเชิงทฤษฎี การส่งปริมาณทราฟฟิกส่วนใหญ่ของคุณไปยัง Opus 5.5 และปักหมุดกฎการจัดเส้นทางที่ยกระดับเคสที่ยากจริง ๆ ไปยัง Fable 5.1 เป็นการตั้งค่าบนเอนด์พอยต์เดียว ไม่ใช่การผสานรวมสองอย่าง — และการประกอบการเรียกใช้โดยให้โมเดลหนึ่งร่างคำตอบขณะที่อีกโมเดลตรวจสอบ เป็นเพียงบรรทัด routing-DSL ไม่ใช่ไปป์ไลน์ที่คุณต้องสร้างและดูแลรักษา หากเส้นทางการยกระดับกลับกลายเป็นไม่เหมาะกับเวิร์กโหลดของคุณ การสลับสำรองอัตโนมัติจะทำให้คำขอยังคงไปลงที่โมเดลที่คุณได้ระบุคุณลักษณะไว้แล้ว แทนที่จะล้มเหลวไปเลย
อะไรจะยุติเรื่องนี้ได้
สภาพที่ตรงไปตรงมาของการเปรียบเทียบนี้ก็คือ Anthropic เผยแพร่ตารางหนึ่งที่โมเดลที่ถูกกว่าเป็นฝ่ายชนะในแถวส่วนใหญ่ Artificial Analysis ก็เผยแพร่อีกตารางหนึ่งที่โมเดลนั้นชนะแบบขาดลอย และทั้งสองตารางก็รันด้วยการตั้งค่าระดับความพยายาม (effort) ที่คุณไม่ได้ใช้จริงในการดีพลอย ไม่มีตารางใดเป็นการเทียบกันแบบควบคุมที่ค่าเริ่มต้นที่ตรงกัน และยังไม่มีบุคคลที่สามรายใดทำการทดสอบเช่นนั้น ช่องว่างที่ยังคงเหลืออยู่หลังทั้งหมดนั้น — นั่นคือ Claude Opus 5.5 ถูกกว่าอย่างมีนัยสำคัญในทุกรายการของตารางราคา รองรับโหมดเร็ว (fast mode) ที่ Fable 5.1 ไม่มี และไม่ได้เป็นรองในคะแนนอิสระเพียงตัวเดียวที่ทั้งสองโมเดลมี — ใหญ่มากพอที่ภาระการพิสูจน์ได้ย้ายไปแล้ว ถ้าคุณใช้ Fable 5.1 เป็นค่าเริ่มต้น คำถามก็ไม่ใช่แล้วว่า Opus 5.5 ดีพอหรือไม่ แต่คือว่างานเฉพาะเจาะจงใดในเวิร์กโหลดของคุณที่ล้มเหลวที่ระดับความพยายาม medium เพราะงานเหล่านั้นเท่านั้นที่คุณกำลังจ่ายเงินส่วนเกินอยู่
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
