
Claude Opus 5.5 กับการทดสอบแตงโม: Anthropic แก้สำนวนโวหารแล้ว แต่ประเด็นยังถูกฝังกลบอยู่
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
หนึ่งในตัวอย่างที่ถูกพูดถึงไกลที่สุดจากสัปดาห์เปิดตัว คือเรื่องสั้นเกี่ยวกับแตงโม ความยาวไม่กี่ร้อยคำ ไม่มีเบนช์มาร์กแนบมาด้วย ไม่มีแผนภูมิ — แค่โมเดลที่ถูกขอให้เขียนอะไรเล็ก ๆ และทำได้ถูกต้องเป็นส่วนใหญ่ นั่นเป็นสิ่งประหลาดที่จะมานั่งอยู่ใกล้ศูนย์กลางของการเปิดตัวผลิตภัณฑ์เรือธง แต่กลับชี้ไปที่สิ่งที่ผู้ขายเลือกนำเสนอเป็นประเด็นหลักตอนเปิดตัวClaude Opus 5.5เมื่อวันที่ 22 กันยายน 2026: ไม่ใช่คะแนนอีกจุดบน Terminal-Bench แต่เป็นงานร้อยแก้ว กรอบที่บริษัทวางไว้คือโมเดลนี้เขียน "Claudish" น้อยลง — คำที่พวกเขาใช้เรียกสำนวนแบบสูตรสำเร็จ ชอบใส่เงื่อนไขป้องกันตัวเกินไป และเกริ่นนำเสียยืดยาว ที่Claude Opus 5ถูกวิพากษ์วิจารณ์ และที่Claude Fable 5.1, GPT-6 Astra และ GPT-5.6 Solต่างถูกนำมาวัดเทียบกันมาตั้งแต่นั้น ดังนั้นคำถามที่คุ้มค่าจะตอบจึงไม่ใช่ว่าตัวเดโมนั้นน่าหลงใหลหรือไม่ แต่คือว่างานร้อยแก้วนั้นดีขึ้นจนวัดผลได้จริงหรือไม่ ดีขึ้นเท่าไร และยังล้มเหลวตรงไหน
สิ่งที่ Anthropic บอกว่าได้แก้ไขแล้ว

ข้อกล่าวอ้างของ Anthropic เจาะจงพอที่จะทดสอบได้ Opus 5.5 นั้น บริษัทกล่าวว่า จะวางข้อมูลที่สำคัญที่สุดไว้ก่อน ใช้ศัพท์เฉพาะน้อยลง และปฏิบัติตามกฎการเขียนที่ผู้ใช้ระบุไว้อย่างใกล้ชิดกว่าโมเดล Opus รุ่นก่อน ๆ เอกสารสนับสนุนเป็นข้อมูลที่ผู้ขายรายงานเองและยังไม่ได้ทำซ้ำ: การทดสอบตรวจสอบข้อเท็จจริงภายในที่ Anthropic กล่าวว่าผ่าน 16 จาก 18 ครั้ง เมื่อเทียบกับ 0 จาก 18 ครั้งสำหรับทั้ง Claude Fable 5.1และClaude Opus 5 คำพูดของลูกค้าในสื่อเปิดตัวชี้ไปในทิศทางเดียวกัน — John Ruelas จาก Ramp อธิบายผลลัพธ์ที่ "เขียนเหมือนเพื่อนร่วมงานที่ดี" ขณะที่ Box รายงานว่ามีความฟุ่มเฟือยน้อยลงประมาณ 40% ในภาระงานของตนเอง
มีสองสิ่งที่ควรแยกออกจากกันตรงนี้ อย่างแรกคือ “ความเป็น Claude น้อยลง” เป็นรูปแบบความล้มเหลวที่มีอยู่จริงและระบุชื่อได้ ไม่ใช่สิ่งประดิษฐ์ทางการตลาด ผู้ปฏิบัติงานพากันบ่นเรื่องงานเขียนของ Claude ที่ย่อจนแน่นและมีโครงสร้างแย่มาก ตั้งแต่รุ่น Opus หลังเวอร์ชัน 4.6 เป็นต้นมา และข้อบ่นนั้นก็เจาะจง: คำนำมากเกินไป กล่าวซ้ำพรอมป์ต์มากเกินไป มีนิสัยกว่าจะเข้าถึงประเด็นก็ช้าไปสองย่อหน้าหลังจากที่ผู้อ่านต้องการแล้ว อย่างที่สองคือ ตัวเลขของ Anthropic เองที่อ้างว่าได้แก้ไขเรื่องนี้แล้วก็เป็นเพียงแค่นั้น — ตัวเลขของ Anthropic เอง ตัวเลข 16 จาก 18 ไม่มีการทำซ้ำโดยอิสระ และ “ความยืดเยื้อน้อยลง 40%” เป็นการวัดภายในของลูกค้า ไม่ใช่ระเบียบวิธีที่เผยแพร่
การเปิดตัวนี้ยังมีการเปลี่ยนแปลงที่ไม่เกี่ยวกับงานเขียนซึ่งน่าทราบ: Opus 5.5 เป็นโมเดล Opus รุ่นแรกที่มาพร้อมมาตรการป้องกันด้านความมั่นคงไซเบอร์ ชีววิทยา และการพัฒนา LLM ชั้นแนวหน้า ซึ่งเทียบเท่ากับมาตรการที่มีใน Claude Fable 5.1 เมื่อคำขอใดกระตุ้นมาตรการใดมาตรการหนึ่ง Anthropic กล่าวว่าจะส่งต่อคำขอนั้นไปยังโมเดลอื่นอย่างโปร่งใสแทนที่จะปฏิเสธไปเลย
ตัวเลขที่ไม่ใช่ของ Anthropic

บทวิเคราะห์อิสระที่มีประโยชน์ที่สุดเกี่ยวกับข้ออ้างเรื่องการเขียนมาจาก Vibe Check ของ Every ซึ่งรันพรอมป์ต์เดียวกันกับโมเดลแนวหน้า 5 ตัว และให้คะแนนผลลัพธ์ด้วยเครื่องมือวัดความอ่านง่ายมาตรฐาน 2 ชนิด บนชุดพรอมป์ต์นั้น Claude Opus 5.5กลายเป็นตัวที่อ่านง่ายที่สุดในกลุ่ม — และช่องว่างระหว่างมันกับโมเดลที่มันเข้าแทนที่คือประเด็นสำคัญ:
• ระดับชั้นตามเกณฑ์ Flesch-Kincaid — Claude Opus 5.5 อยู่ที่ 6.95 เทียบกับ Claude Opus 5 ที่ 7.97
• Flesch Reading Ease — 68.4 สำหรับ Opus 5.5 เทียบกับ 61.35 สำหรับ Opus 5
• Claude Fable 5.1 — ระดับชั้น 7.43, ความง่ายในการอ่าน 66.09
• GPT-6 Astra — ระดับชั้น 7.52, คะแนนความง่ายในการอ่าน 64.55
• GPT-5.6 Sol — ระดับชั้น 8.74, ความง่ายในการอ่าน 56.62
อ่านเครื่องมือทั้งสองนี้ร่วมกัน เพราะมันเคลื่อนที่ไปในทิศทางตรงกันข้าม และนั่นคือประเด็น: ระดับเกรดที่ต่ำกว่าและคะแนนความง่ายที่สูงกว่าต่างก็หมายถึงข้อความที่ง่ายกว่า Opus 5.5 อยู่ต่ำกว่า Opus 5 ประมาณหนึ่งเกรดเต็ม ต่ำกว่าทั้ง Claude Fable 5.1 และ GPT-6 Astra ประมาณครึ่งเกรด และต่ำกว่า GPT-5.6 Sol เกือบสองเกรด พูดง่ายๆ ก็คือ ระดับการอ่านเกรด 7 แทนที่จะเป็นเกรด 8
นั่นเป็นการปรับปรุงที่แท้จริง และยังเป็นการปรับปรุงที่แคบด้วย นี่คือชุดพรอมป์ของสำนักข่าวแห่งหนึ่ง ไม่ใช่เบนช์มาร์กที่มีรายการงานตายตัวและมีลีดเดอร์บอร์ดรองรับอยู่เบื้องหลัง มันบอกทิศทางที่กำลังมุ่งไปและขนาดของก้าวโดยประมาณ แต่มันไม่ได้บอกคุณว่า Opus 5.5 เขียนงานของคุณได้ดี และบันทึกเชิงคุณภาพของ Every เองก็แสดงชัดว่าผู้รีวิวก็ไม่ได้คิดเช่นนั้นเหมือนกัน
ที่ซึ่งมันยังคงกลบประเด็นสำคัญ
รีวิวเดียวกันที่ให้ตัวเลขความอ่านง่ายออกมาตรงไปตรงมาเกี่ยวกับความล้มเหลวที่ยังหลงเหลืออยู่หลังการแก้ไข เมื่อถูกขอให้เปิดบทความ Opus 5.5 ใช้ 37 ถึง 39 ประโยคเพื่อครอบคลุมสิ่งที่ผู้รีวิวครอบคลุมใน 21 ประโยค และใช้ย่อหน้าเต็ม ๆ กับประเด็นที่ผู้รีวิวพูดในแปดคำ สรุปของผู้รีวิวคือโมเดลนี้ "ยังคงฝังประเด็น" — และคำตำหนิที่คมกว่านั้นคือมันสามารถวินิจฉัยได้อย่างถูกต้องว่าย่อหน้าต้องการอะไร แล้วสร้างฉบับแก้ไขที่เพิกเฉยต่อการวินิจฉัยของตัวเอง
ในฐานะบรรณาธิการ มันได้ผลลัพธ์ที่แย่กว่าในฐานะนักเขียน เมื่อจัดอันดับเทียบกับโมเดลอื่น ๆ ในงานด้านบรรณาธิการ Opus 5.5 อยู่อันดับรองจาก Claude Opus 5, GPT-5.6 Sol และGPT-6 Astra — โมเดลนี้เก่งเรื่องการสร้างประโยคที่อ่านเข้าใจง่ายมากกว่าเรื่องการรู้ว่าประโยคใดควรจะมาก่อน คำตัดสินของผู้วิจารณ์ตกผลึกอยู่ในประโยคหนึ่งที่ควรค่าแก่การอ้างอิง เพราะเป็นสิ่งที่มีประโยชน์ที่สุดในบทวิจารณ์ทั้งหมด: "ฉันพอใจกับมันในฐานะผู้ร่วมงานมากกว่าตัวงานร้อยเรียงที่มันผลิตออกมา"
การตีความเชิงปฏิบัติตามมาจากสิ่งนั้นโดยตรง ร่างด้วยมัน และร่างที่ระดับความพยายามสูงหรือสูงกว่า — การตั้งค่าความพยายามต่ำคือจุดที่เนื้อหาเยิ่นเย้อแย่ที่สุด จงใส่ตัวอย่างของคุณเองแทนที่จะขอให้มันคิดตัวอย่างขึ้นมา จากนั้นย้ายประเด็นขึ้นไปด้านบนด้วยตัวคุณเอง หรือส่งร่างให้สิ่งที่ทำเช่นนั้นได้ สิ่งที่ Opus 5.5 มอบให้คือเส้นทางที่เร็วกว่าไปสู่ร่างแรกที่สะอาด และผู้ร่วมงานที่ดีขึ้นอย่างแท้จริงสำหรับการตรวจแก้ในรอบถัด ๆ ไป มันไม่ได้มอบบรรณาธิการให้คุณ
คำพิเศษเหล่านั้นมีราคาต้องจ่ายเท่าไร

ปัญหาความเยิ่นเย้อมีมิติด้านต้นทุนที่บทวิจารณ์งานเขียนส่วนใหญ่มองข้าม และมันสวนทางกับเรื่องเล่าตอนเปิดตัว Artificial Analysis ซึ่งรันการประเมินของตนเองแทนที่จะพึ่งพาตัวเลขจากผู้ขาย จัดให้ Claude Opus 5.5อยู่อันดับหนึ่งจาก 212 โมเดลบน Intelligence Index ของตนด้วยคะแนน 58 — แต่อันดับที่ 95 จาก 212 ด้านความเยิ่นเย้อ โดยสร้างเอาต์พุตโทเคน 260 ล้านโทเคนตลอดการรัน Intelligence Index ครั้งนั้น เทียบกับค่ามัธยฐานที่ 88 ล้าน คิดเป็น $5.98 ต้องาน Intelligence Index ที่ประเมิน และรวมทั้งหมด $8,708.20
วางเรื่องนั้นเทียบกับคำกล่าวอ้างด้านประสิทธิภาพของ Anthropic เอง แล้วสองสิ่งนี้ก็ไม่สอดคล้องกันอย่างเห็นได้ชัด จุดยืนที่ผู้ขายรายงานคือ Opus 5.5 ใช้โทเค็นน้อยลงและสร้างเอาต์พุตได้เร็วกว่า Opus 5 มากกว่า 30% การรันอิสระของ Artificial Analysis พบว่าโมเดลนี้พูดเยิ่นเย้อมากเมื่อเทียบกับโมเดลคู่แข่ง ทั้งสองอย่างเป็นจริงพร้อมกันได้ — งานผสมต่างกัน การตั้งค่าความพยายามต่างกัน นิยามของ "โทเค็นน้อยลง" ต่างกัน — แต่ไม่มีใครควรอ่านกรอบการเปิดตัวว่าเป็นข้อเท็จจริงที่ยืนยันแล้วเกี่ยวกับความประหยัดโทเค็น ด้านราคาภาพชัดเจนกว่า: $4 ต่อล้านโทเค็นอินพุต และ $20 ต่อล้านโทเค็นเอาต์พุต ลดจาก $5/$25 โดยมีส่วนลดแคช 95% ในตัวเลขของ Artificial Analysis
หากคุณจ่ายต่อโทเคนเอาต์พุต งานเขียนที่ยืดเยื้อไม่ใช่ความชอบด้านสไตล์ แต่มันคือรายการค่าใช้จ่าย
รันมันกับสิ่งที่คุณมีอยู่แล้ว
หมายเหตุความซื่อตรงหนึ่งข้อก่อนถึงส่วนภาคปฏิบัติ: Claude Opus 5.5 ไม่ใช่หนึ่งในเส้นทางของเรา เราไม่ได้โฮสต์มัน และไม่ควรตีความสิ่งใดด้านล่างนี้ว่าเป็นข้ออ้างว่าเราโฮสต์มัน คุณเข้าถึงมันผ่าน API ของ Anthropic เองและแพลตฟอร์มของบุคคลที่สามหลายแห่ง
สิ่งที่อยู่บน OrcaRouter วันนี้คือโมเดลที่มันเข้าไปแทนที่ และรุ่นระดับสูงขึ้นไปอีกขั้น Claude Opus 5 อยู่บน OrcaRouter วันนี้ และ Claude Fable 5.1 ก็เช่นกัน ทั้งคู่ในราคาตามรายการของผู้ให้บริการ โดยบวกเพิ่ม 0% — ซึ่งหมายความว่าราคาที่ผู้ขายเปลี่ยนแปลงจะมาถึงฝั่งเราภายในวันเดียวกัน ไม่ใช่รอจนกว่าตัวแทนจำหน่ายจะว่างจัดการ ถ้าคุณกำลังตัดสินใจว่าสำนวนของ Opus 5.5 คุ้มค่าที่จะย้ายหรือไม่ นี่คือคู่ที่น่าใช้เปรียบเทียบ: คุณรันการเปรียบเทียบบนคีย์เดียวได้โดยไม่ต้องมีสัญญาที่สองหรือแก้โค้ด เพราะทั้งสองโมเดลอยู่API เดียวสำหรับ 200+ โมเดล ห่างออกไปเพียงปลายทางเดียวกัน
เหตุผลอีกประการในการเก็บโมเดลที่สองไว้ในลูปคือโหมดความล้มเหลวที่บทความนี้พูดถึง โมเดลที่กลบประเด็นสำคัญไว้ลึกคือโมเดลที่คุณอยากให้สามารถกำหนดเส้นทางอ้อมได้กลางงาน และ การสลับไปใช้ระบบสำรองอัตโนมัติมีอยู่ก็เพื่อให้การสร้างที่ไม่ดีไม่กลายเป็นไปป์ไลน์ที่หยุดชะงัก หากคุณไม่อยากเลือกโมเดลใดโมเดลหนึ่งเลย DSL สำหรับกำหนดเส้นทางจะประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียว และการหลอมรวมโมเดลจะรันคณะโมเดลที่ตอบพร้อมกัน ซึ่งเป็นรูปแบบที่สมเหตุสมผลสำหรับงานแก้ไข โดยที่ความล้มเหลวมาจากการตัดสินใจมากกว่าความสามารถ
ใครควรลงมือ และใครควรรอ
ถ้าข้อร้องเรียนของคุณเกี่ยวกับ Claude Opus 5 คือคุณต้องเขียนบทเปิดของมันใหม่ Opus 5.5 ก็ช่วยแก้ปัญหาส่วนนั้นได้จริงประมาณหนึ่งระดับชั้น และข้อมูลด้านความอ่านง่ายบอกว่าการปรับปรุงนี้วัดผลได้ ไม่ใช่แค่ความรู้สึก ถ้าข้อร้องเรียนของคุณคือกว่าจะเข้าประเด็นต้องใช้ถึงสามย่อหน้า ก็ไม่มีหลักฐานอิสระใดบอกว่าสิ่งนั้นเปลี่ยนไป นั่นเป็นข้อร้องเรียนที่ต่างกัน และการรายงานข่าวเปิดตัวก็มองสองเรื่องนี้เป็นเรื่องเดียวกัน
สำหรับงานสร้างสรรค์โดยเฉพาะ เรื่องแตงโมไม่ใช่หลักฐานของสิ่งใดเลย นอกจากว่าผู้คนมักหยิบพรอมป์ต์เล็ก ๆ อบอุ่น ความเสี่ยงต่ำ มาใช้เมื่อต้องการทำความรู้จักโมเดลใหม่ นั่นเป็นสิ่งที่สมเหตุสมผล และมันก็เป็นบริบทที่แนวโน้มการกลบประเด็นสำคัญนั้นมองเห็นได้น้อยที่สุดพอดี เพราะไม่มีใครอ่านเรื่องแตงโมเพื่อเอาประเด็นหลัก ลองวางโมเดลไว้ตรงหน้าเอกสารที่ผู้อ่านต้องการบทสรุปในสองประโยคแรก แล้วคุณจะรู้ว่าปัญหาสองข้อนั้น ข้อไหนที่คุณมีจริง ๆ
สิ่งที่ต้องจับตาต่อไปคือว่าโมเดลถัดไปในตระกูลนี้ — โดยคาดว่า Sonnet 5.5 และ Haiku 5.5 จะออกมาในอีกไม่กี่สัปดาห์ข้างหน้า — จะสืบทอดความอ่านง่ายที่เพิ่มขึ้นนี้หรือไม่ และว่าจะมีใครเผยแพร่ตัวเลขความอ่านง่ายสำหรับการแก้ไขแทนที่จะเป็นการร่างหรือไม่ ตัวเลขการร่างเป็นเรื่องง่าย ส่วนตัวเลขการแก้ไขคือจุดที่ Opus 5.5 ยังอยู่อันดับรองจากคู่แข่งสามราย
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
