การ์ดชื่อเรื่องหลักมีหัวข้อว่า 'Claude Opus 5.5 และการทดสอบแตงโม' คำโปรยว่า 'Claude ที่อ่านง่ายที่สุดเท่าที่เคยมีมา — และยังคงฝังประเด็นสำคัญไว้' พร้อมป้ายสามป้ายที่ระบุว่า Flesch-Kincaid 6.95, Reading Ease 68.4 และ 22 กันยายน 2026 และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Claude Opus 5.5 กับการทดสอบแตงโม: Anthropic แก้สำนวนโวหารแล้ว แต่ประเด็นยังถูกฝังกลบอยู่

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

หนึ่งในตัวอย่างที่ถูกพูดถึงไกลที่สุดจากสัปดาห์เปิดตัว คือเรื่องสั้นเกี่ยวกับแตงโม ความยาวไม่กี่ร้อยคำ ไม่มีเบนช์มาร์กแนบมาด้วย ไม่มีแผนภูมิ — แค่โมเดลที่ถูกขอให้เขียนอะไรเล็ก ๆ และทำได้ถูกต้องเป็นส่วนใหญ่ นั่นเป็นสิ่งประหลาดที่จะมานั่งอยู่ใกล้ศูนย์กลางของการเปิดตัวผลิตภัณฑ์เรือธง แต่กลับชี้ไปที่สิ่งที่ผู้ขายเลือกนำเสนอเป็นประเด็นหลักตอนเปิดตัวClaude Opus 5.5เมื่อวันที่ 22 กันยายน 2026: ไม่ใช่คะแนนอีกจุดบน Terminal-Bench แต่เป็นงานร้อยแก้ว กรอบที่บริษัทวางไว้คือโมเดลนี้เขียน "Claudish" น้อยลง — คำที่พวกเขาใช้เรียกสำนวนแบบสูตรสำเร็จ ชอบใส่เงื่อนไขป้องกันตัวเกินไป และเกริ่นนำเสียยืดยาว ที่Claude Opus 5ถูกวิพากษ์วิจารณ์ และที่Claude Fable 5.1, GPT-6 Astra และ GPT-5.6 Solต่างถูกนำมาวัดเทียบกันมาตั้งแต่นั้น ดังนั้นคำถามที่คุ้มค่าจะตอบจึงไม่ใช่ว่าตัวเดโมนั้นน่าหลงใหลหรือไม่ แต่คือว่างานร้อยแก้วนั้นดีขึ้นจนวัดผลได้จริงหรือไม่ ดีขึ้นเท่าไร และยังล้มเหลวตรงไหน

สิ่งที่ Anthropic บอกว่าได้แก้ไขแล้ว

Screenshot of Anthropic's Claude Platform release-notes page, showing the Claude Opus 5.5 entry dated September 22, 2026, with the model ID claude-opus-5-5, a 1M-token context window and 128K maximum output.

ข้อกล่าวอ้างของ Anthropic เจาะจงพอที่จะทดสอบได้ Opus 5.5 นั้น บริษัทกล่าวว่า จะวางข้อมูลที่สำคัญที่สุดไว้ก่อน ใช้ศัพท์เฉพาะน้อยลง และปฏิบัติตามกฎการเขียนที่ผู้ใช้ระบุไว้อย่างใกล้ชิดกว่าโมเดล Opus รุ่นก่อน ๆ เอกสารสนับสนุนเป็นข้อมูลที่ผู้ขายรายงานเองและยังไม่ได้ทำซ้ำ: การทดสอบตรวจสอบข้อเท็จจริงภายในที่ Anthropic กล่าวว่าผ่าน 16 จาก 18 ครั้ง เมื่อเทียบกับ 0 จาก 18 ครั้งสำหรับทั้ง Claude Fable 5.1และClaude Opus 5 คำพูดของลูกค้าในสื่อเปิดตัวชี้ไปในทิศทางเดียวกัน — John Ruelas จาก Ramp อธิบายผลลัพธ์ที่ "เขียนเหมือนเพื่อนร่วมงานที่ดี" ขณะที่ Box รายงานว่ามีความฟุ่มเฟือยน้อยลงประมาณ 40% ในภาระงานของตนเอง

มีสองสิ่งที่ควรแยกออกจากกันตรงนี้ อย่างแรกคือ “ความเป็น Claude น้อยลง” เป็นรูปแบบความล้มเหลวที่มีอยู่จริงและระบุชื่อได้ ไม่ใช่สิ่งประดิษฐ์ทางการตลาด ผู้ปฏิบัติงานพากันบ่นเรื่องงานเขียนของ Claude ที่ย่อจนแน่นและมีโครงสร้างแย่มาก ตั้งแต่รุ่น Opus หลังเวอร์ชัน 4.6 เป็นต้นมา และข้อบ่นนั้นก็เจาะจง: คำนำมากเกินไป กล่าวซ้ำพรอมป์ต์มากเกินไป มีนิสัยกว่าจะเข้าถึงประเด็นก็ช้าไปสองย่อหน้าหลังจากที่ผู้อ่านต้องการแล้ว อย่างที่สองคือ ตัวเลขของ Anthropic เองที่อ้างว่าได้แก้ไขเรื่องนี้แล้วก็เป็นเพียงแค่นั้น — ตัวเลขของ Anthropic เอง ตัวเลข 16 จาก 18 ไม่มีการทำซ้ำโดยอิสระ และ “ความยืดเยื้อน้อยลง 40%” เป็นการวัดภายในของลูกค้า ไม่ใช่ระเบียบวิธีที่เผยแพร่

การเปิดตัวนี้ยังมีการเปลี่ยนแปลงที่ไม่เกี่ยวกับงานเขียนซึ่งน่าทราบ: Opus 5.5 เป็นโมเดล Opus รุ่นแรกที่มาพร้อมมาตรการป้องกันด้านความมั่นคงไซเบอร์ ชีววิทยา และการพัฒนา LLM ชั้นแนวหน้า ซึ่งเทียบเท่ากับมาตรการที่มีใน Claude Fable 5.1 เมื่อคำขอใดกระตุ้นมาตรการใดมาตรการหนึ่ง Anthropic กล่าวว่าจะส่งต่อคำขอนั้นไปยังโมเดลอื่นอย่างโปร่งใสแทนที่จะปฏิเสธไปเลย

ตัวเลขที่ไม่ใช่ของ Anthropic

A single-column readability scoreboard for Claude Opus 5.5: Flesch-Kincaid grade 6.95 versus Opus 5 at 7.97; Reading Ease 68.4 versus 61.35; Fable 5.1 and GPT-6 Astra at 7.43 and 7.52 grade; GPT-5.6 Sol at 8.74 grade and 56.62 ease; ranked 4th of 5 tested as an editor; and an AA Intelligence Index of 58, first of 212 models, with a sourcing footer.

บทวิเคราะห์อิสระที่มีประโยชน์ที่สุดเกี่ยวกับข้ออ้างเรื่องการเขียนมาจาก Vibe Check ของ Every ซึ่งรันพรอมป์ต์เดียวกันกับโมเดลแนวหน้า 5 ตัว และให้คะแนนผลลัพธ์ด้วยเครื่องมือวัดความอ่านง่ายมาตรฐาน 2 ชนิด บนชุดพรอมป์ต์นั้น Claude Opus 5.5กลายเป็นตัวที่อ่านง่ายที่สุดในกลุ่ม — และช่องว่างระหว่างมันกับโมเดลที่มันเข้าแทนที่คือประเด็นสำคัญ:

• ระดับชั้นตามเกณฑ์ Flesch-Kincaid — Claude Opus 5.5 อยู่ที่ 6.95 เทียบกับ Claude Opus 5 ที่ 7.97

• Flesch Reading Ease — 68.4 สำหรับ Opus 5.5 เทียบกับ 61.35 สำหรับ Opus 5

• Claude Fable 5.1 — ระดับชั้น 7.43, ความง่ายในการอ่าน 66.09

• GPT-6 Astra — ระดับชั้น 7.52, คะแนนความง่ายในการอ่าน 64.55

• GPT-5.6 Sol — ระดับชั้น 8.74, ความง่ายในการอ่าน 56.62

อ่านเครื่องมือทั้งสองนี้ร่วมกัน เพราะมันเคลื่อนที่ไปในทิศทางตรงกันข้าม และนั่นคือประเด็น: ระดับเกรดที่ต่ำกว่าและคะแนนความง่ายที่สูงกว่าต่างก็หมายถึงข้อความที่ง่ายกว่า Opus 5.5 อยู่ต่ำกว่า Opus 5 ประมาณหนึ่งเกรดเต็ม ต่ำกว่าทั้ง Claude Fable 5.1 และ GPT-6 Astra ประมาณครึ่งเกรด และต่ำกว่า GPT-5.6 Sol เกือบสองเกรด พูดง่ายๆ ก็คือ ระดับการอ่านเกรด 7 แทนที่จะเป็นเกรด 8

นั่นเป็นการปรับปรุงที่แท้จริง และยังเป็นการปรับปรุงที่แคบด้วย นี่คือชุดพรอมป์ของสำนักข่าวแห่งหนึ่ง ไม่ใช่เบนช์มาร์กที่มีรายการงานตายตัวและมีลีดเดอร์บอร์ดรองรับอยู่เบื้องหลัง มันบอกทิศทางที่กำลังมุ่งไปและขนาดของก้าวโดยประมาณ แต่มันไม่ได้บอกคุณว่า Opus 5.5 เขียนงานของคุณได้ดี และบันทึกเชิงคุณภาพของ Every เองก็แสดงชัดว่าผู้รีวิวก็ไม่ได้คิดเช่นนั้นเหมือนกัน

ที่ซึ่งมันยังคงกลบประเด็นสำคัญ

รีวิวเดียวกันที่ให้ตัวเลขความอ่านง่ายออกมาตรงไปตรงมาเกี่ยวกับความล้มเหลวที่ยังหลงเหลืออยู่หลังการแก้ไข เมื่อถูกขอให้เปิดบทความ Opus 5.5 ใช้ 37 ถึง 39 ประโยคเพื่อครอบคลุมสิ่งที่ผู้รีวิวครอบคลุมใน 21 ประโยค และใช้ย่อหน้าเต็ม ๆ กับประเด็นที่ผู้รีวิวพูดในแปดคำ สรุปของผู้รีวิวคือโมเดลนี้ "ยังคงฝังประเด็น" — และคำตำหนิที่คมกว่านั้นคือมันสามารถวินิจฉัยได้อย่างถูกต้องว่าย่อหน้าต้องการอะไร แล้วสร้างฉบับแก้ไขที่เพิกเฉยต่อการวินิจฉัยของตัวเอง

ในฐานะบรรณาธิการ มันได้ผลลัพธ์ที่แย่กว่าในฐานะนักเขียน เมื่อจัดอันดับเทียบกับโมเดลอื่น ๆ ในงานด้านบรรณาธิการ Opus 5.5 อยู่อันดับรองจาก Claude Opus 5, GPT-5.6 Sol และGPT-6 Astra — โมเดลนี้เก่งเรื่องการสร้างประโยคที่อ่านเข้าใจง่ายมากกว่าเรื่องการรู้ว่าประโยคใดควรจะมาก่อน คำตัดสินของผู้วิจารณ์ตกผลึกอยู่ในประโยคหนึ่งที่ควรค่าแก่การอ้างอิง เพราะเป็นสิ่งที่มีประโยชน์ที่สุดในบทวิจารณ์ทั้งหมด: "ฉันพอใจกับมันในฐานะผู้ร่วมงานมากกว่าตัวงานร้อยเรียงที่มันผลิตออกมา"

การตีความเชิงปฏิบัติตามมาจากสิ่งนั้นโดยตรง ร่างด้วยมัน และร่างที่ระดับความพยายามสูงหรือสูงกว่า — การตั้งค่าความพยายามต่ำคือจุดที่เนื้อหาเยิ่นเย้อแย่ที่สุด จงใส่ตัวอย่างของคุณเองแทนที่จะขอให้มันคิดตัวอย่างขึ้นมา จากนั้นย้ายประเด็นขึ้นไปด้านบนด้วยตัวคุณเอง หรือส่งร่างให้สิ่งที่ทำเช่นนั้นได้ สิ่งที่ Opus 5.5 มอบให้คือเส้นทางที่เร็วกว่าไปสู่ร่างแรกที่สะอาด และผู้ร่วมงานที่ดีขึ้นอย่างแท้จริงสำหรับการตรวจแก้ในรอบถัด ๆ ไป มันไม่ได้มอบบรรณาธิการให้คุณ

คำพิเศษเหล่านั้นมีราคาต้องจ่ายเท่าไร

Screenshot of the Artificial Analysis model page for Claude Opus 5.5, showing an Intelligence Index of 58 ranked first of 212 models, a cost rank of 93 of 212 at $4.00 per million input and $20.00 per million output with a 95% cache discount and $5.98 per Index task, and a verbosity rank of 95 of 212 at 260 million output tokens against a median of 88 million.

ปัญหาความเยิ่นเย้อมีมิติด้านต้นทุนที่บทวิจารณ์งานเขียนส่วนใหญ่มองข้าม และมันสวนทางกับเรื่องเล่าตอนเปิดตัว Artificial Analysis ซึ่งรันการประเมินของตนเองแทนที่จะพึ่งพาตัวเลขจากผู้ขาย จัดให้ Claude Opus 5.5อยู่อันดับหนึ่งจาก 212 โมเดลบน Intelligence Index ของตนด้วยคะแนน 58 — แต่อันดับที่ 95 จาก 212 ด้านความเยิ่นเย้อ โดยสร้างเอาต์พุตโทเคน 260 ล้านโทเคนตลอดการรัน Intelligence Index ครั้งนั้น เทียบกับค่ามัธยฐานที่ 88 ล้าน คิดเป็น $5.98 ต้องาน Intelligence Index ที่ประเมิน และรวมทั้งหมด $8,708.20

วางเรื่องนั้นเทียบกับคำกล่าวอ้างด้านประสิทธิภาพของ Anthropic เอง แล้วสองสิ่งนี้ก็ไม่สอดคล้องกันอย่างเห็นได้ชัด จุดยืนที่ผู้ขายรายงานคือ Opus 5.5 ใช้โทเค็นน้อยลงและสร้างเอาต์พุตได้เร็วกว่า Opus 5 มากกว่า 30% การรันอิสระของ Artificial Analysis พบว่าโมเดลนี้พูดเยิ่นเย้อมากเมื่อเทียบกับโมเดลคู่แข่ง ทั้งสองอย่างเป็นจริงพร้อมกันได้ — งานผสมต่างกัน การตั้งค่าความพยายามต่างกัน นิยามของ "โทเค็นน้อยลง" ต่างกัน — แต่ไม่มีใครควรอ่านกรอบการเปิดตัวว่าเป็นข้อเท็จจริงที่ยืนยันแล้วเกี่ยวกับความประหยัดโทเค็น ด้านราคาภาพชัดเจนกว่า: $4 ต่อล้านโทเค็นอินพุต และ $20 ต่อล้านโทเค็นเอาต์พุต ลดจาก $5/$25 โดยมีส่วนลดแคช 95% ในตัวเลขของ Artificial Analysis

หากคุณจ่ายต่อโทเคนเอาต์พุต งานเขียนที่ยืดเยื้อไม่ใช่ความชอบด้านสไตล์ แต่มันคือรายการค่าใช้จ่าย

รันมันกับสิ่งที่คุณมีอยู่แล้ว

หมายเหตุความซื่อตรงหนึ่งข้อก่อนถึงส่วนภาคปฏิบัติ: Claude Opus 5.5 ไม่ใช่หนึ่งในเส้นทางของเรา เราไม่ได้โฮสต์มัน และไม่ควรตีความสิ่งใดด้านล่างนี้ว่าเป็นข้ออ้างว่าเราโฮสต์มัน คุณเข้าถึงมันผ่าน API ของ Anthropic เองและแพลตฟอร์มของบุคคลที่สามหลายแห่ง

สิ่งที่อยู่บน OrcaRouter วันนี้คือโมเดลที่มันเข้าไปแทนที่ และรุ่นระดับสูงขึ้นไปอีกขั้น Claude Opus 5 อยู่บน OrcaRouter วันนี้ และ Claude Fable 5.1 ก็เช่นกัน ทั้งคู่ในราคาตามรายการของผู้ให้บริการ โดยบวกเพิ่ม 0% — ซึ่งหมายความว่าราคาที่ผู้ขายเปลี่ยนแปลงจะมาถึงฝั่งเราภายในวันเดียวกัน ไม่ใช่รอจนกว่าตัวแทนจำหน่ายจะว่างจัดการ ถ้าคุณกำลังตัดสินใจว่าสำนวนของ Opus 5.5 คุ้มค่าที่จะย้ายหรือไม่ นี่คือคู่ที่น่าใช้เปรียบเทียบ: คุณรันการเปรียบเทียบบนคีย์เดียวได้โดยไม่ต้องมีสัญญาที่สองหรือแก้โค้ด เพราะทั้งสองโมเดลอยู่API เดียวสำหรับ 200+ โมเดล ห่างออกไปเพียงปลายทางเดียวกัน

เหตุผลอีกประการในการเก็บโมเดลที่สองไว้ในลูปคือโหมดความล้มเหลวที่บทความนี้พูดถึง โมเดลที่กลบประเด็นสำคัญไว้ลึกคือโมเดลที่คุณอยากให้สามารถกำหนดเส้นทางอ้อมได้กลางงาน และ การสลับไปใช้ระบบสำรองอัตโนมัติมีอยู่ก็เพื่อให้การสร้างที่ไม่ดีไม่กลายเป็นไปป์ไลน์ที่หยุดชะงัก หากคุณไม่อยากเลือกโมเดลใดโมเดลหนึ่งเลย DSL สำหรับกำหนดเส้นทางจะประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียว และการหลอมรวมโมเดลจะรันคณะโมเดลที่ตอบพร้อมกัน ซึ่งเป็นรูปแบบที่สมเหตุสมผลสำหรับงานแก้ไข โดยที่ความล้มเหลวมาจากการตัดสินใจมากกว่าความสามารถ

ใครควรลงมือ และใครควรรอ

ถ้าข้อร้องเรียนของคุณเกี่ยวกับ Claude Opus 5 คือคุณต้องเขียนบทเปิดของมันใหม่ Opus 5.5 ก็ช่วยแก้ปัญหาส่วนนั้นได้จริงประมาณหนึ่งระดับชั้น และข้อมูลด้านความอ่านง่ายบอกว่าการปรับปรุงนี้วัดผลได้ ไม่ใช่แค่ความรู้สึก ถ้าข้อร้องเรียนของคุณคือกว่าจะเข้าประเด็นต้องใช้ถึงสามย่อหน้า ก็ไม่มีหลักฐานอิสระใดบอกว่าสิ่งนั้นเปลี่ยนไป นั่นเป็นข้อร้องเรียนที่ต่างกัน และการรายงานข่าวเปิดตัวก็มองสองเรื่องนี้เป็นเรื่องเดียวกัน

สำหรับงานสร้างสรรค์โดยเฉพาะ เรื่องแตงโมไม่ใช่หลักฐานของสิ่งใดเลย นอกจากว่าผู้คนมักหยิบพรอมป์ต์เล็ก ๆ อบอุ่น ความเสี่ยงต่ำ มาใช้เมื่อต้องการทำความรู้จักโมเดลใหม่ นั่นเป็นสิ่งที่สมเหตุสมผล และมันก็เป็นบริบทที่แนวโน้มการกลบประเด็นสำคัญนั้นมองเห็นได้น้อยที่สุดพอดี เพราะไม่มีใครอ่านเรื่องแตงโมเพื่อเอาประเด็นหลัก ลองวางโมเดลไว้ตรงหน้าเอกสารที่ผู้อ่านต้องการบทสรุปในสองประโยคแรก แล้วคุณจะรู้ว่าปัญหาสองข้อนั้น ข้อไหนที่คุณมีจริง ๆ

สิ่งที่ต้องจับตาต่อไปคือว่าโมเดลถัดไปในตระกูลนี้ — โดยคาดว่า Sonnet 5.5 และ Haiku 5.5 จะออกมาในอีกไม่กี่สัปดาห์ข้างหน้า — จะสืบทอดความอ่านง่ายที่เพิ่มขึ้นนี้หรือไม่ และว่าจะมีใครเผยแพร่ตัวเลขความอ่านง่ายสำหรับการแก้ไขแทนที่จะเป็นการร่างหรือไม่ ตัวเลขการร่างเป็นเรื่องง่าย ส่วนตัวเลขการแก้ไขคือจุดที่ Opus 5.5 ยังอยู่อันดับรองจากคู่แข่งสามราย

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube