Thẻ tiêu đề hero có tiêu đề 'Claude Opus 5.5 và bài kiểm tra dưa hấu', phụ đề 'Claude dễ đọc nhất từ trước đến nay — và nó vẫn chôn vùi ý chính', với ba badge ghi Flesch-Kincaid 6.95, Reading Ease 68.4 và 22 tháng 9, 2026, cùng logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

Claude Opus 5.5 và Bài kiểm tra Dưa hấu: Anthropic đã sửa được văn phong, nhưng ý chính vẫn bị chôn vùi

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Một trong những mẫu lan truyền xa nhất ra khỏi tuần ra mắt là một truyện ngắn về quả dưa hấu. Vài trăm từ, không kèm benchmark, không biểu đồ — chỉ là một mô hình được yêu cầu viết một thứ nhỏ nhắn và làm đúng phần lớn. Đó là một hiện vật kỳ lạ để nằm gần trung tâm của một bản phát hành chủ lực, nhưng nó chỉ ra thứ mà nhà cung cấp chọn để dẫn dắt khi họ tung raClaude Opus 5.5vào ngày 22 tháng 9 năm 2026: không phải thêm một điểm số nữa trên Terminal-Bench, mà là văn xuôi. Cách diễn đạt của công ty là mô hình này viết ít "Claudish" hơn — từ của họ để chỉ giọng điệu rập khuôn, rào đón quá mức, kiểu dài dòng khai đề màClaude Opus 5đã hứng nhiều lời phàn nàn, và màClaude Fable 5.1, GPT-6 AstraGPT-5.6 Solđều đã được đem ra so sánh kể từ đó. Vậy nên câu hỏi đáng để trả lời không phải là liệu bản demo có duyên hay không. Mà là liệu văn xuôi có cải thiện một cách đo lường được hay không, cải thiện bao nhiêu, và còn thất bại ở đâu.

Anthropic nói đã khắc phục những gì

Screenshot of Anthropic's Claude Platform release-notes page, showing the Claude Opus 5.5 entry dated September 22, 2026, with the model ID claude-opus-5-5, a 1M-token context window and 128K maximum output.

Tuyên bố của Anthropic đủ cụ thể để có thể kiểm chứng. Opus 5.5, theo tuyên bố, đặt thông tin quan trọng nhất lên trước, dùng ít thuật ngữ chuyên môn hơn và tuân thủ sát hơn các quy tắc viết mà người dùng đã nêu so với các mô hình Opus trước đó. Tài liệu hỗ trợ do nhà cung cấp báo cáo và chưa được tái lập: các bài kiểm tra kiểm chứng thông tin nội bộ mà Anthropic nói đã đạt 16 trong 18 lần thử, so với 0 trong 18 đối với cả Claude Fable 5.1Claude Opus 5. Các trích dẫn từ khách hàng trong tài liệu ra mắt cũng chỉ về cùng một hướng — John Ruelas của Ramp mô tả kết quả đầu ra "viết như một đồng nghiệp giỏi", Box báo cáo mức độ dài dòng giảm khoảng 40% trên chính khối lượng công việc của mình.

Ở đây có hai điều đáng tách bạch. Thứ nhất, "less Claudish" là một kiểu thất bại có thật, có thể gọi tên được, chứ không phải một phát minh tiếp thị. Những người hành nghề đã phàn nàn về văn phong Claude cô đọng, cấu trúc kém kể từ các thế hệ Opus sau 4.6, và lời phàn nàn rất cụ thể: quá nhiều lời dẫn nhập, quá nhiều lần nhắc lại đề bài, thói quen đi đến ý chính muộn hai đoạn so với lúc người đọc cần. Thứ hai, những con số của chính Anthropic về việc đã khắc phục được nó đúng là như vậy — con số của chính Anthropic. Con số 16/18 không có bản sao độc lập nào, và "40% less verbosity" là đo lường nội bộ của một khách hàng, không phải một phương pháp luận đã công bố.

Bản phát hành còn có một thay đổi ngoài khả năng viết đáng để biết: Opus 5.5 là mô hình Opus đầu tiên được phát hành kèm các biện pháp bảo vệ an ninh mạng, sinh học và phát triển LLM tiên phong tương đương với những biện pháp trên Claude Fable 5.1. Khi một yêu cầu kích hoạt một trong các biện pháp đó, Anthropic cho biết họ sẽ định tuyến yêu cầu đó một cách minh bạch sang một mô hình khác thay vì từ chối thẳng.

Những con số không thuộc về Anthropic.

A single-column readability scoreboard for Claude Opus 5.5: Flesch-Kincaid grade 6.95 versus Opus 5 at 7.97; Reading Ease 68.4 versus 61.35; Fable 5.1 and GPT-6 Astra at 7.43 and 7.52 grade; GPT-5.6 Sol at 8.74 grade and 56.62 ease; ranked 4th of 5 tested as an editor; and an AA Intelligence Index of 58, first of 212 models, with a sourcing footer.

Đánh giá độc lập hữu ích nhất về tuyên bố liên quan đến khả năng viết đến từ Vibe Check của Every, công cụ đã chạy cùng một bộ lệnh trên năm mô hình tiên tiến và chấm điểm kết quả bằng hai công cụ đo độ dễ đọc tiêu chuẩn. Trên bộ lệnh đó, Claude Opus 5.5 nổi lên là mô hình dễ đọc nhất trong nhóm — và khoảng cách so với mô hình mà nó thay thế chính là điểm đáng chú ý:

• Chỉ số cấp lớp Flesch-Kincaid — Claude Opus 5.5 đạt 6,95, so với Claude Opus 5 đạt 7,97

• Độ dễ đọc Flesch — 68,4 đối với Opus 5.5, so với 61,35 đối với Opus 5

• Claude Fable 5.1 — cấp lớp 7.43, Độ dễ đọc 66.09

• GPT-6 Astra — trình độ lớp 7,52, chỉ số Reading Ease 64,55

• GPT-5.6 Sol — cấp độ lớp 8,74, Độ dễ đọc 56,62

Hãy đọc hai thang đo này cùng nhau, vì chúng vận động ngược chiều nhau và đó chính là điểm mấu chốt: cấp lớp thấp hơn và điểm dễ đọc cao hơn đều có nghĩa là văn xuôi đơn giản hơn. Opus 5.5 nằm thấp hơn Opus 5 khoảng trọn một cấp, thấp hơn cả Claude Fable 5.1 và GPT-6 Astra khoảng nửa cấp, và thấp hơn GPT-5.6 Sol gần hai cấp. Nói một cách dễ hiểu, trình độ đọc lớp 7 thay vì lớp 8.

Đó là một sự cải thiện thực sự, nhưng cũng là một sự cải thiện hẹp. Đây là bộ lệnh của một đơn vị truyền thông, không phải một benchmark với danh sách tác vụ cố định và một bảng xếp hạng phía sau. Nó cho bạn biết hướng đi và khoảng chừng độ lớn của bước tiến. Nó không cho bạn biết rằng Opus 5.5 viết tốt trên công việc của bạn, và những ghi chú định tính của chính Every cho thấy rõ rằng người đánh giá cũng không nghĩ vậy.

Nơi nó vẫn chôn vùi điểm mấu chốt

Cùng một bài đánh giá đã tạo ra những con số về khả năng đọc được cũng thẳng thắn nói về lỗi vẫn tồn tại sau khi sửa. Khi được yêu cầu mở đầu một bài luận, Opus 5.5 cần 37 đến 39 câu để bao quát điều mà người đánh giá chỉ cần 21 câu, và dành trọn một đoạn cho một ý mà người đánh giá chỉ diễn đạt trong tám từ. Tóm tắt của người đánh giá là mô hình “vẫn chôn vùi ý chính” — và phiên bản sắc bén hơn của lời phàn nàn là nó có thể chẩn đoán đúng điều mà một đoạn văn cần, rồi tạo ra một bản sửa đổi phớt lờ chính chẩn đoán của mình.

Ở vai trò biên tập viên, nó thể hiện kém hơn so với vai trò người viết. Khi xếp hạng so với các mô hình khác trong các tác vụ biên tập, Opus 5.5 đứng sau Claude Opus 5, GPT-5.6 SolGPT-6 Astra — mô hình này giỏi tạo ra những câu dễ đọc hơn là nhận ra câu nào lẽ ra phải đứng trước. Phán quyết của người đánh giá đọng lại trong một câu đáng để trích dẫn, vì đó là điều hữu ích nhất trong toàn bộ bài đánh giá: "Tôi hài lòng với nó trong vai trò cộng sự hơn là với văn phong mà nó tạo ra."

Hàm ý thực tế rút ra trực tiếp từ đó. Hãy soạn thảo với nó, và soạn ở mức effort cao hoặc cao hơn — các thiết lập effort thấp hơn là nơi tình trạng lan man trở nên tệ nhất. Hãy tự cung cấp ví dụ của bạn thay vì yêu cầu nó bịa ra. Sau đó, tự đưa luận điểm lên đầu, hoặc giao bản nháp cho thứ gì đó sẽ làm điều đó. Điều Opus 5.5 mang lại là con đường nhanh hơn đến một bản nháp đầu tiên sạch sẽ và một cộng sự thực sự tốt hơn cho những lượt chỉnh sửa sau đó. Nó không mang lại cho bạn một biên tập viên.

Cái giá phải trả cho những từ thừa

Screenshot of the Artificial Analysis model page for Claude Opus 5.5, showing an Intelligence Index of 58 ranked first of 212 models, a cost rank of 93 of 212 at $4.00 per million input and $20.00 per million output with a 95% cache discount and $5.98 per Index task, and a verbosity rank of 95 of 212 at 260 million output tokens against a median of 88 million.

Vấn đề dài dòng còn có một khía cạnh chi phí mà hầu hết các bài đánh giá về khả năng viết đều bỏ qua, và nó đi ngược lại câu chuyện ra mắt. Artificial Analysis, đơn vị tự thực hiện đánh giá của riêng mình thay vì dựa vào số liệu của nhà cung cấp, xếp Claude Opus 5.5đứng đầu trong số 212 mô hình trên Intelligence Index của mình với điểm số 58 — nhưng đứng thứ 95 trong số 212 về mức độ dài dòng, khi đã tạo ra 260 triệu token đầu ra trong lần chạy Index đó, so với mức trung vị là 88 triệu. Chi phí để đánh giá là 5,98 USD cho mỗi tác vụ Intelligence Index, và tổng cộng là 8.708,20 USD.

Đặt điều đó bên cạnh tuyên bố về hiệu quả của chính Anthropic thì hai bên rõ ràng không khớp với nhau. Lập trường do nhà cung cấp báo cáo là Opus 5.5 dùng ít token hơn và tạo đầu ra nhanh hơn hơn 30% so với Opus 5. Lần chạy độc lập của Artificial Analysis nhận thấy mô hình này rất dài dòng so với các mô hình cùng loại. Cả hai đều có thể đúng cùng lúc — các hỗn hợp tác vụ khác nhau, thiết lập mức nỗ lực khác nhau, định nghĩa khác nhau về “ít token hơn” — nhưng không ai nên đọc cách diễn đạt khi ra mắt như một sự thật đã được khẳng định về tính tiết kiệm token. Về giá cả thì bức tranh rõ ràng hơn: 4 USD cho mỗi triệu token đầu vào và 20 USD cho mỗi triệu token đầu ra, giảm từ 5/25 USD, với mức chiết khấu cache 95% trong các số liệu của Artificial Analysis.

Nếu bạn đang trả tiền theo từng token đầu ra, văn xuôi dài dòng không phải là sở thích văn phong. Nó chính là một mục chi phí.

Chạy nó đối chiếu với những gì bạn đã có

Một lưu ý về sự trung thực trước phần thực hành: Claude Opus 5.5 không phải là một trong các tuyến của chúng tôi. Chúng tôi không lưu trữ nó, và không có nội dung nào dưới đây nên được hiểu là tuyên bố rằng chúng tôi có. Bạn truy cập nó thông qua API riêng của Anthropic và một số nền tảng bên thứ ba.

Điều hiện có trên OrcaRouter hôm nay là mô hình mà nó đã thay thế và bậc trên của nó. Claude Opus 5 hiện có trên OrcaRouter hôm nay, và Claude Fable 5.1 cũng vậy, cả hai đều ở mức giá niêm yết của nhà cung cấp với mức chênh 0% được chuyển thẳng — nghĩa là thay đổi giá từ nhà cung cấp sẽ đến phía chúng tôi ngay trong ngày, thay vì chờ đến khi nhà bán lại xử lý. Nếu bạn đang cân nhắc liệu văn phong của Opus 5.5 có đáng để chuyển hay không, thì đây là một cặp hữu ích: bạn có thể chạy so sánh trên một khóa mà không cần hợp đồng thứ hai hay thay đổi mã, vì cả hai mô hình đều chỉ cách một API cho 200+ mô hình trên cùng một endpoint.

Lý do khác để giữ một mô hình thứ hai trong vòng lặp là chế độ hỏng mà bài viết này bàn tới. Một mô hình chôn vùi ý chính là mô hình mà bạn muốn có thể định tuyến vòng quanh giữa chừng tác vụ, và chuyển đổi dự phòng tự động tồn tại chính xác để một lần sinh đầu ra tồi không trở thành một pipeline bị đình trệ. Nếu bạn không muốn chọn bất kỳ một mô hình nào cả, DSL định tuyến kết hợp nhiều mô hình vào một lời gọi duy nhất và kết hợp mô hình chạy một nhóm mô hình cùng trả lời — một dạng hợp lý cho công việc biên tập, nơi thất bại nằm ở phán đoán chứ không phải năng lực.

Ai nên hành động, và ai nên chờ đợi

Nếu lời phàn nàn của bạn về Claude Opus 5 là bạn phải viết lại phần mở đầu của nó, thì Opus 5.5 thực sự khắc phục được khoảng một bậc trình độ đọc của vấn đề đó, và dữ liệu về độ dễ đọc cho thấy mức cải thiện này có thể đo lường được chứ không phải chỉ là cảm tính. Nếu lời phàn nàn của bạn là nó phải mất ba đoạn mới vào được trọng tâm, thì không có gì trong bằng chứng độc lập cho thấy điều đó đã thay đổi. Đó là những lời phàn nàn khác nhau, và các bài đưa tin về ra mắt đã coi chúng là một.

Đối với công việc sáng tạo cụ thể, câu chuyện dưa hấu không phải là bằng chứng cho bất cứ điều gì, ngoại trừ việc người ta thường tìm đến những câu lệnh nhỏ nhặt, ấm áp, ít hệ trọng khi muốn thăm dò một mô hình mới. Đó là một việc hợp lý để làm. Đó cũng chính là bối cảnh mà khuynh hướng chôn vùi ý chính ít lộ ra nhất, bởi vì chẳng ai đọc một câu chuyện dưa hấu để tìm luận điểm. Hãy đặt mô hình trước một tài liệu mà người đọc cần kết luận ngay trong hai câu đầu tiên, và bạn sẽ phát hiện ra mình thực sự mắc vấn đề nào trong hai vấn đề đó.

Điều cần theo dõi tiếp theo là liệu mô hình kế tiếp trong dòng — Sonnet 5.5 và Haiku 5.5 đều dự kiến ra mắt trong vài tuần tới — có kế thừa mức cải thiện về khả năng đọc hiểu hay không, và liệu có ai công bố một con số về khả năng đọc hiểu cho việc chỉnh sửa thay vì soạn thảo hay không. Con số về soạn thảo là con số dễ. Con số về chỉnh sửa là chỗ Opus 5.5 vẫn xếp sau ba đối thủ cạnh tranh.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày