Thẻ hero Claude Opus 5.5 rò rỉ mang tiêu đề 'Claude Opus 5.5: một vụ rò rỉ, được dán nhãn', với dòng 'Checkpoint được cho là có tên claude-wafer-eap — chưa phát hành, chưa xác nhận, chỉ một nguồn tin' và ba thẻ được dán nhãn: Được cho là — phiên bản 5.5, phát hành sớm nhất vào Thứ Ba ngày 22 tháng 9; Đã xác minh — Opus 5.2 được phục vụ dưới nhãn Opus 5, ngày 14–17 tháng 9; Chưa xác nhận — tên mã và tên người rò rỉ: không có nguồn thứ hai
Guides & Insights

Rò rỉ Claude Opus 5.5: Một checkpoint tên là "claude-wafer-eap" và tin đồn phát hành vào thứ Ba

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tuyên bố đang lan truyền trong cuối tuần này đủ cụ thể để có thể kiểm chứng, và cũng đủ mỏng manh để sụp đổ ngay khi bị kiểm tra: một checkpoint mới cho bản cập nhật Opus tiếp theo, hiện được dán nhãn Claude Opus 5.5, được cho là đã nằm trong tay, với mật danh nội bộ — "claude-wafer-eap" — và một bản phát hành có thể ra mắt sớm nhất là thứ Ba, ngày 22 tháng 9. Nguồn tin là tài khoản X @kimmonismus, thuật lại lời của một người rò rỉ tên Lyra. Không có model card, không có mã định danh API, không có bảng giá, không có benchmark, và không có nguồn thứ hai nào đưa tin về cùng chuỗi checkpoint đó. Điều thực sự có, bên dưới tuyên bố ấy, là một sự kiện có thật và được ghi nhận đầy đủ: Claude Opus 5.2, bản dựng Opus chưa phát hành từng được phục vụ cho một phần lưu lượng dưới nhãn "Opus 5" không đổi suốt đến giữa tháng 9, và đã bị nhà cung cấp tạm cắt vào đêm ngày 17 tháng 9. Điều đó thì được nhiều nguồn xác nhận. Mọi thứ phía trên đó chỉ là lời của một tài khoản. Và còn có điều thứ ba đáng để ý, đó là những gì vụ rò rỉ này làm với chính số phiên bản: Claude Opus 5 đã ra mắt ngày 24 tháng 7 với giá $5.00/$25.00 mỗi triệu token và vẫn là mẫu Opus cao cấp nhất hiện có sẵn rộng rãi của nhà cung cấp; Claude Fable 5.1 đã đến vào ngày 1 tháng 9. Nếu Opus tiếp theo thực sự là 5.5, thì cách đặt tên đã nhảy qua cả 5.3 và 5.4 — và con số này đang đóng vai trò lớn hơn trong câu chuyện này so với bất kỳ benchmark nào.

Rò rỉ thực sự khẳng định điều gì

Bóc lớp đóng gói ra thì có bốn khẳng định. Thứ nhất, rằng tồn tại một checkpoint — một mô hình đã được huấn luyện, lưu lại và đang được chuẩn bị ở đâu đó. Thứ hai, rằng số phiên bản của nó là 5.5, không phải 5.2 hay 5.3. Thứ ba, rằng nó mang một tên mã, "claude-wafer-eap", với "eap" được hiểu là chương trình truy cập sớm theo cách viết tắt thông thường của nhà cung cấp. Thứ tư, rằng bản phát hành sắp diễn ra, có thể là thứ Ba.

Mỗi điều trong số đó là một loại tuyên bố khác nhau, và chúng không được ủng hộ một cách ngang bằng. Điều thứ tư là điều có bằng chứng bên ngoài đằng sau, và bằng chứng đó chỉ vào một ngày, chứ không phải một mật danh. Các thị trường dự đoán về bản phát hành Claude Opus tiếp theo đã mở vào ngày 16 tháng 9 và đã tập trung phần lớn xác suất ngụ ý của chúng trong khoảng từ ngày 21 đến 24 tháng 9, với một phần đáng kể khối lượng vẫn ủng hộ "không có bản phát hành nào tính đến ngày 30 tháng 9." Các quy tắc giải quyết của thị trường rất hẹp: mô hình phải có thể truy cập công khai, và nó phải được đặt tên rõ ràng là Opus. Các bản phát hành Fable, Mythos, Sonnet và Haiku không được tính. "Claude Opus 5.5" xuất hiện trong danh sách tên đủ điều kiện của chính thị trường đó — đó là nơi chuỗi này rất có khả năng đã đi vào lưu hành, và đó là một danh sách các khả năng, chứ không phải một báo cáo về một lần bắt gặp.

Mật danh là mắt xích yếu nhất. "claude-wafer-eap" xuất hiện trong văn bản tín hiệu và, theo những gì chúng tôi có thể xác định, không xuất hiện ở nơi nào khác: không có tham chiếu kho mã, không có API slug, không có rò rỉ cấu hình, không có lời kể xác nhận nào. Mật danh đúng là kiểu chi tiết lan truyền vì nghe có vẻ có thể kiểm chứng được. Hãy coi cái này là chưa được xác minh cho đến khi một nguồn thứ hai, độc lập đưa ra cùng chuỗi ký tự đó. Điều tương tự cũng áp dụng cho quy kết "Lyra" — một danh tính người rò rỉ không có thành tích nào để chúng ta đối chiếu.

Điều gì thực sự được xác minh

Mốc cơ sở đã được xác minh là Claude Opus 5, và nó được ghi chép tài liệu đầy đủ một cách bất thường, chính điều đó khiến nó hữu ích như một thước đo chuẩn. Anthropic phát hành nó vào ngày 24 tháng 7 năm 2026 — không có 5.1 xen giữa — với cửa sổ ngữ cảnh 1M token, tối đa 128K token đầu ra (300K thông qua beta header trên Batch API), adaptive thinking được bật theo mặc định, và năm mức nỗ lực suy luận từ low đến max. Giá được giữ cố định ở mức $5.00 mỗi triệu token đầu vào và $25.00 mỗi triệu token đầu ra ở mọi độ dài prompt, giống như Opus 4.8 trước đó, với Batch API chỉ bằng một nửa mức đó. Artificial Analysis xếp nó ở vị trí đầu bảng Intelligence Index của mình, với điểm số chính xác phụ thuộc vào biến thể nỗ lực mà bạn xem — một chi tiết đáng để ghi nhớ, vì bảng điểm "5.5" sẽ không thể so sánh với bảng điểm "5" trừ khi cài đặt nỗ lực khớp nhau.

Artificial Analysis model page for Claude Opus 5 (Adaptive Reasoning, Max Effort), showing 7th of 200 on the Intelligence Index, released July 2026, $5.00 input and $25.00 output per million tokens with a 90% cache discount, and a 1M token context window

Thêm vào đó là sự kiện tháng 9 đã được kiểm chứng. Từ khoảng ngày 14 đến 15 tháng 9, các nhà phát triển báo cáo rằng một tỷ lệ nhỏ, mang tính xác suất, trong số các yêu cầu danh nghĩa được gửi tới Opus 5 đang được trả lời bởi một mô hình backend khác, với metadata của yêu cầu trỏ tới một bản chưa phát hành claude-opus-5.2 — một số phiên bản bỏ qua hoàn toàn 5.1. Các hành vi được báo cáo bao gồm đầu ra ngắn gọn hơn và tự lặp đi lặp lại không cần nhắc: viết mã, chạy kiểm thử, sửa các lỗi thất bại, lặp lại cho đến khi kiểm thử đạt, thay vì dừng lại khi còn dang dở. Mẹo phát hiện được lan truyền cùng với nó — hỏi mô hình một câu hỏi cụ thể về một người mà nó không nên biết, với tính năng tìm kiếm và bộ nhớ đã bị tắt — là một cách để biết backend nào đã trả lời. Vào đêm ngày 17 tháng 9, Anthropic đã cắt kênh này mà không báo trước, một sự kiện mà cộng đồng nhà phát triển gọi là "cú sốc nửa đêm"; kênh này quay trở lại khoảng một ngày sau đó và, theo những báo cáo ấy, đã mở rộng từ Claude Code sang các bề mặt chat và cowork. Không có model card, không có bảng giá, không có định danh API, và không có tuyên bố chính thức nào đi kèm với bất kỳ điều gì trong số đó.

Số phiên bản chính là câu chuyện

Phần mà vụ rò rỉ nắm đúng về mặt cấu trúc, ngay cả khi mọi chi tiết cụ thể đều sai, là thế này. Anthropic đã chứng minh, hai lần trong năm nay, rằng họ sẽ lặp lại dòng Opus mà không cần một sự kiện ra mắt — 4.8 vào cuối tháng 5, 5 vào ngày 24 tháng 7 với 5.1 bị bỏ qua, rồi một 5.2 tồn tại trong môi trường production mà không tồn tại công khai. Một công ty phát hành thông qua định tuyến backend và kiểm soát tỷ lệ triển khai cũng có thể quyết định, vào phút chót, con số nào sẽ in trên hộp. Nếu Opus tiếp theo được công bố là 5.5 thay vì 5.2, thì đó là một quyết định marketing được đưa ra sau công việc kỹ thuật, và đó là kiểu quyết định mà người rò rỉ nghe được muộn và thiếu chính xác.

Điều đó có hai mặt đối với bất kỳ ai đọc thông tin này. Một số phiên bản bị rò rỉ là bằng chứng yếu về năng lực và bằng chứng mạnh về định vị. Nếu con số thực sự là 5.5, nó hàm ý một bước tiến lớn hơn so với mức 5.2 — và nó hàm ý Anthropic muốn thị trường hiểu theo cách đó, trước một IPO mà công ty được cho là đã đẩy về phía tháng 11. Reuters đưa tin ngày 18 tháng 9, trích dẫn ba nguồn, rằng Anthropic đang cân nhắc có nên tung ra một mô hình mới đặc biệt để đối phó với đà tăng trưởng trong mảng doanh nghiệp của GPT-6 Astra, trong khi tổng giám đốc điều hành của công ty công khai kêu gọi ngành hãy chậm lại. Một con số lớn hơn trên cùng một checkpoint chẳng tốn gì mà lại mua được một tiêu đề. Đó không phải là lý do để không tin vào vụ rò rỉ; đó là lý do để không đưa con số đó vào quyết định như một yếu tố định giá.

Điều gì sẽ phải đúng vào thứ Ba

Một bản phát hành vào ngày 22 tháng 9 sẽ có thể kiểm chứng trong khoảng năm phút, và đáng để nêu tên các bước kiểm tra ngay bây giờ để thông báo — nếu nó đến — có thể được đọc thay vì chỉ được tiếp nhận một cách thụ động.

• Tính khả dụng — một thẻ mô hình công khai, một mã định danh mô hình API trả về completion, hoặc một danh sách chờ mở dạng cuốn chiếu. Bản beta kín không đủ điều kiện, và các thị trường dự đoán thường phân xử theo hướng phủ định điều đó. Đây là ranh giới phân biệt "đã phát hành" với "đã được thử nghiệm trên một số tài khoản."

• Giá cả — liệu Opus mới có giữ nguyên bậc $5.00/$25.00, thay đổi bậc đó, hay ra mắt với mức giá khuyến mãi. Opus 5 đã giữ nguyên chính xác mức giá của Opus 4.8, đó là kiểu mẫu đáng để kỳ vọng và do đó là điều cần kiểm tra.

• Ngữ cảnh và giới hạn đầu ra — ngữ cảnh 1M và đầu ra 128K của Opus 5 (300K trên Batch) hiện là mức sàn. Một Opus mới ra mắt với thông số thấp hơn sẽ là một bước thụt lùi được ngụy trang thành một màn ra mắt.

• Đánh giá độc lập — một mục của Artificial Analysis ở mức độ nỗ lực đã nêu, chứ không phải biểu đồ của nhà cung cấp. Mọi tuyên bố về năng lực trong thông tin rò rỉ hiện đều chưa được tái lập, và chỉ một thẻ mô hình sẽ không thay đổi được điều đó.

• Hành vi định tuyến — liệu hành vi ngắn gọn, tự lặp lại được báo cáo trong các ghi nhận gray-test vẫn còn tồn tại trong bản dựng công khai, hay đó chỉ là một sản phẩm phụ của quá trình kiểm thử. Thay đổi hành vi đó là điều cụ thể nhất mà các nhà phát triển thực sự quan sát được, và cũng là thứ dễ bị âm thầm loại bỏ trước khi phát hành nhất.

A two-column scoreboard for the Claude Opus 5.5 leak: left column 'Claude Opus 5.5 (reported)' lists status unreleased single source, codename claude-wafer-eap unconfirmed, version number reportedly 5.5, reported release as early as Tue Sep 22, no published pricing, and no independent benchmarks; right column 'Claude Opus 5 (verified)' lists generally available since Jul 24, codename n/a, version number 5, shipped Jul 24 2026, $5.00 / $25.00 per million, and top of the Artificial Analysis Index

Thử dùng một Claude chưa được kiểm chứng mà không đặt cược lộ trình production vào nó

Khoảng trống khó xử trong một tuần như tuần này là mô hình mà ai cũng muốn đánh giá lại chính là mô hình mà không ai gọi được. Thứ bạn có thể gọi hôm nay là Claude Opus 5 — và nếu một bản 5.5 xuất hiện, câu hỏi thực tế sẽ là làm sao hướng một phần lưu lượng thật vào nó mà không phải viết lại tích hợp của bạn hoặc đặt một đường dẫn then chốt vào một mô hình không có đánh giá chuẩn độc lập.

Đó chính là trường hợp mà định tuyến được sinh ra để xử lý. OrcaRouter đưa toàn bộ đội hình Claude hiện hành vào sau một khóa API duy nhất với đúng giá niêm yết của nhà cung cấp, mức phụ trội 0% — Claude Opus 5 ở đúng mức $5.00/$25.00 của Anthropic, y hệt những con số mà nhà cung cấp công bố, nên khi nhà cung cấp đổi giá thì phía chúng tôi cập nhật ngay trong cùng ngày chứ không phải sau một lần đồng bộ. Khi một bản Opus mới thực sự ra mắt, nó chỉ là thêm một tuyến chứ không phải một hợp đồng thứ hai: bạn có thể dồn một tỷ lệ phần trăm lưu lượng vào nó, giữ chuyển đổi dự phòng tự động hướng vào một mô hình mà bạn đã nắm rõ đặc tính, và so sánh kết quả đầu ra trên chính các prompt của bạn thay vì trên một bộ đánh giá bị rò rỉ. Việc tổ hợp một lượt gọi xuyên qua nhiều mô hình — bản nháp từ mô hình này, một lượt kiểm chứng từ mô hình khác — chỉ là một dòng routing-DSL chứ không phải một dịch vụ mới.

OrcaRouter model page for anthropic/claude-opus-5, showing Claude Opus 5 by Anthropic dated 2026-07-24 with a 1M token context window, 128K max output, input $5.00 and output $25.00 per million tokens, p50 time to first token 9.49 seconds, and 975.4M tokens of traffic in seven days

Để nói rõ về những gì chúng tôi không khẳng định: không có Claude Opus 5.5 trên OrcaRouter, bởi vì không có Claude Opus 5.5 để định tuyến. Chúng tôi sẽ không có nó cho đến khi Anthropic phát hành một phiên bản như vậy, và bài viết này không phải là bản xem trước của một trang sản phẩm. Mọi điều trong bài viết này về 5.5 đều là báo cáo lại của một báo cáo.

Những gì cần chú ý và những gì cần bỏ qua

Hãy để ý mã định danh mô hình. Một slug API hoạt động được chính là sự khác biệt giữa một màn ra mắt và một tin đồn, và đó là thứ duy nhất mà một vụ rò rỉ không thể giả mạo được lâu. Hãy để ý bảng giá, vì đó là nơi Anthropic cho bạn biết họ nghĩ mô hình thuộc hạng nào. Hãy để ý liệu định tuyến gray-test có hoạt động trở lại trước một thông báo hay không — một kênh được nới rộng trở lại là tín hiệu mạnh hơn nhiều so với một tweet, và đợt cắt-rồi-khôi-phục ngày 17 tháng 9 đã cho thấy kênh đó trông như thế nào từ bên ngoài.

Tạm thời hãy bỏ qua mật danh. "claude-wafer-eap" là một chuỗi chỉ đến từ một nguồn duy nhất và không có gì xác nhận, và điều tương tự cũng đúng với quy kết "Lyra" đằng sau nó. Hãy bỏ qua số phiên bản như bằng chứng cho bất cứ điều gì, ngoại trừ định vị. Và hãy bỏ qua mọi bảng điểm xuất hiện trong 48 giờ đầu tiên so sánh một Opus 5 công khai với một 5.5 mà chưa ai chạy độc lập — kể cả của chúng ta, nếu chúng ta có xây dựng một cái, cho đến khi có thứ gì đó thực sự ở cả hai phía của phép so sánh.

Nếu thứ Ba trôi qua mà không có bản phát hành, rò rỉ không vì thế mà bị bác bỏ; sự kiện Opus 5.2 hồi tháng Chín tự nó là một trường hợp một mô hình đã tồn tại trong môi trường vận hành nhiều ngày trước khi bất cứ ai có thể gọi tên nó. Vị thế trung thực cho đến lúc đó là vị thế mà bằng chứng ủng hộ: một bản dựng Opus thực sự chưa phát hành đã được cung cấp âm thầm cách đây một tuần, một khung thời gian phát hành thực sự đã được thị trường định giá cho tuần này, và một tài khoản đã gắn vào đó một con số, một mật danh và một ngày mà không ai khác xác nhận.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày