
Rò rỉ "Kettle" của Claude Fable 5: ID mô hình nội bộ ẩn trong Signed Thinking — Những gì chúng ta biết cho đến nay
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B Uncensored (Aggressive)2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
Vào lúc 11:29:45 tối ngày 16 tháng 8 (giờ PDT), một nhà nghiên cứu trên X đã đăng tuyên bố biến một góc kém hấp dẫn của API Anthropic thành câu chuyện “những gì chúng ta biết cho đến nay”: họ nói rằng nếu giải mã “chữ ký” do máy chủ ký gắn trên mọi khối suy nghĩ của Claude, trường thứ sáu sẽ nêu tên mô hình thực sự đã trả lời bạn. Theo cách nhìn của họ, các phản hồi được công khai gán nhãn claude-fable-5 — Claude Fable 5 lớp Mythos mà Anthropic đã phát hành rộng rãi kể từ ngày 9 tháng 6 năm 2026, với giá 10/50 đô la mỗi triệu token — bắt đầu mang một mã định danh nội bộ không xuất hiện ở bất kỳ đâu trong tài liệu công khai của Anthropic: claude-kettle-e2c95a10-v2-prod. Nhãn phản hồi không thay đổi gì. Việc thanh toán, trường mô hình cấp cao nhất của API, hay cam kết bản chụp cố định của Anthropic cũng không được chứng minh là thay đổi. Điều thay đổi là một chuỗi được giấu trong một trường mà tài liệu minh bạch khuyên các nhà phát triển không nên phân tích.
Đây là một báo cáo rò rỉ, không phải một phán quyết. Phát hiện này đã được bốn ngày, nó dựa trên bản giải mã của một nhà nghiên cứu duy nhất chưa được tái lập độc lập, và Anthropic vẫn chưa lên tiếng về việc "Kettle" — hay nhãn đi kèm MYCRO_MODEL_MANATEE — ám chỉ điều gì. Câu hỏi hữu ích không phải là "Anthropic có hoán đổi Fable 5 không?" Bằng chứng không xác lập điều đó. Câu hỏi hữu ích là: nếu một ID mô hình nội bộ xuất hiện dưới một ID mô hình công khai thì điều đó sẽ có ý nghĩa gì nếu nó là thật, và điều gì nó sẽ không có ý nghĩa. Đây là những gì chúng ta biết cho đến nay.
Những gì vụ rò rỉ thực sự phát hiện ra
Tín hiệu là một bài đăng X duy nhất từ @chetaslua (status 2089783170896179632, đăng ngày 16 tháng 8 năm 2026), được viết theo phong cách "bằng chứng đầu tiên" quen thuộc của tài khoản. Tóm lại, tuyên bố là:
Các khối suy nghĩ của Claude chứa một protobuf được ký bởi máy chủ trong trường chữ ký.
Theo nhà nghiên cứu, trường thứ sáu của protobuf đó chứa định danh của mô hình thực sự đã tạo ra phản hồi.
• Bắt đầu lúc 11:29:45 đêm theo giờ PDT ngày 16 tháng 8, 2.582 trong số 2.582 chữ ký được lấy mẫu mang cùng một giá trị: claude-kettle-e2c95a10-v2-prod.
• Một nhãn nội bộ thứ hai, MYCRO_MODEL_MANATEE, cũng xuất hiện trong cùng siêu dữ liệu.
Con số "2,582 of 2,582" đang làm công việc tu từ: nó là bằng chứng của nhà nghiên cứu rằng đây không phải là một sự kiện xảy ra một lần hay một lát cắt thử nghiệm A/B, mà là một sự chuyển đổi toàn bộ của bất cứ thứ gì mà mã định danh trỏ tới. Điều mà bài đăng không đề cập là phương pháp đằng sau việc giải mã — không có chữ ký thô, không có tập lệnh giải mã, không có lược đồ protobuf suy luận, không có siêu dữ liệu phản hồi đầy đủ. Bằng chứng công khai chỉ là một biểu đồ tóm tắt. Điều đó khiến phát hiện này vừa hợp lý vừa hiện chưa thể kiểm chứng.

Tại sao chữ ký lại có cả 'field six'?
Mọi khối suy luận (thinking block) mà Claude trả về đều mang một trường chữ ký (signature field). Theo tài liệu về tính năng suy luận (thinking) của Anthropic, chữ ký đó là "một bản sao được mã hóa của toàn bộ quá trình lập luận" mà bạn cần truyền lại nguyên vẹn trong các cuộc hội thoại nhiều lượt và có sử dụng công cụ; API dùng nó "để xác minh rằng các khối suy luận được tạo ra bởi Claude." Trên Claude Fable 5, hành vi mặc định khiến chữ ký trở thành dấu vết duy nhất có thể thấy được: khi display được đặt thành "omitted" — mặc định trên Fable 5, Mythos 5, Opus 5 và Sonnet 5 — khối suy luận trả về với trường thinking trống và chỉ có chữ ký được điền.
Tài liệu sau đó bổ sung một câu quan trọng đối với bất kỳ rò rỉ nào dựa trên trường này: "Trường chữ ký không minh bạch: đừng diễn giải hay phân tích nó." Việc phân tích nó chính là điều mà tuyên bố Kettle làm. Điều đó không phải là bằng chứng cho thấy tuyên bố sai — chữ ký phải có thể đọc được bằng máy đối với ngăn xếp phục vụ của chính Anthropic — nhưng điều đó có nghĩa là việc giải mã được thực hiện trái với chỉ dẫn rõ ràng của nhà cung cấp, trên một giao thức chưa được tài liệu hóa, và sự tái dựng giao thức đó của nhà nghiên cứu chưa được công bố. Mọi suy luận dựa trên câu "trường thứ sáu chỉ mô hình đang được phục vụ" đều mang theo sự không chắc chắn đó.
Điều nó không chứng minh được
Hãy bắt đầu từ điều bằng chứng thực sự cho thấy: một phản hồi được gắn nhãn công khai là claude-fable-5 mang một mã định danh nội bộ chưa từng được báo cáo trước đây. Toàn bộ sự việc chỉ có vậy. Riêng mã định danh không đủ để xác lập rằng Anthropic đã thay thế trọng số của Fable 5, rằng một phiên bản kế nhiệm mạnh hơn tồn tại, rằng các phản hồi trở nên tốt hơn hay tệ hơn, hoặc rằng bất kỳ yêu cầu nào đã được định tuyến đến một mô hình nhỏ hơn. "Kettle" có thể là tên triển khai phục vụ nội bộ cho chính cùng một bản chụp Fable 5; nó có thể là tên của một thành phần bộ định tuyến; nó có thể là một bộ phân loại trong ngăn xếp an toàn. Mật danh không thể phân biệt được giữa những khả năng đó.
Chính sách phiên bản hóa của chính Anthropic giải thích vì sao vụ rò rỉ phù hợp với việc không có gì thay đổi. Từ tài liệu "Model IDs and versioning", hai tuyên bố nằm cạnh nhau:
Anthropic không cập nhật trọng số hoặc cấu hình của một ID mô hình hiện có. Khi có phiên bản cập nhật, nó sẽ được phát hành dưới một ID mô hình mới.
Trọng số mô hình được cố định cho một ID nhất định, nhưng cơ sở hạ tầng phục vụ xung quanh mô hình có thể thay đổi theo thời gian. Cơ sở hạ tầng này bao gồm các thành phần như bộ định tuyến yêu cầu, bộ phân loại an toàn và logic lấy mẫu.

Câu thứ hai đó chính là toàn bộ khoảng cách về mặt khái niệm giữa "Kettle là một vụ bê bối" và "Kettle là một thứ Hai bình thường." Tài liệu thậm chí còn lường trước sự trôi dạt hành vi: "Thỉnh thoảng, các bản cập nhật hạ tầng tạo ra những khác biệt nhỏ trong hành vi quan sát được ngay cả khi ID mô hình và trọng số không thay đổi." Một bộ định tuyến hoặc bản triển khai phục vụ mới tên là Kettle sẽ khớp chính xác với câu đó. Để vụ rò rỉ thực sự gây bất lợi, nó cần phải cho thấy hoặc là một mô hình mới đứng sau ID bất chấp chính sách, hoặc một cơ chế vi phạm các quy tắc hiển thị bên dưới.
Định tuyến dự phòng được ghi lại mà Fable 5 đã có
Claude Fable 5 đã được trang bị sẵn cơ chế chuyển đổi mô hình có thật, được ghi chép rõ ràng và được thiết kế để hiển thị công khai. Bộ phân loại an toàn kiểm tra các yêu cầu và có thể định tuyến một tập hợp con — Anthropic đề cập đến an ninh mạng tấn công, sinh học lưỡng dụng, chưng cất mô hình và một số công việc phát triển chip tiên tiến — đến một mô hình Claude Opus 5. Trên các nền tảng người tiêu dùng, cơ chế dự phòng được dự kiến là phải hiển thị rõ ràng: một thông báo, tên của mô hình phục vụ trên câu trả lời, và bộ chọn mô hình chuyển sang Opus. Trong API, phản hồi hiển thị mô hình phục vụ thông qua trường model cấp cao nhất và một khối nội dung dự phòng chuyên dụng.
Tuyên bố Kettle mô tả một điều gì đó khác biệt, và sự khác biệt chính là phần quan trọng: một định danh nội bộ xuất hiện dưới một phản hồi vẫn giữ nhãn công khai Fable 5. Bài đăng của nhà nghiên cứu không cho thấy một thông báo dự phòng, một trường model API bị thay đổi, hay một khối dự phòng — nếu có, câu chuyện sẽ là "cơ chế dự phòng được ghi nhận đã kích hoạt", chứ không phải "Anthropic đang âm thầm định tuyến." Nếu không có điều đó, vụ rò rỉ chưa cho thấy bất kỳ cam kết minh bạch nào bị vi phạm, vì nó chưa cho thấy Kettle là gì.
Tại sao điều này vẫn quan trọng ngay cả khi không có gì thay đổi
Các ID mô hình được ghim là một cơ chế tin cậy. Tài liệu của Anthropic cam kết rằng "khi bạn sử dụng một ID mô hình trong một yêu cầu API, mô hình nền tảng vẫn không đổi trong suốt thời gian tồn tại của ID đó" — chính là lý do mà một nhóm có thể chạy benchmark đối với claude-fable-5 và mong đợi kết quả có ý nghĩa vào quý sau. Một mã định danh ẩn nằm dưới ID đó, dù là gì, là lời nhắc rằng sự đảm bảo chỉ bao gồm trọng số và cấu hình, chứ không phải toàn bộ đường đi từ yêu cầu đến token. Nếu một mô hình thực sự khác từng chạy dưới một ID công khai mà không được tiết lộ, mọi đánh giá, mọi dự báo chi phí và mọi bài kiểm tra hồi quy chất lượng gắn với ID đó sẽ âm thầm trở nên vô hiệu.
Góc độ thanh toán làm rõ vấn đề. Claude Fable 5 có giá 10 đô la cho mỗi triệu token đầu vào và 50 đô la cho mỗi triệu token đầu ra — mức giá công bố cao nhất của Anthropic. Nếu mô hình phục vụ từng khác với ID bị tính phí, câu hỏi đặt ra là mức giá nào được áp dụng và ai là người quyết định. Vụ rò rỉ không đưa ra bằng chứng nào cho thấy điều đó xảy ra; vấn đề chỉ là trường chữ ký là nơi đầu tiên bạn tìm kiếm dấu hiệu của nó.
Thời điểm cũng đáng chú ý. Đây là tín hiệu thứ ba từ Anthropic trong chín ngày: vào ngày 7 tháng 8, công ty thông báo đã đào tạo lại bộ phân loại sinh học của Fable 5, cắt giảm khoảng 85% các phản hồi dự phòng liên quan đến sinh học trong thử nghiệm nội bộ; vào ngày 14 tháng 8, Báo cáo Rủi ro theo Chính sách Mở rộng Có trách nhiệm của công ty đã thừa nhận một "Model 2" nội bộ chưa được phát hành mà Anthropic gọi là "một cải tiến đáng chú ý" so với Claude Mythos 5 và không có kế hoạch phát hành. Cả hai đều là tuyên bố từ phía nhà cung cấp, nhưng cùng với nhau, chúng cho thấy Anthropic đang chủ động thay đổi các hệ thống xung quanh Claude Fable 5 — bộ phân loại vào ngày 7, một bản kế nhiệm nội bộ được thừa nhận vào ngày 14 — trong khi vẫn giữ nguyên ID claude-fable-5. Kettle sẽ là một câu chuyện cùng khuôn dạng, chỉ là không có phần công bố.
Nên làm gì về việc đó
Đối với người gọi API, lập trường thực dụng nghe buồn tẻ nhưng đúng đắn: một định danh không phải là bằng chứng của việc hoán đổi, và vụ rò rỉ chưa có gì để hành động. Điều bạn có thể làm là tự tạo bằng chứng cho riêng mình. Ghi log trường model ở cấp cao nhất và mọi khối fallback trên các phản hồi bạn thực sự nhận được, đồng thời theo dõi chênh lệch token và chi phí trên một khối lượng công việc cố định. Nếu một fallback được ghi nhận trong tài liệu kích hoạt, nó sẽ hiện rõ ở chính những nơi đó. Đó là bài kiểm tra duy nhất có ý nghĩa với khối lượng công việc của bạn, và nó không phụ thuộc vào việc bất kỳ ai giải mã định dạng chữ ký của Anthropic.
Nếu bạn định tuyến đến Claude Fable 5 qua OrcaRouter, cấu trúc phản hồi nhận về giống hệt những gì Anthropic trả về, và vì chúng tôi truyền giá niêm yết của nhà cung cấp qua mà không cộng thêm phí, nên không có bộ giá thứ hai nào cần đối chiếu — nếu Anthropic có thay đổi mức giá của Fable 5, con số mới sẽ được áp dụng phía chúng tôi ngay trong ngày. Với một tình huống chưa được xác minh như thế này, cách ít rủi ro để tiếp tục sử dụng mô hình mà không đặt cược một luồng production vào tin đồn là định tuyến một phần lưu lượng thực đến Claude Fable 5 với cơ chế tự động chuyển sang một phương án dự phòng đã được kiểm chứng — Claude Opus 5 với giá $5/$25 cho mỗi triệu token, hoặc một mô hình phân khúc lập trình rẻ hơn — để sự suy giảm chất lượng trở thành một quyết định định tuyến thay vì một sự cố. Cùng một khóa, không cần hợp đồng thứ hai, và việc chuyển dự phòng chỉ là một thay đổi routing-DSL thay vì phải viết lại toàn bộ.

Những gì chúng tôi đang xem
• Liệu Anthropic có lên tiếng hay không. Giải pháp rõ ràng nhất là một câu thừa nhận ngắn gọn về việc Kettle và Manatee là gì. Bản thân sự im lặng cũng đã là một thông tin.
• Một sự tái hiện độc lập. Việc ai đó công bố các chữ ký thô, phương pháp giải mã và schema protobuf suy ra sẽ đưa điều này từ hình ảnh của một người thành một tuyên bố có thể kiểm chứng. Cho đến lúc đó, đây chỉ là những gì chúng ta biết cho tới nay, chứ không phải một phát hiện.
• Bề mặt hiển thị. Nếu các phản hồi của claude-fable-5 bắt đầu hiển thị thông báo dự phòng, một trường mô hình API bị thay đổi, hoặc các khối dự phòng, cách hiểu "dự phòng được ghi chép" sẽ mạnh hơn; nếu không, cách hiểu "đường dẫn không được ghi chép" sẽ mạnh hơn.
• Một ID mô hình mới. Chính sách quản lý phiên bản của Anthropic nói rằng một phiên bản thực sự mới sẽ được phát hành dưới một ID mới. Do đó, cách xác nhận rõ ràng nhất rằng Kettle là bản kế thừa thực sự sẽ là việc Anthropic phát hành một thứ gì đó — chứ không phải định tuyến tại chỗ. Hãy để ý đến claude-fable-5.1 hoặc tương tự.
• Liệu "Manatee" có được giải thích hay không. Nhãn thứ hai là một sợi dây chưa ai kéo.
Câu hỏi thường gặp
Anthropic có thực sự đang định tuyến Claude Fable 5 đến một mô hình khác không?
Chưa được chứng minh. Rò rỉ cho thấy các phản hồi được gắn nhãn claude-fable-5 mang một mã định danh nội bộ, claude-kettle-e2c95a10-v2-prod, trong chữ ký suy luận đã ký. Điều đó không cho thấy trọng số đã thay đổi, một phiên bản kế nhiệm đã được triển khai, hay bất kỳ yêu cầu nào bị hạ cấp. "Kettle" cũng có thể chỉ là tên của một hệ thống phục vụ nội bộ cho cùng một bản chụp Fable 5.
Mã định danh Kettle được tìm thấy như thế nào?
Nhà nghiên cứu @chetaslua cho biết họ đã giải mã một protobuf bên trong trường chữ ký của các khối suy nghĩ của Claude và đọc được mã định danh mô hình từ trường thứ sáu. Tài liệu của Anthropic gọi chữ ký này là "opaque" và khuyên các nhà phát triển không nên phân tích nó, đồng thời phương pháp giải mã của nhà nghiên cứu chưa được công bố, vì vậy tuyên bố này vẫn chưa thể được tái lập độc lập.
Điều này có vi phạm cam kết về mô hình cố định (pinned-model) của Anthropic không?
Không rõ. Tài liệu về phiên bản của Anthropic nói rằng họ không bao giờ cập nhật trọng số hoặc cấu hình của một ID mô hình hiện có và các phiên bản mới được phát hành dưới một ID mới — nhưng họ cho phép một cách rõ ràng rằng cơ sở hạ tầng phục vụ xung quanh một mô hình (bộ định tuyến yêu cầu, bộ phân loại an toàn, logic lấy mẫu) có thể thay đổi. Một định danh Kettle có thể chính là loại thay đổi đó, điều này sẽ không vi phạm cam kết.
Làm sao tôi biết được nếu mô hình phục vụ tôi đã thay đổi?
Theo dõi trường model ở cấp cao nhất trong các phản hồi API, tìm kiếm các khối nội dung dự phòng (fallback), và theo dõi sự chênh lệch về token cùng chi phí trên một khối lượng công việc cố định. Các cơ chế dự phòng được Anthropic ghi lại là nhằm hiển thị ở những nơi đó. Không có trường API công khai nào hiển thị mã định danh Kettle.
Cách hiểu trung thực là: một vụ rò rỉ đã nêu tên một thứ gì đó, chứ chưa chứng minh được nó là gì. Định danh Kettle là có thật theo cái nghĩa duy nhất mà một chuỗi bị rò rỉ có thể có: một nhà nghiên cứu cho biết nó xuất hiện 2,582 trên tổng số 2,582 lần, bắt đầu từ đêm 16 tháng 8. Điều mà nó ám chỉ — một mô hình mới, một bản triển khai được đổi tên, một thành phần bộ định tuyến, một bộ phân loại — vẫn chưa được xác minh, và tài liệu của chính Anthropic đưa ra một lời giải thích hoàn toàn bình thường cho toàn bộ sự việc. Đó vừa là giá trị, vừa là giới hạn của bài viết. Cho đến khi một chữ ký thô được công bố hoặc Anthropic nói rõ Kettle là gì, thái độ đúng đắn là coi nó như một kiểu "những-gì-ta-biết-đến-giờ": đáng để theo dõi, đáng để tự ghi nhật ký lưu lượng truy cập của mình, và không đáng để thay đổi lựa chọn mô hình của bạn — nhất là khi một lớp định tuyến cho phép bạn giữ mở quyền lựa chọn theo cả hai hướng.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
