
Claude Sonnet 5.5: Tuyên bố chi phí 30% và sáu thay đổi khiến mã Sonnet 5 bị hỏng
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 984 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 195 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Claude Sonnet 5.5 ra mắt vào ngày 28 tháng 9 năm 2026 với đúng mức giá như Claude Sonnet 5 — 2 đô la mỗi triệu token đầu vào, 10 đô la mỗi triệu token đầu ra, 0,20 đô la mỗi triệu lượt đọc từ bộ đệm — trong khi thông cáo của Anthropic lại mở đầu bằng "chạy nhanh hơn 30%+ và tốn ít hơn tới 30% cho hầu hết công việc." Cả hai phát biểu đều đúng, và khoảng cách giữa chúng chính là toàn bộ câu chuyện. Khoản tiết kiệm không nằm ở bảng giá, bởi bảng giá đã không hề thay đổi. Nó đến từ việc chạy mô hình ở mức effort thấp hơn mức mà phiên bản tiền nhiệm cần, nghĩa là con số 30% là một tuyên bố về điểm vận hành mà bạn phải tự chọn, chứ không phải một mức giá bạn được thừa hưởng. Đo lường độc lập khiến ngã rẽ này trở nên sắc nét: trên Artificial Analysis, Claude Sonnet 5.5 ở mức effort tối đa tốn 7,60 đô la mỗi tác vụ trên Chỉ số Thông minh, so với 5,09 đô la của Claude Sonnet 5 ở mức tối đa — tức nhiều hơn khoảng 49%, chứ không phải ít hơn 30%. Đó không phải là mâu thuẫn với con số của Anthropic. Đó là đầu bên kia của cùng một đường cong, và đó chính là nơi hầu hết các cuộc di trú sẽ hạ cánh theo mặc định nếu không ai chạy lại quá trình khảo sát mức effort của mình.
Hai lời khẳng định khoác chung một con số
Bài đăng của Anthropic đưa ra tuyên bố theo từng tác vụ ở ba chỗ và mỗi chỗ đều dựa vào effort. Cách diễn đạt mạnh nhất: trên Terminal-Bench 4.0, ở mức effort Medium — mặc định trong các ứng dụng Claude — Sonnet 5.5 "vượt xa điểm số tốt nhất của Sonnet 5 với chi phí mỗi tác vụ chưa bằng một phần mười." Trên AA-Briefcase v1.1, ở mức effort Medium, nó đánh bại điểm tốt nhất của Sonnet 5 với chi phí khoảng một phần chín. Trên CursorBench 4.0, ở mức effort Low, nó vượt điểm tốt nhất của Sonnet 5 với chưa bằng một phần mười.
Đọc những điều đó như một tập hợp và cơ chế thật rõ ràng. Ở Sonnet 5.5, mức sàn nằm trên mức trần của Sonnet 5 trong nhiều đánh giá. Bạn không đạt được 30% bằng cách trả ít hơn cho mỗi token; bạn đạt được nó bằng cách không còn cần đến thiết lập đắt đỏ. Anthropic nói đúng như vậy trong tài liệu chuyển đổi, cách phần tiếp thị một trang: "Các mức effort đã được hiệu chỉnh lại. Một mức effort không tạo ra cùng lượng suy nghĩ như khi dùng trên Claude Sonnet 5. Hãy chạy lại quá trình quét effort của bạn thay vì mang một thiết lập cũ sang."
Câu đó là dòng quan trọng nhất về mặt vận hành mà Anthropic đã công bố trong tuần này, và đó chính là dòng đã không xuất hiện trong phần lớn các bài đưa tin về sự kiện ra mắt.
Những gì Anthropic đã công bố — do nhà cung cấp báo cáo, chưa được tái lập
Mọi thứ trong phần này đều là kết quả đo lường của chính Anthropic, từ thông báo Sonnet 5.5 và thẻ hệ thống. Đây là tuyên bố của nhà cung cấp, không phải kết quả độc lập, và chuỗi chú thích cuối trang cũng quan trọng không kém những con số nổi bật.
• Terminal-Bench 4.0 (lập trình agentic) — Sonnet 5.5 70.6% so với Sonnet 5 10.3%. Đó là bước nhảy vọt gấp bảy lần ở hàng được trích dẫn nhiều nhất, và đây là con số mà hầu hết các bài đưa tin đều mở đầu bằng.
• FrontierCode 1.1 (Main) — Sonnet 5.5 đạt 52,1% ở Xhigh và 46,2% ở Max; Sonnet 5 42,4%; Claude Opus 5.5 54,4%; GPT-6 Sol 49,3%. Lưu ý sự đảo ngược: Sonnet 5.5 đạt điểm thấp hơn ở Max so với ở Xhigh.
• CursorBench 4.0 — 55,5% cho Sonnet 5.5 so với 34,1% cho Sonnet 5 và 57,8% cho Opus 5.5. CursorBench 4.0 không công bố điểm của GPT-6 Sol một cách công khai.
• GDPval-AA v2.1 (công việc tri thức) — Sonnet 5.5 1844 Elo, Sonnet 5 1449, Opus 5.5 1846, GPT-6 Sol 1487.
• AA-Briefcase v1.1 — 1811 / 1359 / 1822 / 1483 trên cùng bốn mô hình.
• Humanity's Last Exam (có công cụ) — 64,5% / 54,9% / 67,7%.
• OSWorld 2.1 (sử dụng máy tính, điểm một phần) — 80.1% / 57.0% / 81.8%.
• Chartography (nhận dạng biểu đồ trực quan, không dùng công cụ) — 61,6% / 15,6% / 64,4% / 53,6%.
Ba chú thích nên đi kèm với những hàng đó thay vì nằm bên dưới chúng. Thứ nhất, con số 66,4% của Opus 5.5 trên Terminal-Bench 4.0 được báo cáo ở mức effort Xhigh, cấu hình đạt điểm cao nhất của Opus 5.5. Thứ hai, sự đảo ngược ở FrontierCode Max đã được lý giải: ở mức Max, Sonnet 5.5 thường chạy skill đánh giá mã của Claude Code hơn, vốn chia việc đánh giá cho nhiều subagent, và trong hai trường hợp, điều đó dẫn đến quá thời gian hoặc các chỉnh sửa vượt ngoài phạm vi nhiệm vụ — FrontierCode phạt các thay đổi ngoài phạm vi ngay cả khi chúng tốt. Thứ ba, và đây là điều ít dễ chịu nhất đối với nhà cung cấp, Artificial Analysis đã chạy GDPval-AA và AA-Briefcase trên một bản triển khai tiền phát hành của Sonnet 5.5 mà Anthropic cho biết có một lỗi làm suy giảm phản hồi đối với các yêu cầu đầu ra có cấu trúc. Anthropic kỳ vọng ảnh hưởng này là nhỏ và khiến Sonnet 5.5 bị đánh giá thấp hơn thực tế, đồng thời cho biết lỗi đã được khắc phục. Công ty cũng lưu ý rằng OpenAI gần đây đã khắc phục một lỗi hiểu hình ảnh trong GPT-6 Sol, nên các con số về GPT-6 Sol trong những hàng đó có thể chưa phản ánh mô hình hiện tại.

Lần chạy độc lập nói gì về cùng một mô hình
Artificial Analysis đã đo lường Sonnet 5.5, và trang của nó ghi rõ cấu hình chính xác: "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)". Trên cùng một bản sửa đổi của chỉ mục, 216 mô hình trong lớp:
• Claude Sonnet 5.5 — Chỉ số Trí tuệ 56, xếp hạng #3 trong số 216. Chi phí 7,60 đô-la cho mỗi tác vụ chỉ mục. Nó đã tạo ra 410 triệu token đầu ra trong lần chạy chỉ mục, so với mức trung vị là 88 triệu.
•Claude Sonnet 5 — Chỉ số 38, xếp hạng 58 trong số 216, trên trang riêng của nó được ghi nhãn "(Adaptive Reasoning, Max Effort)". Chi phí $1.5 mỗi tác vụ. 370M token đầu ra.
• Claude Opus 5.5 — Chỉ số 58, xếp hạng #1 trong số 216. $5,98 mỗi tác vụ. 95,3 token đầu ra mỗi giây.
• GPT-6 Sol — Chỉ số 48, xếp hạng #20 trong số 216, với mức giá niêm yết $2/$10. $1,06 mỗi tác vụ, 89,8 token đầu ra mỗi giây.
Khoảng cách Chỉ số Trí tuệ — 56 so với 38, mười tám điểm — là bằng chứng xác nhận độc lập mạnh nhất trong bài này, và đó là con số mà người đọc thực sự nên mang theo. Con số chi phí là thứ cần một lưu ý, và đáng để nói chính xác: cả hai điểm đều là cấu hình nỗ lực tối đa, và nỗ lực tối đa trên một mô hình suy luận lâu hơn là một vị thế đắt đỏ có chủ đích. Sonnet 5.5 đốt 410M token trong lượt chạy chỉ số, nơi Sonnet 5 đốt 370M, và cả hai đều cao hơn hẳn mức trung vị 88M. Một mô hình suy nghĩ lâu hơn ở thiết lập cao nhất sẽ tốn nhiều hơn ở thiết lập cao nhất. Điều mà con số này phủ định không phải là "rẻ hơn trên mỗi tác vụ" mà là bất kỳ cách diễn giải nào coi nó như một thuộc tính của mô hình thay vì của thiết lập.
Artificial Analysis vẫn chưa công bố con số về tốc độ đầu ra cho Sonnet 5.5 — trang của họ ghi N/A cho số token đầu ra mỗi giây, so với 78.7 của Sonnet 5 và 95.3 của Opus 5.5. Vì vậy, nửa "nhanh hơn 30%+" trong tuyên bố của Anthropic hiện chỉ là do nhà cung cấp tự báo cáo. Hãy coi đó là mang tính định hướng cho đến khi một bên thứ ba đo lường.

Khoản tiết kiệm thực sự đến từ đâu và làm thế nào để có được nó
Nếu bạn chấp nhận cơ chế này, hướng dẫn di chuyển sẽ tự viết ra, và Anthropic đã công bố chúng:
• Mặc định hãy bắt đầu ở mức high, chứ không phải ở mức mà cấu hình Sonnet 5 của bạn đã đặt. Hướng dẫn của Anthropic là dùng mức high, trừ khi khối lượng công việc của bạn mang tính tác tử hoặc nhạy cảm với độ trễ.
• Lập trình agentic và sử dụng công cụ theo nhiều bước — hãy bắt đầu ở mức medium đối với các tác vụ được đặc tả rõ ràng, và nâng lên mức high cho những tác vụ khó hơn hoặc dài hơn.
• Chat và các công việc nhạy cảm với độ trễ khác — hãy bắt đầu ở mức trung bình hoặc thấp. Đây chính là dải mà những tuyên bố "chi phí chỉ bằng một phần mười" thuộc về.
Có một lời giải thích mạch lạc cho việc vì sao cấu hình thấp hơn lại hiệu quả, và đó không phải là chiêu tiếp thị. Những người thử nghiệm ban đầu của Anthropic báo cáo rằng Sonnet 5.5 gom các lệnh gọi công cụ lại với nhau nhiều hơn so với Sonnet 5, tạo ra ít bước hơn cho mỗi tác vụ. Ghi chú của CodeRabbit trong thông báo đặc biệt cụ thể đối với một câu trích dẫn khi ra mắt: xu hướng viện đến tìm kiếm web quá thường xuyên và việc sử dụng token cao của Sonnet 5 đều đã biến mất ở mô hình mới này. Sonnet 5.5 cũng giữ nguyên tokenizer như Sonnet 5, nên văn bản giống hệt nhau tiêu tốn số token giống hệt nhau — mức giảm là do ít lượt hơn và ít lệnh gọi dư thừa hơn, chứ không phải do một vốn từ vựng rẻ hơn. Điều đó cũng có nghĩa là số lượng token trong log của bạn vẫn có thể so sánh được xuyên suốt quá trình nâng cấp, khiến việc đo lường trước và sau trở nên đơn giản.
Sáu thay đổi phá vỡ hoặc làm thay đổi mã Sonnet 5
Đây là phần của bản phát hành tiêu tốn thời gian kỹ thuật, và cũng là chỗ mà hướng dẫn di chuyển có giá trị hơn cả biểu đồ điểm chuẩn. Năm trong số sáu cái trả về lỗi cứng; cái thứ sáu thất bại một cách âm thầm.
• thinking: {"type": "disabled"} hiện trả về lỗi 400. Thay thế là thinking: {"type": "between_tools"}, tùy chọn này tắt thinking từ đầu và là cài đặt thinking thấp nhất trên model này. Nó hoạt động ở effort thấp, trung bình và cao, không cần beta header, và khả dụng trên mọi nền tảng phục vụ Sonnet 5.5. Ở effort xhigh hoặc max, bản thân between_tools trả về lỗi 400 — hãy dùng adaptive thinking (bỏ trường này, hoặc gửi {"type": "adaptive"}) nếu bạn cần các mức đó. Với between_tools, bạn cũng không thể thay đổi effort giữa cuộc hội thoại.
• Không hỗ trợ sử dụng công cụ bắt buộc. tool_choice được đặt thành {"type": "any"} hoặc {"type": "tool", "name": "..."} sẽ trả về lỗi 400 với thông báo "tool_choice: type 'tool' và 'any' không được hỗ trợ cho model này." Kiểm tra tương tự cũng áp dụng cho endpoint đếm token. Giải pháp thay thế được tài liệu hóa cho đầu vào hợp lệ theo schema là tool_choice: {"type": "auto"} cùng với strict: true trên công cụ, hoặc chuyển schema sang structured outputs.
• Các khối suy nghĩ được gắn với mô hình và cuộc hội thoại. Sonnet 5.5 đọc các khối suy nghĩ từ Sonnet 5, Opus 4.8, Haiku 4.5 và các phiên bản trước đó — không đọc từ Opus 5, Opus 5.5, hay bất kỳ mô hình Fable hoặc Mythos nào. Không có mô hình nào khác đọc các khối của Sonnet 5.5. Di chuyển một cuộc hội thoại từ Sonnet 5 sang 5.5 thì phần suy luận vẫn tồn tại; di chuyển nó từ Sonnet 5.5 sang bất kỳ thứ gì khác thì các lượt sau sẽ chạy mà không có nó. Riêng biệt, API hiện kiểm tra xem lời nhắc hệ thống, danh sách công cụ, hoặc một tin nhắn trước đó có thay đổi kể từ khi một khối suy nghĩ được tạo ra hay không, và trên các tài khoản được tạo vào hoặc sau ngày 31 tháng 8 năm 2026, nó trả về mã 400 khi chúng đã thay đổi. Giữ các cuộc hội thoại ở chế độ chỉ ghi thêm, hoặc gửi header beta thinking-binding-controls-2026-08-01 với prefix_mismatch_behavior: "drop_block".
• computer_20251124 bị từ chối trên Claude API và Google Cloud. Việc sử dụng máy tính ở đó yêu cầu bộ công cụ computer_toolset_20260801. Amazon Bedrock vẫn chấp nhận công cụ cũ hơn — một sự khác biệt giữa các nền tảng đáng để lưu ý nếu bạn chạy cùng một agent trên cả hai.
• Một số cặp ghép cố vấn không còn nữa. Một trình thực thi Sonnet 5.5 chấp nhận Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5 hoặc chính Sonnet 5.5 làm cố vấn. Các cố vấn Opus 4.8, Opus 4.7 và Sonnet 5, vốn hoạt động với trình thực thi Sonnet 5, sẽ trả về lỗi 400 với trình thực thi Sonnet 5.5. Mọi cố vấn mà Sonnet 5.5 chấp nhận đều trả về lời khuyên được mã hóa, nên client của bạn không thể đọc văn bản lời khuyên.
• Văn bản giữa các lệnh gọi công cụ giờ đây đến bên trong các khối suy nghĩ — và ở chế độ hiển thị mặc định: "omitted" thì nó trống rỗng. Đây là trường hợp âm thầm. Những ghi chú dài hơn một hai câu giữa các lệnh gọi công cụ quay trở về dưới dạng khối suy nghĩ cập nhật tiến độ thay vì dưới dạng văn bản. Một ứng dụng truyền phát lời tường thuật đó cho người dùng sẽ im lặng giữa các lệnh gọi công cụ, không có lỗi và không có gì trong nhật ký. Cách khắc phục là đặt thinking.display để văn bản được trả về, hoặc chuyển sang between_tools, trong trường hợp đó văn bản quay trở lại dưới dạng văn bản thông thường.
Hai điều nữa mà một cuộc chuyển đổi mô hình chạm tới, và cả hai đều không phải là lỗi. Giám sát các trường hợp từ chối: Sonnet 5.5 trả về stop_reason: "refusal" cùng một đối tượng stop_details nêu tên một trong năm lĩnh vực chính sách — cyber, bio, frontier_llm, reasoning_extraction, general_harms — và cơ chế dự phòng phía máy chủ của Anthropic sẽ thử lại các trường hợp từ chối cyber và frontier_llm trên Sonnet 5 nhưng không thử lại ba lĩnh vực còn lại. Và tình hình bảo mật đã thực sự thay đổi: Sonnet 5.5 là mô hình Sonnet đầu tiên được phát hành với các biện pháp bảo vệ an ninh mạng và cơ chế dự phòng giống như dòng Opus, nghĩa là các yêu cầu an ninh mạng có rủi ro cao hơn sẽ được chuyển dự phòng sang Sonnet 5 một cách dễ thấy, và là Sonnet đầu tiên có các bộ phân loại chống lại việc trích xuất lập luận. Nếu đề xuất giá trị của sản phẩm bạn là một công cụ bảo mật, hãy kiểm tra ranh giới đó trước khi bạn phát hành việc hoán đổi mô hình.
Giá cả, và những gì thực sự có trên tuyến đường của chúng ta hôm nay
Bảng giá không thay đổi so với Sonnet 5 và hình thức công bố đầy đủ của nó đủ ngắn để nói rõ ràng:
• Đầu vào — 2,00 USD mỗi triệu token. Đầu ra — 10,00 USD mỗi triệu token. Cả hai đều giống hệt Sonnet 5, được xác nhận trên trang mô hình của Anthropic dành cho Sonnet 5.5.
• Đọc cache — $0.20 mỗi triệu, giảm giá 90% trên giá đầu vào; ghi cache 5 phút $2.50 mỗi triệu; ghi cache 1 giờ $4.00 mỗi triệu. Lời nhắc tối thiểu có thể cache là 512 token trên Sonnet 5.5, giảm từ 1.024 trên Sonnet 5.
• Batch — giảm 50% cho cả hai chiều, chỉ còn $1.00 / $5.00 mỗi triệu token. Trên Message Batches API, đầu ra có thể lên tới 300K token với header beta output-300k-2026-03-24.
• So với Opus 5.5 — Sonnet 5.5 đúng bằng một nửa: $2/$10 so với $4/$20, với chi phí ghi cache bằng một nửa và đọc cache giống hệt nhau ở mức $0.20. Đó chính là cuộc chuyển đổi đáng giá, và Anthropic nói thẳng điều đó: hai mô hình bổ trợ cho nhau tốt nhất khi Sonnet chạy ở mức nỗ lực thấp hơn, còn Opus "vẫn rõ ràng mạnh hơn ở những công việc phức tạp, mở cần sự phán đoán bền bỉ."
• Ngữ cảnh và đầu ra — ngữ cảnh 1M token, đầu ra tối đa 128K, tư duy thích ứng được bật theo mặc định, nỗ lực mặc định cao, điểm cắt kiến thức đáng tin cậy tháng 6 năm 2026, có sẵn tính năng không lưu giữ dữ liệu, không ngừng hỗ trợ sớm hơn ngày 28 tháng 9 năm 2027.
Một lưu ý về tính khả dụng mà chúng tôi muốn nói thẳng ra hơn là để ngụ ý: Claude Sonnet 5.5 không có trong danh mục mô hình của chúng tôi tính đến ngày 29 tháng 9 năm 2026. Phiên bản tiền nhiệm của nó anthropic/claude-sonnet-5 và người anh em lớn hơn của nó anthropic/claude-opus-5.5 thì đều có, và mức giá của nó ở phía chúng tôi là mức giá của chính nhà cung cấp — 2,00 USD vào, 10,00 USD ra, 0,20 USD đọc bộ nhớ đệm, 2,50 USD ghi bộ nhớ đệm cho Sonnet 5, không cộng thêm markup, nên khi nhà cung cấp thay đổi giá thì thay đổi đó có hiệu lực tại đây ngay trong ngày nó được áp dụng thay vì đến kỳ thanh toán tiếp theo. Chính đặc tính cuối cùng đó là điều khiến việc đọc bảng giá trở nên hữu ích thay vì chỉ mang tính trang trí.

Bạn có thể làm gì với điều này ngay hôm nay
Trình tự trung thực cho một đội đã chạy Claude Sonnet 5 trong môi trường production là ba bước, và không bước nào trong đó là "đổi chuỗi model rồi theo dõi đồ thị".
Đầu tiên, hãy chạy lại đợt quét mức effort. Nếu bạn mang cài đặt high hay max từ Sonnet 5 sang vì đó là mức mà chất lượng của bạn đòi hỏi, thì giờ bạn đang trả tiền cho phần suy luận mà bạn không còn cần mua nữa. Các con số chi phí độc lập trên mỗi tác vụ cho thấy bậc cao nhất của thang đã trở nênhơn đắt{{2}}hơn{{/2}}, chứ không phải rẻ hơn, và những tuyên bố chi phí của chính nhà cung cấp đều chỉ mô tả phần giữa của thang đó. Thứ hai, hãy sửa hai nhánh lỗi trước khi triển khai — disabled thinking và forced tool use — vì cả hai đều thất bại ầm ĩ và ngay lập tức, đó là tin tốt. Thứ ba, hãy để mắt đến nhánh narration, vì nó thất bại trong im lặng.
Nếu model chưa có trên tuyến bạn đang dùng, cách ít rủi ro để đánh giá nó là chạy song song, chứ không phải chạy thay thế: hãy giữ Sonnet 5 được ghim làm phương án dự phòng trên cùng một key để mỗi lần bị từ chối, hết thời gian chờ hay đánh giá kém thì yêu cầu sẽ được đẩy sang model bạn đã tin cậy, và tự động chuyển đổi dự phòng sẽ khép kín vòng lặp mà không cần tích hợp thêm lần thứ hai. Đó chính là toàn bộ lý lẽ cho việc đánh giá một model chưa được kiểm chứng phía sau một endpoint thay vì đặt nó trước mặt người dùng của bạn — và điều đó còn đúng gấp đôi ở đây, vì các nhóm từ chối của Sonnet 5.5 là mới và cách hiệu chỉnh effort của nó rõ ràng không giống phiên bản tiền nhiệm. Khi bạn sẵn sàng chuyển mặc định, danh sách trên một key chạy đến hơn 200 model, khiến việc so sánh chỉ còn là một thay đổi cấu hình thay vì một hợp đồng thứ hai.
Xem gì
Ba điều sẽ giải quyết những câu hỏi còn bỏ ngỏ trong bài viết này, và chưa có điều nào trong số đó xảy ra.
Đầu tiên là một phép đo tốc độ đầu ra độc lập. Anthropic tuyên bố nhanh hơn Sonnet 5 từ 30% trở lên; Artificial Analysis chưa công bố con số nào cho Sonnet 5.5, và tuyên bố đó đang thực sự đóng vai trò quan trọng trong lập luận về chi phí, vì một mô hình nhanh hơn hoàn thành cùng một tác vụ trong thời gian thực tế ít hơn và thường dùng ít token hơn. Claude Haiku 5.5 là điều thứ hai — Anthropic nói rằng nó sẽ ra mắt "trong vài tuần tới" và nó sẽ nằm dưới Sonnet 5.5, điều này thay đổi cách tính toán cho phân khúc trò chuyện khối lượng lớn, nơi mức nỗ lực trung bình và thấp vốn đã khiến Sonnet 5.5 trở nên cạnh tranh. Điều thứ ba là lượt hiệu chỉnh: Artificial Analysis đã chạy GDPval-AA và AA-Briefcase trên một bản dựng trước phát hành có lỗi đầu ra có cấu trúc, Anthropic kỳ vọng những điểm số đó đánh giá thấp mô hình, và cả hai con số đều chưa được chạy lại. Nếu chúng tăng lên, khoảng cách về công việc tri thức so với Opus 5.5 càng thu hẹp hơn nữa và lập luận "giá bằng một nửa" càng mạnh hơn.
Cho đến lúc đó, bản tóm tắt có thể biện hộ được thì hẹp hơn thông báo và hữu ích hơn biểu đồ điểm chuẩn. Claude Sonnet 5.5 là mức tăng trí tuệ mười tám điểm so với Sonnet 5 trên chỉ số độc lập, ở cùng mức giá đã công bố, với khoản tiết kiệm thực tế và đo lường được dành cho bất kỳ ai hạ xuống bậc thấp hơn trên thang nỗ lực — và một mức phạt thực tế và đo lường được cho bất kỳ ai không làm vậy.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
