
Claude Haiku 5.5 vs Claude Sonnet 5.5: Bảng giá gấp 20 lần, hóa đơn thực đo gấp 36 lần
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Claude Haiku 5.5 và Claude Sonnet 5.5nằm cách nhau sáu ngày và một bậc trong cùng một dòng họ, chia sẻ cửa sổ ngữ cảnh một triệu token và trả lời trên cùng một dạng API. Trên bảng giá công bố, bản rẻ hơn có chi phí bằng một phần năm bản đắt hơn trong dải mà hầu hết các yêu cầu rơi vào. Trên bảng Artificial Analysis độc lập, khoảng cách còn lớn hơn thế: $0,21 để hoàn thành một tác vụ Intelligence Index trên Claude Haiku 5.5 so với $7,60 trên Claude Sonnet 5.5, với chỉ số Intelligence Index là 43 so với 56. Tín hiệu khởi nguồn cho bài viết này diễn đạt nó thành Claude Haiku 5.5 "tốt hơn hẳn GPT-6 Luna" và "gần (hơn) với Sonnet 5.5". Nửa đầu của điều đó đại khái là những gì bộ so sánh của chính nhà cung cấp cho thấy. Nửa sau là chỗ các phép đo ngừng đồng thuận với marketing, và đáng để nói chính xác về việc cái nào.
Hai mẫu máy, cách nhau sáu ngày và một bậc
Claude Haiku 5.5 ra mắt ngày 7 tháng 10 năm 2026 với model ID claude-haiku-5-5. Đây là bản thay thế trực tiếp cho Claude Haiku 4.5, nhận văn bản và hình ảnh đầu vào rồi trả về văn bản, và là mô hình đầu tiên thuộc lớp Haiku được Anthropic trang bị thiết lập effort có thể điều chỉnh — Low, Medium, High, Xhigh và Max, với medium là mặc định của API. Anthropic gọi đây là "mô hình nhỏ rẻ nhất, nhanh nhất và mạnh nhất mà chúng tôi từng phát hành", và chú thích của họ bổ sung rằng nhanh nhất ở tốc độ tiêu chuẩn của từng mô hình, vẫn xếp sau các mô hình Opus khi chúng chạy ở Fast Mode.
Claude Sonnet 5.5 ra mắt sớm hơn sáu ngày, vào ngày 28 tháng 9 năm 2026, với tên claude-sonnet-5-5 — hạng mục mà Anthropic định vị là sự kết hợp tốt nhất giữa tốc độ và trí tuệ, đồng thời là lựa chọn họ khuyến nghị cho việc lập trình tác tử phức tạp. Cùng cửa sổ một triệu token. Không giống Claude Haiku 5.5, nó không có dải giá theo độ dài prompt, và điều này hóa ra lại quan trọng hơn cả lợi thế đi trước sáu ngày.
Cả hai hiện đã có mặt trên mọi nền tảng, bao gồm Amazon Web Services, Google Cloud và Microsoft Azure, và cả hai đều đi kèm cam kết ngừng hỗ trợ không sớm hơn một năm sau khi ra mắt — ngày 7 tháng 10 năm 2027 đối với Claude Haiku 5.5, ngày 28 tháng 9 năm 2027 đối với Claude Sonnet 5.5. Anthropic cho biết Claude Sonnet 5.5 hiện có sẵn với chính sách không lưu trữ dữ liệu, tương tự như Claude Opus 5.5 và Claude Sonnet 5.
Bảng giá, cả hai mặt, ở cùng một nơi
Mỗi triệu token, tính bằng đô la Mỹ, theo mức giá đã công bố của Anthropic:
• Đầu vào — Claude Haiku 5.5 $0,10 cho các prompt tối đa 100.000 token, $0,50 khi vượt ngưỡng đó; Claude Sonnet 5.5 $2,00 cố định, không chia bậc.
• Đầu ra — Claude Haiku 5.5 0,50 USD cho tối đa 100.000 token, 2,50 USD nếu vượt mức đó; Claude Sonnet 5.5 10,00 USD đồng giá.
• Lượt đọc cache — Claude Haiku 5.5 $0.01 ở dải thấp hơn và $0.05 ở trên mức đó; Claude Sonnet 5.5 $0.10. Anthropic đã giảm một nửa mức đọc cache của Claude Sonnet 5.5 từ $0.20 cùng thời điểm ra mắt Haiku, và cho biết rằng vì lượt đọc cache chiếm tỷ trọng lớn trong mức sử dụng token tác tử, Claude Sonnet 5.5 hiện có chi phí thấp hơn khoảng 20% đối với hầu hết công việc tác tử.
• Ghi bộ đệm — Claude Haiku 5.5 $0.125 cho một lần ghi năm phút và $0.20 cho một lần ghi một giờ ở dải thấp hơn, $0.625 và $1.00 ở mức cao hơn; Claude Sonnet 5.5 $2.50 cho một lần ghi năm phút và $4.00 cho một giờ.
• Batch — Batch API được giảm 50% cho cả đầu vào và đầu ra. Điều đó đưa Claude Haiku 5.5 xuống mức $0.05 và $0.25 dưới mốc 100.000 token, cùng $0.25 và $1.25 trên mốc đó, so với Claude Sonnet 5.5 ở mức $1.00 và $5.00.
Đọc ngang qua những dòng đó và hình dạng là nhất quán: ở dải thấp hơn, bạn đang thấy mức chênh lệch 20x và mức chênh lệch đầu ra 20x; ở phía trên đường, 4x và 4x. Tiêu đề của Anthropic là "chạy rẻ hơn khoảng 75%" tính trung bình so với Claude Haiku 4.5, được làm rõ trong một chú thích thành rẻ hơn 90% dưới 100.000 token và rẻ hơn 50% trên mức đó, với thay đổi tokenizer được gộp vào mức trung bình đó.
Bước 100.000 token là lúc phép tính thay đổi
Hai điều kéo theo hai hướng ngược nhau, và chỉ một trong số đó nằm trên bảng giá. Giá giảm mạnh so với Claude Haiku 4.5. Đồng thời, Claude Haiku 5.5 đi kèm một tokenizer cập nhật, tương tự như những tokenizer trong Claude Sonnet 5.5 và Claude Opus 5.5, mà Anthropic nói rằng “dùng nhiều token hơn một chút cho mỗi tác vụ” — vì vậy một prompt giống hệt sẽ đến dưới dạng số token tính phí lớn hơn so với trên thế hệ trước. Mức trung bình 75% là kết quả ròng của cả hai, và đó là con số do nhà cung cấp đưa ra.
Ngưỡng 100.000 token là phần khiến nhiều người bị bất ngờ. Anthropic tính giá Claude Haiku 5.5 theo độ dài prompt: một yêu cầu có prompt vượt quá 100.000 token sẽ phải trả mức giá cao hơn cho toàn bộ yêu cầu, chứ không chỉ cho số token vượt ngưỡng. Độ dài prompt tính tất cả token đầu vào, bao gồm cả cache read và cache write, và mỗi yêu cầu được tính giá riêng — một yêu cầu dài phải trả mức giá cao hơn ngay cả khi một phần prompt của nó là cache hit, còn các yêu cầu trước đó vẫn giữ mức giá đã được tính. Một pipeline truy xuất nằm thoải mái ở 90.000 token trả $0.10 và $0.50. Chỉ cần nhích cửa sổ thêm một nấc là toàn bộ yêu cầu được tính lại giá ở mức $0.50 và $2.50. Claude Sonnet 5.5 không làm vậy, vì toàn bộ cửa sổ một triệu token được tính theo mức giá tiêu chuẩn.
Có hai hệ quả kéo theo, theo hai hướng ngược nhau. Thứ nhất, điểm giao cắt mà người ta kỳ vọng — ngữ cảnh dài khiến mô hình đắt đỏ trở thành mô hình rẻ hơn — đã không xảy ra: Claude Haiku 5.5 khi vượt ngưỡng vẫn chỉ bằng một phần tư Claude Sonnet 5.5 trên bảng giá. Thứ hai, khoảng cách mà bạn trông cậy thu hẹp từ 20 lần xuống 4 lần đúng vào lúc khối lượng công việc của bạn trở nên nặng nề, cũng chính là lúc các con số tuyệt đối bắt đầu trở nên quan trọng. Bước nhảy này là lý do một pipeline nhạy cảm về chi phí cần có dòng ngân sách riêng thay vì một mức giá trên mỗi token.
Mỗi nhà cung cấp báo cáo mình đạt được bao nhiêu điểm
Mọi thông tin trong phần này đều do nhà cung cấp tự báo cáo và chưa được bên thứ ba tái lập. Anthropic công bố cùng một bộ so sánh trên các trang Claude Haiku 5.5 và Claude Sonnet 5.5 của mình, và ở những chỗ hai trang trùng nhau, chúng nhất quán:
• GDPval-AA v2.1, công việc tri thức — 1.620 cho Claude Haiku 5.5, so với 1.840 cho Claude Sonnet 5.5, 735 cho Claude Haiku 4.5 và 1.437 cho GPT-6 Luna.
• AA-Briefcase v1.1 — 1,578 cho Claude Haiku 5.5, so với 1,824 cho Claude Sonnet 5.5, 614 cho Claude Haiku 4.5 và 1,336 cho GPT-6 Luna.
• OSWorld 2.1, sử dụng máy tính, tập hợp con ngoại tuyến — 72,4% cho Claude Haiku 5.5, so với 83,9% cho Claude Sonnet 5.5, 15,7% cho Claude Haiku 4.5 và 48,9% cho GPT-6 Luna.
• Terminal-Bench 4.0, lập trình tác tử — 39,2% cho Claude Haiku 5.5, so với 70,6% cho Claude Sonnet 5.5, 0,0% cho Claude Haiku 4.5 và 16,4% cho GPT-6 Luna.
• FrontierCode 1.1, Main — 46,4% cho Claude Haiku 5.5, so với 52,4% cho Claude Sonnet 5.5 ở mức Xhigh, 42,4% cho GPT-6 Luna. Anthropic cũng lưu ý rằng Claude Sonnet 5.5 đạt điểm thấp hơn ở mức Max so với mức Xhigh trên chỉ số này, điều mà họ cho là do việc sử dụng kỹ năng đánh giá mã thường xuyên hơn gây ra tình trạng hết thời gian hoặc các chỉnh sửa ngoài phạm vi.
• Chartography, suy luận thị giác không cần công cụ — 46,4% cho Claude Haiku 5.5, so với 61,6% cho Claude Sonnet 5.5, 6,4% cho Claude Haiku 4.5 và 29,1% cho GPT-6 Luna.
• Humanity's Last Exam — 45,9% khi không dùng công cụ và 57,4% khi dùng công cụ đối với Claude Haiku 5.5; 64,5% khi dùng công cụ đối với Claude Sonnet 5.5, 18,7% đối với Claude Haiku 4.5, và 56,9% khi không dùng công cụ đối với Claude Sonnet 5.5 trên cùng một trang. Anthropic lưu ý rằng số liệu của dòng GPT-6 có thể đã lỗi thời vì OpenAI đã sửa một lỗi hiểu hình ảnh và không phải tất cả điểm số của bên thứ ba đều đã được cập nhật.
Hai trong số những dòng đó đáng để đọc hai lần. Trên FrontierCode, hai mô hình khá sát nhau — 46,4% so với 52,1% — và trên Chartography, nơi không có công cụ nào để nấp phía sau, khoảng cách là 15 điểm. Terminal-Bench 4.0 thì không hề sát nhau chút nào: 39,2% so với 70,6% là một đẳng cấp năng lực khác, đó là lý do trang Claude Sonnet 5.5 của Anthropic vẫn chỉ vào Claude Sonnet 5.5 và Claude Opus 5.5 cho lập trình tác nhân phức tạp, đồng thời định vị Claude Haiku 5.5 là mô hình dành cho những công việc có phạm vi hẹp, khối lượng lớn.
Những gì hội đồng quản trị độc lập mang lại
Các con số của Anthropic so sánh các mô hình của chính hãng với nhau và với một đối thủ cạnh tranh. Một bảng đánh giá độc lập đặt cả hai đối chiếu với toàn bộ các mô hình khác, và chỉ số mà nó báo cáo còn các nhà cung cấp thì không, chính là chi phí cho mỗi tác vụ hoàn thành.
Artificial Analysis chấm Claude Haiku 5.5 ở mức Max effort với Intelligence Index là 43, cao hơn hẳn mức trung vị 13 trong số các mô hình tương đương, tạo ra 440 triệu token đầu ra trên Intelligence Index so với mức trung vị 100 triệu — rất dài dòng — với giá 0,10 USD cho đầu vào và 0,50 USD cho đầu ra mỗi triệu token, và 242 token đầu ra mỗi giây. Chi phí đo được của nó là 0,21 USD cho mỗi tác vụ trên Intelligence Index.
Cùng bảng điểm đó chấm Claude Sonnet 5.5 đạt 56, so với mức trung vị là 26, tạo ra 410M token đầu ra so với mức trung vị là 88M, với giá $2.00 cho đầu vào và $10.00 cho đầu ra cùng mức chiết khấu bộ nhớ đệm 90%. Chi phí đo được của nó là $7.60 cho mỗi tác vụ Intelligence Index.


Đặt hai dòng đó cạnh nhau và tỷ lệ chính là câu chuyện. 0,21 đô la so với 7,60 đô la là hơn 36 lần một chút, và hai mô hình gần như ngang nhau về độ dài đầu ra — 440M token đầu ra so với 410M — nên hệ số nhân đó gần như hoàn toàn là bảng giá đang làm đúng những gì bảng giá nói nó sẽ làm. Trên bảng giá của chính nhà cung cấp, cùng phép so sánh đó là 20 lần. Phần chênh lệch thêm đến từ những thứ mà giá theo token không thể hiện được: mô hình rẻ hơn đạt được câu trả lời với ít token bị tính phí hơn cho mỗi tác vụ ở mức effort này, và lượt đọc cache được tính phí bằng một phần mười mức giá của Claude Sonnet 5.5. Cùng bộ khung đánh giá, cùng tác vụ, được đo độc lập.

Nơi gói giá rẻ thực sự hết
Những con số khách hàng mà Anthropic công bố quyết định sự phân định thường xuyên hơn so với các chỉ số benchmark, và tất cả chúng đều chỉ về cùng một hướng. Asana báo cáo độ trễ thấp hơn hơn 30% khi hoàn thành tác vụ và suy luận nhanh hơn tới 2,5 lần cho mỗi lượt tác nhân. Box báo cáo điểm cao hơn Claude Haiku 4.5 11 điểm với độ trễ chỉ bằng khoảng một nửa. HubSpot báo cáo điểm cao nhất mà họ từng thấy trên bộ kiểm thử của riêng mình, 92,8% tính trung bình qua ba lần chạy, với tỷ lệ trúng cao nhất và tỷ lệ dương tính giả thấp nhất. AlphaSense thực hiện khoảng 8 triệu lệnh gọi mỗi tuần thông qua "Ask in Document" và báo cáo mức cải thiện có ý nghĩa thống kê so với Claude Haiku 4.5, 0,84 so với 0,76. Cognition báo cáo rằng với Claude Haiku 5.5 làm trợ thủ, tác nhân Fusion của họ duy trì điểm FrontierCode là 66,2.
Không một cái nào trong số đó là tác nhân tầm xa. Chúng là những giải pháp điểm — một bước được định nghĩa rõ ràng, đang trở nên rẻ hơn. Đó là dạng bài toán mà Claude Haiku 5.5 được xây dựng để giải quyết, và cũng là dạng mà lợi thế chi phí gấp 36 lần là tiền thật chứ không phải một sai số làm tròn. Lợi thế này tích lũy theo khối lượng lệnh gọi và tan biến theo độ sâu lệnh gọi: một trăm nghìn lệnh gọi phân loại mỗi ngày với $0.10 đầu vào và $0.50 đầu ra là một khoản mục chi phí mà bạn để ý thấy nó biến mất, trong khi một trăm lượt tác nhân mỗi phiên, mỗi lượt đọc lại ngữ cảnh tích lũy, là một khoản mục chi phí tăng siêu tuyến tính vì mỗi lượt vượt ngưỡng đều phải trả mức giá cao hơn.
Phản biện của Claude Sonnet 5.5 là chi phí theo mỗi lần thử, chứ không phải chi phí theo mỗi token. Anthropic nói rằng nó chạy nhanh hơn Claude Sonnet 5 hơn 30% và tốn ít hơn tới 30% cho hầu hết công việc, khoản tiết kiệm đến từ việc cần ít token hơn chứ không phải từ mức giá thấp hơn. Các bên thử nghiệm độc lập đã đưa ra những con số cho điều đó: Slack báo cáo ít hơn khoảng 14% token đầu ra, Balyasny khoảng 121k token mỗi câu trả lời so với 497k, Box nhanh hơn 2,4 lần với ít hơn 12% token, Lovable ít hơn khoảng một phần ba số lệnh gọi công cụ và khoảng một nửa số lần chạy shell, Atlassian nhanh hơn tới 30% đối với Rovo Agents, và Base44 3,6 vòng lặp mỗi bản dựng so với 7,7 đối với Claude Opus 5. Một lượt đi thành công vẫn hơn bốn lượt không thành công.
Có một yếu tố thứ ba đi theo hướng ngược lại. Anthropic đã chuyển effort thành một núm điều chỉnh ở cấp mô hình trong thế hệ này — thiết lập effort của Claude Haiku 5.5 được đặt một lần cho mỗi yêu cầu thay vì được định cỡ như một ngân sách suy nghĩ theo từng yêu cầu, và chế độ budget_tokens cũ đã bị ngừng khuyến nghị trên các mô hình 4.6 và không được chấp nhận trên các mô hình sau đó. Với một hệ thống mà nhiều dịch vụ cùng gọi một model ID, đó là một sự đơn giản hóa. Còn với bất kỳ thứ gì tự định cỡ suy luận của riêng nó theo từng lần gọi, thì đó đồng nghĩa với việc phải viết lại.
Chạy cả hai phía sau một endpoint
Lý do quyết định này đáng được làm cho đúng là ở chỗ nửa sai của nó rất tốn kém để hoàn tác: định tuyến lại một luồng production từ model ID này sang model ID khác nghĩa là phải chạm tới mọi điểm gọi đã giả định hành vi của cái cũ. Cách rẻ hơn để tìm ra một workload thuộc tầng nào là chạy cả hai sau một endpoint và chuyển lưu lượng giữa chúng bằng cấu hình thay vì bằng tái cấu trúc.
Đó chính là mục đích của OrcaRouter. Claude Sonnet 5.5 có mặt trong danh mục với mã anthropic/claude-sonnet-5.5, cùng với Claude Sonnet 5, Claude Opus 5.5 và Claude Haiku 4.5 — bậc Haiku cũ hơn vẫn được giữ lại như một điểm tham chiếu trong khi bạn dần chuyển khỏi nó. Nền tảng chuyển nguyên giá niêm yết của nhà cung cấp mà không cộng thêm phụ phí, nên mức $2.00 và $10.00 ở trên chính là mức giá bạn phải trả, và điều ngược lại cũng đúng: khi một nhà cung cấp đổi giá, giá mới sẽ có hiệu lực tại đây ngay trong cùng ngày, đó cũng là cách đợt giảm giá đọc bộ nhớ đệm của Claude Sonnet 5.5 đến với chúng tôi. Hai tính năng sẽ đảm nhiệm phần việc mà quyết định cụ thể này cần. Chuyển đổi dự phòng tự động giữ một mô hình bạn vẫn đang đánh giá ra khỏi đường dẫn then chốt một cách tự động, và DSL định tuyến cho phép bạn gửi các cuộc gọi dưới 100.000 token đến bậc rẻ hơn và chuyển những cuộc gọi ngữ cảnh dài hay tầm xa cho bậc đắt hơn trong cùng một luồng yêu cầu, mà không cần hợp đồng thứ hai hay SDK thứ hai.
Nói chính xác về những gì được và không được lưu trữ: Claude Sonnet 5.5 hiện có thể được định tuyến qua chúng tôi. Claude Haiku 5.5 vẫn chưa có trong danh mục. Cho đến khi có, nó chỉ nằm trên API riêng của Anthropic và ba nền tảng đám mây được liệt kê ở trên.
Cách quyết định
Chọn Claude Haiku 5.5 khi tác vụ hẹp, khối lượng lớn và có thể kiểm tra — phân loại, trích xuất, định tuyến, tóm tắt, công việc theo từng lượt bên trong một agent mà bạn đã xây dựng. Mức chênh lệch đơn giá 20 lần chính là điểm mấu chốt ở đó, bước 100.000 token là thứ có thể tránh được ngay từ thiết kế, và con số $0.21 mỗi tác vụ được đo độc lập cho thấy lợi thế này vẫn đứng vững bên ngoài phòng thí nghiệm của chính nhà cung cấp. Hãy đặt núm điều chỉnh effort theo từng lớp tác vụ thay vì để nó ở mặc định; trên một mô hình tầm cỡ Haiku, khác biệt giữa Low và Max là hệ số nhân chi phí, chứ không phải sở thích về chất lượng.
Hãy chọn Claude Sonnet 5.5 khi tác vụ có tầm nhìn dài hạn, mang tính tác nhân hoặc không thể kiểm chứng — mã phải biên dịch được, việc dùng máy tính phải để màn hình ở một trạng thái đã biết, bất cứ thứ gì mà một câu trả lời sai gây tốn kém hơn cả lần gọi. Terminal-Bench 4.0 đạt 70.6% so với 39.2% không phải là một khác biệt nhỏ, đó là một hạng năng lực khác, và bảng giá cố định nghĩa là một ngữ cảnh dài không âm thầm đổi giá toàn bộ yêu cầu. Nếu khối lượng công việc của bạn thực sự nằm ở khoảng giữa, câu trả lời trung thực là cả hai mô hình đều chưa có một khối lượng lớn các tái lập độc lập từ bên thứ ba phía sau, điểm chỉ số đến từ một bộ khung đánh giá duy nhất, và những con số của nhà cung cấp được nêu ở trên là của chính nhà cung cấp.
Điều gì sẽ làm thay đổi câu trả lời này?
Có ba điều đáng để theo dõi, và không điều nào trong số đó là các bản phát hành benchmark. Điều đầu tiên là liệu các đánh giá độc lập về Claude Haiku 5.5 ở mức effort Low, High và Xhigh — không chỉ Max — có cho thấy cùng tỷ lệ chi phí trên mỗi tác vụ hay không, bởi nút điều chỉnh effort là đòn bẩy rẻ nhất trong so sánh và cũng được đo lường ít nhất. Điều thứ hai là liệu bước 100.000 token có còn tồn tại không; một dải thứ ba, hoặc không có dải nào cả ở thế hệ tiếp theo, sẽ thay đổi bài toán cho mọi pipeline truy xuất ở ranh giới đó nhiều hơn bất kỳ điểm benchmark đơn lẻ nào. Điều thứ ba là tokenizer. Nếu một checkpoint sau này token hóa cùng một văn bản ở tỷ lệ cũ, mức trung bình 75% của Anthropic sẽ trở thành mức sàn thay vì mục tiêu, và khoảng cách so với Claude Sonnet 5.5 sẽ mở rộng mà không mức giá nào thay đổi.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
