
Claude Haiku 5.5 so với Qwen3.8-Flash-Next: Ngữ cảnh 1M ở hai số lượng token rất khác nhau
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Tiêu đề của cả hai mô hình này đều nêu cùng một con số, và đó chính là lý do vì sao việc so sánh chúng cho đàng hoàng lại đáng làm đến vậy. Claude Haiku 5.5 cung cấp cửa sổ ngữ cảnh 1 triệu token. Qwen3.8-Flash-Next cung cấp cửa sổ ngữ cảnh 1 triệu token. Nhưng hai nhà cung cấp đo cửa sổ đó bằng những đơn vị khác nhau, hai mô hình token hóa cùng một đoạn văn bản theo cách khác nhau, và hai bảng giá tính tiền cho nó theo những hình thức khác nhau — nên câu "cả hai đều là mô hình triệu token" là đúng, nhưng gần như vô dụng như một tiêu chí mua hàng. Điều thực sự phân biệt chúng là cách mỗi mô hình tiêu tốn một triệu token trong tài liệu của bạn, và liệu các đo lường độc lập có ủng hộ lời quảng bá của nhà cung cấp hay không một khi các đơn vị đã được quy về cùng một chuẩn để so sánh.
Các con số, đặt cạnh nhau và cùng đơn vị.
Cả hai nhà cung cấp đều công bố cửa sổ một triệu token; chỉ một bên công bố mức giá giữ nguyên ở quy mô đó. Đó là khác biệt thực sự đầu tiên:
• Cửa sổ ngữ cảnh — Claude Haiku 5.5 1.000.000 token so với Qwen3.8-Flash-Next 1.000.000 token (do nhà cung cấp công bố)
• Giá trong ngữ cảnh dưới 100K — Haiku 5.5 $0.10 / $0.50 mỗi triệu so với Qwen3.8-Flash-Next $0.15 / $0.47 (danh sách nhà cung cấp)
• Giá khi ngữ cảnh vượt 100K — Haiku 5.5 $0.50 / $2.50 mỗi triệu, so với Qwen3.8-Flash-Next vẫn $0.15 / $0.47 (bảng giá của nhà cung cấp)
• Chỉ số độc lập — Haiku 5.5 43.395 so với Qwen3.8-Flash-Next 39.822 (Artificial Analysis)
• Chi phí đo được cho mỗi tác vụ — Haiku 5.5 $0.37218 so với Qwen3.8-Flash-Nar $0.37218 (Artificial Analysis)
• Số token đầu ra được đo cho mỗi tác vụ — Haiku 5.5 162.164 so với Qwen3.8-Flash-Next 107.885 (Artificial Analysis)
• Thời gian thực đo được cho mỗi tác vụ — Haiku 5.5 426,26 giây so với Qwen3.8-Flash-Next 1.530,19 giây (Artificial Analysis)
• Kiến trúc — không được tiết lộ đối với Haiku 5.5; Qwen3.8-Flash-Next là mô hình 180B với 6B tham số hoạt động, Mixture-of-Experts (do nhà cung cấp công bố)
• Giấy phép — Haiku 5.5 đóng và chỉ có API; Qwen3.8-Flash-Next theo Qwen Community Licence 1.0 (do nhà cung cấp công bố)
Dòng quan trọng nhất trong danh sách đó là dòng thứ ba, và không có gì gần bằng. Qwen3.8-Flash-Next tính một mức giá cố định — 0,15 đô la và 0,47 đô la — bất kể yêu cầu lớn đến mức nào. Claude Haiku 5.5 thì không: mức giá tăng gấp năm lần ngay khi một yêu cầu vượt qua 100.000 token, lên 0,50 đô la và 2,50 đô la. Vì vậy, hai mô hình quảng cáo cửa sổ ngữ cảnh giống hệt nhau lại có đường cong chi phí hoàn toàn khác nhau trên toàn bộ cửa sổ đó, và một tài liệu 500.000 token chính là trường hợp cho thấy rõ điều đó. Trên Qwen, yêu cầu đó tốn đúng mức mà một yêu cầu 500.000 token luôn tốn. Trên Haiku, nó tốn gấp năm lần mức mà mức giá quảng cáo của mô hình gợi ý, vì mọi token trong yêu cầu đều được tính theo bậc dài, không chỉ những token vượt ngưỡng.

Tại sao con số token trên mỗi tác vụ lại quan trọng hơn cửa sổ
Bảng giá của nhà cung cấp so sánh token với token, điều đó ổn cho đến khi bạn nhận ra rằng hai mô hình không tạo ra cùng số lượng token cho cùng một công việc. Các lần chạy tác vụ của chính Artificial Analysis cho thấy rõ điều đó: Claude Haiku 5.5 dùng 162.164 token đầu ra được đo được để hoàn thành một tác vụ mà Qwen3.8-Flash-Next hoàn tất trong 107.885 token. Đặt con số đó bên cạnh giá mỗi token, và lợi thế giá trên giấy tờ của Haiku 5.5 phần nào biến mất — Haiku dài dòng hơn khoảng 50 phần trăm mỗi tác vụ, một hệ số nhân chi phí thực sự không bao giờ xuất hiện trên bảng giá.
Nó cũng diễn ra theo chiều ngược lại, và đây chính là phần đặc biệt quan trọng đối với phân khúc flash. Qwen3.8-Flash-Next là một mô hình Mixture-of-Experts, 180 tỷ tham số với 6 tỷ tham số hoạt động, và Artificial Analysis đo được tốc độ 56,04 token đầu ra mỗi giây trong một tác vụ mà nó mất 1.530 giây để hoàn thành. Claude Haiku 5.5 hoàn thành cùng loại tác vụ đó trong 426 giây. Trên bảng xếp hạng độc lập, Haiku vừa nhanh hơn, vừa rẻ hơn tính theo số tiền tuyệt đối cho mỗi tác vụ — 0,2128 USD so với 0,37218 USD — dù là mô hình dài dòng hơn trong hai. Giá niêm yết của nhà cung cấp nói rằng mô hình flash là lựa chọn tiết kiệm; nhưng chi phí thực đo để hoàn thành một tác vụ lại nói điều ngược lại. Khoảng cách đó đáng để hiểu rõ trước khi một trong hai mô hình được đưa vào một mô hình chi phí.
Cách diễn đạt của chính Anthropic về Claude Haiku 5.5 là nó rẻ hơn khoảng 75 phần trăm chi phí chạy tính trung bình so với mô hình mà nó thay thế, và rằng tokenizer mới của nó tạo ra nhiều hơn khoảng 30 phần trăm token cho cùng một văn bản. Cả hai phát biểu đều là của chính nhà cung cấp, và cả hai đều quan trọng ở đây vì phát biểu thứ hai là thứ khiến phát biểu thứ nhất trở thành con số ròng thay vì con số theo giá niêm yết. Đối với so sánh với Qwen, điều quan trọng là mức chênh lệch số lượng token là có thật và đã được đo lường, không phải chỉ trên lý thuyết — các lần chạy tác vụ độc lập cho thấy điều đó một cách trực tiếp.
Trường hợp ngữ cảnh dài, được thực hiện cẩn thận
Đặt một tài liệu thực sự lớn trước cả hai và hai bảng giá sẽ cho ra câu trả lời trái ngược nhau tùy thuộc vào cách bạn xử lý nó. Ở 60.000 token mỗi yêu cầu, Claude Haiku 5.5 rẻ hơn ở cả đầu vào lẫn đầu ra — $0,10 / $0,50 so với $0,15 / $0,47, và mức phạt vì tính dài dòng của Haiku vẫn chưa đủ lớn để đảo ngược điều đó trong công việc lấy đầu vào làm chủ đạo. Ở 200.000 token mỗi yêu cầu, mức giá đầu vào của Haiku là $0,50 so với $0,15 của Qwen, và mức giá đầu ra của nó là $2,50 so với $0,47. Qwen rẻ hơn gấp ba lần về đầu vào và khoảng năm lần về đầu ra, và giữ nguyên như vậy cho đến tận cuối cửa sổ một triệu token.
Lý do điều này quan trọng ngoài phép tính đơn thuần là hai mô hình quảng cáo cùng một cửa sổ cho những mục đích khác nhau. Điểm nhấn của Qwen3.8-Flash-Next là cửa sổ lớn với mức giá cố định, và đó chính là điều khiến nó trở thành ứng viên cho các công việc nặng về truy xuất và nặng về tài liệu: đưa toàn bộ vào, trả một mức giá dự đoán được, dừng việc xây dựng lớp truy xuất. Cửa sổ một triệu token của Claude Haiku 5.5 là thật và dùng được, nhưng cách tính giá theo ngữ cảnh dài khiến nó trở thành nơi bạn ghé qua vì một lý do cụ thể hơn là nơi bạn sống. Nếu khối lượng công việc của bạn là một tài liệu lớn mỗi lần gọi, chỉ riêng cấu trúc định giá đã đẩy bạn về phía Qwen; nếu là nhiều lần gọi nhỏ với thỉnh thoảng một lần gọi lớn, thì hạng ngắn của Haiku là nơi rẻ hơn cho số đông, và lần gọi lớn thỉnh thoảng là một chi phí bạn có thể dự trù riêng.
Hội đồng độc lập nói gì về năng lực
Khoảng cách năng lực giữa hai bên là có thật và nghiêng về Claude Haiku 5.5, nhưng ít hơn mức mà cấu trúc giá có thể gợi ý. Artificial Analysis xếp Haiku ở mức 43,395 trên Chỉ số Thông minh của mình, so với 39,822 của Qwen — chênh lệch khoảng chín phần trăm, đáng kể nhưng còn xa mới đạt tới một thế hệ. Trên các bài kiểm tra phụ khó hơn, thứ tự vẫn giữ nguyên: 0,329 so với 0,253 trên Terminal-Bench Hard, 0,444 so với một con số HLE thấp hơn, và Haiku dẫn trước ở các chỉ số tác nhân mà bảng công bố.

Ngược lại, Qwen3.8-Flash-Next thắng về lợi thế kinh tế chi phí trên mỗi tham số và ở chỗ trọng số của nó có sẵn theo Qwen Community Licence 1.0 — nên giống như dòng GLM, nó có thể được tự lưu trữ bởi một nhóm muốn làm vậy. Claude Haiku 5.5 thì không thể. Đối với một khối lượng công việc mà suy luận phải diễn ra trên phần cứng của chính bạn, mô hình đóng không phải là một ứng viên bất kể nó đạt điểm ra sao, và cấu hình MoE 180B/6B ít nhất là một thứ có thể biện minh để thử tự chạy nếu đó là ràng buộc mà bạn đang phải chịu.
Các tính năng agentic lại nghiêng theo hướng ngược lại. Claude Haiku 5.5 đi kèm với tư duy thích ứng, thiết lập effort mặc định ở mức medium, và — lần đầu tiên trong dòng Haiku — một núm điều chỉnh effort có thể tùy chỉnh, chạy từ Low đến Max. Qwen3.8-Flash-Next không quảng cáo một điều khiển tương đương. Với công việc agentic mà ở đó bạn muốn đánh đổi độ trễ lấy độ sâu suy luận cho mỗi lần gọi, núm điều chỉnh đó là một điểm khác biệt thực sự có lợi cho Haiku, và đó là một năng lực mà việc so sánh giá không phản ánh được.
Chạy cả hai từ một nơi
Hai mô hình thường xuyên nằm ở hai phía đối lập của cùng một ranh giới đến mức một stack production rốt cuộc cần cả hai — Haiku cho những lời gọi ngắn, chất lượng cao và Qwen cho việc nạp ngữ cảnh dài. OrcaRouter cung cấp qwen/qwen3.8-flash, người anh em cùng dòng của Qwen3.8-Flash-Next, với giá 0,15 USD và 0,47 USD mỗi triệu token cùng cửa sổ 1 triệu token, đúng theo giá niêm yết của nhà cung cấp và không phụ thu, trên cùng một key và cùng một hóa đơn như phần còn lại của danh mục hơn 200 mô hình.
Cả Claude Haiku 5.5 lẫn bản thân Qwen3.8-Flash-Next đều không có trong danh mục của chúng tôi — với những model đó, nơi để có được chúng là API riêng của nhà cung cấp và một số nền tảng bên thứ ba. Điều chúng tôi mang đến trong sự so sánh này là model Qwen3.8-Flash bản cơ sở, vốn đáp ứng phần lớn các trường hợp ngữ cảnh dài mà người ta sẽ mua biến thể Next để giải quyết, cùng với mức giá pass-through để khi nhà cung cấp thay đổi giá thì bên chúng tôi cập nhật ngay trong cùng ngày, và tính năng tự động chuyển đổi dự phòng khi một luồng vận hành sản xuất phải tiếp tục chạy xuyên qua một buổi chiều trục trặc của nhà cung cấp.
Câu trả lời ngắn gọn
Nếu các yêu cầu của bạn dưới 100.000 token và bạn muốn dùng mô hình mạnh hơn, thì Claude Haiku 5.5 vừa rẻ hơn trên mỗi token vừa đạt điểm cao hơn, và lựa chọn này rất rõ ràng. Nếu các yêu cầu của bạn thường xuyên vượt trên 100.000 token — đó cũng chính là lý do duy nhất khiến bạn phải bận tâm đến cửa sổ token ngay từ đầu — thì mức giá cố định của Qwen3.8-Flash-Next giúp nó rẻ hơn từ ba đến năm lần ở mức dài, và số token đầu ra đo được của nó cũng thấp hơn, nên khoảng cách trên hóa đơn của bạn sẽ lớn hơn mức chênh lệch niêm yết gợi ý.

Con số cần làm rõ trước khi quyết định không phải là mô hình nào có cửa sổ lớn hơn; cả hai đều có cùng một cửa sổ. Mà đó là hình dạng phân bố kích thước yêu cầu của bạn, vì chính nó quyết định việc bạn thực sự đang nằm ở bảng giá nào trong hai bảng giá này. Lấy phân vị thứ 95 của kích thước yêu cầu, đặt nó cạnh mốc 100.000 token, và phép so sánh ở trên sẽ thu gọn thành một câu duy nhất cho lưu lượng của bạn.
