
Claude Haiku 5.5 so với Qwen3.8-Flash-Next: Mô hình trọng số mở không phải là mô hình rẻ
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Trực giác mách bảo rằng một mô hình trọng số mở thuộc phân khúc flash của Alibaba sẽ hạ giá so với một mô hình nhỏ dạng đóng của Anthropic, và xét trên hai con số niêm yết thì đúng là như vậy: Qwen3.8-Flash-Next được phục vụ ở mức 0,15 USD mỗi triệu token đầu vào và 0,47 USD mỗi triệu token đầu ra trên API của chính Alibaba, so với 0,10 USD và 0,50 USD của Claude Haiku 5.5. Tuy nhiên, khi chạy cả hai trên cùng một bộ benchmark, thứ tự lại đảo ngược. Artificial Analysis đo Claude Haiku 5.5 ở mức nỗ lực Max tốn 0,21 USD cho mỗi tác vụ Intelligence Index hoàn thành; Qwen3.8-Flash-Next tốn 0,37 USD cho cùng phép đo đó, mà điểm số lại thấp hơn ba điểm. Con số niêm yết rẻ hơn lại thuộc về mô hình có hóa đơn lớn hơn, và lý do cũng chính là lý do quyết định phần lớn những so sánh kiểu này: bảng giá không phải là cái giá, và mô hình trọng số mở kiếm sống ở một nơi khác chứ không phải ở hóa đơn API dịch vụ được quản lý. Cái "nơi khác" đó mới chính là chủ đề thực sự của màn đối đầu này.
Mỗi loại là gì
Hai thứ đó xuất hiện cách nhau sáu tuần và chúng không phải là cùng một loại tạo tác.
• Claude Haiku 5.5 — một mô hình trọng số đóng được phát hành ngày 7 tháng 10 năm 2026, trên Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry và Claude Platform on AWS. Ngữ cảnh 1M token, tối đa 128.000 token đầu ra trên Messages API đồng bộ, tư duy thích ứng với thang điều chỉnh nỗ lực từ Thấp đến Tối đa và mặc định là trung bình, mốc kiến thức tháng 6 năm 2026, và bảng giá phân bậc tại 100.000 token.
• Qwen3.8-Flash-Next — một mô hình hỗn hợp chuyên gia trọng số mở được phát hành ngày 26 tháng 8 năm 2026 theo giấy phép qwen-community-1.0, được Alibaba mô tả là bản xem trước thử nghiệm của kiến trúc sẽ làm nền tảng cho Qwen4. Nó lưu trữ 125B tham số mô hình chính cùng một bảng nhúng n-gram 51B riêng biệt — khoảng 176B trước một mô-đun dự đoán đa token 4B — và kích hoạt 6B mỗi token, với 512 chuyên gia, định tuyến top-10 và 48 lớp. Về bản chất, nó có 262.144 token ngữ cảnh, có thể mở rộng lên 1M với YaRN và nhận đầu vào văn bản, hình ảnh và video.
• Qwen3.8-Flash — bản thương mại được cung cấp qua dịch vụ, cũng đã hoạt động từ ngày 26 tháng 8 năm 2026 trên QwenCloud của Alibaba với mức giá 0,16 USD mỗi triệu token đầu vào và 0,47 USD mỗi triệu token đầu ra, cùng ngữ cảnh mặc định 1 triệu token. Đáng để tách riêng khỏi Flash-Next: một bên là checkpoint bạn có thể tải về và kiểm tra, bên kia là một endpoint được quản lý có tính phí.
Sự khác biệt giữa hai mục cuối chính là toàn bộ lý do khiến phép so sánh này trở nên thú vị. Claude Haiku 5.5 và Qwen3.8-Flash-Next hầu như chẳng cạnh tranh được ở điểm nào, bởi chỉ một trong hai mới có thể chạy trên phần cứng của chính bạn.
Hóa đơn được đo lường, vốn chỉ về hướng ngược lại
Tất cả các số liệu độc lập sau đây đều đến từ Artificial Analysis trên Intelligence Index v4.3.2. Bảng giá của Anthropic và Alibaba là mức giá do chính các nhà cung cấp công bố.
• Chỉ số Trí tuệ — Claude Haiku 5.5 đạt 43 điểm ở chế độ Max effort, đứng thứ hai trong số 182 mô hình. Qwen3.8-Flash-Next đạt 40, thứ sáu trong số 117 mô hình cùng phân khúc. Cách nhau ba điểm, nghiêng về phía Anthropic.
• Chi phí mỗi tác vụ — 0,21 đô so với 0,37 đô. Mô hình đắt hơn trên mỗi token lại rẻ hơn 43% cho mỗi tác vụ hoàn thành.
• Số token đầu ra trong lần chạy Index — 440 triệu đối với Claude Haiku 5.5 và 240 triệu đối với Qwen3.8-Flash-Next, cả hai đều so với mức trung vị 100 triệu. Mô hình Qwen viết tiết kiệm hơn mà vẫn là tác vụ tốn kém hơn, điều đó cho thấy khoảng cách không chỉ nằm ở khối lượng token mà còn ở sự pha trộn giữa đầu vào và cách định giá mà bên đánh giá áp dụng.
• Tốc độ đầu ra — 241.9 token mỗi giây so với 56.0. Claude Haiku 5.5 nhanh hơn gấp bốn lần trong cùng phép đo, và thời gian đến token đầu tiên là 295 giây của nó trong lần chạy đó là hệ quả của việc suy luận ở mức Max effort chứ không phải là một con số về mạng; thời gian đến token đầu tiên của Qwen3.8-Flash-Next là 2.53 giây.
• Hình dạng bảng giá — Claude Haiku 5.5 tăng theo bậc từ $0.10 và $0.50 lên $0.50 và $2.50 tại mốc 100.000 token. Qwen3.8-Flash giữ mức phẳng $0.16 và $0.47 bất kể độ dài, đây là lợi thế thực sự với các prompt dài và là điểm duy nhất mà lập luận về giá niêm yết còn trụ vững khi tiếp xúc với một tài liệu dài.
• Tokeniser — Claude Haiku 5.5 sử dụng tokenizer mới hơn, dùng chung với Claude 4.7 và các phiên bản sau này, nên cùng một đoạn văn bản sẽ được tính thành khoảng 30% số token nhiều hơn so với Haiku trước đó. Điều này làm phồng các prompt lên tới mốc 100.000 token; đây là tài liệu của chính Anthropic, và nó bất lợi cho mô hình đúng trong trường hợp prompt dài — nơi mức giá đồng nhất của Qwen trông có lợi nhất.
Vậy hình dạng của sự đánh đổi là: trả nhiều hơn trên mỗi token, nhận được câu trả lời nhanh hơn, thông minh hơn một chút và tốn ít hơn trên mỗi tác vụ hoàn thành, kèm một ngưỡng giá tăng vọt cần lưu ý khi đầu vào dài. Hoặc trả ít hơn trên mỗi token và nhận được mô hình chậm hơn, tốn nhiều hơn trên mỗi tác vụ hoàn thành, với mức giá cố định và cửa sổ gốc 262.144 token.


Nơi các trọng số mở thực sự thay đổi cục diện
Tất cả những điều ở trên so sánh hai API được quản lý, và đó là cuộc so sánh mà Qwen3.8-Flash-Next không được thiết kế để giành phần thắng. Lập luận của nó là nó không cần phải được thuê.
• Hỗ trợ serving ngay từ ngày đầu tiên. SGLang đã phát hành một trang cookbook và một image chuyên dụng; vLLM đã có bản build cho nó trong khi pull request hỗ trợ kiến trúc vẫn đang mở. NVIDIA đã xác thực cả hai, cùng với TensorRT LLM, trên một rack GB300 NVL72, và NeMo đảm nhiệm việc fine-tuning.
• Yêu cầu phần cứng tối thiểu rất thấp đối với một checkpoint 176B. Bảng embedding n-gram 51B có thể nằm trong bộ nhớ host thay vì VRAM, vì các địa chỉ tra cứu của nó đã được biết trước và có thể nạp trước (prefetch). Đó chính là điều cho phép mô hình chạy trên các cụm DGX Spark và các máy trạm 4×RTX PRO 6000, cùng các bản lượng tử hóa do cộng đồng thực hiện trong cùng ngày — những bản build 1-bit vừa vặn trong 75GB RAM với độ chính xác khoảng 80% so với bản đầy đủ — đưa nó lên phần cứng mà một nhóm nhỏ cũng có thể sở hữu.
• Tinh chỉnh có sẵn. Không theo nghĩa một API tinh chỉnh được host: trọng số là của bạn, theo một giấy phép cộng đồng với các điều kiện thông thường, và kiến trúc được ghi lại trong một báo cáo kỹ thuật công bố các thí nghiệm ablation và các kết quả phủ định.
• Cửa sổ nhỏ hơn vẻ ngoài của nó. 262.144 token gốc, có thể mở rộng lên 1M với YaRN — so với 1M gốc trên Claude Haiku 5.5, không kèm lưu ý nào về rope-scaling. Trên các khối lượng công việc tài liệu dài, nơi mức giá đồng nhất của Qwen trông hấp dẫn nhất, thì mô hình thực sự có thể chứa được tài liệu lại là mô hình còn lại.
• Các benchmark do nhà cung cấp tự công bố. Bảng của chính Alibaba đặt Flash-Next dẫn trước DeepSeek-V4-Flash-0731 trên DeepSWE 1.1 (58,7 so với 54,4), SWE-bench Pro (62,5 so với 56,0) và GPQA Diamond (91,7 so với 90,8), và xếp sau nó trên NL2Repo-Bench (48,1 so với 54,2) — sinh mã ở cấp kho lưu trữ, khía cạnh tác tử duy nhất mà mô hình nhỏ hơn không theo kịp. Chưa có phần nào trong số đó được bên thứ ba tái lập, và mô hình mới chỉ sáu tuần tuổi.
Đó là ranh giới trung thực giữa hai bên. Claude Haiku 5.5 là một dịch vụ tính phí theo mức sử dụng với trần chất lượng cố định và không có bề mặt vận hành. Qwen3.8-Flash-Next là một tạo tác có đường cong chi phí uốn xuống tiệm cận giá điện, với trần chất lượng là bất cứ thứ gì bạn có thể phục vụ, cộng thêm rủi ro về một bảng benchmark chưa được tái lập và một kiến trúc vẫn đang được các runtime hấp thụ.
Cách thực tế để đưa ra quyết định
Ba câu hỏi là đủ để giải quyết vấn đề, và chỉ câu hỏi đầu tiên là về benchmark.
Bạn có GPU không, hoặc có muốn có không? Nếu không, trường hợp tự vận hành chỉ mang tính lý thuyết và phần so sánh dịch vụ được quản lý ở trên là toàn bộ câu chuyện — và nó nghiêng về Claude Haiku 5.5 xét về chi phí mỗi tác vụ, tốc độ và điểm số, với lưu ý rằng bước 100.000 token của nó gây bất lợi cho các prompt dài. Nếu bạn thực sự có các bộ tăng tốc đang nằm dưới mục tiêu tận dụng, Qwen3.8-Flash-Next là một trong số ít mô hình mở mà việc giải mã với 6B tham số hoạt động thực sự rẻ khi chạy ở khối lượng lớn, và con số $0.37 mỗi tác vụ không còn là con số liên quan nữa.
Độ dài prompt trung bình là bao nhiêu? Đây là chỗ duy nhất mà lập luận về mức giá cố định còn đứng vững. Dưới 100.000 token — sau khi qua bộ tách token vốn thổi phồng khoảng 30% — Claude Haiku 5.5 rẻ hơn trên mọi thước đo. Trên ngưỡng đó, mức giá cố định $0.16 và $0.47 là lựa chọn tốt hơn, và lợi thế của nó mở rộng theo độ dài cho tới tận cửa sổ gốc 262.144 token, vượt qua mức đó thì phần mở rộng YaRN là một bài toán kỹ thuật khác.
Khả năng chịu đựng của khối lượng công việc đối với độ biến thiên độ trễ là bao nhiêu? 241,9 token đầu ra mỗi giây so với 56,0 là một khoảng cách lớn, và việc triển khai tự lưu trữ còn cộng thêm tình trạng xếp hàng vào đó. Một tác nhân hỗ trợ trực tiếp hoặc điều khiển trình duyệt — những khối lượng công việc mà Anthropic nêu tên cho hạng này — sẽ cảm nhận được sự khác biệt.
Với bất kỳ ai muốn trả lời câu hỏi thứ hai và thứ ba thay vì suy luận về chúng, công cụ rẻ nhất là một endpoint dùng chung. Qwen3.8-Flash-Next vẫn chưa có trong danh mục của OrcaRouter, và Claude Haiku 5.5 cũng vậy; người anh em Qwen mà chúng tôi định tuyến là Qwen3.8-Flash, theo giá niêm yết của nhà cung cấp với mức chênh 0% được chuyển thẳng, đây là mô hình tương đương gần nhất đang được phục vụ so với mô hình trong so sánh này và là đường cơ sở đúng cho một bài kiểm tra chi phí với prompt dài. Về phía Anthropic, Claude Haiku 4.5, Claude Sonnet 5.5 và Claude Opus 5.5 đều có thể gọi từ cùng một key ngay hôm nay, nên một thí nghiệm giá hai thế hệ chỉ là một cấu hình chứ không phải một hợp đồng thứ hai — và vì cách tính giá là chuyển thẳng chứ không phải gộp chung, việc nhà cung cấp giảm giá ở một trong hai nhánh sẽ xuất hiện ở phía chúng tôi ngay trong ngày được công bố. Chuyển đổi dự phòng tự động chính là điều khiến thí nghiệm này an toàn khi chạy trên lưu lượng thật: một mô hình xem trước hay một bảng benchmark chưa được tái lập chính là trường hợp để trỏ một tuyến tới thứ mới trong khi một mô hình đáng tin cậy đứng phía sau.
Điều gì sẽ làm thay đổi câu trả lời
Hai điều, cả hai đều có thể kiểm chứng. Điều thứ nhất là việc đánh giá độc lập Qwen3.8-Flash-Next trên một harness cũng chạy Claude Haiku 5.5 — bảng của nhà cung cấp là so với DeepSeek, còn con số 40 của bảng xếp hạng độc lập chỉ là một lần xếp hạng duy nhất. Điểm lập trình ở cấp kho mã là dòng cần để mắt tới, vì NL2Repo chính là nơi mô hình đã được chứng minh là tụt lại phía sau. Điều thứ hai là liệu phần việc về runtime có thành công hay không: hỗ trợ vLLM vẫn đang được hợp nhất thông qua các pull request đang mở, và cho đến khi việc đó hoàn tất, việc tự vận hành kiến trúc này chỉ là một bài tập dành cho những đội thích kiểu đó chứ không phải một lộ trình được hỗ trợ.
Cho đến lúc đó, bản tóm tắt vẫn ngắn gọn. Qwen3.8-Flash-Next là mô hình thú vị hơn để sở hữu và là mô hình đắt hơn để thuê. Claude Haiku 5.5 là endpoint được quản lý rẻ hơn, nhanh hơn, đạt điểm cao hơn, với bảng giá trừng phạt mọi thứ dài. Hãy chọn dựa trên việc bạn đang mua token hay mua checkpoint — và nếu bạn đang mua token, hãy lưu ý rằng mô hình trọng số mở không phải là mức giảm giá mà bạn tưởng.

