Một thẻ tiêu đề được tạo ghi 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next' với phụ đề 'Mô hình trọng số mở không phải là mô hình rẻ', một thanh có nhãn 'Chi phí cho mỗi tác vụ Intelligence Index đã hoàn thành' được đánh dấu $0.21 cho Claude Haiku 5.5 và $0.37 cho Qwen3.8-Flash-Next, và một dòng chân trang ghi 'Số liệu độc lập theo Artificial Analysis; số liệu theo Alibaba.' Logo OrcaRouter thật được ghép ở góc dưới bên phải.
Guides & Insights

Claude Haiku 5.5 so với Qwen3.8-Flash-Next: Mô hình trọng số mở không phải là mô hình rẻ

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Trực giác mách bảo rằng một mô hình trọng số mở thuộc phân khúc flash của Alibaba sẽ hạ giá so với một mô hình nhỏ dạng đóng của Anthropic, và xét trên hai con số niêm yết thì đúng là như vậy: Qwen3.8-Flash-Next được phục vụ ở mức 0,15 USD mỗi triệu token đầu vào và 0,47 USD mỗi triệu token đầu ra trên API của chính Alibaba, so với 0,10 USD và 0,50 USD của Claude Haiku 5.5. Tuy nhiên, khi chạy cả hai trên cùng một bộ benchmark, thứ tự lại đảo ngược. Artificial Analysis đo Claude Haiku 5.5 ở mức nỗ lực Max tốn 0,21 USD cho mỗi tác vụ Intelligence Index hoàn thành; Qwen3.8-Flash-Next tốn 0,37 USD cho cùng phép đo đó, mà điểm số lại thấp hơn ba điểm. Con số niêm yết rẻ hơn lại thuộc về mô hình có hóa đơn lớn hơn, và lý do cũng chính là lý do quyết định phần lớn những so sánh kiểu này: bảng giá không phải là cái giá, và mô hình trọng số mở kiếm sống ở một nơi khác chứ không phải ở hóa đơn API dịch vụ được quản lý. Cái "nơi khác" đó mới chính là chủ đề thực sự của màn đối đầu này.

Mỗi loại là gì

Hai thứ đó xuất hiện cách nhau sáu tuần và chúng không phải là cùng một loại tạo tác.

• Claude Haiku 5.5 — một mô hình trọng số đóng được phát hành ngày 7 tháng 10 năm 2026, trên Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry và Claude Platform on AWS. Ngữ cảnh 1M token, tối đa 128.000 token đầu ra trên Messages API đồng bộ, tư duy thích ứng với thang điều chỉnh nỗ lực từ Thấp đến Tối đa và mặc định là trung bình, mốc kiến thức tháng 6 năm 2026, và bảng giá phân bậc tại 100.000 token.

• Qwen3.8-Flash-Next — một mô hình hỗn hợp chuyên gia trọng số mở được phát hành ngày 26 tháng 8 năm 2026 theo giấy phép qwen-community-1.0, được Alibaba mô tả là bản xem trước thử nghiệm của kiến trúc sẽ làm nền tảng cho Qwen4. Nó lưu trữ 125B tham số mô hình chính cùng một bảng nhúng n-gram 51B riêng biệt — khoảng 176B trước một mô-đun dự đoán đa token 4B — và kích hoạt 6B mỗi token, với 512 chuyên gia, định tuyến top-10 và 48 lớp. Về bản chất, nó có 262.144 token ngữ cảnh, có thể mở rộng lên 1M với YaRN và nhận đầu vào văn bản, hình ảnh và video.

• Qwen3.8-Flash — bản thương mại được cung cấp qua dịch vụ, cũng đã hoạt động từ ngày 26 tháng 8 năm 2026 trên QwenCloud của Alibaba với mức giá 0,16 USD mỗi triệu token đầu vào và 0,47 USD mỗi triệu token đầu ra, cùng ngữ cảnh mặc định 1 triệu token. Đáng để tách riêng khỏi Flash-Next: một bên là checkpoint bạn có thể tải về và kiểm tra, bên kia là một endpoint được quản lý có tính phí.

Sự khác biệt giữa hai mục cuối chính là toàn bộ lý do khiến phép so sánh này trở nên thú vị. Claude Haiku 5.5 và Qwen3.8-Flash-Next hầu như chẳng cạnh tranh được ở điểm nào, bởi chỉ một trong hai mới có thể chạy trên phần cứng của chính bạn.

Hóa đơn được đo lường, vốn chỉ về hướng ngược lại

Tất cả các số liệu độc lập sau đây đều đến từ Artificial Analysis trên Intelligence Index v4.3.2. Bảng giá của Anthropic và Alibaba là mức giá do chính các nhà cung cấp công bố.

• Chỉ số Trí tuệ — Claude Haiku 5.5 đạt 43 điểm ở chế độ Max effort, đứng thứ hai trong số 182 mô hình. Qwen3.8-Flash-Next đạt 40, thứ sáu trong số 117 mô hình cùng phân khúc. Cách nhau ba điểm, nghiêng về phía Anthropic.

• Chi phí mỗi tác vụ — 0,21 đô so với 0,37 đô. Mô hình đắt hơn trên mỗi token lại rẻ hơn 43% cho mỗi tác vụ hoàn thành.

• Số token đầu ra trong lần chạy Index — 440 triệu đối với Claude Haiku 5.5 và 240 triệu đối với Qwen3.8-Flash-Next, cả hai đều so với mức trung vị 100 triệu. Mô hình Qwen viết tiết kiệm hơn mà vẫn là tác vụ tốn kém hơn, điều đó cho thấy khoảng cách không chỉ nằm ở khối lượng token mà còn ở sự pha trộn giữa đầu vào và cách định giá mà bên đánh giá áp dụng.

• Tốc độ đầu ra — 241.9 token mỗi giây so với 56.0. Claude Haiku 5.5 nhanh hơn gấp bốn lần trong cùng phép đo, và thời gian đến token đầu tiên là 295 giây của nó trong lần chạy đó là hệ quả của việc suy luận ở mức Max effort chứ không phải là một con số về mạng; thời gian đến token đầu tiên của Qwen3.8-Flash-Next là 2.53 giây.

• Hình dạng bảng giá — Claude Haiku 5.5 tăng theo bậc từ $0.10 và $0.50 lên $0.50 và $2.50 tại mốc 100.000 token. Qwen3.8-Flash giữ mức phẳng $0.16 và $0.47 bất kể độ dài, đây là lợi thế thực sự với các prompt dài và là điểm duy nhất mà lập luận về giá niêm yết còn trụ vững khi tiếp xúc với một tài liệu dài.

• Tokeniser — Claude Haiku 5.5 sử dụng tokenizer mới hơn, dùng chung với Claude 4.7 và các phiên bản sau này, nên cùng một đoạn văn bản sẽ được tính thành khoảng 30% số token nhiều hơn so với Haiku trước đó. Điều này làm phồng các prompt lên tới mốc 100.000 token; đây là tài liệu của chính Anthropic, và nó bất lợi cho mô hình đúng trong trường hợp prompt dài — nơi mức giá đồng nhất của Qwen trông có lợi nhất.

Vậy hình dạng của sự đánh đổi là: trả nhiều hơn trên mỗi token, nhận được câu trả lời nhanh hơn, thông minh hơn một chút và tốn ít hơn trên mỗi tác vụ hoàn thành, kèm một ngưỡng giá tăng vọt cần lưu ý khi đầu vào dài. Hoặc trả ít hơn trên mỗi token và nhận được mô hình chậm hơn, tốn nhiều hơn trên mỗi tác vụ hoàn thành, với mức giá cố định và cửa sổ gốc 262.144 token.

A screenshot of OrcaRouter's model page for qwen/qwen3.8-flash, showing the model card and its list pricing of $0.15 per million input tokens and $0.47 per million output tokens, captured in English.A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

Nơi các trọng số mở thực sự thay đổi cục diện

Tất cả những điều ở trên so sánh hai API được quản lý, và đó là cuộc so sánh mà Qwen3.8-Flash-Next không được thiết kế để giành phần thắng. Lập luận của nó là nó không cần phải được thuê.

• Hỗ trợ serving ngay từ ngày đầu tiên. SGLang đã phát hành một trang cookbook và một image chuyên dụng; vLLM đã có bản build cho nó trong khi pull request hỗ trợ kiến trúc vẫn đang mở. NVIDIA đã xác thực cả hai, cùng với TensorRT LLM, trên một rack GB300 NVL72, và NeMo đảm nhiệm việc fine-tuning.

• Yêu cầu phần cứng tối thiểu rất thấp đối với một checkpoint 176B. Bảng embedding n-gram 51B có thể nằm trong bộ nhớ host thay vì VRAM, vì các địa chỉ tra cứu của nó đã được biết trước và có thể nạp trước (prefetch). Đó chính là điều cho phép mô hình chạy trên các cụm DGX Spark và các máy trạm 4×RTX PRO 6000, cùng các bản lượng tử hóa do cộng đồng thực hiện trong cùng ngày — những bản build 1-bit vừa vặn trong 75GB RAM với độ chính xác khoảng 80% so với bản đầy đủ — đưa nó lên phần cứng mà một nhóm nhỏ cũng có thể sở hữu.

• Tinh chỉnh có sẵn. Không theo nghĩa một API tinh chỉnh được host: trọng số là của bạn, theo một giấy phép cộng đồng với các điều kiện thông thường, và kiến trúc được ghi lại trong một báo cáo kỹ thuật công bố các thí nghiệm ablation và các kết quả phủ định.

• Cửa sổ nhỏ hơn vẻ ngoài của nó. 262.144 token gốc, có thể mở rộng lên 1M với YaRN — so với 1M gốc trên Claude Haiku 5.5, không kèm lưu ý nào về rope-scaling. Trên các khối lượng công việc tài liệu dài, nơi mức giá đồng nhất của Qwen trông hấp dẫn nhất, thì mô hình thực sự có thể chứa được tài liệu lại là mô hình còn lại.

• Các benchmark do nhà cung cấp tự công bố. Bảng của chính Alibaba đặt Flash-Next dẫn trước DeepSeek-V4-Flash-0731 trên DeepSWE 1.1 (58,7 so với 54,4), SWE-bench Pro (62,5 so với 56,0) và GPQA Diamond (91,7 so với 90,8), và xếp sau nó trên NL2Repo-Bench (48,1 so với 54,2) — sinh mã ở cấp kho lưu trữ, khía cạnh tác tử duy nhất mà mô hình nhỏ hơn không theo kịp. Chưa có phần nào trong số đó được bên thứ ba tái lập, và mô hình mới chỉ sáu tuần tuổi.

Đó là ranh giới trung thực giữa hai bên. Claude Haiku 5.5 là một dịch vụ tính phí theo mức sử dụng với trần chất lượng cố định và không có bề mặt vận hành. Qwen3.8-Flash-Next là một tạo tác có đường cong chi phí uốn xuống tiệm cận giá điện, với trần chất lượng là bất cứ thứ gì bạn có thể phục vụ, cộng thêm rủi ro về một bảng benchmark chưa được tái lập và một kiến trúc vẫn đang được các runtime hấp thụ.

Cách thực tế để đưa ra quyết định

Ba câu hỏi là đủ để giải quyết vấn đề, và chỉ câu hỏi đầu tiên là về benchmark.

Bạn có GPU không, hoặc có muốn có không? Nếu không, trường hợp tự vận hành chỉ mang tính lý thuyết và phần so sánh dịch vụ được quản lý ở trên là toàn bộ câu chuyện — và nó nghiêng về Claude Haiku 5.5 xét về chi phí mỗi tác vụ, tốc độ và điểm số, với lưu ý rằng bước 100.000 token của nó gây bất lợi cho các prompt dài. Nếu bạn thực sự có các bộ tăng tốc đang nằm dưới mục tiêu tận dụng, Qwen3.8-Flash-Next là một trong số ít mô hình mở mà việc giải mã với 6B tham số hoạt động thực sự rẻ khi chạy ở khối lượng lớn, và con số $0.37 mỗi tác vụ không còn là con số liên quan nữa.

Độ dài prompt trung bình là bao nhiêu? Đây là chỗ duy nhất mà lập luận về mức giá cố định còn đứng vững. Dưới 100.000 token — sau khi qua bộ tách token vốn thổi phồng khoảng 30% — Claude Haiku 5.5 rẻ hơn trên mọi thước đo. Trên ngưỡng đó, mức giá cố định $0.16 và $0.47 là lựa chọn tốt hơn, và lợi thế của nó mở rộng theo độ dài cho tới tận cửa sổ gốc 262.144 token, vượt qua mức đó thì phần mở rộng YaRN là một bài toán kỹ thuật khác.

Khả năng chịu đựng của khối lượng công việc đối với độ biến thiên độ trễ là bao nhiêu? 241,9 token đầu ra mỗi giây so với 56,0 là một khoảng cách lớn, và việc triển khai tự lưu trữ còn cộng thêm tình trạng xếp hàng vào đó. Một tác nhân hỗ trợ trực tiếp hoặc điều khiển trình duyệt — những khối lượng công việc mà Anthropic nêu tên cho hạng này — sẽ cảm nhận được sự khác biệt.

Với bất kỳ ai muốn trả lời câu hỏi thứ hai và thứ ba thay vì suy luận về chúng, công cụ rẻ nhất là một endpoint dùng chung. Qwen3.8-Flash-Next vẫn chưa có trong danh mục của OrcaRouter, và Claude Haiku 5.5 cũng vậy; người anh em Qwen mà chúng tôi định tuyến là Qwen3.8-Flash, theo giá niêm yết của nhà cung cấp với mức chênh 0% được chuyển thẳng, đây là mô hình tương đương gần nhất đang được phục vụ so với mô hình trong so sánh này và là đường cơ sở đúng cho một bài kiểm tra chi phí với prompt dài. Về phía Anthropic, Claude Haiku 4.5, Claude Sonnet 5.5 và Claude Opus 5.5 đều có thể gọi từ cùng một key ngay hôm nay, nên một thí nghiệm giá hai thế hệ chỉ là một cấu hình chứ không phải một hợp đồng thứ hai — và vì cách tính giá là chuyển thẳng chứ không phải gộp chung, việc nhà cung cấp giảm giá ở một trong hai nhánh sẽ xuất hiện ở phía chúng tôi ngay trong ngày được công bố. Chuyển đổi dự phòng tự động chính là điều khiến thí nghiệm này an toàn khi chạy trên lưu lượng thật: một mô hình xem trước hay một bảng benchmark chưa được tái lập chính là trường hợp để trỏ một tuyến tới thứ mới trong khi một mô hình đáng tin cậy đứng phía sau.

Điều gì sẽ làm thay đổi câu trả lời

Hai điều, cả hai đều có thể kiểm chứng. Điều thứ nhất là việc đánh giá độc lập Qwen3.8-Flash-Next trên một harness cũng chạy Claude Haiku 5.5 — bảng của nhà cung cấp là so với DeepSeek, còn con số 40 của bảng xếp hạng độc lập chỉ là một lần xếp hạng duy nhất. Điểm lập trình ở cấp kho mã là dòng cần để mắt tới, vì NL2Repo chính là nơi mô hình đã được chứng minh là tụt lại phía sau. Điều thứ hai là liệu phần việc về runtime có thành công hay không: hỗ trợ vLLM vẫn đang được hợp nhất thông qua các pull request đang mở, và cho đến khi việc đó hoàn tất, việc tự vận hành kiến trúc này chỉ là một bài tập dành cho những đội thích kiểu đó chứ không phải một lộ trình được hỗ trợ.

Cho đến lúc đó, bản tóm tắt vẫn ngắn gọn. Qwen3.8-Flash-Next là mô hình thú vị hơn để sở hữu và là mô hình đắt hơn để thuê. Claude Haiku 5.5 là endpoint được quản lý rẻ hơn, nhanh hơn, đạt điểm cao hơn, với bảng giá trừng phạt mọi thứ dài. Hãy chọn dựa trên việc bạn đang mua token hay mua checkpoint — và nếu bạn đang mua token, hãy lưu ý rằng mô hình trọng số mở không phải là mức giảm giá mà bạn tưởng.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next — the scoreboard'. Left column Claude Haiku 5.5: weights, closed and API-only; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; native context 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21; measured output speed 241.9 tokens per second. Right column Qwen3.8-Flash-Next: weights, open under the qwen-community-1.0 license; served price $0.16 per million input and $0.47 per million output, flat; native context 262,144 tokens, extensible to 1M with YaRN; independent score 40, rank 6 of 117; cost per task $0.37; measured output speed 56.0 tokens per second. A footer line reads 'Vendor pricing per Anthropic and Alibaba; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.