Một thẻ hero có tiêu đề 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next', hiển thị Claude Haiku 5.5 ở mức $0.10 đầu vào và $0.50 đầu ra với ngữ cảnh 1M so với Qwen3.8-Flash-Next ở mức $0.15 đầu vào và $0.47 đầu ra với ngữ cảnh 256K, một hàng giữa ghi 'kết hợp 3:1 $0.20 vs $0.23', và một hàng dưới ghi 'Index v4.3.2 - 43.40 vs 39.82 - $0.21 vs $0.37 mỗi tác vụ'.
Engineering & Research

Claude Haiku 5.5 so với Qwen3.8-Flash-Next: Chênh nhau ba xu mỗi token, bảy mươi tám xu mỗi công việc đã hoàn thành

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt hai bảng giá cạnh nhau và chúng trông như thể cùng bước ra từ một cuộc họp. Claude Haiku 5.5 có giá 0,10 USD cho đầu vào và 0,50 USD cho đầu ra. Qwen3.8-Flash-Next có giá 0,15 USD cho đầu vào và 0,47 USD cho đầu ra. Mô hình của nhà cung cấp rẻ hơn một phần ba ở đầu vào và đắt hơn sáu phần trăm ở đầu ra. Không nhà cung cấp nào tạo ra hình dạng đó một cách vô tình, và cũng không ai công bố một ghi chú so sánh giải thích họ đang nhắm tới điều gì — nhưng phép tính của một khối lượng công việc hỗn hợp theo tỉ lệ 3:1 khiến ý đồ trở nên rõ ràng, và nó khiến cặp đôi này trở thành cặp giá gần nhau nhất trong toàn bộ phân khúc này.

Đó là điểm mà sự tương đồng kết thúc. Claude Haiku 5.5 là một mô hình API đóng ra mắt ngày 2026-10-07 với cửa sổ một triệu token và đầu ra tối đa 128.000 token. Qwen3.8-Flash-Neo là một mô hình trọng số mở 180 tỷ tham số với 6 tỷ tham số hoạt động, trọng số theo Giấy phép Cộng đồng Qwen 1.0, và cửa sổ ngữ cảnh được công bố mà cấu hình checkpoint của chính nó và thẻ mô hình không hoàn toàn thống nhất với nhau. Phát hành ngày 2026-08-26, nó không mới cũng không xa lạ đối với bất kỳ ai đang xây dựng trong phân khúc này.

Cả hai được định giá cùng nhau là có chủ đích. Điều mà các bảng giá không thể cho bạn biết là chúng được tạo ra cho những công việc khác nhau, và cái trông có vẻ rẻ hơn trên bảng tính lại là cái tốn kém hơn để vận hành.

Phép tính tiết lộ mức giá

Kết hợp hai mức giá theo tỷ lệ đầu vào-đầu ra phổ biến là 3:1 — tỷ lệ mà hầu hết lưu lượng chat và hỗ trợ lập trình đều xoay quanh — bạn sẽ có mức $0,20 mỗi triệu token cho Claude Haiku 5.5 và $0,23 mỗi triệu token cho Qwen3.8-Flash-Next. Mô hình của Anthropic rẻ hơn khoảng 13% theo cách kết hợp đó, một khoảng cách nhỏ hơn so với hàm ý từ cột đầu vào và lớn hơn so với cột đầu ra.

Đổi tỷ lệ và vị trí thay đổi. Ở tỷ lệ 1:1, hai mô hình ở mức $0.30 và $0.31 mỗi triệu — một kết quả hòa nằm trong sai số làm tròn. Ở tỷ lệ 1:3, thiên về đầu ra, Claude Haiku 5.5 ở mức $0.40 và Qwen3.8-Flash-Next ở mức $0.39, Qwen thắng một xu và đây là tỷ lệ duy nhất mà mô hình của Anthropic không rẻ hơn trong hai.

Vậy nên không có một câu trả lời trung thực duy nhất cho câu hỏi "cái nào rẻ hơn", và bất kỳ so sánh nào đưa ra một câu trả lời như vậy đều đang thay người đọc chọn một tỷ lệ. Điều có thể bảo vệ được là thế này: thẻ của Claude Haiku 5.5 được cân chỉnh cho lưu lượng thiên về đầu vào, còn thẻ của Qwen3.8-Flash-Next được cân chỉnh cho lưu lượng thiên về đầu ra, và mức ba xu mỗi triệu token khiến chúng chênh nhau ở tỷ lệ 3:1 là mức gần nhất mà bất kỳ ai đã đạt tới để khớp với con số của Anthropic trong phân khúc này. Đó là một sự định vị có chủ đích, bất kể tài liệu ra mắt nói gì.

Danh mục của chúng tôi niêm yết Qwen3.8-Flash-Next ở mức 0,15 USD cho đầu vào và 0,47 USD cho đầu ra trên mỗi triệu token, với mức giá 0,0184 USD cho đầu vào được lưu trong bộ nhớ đệm. Mức 0,15 USD và 0,47 USD là cùng những con số mà Artificial Analysis ghi nhận là giá niêm yết của nhà cung cấp, tức là kết quả mà thỏa thuận chuyển tiếp được cho là sẽ tạo ra.

Cái giá thực sự của một ngày có khối lượng thực

Giả sử có một pipeline đẩy 10 triệu token đầu vào và 2 triệu token đầu ra mỗi ngày. Đó là một khối lượng công việc production nhỏ, nằm gọn trong bậc giá đầu tiên với độ dài prompt thông thường.

• Chi phí đầu vào — 1,00 USD mỗi ngày trên Claude Haiku 5.5, 1,50 USD mỗi ngày trên Qwen3.8-Flash-Next.

Chi phí đầu ra — 1,00 USD một ngày trên Claude Haiku 5.5, 0,94 USD một ngày trên Qwen3.8-Flash-Next.

Tổng cộng hằng ngày — $2.00 so với $2.44. Ở quy mô đó, chênh lệch khoảng $160 một năm, tức khoảng 3,7 xu cho mỗi triệu token.

Giờ hãy áp dụng hai điều chỉnh mà bảng giá bỏ qua, thì chiều hướng sẽ đảo ngược.

Đầu tiên, Claude Haiku 5.5 sử dụng tokenizer mới hơn, dùng chung với Claude 4.7 và các phiên bản sau; theo tài liệu của chính Anthropic, tokenizer này đếm cùng một đoạn văn bản thành lượng token nhiều hơn khoảng 30% so với mô hình mà nó thay thế. Nếu đầu vào của bạn là văn xuôi tiếng Anh thuộc loại mà các số liệu token đó được đo trên, thì mức giá đầu vào hiệu dụng không phải là $0.10 — mà gần với $0.13 cho mỗi một triệu từ văn bản, khiến nó chỉ còn cách Qwen3.8-Flash-Next trong khoảng hai xu, thay vì thấp hơn một phần ba.

Thứ hai, và còn lớn hơn: Claude Haiku 5.5 dài dòng. Artificial Analysis đã ghi nhận 162.164 token đầu ra cho nó khi chạy Intelligence Index, so với 107.884 cho Qwen3.8-Flash-Next. Nếu tỷ lệ đó vẫn giữ nguyên trên khối lượng công việc của bạn thay vì mức 3:1 trừu tượng, thì dòng đầu ra ở trên không còn là $1,00 so với $0,94 nữa mà trở thành gần $1,50 so với $0,94 — và tổng theo ngày sẽ đảo chiều có lợi cho Qwen.

Không điều chỉnh nào tự thân mang tính quyết định. Khi kết hợp lại, chúng tạo nên khác biệt giữa việc hai mô hình chỉ chênh nhau một sai số làm tròn và việc Qwen3.8-Flash-Next thực sự rẻ hơn đáng kể khi vận hành, và cách duy nhất để biết trường hợp nào áp dụng là tự đếm token trên lưu lượng của chính bạn thay vì suy luận từ bảng giá.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next - the scoreboard' with rows Index v4.3.2 43.40 against 39.82, cost per task $0.21 against $0.37, time per task 424.6s against 1,524.3s, Terminal Bench 4.0 0.3283 against 0.2525, AutomationBench 0.3541 against 0.5591 and context 1M tokens against 256K tokens, footed 'Board figures per Artificial Analysis v4.3.2; context and price per vendor documentation.'

Nơi mức giá cố định không còn trông phẳng

Giá của Claude Haiku 5.5 có phân bậc, còn giá của Qwen3.8-Flash-Next thì không.

• Giá — Claude Haiku 5.5 $0.10 đầu vào / $0.50 đầu ra mỗi triệu token tối đa 100.000 token prompt, sau đó $0.50 / $2.50 cho phần vượt; Qwen3.8-Flash-Next $0.15 / $0.50 cố định.

• Đầu vào được lưu đệm — $0.01 cho lượt đọc và $0.125 cho lượt ghi đối với Claude Haiku 5.5; $0.016 cho lượt đọc và $0.23 cho lượt ghi đối với Qwen3.8-Flash-Next.

• Ngữ cảnh — một triệu token cho Claude Haiku 5.5. Với Qwen3.8-Flash-Next, con số tùy thuộc vào người bạn hỏi: Qwen công bố cửa sổ một triệu token, cấu hình của chính checkpoint giới hạn embedding vị trí ở 262.144, và Artificial Analysis ghi nhận cấu hình được đánh giá ở 256.000.

• Đầu ra tối đa — 128.000 token đối với Claude Haiku 5.5; 131.072 theo mục trong danh mục của chúng tôi cho Qwen3.8-Flash-Next.

• Phương thức đầu vào — văn bản và hình ảnh đối với Claude Haiku 5.5; văn bản đối với Qwen3.8-Flash-Next.

• Phát hành — 2026-10-07 cho Claude Haiku 5.5, 2026-08-26 cho Qwen3.8-Flash-Next.

• Trọng số — độc quyền, chỉ có qua API cho Claude Haiku 5.5; trọng số mở theo Qwen Community License 1.0 cho Qwen3.8-Flash-Next.

Ba trong số những dòng đó đi ngược hướng với con số giá chính, và bậc độ dài prompt là rõ nét nhất. Dưới 100.000 token prompt, Claude Haiku 5.5 là mô hình rẻ hơn trên cả hai dòng giá. Trên ngưỡng đó, giá đầu vào của Anthropic tăng gấp năm lần và Qwen3.8-Flash-Next vẫn giữ lợi thế 3,3× về đầu vào và 5,3× về đầu ra. Ngưỡng này gần như trùng với điểm mà các cửa sổ ngữ cảnh vốn đã tách ra — một triệu token cho một mô hình, 262.144 cho mô hình kia — vì vậy một pipeline cần cửa sổ dài cũng chính là pipeline phải trả mức giá bậc hai để có được nó.

Đó không phải là lời chỉ trích nhắm vào việc định giá; mức giá theo bậc dựa trên độ dài prompt là một cách tính phí bình thường đối với một mô hình có ngữ cảnh dài. Đó là lời cảnh báo về phép so sánh. Một cuộc đối đầu chạy ở prompt 8.000 token chỉ đang mô tả một cặp mức giá. Hai mô hình đó ở prompt 400.000 token lại là một cặp hoàn toàn khác, và mô hình rẻ hơn trong trường hợp thứ hai lại chính là mô hình đắt hơn trong trường hợp thứ nhất.

Những gì các bảng nhà cung cấp nói ở bên dưới

Không nhà cung cấp nào đã chạy bộ đánh giá của bên kia, vì vậy bức tranh chung chỉ giới hạn ở những hàng mà Artificial Analysis đã đo trên cả hai.

• Chỉ số Trí tuệ v4.3.2 — 43,40 cho Claude Haiku 5.5 (Max) so với 39,82 cho Qwen3.8-Flash-Next. Anthropic dẫn trước 3,57 điểm, mức chênh lệch tổng hợp lớn nhất trong loạt này.

• Chi phí cho mỗi tác vụ Index đã hoàn thành — $0.21 so với $0.37 trên cùng một bảng.

• Thời gian tác vụ — 424,6 giây so với 1.524,3 giây.

• Terminal Bench 4.0 — 0,3283 so với 0,2525. Claude Haiku 5.5 hơn 7,6 điểm.

• SciCode — 0.5498 so với 0.5058. Claude Haiku 5.5 hơn 4.4 điểm.

• Kỳ thi Cuối cùng của Nhân loại — 0.4439 so với 0.3804. Claude Haiku 5.5 dẫn trước 6.4 điểm.

• AutomationBench, điểm một phần — 0.3541 so với 0.5591. Qwen3.8-Flash-Next kém 20.5 điểm.

Sáu dòng thuộc về Anthropic, một số trong đó có cách biệt lớn, và một dòng thuộc về Qwen với cách biệt 20 điểm. Cục diện này cũng chính là cục diện xuyên suốt toàn bộ dải giá này: mô hình nhỏ của Anthropic mạnh hơn ở khả năng suy luận, khoa học và chi phí lẫn độ trễ để có được câu trả lời, nhưng yếu hơn ở việc đưa một tác vụ nhiều bước đến hoàn thành. Qwen3.8-Flash-Next thì ngược lại.

Khoảng cách giữa dòng tổng hợp và dòng tác tử ở đây rộng một cách bất thường — 3,57 điểm theo một hướng, 20,5 theo hướng kia — khiến đây trở thành cặp ít mơ hồ nhất trong dải trên trục đó. Nếu công việc của bạn là một câu hỏi khó duy nhất được trả lời một lần, Claude Haiku 5.5 vượt trội trên mọi thước đo mà bạn sẽ nhận thấy. Nếu công việc của bạn là một tác tử phải hoàn thành, Qwen3.8-Flash-Next vượt trội trên dòng duy nhất dự báo được điều đó, và vượt hơn khoảng cách tổng hợp gấp năm lần.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

180 tỷ tham số bạn có thể nắm giữ

Điều quyết định sự so sánh này đối với nhiều đội nhóm lại hoàn toàn không nằm trong bảng benchmark.

Qwen3.8-Flash-Next là một mô hình mixture-of-experts thưa, tổng cộng 180 tỷ tham số và 6 tỷ tham số hoạt động — một tỷ lệ giữ cho lượng tính toán tiêu tốn trên mỗi token ở mức khiêm tốn so với tổng năng lực của mô hình. Nó được phát hành theo Qwen Community License 1.0, mà Artificial Analysis ghi nhận là giấy phép thương mại chứ không phải giấy phép tự do; sự phân biệt đó đáng để đọc trước khi bạn lên kế hoạch dựa trên nó, bởi vì giấy phép cộng đồng không phải là MIT và có các điều khoản riêng về quy mô. Nó có thể được tự lưu trữ, ghim vào một checkpoint, lượng tử hóa và tinh chỉnh, tùy thuộc vào các điều khoản đó.

Claude Haiku 5.5 không thể là bất kỳ thứ nào trong số đó. Nó là độc quyền, chỉ dùng qua API, không công bố số lượng tham số, không có giấy phép và không có kho mã nguồn. Anthropic cam kết duy trì khả năng gọi nó cho đến không sớm hơn ngày 2027-10-07, đây là một bảo đảm thực sự và cụ thể — nhưng một bảo đảm về tính khả dụng là một sản phẩm khác với chính các trọng số.

Hệ quả thực tế diễn ra theo cả hai chiều, và cần nói thẳng điều đó thay vì biến nó thành lời quảng bá cho bên nào. Những đội ngũ cần suy luận (inference) ngay trong tenancy của riêng họ, một checkpoint cố định để có thể so khớp, hay khả năng fine-tune trên dữ liệu chuyên ngành thì không lựa chọn giữa hai mô hình này dựa trên các chỉ số. Họ chọn Qwen3.8-Flash-Next, bởi lựa chọn còn lại không cung cấp thứ họ cần ở bất kỳ mức giá nào. Những đội ngũ cần một endpoint được quản lý với system card được công bố, một bộ đánh giá được ghi chép đầy đủ và cam kết ngừng hỗ trợ (retirement) thì đang chọn hướng ngược lại, và trọng số (weights) không phải là tính năng mà họ định dùng.

Đang vận hành phía giá cố định

Một lưu ý về tên gọi. Bảng độc lập xếp mô hình này là Qwen3.8-Flash-Next; danh mục của chúng tôi liệt kê cùng bản phát hành đó dưới tên nhà cung cấp ngắn hơn là Qwen3.8 Flash, với mức giá y hệt $0.15 / $0.47 cùng mức giá đầu vào được lưu đệm $0.0184, và trỏ kho lưu trữ của nó tới trọng số Hugging Face được công bố ngày 2026-08-26. Những số liệu dưới đây, khi đến từ Artificial Analysis, thuộc về mục mà nó gọi là Qwen3.8-Flash-Next. Hai cái là cùng một mô hình; bảng chỉ đơn giản mang tên dài hơn của nó.

Qwen3.8-Flash-Next có trong danh mục của OrcaRouter ở mức giá niêm yết của nhà cung cấp với 0% phụ trội, được chuyển thẳng thay vì hòa trộn — vì vậy mức $0.15 và $0.47 ở trên chính là mức giá trên hóa đơn, và thay đổi từ phía Qwen sẽ được áp dụng ở phía chúng tôi ngay trong ngày thay vì vào một lần điều chỉnh giá sau đó. Claude Sonnet 5.5 và Claude Opus 5.5 cũng có trong danh mục, khiến lộ trình nâng cấp từ một mô hình nhỏ lên mô hình tầm trung của Anthropic trở thành một cấu hình định tuyến thay vì một tích hợp thứ hai. Một API cho hơn 200 mô hình, một khóa, chuyển đổi dự phòng tự động ở bên dưới, và DSL định tuyến khi mức trần chi phí thuộc về tuyến thay vì nằm trong mã ứng dụng.

Claude Haiku 5.5 không có trong danh mục. Có thể truy cập nó thông qua API riêng của Anthropic, và phần Anthropic trong so sánh này không phải là thứ chúng tôi cung cấp hiện nay — nói rõ điều đó tốt hơn là để mập mờ.

A capture of the OrcaRouter model page for Qwen3.8 Flash under qwen/qwen3.8-flash, showing a maximum output of 131K, text, image and video input, benchmarks published by Qwen on 2026-08-26, and a price strip reading $0.15 input and $0.47 output per million tokens.

Cái nào trong hai, và dựa trên căn cứ nào

Nếu lưu lượng của bạn nặng về đầu vào, các prompt của bạn nằm dưới 100.000 token và bạn đang trả tiền cho khối lượng thực, thì Claude Haiku 5.5 là mô hình rẻ hơn trên cả hai mức giá và là mô hình đạt điểm cao hơn ở sáu trong bảy phép đo chung — với lưu ý rằng mức khác biệt tokenizer 30% và tính dài dòng của Anthropic đều bào mòn khoản giảm giá vốn trông lớn hơn trên bảng giá so với trên hóa đơn.

Nếu lưu lượng của bạn thiên về đầu ra, hoặc prompt của bạn đủ dài để vượt ngưỡng của Anthropic, hoặc bạn cần mức giá cố định để dự báo, thì Qwen3.8-Flash-Next rẻ hơn — có khi rẻ hơn gấp năm lần ở phần đầu ra vượt mốc — và đây chính là mô hình thắng ở hàng hoàn thành tác vụ agentic với cách biệt 20 điểm.

Nếu bạn cần đến tạ, thì so sánh không hề cân sức, và giá cả chẳng hề được tính đến.

Hai card chỉ chênh nhau trong vòng ba xu mỗi triệu token ở tỷ lệ pha trộn 3:1, mức đủ sát để giá không nên là thứ quyết định. Thứ quyết định là bạn đang ở đoạn nào trong ba đoạn đó, và đó là câu hỏi về pipeline của bạn chứ không phải về mô hình nào trong hai mô hình.