Một thẻ hero được tạo có tiêu đề 'Claude Haiku 5.5 vs Qwen3.8 27B' với dòng kicker 'TRỌNG SỐ MỞ ĐỐI ĐẦU API', hiển thị Claude Haiku 5.5 ở mức Input $0.10, Output $0.50 và Index 43.40 so với Qwen3.8 27B ở mức Input $0.50, Output $3.00 và Index 33.70, trên một thanh ghi 'Chi phí cho mỗi tác vụ hoàn thành $0.21 so với $1.01'.
Engineering & Research

Claude Haiku 5.5 vs Qwen3.8 27B: Một chiến thắng trọn vẹn trên API, và vì sao các trọng số mở vẫn tồn tại

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hầu hết các so sánh trong loạt bài này đều quy về một sự đánh đổi. Trường hợp này thì không, và việc không có sự đánh đổi tự nó đã là phát hiện. Claude Haiku 5.5, phát hành ngày 7 tháng 10 năm 2026, đánh bại Qwen3.8 27B, mô hình dense 27B trọng số mở từ ngày 14 tháng 8 năm 2026, ở điểm trí tuệ tổng hợp, ở chi phí mỗi token, ở chi phí mỗi tác vụ hoàn thành, ở cửa sổ ngữ cảnh, ở giới hạn phản hồi, ở lập trình tác tử, và ở các hàng suy luận khoa học — và nó làm được như vậy từ một API độc quyền duy nhất không cần phần cứng. Hàng duy nhất Qwen3.8 27B thắng hoàn toàn là đầu vào video, còn hàng kia là giấy phép.

Đó không phải là lý do để gạt bỏ mô hình, bởi giấy phép Apache-2.0 và một mô thức video không phải là giải an ủi. Đó là lý do để nói chính xác vì sao bất kỳ ai lại chọn phía trọng số mở, và để ngừng giả vờ rằng cuộc tranh luận là về các benchmark.

Những con số mà cả hai mô hình thực sự được chạy trên đó

Mỗi triệu token tính bằng đô la Mỹ. Mức giá của nhà cung cấp được lấy từ tài liệu định giá của chính họ; các số đo được chia sẻ là Artificial Analysis Intelligence Index v4.3.2, đọc ngày 2026-10-08, cả hai đều ở cấu hình nỗ lực cao nhất đã được công bố của họ.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8 27B — the scoreboard' with rows Index v4.3.2 43.40 against 33.70, cost per task $0.21 against $1.01, input price $0.10 against $0.50, context window 1M tokens against 256K tokens, AutomationBench 0.3541 against 0.4824 and weights 'proprietary' against 'open, Apache 2.0', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Qwen vendor-card scores are unreproduced by the board.'

• Đầu vào — Claude Haiku 5.5 $0.10 cho tối đa 100.000 token và $0.50 cho phần vượt trên; Qwen3.8 27B $0.50 theo mức giá bên thứ ba được ghi nhận trên bảng.

• Đầu ra — Claude Haiku 5.5 $0,50 cho tối đa 100.000 token và $2,50 cho phần vượt trên; Qwen3.8 27B $3,00.

• Đầu vào được lưu trong bộ nhớ đệm — Claude Haiku 5.5 $0.01 và $0.05, giảm giá 90%; Qwen3.8 27B $0.10, giảm giá 80%.

• Điểm số độc lập — 43.40 cho Claude Haiku 5.5 (Max) so với 33.70 cho Qwen3.8 27B (Xhigh). Chênh lệch 9.70 điểm, mức lớn nhất trong đợt này.

• Chi phí cho mỗi tác vụ hoàn thành — 0,21 USD so với 1,01 USD, trong cùng một lượt đánh giá. Chênh lệch 4,7 lần, cũng là mức rộng nhất ở đây.

• Ngữ cảnh và đầu ra — 1M token và giới hạn phản hồi 128.000 token cho Claude Haiku 5.5; ngữ cảnh 256K token cho Qwen3.8 27B.

• Phương thức — cả hai đều nhận văn bản và hình ảnh rồi trả về văn bản. Qwen3.8 27B bổ sung đầu vào video; Claude Haiku 5.5 thì không.

• Trọng số — Qwen3.8 27B là 27B tham số dense theo Apache 2.0, có thể tải xuống. Claude Haiku 5.5 là độc quyền và chỉ truy cập qua API.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the two-tier pricing lines and 'Released October 7, 2026'.

Tại sao khoảng cách trên mỗi tác vụ lại gấp bốn lần khoảng cách trên mỗi token?

Bảng giá đã cho thấy mức chênh lệch đầu vào gấp 5 lần và chênh lệch đầu ra gấp 6 lần theo hướng có lợi cho nhà cung cấp, nên chiều hướng thì không còn gì phải bàn. Điều đáng lưu tâm là con số theo từng tác vụ nhỏ hơn so với con số theo token, tức là ngược lại với những gì đã xảy ra ở các cặp so sánh khác trong lô này, và lý do thì rất đáng suy ngẫm.

Claude Haiku 5.5 phát ra 162.164 token đầu ra cho mỗi tác vụ trên Intelligence Index — 129.047 token suy luận và 33.118 token trả lời. Qwen3.8 27B phát ra 66.797 token, chia thành 47.711 token suy luận và 19.087 token trả lời. Mô hình của nhà cung cấp tiêu tốn số token mỗi tác vụ nhiều gấp 2,4 lần, nên lợi thế tốc độ đầu ra gấp 6 lần của nó bị thu hẹp thành lợi thế gấp 4,7 lần trên mỗi tác vụ. Lợi thế đó vẫn khổng lồ. Chỉ là nó không phải con số mà bảng giá quảng cáo.

Phép toán về tỷ lệ pha trộn là cách rõ ràng hơn để thấy hình dạng của nó. Với tỷ lệ pha trộn 7:2:1 nghiêng về đầu vào — trọng số mà phần lớn lưu lượng sản xuất thực tế có — Claude Haiku 5.5 có giá $0.077 mỗi triệu token, so với $0.470 của Qwen3.8 27B. Với tỷ lệ pha trộn cân bằng 1:1, mức giá là $0.30 so với $1.75. Ngưỡng 100.000 token của nhà cung cấp là thứ duy nhất từng thu hẹp khoảng cách này: vượt qua ngưỡng đó, đơn giá của Claude Haiku 5.5 trở thành $0.50 và $2.50 trên toàn bộ yêu cầu, và hai mô hình gặp nhau ở mức giá gần như tương đương — lúc đó bạn đang trả thêm cho mức điểm cao hơn 9,7 điểm mà chẳng được gì.

Khi thẻ nhà cung cấp và bảng độc lập không thống nhất

Đây là nhóm dòng đáng để chậm lại mà xem xét, bởi vì thẻ mô hình của chính Qwen3.8 27B được đọc là mạnh hơn đáng kể so với các phép đo độc lập, và sự khác biệt đó chính là toàn bộ lý do khiến tuyên bố "một mô hình 27B sánh ngang với những mô hình lớn hơn nhiều" cần một nguồn thứ hai.

The vendor's own published figures, as recorded on our catalogue page for the model, include 90.3 on LiveCodeBench v6, 89.2 on GPQA Diamond, 84.3 on OSWorld-Verified, and 79.0 on QwenSWEBench. Those are vendor-reported and unreproduced, and they describe a model that is competitive well above its weight class.

Trong lượt chạy độc lập của Artificial Analysis, Qwen3.8 27B đạt 0.0556 trên Terminal-Bench 4.0, 0.4664 trên SciCode, 0.3392 trên Humanity's Last Exam và 1423.21 trên GDPval-AA v2.1. Đặt 0.0556 bên cạnh 84.3 mà thẻ nhà cung cấp báo cáo trên OSWorld và hình thái của sự bất đồng đã rõ ràng: đối với công việc tác tử trên máy tính và terminal, bảng độc lập đặt mô hình này gần đúng nơi một mô hình dense 27B thuộc về, còn thẻ nhà cung cấp thì không.

Hai dòng lại cắt theo hướng ngược lại, và chúng đáng được nêu ra vì cùng một lý do. Qwen3.8 27B đạt 0.4824 trên AutomationBench, so với 0.3541 của Claude Haiku 5.5 — một chiến thắng độc lập 12,8 điểm trên thứ gần nhất với một chuẩn đánh giá tự động hóa doanh nghiệp mà cả hai bảng đánh giá đều có. Đó là một con số thực từ cùng một lần chạy, ở dòng sát nhất với mục đích mà người ta thực sự triển khai các mô hình nhỏ.

Cách hiểu trung thực không phải là “nhà cung cấp đã thổi phồng mọi thứ”. Mà là: thẻ mô hình đo lường những tác vụ mà tác giả của nó đã chọn, hội đồng độc lập đo một bộ cố định, và những điểm mạnh của Qwen3.8 27B nằm trong danh sách của nhà cung cấp chứ không nằm trong danh sách của hội đồng.

Bài toán kinh tế thay đổi khi bạn sở hữu phần cứng

Mọi mức giá nêu trên đều là giá API, và với Qwen3.8 27B thì đó là khung sai.

Đây là một mô hình dày đặc 27B theo giấy phép Apache 2.0. Nó vừa vặn trên một bộ tăng tốc hiện đại duy nhất ở mức lượng tử hóa mà hầu hết các đội nhóm chấp nhận được, nghĩa là chi phí biên của một token không còn là đồng hồ đo của nhà cung cấp nữa mà trở thành mức sử dụng của chính bạn. Đó là lý do giá để gọi nó khác nhau tùy theo nhà cung cấp dịch vụ theo cách mà không mô hình độc quyền nào trong so sánh này có thể làm được: bảng giá ghi mức giá của bên thứ ba là 0,50 đô-la đầu vào và 3,00 đô-la đầu ra, còn danh mục OrcaRouter niêm yết nó ở mức 0,33 đô-la đầu vào và 2,40 đô-la đầu ra mà không có dòng đọc bộ đệm nào cả, bởi vì chúng tôi chạy trọng số trên hạ tầng của chính mình thay vì bán lại điểm cuối của người khác.

Với một nhóm đã trả tiền cho GPU, phép so sánh không phải là $0.21 so với $1.01 mỗi tác vụ. Mà là mức giá nhà cung cấp tính so với chi phí tăng thêm của một yêu cầu trên phần cứng bạn sở hữu, và đó là những con số khác nhau. Đó là lập luận cho phía open-weights, và là lập luận duy nhất trụ được khi đối chiếu với bảng benchmark.

Có một hệ quả thứ hai, ít rõ ràng hơn, của việc giấy phép là Apache 2.0: mô hình có thể được đưa vào một sản phẩm, tinh chỉnh trên lưu lượng của chính bạn, ghim vào một bản sửa đổi cụ thể và kiểm toán đến tận các trọng số. Không điều nào trong số đó có thể có được với bất kỳ mức giá nào từ một mô hình độc quyền chỉ cung cấp qua API, và đối với các khối lượng công việc chịu quy định, nó thường là ràng buộc mang tính quyết định chứ không phải là một sở thích.

A capture of the OrcaRouter model page for Qwen3.8 27B under qwen/qwen3.8-27b, showing a 262K-token context chip, text, image and video input, text output, a p50 time to first token of 1.84 seconds, public benchmarks by Qwen dated 2026-08-15, and the page's own description of the model as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

Gọi một trong hai người

Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.

Claude Haiku 5.5 không có trong danh mục. Nó có thể được truy cập trực tiếp qua API của nhà cung cấp và qua AWS, Azure cùng các nền tảng đám mây lớn, và đó mới là phát biểu chính xác. Điều mà danh mục thực sự có trong dòng sản phẩm của nhà cung cấp là Claude Sonnet 5.5 và Claude Opus 5.5, khiến con đường nâng cấp từ một mô hình nhỏ tự vận hành lên một mô hình agentic tầm trung được lưu trữ chỉ còn là một thay đổi định tuyến thay vì một tích hợp thứ hai — chuyển đổi dự phòng tự động dù theo cách nào thì vẫn nằm bên dưới nó.

Phán quyết, với mức độ thiên lệch bất thường

Khi được gọi dưới dạng API trên văn bản hoặc hình ảnh, Claude Haiku 5.5 thắng trong so sánh này ở mọi hàng không liên quan đến cấp phép. 9,7 điểm chỉ số, rẻ hơn 4,7 lần cho mỗi tác vụ hoàn thành, cửa sổ ngữ cảnh lớn gấp bốn lần, trần phản hồi cao gấp đôi, và mức giá niêm yết thấp hơn 5–6 lần trong chế độ prompt ngắn. Không có lập luận nào về hình thái khối lượng công việc có thể cứu Qwen3.8 27B về giá, bởi vì bất lợi của nhà cung cấp — việc sử dụng nhiều token đầu ra — kém giá trị hơn nhiều so với lợi thế về đơn giá của nó.

Điều cứu vãn nó là mọi thứ mà mức giá API không nắm bắt được: một giấy phép cho phép phân phối lại, các trọng số có thể nắm giữ và ghim lại, đầu vào video, và một con đường tự triển khai, nơi chi phí mỗi token là phần cứng của chính bạn thay vì thẻ thanh toán của nhà cung cấp. Nếu bạn đang tìm cách rẻ nhất để phân loại, trích xuất, tóm tắt và định tuyến văn bản, Claude Haiku 5.5 là câu trả lời, và khoảng cách không hề sát nút. Nếu bạn đang tìm một mô hình có thể đặt bên trong sản phẩm của chính mình, trên phần cứng của chính mình, dưới sự kiểm toán của chính mình, thì khoảng cách điểm chuẩn đã không còn là câu hỏi từ vài đoạn trước rồi.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày