
Claude Haiku 5.5 vs Ling 3.1 Flash: Một mô hình 560 tỷ tham số có chi phí mỗi câu trả lời cao gấp bốn lần
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Sáu ngày là khoảng cách giữa chúng. InclusionAI phát hành Ling 3.1 Flash vào ngày 1 tháng 10 năm 2026; nhà cung cấp phát hành Claude Haiku 5.5 vào ngày 7 tháng 10. Cả hai đều được bán như những model thuộc tầng flash, cả hai đều sở hữu cửa sổ ngữ cảnh một triệu token, và trên các dòng suy luận của bảng đánh giá độc lập duy nhất từng chạy cả hai, chúng gần nhau đến mức khác biệt nằm trong ngưỡng nhiễu. Rồi đến dòng đo xem một agent có thực sự hoàn thành công việc hay không, và chúng cách nhau 26 điểm — và đến dòng đo chi phí cho một công việc đã hoàn thành, nơi model có 560 tỷ tham số có mức giá gấp bốn lần rưỡi model mà số lượng tham số của nó thì chưa ai công bố.
Không bảng giá nào dự đoán được điều đó. Ling 3.1 Flash niêm yết ở mức 0,30 đô la cho mỗi triệu token đầu vào và 0,90 đô la cho mỗi triệu token đầu ra. Claude Haiku 5.5 niêm yết ở mức 0,10 và 0,50 đô la cho các prompt tối đa 100.000 token, tăng lên 0,50 và 2,50 đô la khi vượt ngưỡng đó. Nếu quy về giá trên mỗi token, Ling có chi phí gấp ba lần ở đầu vào và chưa đầy gấp đôi ở đầu ra, một khoảng cách kiểu như vậy đủ để kết thúc so sánh chỉ trong một dòng.
Nó không kết thúc trận này đâu, bởi vì bảng giá được tính theo token còn quyết định được tính theo tác vụ. Hai con số đó bước ra từ cuộc đối đầu này với dấu trái ngược nhau, và lý do không phải là sự dài dòng.
Chi phí cho một tác vụ đã hoàn thành, không phải chi phí cho một token.
Trên Artificial Analysis Intelligence Index v4.3.2, chi phí đo được để hoàn thành một tác vụ chỉ số đầy đủ là 0,21 USD đối với Claude Haiku 5.5 và 0,99 USD đối với Ling 3.1 Flash. Đó là khoảng cách 4,6× — lớn hơn tỷ lệ đầu vào 3× và theo cùng chiều.
Lời giải thích hiển nhiên — rằng mô hình đắt tiền đang nói nhiều hơn — là lời giải thích sai. Ling 3.1 Flash tạo ra 100.671 token đầu ra cho mỗi tác vụ lập chỉ mục; Claude Haiku 5.5 tạo ra 162.164. Mô hình rẻ hơn mới là mô hình nói nhiều hơn, với mức chênh lệch hơn 60%. Vậy nên tiền cũng không đi đến nơi mà bảng giá gợi ý.
Tách chi phí theo từng tác vụ ra, và nó rơi đúng vào nơi mà phương pháp luận chỉ số thực sự chi tiêu. Trong 0,21 USD của Claude Haiku 5.5, khoảng 62% nằm ở phía đầu vào; trong 0,99 USD của Ling 3.1 Flash, khoảng 91% là ở phía đầu vào. Đây là những lượt chạy suy luận sử dụng nhiều bộ nhớ đệm, và hai nhà cung cấp định giá một token đầu vào được lưu đệm rất khác nhau: 0,01 USD mỗi triệu token đối với Claude Haiku 5.5 so với 0,06 USD mỗi triệu token đối với Ling 3.1 Flash — mức chênh lệch gấp 6 lần trên dòng duy nhất chi phối hóa đơn. Bảng giá được công bố so sánh 0,10 USD với 0,30 USD. Dòng quyết định hóa đơn so sánh 0,01 USD với 0,06 USD.
Danh mục của chính chúng tôi chuyển tiếp giá niêm yết của nhà cung cấp ở mức markup 0%, đó là cách bạn có thể phân biệt hai tình huống trên hóa đơn thực tế thay vì hóa đơn mô phỏng. Ling 3.1 Flash không có trong danh mục dưới bất kỳ cách viết nào của đường dẫn nhà cung cấp mà chúng tôi có thể phân giải — không thuộc InclusionAI, không thuộc Ling, không thuộc bất kỳ hình thức nào trong tám hình thức chúng tôi đã thử — vì vậy mức $0.30 và $0.90 ở trên là mức giá do nhà cung cấp tự công bố và không phải thứ chúng tôi có thể định tuyến cho bạn hôm nay. Claude Haiku 5.5 cũng không có trong danh mục; nó chạy qua API riêng của Anthropic. Điều mà danh mục thực sự có từ khu vực lân cận của so sánh này là GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash và Gemini 3.8 Flash, mỗi mô hình ở giá niêm yết của nhà cung cấp với markup 0%, vì vậy khi nhà cung cấp thay đổi mức giá thì bên chúng tôi nhận được thay đổi đó cùng ngày họ nhận được. Nếu phát hiện bên dưới là hồ sơ agentic của Ling 3.1 Flash chính là thứ khối lượng công việc của bạn cần, thì bước tiếp theo thiết thực là một cuộc so tài trực tiếp với các mô hình có khả năng agentic mà chúng tôi thực sự định tuyến, trên cùng một khóa với failover tự động bên dưới và routing DSL khi mức trần chi phí nên nằm trong tuyến thay vì trong mã ứng dụng.

Bảy hàng mà cả hai đều đã được đo
Artificial Analysis là bảng duy nhất đã chạy cả hai mô hình, và phần chồng lấn tuy hẹp nhưng giàu thông tin. Các hàng không khớp với nhau, và hướng của sự bất đồng không phải ngẫu nhiên.
• Chỉ số Thông minh v4.3.2 — 43,40 cho Claude Haiku 5.5 (Max) so với 41,09 cho Ling 3.1 Flash. Anthropic dẫn trước 2,31 điểm.
• Chi phí cho mỗi tác vụ Index đã hoàn thành — 0,21 USD so với 0,99 USD trên cùng một bảng.
• Thời gian mỗi tác vụ Index — 424,6 giây đối với Claude Haiku 5.5 so với 360,4 giây đối với Ling 3.1 Flash. Đây là hàng mà kỳ vọng bị phá vỡ: mô hình 560 tỷ tham số là mô hình nhanh hơn trong hai mô hình xét trên toàn bộ Index, nhanh hơn khoảng 15%.
• Terminal Bench 4.0 — 0.3283 so với 0.3333. Ling 3.1 Flash nhỉnh hơn nửa điểm, mà trên một benchmark được cả hai nhà cung cấp trích dẫn thì coi như hòa.
• SciCode — 0.5498 so với 0.5405. Claude Haiku 5.5 hơn 0.9 điểm. Cũng là một kết quả hòa.
• Humanity's Last Exam, không dùng công cụ — 0.4439 so với 0.3943. Claude Haiku 5.5 hơn 5 điểm, sự tách biệt thực sự đầu tiên.
• AutomationBench, điểm một phần — 0.3541 so với 0.6174. Ling 3.1 Flash dẫn trước 26 điểm, và với cách biệt lớn hơn tổng tất cả các khoảng cách khác trong danh sách này cộng lại.
Còn hai hàng nữa nằm ngoài tập hợp dùng chung đó và đáng để đưa vào, vì chúng là những hàng mà người mua chú ý nhất. Trên GDPval-AA, bài đánh giá mà Artificial Analysis thực hiện trên 44 nghề, hai con số là 1620,05 và 1621,75 — một thế hòa về mặt thống kê. Trên AA-Briefcase v1.1, một đánh giá công việc chuyên nghiệp dạng văn bản dài được xếp hạng theo Elo, Claude Haiku 5.5 đạt 1577,72 so với 1400,35 của Ling 3.1 Flash, một khoảng cách 177 điểm nghiêng về phía Anthropic. Đó là mức chênh lệch lớn nhất giữa hai mô hình ở mọi hạng mục không liên quan đến tác nhân (agentic) trên toàn bảng xếp hạng.
Hàng duy nhất đáng lẽ phải quyết định phần lớn những cuộc trò chuyện này
Các con số trung bình ở cấp chỉ số che giấu việc thời gian và tiền bạc thực sự đã đi đâu, và cặp này là ví dụ rõ ràng nhất về điều đó trong cả lô. Các con số theo từng lượt đánh giá trên Terminal Bench 4.0 không hề xấp xỉ nhau ở bất kỳ khía cạnh nào ngoại trừ điểm số.
• Terminal Bench 4.0, Ling 3.1 Flash — 0,3333 với 5,49 đô la mỗi tác vụ và 1.283 giây mỗi tác vụ.
• Terminal Bench 4.0, Claude Haiku 5.5 — 0.3283 với $0.65 mỗi tác vụ và 908 giây mỗi tác vụ.
Năm phần nghìn điểm số chia tách chúng. Chi phí là 8,4× và thời gian thực là 1,4×. Một đội đọc bảng đánh giá và chọn mô hình đạt 0,3333 điểm đã, theo cách tính của chính Artificial Analysis, chọn trả gấp tám lần để đến muộn hơn một phần ba phút với cùng câu trả lời.
Đây không phải là lập luận rằng điểm số là vô nghĩa; đây là lập luận rằng điểm số là tỷ lệ giữa công việc đã hoàn thành và công việc đã thử, và nó không nói gì về nguồn lực tiêu tốn để đạt tới đó. Các benchmark đánh giá khả năng hoàn thành tác vụ của agent chính là bối cảnh mà sự phân biệt đó có hệ quả nặng nề nhất, bởi vì một agent thử lại là một agent phải trả đủ giá cho mỗi lần thử lại, và một mô hình tốn chi phí gấp tám lần mỗi lần thử sẽ biến vòng lặp thử lại thành một khoản mục ngân sách.

560 tỷ tham số mà không cần tải xuống gì cả
Đây là phần thực sự bất thường trong bảng thông số kỹ thuật của Ling 3.1 Flash, và đó không phải là kích thước.
Ling 3.1 Flash là một mô hình hỗn hợp chuyên gia thưa — tổng cộng 560 tỷ tham số, 25 tỷ tham số hoạt động cho mỗi token — và Artificial Analysis xếp nó vào loại độc quyền. Không có trọng số, không có tệp giấy phép và không có kho lưu trữ. Một mô hình thưa lớn với hình dạng như vậy thông thường sẽ được phát hành dưới dạng mở, bởi vì đó là điều mà phần còn lại của tầng này vẫn làm: GLM 5.3 Flash phát hành trọng số theo giấy phép MIT với tổng 320 tỷ tham số và 18 tỷ tham số hoạt động, còn DeepSeek V4.1 Flash phát hành trọng số MIT với tổng 552 tỷ tham số và 16 tỷ tham số hoạt động. Ling 3.1 Flash thuộc cùng lớp kiến trúc ở cùng bậc quy mô, nhưng chỉ được công bố dưới dạng API.
Lựa chọn đó có một hệ quả mà các hàng trong bảng benchmark không thể hiện. Một mô hình 25 tỷ tham số hoạt động phải được phục vụ ở đâu đó, và nếu bạn không thể giữ checkpoint, bạn không thể chọn nơi phục vụ hay mức biên lợi nhuận — bạn thuê dịch vụ phục vụ của nhà cung cấp cho nó. Mức giá 5,49 đô la cho tác vụ Terminal Bench ở trên không chủ yếu là hệ quả của mức giá token; đó là chi phí để thuê một mô hình thưa lớn từ bên duy nhất có thể chạy nó. Các mô hình anh em trọng số mở trong phân khúc này cho bạn tùy chọn tự mình thay đổi con số đó.
Điều đó cũng đúng theo chiều ngược lại, và sự trung thực tương tự cũng được áp dụng. Một bản phát hành mở không tự động là sản phẩm tốt hơn: bạn thừa hưởng gánh nặng vận hành phục vụ, các lựa chọn lượng tử hóa và guồng quay nâng cấp cùng với trọng số, và một tệp giấy phép không phải là hợp đồng hỗ trợ. Anthropic công bố cam kết ngừng hỗ trợ đối với Claude Haiku 5.5 là không sớm hơn ngày 7 tháng 10 năm 2027, trên API chính chủ với một system card. Việc bạn muốn phương án nào trong hai phương án đó là câu hỏi về đội ngũ của bạn, không phải về bất kỳ mô hình nào.
Ling 3.1 Flash dùng để làm gì
Đọc hồ sơ một cách tổng thể, nó mô tả một sản phẩm mạch lạc chứ không phải một sản phẩm phải chịu đánh đổi: một mô hình lớn, thưa, ngữ cảnh dài, hoàn tất các quy trình công việc nhiều bước tự chủ tốt hơn bất kỳ thứ gì khác được đo trong tầm giá này, không có gì nổi bật ở khả năng suy luận một lần với bài khó, và làm được điều đó với mức giá cố định, không có ngưỡng nhảy bậc theo độ dài prompt. Trên AutomationBench, nó hơn Claude Haiku 5.5 26 điểm, và điểm AA-Briefcase của nó là điểm duy nhất trong so sánh này mà nó nằm sau mức giữa của nhóm thay vì ở phía dẫn đầu.
Đó là một mô tả có thể biện hộ được về một worker agentic theo lô: hướng nó vào một hàng đợi các công việc có cấu trúc mà từng việc đều phải được hoàn thành, chấp nhận rằng tác vụ được đo bằng phút, giữ prompt đủ dài để một bước ngưỡng sẽ mang tính trừng phạt, và coi trọng độ tin cậy ở vạch đích hơn chi phí của bất kỳ token đơn lẻ nào. Điều nó không làm tốt là thứ mà các mô hình phân hạng flash thường được mua để làm. Nó chỉ nhận văn bản — hoàn toàn không có đầu vào hình ảnh, trong khi Claude Haiku 5.5 nhận cả văn bản lẫn hình ảnh. Thời gian tác vụ index của nó ngắn hơn, nhưng thời gian tác vụ Terminal Bench của nó dài hơn, và với $0.99 cho mỗi tác vụ index hoàn thành so với $0.21, nó đang chi gấp bốn lần rưỡi để đạt được điểm tổng hợp gần như tương đương.

Cái nào trong hai, dựa trên bằng chứng hiện có
Nếu công việc của bạn là văn bản vào, văn bản ra, được tính giá theo token ở khối lượng lớn, Claude Haiku 5.5 thắng trong so sánh này ở mọi hạng mục xuất hiện trên hóa đơn: chi phí tác vụ theo chỉ số thấp hơn, chi phí tác vụ thực tế thấp hơn trên benchmark quan trọng nhất đối với agent, điểm tổng hợp cao hơn, điểm số công việc chuyên môn dạng dài tốt hơn, độ trung thực tốt hơn, và khả năng nhập hình ảnh mà mô hình kia hoàn toàn không cung cấp.
Nếu công việc của bạn là một tác nhân không cần giám sát, phải hoàn thành một quy trình làm việc gồm nhiều bước, thì Ling 3.1 Flash đang đạt điểm cao hơn Claude Haiku 5.5 26 điểm trên benchmark chung duy nhất đo lường chính xác điều đó, và điều đó đáng để kiểm thử thay vì bỏ qua vì giá. Hãy kiểm thử nó trên trace của chính bạn, không phải trên bảng này — và tính giá phép thử theo mỗi công việc đã hoàn thành, vì đó mới là con số thay đổi khi một tác nhân thử lại.
Nếu bạn cần nắm giữ trọng số, thì cả hai mô hình này đều không dành cho bạn. Ling 3.1 Flash là mô hình độc quyền với 560 tỷ tham số; Claude Haiku 5.5 là mô hình độc quyền và không công bố số lượng tham số. Các bản phát hành mở trong phân khúc này nằm ở chỗ khác trên bảng, và sự so sánh đó bắt đầu từ một tập hợp hàng hoàn toàn khác.
Chỉ số tổng hợp cho biết 2,31 điểm. Benchmark agentic cho biết 26 theo hướng ngược lại. Bảng giá cho biết 3× trên đầu vào; chi phí tác vụ hoàn thành cho biết 4,6× cùng hướng với bảng giá. Bốn con số, hai hướng — đó là lý do cách duy nhất đáng tin cậy để giải quyết chuyện này là chạy cả hai đối chiếu với dấu vết công việc của chính bạn và đọc chi phí từ các tác vụ đã hoàn thành thay vì từ token.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
