Một thẻ hero được tạo cho 'Claude Haiku 5.5 vs Ling 3.0 Flash' với hai bảng được chia bằng một đường kẻ mảnh: bảng bên trái dán nhãn 'Claude Haiku 5.5' mang 'Chỉ số 43' và 'Hiện tại', bảng bên phải dán nhãn 'Ling 3.0 Flash' mang 'Chỉ số 20' và 'Ngừng hỗ trợ'. Một dòng chân trang ghi 'Điểm số theo Artificial Analysis.' Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Engineering & Research

Claude Haiku 5.5 vs Ling 3.0 Flash: Một trong hai mô hình này đã có bản kế nhiệm

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hãy bắt đầu với sự thật kỳ lạ, vì đó là điều nên định hình quyết định. Ling 3.0 Flash — mô hình trọng số mở 124 tỷ tham số của Ant Group, phát hành vào tháng 8 năm 2026 theo giấy phép MIT — hiện được gắn cờ là không còn được hỗ trợ, với Ling 3.1 Flash được nêu tên là bản thay thế. Claude Haiku 5.5 ra mắt vào ngày 7 tháng 10 năm 2026, hai ngày trước thời điểm viết bài này, và Anthropic đã cam kết không ngừng hỗ trợ nó trước tháng 10 năm 2027. Hai mô hình trong cùng một mức giá, và một trong số chúng đã được chỉ tới chính phiên bản kế nhiệm của nó.

Sự bất đối xứng đó không phải là một phán quyết về chất lượng. Ling 3.0 Flash là một mô hình thực sự nhanh với trọng số mở và một kiến trúc khác thường, và trên một số phương diện, nó vượt trội hơn hẳn hạng A​nthropic. Nhưng điều đó có nghĩa là so sánh này có hạn sử dụng, và bất kỳ bài viết nào coi hai bên là bền bỉ như nhau đều đang bán cho bạn phần sẽ hết hạn.

Hai bản phát hành, hai thời đại rất khác biệt

Các số liệu độc lập ở đây đến từ Artificial Analysis; các tuyên bố riêng của nhà cung cấp đến từ model card và tài liệu, và đều đã được ghi nhãn.

• Phát hành — Ling 3.0 Flash vào ngày 4 tháng 8 năm 2026, cùng với kho lưu trữ Hugging Face ghi ngày 2 tháng 8. Claude Haiku 5.5 vào ngày 7 tháng 10 năm 2026.

• Giấy phép — MIT dành cho Ling 3.0 Flash, mức thoáng đãng gần như tối đa đối với các mô hình trọng số mở. Claude Haiku 5.5 là độc quyền, chỉ truy cập qua API.

• Trạng thái — Ling 3.0 Flash mang cờ đánh dấu ngừng hỗ trợ trỏ đến Ling 3.1 Flash. Claude Haiku 5.5 là phiên bản hiện hành, với cam kết không khai tử đến hết tháng 10 năm 2027.

• Mức độ chấp nhận — kho lưu trữ Ling 3.0 Flash đã đạt 11.797 lượt tải xuống và 427 lượt thích. Đó là một dấu ấn thực tế nhưng khiêm tốn, và là một chỉ số đại diện hợp lý cho mức độ phát triển của các công cụ bên thứ ba xung quanh mô hình này.

Khoảng cách tuổi tác quan trọng hơn mức mà sáu tuần gợi ý. Ling 3.0 Flash ra mắt vào thời điểm mà dòng sản phẩm của chính nó đã đang chuyển dịch; Claude Haiku 5.5 ra mắt với tư cách là thành viên mới nhất của một dòng chưa có người kế nhiệm nào được công bố.

Kiến trúc là phần đáng đọc lại hai lần

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash, showing 427 likes, the 'TextGeneration', 'Safetensors', 'conversational' and 'custom_code' tags, and the introduction text describing the model as a native hybrid reasoning model operating with 124B total and 5.1B active parameters (about 12.4% and 8.1% of the previous 1T-class flagship Ring-2.6-1T) built on a native hybrid linear attention architecture.

Ling 3.0 Flash là một mô hình mixture-of-experts với tổng cộng 124 tỷ tham số và 5,1 tỷ tham số hoạt động trên mỗi token. Tỷ lệ đó chính là toàn bộ lập luận kinh tế: bạn chứa được dấu chân bộ nhớ của một mô hình lớn nhưng chỉ trả chi phí tính toán của một mô hình nhỏ. Cấu hình được công bố rất cụ thể, và nó không phải là một bản đổi vỏ của một transformer tiêu chuẩn:

• Phân lớp — 35 lớp KDA với 7 lớp Gated MLA theo tỷ lệ 5:1, cộng thêm 2 lớp dense. Công thức huấn luyện đã được công bố sẽ nâng cửa sổ ngữ cảnh từ 8K lên 32K rồi lên 256K theo từng giai đoạn, thay vì huấn luyện cửa sổ dài ngay từ đầu.

• Các chuyên gia — 512 chuyên gia định tuyến với một chuyên gia chia sẻ, 8 chuyên gia được kích hoạt trên mỗi token, với kích thước ẩn là 2.560, kích thước trung gian chuyên gia là 768 và kích thước trung gian dense là 6.144. Từ vựng gồm 157.184 token.

• Phục vụ — triển khai tham chiếu của thẻ này sử dụng SGLang với --context-length 262144, và báo cáo rằng HiCache cùng bộ nhớ đệm Mooncake giúp giảm 60–80% hoặc hơn thời gian tới token đầu tiên với các đầu vào dài. Đó là con số do nhà cung cấp báo cáo và được nêu đúng như vậy.

Không có gì trong số đó là chiêu trò. Footprint hoạt động 5,1B là lý do Ling 3.0 Flash có thể được phục vụ ở mức thông lượng mà nó đạt được, và công việc caching là lý do độ trễ token đầu tiên của nó trên các prompt dài vẫn dùng được. Cách tiếp cận của Claude Haiku 5.5 thì ngược lại: một mô hình độc quyền dạng dense duy nhất phía sau một API, với cửa sổ 1.000.000 token và tư duy thích ứng quyết định theo từng yêu cầu xem cần làm bao nhiêu việc. Hai câu trả lời mạch lạc cho cùng một bài toán chi phí.

Các con số, nằm cạnh nhau

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.0 Flash - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Ling 3.0 Flash column reads independent score 20 (AA, #3 of 65), weights MIT open weights, context 262,000 tokens, input price $0.075 / 1M, output price $0.22 / 1M and throughput 333.6 tok/s. A footer line reads 'Independent figures per Artificial Analysis; pricing per each vendor.'

• Điểm độc lập — Claude Haiku 5.5 đạt 43 trên Chỉ số Trí tuệ, đứng thứ hai trong số 182. Ling 3.0 Flash đạt 20, đứng thứ ba trong số 65 ở phân khúc của mình.

• Giá đầu vào mỗi triệu token — Claude Haiku 5.5 $0.10 cho tối đa 100.000 token, $0.50 cho phần vượt trên. Ling 3.0 Flash $0.075, với mức giảm giá bộ nhớ đệm 80%.

• Giá đầu ra trên mỗi triệu token — Claude Haiku 5.5 $0.50 cho tối đa 100.000 token, $2.50 khi vượt mức. Ling 3.0 Flash $0.22.

• Chi phí hỗn hợp — 0,05 USD cho mỗi triệu token đối với Ling 3.0 Flash, so với 0,08 USD cho Claude Haiku 5.5 theo cách tính hỗn hợp của chính hội đồng.

• Tốc độ — 333,6 token đầu ra mỗi giây đối với Ling 3.0 Flash, đứng đầu trong số 65 mô hình cùng phân khúc, so với 240,4 của Claude Haiku 5.5. Thời gian đến token đầu tiên gần như ngang bằng: 2,50 giây so với số đo của bảng xếp hạng dành cho mô hình Anthropic.

• Ngữ cảnh — 262.000 token cho Ling 3.0 Flash; 1.000.000 cho Claude Haiku 5.5.

• Phương thức đầu vào — chỉ văn bản cho Ling 3.0 Flash. Văn bản và hình ảnh cho Claude Haiku 5.5.

• Trọng số — theo giấy phép MIT và có thể tải xuống đối với Ling 3.0 Flash. Độc quyền đối với Claude Haiku 5.5.

Ling mạnh về tốc độ và giá cả, không phải chiều sâu

Khoảng cách 23 điểm trên Chỉ số giữa 43 và 20 là điểm đáng chú ý nhất, và nó chỉ về cùng một hướng như trong mọi so sánh kiểu này: Claude Haiku 5.5 là mô hình mạnh hơn, và khoảng cách không hề nhỏ. Nhưng cột Ling thắng hai hàng một cách dứt khoát, và cả hai đều thuộc loại xuất hiện trên hóa đơn hoặc trong ngân sách độ trễ.

Đầu tiên, thông lượng. 333,6 token mỗi giây là nhanh nhất trong phân khúc của nó trên bảng, nhanh hơn khoảng 39% so với Claude Haiku 5.5, và kết hợp với chi phí hỗn hợp thấp hơn, điều đó có nghĩa là tạo hàng loạt — quét phân loại, gán nhãn dữ liệu, trích xuất có cấu trúc khối lượng lớn — chạy trên Ling 3.0 Flash rẻ hơn một cách đáng kể. Khi tác vụ được đặc tả rõ ràng và kiểu lỗi là hiển nhiên, một mô hình kém 23 điểm Index vẫn có thể là lựa chọn đúng.

Thứ hai, mức giảm giá bộ nhớ đệm 80%. Đối với một khối lượng công việc có tiền tố ổn định lớn và phần đuôi thay đổi nhỏ, tốc độ đầu vào hiệu dụng trên Ling 3.0 Flash giảm xuống thấp hơn nhiều so với mức niêm yết, và thiết kế bộ nhớ đệm của thẻ mô hình nhắm chính xác vào kiểu mẫu đó. Mức giá đọc bộ nhớ đệm 0,01 đô la của Claude Haiku 5.5 rẻ hơn về mặt tuyệt đối, nhưng chi phí ghi bộ nhớ đệm của nó là 0,125 đô la và mô hình được định giá theo bậc tại 100.000 token đầu vào mà Ling không có.

Đối trọng là tính dài dòng, và nó cũng chính là đối trọng áp dụng cho mô hình A​nthropic. Artificial Analysis ghi nhận 260 triệu token đầu ra khi chạy Index trên Ling 3.0 Flash, so với mức trung vị 100 triệu, và gắn cờ nó là dài dòng. Trên một mô hình tính giá theo token, điều đó bào mòn lợi thế về đơn giá — mức giá đầu ra rẻ hơn 2,3 lần bị tiêu hao một phần bởi một mô hình viết nhiều token hơn là một lợi thế nhỏ hơn so với những gì thẻ mô hình gợi ý.

Các benchmark của nhà cung cấp khẳng định điều gì, và điều gì chúng không nói

Thẻ của riêng Ling 3.0 Flash báo cáo một bộ kết quả mạnh: MathArena AIME 2026 đạt 93.2, HMMT February 2026 đạt 87, SWE-Bench Pro đạt 56.6, SWE-Bench Multilingual Resolved đạt 72.4, và Humanity's Last Exam đạt 22.7. Mỗi một trong số đó đều do nhà cung cấp báo cáo và không có cái nào được tái lập độc lập ở đây. Chúng cũng không được đo lường so với Claude Haiku 5.5 trên cùng một giàn thử nghiệm — A​nthropic công bố bộ của riêng mình (GDPval-AA v2.1 đạt 1620, OSWorld 2.1 đạt 72.4%, Terminal-Bench 4.0 đạt 39.2%) và hai nhà cung cấp đã chạy các bộ đánh giá khác nhau. Phép đo chung duy nhất là bảng xếp hạng độc lập, và ở đó câu trả lời là rõ ràng.

Cũng đáng lưu ý bên cạnh các điểm số toán học: con số HLE 22,7 đó nằm thấp hơn hẳn mức 45,9 khi không dùng công cụ mà Anthropic báo cáo cho Claude Haiku 5.5. Các harness là khác nhau, nên đây không phải là so sánh trực tiếp, nhưng cũng không phải là khoảng cách mà việc chọn harness có thể giải thích hết.

A screenshot of the Artificial Analysis page for Ling 3.0 Flash carrying a deprecation notice that the model is deprecated and that only the default 10k-input-token workload is still benchmarked, and that InclusionAI has launched a newer release, Ling 3.1 Flash, which it suggests considering instead. Beneath the notice the page shows the model as an open-weights release from August 2026 with an Intelligence rank of 3 of 65 and a speed rank of 1 of 65.

Vấn đề người kế nhiệm

Đây chính là phần quyết định sự so sánh đối với bất kỳ ai đang lập kế hoạch vượt ra ngoài quý hiện tại, và nó không liên quan gì đến các chỉ số đánh giá.

Ling 3.0 Flash đã bị ngừng hỗ trợ để nhường chỗ cho Ling 3.1 Flash. Điều đó không có nghĩa là nó ngừng hoạt động — trọng số mở không hết hạn, và giấy phép MIT không thể bị thu hồi. Nhưng nó có nghĩa là hệ sinh thái xung quanh nó sẽ dần lệch hướng: hỗ trợ framework suy luận, các bản phát hành lượng tử hoá, sửa lỗi và công cụ cộng đồng đều đi theo mô hình hiện hành, còn một mô hình đã ngừng hỗ trợ chỉ nhận được phần đuôi của sự chú ý đó. Nếu hôm nay bạn đang xây dựng trên Ling 3.0 Flash thì bạn đang xây dựng trên những trọng số đã đóng băng và hoàn thiện, điều này ổn với một khối lượng công việc ổn định và khá khó xử với bất cứ thứ gì bạn mong sẽ được cải thiện.

Claude Haiku 5.5 có tập hợp các đảm bảo mang tính đối xứng ngược: bạn không nhận được trọng số, nhưng bạn có một nhà cung cấp mà lợi ích thương mại của họ là giữ cho mô hình nhanh, được vá và được phục vụ, cùng với cam kết không loại bỏ mô hình cho đến tháng 10 năm 2027 và một lộ trình di trú được công bố bất cứ khi nào cam kết đó kết thúc.

Cả hai phía của tuyến đường này, chỉ qua một chìa khóa

Dòng thông tin trung thực về tình trạng sẵn có: OrcaRouter không cung cấp Ling 3.0 Flash, và cũng không cung cấp Claude Haiku 5.5. Ling 3.0 Flash được cung cấp thông qua kênh phân phối riêng của nhà cung cấp và một số nền tảng bên thứ ba; Claude Haiku 5.5 có trên API của Anthropic và các nền tảng đám mây lớn.

Điều còn lại là câu hỏi định tuyến mà cả hai mô hình đặt ra. Claude Haiku 5.5 ở mức 43 cùng cửa sổ 1M là một mục tiêu leo thang tự nhiên; Ling 3.0 Flash với 333 token mỗi giây là một chặng xử lý khối lượng lớn tự nhiên. Một tuyến gửi công việc khối lượng lớn, được đặc tả rõ ràng đến một tầng nhanh và đẩy bất cứ thứ gì không đạt kiểm tra độ dài hay chất lượng lên một tầng mạnh hơn chính là đúng cách sắp xếp mà một router tạo nên — trên OrcaRouter, Claude Haiku 4.5, Claude Sonnet 5.5 và Claude Opus 5.5 của Anthropic đã có trong danh mục ngay hôm nay, cùng với các lựa chọn trọng số mở quy mô lớn như DeepSeek V4.1 Flash và GLM 5.3 Flash, nên cả chặng leo thang lẫn chặng khối lượng lớn đều có thể được xây dựng và kiểm thử tải ngay bây giờ. Một khóa duy nhất, chuyển đổi dự phòng tự động ở bên dưới, giá niêm yết của nhà cung cấp được chuyển thẳng qua với mức chênh lệch 0% để một thay đổi giá có hiệu lực ngay trong cùng ngày.

Cái nào trong hai cái, và trong bao lâu

Hãy chọn Claude Haiku 5.5 nếu công việc có tính mở, nếu bạn cần hình ảnh hoặc cửa sổ một triệu token, nếu bạn muốn nhà cung cấp chịu trách nhiệm về thời gian hoạt động, hoặc nếu bạn đang lên kế hoạch xa hơn quý tới. Nó dẫn trước 23 điểm Index, đây là phiên bản hiện hành chứ không bị ngừng hỗ trợ, và mức chênh lệch giá đủ nhỏ để khoảng cách điểm số chiếm ưu thế.

Hãy chọn Ling 3.0 Flash nếu khối lượng công việc của bạn là dạng hàng loạt, được đặc tả rõ ràng và nhạy cảm với độ trễ; nếu giấy phép MIT hay trọng số mở chính là điều bạn quan tâm; hoặc nếu mức giảm giá 80% nhờ bộ nhớ đệm trên một tiền tố ổn định chính là nơi hoá đơn của bạn thực sự phát sinh. Đây là mô hình nhanh hơn và cũng rẻ hơn trên mỗi token, và nó thực sự giỏi ở những tác vụ mà một mô hình 20-Index có thể đảm nhiệm. Chỉ cần bước vào với hiểu biết rằng bạn đang chấp nhận một mô hình đã hoàn thiện thay vì một mô hình được duy trì, và rằng phiên bản kế nhiệm mà nó hướng tới đã tồn tại rồi.