Một thẻ tiêu đề được tạo cho 'LongCat-2.5-Preview vs Qwen3.8-Max' với tiêu đề phụ 'Một phần bảy mức giá, và không hề có bảng điểm', phía trên bốn thẻ ghi 'Đầu vào chưa lưu đệm: $0.30 so với $2.00 mỗi 1M', 'Đầu vào đã lưu đệm: $0.006 so với $0.25 mỗi 1M', 'Đầu ra: $1.20 so với $6.00 mỗi 1M' và 'Điểm độc lập: không có so với AA Intelligence 45.4'. Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

LongCat-2.5-Preview vs Qwen3.8-Max: Một phần bảy mức giá và không có gì trên bảng điểm

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Meituan đã đưa LongCat-2.5-Preview lên nền tảng API của mình vào ngày 25 tháng 9 năm 2026 với một mục trong nhật ký thay đổi, một bảng giá, và không có bất kỳ đánh giá chuẩn nào — rồi định giá nó ở mức chỉ bằng khoảng một phần bảy so với mức mà Qwen3.8-Max thu cho cùng một lượt gọi. Đó không phải là một khoảng cách nhỏ, và cũng không phải là một khoảng cách an toàn. Qwen3.8-Max, mô hình chủ lực của nhà cung cấp, đã được cung cấp rộng rãi từ ngày 3 tháng 8 năm 2026, có xếp hạng độc lập từ Artificial Analysis, công bố một bản chụp nhanh có ghi ngày mà bạn có thể ghim theo tên, và tính phí gấp 6,7 lần cho đầu vào và gấp 5 lần cho đầu ra. Câu hỏi mà so sánh này phải trả lời không phải là mô hình nào tốt hơn — chưa ai ngoài Meituan đủ khả năng trả lời điều đó. Mà là bạn đang mua gì bằng phần chênh lệch đó, và liệu phần chênh lệch ấy có đáng để mua hay không.

Những gì mỗi bên thực sự đã công bố

Hãy bắt đầu với nguồn gốc xuất xứ, vì đó chính là thứ phân biệt hai điều này rõ nét hơn bất kỳ phép đo chuẩn nào.

LongCat-2.5-Preview xuất hiện với một mục ghi ngày tháng trên changelog của chính Meituan — nguyên văn từ phía nhà cung cấp: "Version: 2026-09-25 — LongCat-2.5-Preview Now Available" — một trang định giá liệt kê nó là mô hình trả theo mức sử dụng hiện hành của nền tảng, cùng một hướng dẫn bắt đầu nhanh đề cập cả hai định dạng truyền tải. Bài đăng của chính Meituan trên X mô tả nó là "1.6T parameters. ~48B active. A 1M-token context window. Natively multimodal." Ngoài những điều đó, không có gì để đọc. Không có repository nào trong tổ chức meituan-longcat trên Hugging Face bao trùm mô hình này — repository gần đây nhất của tổ chức là LongCat-Flash-Lite-Sparse, từ ngày 31 tháng 7 — và danh mục mô hình OpenCode, nơi cung cấp mô hình này, ghi nhận nó là trọng số đóng. Không có thẻ mô hình, không có báo cáo kỹ thuật, không có giấy phép, không có bảng tham số nào do nhà cung cấp công bố, và không có đánh giá độc lập nào ở bất cứ đâu: tính đến ngày 27 tháng 9, không có trang LongCat-2.5-Preview nào trên Artificial Analysis.

Qwen3.8-Max là trường hợp ngược lại ở gần như mọi khía cạnh. Nó được phát hành rộng rãi vào ngày 3 tháng 8 năm 2026 với bảng giá được công bố, và Alibaba đã phát hành một bản làm mới có tên, Qwen3.8-Max-0902, vào ngày 2 tháng 9. Artificial Analysis đánh giá nó: Chỉ số Thông minh 45,4, xếp thứ 15 trong số 145 mô hình, và Chỉ số Lập trình 76,2, xếp thứ 9 trong số 138. Nó đạt GPQA Diamond 92,8%, Humanity's Last Exam 43,1%, SciCode 52,1%, Long-Context Recall 80,3%, Terminal-Bench 2.1 đạt 88,8%, và τ-bench ngân hàng đạt 47,8%. Đó là một mô hình được đo lường với minh chứng cho từng con số.

Vậy nên, bản tóm tắt trung thực về cột bằng chứng bị lệch theo một cách chẳng liên quan gì đến năng lực. Một trong hai mô hình này có thể được đánh giá trước khi bạn quyết định. Mô hình còn lại thì chỉ có thể thử mà thôi.

Bảng giá, từng dòng một

Cả hai đều là những mô hình hàng triệu token với cùng trần đầu ra, nên các bảng thông số kỹ thuật hội tụ đúng ở nơi mà một bảng thông số kỹ thuật ít hữu ích nhất:

• Đầu vào không dùng bộ đệm — LongCat-2.5-Preview 0,30 USD mỗi 1 triệu so với Qwen3.8-Max 2,00 USD mỗi 1 triệu, khoảng cách 6,7 lần.

• Đầu vào được lưu đệm — $0.006 mỗi 1 triệu so với $0.25 mỗi 1 triệu, chênh lệch gấp 41,7 lần.

• Đầu ra — 1,20 đô la mỗi 1M so với 6,00 đô la mỗi 1M, chênh lệch gấp 5 lần.

• Cửa sổ ngữ cảnh — 1.048.576 token so với 1.000.000 token. Về mặt chức năng, hòa nhau.

• Đầu ra tối đa — 131.072 token trên cả hai. Giống hệt nhau.

• Điểm số độc lập — không có công bố nào so với AA Intelligence 45.4 và AA Coding 76.2.

Mọi con số về LongCat ở đó đều đến từ trang định giá của chính Meituan, và trang đó ghi nhãn cho cả cột là “Giá đã giảm (trong thời gian có hạn)”. Các con số của Qwen3.8-Max là mức giá niêm yết của Alibaba, lấy từ thẻ mô hình của chính chúng tôi, với giá đọc bộ nhớ đệm là 0,25 USD và giá ghi bộ nhớ đệm là 2,50 USD mỗi triệu. Ảnh chụp của Artificial Analysis được ghi ngày 2 tháng 9 năm 2026.

Dòng cached-input chính là dòng đáng để nhìn kỹ. Mức chênh lệch 42× ở khâu đọc từ bộ đệm là con số đơn lẻ lớn nhất trong phép so sánh này, và nó rơi đúng vào chiều mà các khối lượng công việc của agent thực sự sống dựa vào. Một vòng lặp agent gửi lại system prompt và tool schema dài 100.000 token ở mỗi lượt đang trả mức giá đã lưu đệm cho phần lớn số token của nó, chứ không phải mức giá đầu vào được quảng cáo.

Một cuộc gọi 150.000 token, được định giá theo cả hai chiều

Hãy xét một yêu cầu dạng agent hợp lý: 150.000 token đầu vào, 50.000 trong số đó được phục vụ từ cache, và một câu trả lời dài 4.000 token. Theo mức giá ưu đãi của Meituan, cuộc gọi đó tốn $0,0501. Theo giá niêm yết của Qwen3.8-Max, cuộc gọi y hệt tốn $0,3365 — cao hơn 6,7 lần, tức $50 so với $337 cho một nghìn cuộc gọi mỗi ngày. Đẩy hỗn hợp này lên mức cache hoàn toàn, vốn là trạng thái ổn định đối với một prompt lặp lại, và tỷ lệ này nới rộng lên 12,3 lần: $0,006 so với $0,074 mỗi cuộc gọi.

Không có gì trong phép tính đó phụ thuộc vào việc LongCat-2.5-Preview có tốt hay không. Đó chính xác là vấn đề. Hệ số nhân mà bạn đang được chào mời là có thật, và từ đi kèm với nó trên chính trang của nhà cung cấp là “limited-time”, không có ngày kết thúc và không có giá kế nhiệm được nêu. Một mức giảm giá 6,7× không có ngày hết hạn được công bố là một khoản mục ngân sách mà bạn không thể đưa vào kế hoạch; đó là một khoản mục ngân sách mà bạn phải theo dõi.

Cũng có một sự bất đối xứng về định tuyến đáng nói thẳng ra. Qwen3.8-Max là một tuyến mà chúng tôi phục vụ — qwen/qwen3.8-max và bản đã ghim qwen/qwen3.8-max-0902 — ở giá niêm yết của Alibaba, không đánh thêm, nên một thay đổi giá từ nhà cung cấp sẽ đến phía chúng tôi ngay trong ngày chứ không phải vài tuần sau. LongCat-2.5-Preview không phải là một trong các tuyến của chúng tôi, và chúng tôi sẽ không giả vờ điều ngược lại; ở phía rẻ của phép so sánh này, bạn đang làm việc với API của chính Meituan và bất kỳ nền tảng nào bạn dùng để truy cập nó.

Lời khẳng định duy nhất mà API của chính Meituan phản bác

{{1}}Đây là phát hiện{{/1}} có thể quyết định {{2}}cuộc đối đầu{{/2}} cho bất kỳ ai có khối lượng công việc không thuần văn bản.

Nhật ký thay đổi của Meituan liệt kê hiểu hình ảnh là bổ sung nổi bật của thế hệ 2.5: "Hiểu đa phương thức: Khả năng hiểu hình ảnh mới, có thể phân tích nội dung hình ảnh, hỗ trợ hỏi đáp xuyên phương thức, tóm tắt nội dung và suy luận hình ảnh phức tạp." Bài đăng trên X nói "đa phương thức nguyên bản." Đó là những tuyên bố của nhà cung cấp, và tự thân chúng thì cũng hợp lý để đưa vào một quyết định.

Sau đó, chính trang tài liệu đó công bố ví dụ phản hồi để truy xuất siêu dữ liệu của chính mô hình đó, và mô hình mà nó trả về chỉ có văn bản. Đối với id "LongCat-2.5-Preview", payload hiển thị context_length: 1048576, input_modalities: ["text"], output_modalities: ["text"], và một chuỗi modality là text->text. Không có mục hình ảnh. Không phải trong một bản chụp cũ — mà trong ví dụ minh họa trên trang ghi tài liệu về endpoint đó.

A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.

Điều đó không chứng minh rằng mô hình không thể nhìn thấy. Nó chứng minh rằng nhà cung cấp chưa dung hòa phần văn xuôi của mình với schema API của chính họ, và điều đó có nghĩa là người mua không thể tính một khối lượng công việc thị giác dựa trên câu trong changelog đó cho đến khi có ai đó giải quyết dứt điểm. Đặt nó cạnh phía bên kia: danh mục của chúng tôi liệt kê Qwen3.8-Max chấp nhận đầu vào văn bản, hình ảnh và video, với thị giác nằm trong số các năng lực được công bố, và có một bảng đánh giá độc lập đứng sau mô hình. Nếu tác vụ của bạn là hiểu tài liệu, sàng lọc ảnh chụp màn hình, hay phân tích khung hình video, thì cột đắt đỏ là cột có phương thức đầu vào đã được xác minh và cột rẻ là cột có phương thức đầu vào chưa được giải quyết. Chỉ một dòng đó có thể xóa sổ toàn bộ mức 6,7×.

Bản xem trước không thể được ghim vào những gì

Alibaba phát hành các bản snapshot có ghi ngày. qwen/qwen3.8-max-0902là một bản dựng được đặt tên, đóng băng, có cùng mức giá $2/$6 như mô hình cơ sở, nghĩa là một quy tắc định tuyến nêu tên nó sẽ tiếp tục trả về đúng cùng một trọng số vào tháng sau. Những thay đổi về hành vi sẽ đến dưới dạng một id mới mà bạn có thể áp dụng theo lịch trình của riêng mình.

LongCat-2.5-Preview không có định danh như vậy. Id model chính là id preview, không có hậu tố snapshot, không có lịch sử phiên bản trên nền tảng, và không có mục changelog nào cho bạn biết rằng trọng số đã thay đổi — chỉ cho biết rằng mức giảm giá là "trong thời gian có hạn". Đây là bản preview theo nghĩa thông thường: thứ nằm dưới cái tên đó được phép thay đổi, và bạn sẽ phát hiện ra từ đầu ra của mình chứ không phải từ một ghi chú phát hành.

Cách rẻ nhất để mua bằng chứng còn thiếu là cánh cửa sổ mà Meituan đã mở ở phía bên kia của điều này: OpenCode liệt kê LongCat-2.5-Preview là miễn phí trong một thời gian giới hạn, với việc nhà cung cấp tuân theo chính sách không lưu giữ dữ liệu và không huấn luyện trên dữ liệu của bạn, và vào ngày 26 tháng 9, họ cho biết cửa sổ này kéo dài hai tuần. Đầu vào miễn phí, đầu ra miễn phí, đọc bộ nhớ đệm miễn phí. Đó là một cách hợp pháp để xây dựng bảng đánh giá mà chưa ai công bố — hãy chạy tập dữ liệu đánh giá của riêng bạn trên đó, và bạn có một con số ở nơi mà nhà cung cấp chỉ đưa cho bạn một câu. Nhưng điều nó không phải là một mức giá mà bạn có thể dựa vào để lập kế hoạch: hai tuần rồi sẽ kết thúc, và con số ở phía bên kia của nó do Meituan quyết định.

Ai nên chọn cái nào

Hãy chọn Qwen3.8-Max khi chính khối lượng công việc là lý do bạn mua mô hình ngay từ đầu. Nếu đầu vào là hình ảnh hoặc video, nếu câu trả lời phải tái lập được giữa các bản build, nếu một chỉ số độc lập là yêu cầu của bộ phận mua sắm, hoặc nếu tác vụ thuộc kiểu lập trình tác tử mà Terminal-Bench và Coding Index là đại diện, thì mức 6,7× chính là cái giá để bạn có thể kiểm tra lại công việc của mình. Với một khóa, nó còn nằm sau một chuỗi dự phòng, nên một mô hình đã được chấm điểm có thể gánh ngày tồi tệ thay cho mô hình chưa được chấm điểm mà bạn không cần chạy hai tích hợp.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, headed 'Qwen3.8 Max', listing input modalities 'text + Image + video' with Vision, Tools, JSON and Reasoning capability chips, a price of $2.00 per 1M input and $6.00 per 1M output, open weights 'No', a p50 time-to-first-token of 2.73s, and a public benchmark panel sourced to Qwen dated 2026-08-03.

Hãy chọn LongCat-2.5-Preview khi khối lượng công việc lớn, ngữ cảnh ngắn, chỉ dùng văn bản và mang tính nội bộ — phân loại, trích xuất, tóm tắt, viết lại hàng loạt — và khi cái giá của việc sai chỉ là một lần thử lại chứ không phải mất một khách hàng. Với dạng bài đó, dòng đầu vào được lưu đệm không phải là một khoản giảm giá, nó là toàn bộ bài toán kinh tế của công việc, và 42× là con số đáng bỏ công đo đếm. Hãy tận dụng cửa sổ miễn phí để tạo ra bộ đánh giá chuẩn mà hiện chưa hề tồn tại. Đừng di chuyển một luồng công việc trọng yếu lên đó.

Điều gì sẽ thay đổi phán quyết này, theo thứ tự quan trọng: một đánh giá độc lập về LongCat-2.5-Preview; một ngày kết thúc được công bố và giá kế nhiệm cho ưu đãi giảm giá; một lịch sử phiên bản với các ảnh chụp nhanh có ngày tháng; và một giải pháp cho việc liệu danh sách phương thức có chỉ là văn bản hay không. Bất kỳ điều nào trong số đó cũng khiến cột giá rẻ trở thành nhiều hơn một khoản giảm giá. Cho đến khi ít nhất một điều được đưa ra, so sánh này không phải là cuộc đối đầu giữa hai mô hình — mà là cuộc đối đầu giữa một mức giá bạn có thể xác minh và một khả năng bạn không thể.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Qwen3.8-Max - the scoreboard'. The left column, LongCat-2.5-Preview, reads 'Uncached input $0.30 / 1M', 'Cached input $0.006 / 1M', 'Output $1.20 / 1M', 'Context 1,048,576', 'Max output 131,072' and 'AA Intelligence none'; the right column, Qwen3.8-Max, reads 'Uncached input $2.00 / 1M', 'Cached input $0.25 / 1M', 'Output $6.00 / 1M', 'Context 1,000,000', 'Max output 131,072' and 'AA Intelligence 45.4'. A footer credits LongCat prices to Meituan as limited-time, Qwen prices to Alibaba, and the AA index to Artificial Analysis dated 2 Sept 2026. The OrcaRouter logo is composited in the bottom-right corner.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày