
LongCat-2.5-Preview vs MiniMax M3: Ghế rẻ đã bị chiếm mất rồi
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 610 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 189 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Tiền đề của phần lớn các bài viết về LongCat-2.5-Preview là Meituan đã hạ giá dưới mặt bằng chung. So với MiniMax M3, tiền đề đó tan biến ngay khi chạm thực tế. MiniMax M3 được niêm yết ở mức 0,30 USD mỗi triệu token đầu vào và 1,20 USD mỗi triệu token đầu ra trên danh mục của chúng tôi. Bảng giá công bố của LongCat-2.5-Preview là 0,30 USD mỗi triệu token đầu vào chưa cache và 1,20 USD mỗi triệu token đầu ra. Đó không phải là những con số na ná nhau; chúng là cùng một con số. Chỗ duy nhất chúng khác nhau là phần đầu vào đã cache, nơi Meituan báo giá 0,006 USD mỗi triệu token so với 0,06 USD của đối thủ đương nhiệm — khoảng cách gấp mười lần ở dòng rẻ nhất trong hóa đơn. Vậy nên câu hỏi đáng quan tâm không phải là liệu LongCat-2.5-Preview có rẻ hay không. Mà là bạn đang mua được gì và phải đánh đổi điều gì khi một mô hình mới xuất hiện với đúng mức giá của đối thủ đương nhiệm.
Câu trả lời ngắn gọn: một giới hạn đầu ra lớn hơn nhiều, một cơ sở bằng chứng mỏng hơn nhiều, và một ưu đãi bộ nhớ đệm.
Cùng mức giá niêm yết, mức trần công bố lại rất khác nhau
MiniMax M3 đã được công bố chính thức kể từ ngày 31 tháng 5 năm 2026. Danh mục của chúng tôi cung cấp mô hình này với cửa sổ ngữ cảnh 1.048.576 token và đầu ra tối đa 512.000 token — nhiều hơn mức mà hầu hết mô hình cho phép, và gấp bốn lần con số 131.072 của LongCat-2.5-Preview. Nó chấp nhận đầu vào là văn bản, hình ảnh và video, đồng thời trả về văn bản, với khả năng gọi công cụ, chế độ JSON và tính năng suy luận được cung cấp.

LongCat-2.5-Preview, được niêm yết trên Nền tảng API LongCat của Meituan vào ngày 25 tháng 9 năm 2026, khớp về ngữ cảnh ở mức 1.000.000 token và hụt rất xa ở đầu ra với 131.072. Cấu hình đầu vào của nó mới là câu hỏi nóng: changelog giới thiệu khả năng hiểu hình ảnh như là điểm bổ sung nổi bật nhất, nhưng phản hồi ví dụ trong tài liệu "Retrieve Model" của chính Meituan vẫn hiển thị input_modalities/ là ["text"]/ với một chuỗi modality text->text/. MiniMax M3 còn chấp nhận cả video, điều mà LongCat-2.5-Preview hoàn toàn không công bố. Nếu pipeline của bạn đưa vào các bản ghi màn hình hoặc chuỗi khung hình, thì phép so sánh này dừng lại tại đây.
Sự bất đối xứng về cache lại đi theo chiều ngược lại và đáng được nêu theo hướng có lợi cho Meituan, vì đây là khía cạnh duy nhất mà mô hình mới thực sự tạo ra khác biệt. $0,006 cho mỗi triệu đầu vào được cache so với $0,06 là một lợi thế thực sự cho các workload agent gửi lại cùng một tiền tố dài trong mỗi lượt — mà phần lớn trong số đó đều như vậy. Đây cũng là mục chi phí dễ thay đổi mà không báo trước nhất, vì Meituan đánh dấu toàn bộ bảng giá là ưu đãi có thời hạn.
Khoảng trống bằng chứng, được đo lường một cách trung thực theo cả hai hướng
Vị thế benchmark của MiniMax M3 không mạnh, và việc nói rõ điều đó là một phần để thực hiện so sánh này cho đúng. Artificial Analysis ghi nhận Coding Index 58,6 cho nó — đứng thứ bốn mươi sáu trong số các mô hình được theo dõi — và Intelligence Index 29,2 ở vị trí thứ sáu mươi. GPQA Diamond 92,9%, Humanity's Last Exam 39%, SciCode 47,1%, Long-Context Recall 83, τ²-Bench banking 15,3, Terminal-Bench v2.1 65,2. Các số liệu do chính MiniMax công bố lại bao quát một phạm vi khác: BrowseComp 83,5, GDPval rubrics 76,7, MCP Atlas 74,2, BankerToolBench 76,1. Đó là những con số do nhà cung cấp báo cáo và thuộc một cột khác với các con số độc lập, nhưng chúng tồn tại, và đó mới là điểm mấu chốt.

LongCat-2.5-Preview hoàn toàn không có cột nào. Không có bảng đánh giá chuẩn nào được công bố, không có model card, không có báo cáo kỹ thuật, không có kho lưu trữ trên HuggingFace hay trong tổ chức GitHub của Meituan, và metadata danh mục ghi trọng số mở là false. Số lượng tham số khoảng 1,6 nghìn tỷ tổng / 48 tỷ hoạt động được báo cáo từ metadata trang web của Meituan và các bài đưa tin thương mại Trung Quốc chứ không phải từ tài liệu. Vậy phát biểu chính xác là: điểm của M3 tầm thường và có nguồn độc lập; còn của LongCat-2.5-Preview thì vắng mặt. Một mô hình đạt điểm ở hàng bốn mươi trên chỉ số lập trình là một đại lượng đã biết mà bạn có thể lên kế hoạch dựa trên nó. Một mô hình không có điểm là một kiểu rủi ro khác, và việc giá giống hệt nhau loại bỏ phần bù đắp vốn thường biện minh cho việc chọn nó.
Khi cùng một mức giá thay đổi điều bạn nên làm
Khi một mô hình mới hạ giá thấp hơn cả thị trường, hành động hợp lý là đánh giá nó — lợi ích nằm ở mức giảm giá thực sự. Khi một mô hình mới ra mắt với đúng mức giá của một mô hình hiện hành đã được tung ra từ tháng Năm, lợi ích không phải là giá. Đó là năng lực, và năng lực là thứ duy nhất LongCat-2.5-Preview chưa công bố. Điều đó định hình lại toàn bộ việc đánh giá: bạn không kiểm tra xem nó có rẻ hơn không, mà kiểm tra xem nó có tốt hơn không, trên các tác vụ của bạn, từ vạch xuất phát với không bằng chứng nào để bám vào.
Có một chi tiết bậc hai khiến bài kiểm tra đó rẻ hơn vẻ ngoài của nó. LongCat-2.5-Preview miễn phí và không giới hạn thông qua OpenCode trong một khoảng thời gian không nêu rõ độ dài, với chính sách không lưu trữ mà OpenCode ghi rõ — huấn luyện mô hình "Not used", lưu trữ dữ liệu "0 days", so với ba mươi ngày cho danh mục so sánh. Vì vậy, chi phí tạo đánh giá của riêng bạn gần như bằng không, và chính sách lưu trữ nghĩa là bạn có thể chạy nó trên mã riêng tư. Một chi tiết harness cần giải quyết trước tiên là mô hình trả về dấu vết suy luận của nó trong một trường xen kẽ reasoning_content/ field; các client phân tích chat completions mà không lường trước điều đó sẽ âm thầm bỏ qua phần suy nghĩ và khiến mô hình trông tệ hơn thực tế.

Lập luận về định tuyến, cụ thể cho việc so sánh ở cùng một mức giá
Chúng tôi cung cấp MiniMax M3 với giá niêm yết của MiniMax và không cộng thêm phí. LongCat-2.5-Preview không phải là một trong những tuyến của chúng tôi — chúng tôi không cung cấp nó, và không có nội dung nào ở đây nên được hiểu là khẳng định điều ngược lại.
Trường hợp so tài cùng mức giá chính là tình huống mà việc định tuyến thực sự phát huy giá trị chứ không chỉ là một tiện ích. Nếu hai mô hình có cùng chi phí, việc lựa chọn giữa chúng mang tính theo từng yêu cầu và từng tác vụ: M3 nhờ giới hạn đầu ra 512.000 token và đầu vào video, LongCat-2.5-Preview nhờ ưu đãi giảm giá cho tiền tố được lưu đệm trong các vòng lặp agent dài, một khi bạn đã tự tin về chất lượng của nó. Kết hợp mô hình chính là cơ chế biến điều đó thành hiện thực — một lượt truy xuất và một bước tổng hợp có thể là các mô hình khác nhau trong cùng một yêu cầu, nên bạn không buộc phải chọn ra người thắng trước khi có bằng chứng. Và vì chúng tôi chuyển tiếp nguyên giá niêm yết của nhà cung cấp mà không cộng thêm, nên thay đổi mức giá của một nhà cung cấp sẽ hiện lên hóa đơn của bạn ngay trong cùng ngày thay vì vào kỳ gia hạn hợp đồng tiếp theo, điều này càng quan trọng hơn mức thông thường khi một trong hai thẻ rõ ràng là giá khuyến mãi. Tự động chuyển đổi dự phòng sau đó bao quát trường hợp một nhà cung cấp bị suy giảm, và điều này đặc biệt quan trọng với mô hình không có lịch sử phục vụ nào để kiểm tra.
Thường được hỏi
• LongCat-2.5-Preview có rẻ hơn MiniMax M3 không? Không. Trên các bảng giá được công bố, mức giá đầu vào và đầu ra hoàn toàn giống nhau, ở mức 0,30 USD và 1,20 USD mỗi triệu. Lợi thế giá duy nhất nằm ở đầu vào được lưu đệm, 0,006 USD so với 0,06 USD, và Meituan dán nhãn toàn bộ bảng giá của mình là ưu đãi có thời hạn mà không nói điều gì sẽ tiếp theo.
• Cái nào có đầu ra khả dụng lớn hơn? MiniMax M3 vượt trội hơn hẳn: 512.000 token so với 131.072. Đối với việc tạo nội dung dài, trích xuất có cấu trúc trên các tài liệu lớn, hay bất kỳ thứ gì viết dài hơn một chương, mức trần đó chính là thông số quyết định.
• Cái nào tôi có thể kiểm chứng? MiniMax M3, và việc kiểm chứng không hề tô hồng nó — Coding 58.6 ở vị trí thứ 46 và Intelligence Index 29.2 ở vị trí thứ 60 từ Artificial Analysis. LongCat-2.5-Preview không có đánh giá nào được công bố từ bất kỳ ai. Nếu một benchmark của LongCat-2.5-Preview xuất hiện trong tuần này, hãy coi nó là không thể kiểm chứng cho đến khi bạn truy được nó tới một đơn vị đánh giá có tên.
• Nên đưa cái nào vào production? Không cái nào cả, nếu chưa có bài kiểm tra của riêng bạn. Giữa hai lựa chọn, M3 là phương án ít biến động hơn vì các điểm yếu của nó đã được ghi nhận rõ ràng và các phương thức đầu vào đã được xác nhận; LongCat-2.5-Preview là phương án biến động cao hơn, với tuyên bố context lớn hơn, trần output nhỏ hơn nhiều, ưu đãi cache và không có bằng chứng công khai nào. Hãy chạy nó miễn phí trong khi cửa sổ còn mở, giữ cả hai phía sau một key, và để chính các con số của bạn đưa ra quyết định.
