
LongCat-2.5-Preview vs GPT-5.6 Sol: Cái giá của cửa sổ 1M token ở mỗi bên
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 610 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 189 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Điều hữu ích nhất bạn có thể nói về LongCat-2.5-Preview so với GPT-5.6 Sol không phải là mô hình nào thông minh hơn. Mà là cả hai đều quảng cáo cửa sổ ngữ cảnh khoảng một triệu token, và chỉ một trong hai tính cùng một mức giá cho toàn bộ cửa sổ đó. Giá của Sol tăng gấp đôi khi vượt quá 272.000 token đầu vào. Bảng giá công bố của LongCat-2.5-Preview, theo như Meituan ghi lại, hoàn toàn không phân tầng. Chính sự khác biệt cấu trúc đó quyết định phần lớn các khối lượng công việc tài liệu dài thực tế trước khi người ta tra cứu đến một benchmark — và đó là kiểu điều mà một bảng so sánh thông số sẽ không bao giờ cho bạn thấy, bởi vì cả hai mô hình đều đặt "1M" ở cùng một cỡ chữ.
Đây là những gì thực sự được ghi nhận cho mỗi mục, được sắp xếp theo những câu hỏi đáng để đặt ra.
Cửa sổ một triệu token có phải là cùng một sản phẩm ở cả hai bên không?
Không, và sự khác biệt không nằm ở cửa sổ — mà nằm ở điều xảy ra khi bạn lấp đầy nó. Danh mục của chúng tôi có Sol với cửa sổ ngữ cảnh 1.050.000 token cùng đầu ra tối đa 128.000 token, ở mức $4,00 mỗi triệu token đầu vào và $20,00 mỗi triệu token đầu ra cho các yêu cầu tối đa 272.000 token, với đầu vào được lưu đệm ở $0,40 mỗi triệu và ghi bộ đệm ở $5,00 mỗi triệu. Trên ngưỡng đó, mức giá tăng lên $8,00 và $30,00 mỗi triệu. Vì vậy, một lượt xử lý tài liệu 500.000 token trên Sol được tính theo mức giá ngữ cảnh dài cho toàn bộ yêu cầu, chứ không phải mức hỗn hợp.

LongCat-2.5-Preview liệt kê 1.000.000 token ngữ cảnh và 131.072 token đầu ra tối đa. Bảng giá của nó, được công bố trên chính nền tảng của Meituan và được gắn nhãn ở đó là ưu đãi có thời hạn, là 0,30 USD cho mỗi triệu token đầu vào chưa được cache, 0,006 USD cho mỗi triệu token đầu vào đã được cache và 1,20 USD cho mỗi triệu token đầu ra. Meituan không công bố bậc giá thứ hai. Điều đó không giống với việc nói rằng không có bậc nào tồn tại — mà là nói rằng nhà cung cấp chưa mô tả một bậc như vậy, và một mức giá không được mô tả thì không phải là mức giá bạn có thể lập ngân sách dựa vào.
Hãy đặt một con số cụ thể. Một lượt đọc 500.000 token rồi ghi trả lại 20.000 token tốn khoảng 4,60 USD trên Sol ở hạng long-context và khoảng 17 xu trên LongCat-2.5-Preview ở mức giá khuyến mại đã công bố. Cả hai con số đều là phép tính dựa trên bảng giá đã công bố, không phải kết quả đo lường. Tỷ lệ này đủ lớn để thay đổi điều gì là hợp lý về mặt kinh tế để thử làm: với mức giá long-context của Sol, việc nạp một codebase vào mô hình là một quyết định; còn với LongCat, nó gần như là mặc định.
Cái nào có bằng chứng đằng sau con số đó?
Sol, vượt trội hơn hẳn, và đây chính là phần khiến cho việc so sánh không chỉ đơn thuần là một cuộc tranh luận về giá cả. Sol là bản phát hành tháng 7 năm 2026 với một hồ sơ độc lập đầy đủ trên danh mục của chúng tôi: Chỉ số Lập trình là 77,4, đứng thứ ba trong số các mô hình mà Artificial Analysis theo dõi; Chỉ số Thông minh là 47 ở vị trí thứ mười ba; GPQA Diamond 94,1%; Humanity's Last Exam 49,5%; SciCode 57,1%; Terminal-Bench v2.1 ở mức 88,0; τ²-Bench ở mức 85,1. Tất cả những số liệu đó đều có nguồn từ Artificial Analysis, không phải từ OpenAI.
Con số liên quan nhất của nó cho so sánh này là Long-Context Recall: 84. Đó là mức cao nhất trong số các mô hình tiên tiến mà chúng tôi cung cấp, và đây là phép đo xem liệu mô hình có còn sử dụng thông tin nằm sâu bên trong một đầu vào dài hay không — câu hỏi mà một cửa sổ ngữ cảnh lớn được kỳ vọng sẽ trả lời. Nó cũng được đo ở độ dài ngữ cảnh của chính Sol, theo cách của chính Sol.
LongCat-2.5-Preview không có bản tương đương. Mục nhật ký thay đổi của Meituan cho ngày 25 tháng 9 năm 2026 tuyên bố có khả năng hiểu hình ảnh, năng lực lập trình và khả năng tương thích với “Claude Code và các môi trường phát triển chủ đạo khác”, đồng thời nêu tên Hermes, OpenClaw, OpenCode và Kilo Code. Nó không công bố bảng benchmark, thẻ mô hình hay báo cáo kỹ thuật nào. Khoảng 1,6 nghìn tỷ tham số tổng với khoảng 48 tỷ tham số hoạt động trên mỗi token được báo cáo từ siêu dữ liệu trang web của Meituan và các bài đưa tin chuyên ngành Trung Quốc, chứ không phải từ tài liệu. Không có kho lưu trữ LongCat-2.5-Preview nào trên HuggingFace, cũng không có kho nào trong tổ chức GitHub của Meituan, và siêu dữ liệu danh mục mà OpenCode phát hành ghi trọng số mở là false.

Phía đầu vào có khớp không, hay chỉ phía đầu ra?
Đây là chỗ hồ sơ của Sol rộng hơn còn của LongCat thì đang gây tranh cãi. Sol chấp nhận đầu vào là văn bản, hình ảnh và tệp trên danh mục của chúng tôi, và trả về văn bản. Changelog của LongCat-2.5-Preview giới thiệu khả năng hiểu hình ảnh như là bổ sung nổi bật — "phân tích nội dung hình ảnh để trả lời câu hỏi đa phương thức, tóm tắt nội dung và suy luận hình ảnh phức tạp" — nhưng phản hồi ví dụ trong tài liệu "Retrieve Model" của chính Meituan vẫn hiển thị input_modalities là ["text"] với chuỗi phương thức text->text. Mẫu đó có thể chỉ đơn giản là đã lỗi thời. Tuy vậy, đó vẫn là hợp đồng đã công bố của nhà cung cấp, và cách hiểu trung thực là đầu vào hình ảnh mới chỉ được tuyên bố chứ chưa được xác nhận cho đến khi bạn tự kiểm thử.
Một hệ quả thiết thực: dấu vết suy luận từ LongCat-2.5-Preview đến trong một trường reasoning_content xen kẽ thay vì dưới dạng một tham số được lấy mẫu. Các harness phân tích chat completions mà không mong đợi trường đó sẽ âm thầm bỏ qua phần suy luận của mô hình — không có lỗi, chỉ là một câu trả lời kém hơn. Dù bạn quyết định thế nào về chính mô hình, hãy kiểm tra điều đó trước.
Cái nào là lộ trình mà bạn thực sự có thể duy trì?
Sol là một trong những sản phẩm của chúng tôi. Chúng tôi cung cấp nó theo giá niêm yết của OpenAI với không tính thêm phí, vì vậy khi giá từ nhà cung cấp thay đổi, hóa đơn của bạn nhận được thay đổi đó ngay trong ngày thay vì vào kỳ gia hạn tiếp theo, và chuyển đổi dự phòng tự động sẽ chuyển một yêu cầu bị suy giảm sang một nhà cung cấp khỏe mạnh mà ứng dụng của bạn không hề hay biết. LongCat-2.5-Preview không phải là một trong các tuyến của chúng tôi — chúng tôi không cung cấp nó, và không có nội dung nào trong bài viết này nên được hiểu là chúng tôi có cung cấp nó.
Sự bất đối xứng đó chính là chỗ mà lớp định tuyến khẳng định vị trí của mình trong so sánh cụ thể này, chứ không phải như một lời bàn phụ chung chung. Cơ chế định giá theo bậc của Sol nghĩa là cùng một tác vụ có thể tốn gấp đôi chỉ vì độ dài đầu vào, và ngưỡng nằm ở 272,000 token — một con số mà ứng dụng của bạn biết trước khi gửi yêu cầu. Chia tách khối lượng công việc theo kích thước yêu cầu giữa các nhà cung cấp chính là việc mà một DSL định tuyến sinh ra để làm, và kết hợp mô hình còn đi xa hơn: hai mô hình có thể được ghép lại trong một yêu cầu để một lượt xử lý ngữ cảnh dài và một bước tổng hợp chất lượng cao không nhất thiết phải là cùng một mô hình với cùng một mức giá. Cả hai điều đó đều không phải lý do để chọn một mô hình không có benchmark nào được công bố. Cả hai đều là lý do để đừng gắn cứng vào một mô hình duy nhất.

Điểm mấu chốt
Nếu khối lượng công việc của bạn ngắn, Sol là lựa chọn đơn giản: nó đứng thứ ba trên chỉ số lập trình, có các con số độc lập trên mọi phương diện, và phía đầu vào của nó đã được ghi tài liệu. Nếu khối lượng công việc của bạn dài, phép tính đảo chiều mạnh: bậc ngữ cảnh dài của Sol có chi phí khoảng 26 lần mức giá khuyến mại của LongCat-2.5-Preview cho cùng một lượt đọc 500.000 token, và Sol mới là bên có điểm truy hồi, 84, thực sự trả lời được liệu cửa sổ dài có hoạt động hay không. Bạn đang mua một cửa sổ dài đã được đo lường với mức giá tiên phong, đối lại một cửa sổ dài chưa được đo lường với mức giá chiết khấu mà nhà cung cấp đã gắn nhãn là tạm thời.
Kiểu sai lầm cần tránh là coi chúng như những lựa chọn có thể so sánh ngang bằng. Chúng không phải là cùng một sản phẩm được bán với các mức giá khác nhau; chúng là một năng lực đã được ghi nhận và một lời hứa. Cách đúng để thu hẹp khoảng cách là chạy LongCat-2.5-Preview trên các tác vụ ngữ cảnh dài của riêng bạn khi nó miễn phí qua OpenCode hoặc rẻ qua Meituan — và giữ Sol phía sau một router để vào ngày mức giá khuyến mãi biến mất, hoặc gói ngữ cảnh dài vượt quá ngân sách của bạn, việc chuyển đổi chỉ là một dòng cấu hình chứ không phải một cuộc di trú.
