
Mercury 2.5 so với Mercury 2.5 Preview: Một mô hình khuếch tán, hai ngày ra mắt
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Đây là một cuộc so tài trực diện giữa hai bên dùng chung một thẻ thông số mô hình. Inception Mercury 2.5 Preview, phát hành ngày 31 tháng 8 năm 2026, và Mercury 2.5, phát hành ngày 8 tháng 9 năm 2026, là cùng một mô hình ngôn ngữ khuếch tán, chỉ cách nhau tám ngày: một kênh xem trước mà Inception mở cho các nhà phát triển, và phiên bản sản xuất "sẵn sàng cho doanh nghiệp" mà họ tung ra một tuần sau đó. Inception đã không công bố một checkpoint khác, một con số tốc độ khác, hay một mức giá khác cho Mercury 2.5 — và những con số thực sự thay đổi giữa hai thông báo trông giống như một đợt dọn dẹp, chứ không phải một mô hình mới. Con số về ngữ cảnh đã được chỉnh từ 256K trên trang xem trước thành 260K tại thời điểm ra mắt, và mức tăng trí tuệ so với Mercury 2 được diễn đạt lại từ "hơn 10 điểm" (tài liệu xem trước) thành "40 phần trăm" (tài liệu ra mắt). Động cơ, tuyên bố 1.107 token mỗi giây, và bảng giá là giống hệt nhau. Vì vậy, đây không phải cuộc chiến thông số kỹ thuật thông thường, và thêm thắt cho một bên là không trung thực. Sự so sánh thực sự quan trọng giữa hai cái tên này xoay quanh cách đóng gói và thời điểm: bản phát hành sản xuất thực sự thay đổi điều gì, nhãn Preview thực sự đang nói với bạn điều gì, và cái tên nào mà các lệnh gọi API của bạn nên sử dụng ngay bây giờ.
Tại sao một mô hình lại được so sánh với chính nó
Các hãng thường tung bản xem trước của một mô hình rồi âm thầm gộp nó vào tên gọi chính; mục của bản xem trước biến mất và không ai viết bài so sánh. Inception thì ngược lại, đã để hai tên gọi này chạy song song trong một tuần, và danh tính của bản xem trước đến giờ mới bị khai tử — đó chính là lý do bài so sánh này có chất liệu. Bản Preview là con đường tắt mà Inception dùng để đưa canh bạc khuếch tán của mình đến trước mắt các nhà phát triển. Nó xuất hiện vào ngày 31 tháng 8 với bảng thông số kỹ thuật mà nay chính là bảng thông số của Mercury 2.5: một diffusion LLM (dLLM) tạo và tinh chỉnh song song các khối token thay vì phát ra từng token một; tuyên bố đạt 1,107 token/giây trên GPU tiêu chuẩn; tuyên bố thời gian đến token đầu tiên dưới 300ms; cửa sổ ngữ cảnh 260K token với đầu ra 65,536 token; các mức suy luận có thể điều chỉnh; sử dụng công cụ gốc, gọi công cụ song song và đầu ra có cấu trúc. Mọi con số trong số đó đều do chính Inception đưa ra, và chưa có phòng thí nghiệm độc lập nào đo đạc mô hình khi bản Preview được phát hành.
Vào ngày 8 tháng 9, Inception đã ra mắt Mercury 2.5 như là "cấp độ trí tuệ tiếp theo cho các LLM khuếch tán" và là mô hình suy luận nhanh nhất của họ đang vận hành — sẵn sàng cho doanh nghiệp, nhắm đến các tác tử thoại, các tác tử con viết mã, tìm kiếm doanh nghiệp và khối lượng công việc hỗ trợ. Cùng thông số kỹ thuật, cùng định vị, cùng bảng giá. Bản ra mắt cũng hé lộ hai phiên bản liên quan, cho thấy rõ hướng đi của Inception: Mercury Voice, một dLLM được tinh chỉnh để có token đầu tiên dưới 170ms dành cho tác tử thoại, và Mercury Router, định tuyến các prompt qua nhiều mô hình dựa trên chất lượng, tốc độ và chi phí. Mercury 2.5 là sản phẩm chủ lực trong một hệ sinh thái được xây dựng cho các khối lượng công việc tác tử nhạy cảm với độ trễ, thay vì cho phân khúc chất lượng tiên phong.
Sự kiện ra mắt ngày 8 tháng 9 thực sự đã thay đổi điều gì
So sánh từng dòng giữa hai tên gọi, và khác biệt không nằm ở động cơ — mà nằm ở mọi thứ bao quanh động cơ:
• Trạng thái — Mercury 2.5 Preview: bản xem trước khép kín có thể "thay đổi hành vi hoặc tính khả dụng." Mercury 2.5: mô hình sản xuất được ra mắt với cam kết sẵn sàng cho doanh nghiệp, kênh bán hàng và danh mục sản xuất có mốc thời gian cụ thể.
• Danh tính — Trang mô hình của Inception hiện liệt kê Mercury 2.5, Mercury Voice và Mercury Router, không thấy Preview đâu cả, và chú thích hỗ trợ của nó nêu tên Mercury 1, Mercury 2 và Mercury Edit 2 là các mô hình "vẫn được hỗ trợ cho khách hàng hiện tại." Preview không xuất hiện trong danh sách nào. Theo quan điểm của nhà cung cấp, nhãn preview đã được gộp vào Mercury 2.5.
• Điểm cuối — Nền tảng dành cho nhà phát triển của Inception phục vụ mô hình dưới tên mercury-2.5, và danh sách sản xuất chính thức có hiệu lực từ ngày 8 tháng 9 là nơi phục vụ lưu lượng truy cập mới. Trong danh mục từng giới thiệu bản Preview vào cuối tháng 8, tên Preview hiện không trỏ tới điểm cuối phục vụ trực tiếp nào, trong khi danh sách Mercury 2.5 được thêm vào ngày 8 tháng 9 đảm nhận các phản hồi. Bất kỳ ai đã lập trình theo đúng tên Preview nên chuyển sang trỏ tới Mercury 2.5 và xác nhận nhà cung cấp của họ đang thực sự tính phí gì — mã định danh bạn đã tích hợp trong tuần đầu tiên chính là mã đang bị ngừng hoạt động.
• Giá — danh sách giống hệt và mức chiết khấu giống hệt. Cả hai đều là $0.20 cho mỗi triệu token đầu vào và $0.75 cho mỗi triệu token đầu ra, với đầu vào được lưu trong bộ nhớ đệm ở mức $0.02, và cả hai đều ra mắt với mức giảm khoảng 80%: $0.04 / $0.15, bộ nhớ đệm $0.004. Mức chiết khấu của Preview được giới hạn thời gian rõ ràng đến ngày 8 tháng 9; Mercury 2.5 ra mắt với cùng ưu đãi giảm 80%, và mức giá chiết khấu là thứ mà bảng niêm yết sản xuất của nó vẫn hiển thị tại thời điểm viết bài. Đó chính là cái bẫy, được mổ xẻ bên dưới.
• Bắt đầu sử dụng — bản phát hành chính thức đã thêm một lượng token miễn phí cho các tài khoản nhà phát triển mới — các tài liệu phát hành nêu con số 100 triệu token — và mở ra một kênh liên hệ dành cho doanh nghiệp mà bản xem trước chưa từng có.
• Bằng chứng — không thay đổi. Cả hai tên đều không có chuẩn đánh giá độc lập, và các tuyên bố của nhà cung cấp vẫn là những tuyên bố cũ, chỉ khác cách diễn đạt một chút: bước nhảy vọt về trí thông minh “hơn 10 điểm” so với Mercury 2 trong tài liệu xem trước trở thành mức tăng “40 phần trăm” trong tài liệu ra mắt, cùng với mức ngang bằng đã nêu với phân khúc frontier được tối ưu hóa chi phí (GPT-5.6 Luna ở chế độ nỗ lực thấp, Gemini 3.5 Flash-Lite, Claude Haiku 4.5) và cùng con số 79% trên GPQA Diamond và 77% trên IFBench do nhà cung cấp báo cáo. Một tuyên bố được nhắc lại không phải là một tuyên bố đã được xác minh.

Cái bẫy định giá nằm ở trung tâm của sự kết hợp.
Vì hai tên gọi này có cùng giá niêm yết và cùng mức chiết khấu teaser 80%, người ta dễ cho rằng chúng luôn có chi phí như nhau. Nhưng chúng không nhất thiết phải như vậy. Chiết khấu của Preview đã dừng hẳn vào ngày 8/9; trong khi đó, chiết khấu ra mắt của Mercury 2.5 vẫn đang chạy với bộ đếm thời gian mới. Trong suốt một tuần, người dùng hoàn toàn có thể phải trả $0.20 / $0.75 cho một lời gọi tới Preview, trong khi cùng engine đó lại phản hồi với giá $0.04 / $0.15 dưới tên production của nó — hoặc có khả năng hơn là họ đang dùng một preview ID đã âm thầm ngừng phục vụ trong khi hóa đơn vẫn tiếp tục đến. Một mức chiết khấu ra mắt hết hạn theo từng endpoint chính là thứ chữ in nhỏ biến câu chuyện "cùng mô hình, cùng giá" thành một sự chênh lệch chi phí thực sự.
Con số lâu bền là giá niêm yết, và lời khuyên lâu bền là hãy dự trù ngân sách theo mức đó: $0.20 / $0.75 cho mỗi triệu token, $0.02 cho input được lưu cache — rẻ đối với một mô hình suy luận có ngữ cảnh 260K, thấp hơn hẳn phân khúc flagship, nhưng không phải mức $0.04 / $0.15 mà các banner lúc ra mắt quảng cáo. Hãy coi mức giá chiết khấu như một mức giá dùng thử có thời hạn, hãy kiểm tra xem nhà cung cấp của bạn tính phí theo đúng model id trong mã của bạn chứ không phải theo tên trên trang tiếp thị, và nếu bạn đã gia nhập từ bản Preview, hãy chuyển sang Mercury 2.5 trước khi ngày hết hạn hoặc một endpoint đã ngừng hoạt động quyết định thay bạn.
Đây cũng chính là loại vấn đề mà một tầng định tuyến được tạo ra để loại bỏ. Một bộ định tuyến mô hình chuyển tiếp giá niêm yết của nhà cung cấp ở mức tăng giá 0% cho thấy mức giá mà nhà cung cấp thực sự tính phí, được cập nhật ngay trong ngày một ưu đãi ra mắt có hiệu lực hoặc hết hạn, và cơ chế chuyển đổi dự phòng tự động giúp các lời gọi luôn thông suốt khi một endpoint bị ngừng hoạt động ngay bên dưới bạn. Tính đến thời điểm viết bài này, Mercury 2.5 chưa có trên OrcaRouter — Inception đang phục vụ nó qua API riêng của mình và một số nền tảng bên thứ ba — vì vậy hiện tại, trang danh sách mô hình của nhà cung cấp là nguồn tham chiếu chính xác nhất về mức giá. Ngay khi một nhà cung cấp niêm yết nó, những cơ chế chuyển tiếp đó chính là thứ bạn nhận được chỉ với một khóa API, và việc giảm giá hay hết hạn ưu đãi sẽ xuất hiện phía chúng tôi ngay trong ngày được công bố.
Vấn đề bằng chứng mà cả hai tên đều gặp phải
Bảng điểm trung thực cho cặp đôi này rất ngắn, vì hai cột là cùng một mô hình với cùng một sự thiếu vắng bằng chứng. Cả Mercury 2.5 lẫn Mercury 2.5 Preview đều không có chỉ số đánh giá độc lập, không có lần chạy tái lập, cũng không có thứ hạng đấu trường tính đến ngày 9 tháng 9 năm 2026. Những tuyên bố của Inception — bước nhảy vọt về trí tuệ so với Mercury 2, sự tương đương với phân khúc Haiku 4.5, 79% GPQA Diamond, 1.107 token mỗi giây — chỉ là lời nói của công ty, và chúng giống hệt nhau cho cả hai tên gọi vì mô hình là giống hệt nhau.
Mảnh bằng chứng độc lập duy nhất trong gia đình này chỉ ra cách đọc tuyên bố về tốc độ. Artificial Analysis đã đo Mercury 2, thế hệ tiền nhiệm, ở mức 684 token mỗi giây trên endpoint sản xuất, chấm cho nó 22 điểm trên Intelligence Index — thực sự nhanh, và là minh chứng rằng phương pháp diffusion không phải là ảo ảnh, nhưng vẫn kém xa con số khoảng 1.000 token mỗi giây mà Inception quảng cáo cho mẫu máy đó trên phần cứng Blackwell. Hãy kỳ vọng một khoảng cách tương tự giữa con số 1.107 của Mercury 2.5 và những gì một endpoint dùng chung, đa khách thuê thực sự cung cấp dưới tải thực tế. Sự thận trọng tương tự cũng áp dụng cho chất lượng: một mô hình diffusion hoàn toàn mới chỉ được chính nhà sản xuất của nó đo lường thì không nên tin vào lời họ nói rằng nó ngang bằng Claude Haiku 4.5 cho đến khi bên thứ ba vận hành thử nghiệm.

Các trang theo dõi đã bắt đầu đưa tin về bản phát hành phản ánh chính xác hiện trạng đó. Một bản ghi BenchLM cho Mercury 2.5, được đăng ngày 8 tháng 9, không cho mô hình điểm số công khai hay thứ hạng công khai nào; bản ghi này mang các chỉ số GPQA Diamond 79% và IFBench 77% của Inception được dán nhãn rõ ràng là do nhà cung cấp báo cáo, đồng thời lưu ý rằng tốc độ chạy độc lập chưa được đo lường. Mục nhập đầu tiên trong chỉ số Artificial Analysis, một vị trí trên LMArena, hoặc một lần chạy GPQA được tái lập sẽ biến Mercury 2.5 từ một tuyên bố thành một đối tượng có thể so sánh — và điều đó sẽ áp dụng cho cả hai tên cùng lúc, vì chỉ có một mô hình duy nhất để đo lường.

Bạn nên gọi tên nào
• Tích hợp mới, không có legacy: Hãy gọi Mercury 2.5 và bỏ qua bản Preview. Tên bản production có cùng engine, cùng mức chiết khấu (hiện tại), các điều khoản enterprise, và đảm bảo rằng đây chính là id mà nhà cung cấp đang thực sự phục vụ. Bản Preview chỉ thêm rủi ro mất ổn định và không gì khác.
• Đã tích hợp Preview: hãy kiểm tra hôm nay xem nhà cung cấp của bạn phục vụ gì dưới tên đó và tính phí cho nó ra sao. Chuyển hướng client của bạn đến id Mercury 2.5 và xác nhận mức giá. Việc giữ tên Preview trong mã sản xuất bây giờ là một canh bạc rằng một kênh xem trước có giới hạn thời gian rõ ràng sẽ tồn tại lâu hơn chính sự ngừng hoạt động của nó.
• Lưu lượng doanh nghiệp hoặc quan trọng đối với production: Mercury 2.5 thông qua lộ trình enterprise của Inception, chứ không phải là nhãn preview không có cam kết phía sau. Đối với nhu cầu voice và routing, hãy dùng Mercury Voice và Mercury Router tương ứng. Cả hai hiện vẫn đang trong giai đoạn preview.
• Bất kỳ ai đang đánh giá tier diffusion: cả hai tên gọi đều là cùng một đối tượng đánh giá, vì vậy chỉ cần chạy bản đánh giá của bạn trên Mercury 2.5 một lần và coi kết quả đó áp dụng cho toàn bộ dòng mô hình. Hãy dự trù ngân sách theo giá niêm yết, và coi các tuyên bố của nhà cung cấp như những giả thuyết cho đến khi có một điểm số độc lập được công bố.
Xem gì
Ba điều sẽ định đoạt việc ghép cặp này trong vài tuần tới. Thứ nhất, điểm chuẩn độc lập đầu tiên — một vị trí trên bảng xếp hạng chỉ số hoặc một lần chạy GPQA hay AIME được tái lập — thứ sẽ kiểm chứng tuyên bố ngang bằng vốn là toàn bộ canh bạc thương mại. Thứ hai, liệu danh tính Preview có biến mất hoàn toàn khỏi hệ sinh thái mô hình hay không, như chính trang mô hình của Inception đã ngầm ám chỉ. Thứ ba, điều gì sẽ xảy ra với mức chiết khấu 80% khi ra mắt khi mốc ngày 8 tháng 9 mà Preview được neo vào đã trôi qua: việc gia hạn sẽ khiến Mercury 2.5 rẻ về mặt cấu trúc, còn việc quay về mức $0.20 / $0.75 sẽ chỉ khiến nó đơn thuần là đủ sức cạnh tranh. Cho đến lúc đó, câu trả lời đúng cho "Mercury 2.5 hay Mercury 2.5 Preview?" là đây là một mô hình duy nhất, và bạn nên gọi đến cái vẫn còn là một sản phẩm.
