
Mercury 2.5 Preview vs Grok 4.6: Liệu bản xem trước 1.107 token/giây có thể hạ bệ nhà vô địch về giá trị?
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
Câu trả lời chỉ trong một câu: Mercury 2.5 Preview là mô hình suy luận đáng tin cậy rẻ nhất hiện đang vận hành, ở mức 0,04 USD / 0,15 USD mỗi triệu token, còn Grok 4.6 là mô hình rẻ nhất tại biên giới trí tuệ, ở mức 2,00 USD / 6,00 USD — vậy nên câu hỏi thực dụng giữa chúng là liệu một mô hình khuếch tán dạng xem trước mà Inception mới chỉ tuyên bố là "tương đương với" GPT-5.6 Luna (Low) và Claude Haiku 4.5 có thể đảm nhiệm được những công việc mà nếu không thì bạn sẽ phải trả phí hạng biên giới hay không. Mercury 2.5 Preview, ra mắt ngày 31 tháng 8 năm 2026, tạo sinh token song song và tuyên bố đạt 1.107 token mỗi giây trên các GPU tiêu chuẩn; còn Grok 4.6, mô hình chủ lực của biên giới trí tuệ ra mắt ngày 12 tháng 8 năm 2026, đạt 61 điểm trên chỉ số Artificial Analysis Intelligence Index, đồng hạng ba toàn cầu, và đạt được điều đó ở mức giá mà biên giới trí tuệ chưa từng chứng kiến. Cuộc chạm trán đó — tuyên bố nhanh nhất ở đáy đường cong giá gặp gỡ giá trị tốt nhất ở đỉnh của nó — chính là điều bài viết này xoay quanh.
Những điểm chính rút ra
• Grok 4.6 ở mức $2.00 / $6.00 với Chỉ số Trí tuệ AA 61 là nhà vô địch về giá trị tại phân khúc tiên phong; Mercury 2.5 Preview ở mức $0.04 / $0.15 là một canh bạc rằng chất lượng đủ tốt với giá chỉ bằng 1/50 sẽ đánh bại chất lượng tiên phong mà bạn hiếm khi cần đến.
• Các tuyên bố về tốc độ và chất lượng của Mercury 2.5 Preview hoàn toàn là của Inception; không có điểm benchmark độc lập nào tồn tại vào ngày đầu ra mắt.
• Ưu đãi giảm 80% khi ra mắt dành cho Mercury 2.5 Preview sẽ hết hạn vào ngày 8 tháng 9 năm 2026, sau đó giá niêm yết là $0,20 / $0,75 — vẫn rẻ hơn 10 lần so với Grok 4.6 về đầu vào, nhưng chỉ là một câu chuyện nhỏ hơn.
• Grok 4.6 hiện được định tuyến trên OrcaRouter ở mức giá niêm yết; Mercury 2.5 Preview chưa được định tuyến và được phục vụ qua API riêng của Inception cùng một số nền tảng bên thứ ba.
Bảng tỷ số

• Trí tuệ — Mercury 2.5 Preview: không có chỉ số độc lập; Inception tuyên bố ngang bằng với phân khúc tối ưu chi phí. Grok 4.6: Chỉ số Trí tuệ AA 61, đồng hạng 3 toàn cầu (theo Artificial Analysis; số liệu của phòng thí nghiệm là do nhà cung cấp tự báo cáo).
• Giá — Mercury 2.5 Preview: $0.04 / $0.15 cho mỗi 1M token (giảm 80% so với $0.20 / $0.75, áp dụng đến hết ngày 8 tháng 9 năm 2026). Grok 4.6: $2.00 / $6.00 cho mỗi 1M token, tăng gấp đôi lên $4.00 / $12.00 cho các prompt từ 200K token trở lên.
• Tốc độ — Mercury 2.5 Preview: 1.107 token/giây được công bố, theo báo cáo của nhà cung cấp. Grok 4.6: tốc độ không phải thông số chủ đạo; mô hình được xây dựng cho các phiên chạy agent kéo dài, không phải luồng phản hồi nhanh.
• Bối cảnh — Mercury 2.5 Preview: 260K. Grok 4.6: 500K.
• Công việc tác nhân — Mercury 2.5 Preview: không có điểm công khai, dù hỗ trợ gọi công cụ song song. Grok 4.6: APEX-Agents 57.5, DeepSWE v1.1 65.9, CursorBench v3.2 69.9 (do nhà cung cấp báo cáo, phần lớn chưa được tái lập).
• Trọng số — Mercury 2.5 Preview: đóng, độc quyền. Grok 4.6: đóng, độc quyền.
Nhà vô địch giá trị và sự bỏ qua mức giá
Vị trí của Grok 4.6 là khác thường. Nó chiếm vị trí thông minh #3 trên chỉ số Artificial Analysis — đứng ngang với GPT-5.6 Sol Max — trong khi rẻ hơn mọi mô hình nằm trong phạm vi mười điểm quanh nó, và các bài phủ sóng lúc ra mắt nhấn mạnh các phiên chạy tác nhân dài hoàn tất với chi phí trung bình khoảng 0,84 USD mỗi tác vụ trong một bài đánh giá do nhà cung cấp thực hiện. Đó chính là định nghĩa của một nhà vô địch về giá trị: năng lực cận tiên phong với mức giá khiến chi phí từng tác vụ hiện rõ trên bảng tính. Mercury 2.5 Preview không cố trở thành thứ đó. Inception định vị nó cạnh tranh với các mô hình như GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite và Claude Haiku 4.5 — tầng tối ưu chi phí, chứ không phải tầng tiên phong. Nếu Inception đúng, Mercury 2.5 Preview thấp hơn Grok 4.6 một bậc về năng lực và thấp hơn nhiều bậc về giá — một sản phẩm hoàn toàn nhất quán: một phương án bỏ qua mức giá cao cho những khối lượng công việc mà tầng tiên phong là lãng phí.
Điều mà giải mã song song thực sự thay đổi
Kiến trúc là phần đáng để hiểu, vì nó thay đổi ý nghĩa của từ “nhanh”. Các mô hình tự hồi quy phát ra một token qua mỗi bước, nên thông lượng bị giới hạn bởi độ trễ tuần tự; còn một mô hình ngôn ngữ khuếch tán như Mercury 2.5 Preview sinh song song cả một khối token rồi tinh chỉnh dần qua các bước khử nhiễu, nhờ đó tách thông lượng ra khỏi số token được tạo ra. Đó là lý do Inception có thể tuyên bố đạt 1.107 token/giây trên GPU tiêu chuẩn — không cần bộ tăng tốc đặc biệt, không thủ thuật gộp lô — và cũng là lý do tuyên bố thực chất về sản phẩm lại nằm ở thời gian nhận token đầu tiên dưới 300 mili giây cho các tác vụ tương tác. Với một tác nhân giọng nói, một đường ống tìm kiếm, hay một tác nhân phụ viết mã gọi mô hình trong từng lượt, sự khác biệt về độ trễ đó chính là sản phẩm: nó là ranh giới giữa một vòng phản hồi giọng nói tức thì và một vòng bị chững lại. Vấn đề là: các mô hình ngôn ngữ khuếch tán là một lĩnh vực nghiên cứu còn non trẻ; con số 1.107 là do Inception đưa ra; và chưa có phòng thí nghiệm độc lập nào tái tạo được tốc độ đó, cũng như đo được độ lệch chất lượng — nếu có — mà kiểu sinh song song gây ra trên các prompt dài hoặc đối kháng.
Nơi Grok 4.6 vẫn làm tốt công việc của mình
Không có gì ở Mercury 2.5 Preview chạm tới những phân khúc thị trường mà Grok 4.6 đang thực sự chiến thắng. Mức tăng của Grok so với Grok 4.5 tập trung vào các benchmark về tác tử (agentic) và lập trình — DeepSWE tăng 11,9 điểm, APEX-Agents tăng 10,4, Terminal-Bench tăng 10,3 — và cửa sổ ngữ cảnh 500K của nó tồn tại để dành cho các tác tử dài hạn phải giữ toàn bộ nhiệm vụ trong ngữ cảnh. Mercury 2.5 Preview cung cấp khả năng gọi công cụ song song, nhưng một mô hình không có điểm agentic độc lập, giới hạn đầu ra 65.536 token, và ngữ cảnh 260K không phải là công cụ cho một quy trình kỹ thuật phần mềm 50 bước. Hai mô hình gần như không trùng về cách dùng: Grok 4.6 là cỗ máy cho những công việc phải thực sự hoàn thành; Mercury 2.5 Preview là cỗ máy cho những tác vụ cần cảm giác tức thời và gần như không tốn gì cho mỗi lần gọi.
Cửa sổ giảm giá 80%
Mức giá ở đây có ngày hết hạn, và điều đó làm thay đổi quyết định. Mức giá $0.04 / $0.15 của Mercury 2.5 Preview là mức chiết khấu 80% so với giá niêm yết $0.20 / $0.75, và Inception đã cho biết chương trình khuyến mãi kéo dài đến ngày 8 tháng 9 năm 2026. Mức giá $2.00 / $6.00 của Grok 4.6 là một mức giá niêm yết ổn định với cấu trúc rõ ràng — đầu vào được lưu cache ở mức $0.50, một bậc ưu tiên với hệ số 2×, và một bậc tăng giá cho prompt dài tại mốc 200K token khiến toàn bộ yêu cầu bị tính phí theo mức giá cao hơn. Nếu bạn so sánh các con số hiện tại, Mercury trông rẻ hơn 50× ở đầu vào và 40× ở đầu ra; nếu mức chiết khấu hết hạn đúng kế hoạch, khoảng cách thực sự trong dài hạn là 10× ở đầu vào và 5× ở đầu ra. Cả hai cách diễn giải đều không sai — chúng chỉ là những chân trời thời gian khác nhau, và một pipeline được định giá theo mức chiết khấu mà không có điểm đánh giá lại sẽ là một pipeline sẽ bị bất ngờ vào ngày 9 tháng 9. Mức giá $2.00 / $6.00 của Grok 4.6 chính là số tiền bạn phải trả trên OrcaRouter, nơi giá niêm yết của nhà cung cấp được chuyển thẳng với mức phụ giá 0% — khi nhà cung cấp thay đổi một con số, nó sẽ có hiệu lực trên cùng một key ngay trong ngày, kèm theo khả năng tự động chuyển sang dự phòng nếu một đường dẫn nhà cung cấp bị giới hạn tốc độ.
Phán quyết một dòng
Nếu công việc phải hoàn thành và bạn muốn năng lực tiên phong với mức giá tốt nhất trong phân khúc, hãy mua Grok 4.6 — đây là nhà vô địch giá trị đã được kiểm chứng, đang có mặt trên OrcaRouter với giá $2.00 / $6.00 hôm nay. Nếu công việc là suy luận văn bản khối lượng lớn, nhạy cảm với độ trễ, nơi những câu trả lời đủ tốt có chi phí xác minh thấp, Mercury 2.5 Preview với giá $0.04 / $0.15 là một mức giá đột phá đáng để thử nghiệm trong cửa sổ giảm giá — chỉ cần nhớ rằng mọi tuyên bố ở phía của nó trên bảng đều là của Inception, còn bằng chứng thì vẫn chưa được đưa ra.


OrcaRouter chuyển tiếp giá niêm yết của nhà cung cấp với mứcchênh lệch 0% kèm tính năng tự động chuyển đổi dự phòng (failover), do đó mọi thay đổi giá từ nhà cung cấp sẽ được cập nhật trên cùng một key ngay trong ngày.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
