Một thẻ tiêu đề chính tự xây dựng cho 'Claude Fable 5.1 vs Grok 4.6' với phụ đề 'Chín điểm chỉ số, giá đầu ra gấp tám lần'. Hai khung: 'Claude Fable 5.1' (Anthropic, API đóng, 0.00 / 0.00 mỗi 1 triệu token, AA Intelligence Index 53, #1 trong 201) và 'Grok 4.6' (SpaceXAI, API đóng, .00 / .00 mỗi 1 triệu token, AA Intelligence Index 44, #20 trong 201). Phần chân trang ghi: 'Claude Fable 5.1 ra mắt ngày 1 tháng 9 năm 2026 · Grok 4.6 ra mắt ngày 12 tháng 8 năm 2026 · Số liệu độc lập, chỉ số Artificial Analysis hiện tại, thu thập ngày 10 tháng 9 năm 2026'; logo OrcaRouter nằm ở góc dưới bên phải.
Guides & Insights

Claude Fable 5.1 so với Grok 4.6: Chín điểm chỉ số và mức giá đầu ra gấp tám lần — Khoảng cách đó thực sự mang lại điều gì

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Claude Fable 5.1Grok 4.6 là hai mô hình biên giới đóng nằm ở hai đầu của dải giá thế hệ hiện tại. Flagship mới của Anthropic, phát hành ngày 1 tháng 9 năm 2026, có giá 10,00 USD cho mỗi triệu token đầu vào và 50,00 USD cho mỗi triệu token đầu ra, và trên phiên bản hiện tại của Chỉ số Trí tuệ (Intelligence Index) của Artificial Analysis, nó đạt 53 — đứng đầu trong số 201 mô hình mà chỉ số này theo dõi. Grok 4.6 của SpaceXAI, ra mắt từ ngày 12 tháng 8, có giá 2,00 USD và 6,00 USD cho cùng các đơn vị đó và đạt 44, đứng thứ hai mươi trong số 201. Chín điểm chỉ số phân tách chúng. Tám lần giá đầu ra phân tách chúng. Câu hỏi đặt ra là khối lượng công việc cụ thể nên quan tâm đến con số nào trong hai con số đó, và chúng chỉ ra các hướng khác nhau tùy thuộc vào việc bạn yêu cầu mô hình làm gì.

Nguồn dữ liệu, được nêu rõ ngay từ đầu: Artificial Analysis đã chấm lại Chỉ số Trí tuệ (Intelligence Index) của mình vào tháng 9, vì vậy các con số ở đây được lấy từ phiên bản hiện tại, ghi nhận vào ngày 10 tháng 9 năm 2026, thay vì từ thang đo cũ vẫn được trích dẫn trong nhiều bài viết hồi tháng 8. Điểm chỉ số từ các phiên bản khác nhau không thể so sánh được, đó là lý do vì sao các con số dưới đây có thể trông thấp hơn những gì bạn đọc về từng mô hình tại thời điểm ra mắt. Mọi thứ được ghi chú là do nhà cung cấp báo cáo đều lấy từ bảng đánh giá của chính phòng thí nghiệm phát hành và chưa được bên trung lập nào kiểm chứng lại. Lưu ý đó có mức độ ảnh hưởng không đồng đều ở đây — Grok 4.6 đã trải qua một tháng bị giới bên ngoài soi xét, trong khi Claude Fable 5.1 mới ra mắt được chín ngày và hầu hết những gì công chúng biết về các con số nổi bật của nó vẫn chỉ là lời khẳng định từ Anthropic.

Hai phòng lab, hai món đồ khác nhau đang giảm giá

Bản phát hành tháng 9 của Anthropic là một chiến lược về năng lực, gắn kèm câu chuyện an toàn. Claude Fable 5.1 là bản song sinh phát hành rộng rãi của Claude Mythos 5.1, người anh em bị giới hạn an toàn chỉ đến tay các tổ chức an ninh mạng và khoa học sự sống đã được thẩm định — cùng mô hình nền tảng, khác lớp bảo vệ. Điều Anthropic đang bán là vị trí dẫn đầu bảng xếp hạng độc lập, cửa sổ ngữ cảnh 1M token, tối đa 128K token đầu ra trong một phản hồi duy nhất, và hệ sinh thái agent được xây dựng quanh Claude Code và các ứng dụng Claude. Thông điệp rất đơn giản: đây là mô hình bạn dùng đến khi công việc đủ khó để một câu trả lời sai tốn kém hơn cả chi phí token đã bỏ ra.

SpaceXAI đang bán một thứ hẹp hơn và theo thời gian, mạnh mẽ hơn — mẫu rẻ nhất vẫn thuộc nhóm tiên phong, được định giá đủ thấp để việc xây dựng agent trên bất kỳ nền tảng nào khác trông có vẻ xa xỉ. Grok 4.6 không phải là một bản mở rộng: nó là cùng nền tảng với Grok 4.5 với một đợt huấn luyện bổ sung dài hơn và học tăng cường nặng hơn, nhà cung cấp cho biết điều này mang lại "trí thông minh tương đương GPT-5.6 SolClaude Fable 5." Với giá $2/$6, và vẫn nằm trong top hai mươi của chỉ số, đó là toàn bộ lập luận. Đây cũng là một chiến lược, không chỉ là giá. SpaceXAI sở hữu Cursor, ra mắt agent trình duyệt Grok Bot của mình một ngày trước khi mô hình ra mắt, và vận hành các ứng dụng chat tiêu dùng riêng; một mô hình tiên phong với giá hàng hóa là nhiên liệu cho tất cả những thứ đó. Phép tính công khai của Elon Musk — doanh thu AI vượt qua mọi phân khúc khác của công ty, 10 GW điện toán — cũng chỉ về cùng một hướng. Mô hình này không được định giá để tối đa hóa biên lợi nhuận API.

Bảng thông số kỹ thuật, từng chiều một

• Giá mỗi 1 triệu token — Claude Fable 5.1 $10.00 đầu vào / $50.00 đầu ra so với Grok 4.6 $2.00 đầu vào / $6.00 đầu ra.

• Đầu vào được cache — Claude Fable 5.1 $0.25 mỗi 1M so với Grok 4.6 $0.50, và Artificial Analysis liệt kê mức chiết khấu cache hiệu dụng là 98% so với 75%.

{{1}}Định giá ngữ cảnh dài{{/1}} — {{2}}Claude Fable 5.1{{/2}} tính phí cửa sổ của mình ở mức cố định lên đến 1M token; {{3}}Grok 4.6{{/3}} định giá lại toàn bộ yêu cầu thành $4.00 / $12.00 / $1.00 ngay khi vượt qua 200K token đầu vào, nên mức chiết khấu của nó mỏng đi đúng nơi các phiên chạy tác nhân dài hạn đang hoạt động.

• Ngữ cảnh và đầu ra — Claude Fable 5.1 sở hữu cửa sổ ngữ cảnh 1 triệu token và tối đa 128K token đầu ra, so với cửa sổ ngữ cảnh 500K của Grok 4.6, một núm điều chỉnh nỗ lực suy luận từ thấp đến rất cao, và một biến thể nhanh hơn với tốc độ gấp đôi.

• Điểm số, tốc độ và chi phí độc lập — Artificial Analysis xếp Claude Fable 5.1 ở mức 53 trên Chỉ số Trí tuệ hiện tại (#1 trong 201), 67,2 token đầu ra mỗi giây và 7,63 USD mỗi tác vụ chỉ số; Grok 4.6 đạt 44 (#20 trong 201), 52,8 token mỗi giây và 1,86 USD mỗi tác vụ. Cả hai đều được đánh giá là "rất dài dòng" hoặc "hơi dài dòng" theo phép đo đó — 190 triệu token đầu ra cho mô hình Claude so với 94 triệu cho Grok.

• Tuyên bố điểm chuẩn của nhà cung cấp — Anthropic báo cáo 52,6% trên Terminal-Bench-Science 0.1 (hơn gấp đôi mức 24,7% của Claude Fable 5), 55,8% trên Terminal-Bench 4.0 và 1.853 trên GDPval-AA v2 cho Claude Fable 5.1. SpaceXAI báo cáo 65,9% trên DeepSWE v1.1 và 69,9% trên CursorBench v3.2 cho Grok 4.6, cùng với con số tự báo cáo 26% trên Terminal-Bench v3.0 — hàng duy nhất trong bảng của chính nhà cung cấp rõ ràng là yếu.

• Nơi từng loại chạy — API Anthropic, các ứng dụng Claude, Claude Code, Amazon Bedrock, Google Cloud và Microsoft Foundry so với API SpaceXAI, Cursor, Grok Build, tác nhân Grok Bot, các ứng dụng Grok dành cho người tiêu dùng và Amazon Bedrock GovCloud.

• Đã phát hành — Claude Fable 5.1 vào ngày 1 tháng 9 năm 2026; Grok 4.6 vào ngày 12 tháng 8 năm 2026.

A self-built two-column scoreboard titled 'Claude Fable 5.1 vs Grok 4.6 \u2014 the scoreboard'. Left column 'Claude Fable 5.1 (Anthropic)': 'AA Intelligence Index 53 (#1 of 201)', 'Price in / out 0.00 / 0.00 per 1M tokens', 'Cost per index task .63', 'Context / max output 1M / 128K', 'AA output speed 67.2 tok/s', 'Released Sep 1, 2026'. Right column 'Grok 4.6 (SpaceXAI)': 'AA Intelligence Index 44 (#20 of 201)', 'Price in / out .00 / .00 per 1M tokens', 'Cost per index task .86', 'Context / max output 500K, repriced above 200K', 'AA output speed 52.8 tok/s', 'Released Aug 12, 2026'. Footer: 'AA figures per Artificial Analysis, current index version, captured Sep 10 2026.'

Chín điểm chỉ số thực sự đại diện cho điều gì

Trên chỉ số độc lập hiện tại, thứ tự tháng 9 là rõ ràng: Claude Fable 5.1 đạt 53 và đứng đầu trong 201, Grok 4.6 đạt 44 và đứng thứ hai mươi. Chỉ số được tính lại cần một sự làm rõ, vì đây là kiểu điều khiến các con số tuần ra mắt trông có vẻ sai khi nhìn lại: Artificial Analysis đã điều chỉnh lại Intelligence Index của mình vào tháng 9, và điểm số công bố của cả hai mô hình đều giảm khi điều đó xảy ra. Khoảng cách chín điểm là có thật, nhưng chỉ số này là một tổng hợp có trọng số — nghiêng hẳn về công việc agentic, với lập trình, lý luận khoa học và năng lực tổng quát phía sau — nên nó nén một bức tranh hỗn hợp theo từng khía cạnh thành một dòng duy nhất.

Bằng chứng theo từng khía cạnh thì nhiễu hơn nhưng hữu ích hơn. Con số Terminal-Bench-Science 0.1 của chính Anthropic — 52,6%, hơn gấp đôi mức 24,7% của thế hệ trước — nhắm chính xác vào các quy trình khoa học và nghiên cứu dài hạn mà người mua agentic quan tâm, và chưa có mô hình hiện tại nào tiến gần đến mức đó trên điểm chuẩn cụ thể này. Bảng của nhà cung cấp SpaceXAI mạnh nhất về kỹ thuật phần mềm (65,9% DeepSWE v1.1, 69,9% CursorBench v3.2) và yếu nhất ở các vòng lặp agent nặng về terminal, nơi mức 26% của chính Grok 4.6 trên Terminal-Bench v3.0 nằm dưới mức 34,6% của GPT-5.6 Sol Max và 34,1% của Claude Fable 5 Max. Cả hai bảng đều do nhà cung cấp tự báo cáo và chưa được tái lập; chúng mô tả nơi mỗi phòng thí nghiệm tin rằng mình mạnh, chứ không phải ai thắng cuộc.

Screenshot of the Artificial Analysis model page for Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), captured September 10, 2026, showing Intelligence Index 53 ranked #1 of 201, output speed 67.2 tokens per second, a .63 cost per Intelligence Index task, a 98% cache discount against 0.00 input and 0.00 output pricing, 190M output tokens of verbosity, and a 1M-token context window.

Chữ in nhỏ về token giá rẻ

Lợi thế về giá của Grok 4.6 là có thật, và với ngữ cảnh ngắn và trung bình thì đó là lợi thế rất lớn: một khối lượng công việc nặng về đầu ra phải trả ít hơn khoảng 83% cho mỗi token được tạo ra so với khi dùng Claude Fable 5.1. Nhưng bảng giá có ba cạnh mà một so sánh tiên tiến thường bỏ qua.

Điều đầu tiên là ngưỡng 200K. Vượt qua 200.000 token đầu vào sẽ định giá lại toàn bộ yêu cầu thành $4/$12, không chỉ các token vượt ngưỡng. Đối với một phiên chạy agent dài tích lũy ngữ cảnh — chính xác là khối lượng công việc mà cả hai mô hình được bán ra để phục vụ — mức giá hiệu dụng tăng gấp đôi mà không báo trước và không còn bằng 1/5 giá của Claude. Điều thứ hai là biến thể nhanh hơn, có chi phí gấp đôi mức giá cơ bản và là cách duy nhất được công bố để khắc phục tốc độ xuất ra dưới trung bình của mô hình. Điều thứ ba là các lệnh gọi công cụ phía máy chủ, được tính phí riêng theo từng nghìn lần gọi.

Sự thay đổi giá tháng 9 của Claude Fable 5.1 lại đi theo hướng ngược lại. Mức giá danh nghĩa $10/$50 không thay đổi, nhưng giá đọc bộ nhớ đệm (cache-read) đã giảm 75% xuống còn $0,25 cho mỗi triệu token, và đây chính là nơi các phiên tác tử (agentic) dài thực sự tiêu tiền: đọc lại kết quả công cụ, nội dung tệp tin và các lượt trước đó lặp đi lặp lại. Artificial Analysis cho thấy mức chiết khấu bộ nhớ đệm hiệu quả thu được là 98%, so với 75% của Grok. Việc trả một phần tư đô la cho mỗi triệu token đọc lại thay đổi phép tính của một tác tử hoạt động nhiều giờ theo cách mà mức giá nổi bật không bao giờ cho thấy.

Đối trọng trung thực chính là độ dài văn bản, và đó là lý do khoảng cách chi phí thực tế không phải gấp tám lần. Bởi vì mô hình Claude tạo ra khoảng gấp đôi số token để hoàn thành cùng một tác vụ lập chỉ mục — 190 triệu so với 94 triệu của Grok — chỉ số chi phí trên mỗi tác vụ của Artificial Analysis đạt 7,63 đô la cho Claude Fable 5.1 so với 1,86 đô la cho Grok 4.6. Đó là hệ số khoảng bốn, không phải tám, và đó là con số cần dùng để lập kế hoạch ngân sách.

Sự khác biệt không bao giờ lên bàn

Độ trễ là điểm mà hai mô hình khác biệt đối với các sản phẩm tương tác, và kết quả ngược lại với những gì mức giá thể hiện. Artificial Analysis đo Claude Fable 5.1 ở mức 67,2 token đầu ra mỗi giây — cao hơn mức trung bình của phân khúc — so với 52,8 của Grok 4.6, mức mà phép đo đó xếp dưới trung bình; bản tóm tắt chỉ số của Grok đã nhấn mạnh rằng nó chậm hơn so với các đối thủ cùng phân khúc, đây chính là lý do SpaceXAI bán phiên bản nhanh hơn với mức giá gấp đôi. Mô hình của Anthropic cũng, theo cùng ghi chú độc lập đó, là mô hình viết dài dòng hơn trong hai mô hình. Vậy nên mô hình rẻ hơn lại chậm hơn, còn mô hình đắt hơn lại viết nhiều hơn mức cần thiết: hai loại chi phí kéo theo hai hướng ngược nhau và không loại nào xuất hiện trên bảng giá.

Gọi cả hai mà không cam kết với bên nào vào hôm nay

Hệ quả thực tế của khoảng cách chín điểm, sự chênh lệch chi phí gấp bốn lần cho mỗi tác vụ và một bảng giá đầy các bậc là hầu hết các đội ngũ nên vận hành cả hai, và câu hỏi thú vị là điểm chuyển đổi nằm ở đâu. Việc đó thực ra rẻ hơn so với vẻ bề ngoài: Claude Fable 5.1 và Grok 4.6 đều có mặt trên OrcaRouter với giá niêm yết của nhà cung cấp, không cộng thêm phí — các con số $2/$6 và $10/$50 ở trên là những con số xuất hiện trên hóa đơn, và bất kỳ thay đổi giá nào từ nhà cung cấp đều được phản ánh ngay trong cùng ngày thay vì bị hấp thụ vào biên lợi nhuận của bên bán lại. Một điểm cuối phục vụ cả hai, vì vậy mô hình leo thang là một quy tắc định tuyến thay vì một hợp đồng thứ hai: gửi khối lượng công việc lớn, phạm vi rõ ràng đến Grok 4.6, leo thang lên Claude Fable 5.1 khi tác vụ cần đến trần suy luậnvà để cơ chế chuyển đổi dự phòng tự động xử lý trường hợp thông lượng của mô hình rẻ hơn quá chậm so với thời hạn. DSL định tuyến thể hiện chuỗi đó ở một nơi duy nhất, và kết hợp mô hình cho phép một hội đồng mô hình cùng trả lời khi một tác vụ đủ quan trọng để cần nhiều hơn một ý kiến. Khoảng cách giá khi đó không còn là quyết định bạn đưa ra một lần mà trở thành một dòng bạn tinh chỉnh khi tỷ trọng khối lượng công việc của bạn dịch chuyển.

Screenshot of the OrcaRouter model page for Grok 4.6 (model id grok/grok-4.6) showing .00 input and .00 output per 1M tokens, the SpaceXAI provider listed as of 2026-08-12, a 500K-token context window with text, image and file input, Vision, Tools, JSON and Reasoning capability badges, endpoints /v1/chat/completions and /v1/responses, and a p50 time-to-first-token of 10.00 seconds.

Ai nên chọn cái nào

Hãy chọn Claude Fable 5.1 khi chi phí của một câu trả lời sai hoặc bị bỏ dở vượt trội so với chi phí token: nghiên cứu tác nhân tầm xa, suy luận phức tạp, công việc có tính quy định chặt chẽ nơi vòng an toàn của Anthropic và các kiểm soát không lưu giữ dữ liệu theo giai đoạn là yếu tố quan trọng, và bất cứ thứ gì hoạt động trong Claude Code. Hãy chọn Grok 4.6 khi công việc có khối lượng lớn, phạm vi rõ ràng và chấp nhận được về thông lượng — viết mã hàng loạt, trích xuất, sinh nội dung, các vòng lặp tác nhân có lượt xử lý đủ ngắn để nằm dưới ngưỡng định giá lại 200K — và khi bạn đang xây dựng các tác nhân mà mô hình chỉ là một thành phần và chi phí cho mỗi tác vụ là toàn bộ bài toán kinh doanh.

Hai vòng lặp mở đáng theo dõi trước khi một trong hai lựa chọn trở nên cố định. SpaceXAI đã hé lộ lại Grok 4.7 cho tương lai gần, và nếu nó giữ nguyên mức giá với khả năng cao hơn, thì món hời hôm nay sẽ thành phân khúc trung cấp chỉ trong vài tuần. Trong khi đó, Anthropic cho thấy nhịp phát hành gần như hàng tháng và sự sẵn sàng cắt giảm giá cache mà không đụng đến mức giá niêm yết chính, điều này gợi ý rằng nước đi tiếp theo trong cuộc so tài này có thể nằm ở phía chi phí thay vì chỉ số. Không vòng lặp nào thay đổi những gì các mô hình làm hôm nay, nhưng cả hai đều là lý do để giữ ID mô hình như một giá trị cấu hình. Trên một endpoint có định giá truyền thẳng và chuyển đổi dự phòng, đó là mặc định chứ không phải một dự án.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày