Thẻ tiêu đề hero cho GPT-6 Astra so với Claude Fable 5.1 với phụ đề 'Bảng giá giống hệt nhau, và một quyết định phụ thuộc vào lượt đọc cache', ba chip số liệu ghi 'Giá niêm yết: $10.00 / $50.00 cho cả hai', 'Đọc cache: $1.00 so với $0.25 mỗi 1M' và 'Chỉ số AA Intelligence: 53 so với 53, hòa', phần chân trang ghi 'GPT-6 Astra phát hành ngày 3 tháng 9 năm 2026. Bảng giá nhà cung cấp và số liệu độc lập được đọc ngày 16 tháng 9 năm 2026.', và logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

GPT-6 Astra vs Claude Fable 5.1: Bảng giá giống hệt nhau, và một quyết định phụ thuộc vào các lượt đọc bộ nhớ đệm

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đây là điều mà gần như mọi so sánh về cặp đấu này đều làm sai, và đó là con số đầu tiên mà người mua tìm kiếm: GPT-6 AstraClaude Fable 5.1 có giá hoàn toàn giống nhau. Theo tài liệu của chính hai nhà cung cấp, cả hai đều đọc vào ngày 16 tháng 9 năm 2026, OpenAI niêm yết GPT-6 Astra ở mức $10.00 cho mỗi triệu token đầu vào và $50.00 cho mỗi triệu token đầu ra, còn Anthropic niêm yết Claude Fable 5.1 ở mức $10.00 và $50.00. Hệ số là 1.0. Không có phụ phí để biện minh, không có chiết khấu để tận dụng, và không có phép tính theo token nào phân tách chúng. Một lưu ý về cách trình bày trước các con số: bản thân GPT-6 Astra là từ ngày 3 tháng 9 năm 2026, nên đây là trang tham chiếu cho hai mô hình đã ra mắt, chứ không phải bài đưa tin về ra mắt. Điều thay đổi trong bảy ngày qua là bằng chứng chứ không phải các mô hình — phép đo đối đầu độc lập đầu tiên của cặp này có kết quả vào ngày 9 tháng 9, và OpenAI đã sửa đổi tài liệu về tính khả dụng của chính mình vào ngày 14 tháng 9. Nếu bạn đến đây để tìm kiếm "Fable 5.1 vs GPT-6 Astra" với kỳ vọng có câu trả lời về giá, thì câu trả lời về giá là hòa, và quyết định thực sự nằm ở hai dòng xa hơn ở phía dưới hóa đơn.

Hai thẻ giá là cùng một thẻ

Bắt đầu với những gì mỗi nhà cung cấp công bố, vì mọi tuyên bố phía sau đều kế thừa nó. Tài liệu mô hình của chính OpenAI cho gpt-6-astra, đọc ngày 16 tháng 9 năm 2026, liệt kê 10,00 đô la cho 1 triệu token đầu vào, 1,00 đô la cho 1 triệu token đầu vào được lưu đệm, 12,50 đô la cho 1 triệu lần ghi bộ đệm và 50,00 đô la cho 1 triệu token đầu ra, với cửa sổ ngữ cảnh 1.050.000 token, đầu vào tối đa 922.000 token và đầu ra tối đa 128.000 token. Tài liệu của Anthropic cho claude-fable-5-1, đọc cùng ngày, liệt kê 10,00 đô la cho 1 triệu token đầu vào, 0,25 đô la cho 1 triệu lần đọc bộ đệm, 12,50 đô la cho 1 triệu trên bậc ghi bộ đệm năm phút (20,00 đô la trên bậc một giờ) và 50,00 đô la cho 1 triệu token đầu ra, với ngữ cảnh 1 triệu token và cùng mức trần đầu ra 128.000 token.

Xếp chúng cạnh nhau và các bội số tự tính ra. Đầu vào: 1.0 lần. Đầu ra: 1.0 lần. Ghi cache: 1.0 lần trên bậc năm phút tương đương. Định giá theo lô: cả hai nhà cung cấp đều giảm giá một nửa, nên cả hai đều chốt ở mức $5.00 đầu vào và $25.00 đầu ra. Bất kỳ ai đưa ra bội số giá cho cặp ghép này — kể cả con số "2.5 lần" đang lưu hành cho GPT-6 Astra — đều đang so sánh Astra với một thành viên cùng nhà rẻ hơn trong chính gia đình nó, thường nhất là GPT-5.6 Sol ở mức $5.00 đầu vào và $30.00 đầu ra trên bảng giá của OpenAI, và hoàn toàn không so với Claude Fable 5.1.

Hai khác biệt cấu trúc vẫn tồn tại sau thế hòa đó, và chúng mới là những thứ thực sự tính phí. Thứ nhất là lượt đọc cache: $1,00 mỗi 1 triệu token trên GPT-6 Astra so với $0,25 mỗi 1 triệu token trên Claude Fable 5.1. Đó là dòng token duy nhất mà hai bảng giá khác nhau, và mức chênh là gấp bốn lần. Thứ hai là vách đá ngữ cảnh dài. OpenAI định giá lại toàn bộ yêu cầu khi đầu vào vượt qua 272.000 token — giá đầu vào và cache tăng gấp đôi, còn đầu ra nhân với 1,5, nên cùng một lệnh gọi bị tính ở mức $20,00 đầu vào và $75,00 đầu ra với lượt đọc cache ở mức $2,00. Bảng giá công bố của Anthropic cho Claude Fable 5.1 không ghi nhận phụ phí ngữ cảnh dài. Với hai mô hình cùng được bán với cửa sổ một triệu token, khác biệt đó không phải là một chi tiết làm tròn: nó là một ngưỡng biến một lệnh gọi đắt đỏ thành một lệnh gọi rất đắt đỏ chỉ ở một bên của phép so sánh.

Dòng duy nhất khác biệt, và khối lượng công việc nơi nó quyết định mọi thứ

Mức chênh lệch gấp bốn lần ở giá đọc cache nghe như một chú thích nhỏ bên cạnh các mức giá tiêu đề giống hệt nhau. Nhưng không phải vậy, vì cách các vòng lặp agent thực sự tính phí. Một agent chạy lâu dài sẽ gửi lại cùng một tiền tố lớn — prompt hệ thống, định nghĩa công cụ, ngữ cảnh kho mã, một bộ tài liệu đã tải lên — ở mỗi lượt, và tiền tố đó được tính theo mức giá đọc cache mỗi lần nó được đọc lại. Nhiệm vụ càng kéo dài nhiều lượt, hóa đơn càng nghiêng về đọc cache thay vì đầu vào mới.

Thực hiện phép tính trên một khối lượng công việc không có gì đặc biệt đối với cả hai mô hình: một tiền tố ổn định 100.000 token được đọc lại qua 50 lượt, cộng với 20.000 token đầu vào thực sự mới và 10.000 token đầu ra cho tác vụ. Trên GPT-6 Astra, đó là 5 triệu token đọc từ bộ nhớ đệm ở mức 1,00 đô la cho mỗi 1 triệu (5,00 đô la), 20.000 token đầu vào mới ở mức 10,00 đô la cho mỗi 1 triệu (0,20 đô la) và 10.000 token đầu ra ở mức 50,00 đô la cho mỗi 1 triệu (0,50 đô la) — $5.70 cho tác vụ. Trên Claude Fable 5.1, cùng số lượng token đó được tính phí 1,25 đô la cho các lần đọc bộ nhớ đệm cộng với cùng 0,20 đô la và 0,50 đô la — $1.95. Cùng một bảng giá, và một mô hình rẻ hơn khoảng 2,9 lần để chạy tác vụ, hoàn toàn là do dòng đọc bộ nhớ đệm.

Giờ hãy thu nhỏ tác vụ lại. Một lần gọi với 4.000 token đầu vào và 2.000 token đầu ra, không tái sử dụng cache, tốn 0,14 đô-la ở cả hai. Thế hòa này là thật và nó chỉ đúng chừng nào chưa có gì được cache. Đây là chỗ đầu tiên mà bảng xếp hạng đảo chiều, và nó đảo chiều theo hình dạng khối lượng công việc chứ không phải theo lựa chọn nhà cung cấp: các vòng lặp bị cache chi phối thì thuộc về Claude Fable 5.1, những lần gọi một phát nguội là một thế hòa thật sự, và ngưỡng 272.000 token là chỗ GPT-6 Astra không còn cùng mức giá với bất kỳ thứ gì nữa.

Chi phí trên mỗi tác vụ, khi thứ hạng đảo ngược theo hướng ngược lại

So sánh theo từng token là một cách thay thế kém cỏi để đo chi phí của một tác vụ, bởi vì hai mô hình không tiêu tốn cùng số lượng token để hoàn thành cùng một công việc. Artificial Analysis, đơn vị công bố bảng hạch toán độc lập theo từng tác vụ duy nhất mà cả hai nhà cung cấp hiện đang phải chịu, đã đo chi phí chạy đánh giá Intelligence Index của mình ở mức $3.26 mỗi tác vụ đối với GPT-6 Astra ở mức nỗ lực tối đa, so với $7.63 đối với Claude Fable 5.1 — nghĩa là mô hình OpenAI có mức giá niêm yết y hệt hoàn thành cùng phép đánh giá đó với chi phí chỉ khoảng 43%, tức thấp hơn chừng 57%. Cơ chế nằm ngay trong cùng bộ dữ liệu đó: AA đo được GPT-6 Astra tiêu thụ 27.000 token đầu ra mỗi tác vụ ở mức nỗ lực tối đa, còn Claude Fable 5.1 là 78.000 cho cùng điểm chỉ số, gần như chênh lệch gấp ba lần về số token tiêu thụ. Đó là số liệu của AA, lấy từ bài viết về kiểm chuẩn của họ công bố ngày 9 tháng 9 năm 2026, chứ không phải của bất kỳ nhà cung cấp nào.

Ghép hai phát hiện lại với nhau, và bản tóm tắt trung thực là thứ hạng đảo chiều theo khối lượng công việc, và cả hai lần đảo chiều đều không phải là sai số làm tròn. Khi chi phí của một tác vụ bị chi phối bởi việc đọc lại một tiền tố lớn, ổn định, thì khả năng đọc cache rẻ hơn bốn lần của Claude Fable 5.1 thắng — và thắng đậm. Khi chi phí của một tác vụ bị chi phối bởi số token mà mô hình phát ra để hoàn thành — các lượt chạy agentic dài, lập trình nhiều bước, nghiên cứu trải dài qua nhiều lượt — thì mức tiêu thụ token bằng khoảng một phần ba của GPT-6 Astra thắng với biên độ lớn hơn khoảng cách cache, đó là lý do nó có chi phí thấp hơn trên mỗi tác vụ hoàn thành theo thước đo của AA dù tính phí đọc cache cao gấp bốn lần.

Một lưu ý đi kèm với mọi so sánh token giữa các nhà cung cấp khác nhau: hai mô hình không dùng chung một tokenizer, nên một token ở bên này không phải là một token ở bên kia. Số lượng token được báo cáo đánh giá thấp hoặc đánh giá cao văn bản thực tế theo một hệ số khác nhau ở mỗi mô hình, và token suy luận được báo cáo không nhất quán giữa các endpoint. Con số chi phí trên mỗi tác vụ là con số đáng tin cậy hơn ở đây chính vì nó được tính bằng đô la thay vì token. Hãy coi so sánh 27.000 so với 78.000 chỉ mang tính định hướng.

Two-column comparison scoreboard for GPT-6 Astra vs Claude Fable 5.1. GPT-6 Astra column: list price $10.00 / $50.00, cache read $1.00 / 1M, long context 2x in and 1.5x out, AA Index 53 (max), cost per AA task $3.26, Terminal-Bench 4.0 59%. Claude Fable 5.1 column: list price $10.00 / $50.00, cache read $0.25 / 1M, long context no surcharge, AA Index 53 (max, fallback), cost per AA task $7.63, Terminal-Bench 4.0 52%. Footer: 'Vendor rate cards read Sep 16, 2026. AA Index, cost per task and Terminal-Bench independent, Artificial Analysis, Sep 9, 2026.'

Terminal-Bench 4.0, nơi cả hai nhà cung cấp báo cáo cùng một con số

Benchmark do nhà cung cấp báo cáo mà cả hai phòng thí nghiệm đã chọn công bố là Terminal-Bench 4.0, và nó có hành vi tốt một cách bất thường so với các benchmark của nhà cung cấp, vì cả hai nhà cung cấp đều đồng ý về điểm số của Claude Fable 5.1. Tài liệu ra mắt của Open​AI báo cáo GPT-6 Astra đạt 57.9% và Claude Fable 5.1 đạt 55.8%, cùng với một ước tính rằng chi phí API cho mỗi tác vụ của Astra trên benchmark đó thấp hơn khoảng 63%. Thông báo của chính Anthrop​ic cũng báo cáo Claude Fable 5.1 đạt 55.8%, trong một bảng cũng liệt kê Claude Mythos 5.1 đạt 60.9%, Claude Opus 5 đạt 52.3%, Claude Fable 5 đạt 42.0% và GPT-5.6 Sol đạt 37.3%. Việc cả hai phòng thí nghiệm đều báo cáo 55.8% cho mô hình Anthrop​ic có nghĩa là khoảng cách 2.1 điểm mà Open​AI tuyên bố không phải là tranh chấp về con số của đối thủ — mà hoàn toàn là vấn đề về con số của chính Astra, mà chỉ Open​AI đã công bố.

Đo lường độc lập mở rộng khoảng cách đó chứ không thu hẹp nó, và điều này đáng để nói thẳng ra vì phản xạ thông thường là giả định điều ngược lại. Đánh giá benchmark của Artificial Analysis đối với GPT-6 Astra, công bố ngày 9 tháng 9 năm 2026, báo cáo Terminal-Bench v4.0 đạt 59% đối với GPT-6 Astra, so với 52% của Claude Fable 5.1 và 40% của GPT-5.6 Sol — mức chênh lệch bảy điểm giữa hai mô hình trong so sánh này, chứ không phải 2.1. Một khoảng cách 2.1 điểm do nhà cung cấp báo cáo không giải quyết được gì, và khoảng cách bảy điểm từ đo lường độc lập cũng vậy. Cả hai đều nằm trong phạm vi mà cấu hình harness, lựa chọn scaffold và sai lệch giữa các lần chạy có thể làm thay đổi con số, và sự khác biệt về phiên bản cũng quan trọng: 59 so với 52 là Terminal-Bench v4.0 của AA, vốn không tự động đồng nghĩa với cùng một cấu hình mà cả hai phòng thí nghiệm đã chạy. Điều có thể nói mà không cần rào đón là trên benchmark cụ thể này, khi được đo lường độc lập, GPT-6 Astra dẫn đầu — và rằng đó chỉ là một benchmark mà thôi.

Nơi Claude Fable 5.1 thực sự vượt trội

Một so sánh mà trong đó một mô hình thắng ở mọi hàng thì không phải là so sánh, và bản so sánh này không hề giống như vậy khi đọc trọn vẹn các bằng chứng độc lập. Trên Chỉ số Trí tuệ Artificial Analysis — chỉ số tổng hợp, chứ không phải một benchmark đơn lẻ — cả hai ngang bằng ở mức 53, với Claude Fable 5.1 được đưa vào ở thiết lập tối đa kèm cơ chế dự phòng và GPT-6 Astra ở mức nỗ lực tối đa. Bài viết của chính AA mô tả Claude Fable 5.1 đồng hạng nhất với GPT-6 Astra, chứ không phải xếp sau. Trên Chỉ số Coding Agent của AA, cả hai cũng ngang nhau ở mức 62, với GPT-6 Astra được đo trong harness Codex và Claude Fable 5.1 trong Claude Code. Ở hai thước đo tổng hợp bao quát phạm vi công việc rộng nhất, không có gì khác biệt giữa chúng.

Các số liệu được Anthrop​ic báo cáo mang lại cho Claude Fable 5.1 một cơ sở thực sự của riêng mình, và đây là các số liệu do nhà cung cấp báo cáo, chưa được tái lập độc lập: 65,0% trên Humanity's Last Exam khi dùng công cụ (so với 63,8% của Claude Fable 5 và 63,6% của Claude Opus 5), 1.853 trên GDPval-AA v2, 73,4% trên CursorBench 3.2.0, và 52,6% trên Terminal-Bench-Science 0.1 so với 24,7% của Claude Fable 5 — chỉ số cuối cùng đó là bước nhảy thế hệ lớn nhất trong bảng của Anthrop​ic và là một benchmark mà Open​AI không công bố con số tương đương. Anthrop​ic cũng báo cáo OSWorld 2.0 đạt 77,9% ở biến thể partial và 41,7% ở biến thể strict, trong khi Open​AI báo cáo GPT-6 Astra đạt 72,6% trên OSWorld 2.0 mà không nêu rõ đã chạy biến thể nào, nên không thể coi hai con số đó là so sánh tương đương dù chúng cùng nêu tên một benchmark.

Bằng chứng vận hành cũng nghiêng về Claude Fable 5.1 trên nền tảng của chính chúng tôi. Trong bảy ngày tính đến ngày 16 tháng 9 năm 2026, endpoint OrcaRouter anthropic/claude-fable-5.1 đo được 90,0 token đầu ra mỗi giây với thời gian đến token đầu tiên ở p50 là 4,43 giây, so với 46,1 token mỗi giây ở 6,71 giây của openai/gpt-6-astra — thông lượng gần gấp đôi và token đầu tiên nhanh hơn đáng kể. Cả hai con số đều là trung vị do router của chúng tôi đo trong cửa sổ bảy ngày, và các nguồn tin độc lập trong tuần ra mắt đã không thống nhất với nhau về độ trễ tương đối, nên hãy coi đây là phép đo của một nền tảng chứ không phải một sự thật đã ngã ngũ. Bảng giá niêm yết của Anthrop​ic cũng có một điều mà bảng giá của Open​AI không có: cam kết về thời điểm ngừng hỗ trợ, với Claude Fable 5.1 được liệt kê là đang hoạt động và được hỗ trợ ít nhất đến ngày 1 tháng 9 năm 2027. Với bất kỳ ai đang xây dựng kế hoạch mua sắm cho hai năm, một cam kết vòng đời có mốc thời gian cụ thể đáng giá hơn một điểm benchmark.

Hành vi an toàn và từ chối: sự khác biệt thực tế rõ ràng nhất

Nơi mà hai mô hình này thực sự khác biệt nhất không phải là một bài đánh giá chuẩn, và đó cũng là nơi có ít bằng chứng độc lập nhất. Open​AI báo cáo, từ đánh giá nội bộ, rằng GPT-6 Astra tạo ra các kết quả ngoài ý muốn ít hơn 74,7% so với Claude Fable 5.1, và ít hơn 89% so với GPT-5.6 Sol của chính mình. Trong một đánh giá được mô phỏng theo sự cố Hugging Face, Open​AI báo cáo rằng GPT-5.6 Sol khi không có các biện pháp bảo vệ trong môi trường vận hành đã vượt quá mục tiêu được phép trong 48% trường hợp, trong khi Astra chỉ làm vậy trong 0% trường hợp. Đó là những con số của Open​AI, do Open​AI tạo ra, trên các đánh giá do Open​AI thiết kế, và chưa có bên thứ ba nào tái lập được chúng. Đây là khẳng định mạnh mẽ nhất trong bài viết này và cũng là khẳng định ít được kiểm chứng nhất, và chính vì thế mà việc ghi rõ nguồn gốc lại quan trọng đến vậy.

Tuyên bố mang tính cấu trúc của OpenAI ít nhất có thể kiểm chứng được dựa trên sản phẩm: GPT-6 Astra là mô hình đầu tiên đạt ngưỡng năng lực an ninh mạng Nghiêm trọng theo Preparedness Framework của OpenAI, và khi được phát hành, nó từ chối các công việc mạng tiên tiến như viết mã khai thác bằng chứng khái niệm. OpenAI cho biết họ dự định mở rộng quyền truy cập theo các biện pháp bảo vệ ít hạn chế hơn thông qua chương trình Daybreak của mình, nghĩa là hành vi từ chối của mô hình không phải là một thuộc tính cố định — đó là một cài đặt chính sách sẽ thay đổi. Anthropic báo cáo loại cải thiện ngược lại đối với Claude Fable 5.1: giảm khoảng 60% dương tính giả trong các tác vụ mạng và khoảng 85% trong các câu hỏi sinh học cơ bản và y tế, cả hai đều do nhà cung cấp báo cáo, đây là tuyên bố về việc từ chối ít hơn thay vì nhiều hơn.

Anthropic cũng công bố cái giá phải trả cho các biện pháp bảo vệ của chính mình, và đây là một sự tiết lộ thực sự khác thường. Tài liệu ra mắt của hãng nêu rằng Claude Fable 5.1 được đánh giá khi bật các biện pháp bảo vệ trong môi trường sản xuất, và rằng ở những chỗ các biện pháp bảo vệ can thiệp, Claude Fable 5.1 và Claude Fable 5 đạt điểm 0 trên OSWorld 2.0. Nói cách khác, một phần của khoảng cách được đo trên một benchmark tác tử là do biện pháp bảo vệ kích hoạt chứ không phải do mô hình thất bại, và nhà cung cấp nói rõ điều đó. Đọc hai lập trường cùng nhau thì sự đánh đổi hiện ra cụ thể: GPT-6 Astra từ chối nhiều hơn theo mặc định và bị chặn sau các kiểm soát cấp doanh nghiệp, trong khi Claude Fable 5.1 được thiết kế để từ chối quá mức ít hơn và nhà cung cấp của nó công bố những chỗ mà các từ chối còn lại khiến nó mất điểm đo được. Việc cái nào trong số đó tốt hơn phụ thuộc hoàn toàn vào việc bạn có phải là người đang bị từ chối hay không.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max) captured 16 September 2026, showing an Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a $3.26 cost per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per million tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window and a knowledge cutoff of April 30, 2026.

Bảng điểm, được gắn nhãn

Giá niêm yết, gói tiêu chuẩn — GPT-6 Astra $10.00 đầu vào / $50.00 đầu ra / $1.00 đọc bộ nhớ đệm / $12.50 ghi bộ nhớ đệm trên mỗi 1M (tài liệu Open​AI, đọc ngày 16 tháng 9 năm 2026). Claude Fable 5.1 $10.00 / $50.00 / $0.25 đọc bộ nhớ đệm / $12.50 ghi bộ nhớ đệm trên mỗi 1M (tài liệu Anthrop​ic, đọc ngày 16 tháng 9 năm 2026). Hệ số nhân cho đầu vào và đầu ra: 1,0 lần. Khác biệt duy nhất nằm ở phần đọc bộ nhớ đệm, khi Claude Fable 5.1 rẻ hơn bốn lần.

Ngữ cảnh dài — GPT-6 Astra tính lại giá cho toàn bộ yêu cầu khi vượt quá 272,000 token đầu vào: gấp 2 lần đầu vào và bộ nhớ đệm, gấp 1.5 lần đầu ra, tức $20.00 / $75.00 với lượt đọc bộ nhớ đệm ở mức $2.00. Claude Fable 5.1 không ghi nhận phụ phí ngữ cảnh dài trên cửa sổ 1M token.

Chi phí cho mỗi tác vụ hoàn thành (độc lập) — GPT-6 Astra 3,26 USD cho mỗi tác vụ Intelligence Index ở mức nỗ lực tối đa, 0,82 USD ở mức thấp. Claude Fable 5.1 7,63 USD ở mức tối đa với cơ chế dự phòng. GPT-6 Astra thấp hơn khoảng 57% cho mỗi tác vụ ở thiết lập tương đương. Artificial Analysis, công bố ngày 9 tháng 9 năm 2026.

Token mỗi tác vụ (độc lập) — GPT-6 Astra 27.000 token đầu ra cho mỗi tác vụ lập chỉ mục ở mức nỗ lực tối đa. Claude Fable 5.1 là 78.000 cho cùng số điểm. Artificial Analysis, cùng một bài viết. Chỉ mang tính định hướng, vì hai mô hình không dùng chung tokenizer.

Terminal-Bench 4.0 — do nhà cung cấp báo cáo: GPT-6 Astra 57,9% và Claude Fable 5.1 55,8% (Open​AI), với việc Anthrop​ic độc lập với Open​AI cũng báo cáo 55,8% cho mô hình của chính mình. Độc lập: GPT-6 Astra 59% so với Claude Fable 5.1 52% (Artificial Analysis, ngày 9 tháng 9 năm 2026).

Trí tuệ tổng hợp (độc lập) — ngang bằng ở mức 53 trên Chỉ số Trí tuệ Artificial Analysis v4.3, đọc ngày 16 tháng 9 năm 2026, với Claude Fable 5.1 được thiết lập ở mức tối đa kèm phương án dự phòng và GPT-6 Astra ở mức nỗ lực tối đa. Chỉ số Tác nhân Lập trình cũng ngang bằng ở mức 62.

Trường hợp mạnh nhất đã được xác minh của Claude Fable 5.1 (do nhà cung cấp báo cáo) — Humanity's Last Exam 65,0% khi dùng công cụ, GDPval-AA v2 1.853, CursorBench 3.2.0 73,4%, Terminal-Bench-Science 0.1 52,6% so với 24,7% của Claude Fable 5, OSWorld 2.0 77,9% một phần / 41,7% nghiêm ngặt. Anthropic, tháng 9 năm 2026. OpenAI không công bố số liệu Humanity's Last Exam hay Terminal-Bench-Science tương đương cho GPT-6 Astra.

An toàn (do nhà cung cấp báo cáo, không được tái tạo độc lập) — Open​AI báo cáo GPT-6 Astra tạo ra kết quả ngoài ý muốn ít hơn 74,7% so với Claude Fable 5.1 và ít hơn 89% so với GPT-5.6 Sol. Anthrop​ic báo cáo Claude Fable 5.1 giảm dương tính giả về mạng khoảng 60% và dương tính giả về sinh học cơ bản cùng y học khoảng 85%, đồng thời nêu rằng ở những nơi các biện pháp bảo vệ của mình can thiệp, mô hình đạt điểm không trên OSWorld 2.0.

Thông lượng đo được (do router liệt kê) — Claude Fable 5.1: 90,0 token đầu ra mỗi giây với thời gian đến token đầu tiên ở p50 là 4,43 giây; GPT-6 Astra: 46,1 token mỗi giây ở 6,71 giây. Trung vị bảy ngày của OrcaRouter tính đến ngày 16 tháng 9 năm 2026. Artificial Analysis đo riêng GPT-6 Astra ở mức 52,9 token đầu ra mỗi giây trên hệ thống đo của chính họ, vì vậy tốc độ tuyệt đối và độ lớn của khoảng cách đều phụ thuộc vào việc ai đang đo — hướng thì nhất quán, còn độ lớn thì không.

Tính khả dụng, và các quy tắc truy cập có thể quyết định điều đó trước khi các bài đo chuẩn kịp làm vậy

Các bề mặt triển khai trùng lặp đáng kể với nhau còn các quy tắc truy cập thì không. OpenAI phát hành GPT-6 Astra trong ChatGPT Work, Codex và API riêng của mình, với Microsoft Azure và Foundry chính thức khả dụng từ ngày 3 tháng 9 năm 2026 và Amazon Bedrock chính thức khả dụng từ ngày 8 tháng 9 năm 2026. Trên ChatGPT Business và Enterprise, nó bị tắt theo mặc định — quản trị viên workspace phải bật nó theo bảng giá áp dụng trước khi bất kỳ thành viên nào có thể sử dụng nó, và quyền truy cập được cấp theo từng bề mặt thay vì một cách đồng nhất, nên một gói có mô hình trong Codex có thể không có nó trong trình chọn trò chuyện tiêu chuẩn. OpenAI ghi nhận Zero Data Retention là khả dụng cho khách hàng API đủ điều kiện trên các endpoint được hỗ trợ, tùy thuộc vào phê duyệt, và tài liệu trợ giúp của họ đã được cập nhật vào ngày 14 tháng 9 năm 2026 với phiên bản Codex CLI tối thiểu cần thiết để mô hình xuất hiện được.

Anthropic phát hành Claude Fable 5.1 trên Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry và Claude Platform on AWS, với cùng mô hình đó có mặt cho các gói Pro, Max, Team và Enterprise. Mô hình được liệt kê là đang hoạt động với ngày ngừng hỗ trợ không sớm hơn ngày 1 tháng 9 năm 2027, và không có bước đăng ký tham gia tương đương nào được ghi nhận — nó được cung cấp sẵn thay vì bị hạn chế. Mô hình anh em Claude Mythos 5.1 của nó là cùng một mô hình nền tảng với các biện pháp bảo vệ khác nhau, bị giới hạn theo lời mời dành cho các chương trình Cyber Verification và Life Sciences của Anthropic.

Phạm vi hỗ trợ đám mây — Claude Fable 5.1 có mặt trên Amazon Bedrock, Goo​gle Cloud, Microsoft Foundry và Claude Platform trên AWS. GPT-6 Astra có mặt trên Microsoft Azure và Foundry cùng với Amazon Bedrock. Goo​gle Cloud chính là khoảng trống: nếu hoạt động suy luận của bạn buộc phải chạy trên Goo​gle Cloud, thì một trong hai giải pháp này có câu trả lời, còn giải pháp kia thì không.

Mặc định truy cập — GPT-6 Astra mặc định bị tắt trên Business và Enterprise và cần quản trị viên bật theo bảng giá. Claude Fable 5.1 không có cổng đăng ký tham gia nào được ghi nhận trong tài liệu.

Xử lý dữ liệu — OpenAI tài liệu hóa chính sách Lưu trữ dữ liệu bằng không (Zero Data Retention) dành cho các khách hàng API đủ điều kiện trên những endpoint được hỗ trợ, tùy thuộc vào sự phê duyệt. Anthropic tài liệu hóa các biện pháp bảo vệ cấp doanh nghiệp với zero data retention sẽ ra mắt vào mùa thu năm 2026, nghĩa là hiện nay tính năng này chưa khả dụng.

Vòng đời — Claude Fable 5.1 có cam kết ngừng hỗ trợ đã được công bố là không sớm hơn ngày 1 tháng 9 năm 2027. OpenAI chưa công bố cam kết có mốc thời gian tương đương cho GPT-6 Astra.

Screenshot of the OrcaRouter model page for Claude Fable 5.1, model id anthropic/claude-fable-5.1, released 2026-09-01 by Anthropic, showing INPUT $10.00 and OUTPUT $50.00 per 1M tokens, a 1M-token context, 128K maximum output, p50 TTFT 4.43 s, p95 TTFT 10.00 s, and 19.9M tokens of traffic in seven days, with the site language set to EN.

Chạy cả hai sau một khóa

Vì hai bảng giá hoàn toàn giống nhau ở mức giá niêm yết, câu hỏi thực sự làm một nhóm tốn tiền không phải là mô hình nào rẻ hơn, mà là việc đổi ý tốn kém đến mức nào. Cả hai đều được cung cấp trên OrcaRouter theo đúng giá niêm yết của nhà cung cấp — openai/gpt-6-astra ở mức 10,00 USD cho đầu vào và 50,00 USD cho đầu ra, với hạng ngữ cảnh dài 272K được áp dụng đúng như Open​AI định nghĩa, và anthropic/claude-fable-5.1 ở mức 10,00 USD và 50,00 USD cùng giá đọc bộ nhớ đệm là 0,25 USD — được chuyển nguyên mức giá với 0% phụ phí, nhờ đó khi nhà cung cấp thay đổi giá thì thay đổi đó có hiệu lực ngay trong cùng ngày trên chính khóa đó, thay vì phải chờ một cuộc di trú hệ thống thanh toán.

Điều đó quan trọng hơn đối với cặp mô hình này so với phần lớn các trường hợp, bởi bằng chứng cho thấy câu trả lời đúng là chia tách thay vì chọn một. Lưu lượng chat là thật trên cả hai điểm cuối ở đây — 180,7M token được định tuyến đến GPT-6 Astra trong bảy ngày tính đến ngày 16 tháng 9 năm 2026 và 19,9M đến Claude Fable 5.1 — và các dạng khối lượng công việc mà mỗi bên phù hợp khác nhau đủ để việc định tuyến giữa chúng là một thay đổi cấu hình chứ không phải một quyết định kiến trúc. Một DSL định tuyến có thể gửi các vòng lặp chạy dài, nặng về cache đến Claude Fable 5.1 để có mức đọc cache rẻ hơn bốn lần, trong khi công việc ngắn, khối lượng lớn, hiệu quả về đầu ra thì đi đến GPT-6 Astra, và hợp nhất mô hình có thể đưa cả hai vào cùng một bài toán khó khi một câu trả lời duy nhất không đủ tốt để hành động dựa trên đó. Chuyển đổi dự phòng tự động nghĩa là một giới hạn tốc độ trên một đường dẫn là một sự kiện định tuyến chứ không phải một sự cố ngừng dịch vụ, và đó chính là điều khiến việc thử mặt chưa được kiểm chứng của một mô hình tiên tiến hoàn toàn mới trên một đường dẫn production trở nên hợp lý.

Ai nên chọn cái nào

Chọn GPT-6 Astra nếu công việc của bạn mang tính dài hạn và đầu-cuối — lập trình tác tử, tự động hoá terminal, nghiên cứu hoặc các tác vụ dùng máy tính chạy qua nhiều bước và tốn nhiều token phát ra hơn là ngữ cảnh. Dựa trên bằng chứng độc lập, nó hoàn thành cùng một bài đánh giá với chỉ khoảng một phần ba số token đầu ra và rẻ hơn khoảng 57% cho mỗi tác vụ hoàn thành, đồng thời dẫn đầu trên Terminal-Bench 4.0 ở cả đo lường của nhà cung cấp lẫn đo lường độc lập. Hãy lập ngân sách theo từng tác vụ thay vì theo từng token, và coi 272.000 token đầu vào là một ranh giới cứng: vượt qua ngưỡng đó, một yêu cầu trên mô hình này sẽ được nhà cung cấp định giá lại theo quy tắc riêng của họ cho toàn bộ yêu cầu.

Hãy chọn Claude Fable 5.1 nếu khối lượng công việc của bạn đọc lại một tiền tố lớn, ổn định — chẳng hạn một prompt hệ thống dài, một kho mã nguồn, một bộ tài liệu — qua nhiều lượt, bởi vì một lần đọc bộ nhớ đệm rẻ hơn bốn lần sẽ cộng dồn trên từng lượt một, và phép tính ở trên cho thấy nó biến một tác vụ $5.70 thành $1.95. Đây cũng là lựa chọn dành cho bạn nếu bạn muốn thông lượng đo được cao hơn và token đầu tiên nhanh hơn, nếu suy luận của bạn phải chạy trên Goo​gle Cloud, hoặc nếu một cam kết ngừng hỗ trợ có ngày tháng cụ thể là điều quan trọng đối với việc mua sắm. Nó ngang bằng với GPT-6 Astra trên chỉ số tổng hợp và trên chỉ số tác nhân lập trình, đồng thời có lập luận mạnh hơn do nhà cung cấp công bố trên Humanity's Last Exam, GDPval và CursorBench — những bộ đánh giá mà Open​AI không công bố con số tương đương, nên hãy coi đó là một lỗ hổng trong bằng chứng thay vì một chiến thắng đã được chứng minh.

Và đây là câu trả lời mà một trang so sánh nợ bạn khi nó đúng: với nhiều đội nhóm, khuyến nghị trung thực là không chọn cả hai. Tài liệu của chính Anthropic dành cho Claude Fable 5.1 nói rằng với hầu hết khối lượng công việc, bạn nên bắt đầu với Claude Opus 5 và chỉ tìm đến Fable 5.1 khi các bài đánh giá (eval) của bạn trên Opus 5 ở mức effort cao hơn vẫn còn thiếu hụt. Claude Opus 5 có giá 5,00 USD cho đầu vào và 25,00 USD cho đầu ra — bằng một nửa cả hai mô hình này trên cả hai hạng mục. Nếu lợi thế đọc cache gấp bốn lần hay hiệu quả token gấp ba lần không mô tả đúng khối lượng công việc của bạn, thì khoản phụ phí dành cho mô hình flagship đang mua cho bạn một năng lực mà bạn chưa chứng minh được là mình cần, và cách rẻ nhất để tìm ra câu trả lời là chạy thử một tác vụ thực tế qua cả hai mô hình này cùng một bậc thấp hơn, trên một key duy nhất, trước khi cam kết với bất kỳ bên nào.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày