
Điểm số độc lập đầu tiên của GPT-6.1 Sol đã có: kém Astra 0.84 điểm, với chi phí tác vụ dưới một phần tư.
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 397 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 195 tok/s
- OrcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Mọi bài viết về GPT-6.1 Sol được xuất bản trong những ngày sau bản phát hành DevDay ngày 29 tháng 9 năm 2026 của OpenAI — bao gồm cả blog này — đều mang cùng một lưu ý: các con số về năng lực là do nhà cung cấp đưa ra và chưa có bên thứ ba nào chấm điểm mô hình. Lưu ý đó nay đã lỗi thời. Artificial Analysis đã có một dòng GPT-6.1 Sol trên Intelligence Index của mình, được chạy ở mức nỗ lực suy luận tối đa, và đây là con số đầu tiên trong vòng đời ngắn ngủi của mô hình này mà OpenAI không tự tạo ra. Nó ghi 51,8 so với 52,7 của GPT-6 Astra và 47,5 của GPT-6 Sol — một khoảng cách chưa đến một điểm so với mô hình chủ lực giá $10/$50, và mức tăng 4,3 điểm so với mô hình mà GPT-6.1 Sol thay thế. Con số khiến dòng này trở nên thú vị là con số nằm bên cạnh nó: bảng xếp hạng định giá lần chạy đánh giá đằng sau mỗi điểm số, và lần chạy chỉ số của GPT-6.1 Sol tốn $0,72 mỗi tác vụ, trong khi của Astra tốn $3,26. Gấp bốn lần rưỡi số tiền để đổi lấy 0,84 điểm là toàn bộ phép so sánh gói gọn trong một dòng, và giờ đây đó là một dòng được đo lường chứ không phải cách nhà cung cấp diễn giải về nó.
Bản thân dòng đó, và thứ mà nó được chạy trên

Artificial Analysis công bố Intelligence Index của mình dưới dạng tổ hợp của mười đánh giá, và phiên bản chạy vào ngày 30 tháng 9 năm 2026 là v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience và AA-LCR v1.1. Cả ba mô hình OpenAI trong bài viết này đều nằm trên cùng phiên bản đó, nên phần so sánh dưới đây là so sánh tương đồng theo cách mà bảng ra mắt của chính nhà cung cấp không bao giờ có được. Bảng xếp hạng cũng ghi lại ngày phát hành mà nó có cho mô hình — 2026-09-29, ngày DevDay — và đánh giá mô hình ở cấu hình nỗ lực tối đa, tức cài đặt mà trang nêu trong tiêu đề của chính nó.
• Chỉ số Trí tuệ — 51,8 đối với GPT-6.1 Sol (max), 52,7 đối với GPT-6 Astra (max), 47,5 đối với GPT-6 Sol (max).
• Chi phí cho mỗi tác vụ chỉ số — 0,72 USD đối với GPT-6.1 Sol, 3,26 USD đối với Astra, 1,05 USD đối với GPT-6 Sol. Đây là con số của chính bảng xếp hạng về chi phí để chạy một lần đánh giá chỉ số đầy đủ, chứ không phải một bảng giá niêm yết.
• Token đầu ra tiêu tốn cho lần chạy — 67,2 triệu đối với GPT-6.1 Sol, 60,0 triệu đối với Astra, 76,8 triệu đối với GPT-6 Sol. Phần bình luận của chính AA gọi 67 triệu là "khá súc tích" so với mức trung vị 82 triệu của bảng xếp hạng, và đây là chiến thắng thứ hai, lặng lẽ hơn, trước mô hình mà nó thay thế.
• Tốc độ đầu ra — 66,8 token mỗi giây đối với GPT-6.1 Sol, 57,0 đối với Astra, 76,2 đối với GPT-6 Sol.
• Giá theo như bảng xếp hạng liệt kê — 2,00 USD cho đầu vào và 10,00 USD cho đầu ra trên mỗi triệu token đối với GPT-6.1 Sol, với đầu vào được lưu đệm ở mức 0,10 USD và ghi đệm ở mức 2,50 USD. Bốn con số đó khớp chính xác với trang giá của nhà cung cấp, và đó là điều ít kịch tính nhất mà cũng hữu ích nhất ở hàng này: một danh sách độc lập các mức giá mà chúng tôi đã trích dẫn.
Một lưu ý về khung diễn giải trước khi những con số bị dùng làm đạn dược. Chỉ số của AA gồm mười đánh giá, và những đánh giá mà OpenAI mở đầu thông báo của chính mình — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — không nằm trong số đó. AA vận hành một biến thể AutomationBench của riêng mình, vốn không cùng một harness như phiên bản AutomationBench mà nhà cung cấp đã viện dẫn. Vì vậy, hồ sơ độc lập không xác nhận cũng không phủ nhận bốn tuyên bố nổi bật từ bài đăng ra mắt; nó đo một tập tác vụ phần lớn khác biệt, và đáng được đọc như ý kiến tham khảo thứ hai về hình dạng của mô hình hơn là như một phán quyết về những câu cụ thể đó.
Astra vẫn thắng, với cách biệt chưa đầy một điểm, nhưng với chi phí gấp bốn lần rưỡi.

Cả hai mô hình đều đưa ra một thang mức nỗ lực, và bảng xếp hạng giờ đã công bố điểm số cùng chi phí chạy cho từng bậc của cả hai. Khi đặt cạnh nhau, các thang này nói lên điều mà phép so sánh tiêu đề đơn lẻ không thể: Cấu hình tốt nhất của GPT-6.1 Sol không cạnh tranh với cấu hình tốt nhất của Astra. Nó đang cạnh tranh với cấu hình tốt thứ hai của Astra.
• GPT-6.1 Sol, max — 51,8, 0,72 USD mỗi tác vụ lập chỉ mục. GPT-6 Astra, max — 52,7, 3,26 USD.
• GPT-6.1 Sol, xhigh — 51,0, 0,39 USD. GPT-6 Astra, xhigh — 52,4, 2,31 USD.
• GPT-6.1 Sol, high — 50,2, 0,32 USD. GPT-6 Astra, high — 50,9, 1,73 USD.
• GPT-6.1 Sol, medium — 47,8, 0,21 USD. GPT-6 Astra, medium — 49,6, 1,54 USD.
• GPT-6.1 Sol, low — 42,1, 0,13 USD. GPT-6 Astra, low — 45,8, 0,82 USD.
Astra dẫn đầu ở mọi nấc, đó là tóm tắt trung thực về cuộc đối đầu và cũng là phần kém thú vị nhất của nó. Phần thú vị là tỷ lệ đánh đổi. Nếu bạn muốn cấu hình Astra rẻ nhất đánh bại thành tích tốt nhất của GPT-6.1 Sol, thì đó là Astra ở xhigh: 52,4 so với 51,8, với chi phí $2,31 so với $0,72. Đó là 0,56 điểm chỉ số đổi lấy việc tốn thêm $1,59 mỗi lần chạy đánh giá — chi phí gấp khoảng 3,2 lần để đổi lấy chưa đến một phần trăm điểm số. Đi theo hướng ngược lại và hạ GPT-6.1 Sol xuống xhigh, bạn mất 0,8 điểm trong khi hóa đơn giảm còn $0,39, tức rẻ hơn 5,9 lần so với xhigh của Astra và bằng một phần chín chi phí của lần chạy nỗ lực tối đa của Astra.
Có một cách diễn giải thứ hai về cùng một thang, lập luận chống lại việc mua Astra ở mức nỗ lực tối đa. Bốn bậc thấp hơn của Astra đều rẻ hơn mức tối đa của nó, và mức xhigh của nó thấp hơn mức tối đa 0,29 điểm — chỉ hơn nửa phần trăm điểm số một chút để đổi lấy việc cắt giảm 29% chi phí chạy. Bất kỳ cuộc trao đổi mua sắm nào về cặp này mà bắt đầu từ “Astra ở mức tối đa” và kết thúc ở “Astra tốn kém gấp 4,5 lần” đều đang bỏ sót các bậc rẻ hơn của chính Astra khỏi so sánh.
Sáu đánh giá dành cho Astra, hai dành cho GPT-6.1 Sol, hai hòa
Chỉ số tổng hợp che giấu một sự chia tách. Khi chấm điểm từng eval một ở mức nỗ lực tối đa, GPT-6.1 Sol không phải là một Astra kém hơn một chút một cách đồng đều — nó giỏi hơn ở hai thứ và kém hơn ở sáu thứ.
• GDPval-AA — Elo 1575.1 cho GPT-6.1 Sol so với 1541.9 của Astra, dẫn trước 33 điểm trong các tác vụ công việc chuyên môn. Đây là chiến thắng độc lập đơn lẻ lớn nhất cho mô hình rẻ hơn.
• AA-LCR v1.1, suy luận ngữ cảnh dài — 0.830 so với 0.807. GPT-6.1 Sol dẫn trước.
• AA-Briefcase v1.1 — Elo 1564.2 so với 1568.9. Astra hơn 4.7.
• AutomationBench-AA — 0.649 so với 0.685. Astra hơn 3.6 điểm.
• Terminal-Bench 4.0 — 0.561 so với 0.591. Astra hơn 3.0 điểm.
• SciCode — 0.542 so với 0.565. Astra hơn 2.3 điểm.
• Humanity's Last Exam — 0.529 so với 0.547. Astra hơn 1.8 điểm.
• AA-Omniscience — 41.5 so với 43.4. Astra hơn 1.9 điểm.
• GDP.pdf và CritPt — hòa hoàn toàn ở mức 0.310 và 0.317 tương ứng, trên cả hai mô hình.
Hai trong số những dòng đó đáng giá hơn vị trí của chúng trong danh sách. Biên lợi thế GDPval-AA là nơi duy nhất mà lợi thế của mô hình rẻ hơn đủ lớn để trụ vững khi thay đổi khung đánh giá, và nó rơi đúng vào loại khối lượng công việc mà tuyên bố định vị của nhà cung cấp khẳng định — công việc chuyên nghiệp, nặng về tài liệu. Còn hai kết quả hòa tuyệt đối nằm ở những bài đánh giá có mức chênh lệch hẹp nhất, điều này nhắc nhở rằng khoảng cách tổng hợp 0,84 điểm đang được ghép lại từ những dòng mà xét riêng lẻ trải từ mức thắng 33 điểm đến mức thua 3,6 điểm.
So với mẫu mà nó thay thế, mức cải thiện là có thật nhưng không đồng đều.
Phép so sánh đáng quan tâm đối với bất kỳ ai đang chạy GPT-6 Sol trên môi trường production là phép so sánh mà 6.1 Sol tạo ra với chính phiên bản tiền nhiệm của nó, và dữ liệu độc lập nói rõ hơn về điều đó so với bài đăng của nhà cung cấp. Tám trong mười đánh giá cải thiện. Hai đánh giá đi lùi.
• SciCode — GPT-6.1 Sol đạt 0,542 trong khi GPT-6 Sol đạt 0,576. Mô hình mới hơn lại kém hơn ở mảng lập trình khoa học tới 3,5 điểm.
• AA-LCR v1.1 — 0,830 cho 6.1 Sol so với 0,837 của GPT-6 Sol. Cách biệt chỉ trong gang tấc, nhưng lại theo hướng sai, ở bài đánh giá ngữ cảnh dài.
• AA-Omniscience — 41,5 so với 27,1. Đây là mức dịch chuyển lớn nhất trong hàng: bước nhảy 14,4 điểm ở bài đánh giá kiến thức, và độ chính xác trên bộ đó tăng từ 0,545 lên 0,621.
• Tỷ lệ ảo giác trên cùng bộ — 0,543 cho GPT-6.1 Sol, giảm từ 0,601 của GPT-6 Sol và vẫn cao hơn 0,513 của GPT-6 Astra. AA-Omniscience chia điểm số của mình thành “trả lời đúng” và “sai một cách tự tin”, và chính cách chia đó là nơi bản làm mới 6.1 khẳng định được giá trị: nó ít gian dối hơn Sol một cách đáng kể, và nó vẫn là mô hình gian dối nhất trong ba mô hình.
• Terminal-Bench 4.0 — 0,561 so với 0,439, mức tăng 12,2 điểm. AA-Briefcase — 1482,8 lên 1564,2 Elo. GDP.pdf — 0,248 lên 0,310.
Cách hiểu là đây là một lần làm mới về kiến thức và công cụ nhiều hơn là một lần làm mới về suy luận. Những bài đánh giá thay đổi nhiều nhất là những bài thưởng cho việc biết các thứ và không tự bịa ra chúng; bài đánh giá bị giảm là một bài hẹp và mang tính kỹ thuật. Bất kỳ ai đã chuyển sang 6.1 Sol vì khoản tiết kiệm cache thì nhận được lợi ích về kiến thức như một phần thưởng thêm và không nên cho rằng điều đó áp dụng cho mọi harness mà họ chạy.
Vị trí mà hội đồng xếp hạng nó, và những gì đứng trên nó.

Trong thứ tự mặc định của bảng xếp hạng theo Intelligence Index, GPT-6 Astra ở mức nỗ lực tối đa đứng thứ 7 và GPT-6.1 Sol ở mức nỗ lực tối đa đứng thứ 10, còn GPT-6 Sol ở mức nỗ lực tối đa đứng thứ 20. Chín dòng phía trên GPT-6.1 Sol là hai cấu hình Astra, ba cấu hình Claude Opus 5.5, một cấu hình Claude Sonnet 5.5 và hai cấu hình Claude Fable 5.1 — vậy mẫu mà GPT-6.1 Sol gần nhất chính là mẫu chủ lực của gia đình nó, và mẫu mà nó thực sự đã soán ngôi trong thứ tự đó là phiên bản tiền nhiệm của chính nó, thấp hơn mười ba bậc.
Bỏ thiết lập effort đi thì thứ tự sẽ co lại theo một cách quan trọng đối với việc lập kế hoạch chi phí: GPT-6.1 Sol ở xhigh xếp thứ 13, ở high xếp thứ 15, ở medium xếp thứ 19 và ở low xếp thứ 35, trong khi Astra đứng thứ 14 ở high, thứ 16 ở medium và thứ 26 ở low. Nói cách khác, GPT-6.1 Sol ở xhigh xếp trên Astra ở high trên bảng, còn GPT-6.1 Sol ở medium xếp trên Astra ở low. Effort là một đòn bẩy lớn hơn ở đây so với việc chọn mô hình, ít nhất là giữa hai mô hình này.
Thành thật mà nói, phải làm gì với con số này đây
Tuyên bố của nhà cung cấp mà dòng này kiểm chứng là GPT-6.1 Sol gần như sánh ngang với flagship với mức giá chỉ bằng khoảng một phần năm. Phiên bản độc lập của câu đó là: nó chỉ cách flagship 0,84 điểm chỉ số, và lần chạy đánh giá đứng sau điểm số của nó chỉ tốn 22% chi phí của flagship. Điều đó đủ gần với tuyên bố đến mức không ai nên cảm thấy bị dẫn dắt sai lệch bởi nó, và đó là một phát biểu mạnh hơn “chưa được xác minh” theo mọi khía cạnh quan trọng đối với người mua.
Điều mà hàng này không làm là định giá khối lượng công việc của bạn. Một lượt chạy chỉ số là một tổ hợp tác vụ cụ thể, và con số quyết định hoá đơn thực tế chính là bảng giá đối chiếu với hồ sơ token của riêng bạn — đó là lý do dòng cache vẫn là dòng cần mô hình hoá: mức đầu vào được cache $0.10 của GPT-6.1 Sol so với $1.00 của Astra là mức chênh lệch gấp mười lần mà không điểm chỉ số nào chạm tới. Về phía chúng tôi, cơ chế chuyển tiếp nguyên giá cũng được áp dụng tương tự: OrcaRouter cung cấp GPT-6 Astra, GPT-6 Sol và GPT-6 Luna đúng theo giá niêm yết của chính OpenAI mà không cộng thêm phụ phí, nên vào ngày nhà cung cấp thay đổi mức giá, giá phía chúng tôi cũng thay đổi theo, thay vì phải chờ một hợp đồng thứ hai. GPT-6.1 Sol không nằm trong các tuyến của chúng tôi — danh mục công khai trả về "model not found" cho openai/gpt-6.1-sol hôm nay, và không có cách nào trung thực để mô tả một mô hình mà chúng tôi không thể phục vụ. Điều mà một API key thực sự mang lại cho bạn ngay lúc này là cặp mô hình mà chính bài benchmark đang tranh luận — Astra cho những công việc khó nhất, Sol cho khối lượng lớn — với giá niêm yết của nhà cung cấp được chuyển tiếp nguyên vẹn, không đánh dấu, cùng khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp khi một trong số họ gặp lỗi.
Hai điều sẽ giúp làm rõ hơn nữa. Một bộ khung đánh giá độc lập thứ hai trên cùng mô hình sẽ cho chúng ta biết liệu lợi thế dẫn đầu của GDPval-AA là thuộc tính của mô hình hay của chính phép đánh giá đó, và đây là điểm dữ liệu còn thiếu hữu ích nhất trong hàng. Và một phép đo độc lập cho hạng ngữ cảnh dài 272.000 token sẽ quan trọng hơn một điểm tổng hợp khác, vì đó là nơi mức giá của dòng mô hình này không còn rẻ nữa.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
