Thẻ hero được tạo cho GPT-6.1 Sol với tiêu đề 'Điểm số độc lập đã có', cùng các huy hiệu ghi 'Phát hành: 29 tháng 9, 2026', 'Chỉ số Thông minh: 52 ở mức nỗ lực tối đa' và 'Chi phí mỗi tác vụ chỉ số: $0.72', phần chân trang ghi 'Các số liệu độc lập theo Artificial Analysis, chỉ số v4.3.2, đọc ngày 30 tháng 9, 2026', và logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

Điểm số độc lập đầu tiên của GPT-6.1 Sol đã có: kém Astra 0.84 điểm, với chi phí tác vụ dưới một phần tư.

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Mọi bài viết về GPT-6.1 Sol được xuất bản trong những ngày sau bản phát hành DevDay ngày 29 tháng 9 năm 2026 của Ope​nAI — bao gồm cả blog này — đều mang cùng một lưu ý: các con số về năng lực là do nhà cung cấp đưa ra và chưa có bên thứ ba nào chấm điểm mô hình. Lưu ý đó nay đã lỗi thời. Artificial Analysis đã có một dòng GPT-6.1 Sol trên Intelligence Index của mình, được chạy ở mức nỗ lực suy luận tối đa, và đây là con số đầu tiên trong vòng đời ngắn ngủi của mô hình này mà Ope​nAI không tự tạo ra. Nó ghi 51,8 so với 52,7 của GPT-6 Astra và 47,5 của GPT-6 Sol — một khoảng cách chưa đến một điểm so với mô hình chủ lực giá $10/$50, và mức tăng 4,3 điểm so với mô hình mà GPT-6.1 Sol thay thế. Con số khiến dòng này trở nên thú vị là con số nằm bên cạnh nó: bảng xếp hạng định giá lần chạy đánh giá đằng sau mỗi điểm số, và lần chạy chỉ số của GPT-6.1 Sol tốn $0,72 mỗi tác vụ, trong khi của Astra tốn $3,26. Gấp bốn lần rưỡi số tiền để đổi lấy 0,84 điểm là toàn bộ phép so sánh gói gọn trong một dòng, và giờ đây đó là một dòng được đo lường chứ không phải cách nhà cung cấp diễn giải về nó.

Bản thân dòng đó, và thứ mà nó được chạy trên

A screenshot of the Artificial Analysis model page for GPT-6.1 Sol at maximum reasoning effort, headed 'GPT-6.1 Sol (max) Intelligence, Performance & Price Analysis', with a class-rank strip above the summary naming the model's Intelligence, Speed, Cost and Verbosity positions out of 221 models. The summary paragraph reports an Intelligence Index score of 52 against a median of 26 across 221 models in the class, $2.00 per million input tokens and $10.00 per million output tokens, $0.72 per task to evaluate on the Intelligence Index, and 67 tokens per second against an average of 74, with 67 million output tokens generated against a board median of 82 million; a panel to its right lists a 1M-token context window together with text-and-image input. The page names Intelligence Index v4.3.2 and its ten constituent evaluations.

Artificial Analysis công bố Intelligence Index của mình dưới dạng tổ hợp của mười đánh giá, và phiên bản chạy vào ngày 30 tháng 9 năm 2026 là v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience và AA-LCR v1.1. Cả ba mô hình OpenAI trong bài viết này đều nằm trên cùng phiên bản đó, nên phần so sánh dưới đây là so sánh tương đồng theo cách mà bảng ra mắt của chính nhà cung cấp không bao giờ có được. Bảng xếp hạng cũng ghi lại ngày phát hành mà nó có cho mô hình — 2026-09-29, ngày DevDay — và đánh giá mô hình ở cấu hình nỗ lực tối đa, tức cài đặt mà trang nêu trong tiêu đề của chính nó.

• Chỉ số Trí tuệ — 51,8 đối với GPT-6.1 Sol (max), 52,7 đối với GPT-6 Astra (max), 47,5 đối với GPT-6 Sol (max).
• Chi phí cho mỗi tác vụ chỉ số — 0,72 USD đối với GPT-6.1 Sol, 3,26 USD đối với Astra, 1,05 USD đối với GPT-6 Sol. Đây là con số của chính bảng xếp hạng về chi phí để chạy một lần đánh giá chỉ số đầy đủ, chứ không phải một bảng giá niêm yết.
• Token đầu ra tiêu tốn cho lần chạy — 67,2 triệu đối với GPT-6.1 Sol, 60,0 triệu đối với Astra, 76,8 triệu đối với GPT-6 Sol. Phần bình luận của chính AA gọi 67 triệu là "khá súc tích" so với mức trung vị 82 triệu của bảng xếp hạng, và đây là chiến thắng thứ hai, lặng lẽ hơn, trước mô hình mà nó thay thế.
• Tốc độ đầu ra — 66,8 token mỗi giây đối với GPT-6.1 Sol, 57,0 đối với Astra, 76,2 đối với GPT-6 Sol.
• Giá theo như bảng xếp hạng liệt kê — 2,00 USD cho đầu vào và 10,00 USD cho đầu ra trên mỗi triệu token đối với GPT-6.1 Sol, với đầu vào được lưu đệm ở mức 0,10 USD và ghi đệm ở mức 2,50 USD. Bốn con số đó khớp chính xác với trang giá của nhà cung cấp, và đó là điều ít kịch tính nhất mà cũng hữu ích nhất ở hàng này: một danh sách độc lập các mức giá mà chúng tôi đã trích dẫn.

Một lưu ý về khung diễn giải trước khi những con số bị dùng làm đạn dược. Chỉ số của AA gồm mười đánh giá, và những đánh giá mà OpenAI mở đầu thông báo của chính mình — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — không nằm trong số đó. AA vận hành một biến thể AutomationBench của riêng mình, vốn không cùng một harness như phiên bản AutomationBench mà nhà cung cấp đã viện dẫn. Vì vậy, hồ sơ độc lập không xác nhận cũng không phủ nhận bốn tuyên bố nổi bật từ bài đăng ra mắt; nó đo một tập tác vụ phần lớn khác biệt, và đáng được đọc như ý kiến tham khảo thứ hai về hình dạng của mô hình hơn là như một phán quyết về những câu cụ thể đó.

Astra vẫn thắng, với cách biệt chưa đầy một điểm, nhưng với chi phí gấp bốn lần rưỡi.

A generated scoreboard titled 'GPT-6.1 Sol - the independent scoreboard', listing six rows: Intelligence Index 51.8 at maximum effort, cost per index task $0.72 against GPT-6 Astra's $3.26, output tokens on the run 67.2 million, output speed 66.8 tokens per second, price $2.00 input and $10.00 output per million tokens with cached input at $0.10, and release date September 29, 2026. A footer reads that all figures are per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.

Cả hai mô hình đều đưa ra một thang mức nỗ lực, và bảng xếp hạng giờ đã công bố điểm số cùng chi phí chạy cho từng bậc của cả hai. Khi đặt cạnh nhau, các thang này nói lên điều mà phép so sánh tiêu đề đơn lẻ không thể: Cấu hình tốt nhất của GPT-6.1 Sol không cạnh tranh với cấu hình tốt nhất của Astra. Nó đang cạnh tranh với cấu hình tốt thứ hai của Astra.

• GPT-6.1 Sol, max — 51,8, 0,72 USD mỗi tác vụ lập chỉ mục. GPT-6 Astra, max — 52,7, 3,26 USD.
• GPT-6.1 Sol, xhigh — 51,0, 0,39 USD. GPT-6 Astra, xhigh — 52,4, 2,31 USD.
• GPT-6.1 Sol, high — 50,2, 0,32 USD. GPT-6 Astra, high — 50,9, 1,73 USD.
• GPT-6.1 Sol, medium — 47,8, 0,21 USD. GPT-6 Astra, medium — 49,6, 1,54 USD.
• GPT-6.1 Sol, low — 42,1, 0,13 USD. GPT-6 Astra, low — 45,8, 0,82 USD.

Astra dẫn đầu ở mọi nấc, đó là tóm tắt trung thực về cuộc đối đầu và cũng là phần kém thú vị nhất của nó. Phần thú vị là tỷ lệ đánh đổi. Nếu bạn muốn cấu hình Astra rẻ nhất đánh bại thành tích tốt nhất của GPT-6.1 Sol, thì đó là Astra ở xhigh: 52,4 so với 51,8, với chi phí $2,31 so với $0,72. Đó là 0,56 điểm chỉ số đổi lấy việc tốn thêm $1,59 mỗi lần chạy đánh giá — chi phí gấp khoảng 3,2 lần để đổi lấy chưa đến một phần trăm điểm số. Đi theo hướng ngược lại và hạ GPT-6.1 Sol xuống xhigh, bạn mất 0,8 điểm trong khi hóa đơn giảm còn $0,39, tức rẻ hơn 5,9 lần so với xhigh của Astra và bằng một phần chín chi phí của lần chạy nỗ lực tối đa của Astra.

Có một cách diễn giải thứ hai về cùng một thang, lập luận chống lại việc mua Astra ở mức nỗ lực tối đa. Bốn bậc thấp hơn của Astra đều rẻ hơn mức tối đa của nó, và mức xhigh của nó thấp hơn mức tối đa 0,29 điểm — chỉ hơn nửa phần trăm điểm số một chút để đổi lấy việc cắt giảm 29% chi phí chạy. Bất kỳ cuộc trao đổi mua sắm nào về cặp này mà bắt đầu từ “Astra ở mức tối đa” và kết thúc ở “Astra tốn kém gấp 4,5 lần” đều đang bỏ sót các bậc rẻ hơn của chính Astra khỏi so sánh.

Sáu đánh giá dành cho Astra, hai dành cho GPT-6.1 Sol, hai hòa

Chỉ số tổng hợp che giấu một sự chia tách. Khi chấm điểm từng eval một ở mức nỗ lực tối đa, GPT-6.1 Sol không phải là một Astra kém hơn một chút một cách đồng đều — nó giỏi hơn ở hai thứ và kém hơn ở sáu thứ.

• GDPval-AA — Elo 1575.1 cho GPT-6.1 Sol so với 1541.9 của Astra, dẫn trước 33 điểm trong các tác vụ công việc chuyên môn. Đây là chiến thắng độc lập đơn lẻ lớn nhất cho mô hình rẻ hơn.
• AA-LCR v1.1, suy luận ngữ cảnh dài — 0.830 so với 0.807. GPT-6.1 Sol dẫn trước.
• AA-Briefcase v1.1 — Elo 1564.2 so với 1568.9. Astra hơn 4.7.
• AutomationBench-AA — 0.649 so với 0.685. Astra hơn 3.6 điểm.
• Terminal-Bench 4.0 — 0.561 so với 0.591. Astra hơn 3.0 điểm.
• SciCode — 0.542 so với 0.565. Astra hơn 2.3 điểm.
• Humanity's Last Exam — 0.529 so với 0.547. Astra hơn 1.8 điểm.
• AA-Omniscience — 41.5 so với 43.4. Astra hơn 1.9 điểm.
• GDP.pdf và CritPt — hòa hoàn toàn ở mức 0.310 và 0.317 tương ứng, trên cả hai mô hình.

Hai trong số những dòng đó đáng giá hơn vị trí của chúng trong danh sách. Biên lợi thế GDPval-AA là nơi duy nhất mà lợi thế của mô hình rẻ hơn đủ lớn để trụ vững khi thay đổi khung đánh giá, và nó rơi đúng vào loại khối lượng công việc mà tuyên bố định vị của nhà cung cấp khẳng định — công việc chuyên nghiệp, nặng về tài liệu. Còn hai kết quả hòa tuyệt đối nằm ở những bài đánh giá có mức chênh lệch hẹp nhất, điều này nhắc nhở rằng khoảng cách tổng hợp 0,84 điểm đang được ghép lại từ những dòng mà xét riêng lẻ trải từ mức thắng 33 điểm đến mức thua 3,6 điểm.

So với mẫu mà nó thay thế, mức cải thiện là có thật nhưng không đồng đều.

Phép so sánh đáng quan tâm đối với bất kỳ ai đang chạy GPT-6 Sol trên môi trường production là phép so sánh mà 6.1 Sol tạo ra với chính phiên bản tiền nhiệm của nó, và dữ liệu độc lập nói rõ hơn về điều đó so với bài đăng của nhà cung cấp. Tám trong mười đánh giá cải thiện. Hai đánh giá đi lùi.

• SciCode — GPT-6.1 Sol đạt 0,542 trong khi GPT-6 Sol đạt 0,576. Mô hình mới hơn lại kém hơn ở mảng lập trình khoa học tới 3,5 điểm.
• AA-LCR v1.1 — 0,830 cho 6.1 Sol so với 0,837 của GPT-6 Sol. Cách biệt chỉ trong gang tấc, nhưng lại theo hướng sai, ở bài đánh giá ngữ cảnh dài.
• AA-Omniscience — 41,5 so với 27,1. Đây là mức dịch chuyển lớn nhất trong hàng: bước nhảy 14,4 điểm ở bài đánh giá kiến thức, và độ chính xác trên bộ đó tăng từ 0,545 lên 0,621.
• Tỷ lệ ảo giác trên cùng bộ — 0,543 cho GPT-6.1 Sol, giảm từ 0,601 của GPT-6 Sol và vẫn cao hơn 0,513 của GPT-6 Astra. AA-Omniscience chia điểm số của mình thành “trả lời đúng” và “sai một cách tự tin”, và chính cách chia đó là nơi bản làm mới 6.1 khẳng định được giá trị: nó ít gian dối hơn Sol một cách đáng kể, và nó vẫn là mô hình gian dối nhất trong ba mô hình.
• Terminal-Bench 4.0 — 0,561 so với 0,439, mức tăng 12,2 điểm. AA-Briefcase — 1482,8 lên 1564,2 Elo. GDP.pdf — 0,248 lên 0,310.

Cách hiểu là đây là một lần làm mới về kiến thức và công cụ nhiều hơn là một lần làm mới về suy luận. Những bài đánh giá thay đổi nhiều nhất là những bài thưởng cho việc biết các thứ và không tự bịa ra chúng; bài đánh giá bị giảm là một bài hẹp và mang tính kỹ thuật. Bất kỳ ai đã chuyển sang 6.1 Sol vì khoản tiết kiệm cache thì nhận được lợi ích về kiến thức như một phần thưởng thêm và không nên cho rằng điều đó áp dụng cho mọi harness mà họ chạy.

Vị trí mà hội đồng xếp hạng nó, và những gì đứng trên nó.

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol — the independent scoreboard', with both columns carrying the same six labels. Left column 'GPT-6.1 Sol (max)': Intelligence Index 51.8, cost per index task $0.72, SciCode 0.542, long-context reasoning 0.830, AA-Omniscience 41.5, hallucination rate 0.543. Right column 'GPT-6 Sol (max)': Intelligence Index 47.5, cost per index task $1.05, SciCode 0.576, long-context reasoning 0.837, AA-Omniscience 27.1, hallucination rate 0.601. A footer reads 'Figures per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.'

Trong thứ tự mặc định của bảng xếp hạng theo Intelligence Index, GPT-6 Astra ở mức nỗ lực tối đa đứng thứ 7 và GPT-6.1 Sol ở mức nỗ lực tối đa đứng thứ 10, còn GPT-6 Sol ở mức nỗ lực tối đa đứng thứ 20. Chín dòng phía trên GPT-6.1 Sol là hai cấu hình Astra, ba cấu hình Claude Opus 5.5, một cấu hình Claude Sonnet 5.5 và hai cấu hình Claude Fable 5.1 — vậy mẫu mà GPT-6.1 Sol gần nhất chính là mẫu chủ lực của gia đình nó, và mẫu mà nó thực sự đã soán ngôi trong thứ tự đó là phiên bản tiền nhiệm của chính nó, thấp hơn mười ba bậc.

Bỏ thiết lập effort đi thì thứ tự sẽ co lại theo một cách quan trọng đối với việc lập kế hoạch chi phí: GPT-6.1 Sol ở xhigh xếp thứ 13, ở high xếp thứ 15, ở medium xếp thứ 19 và ở low xếp thứ 35, trong khi Astra đứng thứ 14 ở high, thứ 16 ở medium và thứ 26 ở low. Nói cách khác, GPT-6.1 Sol ở xhigh xếp trên Astra ở high trên bảng, còn GPT-6.1 Sol ở medium xếp trên Astra ở low. Effort là một đòn bẩy lớn hơn ở đây so với việc chọn mô hình, ít nhất là giữa hai mô hình này.

Thành thật mà nói, phải làm gì với con số này đây

Tuyên bố của nhà cung cấp mà dòng này kiểm chứng là GPT-6.1 Sol gần như sánh ngang với flagship với mức giá chỉ bằng khoảng một phần năm. Phiên bản độc lập của câu đó là: nó chỉ cách flagship 0,84 điểm chỉ số, và lần chạy đánh giá đứng sau điểm số của nó chỉ tốn 22% chi phí của flagship. Điều đó đủ gần với tuyên bố đến mức không ai nên cảm thấy bị dẫn dắt sai lệch bởi nó, và đó là một phát biểu mạnh hơn “chưa được xác minh” theo mọi khía cạnh quan trọng đối với người mua.

Điều mà hàng này không làm là định giá khối lượng công việc của bạn. Một lượt chạy chỉ số là một tổ hợp tác vụ cụ thể, và con số quyết định hoá đơn thực tế chính là bảng giá đối chiếu với hồ sơ token của riêng bạn — đó là lý do dòng cache vẫn là dòng cần mô hình hoá: mức đầu vào được cache $0.10 của GPT-6.1 Sol so với $1.00 của Astra là mức chênh lệch gấp mười lần mà không điểm chỉ số nào chạm tới. Về phía chúng tôi, cơ chế chuyển tiếp nguyên giá cũng được áp dụng tương tự: OrcaRouter cung cấp GPT-6 Astra, GPT-6 Sol và GPT-6 Luna đúng theo giá niêm yết của chính OpenAI mà không cộng thêm phụ phí, nên vào ngày nhà cung cấp thay đổi mức giá, giá phía chúng tôi cũng thay đổi theo, thay vì phải chờ một hợp đồng thứ hai. GPT-6.1 Sol không nằm trong các tuyến của chúng tôi — danh mục công khai trả về "model not found" cho openai/gpt-6.1-sol hôm nay, và không có cách nào trung thực để mô tả một mô hình mà chúng tôi không thể phục vụ. Điều mà một API key thực sự mang lại cho bạn ngay lúc này là cặp mô hình mà chính bài benchmark đang tranh luận — Astra cho những công việc khó nhất, Sol cho khối lượng lớn — với giá niêm yết của nhà cung cấp được chuyển tiếp nguyên vẹn, không đánh dấu, cùng khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp khi một trong số họ gặp lỗi.

Hai điều sẽ giúp làm rõ hơn nữa. Một bộ khung đánh giá độc lập thứ hai trên cùng mô hình sẽ cho chúng ta biết liệu lợi thế dẫn đầu của GDPval-AA là thuộc tính của mô hình hay của chính phép đánh giá đó, và đây là điểm dữ liệu còn thiếu hữu ích nhất trong hàng. Và một phép đo độc lập cho hạng ngữ cảnh dài 272.000 token sẽ quan trọng hơn một điểm tổng hợp khác, vì đó là nơi mức giá của dòng mô hình này không còn rẻ nữa.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày