Bảng điểm so sánh hai cột được tạo tự động có tiêu đề 'GPT-6.1 Sol so với GPT-6 Sol — bảng điểm'. Cột bên trái 'GPT-6.1 Sol': các hàng ghi 'Phát hành: 29 tháng 9, 2026', 'Đầu vào: 2,00 đô la mỗi 1M', 'Đầu vào đã lưu đệm: 0,10 đô la mỗi 1M', 'Ngữ cảnh: 1.050.000 token', 'Suy luận: không hỗ trợ', 'Đỉnh cao nhà cung cấp: DeepSWE +6,4 điểm'. Cột bên phải 'GPT-6 Sol': các hàng ghi 'Phát hành: 22 tháng 9, 2026', 'Đầu vào: 2,00 đô la mỗi 1M', 'Đầu vào đã lưu đệm: 0,20 đô la mỗi 1M', 'Ngữ cảnh: 1.050.000 token', 'Suy luận: có hỗ trợ', 'Đỉnh cao nhà cung cấp: mức cơ sở'. Phần chân trang ghi 'Các số liệu của OpenAI do nhà cung cấp báo cáo; chưa có điểm số độc lập nào được công bố cho cả hai mô hình tính đến ngày 30 tháng 9, 2026.'
Guides & Insights

GPT-6.1 Sol vs GPT-6 Sol: Một tuần làm việc thêm đã mang lại điều gì, và điều gì thì không

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Nếu bạn có GPT-6 Sol đang chạy trong môi trường production hôm nay và đang cố quyết định liệu GPT-6.1 Sol có đáng để chuyển đổi hay không, thì câu trả lời hoàn toàn phụ thuộc vào việc chi phí nào của bạn lớn hơn — và hai mô hình được xây dựng sao cho câu trả lời gần như không bao giờ là “cả hai”. GPT-6 Sol ra mắt ngày 22 tháng 9 năm 2026 với mức giá 2,00 USD cho mỗi triệu token đầu vào, 0,20 USD cho token được cache và 10,00 USD cho đầu ra. GPT-6.1 Sol ra mắt ngày 29 tháng 9 năm 2026 với mức giá 2,00 USD đầu vào, 0,10 USD cho cache và 10,00 USD đầu ra, cùng mức cải thiện 6,4 điểm phần trăm do nhà cung cấp báo cáo trên các tác vụ kỹ thuật phần mềm phức tạp với nỗ lực suy luận thấp hơn. Giá đầu vào và đầu ra không thay đổi. Tỷ lệ cache đã giảm một nửa. Chỉ một dòng thay đổi đó là toàn bộ luận cứ tài chính, còn mọi thứ khác là một lập luận về năng lực mà, ở thời điểm này trong vòng đời của bản phát hành, chỉ đến từ đúng một nguồn.

Ba điều đã thay đổi. Một trong số đó là một dự luật.

Gạt bỏ phần marketing sang một bên, thì khác biệt giữa hai lần triển khai này ngắn đến mức có thể nắm gọn trong đầu.

• Đầu vào đã lưu đệm — 0,10 USD mỗi triệu token trên GPT-6.1 Sol so với 0,20 USD trên GPT-6 Sol. Được đo lường chứ không chỉ được tuyên bố, và là thay đổi duy nhất thể hiện ra như một phép tính số học.
• Năng lực, theo nhà cung cấp — OpenAI báo cáo mức dẫn trước 6,4 điểm trên DeepSWE v1.1 với nỗ lực suy luận và chi phí thấp hơn, điểm số trên Terminal-Bench Science 0.1 cao hơn gấp đôi ở nỗ lực tối đa, bảy điểm trên bộ offline OSWorld 2.0 ở nỗ lực tối đa, 4,8 điểm trên AutomationBench ở nỗ lực trung bình, và tỷ lệ lỗi thực tế giảm từ 11,4% xuống 7,7% trên một bộ prompt được thiết kế để gây lỗi. Tất cả đều chưa được tái lập.
• Thang bậc suy luận — GPT-6.1 Sol hỗ trợ low, medium, high, xhigh và max, và không hỗ trợ none; GPT-6 Sol hỗ trợ cả sáu. Đây là khác biệt làm hỏng code, và là điều không ai đưa vào bài đăng ra mắt.

Mọi thứ khác đều giống hệt hoặc gần như vậy: cùng cửa sổ ngữ cảnh 1.050.000 token, cùng giới hạn đầu ra 128.000 token, cùng mức phí ghi bộ nhớ đệm 2,50 USD, cùng ngưỡng định giá lại 272K token mà trên đó toàn bộ yêu cầu được tính phí ở mức 2× đầu vào và bộ nhớ đệm, và 1,5× đầu ra, cùng yêu cầu Responses-API đối với việc gọi công cụ, và cùng việc không có hỗ trợ tinh chỉnh. Thời điểm cắt kiến thức đã dịch chuyển từ ngày 20 tháng 4 sang ngày 30 tháng 4 năm 2026 — mười ngày, kiểu con số cho bạn biết đây là một cuộc nâng cấp lại ở mức nào chứ không phải là một cuộc xây dựng lại.

Vì sao dòng cache có giá trị hơn vẻ bề ngoài của nó

A screenshot of OpenAI's developer model page for GPT-6.1 Sol showing the pricing block with input at $2.00, cached input at $0.10, cache writes at $2.50 and output at $10.00 per million tokens, the note that cached input tokens are priced at 5% of the uncached rate, the 272K-token repricing rule, and a 1,050,000-token context window with 128,000 max output tokens.

Việc đọc cache được giảm một nửa là một điều kỳ lạ để mở màn cho một bản làm mới sản phẩm, cho đến khi bạn nhìn vào lưu lượng agent thực sự trông như thế nào. Một vòng lặp agent gửi lại một tiền tố ổn định — lời nhắc hệ thống, lược đồ công cụ, ngữ cảnh truy xuất, lịch sử hội thoại — ở mỗi lượt, và trong một phiên dài, cùng tiền tố đó bị tính phí hàng chục hoặc hàng trăm lần. Đó là loại lưu lượng mà ở đó tỷ lệ cache không còn là một sai số làm tròn nữa và trở thành khoản mục chiếm ưu thế trên hóa đơn.

Hãy tính toán các con số cho một phiên agent dài duy nhất. Giả sử một tiền tố 120.000 token được tái sử dụng qua 40 lượt, tức 4,8 triệu token đầu vào được lưu đệm mỗi phiên, cộng thêm 150.000 token đầu ra mới khiêm tốn. Trên GPT-6 Sol, các lượt đọc được lưu đệm tính phí $0,96 và đầu ra $1,50 — khoảng $2,46 mỗi phiên. Trên GPT-6.1 Sol, cùng phiên đó tính $0,48 cho các lượt đọc được lưu đệm và vẫn $1,50 cho đầu ra: khoảng $1,98. Mỗi phiên, chênh lệch là 48 xu, không phải là điều đáng để ra quyết định. Nhân lên trên một trăm nghìn phiên mỗi tháng thì thành $48.000 — mà đó thì lại là điều đáng để ra quyết định.

Hai lưu ý sau giữ cho điều đó vẫn trung thực. Các lượt đọc được cache chỉ được tính theo mức giá cache khi tiền tố thực sự trúng cache, nên khoản tiết kiệm thực tế của bạn là tỷ lệ trúng cache nhân với chênh lệch, chứ không phải bản thân chênh lệch. Và tiền tố phải dưới 272,000 token thì các mức giá tiêu chuẩn mới được áp dụng: vượt qua ranh giới đó, toàn bộ yêu cầu sẽ được định giá lại ở mức 2× đối với đầu vào và cache và 1.5× đối với đầu ra, điều có thể nhấn chìm khoản tiết kiệm 10 xu trên tiền tố. Các phiên ngữ cảnh dài là những trường hợp mà phép tính cache ít có khả năng giống như trong tờ quảng cáo nhất.

Khoảng cách benchmark là có thật, và nó đến từ một nơi.

Bài đăng ra mắt của OpenAI đặc biệt cụ thể về các đánh giá của mình, đó là một điểm có lợi, và mỗi một con số trong đó đều là việc nhà cung cấp tự chấm điểm mô hình của chính họ, đó là điểm bất lợi. Xu hướng xuyên suốt chúng rất nhất quán: phép so sánh được lan truyền luôn là với GPT-6 Astra, và so sánh với Astra luôn là so sánh chi phí. Trên DeepSWE v1.1, tuyên bố là ngang bằng Astra với chi phí chỉ khoảng một phần năm. Trên GDP.pdf, tiệm cận mức tiên tiến nhất của Astra với chi phí mỗi tác vụ chỉ khoảng một phần năm. Trên OSWorld 2.0, cách Astra trong vòng 2,1 điểm với chi phí mỗi tác vụ chỉ khoảng một phần bảy. Về tính xác thực, cách Astra trong vòng 1,9 điểm với chi phí mỗi tác vụ chưa đến một phần năm. Đó không phải là sự ngẫu nhiên khi soạn thảo; đó là luận đề của sản phẩm, và là luận đề về giá, không phải về vị thế dẫn đầu năng lực.

Điểm duy nhất OpenAI đi ngược lại cách định vị của chính mình là điều đáng ghi nhận: trên Terminal-Bench Science 0.1, họ nói thẳng rằng GPT-6 Astra vẫn giữ điểm số cao nhất trong số các mô hình được thử nghiệm ở mức 68,1% và nên được dùng cho những nghiên cứu khoa học khó nhất. Một bài đăng ra mắt cho bạn biết khi nào nên mua người anh em đắt tiền hơn là một bài đăng ra mắt có chút kỷ luật.

Riêng với GPT-6 Sol, trạng thái trung thực của việc so sánh là thế này — không có điểm số độc lập nào cho cả hai mô hình ở cấu hình này. Artificial Analysis có đánh giá đầy đủ về GPT-6 Sol ở mức nỗ lực suy luận tối đa: chỉ số Intelligence Index là 48, 1,06 USD cho mỗi tác vụ chỉ số, 77 triệu token đầu ra được tạo ra so với mức trung vị trên bảng là 88 triệu, và Coding Agent Index là 57 với 2,99 USD mỗi tác vụ. Tính đến ngày 30 tháng 9, nó hoàn toàn không có mục GPT-6.1 Sol; slug của mô hình trả về lỗi 404 và chuỗi đó không xuất hiện trên bảng xếp hạng trực tiếp. Vì vậy, so sánh duy nhất đã được đo lường, từ bên thứ ba, hiện có hôm nay là giữa GPT-6 Sol và các mô hình của những phòng thí nghiệm khác — không phải giữa GPT-6 Sol và phiên bản kế nhiệm của chính nó. Bất kỳ ai đang cho bạn xem biểu đồ 6.1 so với 6.0 ngay lúc này đều đang cho bạn xem slide của OpenAI.

Việc di chuyển chỉ là một thay đổi chuỗi, trừ những chỗ nó không phải vậy.

Hướng dẫn di chuyển của chính OpenAI cho dòng GPT-6 đáng để đọc trước khi bạn đổi định danh, vì có hai mục trong đó sẽ làm hỏng code đang chạy. Mục thứ nhất là thang suy luận: nếu bất kỳ yêu cầu nào gửi reasoning_effort: "none", GPT-6.1 Sol sẽ từ chối nó, và cách khắc phục được tài liệu nêu là bắt đầu từ low rồi so sánh trên các tác vụ đại diện thay vì giả định rằng thiết lập thấp nhất là tương đương. Những quy trình từng dùng none làm mốc độ trễ cơ sở sẽ mất mốc đó. Mục thứ hai là gọi công cụ: GPT-6.1 Sol hỗ trợ Chat Completions nhưng không hỗ trợ gọi công cụ qua đó — công cụ yêu cầu Responses API. Nếu stack của bạn gọi hàm trên /v1/chat/completions, thì bạn không phải đang thay một chuỗi, mà là đang port một endpoint. Chỉ dẫn của chính nhà cung cấp dành cho các nhà phát triển đã dùng GPT-6 Sol là hãy xem lại hướng dẫn đó trước khi chuyển đổi, một tín hiệu hợp lý cho thấy đây không phải là bản làm mới cắm-là-chạy như khoảng cách một tuần ngụ ý.

Các tham số còn lại hoạt động như sau: mức độ suy luận, đầu ra có cấu trúc, truyền phát, bộ nhớ đệm prompt và bộ công cụ đều được giữ nguyên, và cùng một quy tắc định giá lại 272K áp dụng giống hệt cho cả hai mô hình. Đặt model thành gpt-6.1-sol, giữ nguyên cài đặt effort của bạn ở nơi nó được hỗ trợ, và xóa temperature, top_p và top_logprobs bất cứ khi nào effort không phải là none — cái cuối cùng áp dụng cho cả hai mô hình và là nguyên nhân phổ biến gây ra lỗi 400 sau bất kỳ đợt chuyển đổi mô hình suy luận nào.

Di chuyển mà không đặt cược một lộ trình production vào nó.

A screenshot of the OrcaRouter model page for GPT-6 Sol (openai/gpt-6-sol) showing the header 'by OpenAI - 2026-09-22', capability tags for vision, tools, JSON and reasoning, a 1,050,000-token context window with 128,000 maximum output tokens, a standard tier reading $2.00 input and $10.00 output per million tokens with $0.20 cached input, and a long-prompt tier reading $4.00 input and $15.00 output.

Cuộc di trú thực tế không phải là một lần cắt chuyển hoàn toàn, mà là một shadow run: gửi một phần lưu lượng production đến định danh mới, giữ định danh cũ làm đường trả lời, và so sánh trên chính các tác vụ của bạn. Đó là một bài toán định tuyến, và đây chính là chỗ mà nền tảng bạn gọi qua làm thay đổi hình dạng của công việc. OrcaRouter phục vụ GPT-6 Sol ngay hôm nay với đúng giá niêm yết của chính OpenAI, không markup — bảng giá $2.00 / $0.20 / $10.00, bao gồm cả quy tắc định giá lại 272K — nên nhánh cơ sở của phép so sánh đang chạy trực tiếp trên cùng một key như mọi thứ khác, và nhánh 6.1 có thể được thêm vào tập route ngay khi nó có thể gọi được, mà không cần hợp đồng thứ hai hay SDK thứ hai. Cho đến lúc đó, vị thế trung thực là GPT-6 Sol là model hiện có thể gọi, và điều đó đáng được nói thẳng ra thay vì ngụ ý điều ngược lại: openai/gpt-6.1-sol trả về "model not found" trên danh mục endpoint công khai của chúng tôi ngay hôm nay. Tự động chuyển đổi dự phòng chính là thứ khiến shadow run trở nên an toàn khi nó thực sự đến — nếu route mới gặp lỗi, yêu cầu sẽ hoàn tất trên route cũ và bạn phát hiện ra điều đó từ log thay vì từ người dùng của mình.

Ai nên chuyển ngay: những nhóm mà chi phí bị chi phối bởi đầu vào được cache trong các phiên agent dài, và những nhóm mà quy trình làm việc đã dùng Responses API và không bao giờ gửi không có. Với họ, đây gần như là một bản nâng cấp miễn phí — nhà cung cấp báo cáo những cải thiện về năng lực, tỷ lệ cache giảm một nửa, và việc di chuyển chỉ là một chuỗi. Ai nên chờ: những nhóm có không có trong một đường dẫn quan trọng về độ trễ, những nhóm mà việc gọi công cụ chạy qua Chat Completions, và bất kỳ ai cần một con số từ bên ngoài OpenAI trước khi cam kết. Với nhóm cuối cùng đó, thời gian chờ không có ngày kết thúc nào được công bố, và điều hợp lý nên làm trong khoảng thời gian đó là xây dựng bộ đánh giá mà việc so sánh sẽ cần — bởi vì khi điểm số độc lập xuất hiện, nó sẽ dành cho lưu lượng của người khác.

A generated summary card titled 'What changed in one week' with five rows reading 'Cached input: $0.20 to $0.10 per 1M', 'DeepSWE v1.1: +6.4 points, vendor-reported', 'Terminal-Bench Science: more than doubled, vendor-reported', 'Context window: unchanged at 1,050,000', 'Input and output price: unchanged at $2.00 / $10.00', and a footer reading 'Vendor-reported figures only; no independent evaluation of GPT-6.1 Sol existed as of September 30, 2026.'

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày