
GPT-5 Codex vs GPT-5.6 Sol: Chuyên gia viết mã so với gã đầu tàu đã nuốt chửng nó
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0259Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0258Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0166Trí tuệ82Lập trình
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
Khi OpenAI phát hành dòng GPT-5.6 vào ngày 9 tháng 7 năm 2026, họ lặng lẽ khai tử ứng dụng Codex độc lập và gộp chế độ tác tử lập trình vào ChatGPT. Trang mô hình mà OpenAI viết cho GPT-5.6 Sol khi đó đọc giống như một bản mô tả công việc chép từ một chuyên gia viết mã — “suy luận đa bước sâu, kỹ thuật phần mềm quy mô lớn và quy trình tác tử dài hạn.” Vậy nên cuộc đối đầu giữa GPT-5 Codex và GPT-5.6 Sol không phải là một cuộc so kè thông số thông thường. Chính là chuyên gia đang tự hỏi liệu sản phẩm chủ lực vừa nuốt trọn phân khúc sản phẩm của chuyên gia có khiến bản thân chuyên gia trở nên thừa thãi hay không.
Câu trả lời ngắn gọn là không — nhưng lý do thú vị hơn nhiều so với việc "Codex vẫn còn tốt." GPT-5 Codex vẫn hoạt động trên API với giá 1,25 đô la cho mỗi triệu token đầu vào và 10 đô la cho mỗi triệu token đầu ra: một tác nhân kỹ thuật phần mềm được thiết kế chuyên dụng, tinh chỉnh cho CLI, IDE và tự động hóa GitHub, với các điểm số được đo lường độc lập. GPT-5.6 Sol có giá cao gấp bốn lần cho đầu vào và gấp ba lần cho đầu ra (5 đô la / 30 đô la) và là mô hình tổng quát hàng đầu mới nhất, với các con số lập trình cao hơn — nhưng hầu hết là do nhà cung cấp công bố. Điều mà sự kết hợp này thực sự xoay quanh là giá cả, ngữ cảnh và sự khác biệt giữa một chuyên gia và một mô hình đa năng lập trình tốt. Mọi thứ bên dưới được ghi rõ theo nguồn.
Mỗi mô hình là gì
GPT-5 Codex đúng như những gì trang mô hình của nó mô tả: "một phiên bản chuyên biệt của GPT-5 được tối ưu hóa cho các quy trình kỹ thuật phần mềm và lập trình." Được phát hành vào tháng 9 năm 2025, đây là mô hình API đứng sau tác nhân lập trình của OpenAI — tác nhân có thể xây dựng dự án từ đầu, triển khai tính năng mới, tái cấu trúc mã ở quy mô lớn, rà soát mã và lên kế hoạch thay đổi nhiều tệp với một núm điều chỉnh mức độ suy luận. Nó nhận đầu vào là văn bản và hình ảnh (ảnh chụp màn hình cho công việc giao diện người dùng), có ngữ cảnh 400K token, trần đầu ra 128K, và được thiết kế rõ ràng cho các ứng dụng lập trình tác nhân: CLI, tiện ích mở rộng IDE, GitHub và các tác vụ đám mây.
GPT-5.6 Sol là phiên bản cao cấp nhất của dòng GPT-5.6, được phát hành ngày 9 tháng 7 năm 2026 với mốc cắt kiến thức vào tháng 2 năm 2026. Đây là mô hình mà OpenAI giao cho những công việc tổng quát khó nhất: suy luận đa bước sâu, kỹ thuật phần mềm quy mô lớn, tác tử tầm nhìn dài hạn, sử dụng máy tính và chế độ suy luận "ultra" đa tác tử. Ngữ cảnh của nó là 1,05 triệu token — gấp 2,6 lần GPT-5 Codex — với cùng trần đầu ra 128K, đồng thời chấp nhận đầu vào văn bản, hình ảnh và tệp tin. Sol cũng chạy bên trong ChatGPT, nên khi OpenAI nhắc đến "Codex" theo nghĩa sản phẩm ngày nay, điều đó thường có nghĩa là Sol đang thực hiện công việc lập trình tác tử.
Giá: khoảng cách 4x / 3x thu hẹp nhưng không bao giờ khép lại
Các con số chủ chốt, cả hai đều tính theo giá niêm yết của nhà cung cấp: GPT-5 Codex ở mức $1.25 / $10 mỗi triệu token (đọc cache $0.125); GPT-5.6 Sol ở mức $5 / $30 (đọc cache $0.50). Tức là giá đầu vào gấp bốn lần và giá đầu ra gấp ba lần. Trong một ngày viết mã thông thường với mười triệu token, chia theo tỷ lệ 75/25 đầu vào/đầu ra, GPT-5 Codex tính phí khoảng $34; GPT-5.6 Sol tính phí khoảng $112. Khoảng cách này không phải chỉ nằm trên lý thuyết.
Hai điều thu hẹp khoảng cách này. Thứ nhất, bộ nhớ đệm: cả hai mô hình đều định giá đầu vào được lưu trong bộ nhớ đệm thấp hơn nhiều so với đầu vào mới, và các vòng lặp agent liên tục đọc lại cùng một ngữ cảnh kho lưu trữ, do đó một phần lớn token có thể sử dụng mức giá rẻ. Thứ hai, hiệu quả: OpenAI tuyên bố thế hệ 5.6 hoàn thành các tác vụ agent với số token đầu ra ít hơn khoảng 54% so với thế hệ trước. Nếu Sol chỉ cần một nửa số token đầu ra cho cùng một công việc, chênh lệch trên mỗi tác vụ sẽ giảm từ khoảng 3,3 lần xuống còn khoảng 2 lần — một khoản tiết kiệm thực sự, nhưng không xóa bỏ được chênh lệch giá đầu vào gấp 4 lần, và đây là tuyên bố về hiệu quả do OpenAI đưa ra chứ không phải được đo lường độc lập.
Sol cũng có mức giá đầu vào theo bậc: trên trang mô hình của OrcaRouter, mức cơ bản $5 / $30 áp dụng cho các yêu cầu lên đến 32K token đầu vào, và các yêu cầu lớn hơn sẽ bị tính ở bậc cao hơn là $10 / $45. Đó chính là khoản thuế ngữ cảnh dài — chính xác là loại yêu cầu mà một tác nhân kho mã nguồn lớn tạo ra. Vì vậy, so sánh giá thực tế thậm chí còn phụ thuộc vào khối lượng công việc nhiều hơn so với con số chênh lệch 3-4 lần ở tiêu đề.

Bối cảnh và cách bạn gọi chúng
Khoảng cách ngữ cảnh là ranh giới thực sự thứ hai. 400K token bao phủ một codebase đáng kể, và Codex, với tư cách là một công cụ chuyên biệt, được xây dựng để hoạt động hiệu quả trong phạm vi đó. Nhưng ngữ cảnh Sol 1,05M token thay đổi những gì bạn có thể đưa cho một mô hình: toàn bộ monorepo, các trace dài của agent, một wiki onboarding cùng với mã nguồn. Đối với các nhóm đưa toàn bộ kho lưu trữ vào một yêu cầu duy nhất, cửa sổ lớn hơn chính là sự khác biệt giữa "mô hình có thể thấy các tệp liên quan" và "mô hình có thể thấy các tệp liên quan cộng với mọi thứ import chúng". Nó cũng là sự khác biệt giữa một token đầu vào $1,25 và một token $5, đó là lý do tại sao quyết định về ngữ cảnh cũng là quyết định về chi phí.
Cả hai mô hình đều sử dụng cùng hai dạng API — OpenAI Chat Completions và API Responses — và cả hai đều hỗ trợ gọi công cụ/hàm và đầu ra có cấu trúc. Trên OrcaRouter, cả hai đều nằm sau một endpoint tương thích OpenAI, vì vậy việc chuyển đổi giữa chúng chỉ là thay đổi tên mô hình, không phải thay đổi tích hợp.
Nơi các điểm chuẩn khác nhau — và lưu ý về sự trung thực
Điều thú vị là hai mô hình hầu như không dùng chung một chuẩn đánh giá nào. GPT-5 Codex có điểm số thực sự độc lập: Artificial Analysis đo lường nó ở chỉ số trí tuệ 36,1 và chỉ số mã hóa 38,9, với chỉ số toán học 98,7, LiveCodeBench ở mức 84,0 và SWE-Bench Verified ở mức 74,5 phần trăm. Các con số chủ lực của GPT-5.6 Sol — Terminal-Bench 2.1 ở mức 88,8, chỉ số Coding Agent Index của Artificial Analysis ở mức 80 trong chế độ suy luận tối đa, Agents' Last Exam ở mức 53,6 — là những con số mà OpenAI công bố khi ra mắt và chưa được nhà đánh giá độc lập nào tái lập. Cuộc so tài "88,8 so với 84,0" không công bằng, vì một con số được kiểm toán còn con số kia chỉ là tuyên bố của nhà cung cấp. Tóm tắt một cách trung thực: Sol mới hơn một thế hệ và trần năng lực của nó rõ ràng cao hơn, nhưng điểm mã hóa duy nhất được phòng thí nghiệm độc lập xác minh trong số điểm của hai mô hình lại thuộc về chuyên gia rẻ hơn, cũ hơn.

Cũng có một benchmark mà chính OpenAI cũng phản đối. Trên SWE-Bench Pro, GPT-5.6 Sol đạt 64,6% trong khi Claude Fable 5 dẫn đầu với 80 — và OpenAI đã công khai đặt câu hỏi về tính hợp lệ của benchmark này. Ở đó, tín hiệu thú vị không phải là điểm số mà là việc một nhà cung cấp hàng đầu giờ đây cho rằng điểm thấp của chính mình là lỗi của benchmark. Đối với một nhóm lập trình, đó là lời nhắc nhở nên thử nghiệm mô hình trên chính kho lưu trữ của bạn trước khi tin vào bất kỳ bảng xếp hạng nào, kể cả của chúng tôi.
Speed: lời cảnh báo về giao thông
Trên dữ liệu đo từ xa bảy ngày của OrcaRouter, GPT-5.6 Sol cho thấy thời gian trung vị đến token đầu tiên là 3,82 giây và khoảng 465 token đầu ra mỗi giây, trên 39 triệu token lưu lượng. Trang của GPT-5 Codex vẫn đang "thu thập" dữ liệu đo từ xa — lưu lượng của nó qua bộ định tuyến quá mỏng đến mức chưa có gì để tính trung bình. Lưu lượng mỏng đó tự nó đã là thông tin: trong mắt thị trường, các API dành cho tác tử lập trình đã chuyển sang các mô hình mới hơn. Điều đó không có nghĩa GPT-5 Codex chậm hay bị lỗi; nó có nghĩa là câu hỏi "cái nào nhanh hơn" không thể trả lời được từ dữ liệu bộ định tuyến cho đến khi có ai đó chạy khối lượng thực sự qua nó.
Bạn nên chọn cái nào?
Chọn GPT-5 Codex nếu…
Khối lượng công việc của bạn thực sự có hình dạng lập trình: bạn điều hành một tác tử chỉnh sửa mã, xem xét pull request, tái cấu trúc, viết test, và hoạt động trong môi trường IDE hoặc CLI. Bạn muốn sự tập trung của chuyên gia, mức chi phí đầu vào rẻ hơn bốn lần, và điểm số năng lực lập trình được xác minh độc lập duy nhất trong cuộc đối đầu này. GPT-5 Codex cũng là lựa chọn đúng nếu bạn muốn ngữ nghĩa tác tử lập trình của OpenAI — núm chỉnh mức suy luận, vòng lặp sử dụng công cụ — mà không phải trả mức giá cao cấp cho năng lực tổng quát bạn sẽ không dùng đến.
Chọn GPT-5.6 Sol nếu…
Công việc của bạn kết hợp lập trình với lý luận tổng quát phức tạp, tác nhân dài hạn, thao tác trên máy tính, hoặc đầu vào nặng về tệp tin — hoặc đơn giản bạn muốn một mô hình đầu bảng cho mọi thứ. Ngữ cảnh 1,05M, chế độ cực đa tác nhân, quá trình huấn luyện mới hơn, và tích hợp sản phẩm ChatGPT và Codex đều nghiêng về Sol. Chỉ số lập trình của nó cao hơn trên lý thuyết, và trên một điểm chuẩn mà nhà cung cấp tin tưởng, đây là tác nhân lập trình tốt nhất mà OpenAI từng phát hành. Bạn đang trả gấp ba đến bốn lần mỗi token cho bề rộng đó; câu chuyện hiệu quả token thu hẹp khoảng cách trong các tác vụ mà Sol thực sự giành chiến thắng.
Câu trả lời thường là cả hai — định tuyến theo nhiệm vụ
{{1}}Vì cả hai đều đang có mặt trên OrcaRouter với mức chênh lệch 0%, cấu hình mạnh nhất không phải là một sự lựa chọn gì cả.{{/1}} {{2}}Hãy hướng khối lượng tác vụ lập trình vào GPT-5 Codex — chuyên gia với mức giá $1.25 / $10 — và chỉ chuyển những tác vụ cần sức mạnh toàn diện của flagship lên GPT-5.6 Sol ở mức $5 / $30.{{/2}} {{3}}Một khóa API, một endpoint tương thích OpenAI, chỉ cần đổi tên model khi định tuyến, và tự động chuyển đổi dự phòng nếu một nhà cung cấp gặp trục trặc.{{/3}} {{4}}Cơ chế chuyển tiếp giá đóng vai trò đặc biệt ở đây: mức $1.25 / $10 và $5 / $30 bạn dự toán chính là giá niêm yết của nhà cung cấp, vì vậy nếu OpenAI giảm giá trong tương lai, mức giá mới sẽ có hiệu lực trên endpoint của chúng tôi ngay trong ngày công bố, và logic định tuyến của bạn không cần thay đổi.{{/4}}

Những câu hỏi mà điều này đặt ra
GPT-5.6 Sol có thay thế GPT-5 Codex không?
Trong sản phẩm thì có — ứng dụng Codex độc lập đã được hợp nhất vào ChatGPT tại bản phát hành 5.6, và Sol là engine chạy chế độ coding-agent ở đó. Trong API thì không: GPT-5 Codex vẫn là một mô hình trực tiếp, được phục vụ với giá riêng, và nhiều pipeline agent vẫn chạy nó vì nó được thiết kế cho mục đích cụ thể và rẻ.
Liệu khả năng viết mã của Sol có thực sự tốt hơn Codex không?
Về những con số OpenAI công bố, đúng vậy — Terminal-Bench 2.1 đạt 88.8 so với LiveCodeBench của Codex ở mức 84.0 — nhưng đó là những benchmark khác nhau, và số liệu của Sol do nhà cung cấp báo cáo trong khi số liệu của Codex được đo lường độc lập. Hãy thử nghiệm trên repository của riêng bạn; đó mới là điểm số duy nhất đáng giá.
Tại sao vẫn còn ai chạy GPT-5 Codex?
Giá cả và độ phù hợp. Với mức giá đầu vào chỉ bằng một phần tư của Sol, một pipeline tác nhân mã hóa chuyên dụng không bao giờ cần đến sự bao quát của flagship đa năng sẽ tiết kiệm được tiền thật trên mỗi triệu token, và sự tập trung của chuyên gia này có nghĩa là cần ít định hình prompt hơn để giữ nó vào công việc viết mã.
Lý do cuộc so kè này đáng cân nhắc là OpenAI đã nhúng câu trả lời ngay vào sản phẩm của chính mình. Công ty đã dành một năm để bán một sản phẩm chuyên viết mã, sau đó gộp nó vào một bản chủ lực đa năng viết mã đủ tốt để giành lấy vương miện của chuyên gia — trong khi vẫn để sản phẩm chuyên gia đó trên API với mức giá chỉ bằng một phần nhỏ. Đó không phải là một thủ thuật; đó là mức giá sàn cho những ai muốn "có tác nhân viết mã mà không phải trả tiền cho bản chủ lực." GPT-5 Codex là chuyên gia rẻ, tập trung, được đo lường độc lập. GPT-5.6 Sol là bản chủ lực mới hơn, rộng hơn, đắt hơn mà những tuyên bố về khả năng viết mã của nó bạn nên tự kiểm chứng trên công việc của mình. Hầu hết các đội sản xuất sẽ thấy câu trả lời trung thực là cả hai — và với cả hai trên cùng một điểm cuối truyền thẳng, việc định tuyến giữa chúng chỉ là cấu hình, không phải di trú.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
