
GPT-6 Sol vs Qwen3.8-Max: Ranh giới duy nhất mà mô hình đóng không thể cạnh tranh
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Gần như mọi so sánh giữa GPT-6 Sol và Qwen3.8-Max sẽ được quyết định bởi chi phí, và gần như tất cả chúng đều sẽ tính sai chi phí theo cùng một hướng. Qwen3.8-Max, sản phẩm chủ lực do nhà cung cấp vận hành, đã được định giá 2,00 USD mỗi triệu token đầu vào và 6,00 USD mỗi triệu token đầu ra kể từ ngày ra mắt chính thức 3 tháng 8 năm 2026, với bản chụp có ghi ngày Qwen3.8-Max-0902 ra mắt vào ngày 2 tháng 9. GPT-6 Sol đạt trạng thái sẵn sàng chung vào ngày 22 tháng 9 năm 2026 với mức 2,00 USD đầu vào và 10,00 USD đầu ra. Giá đầu vào giống hệt nhau, và đầu ra rẻ hơn 40% theo bảng giá Qwen3.8-Max — nhưng trên bộ đánh giá độc lập, chi phí để hoàn thành một tác vụ lại cao hơn khoảng năm lần.
Nhưng có một khác biệt thứ hai, rõ ràng hơn mà lập luận về chi phí cứ chôn vùi, và chính nó mới là thứ thực sự quyết định một số khối lượng công việc. Qwen3.8-Max chấp nhận video. GPT-6 Sol thì không. Đó không phải là một dòng về giá hay một dòng về điểm chuẩn; đó là một năng lực mà một trong hai mô hình này có và mô hình kia không thể tiệm cận, và đó là phần duy nhất của cuộc so tài này mà mọi nỗ lực tối ưu hiệu quả token đều không thể khắc phục.

Hai mẫu flagship, hai kiểu dáng khác biệt
Qwen3.8-Max là một mô hình hỗn hợp chuyên gia thưa (sparse mixture-of-experts) với 2,4 nghìn tỷ tham số, trong đó khoảng 95 tỷ tham số hoạt động cho mỗi truy vấn — mô hình được lưu trữ lớn thứ hai đang vận hành, chỉ sau Kimi K3. Cửa sổ ngữ cảnh của nó là một triệu token với giới hạn đầu ra 131.072 token, các phương thức đầu vào gồm văn bản, hình ảnh và video, và nó hỗ trợ mức độ suy luận từ thấp, trung bình đến cực cao cùng với đầu ra có cấu trúc và tính năng gọi công cụ. Mô hình chủ lực dạng lưu trữ này không phải là trọng số mở; sản phẩm cùng thế hệ có thể tải xuống là một bản phát hành riêng với những hạn chế riêng của nó.
GPT-6 Sol nhận đầu vào là văn bản và hình ảnh, xuất ra văn bản. Cửa sổ của nó là 1.050.000 token với đầu vào tối đa 922.000 token và giới hạn đầu ra 128.000 token, có mức giá cố định là $2.00 và $10.00 với đọc từ bộ nhớ đệm $0.20 và ghi vào bộ nhớ đệm $2.50, định giá lại toàn bộ yêu cầu trên 272.000 token đầu vào thành $4.00 và $15.00. Nó là mô hình đóng, chỉ có một định danh, và OpenAI đã mô tả các mức giá này là vĩnh viễn thay vì mang tính khuyến mại.
Các con số về cửa sổ nằm trong khoảng chênh nhau khoảng 7%, và các mức trần đầu ra cũng nằm trong cùng một dải. Danh sách mô thức là khoảng trống cấu trúc duy nhất — và nó chỉ chạy theo một chiều.
Từng dòng một
• Đầu vào — GPT-6 Sol 2,00 đô la mỗi triệu token so với Qwen3.8-Max 2,00 đô la mỗi triệu token; con số được nhấn mạnh là hoàn toàn giống nhau
• Đầu ra — GPT-6 Sol 10,00 USD mỗi triệu token so với Qwen3.8-Max 6,00 USD mỗi triệu token; mức giá của Alibaba thấp hơn 40%
• Đầu vào được lưu vào bộ nhớ đệm — GPT-6 Sol 0,20 USD mỗi triệu token so với Qwen3.8-Max 0,25 USD mỗi triệu token cho các lượt đọc bộ nhớ đệm ngầm, với một lượt đọc bộ nhớ đệm tường minh ở mức 0,17 USD và một lượt ghi bộ nhớ đệm tường minh ở mức 2,50 USD
• Cửa sổ ngữ cảnh — GPT-6 Sol 1.050.000 token so với Qwen3.8-Max 1.000.000 token
• Đầu ra tối đa — GPT-6 Sol 128,000 token so với Qwen3.8-Max 131,072 token
• Các phương thức đầu vào — GPT-6 Sol: văn bản và hình ảnh so với Qwen3.8-Max: văn bản, hình ảnh và video
• Xử lý ngữ cảnh dài — GPT-6 Sol định giá lại toàn bộ yêu cầu trên 272.000 token đầu vào ở mức 2× đối với giá đầu vào và giá bộ nhớ đệm, cùng 1,5× đối với đầu ra, so với Qwen3.8-Max với một mức phẳng xuyên suốt toàn bộ cửa sổ, đây là điểm duy nhất mà bảng giá của Qwen có lợi thế về mặt cấu trúc chứ không chỉ rẻ hơn một chút
• Mức độ nỗ lực suy luận — GPT-6 Sol: không, thấp, trung bình (mặc định), cao, xhigh, tối đa so với Qwen3.8-Max: thấp, trung bình và cực cao
• Thời điểm cắt kiến thức — GPT-6 Sol 20 tháng 4 năm 2026 so với Qwen3.8-Max không được công bố dưới dạng một mốc ngày cụ thể
• Bản chụp nhanh có ghi ngày — GPT-6 Sol chỉ một định danh duy nhất luôn thay đổi, so với Qwen3.8-Max-0902 có sẵn dưới dạng bản sửa đổi được ghim cố định ngày 2 tháng 9 năm 2026 với cùng mức giá
Dòng ngữ cảnh dài đáng được chú ý nhiều hơn mức nó thường nhận được. Phụ phí của GPT-6 Sol là một bước được áp dụng cho toàn bộ yêu cầu, nên một lượt chạy agent 900.000 token bị tính ở mức $4,00 và $15,00 trên mỗi token. Qwen3.8-Max tính một mức duy nhất xuyên suốt toàn bộ cửa sổ. Với một khối lượng công việc nằm trên 272.000 token, hai bảng giá không còn so sánh được với nhau nữa — mô hình rẻ hơn trên tiêu đề lại là mô hình đắt hơn với khoảng cách lớn, và hướng của khoảng cách phụ thuộc hoàn toàn vào việc ngữ cảnh của bạn nằm ở đâu.

Bảng giá nói rẻ hơn 40%. Harness nói hóa đơn gấp năm lần.
Artificial Analysis đã đo Qwen3.8-Max-0902 đạt điểm Intelligence Index là 45, với chi phí 5,41 USD cho mỗi tác vụ index hoàn thành, sau khi tạo ra 190 triệu token đầu ra trong toàn bộ lần chạy. Phần tóm tắt của nó mô tả mô hình là "chậm một cách đáng chú ý và rất dài dòng." GPT-6 Sol đạt 48 điểm với 1,06 USD mỗi tác vụ trên 77 triệu token đầu ra.
Đọc ba cặp đó cùng nhau, và hình dạng của cuộc so tài hiện ra. Qwen kém ba điểm chỉ số, tạo ra lượng token gấp hai lần rưỡi, và có chi phí cho mỗi tác vụ hoàn thành cao gấp khoảng năm lần — trên một bảng giá mà đầu ra của nó lại rẻ hơn 40%. Cơ chế không hề khó thấy. Với 6,00 đô la mỗi triệu token đầu ra, 190 triệu token tốn 1,14 đô la cho mỗi lần chạy chỉ số, chỉ tính riêng đầu ra trước khi tính đầu vào; ở mức 10,00 đô la mỗi triệu, 77 triệu token của Sol tốn 0,77 đô la. Mức giá rẻ hơn đang mua nhiều token hơn, chứ không phải một hóa đơn nhỏ hơn.
Đây là cùng một kiểu mẫu xuất hiện xuyên suốt nhóm tháng Chín, và đáng được nêu ra như một quy luật thay vì một dữ kiện về hai mô hình này: trên bảng giá theo token, mức chiết khấu 40% cho đầu ra chẳng có giá trị gì nếu mô hình phát ra số token gấp hai lần rưỡi. Chi phí cho mỗi tác vụ hoàn thành là con số duy nhất còn trụ lại.
Những gì Alibaba đã công bố, và vấn đề thiết lập mức độ nỗ lực
Bảng benchmark của chính Alibaba là bảng dài nhất trong so sánh này và cũng khó so sánh nhất. Các số liệu do nhà cung cấp báo cáo đặt Qwen3.8-Max dẫn đầu ở PaperBench và IFBench trong khi xếp sau ở SWE-bench Pro và Humanity's Last Exam, với một thang mức nỗ lực suy luận — thấp, trung bình, cực cao — không có ánh xạ trực tiếp sang thang sáu mức của OpenAI. Một điểm được công bố ở mức cực cao không phải là cùng một sản phẩm với một điểm được công bố ở mức trung bình, và cả hai nhà cung cấp đều không ghi rõ mức nào đã tạo ra một con số nhất định trên biểu đồ so sánh.
Đó là lý do thẳng thắn để không dựa vào bảng của bất kỳ nhà cung cấp nào trong hai nhà cung cấp ở đây. Các con số của Alibaba được chạy trên harness của Alibaba ở thiết lập mức nỗ lực của Alibaba; còn của OpenAI được chạy trên của OpenAI. Các số liệu của Artificial Analysis tồn tại chính xác là vì cả hai bộ số liệu đó đều không thể dùng để so sánh trực tiếp, và chúng chính là những số liệu được dùng ở trên.
Khả năng tái lập là một tính năng thực sự, và nó có giá bằng không
Bản snapshot gắn ngày là dòng bị xem nhẹ nhất trong phần so sánh này. Qwen3.8-Max-0902 là một bản sửa đổi được ghim ngày 2 tháng 9 năm 2026, mà theo Alibaba, có cùng năng lực và mức giá như mô hình cơ sở. Ghim nó lại nghĩa là mô hình đứng sau endpoint của bạn sẽ không thay đổi ngay dưới chân bạn chỉ trong khoảng từ thứ Ba đến thứ Năm.
GPT-6 Sol không có thứ tương đương. Nó là một mã định danh cuốn chiếu duy nhất — cùng một trang mô hình chỉ mang một bản chụp mặc định và không có các biến thể gắn ngày — nghĩa là thứ bạn chạy benchmark vào tháng 9 không được đảm bảo là thứ bạn đang gọi vào tháng 11. Với hầu hết các đội nhóm, thế là ổn. Nhưng với một pipeline phải tuân thủ quy định và phải chứng minh được cái gì đã tạo ra một đầu ra, đó là một khác biệt thực sự, và đó là thứ Alibaba cung cấp miễn phí trong khi OpenAI hoàn toàn không cung cấp.
Dòng video là thứ quyết định
Mọi thứ ở trên là sự so sánh. Phần này thì không. Nếu đầu vào của bạn bao gồm video — bản ghi màn hình, cảnh quay kiểm tra, bản ghi bài giảng, bất cứ thứ gì mà thông tin nằm trong chuyển động thay vì trong một khung hình tĩnh — Qwen3.8-Max tiếp nhận nó một cách nguyên bản và GPT-6 Sol thì không có đường nào để làm vậy. Bạn không thể dùng prompt để đi vòng qua một phương thức. Bạn không thể tiền xử lý một video thành ảnh rồi thu được điều tương tự, bởi vì thông tin thời gian mới là mấu chốt, và dù có bao nhiêu điểm chỉ số trên một benchmark văn bản đi chăng nữa cũng không thể thay thế cho đầu vào mà tác vụ của bạn thực sự yêu cầu.
Trường hợp ngược lại cũng đáng được nhắc đến, vì đó là nơi sự so sánh không còn mất cân đối nữa. Nếu đầu vào của bạn là văn bản và hình ảnh, Sol rẻ hơn trên mỗi tác vụ, dẫn trước bốn điểm trên bảng trung lập, và rẻ hơn khi đọc từ bộ nhớ đệm. Khả năng xử lý video không phải là yếu tố quyết định có lợi cho bạn; nó chỉ đơn giản là không được sử dụng.
Định tuyến một quyết định có hai câu trả lời riêng biệt

Đây là một cuộc đối đầu mà ở đó kiến trúc đúng đắn thực sự là hai mô hình, không phải một, và lý do là sự phân chia dựa trên phương thức đầu vào chứ không phải dựa trên độ khó. Một pipeline tiếp nhận video và suy luận trên văn bản cần cả hai, và quy tắc định tuyến là một thuộc tính của yêu cầu chứ không phải một phán đoán chủ quan.
Qwen3.8-Max có trong danh mục của OrcaRouter — bản chụp theo ngày qwen/qwen3.8-max-0902 có thể định tuyến ở mức giá niêm yết của Alibaba theo mô hình chuyển tiếp, nghĩa là một thay đổi giá của Alibaba sẽ có hiệu lực ngay phía chúng tôi trong cùng ngày thay vì sau khi nhà bán lại đàm phán lại. GPT-6 Sol hiện không có trong danh mục của chúng tôi tại thời điểm viết bài này và có thể truy cập thông qua API riêng của OpenAI. DSL định tuyến chính là mảnh ghép phù hợp cho trường hợp cụ thể này: một quy tắc gửi các yêu cầu có chứa video theo một hướng và mọi thứ khác theo hướng còn lại đúng chính là mục đích của nó, và tính năng chuyển đổi dự phòng tự động nghĩa là nhánh theo phương thức không trở thành điểm lỗi duy nhất.
Nơi mỗi cái chiến thắng
• Video vào, văn bản ra — Qwen3.8-Max, và không có cuộc so tài nào để diễn tả.
• Đầu vào là văn bản và hình ảnh, chi phí cho mỗi tác vụ hoàn thành làm thước đo — GPT-6 Sol, khoảng năm lần trên bộ kiểm thử độc lập.
• Công việc với tiền tố được lưu đệm — GPT-6 Sol. Lượt đọc được lưu đệm của nó rẻ hơn một chút và khối lượng token của nó chưa bằng một nửa.
• Các yêu cầu trên 272.000 token đầu vào — Qwen3.8-Max. Việc định giá lại toàn bộ yêu cầu của Sol là mức chênh lệch chi phí lớn nhất trong so sánh này, và nó không hiển thị trên các mức giá niêm yết.
• Ghim phiên bản có thể tái lập — Qwen3.8-Max-0902, vốn không tốn thêm chi phí và là bản sửa đổi được ghim duy nhất trong hai bản.
• Nếu bạn được cho xem một biểu đồ có Qwen dẫn trước trên SWE-bench Pro — hãy kiểm tra xem harness của ai đã tạo ra nó và ở thiết lập nỗ lực nào. Bảng xếp hạng độc lập cho thấy Qwen kém ba điểm trên chỉ số tổng hợp, và các bảng của nhà cung cấp không cùng thang đo với nhau.
So sánh trong bài viết này3
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
