
GPT-6 vs Qwen 3.8 Max: Một bên nhận video, một bên viết dài hơn
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
GPT-6 Sol và Qwen3.8 Max thu cùng một mức giá đầu vào — 2,00 đô la cho mỗi triệu token, cả hai đều vậy — rồi sau đó tách hướng ở hai khía cạnh mà chỉ riêng bảng giá sẽ không làm nổi bật. Qwen3.8 Max, được cung cấp ở trạng thái khả dụng chung từ ngày 3 tháng 8 năm 2026, là mô hình duy nhất trong hai mô hình chấp nhận video: các phương thức đầu vào của nó là văn bản, hình ảnh và video, trong khi GPT-6 Sol nhận văn bản, hình ảnh và tệp. GPT-6 Sol, được nhà cung cấp phát hành vào ngày 22 tháng 9 năm 2026, là mô hình duy nhất trong hai có giới hạn đầu ra được công bố, 128.000 token, và cũng là mô hình duy nhất có một bề mặt dành cho người tiêu dùng đằng sau — đợt triển khai ChatGPT ngày 7 tháng 10 đã đưa mô hình này đến với hơn 1,2 tỷ người dùng hàng tuần.
Vậy nên câu hỏi phân loại không phải là cái nào mạnh hơn. Mà là liệu đầu vào của bạn có phải là video hay không, và liệu đầu ra của bạn có dài hay không.
Video là ngã rẽ đầu tiên
Hầu hết các so sánh mô hình đều quy về giá và điểm chuẩn, và lần này có một khác biệt mang tính cấu trúc cứng khiến những yếu tố đó trở thành thứ yếu. Nếu pipeline của bạn tiếp nhận video — cảnh quay giám sát, bản ghi cuộc họp, tư liệu thể thao hay bài giảng, thước phim demo sản phẩm — Qwen3.8 Max có thể nhận clip ngay trong yêu cầu. Thẻ của nó liệt kê video như một phương thức đầu vào song song với văn bản và hình ảnh, trong cửa sổ lên tới một triệu token, mà với video thì điều đó nghĩa là lấy mẫu khung hình cộng với bản chép lời trong một lần gọi duy nhất thay vì một công đoạn trích xuất riêng. GPT-6 Sol thì không. Các phương thức của nó là văn bản, hình ảnh và tệp; không có đầu vào video trên thẻ, và không lượng kỹ thuật prompt nào có thể thay thế được điều đó.
Dòng duy nhất đó quyết định danh sách rút gọn cho một pipeline video, và nó không hiển thị trên bảng giá. Nơi hai mô hình thực sự có thể thay thế cho nhau là công việc văn bản và hình ảnh, và đó là nơi áp dụng phần so sánh giá và điểm chuẩn bên dưới.
Một lưu ý thẳng thắn về tuyên bố video: modality thì được ghi trong tài liệu, nhưng schema thì không. Mục catalogue của cả hai nhà cung cấp đều không nêu rõ giới hạn về độ phân giải, tốc độ khung hình hay độ dài clip, nên "hỗ trợ video" có nghĩa là kiểu đầu vào đó tồn tại, chứ không phải rằng bất kỳ clip cụ thể nào cũng sẽ được nạp vào ở chất lượng bạn cần. Hãy kiểm thử với chính tư liệu video của bạn trước khi xây dựng dựa trên đó.
Phía đầu ra chạy theo hướng ngược lại.
Đảo ngược yêu cầu lại thì lợi thế cũng đảo chiều. GPT-6 Sol công bố đầu ra tối đa 128.000 token mỗi phản hồi. Thẻ của Qwen3.8 Max công bố cửa sổ ngữ cảnh nhưng không có con số đầu ra tối đa, nên một hệ thống lập ngân sách dựa trên giới hạn đầu ra cứng không thể đọc được con số đó từ dữ liệu của nhà cung cấp — cũng là khoảng trống xuất hiện trên một số thẻ nền tảng lưu trữ và đáng được coi là chưa biết thay vì không giới hạn.
Điều được công bố là sự bất đối xứng về giá ở phía đầu ra, và nó ngược lại với câu chuyện của video. Qwen3.8 Max tính 6,00 đô la cho mỗi triệu token đầu ra so với 10,00 đô la của GPT-6 Sol — mức giảm giá 40% trên mỗi token mà mô hình viết ra. Một khối lượng công việc nặng về đầu ra, chẳng hạn như tạo văn bản dài hoặc tuần tự hóa một tạo tác có cấu trúc lớn, sẽ rẻ hơn đáng kể trên Qwen3.8 Max tính theo mỗi đơn vị công việc, và điều đó đúng bất kể giá đầu vào là giống hệt nhau.
Cũng cần lưu ý rằng thẻ của Qwen3.8 Max chỉ liệt kê một mức giá đầu vào duy nhất, không có bậc ngữ cảnh dài nào được ghi rõ, trong khi GPT-6 Sol định giá lại toàn bộ yêu cầu trên 272.000 token đầu vào thành $4.00 đầu vào và $15.00 đầu ra. Trang mô hình của OpenAI nêu rõ quy tắc: các lời nhắc vượt ngưỡng đó bị tính gấp 2 lần mức đầu vào và mức bộ nhớ đệm, cùng gấp 1,5 lần đầu ra cho toàn bộ yêu cầu. Với một lời nhắc vượt quá 272.000 token, mức đầu vào hiệu dụng của GPT-6 Sol tăng gấp đôi lên $4.00 trong khi Qwen3.8 Max giữ nguyên ở $2.00 — một lần nữa đảo ngược thế hòa nhau rõ ràng về đầu vào.
Hội đồng độc lập nói gì
Artificial Analysis có cả hai mô hình, và chỉ số tổng hợp cho thấy GPT-6 Sol dẫn trước trong khi một số bài kiểm tra riêng lẻ lại đi theo hướng ngược lại. Mọi số liệu dưới đây là của đơn vị đánh giá, không phải của nhà cung cấp.
• Chỉ số Trí tuệ: GPT-6 Sol 47,6, Qwen3.8 Max 45,4 — GPT-6 Sol dẫn trước khoảng hai điểm
• Chỉ số lập trình: Qwen3.8 Max 76,2 với thứ hạng trong top mười; hồ sơ lập trình của GPT-6 Sol tương đương nhưng mục của Qwen có thứ hạng cao hơn
• GPQA Diamond: Qwen3.8 Max 92,8%, chỉ số của GPT-6 Sol là cao hơn trong hai mô hình ở cùng nhóm bài kiểm tra
• Humanity's Last Exam: Qwen3.8 Max 43,1%, GPT-6 Sol 47,9%
• Khả năng ghi nhớ ngữ cảnh dài: Qwen3.8 Max 80,3%, GPT-6 Sol 83,7%
• SciCode: Qwen3.8 Max 52,1%, GPT-6 Sol 57,6%
• Sử dụng công cụ dạng tác tử: Qwen3.8 Max 88,8% trên terminal-bench v2.1 và 47,8% trên tau-banking, cả hai đều mạnh
Mô hình chung là GPT-6 Sol thắng các tổ hợp suy luận tổng quát và các bài kiểm tra khoa học cùng truy hồi, trong khi Qwen3.8 Max là mô hình viết mã và sử dụng công cụ sắc bén hơn. Có hai lưu ý, và chúng không phải để trang trí. Thứ nhất, các giá trị chỉ số này được đánh giá vào những ngày khác nhau, nên hai điểm chênh lệch giữa các lần sửa đổi nằm trong mức dao động mà một lần chạy lại tạo ra, chứ không phải một khoảng cách đã cố định. Thứ hai, các số liệu được công bố của Qwen3.8 Max là kết quả chạy của bên đánh giá trên mô hình được cung cấp qua endpoint của Alibaba, và nhà cung cấp cũng đã phát hành một snapshot gắn ngày, Qwen3.8 Max (0902), vào ngày 2 tháng 9 năm 2026 với cùng mức giá $2.00 / $6.00 — nếu bạn đang ghim một snapshot, hãy xác nhận bạn đang gọi bản nào trước khi trích dẫn điểm số.

Những gì được bổ sung trong đợt triển khai ngày 7 tháng 10 của OpenAI
Việc ChatGPT được phát hành là một dữ kiện về phân phối hơn là một dữ kiện về năng lực, nhưng nó thay đổi điều mà một độc giả muốn nói khi nhắc đến “GPT-6”. Vào ngày 7 tháng 10 năm 2026, OpenAI bắt đầu đưa GPT-6 vào ChatGPT trong năng lực Intelligent UI, với tab Chat được cung cấp cho Plus, Pro, Business và Enterprise trước, còn Free và Go theo sau từ ngày 8 tháng 10; khả năng cung cấp cho doanh nghiệp phụ thuộc vào cài đặt quản trị tại nơi làm việc. Các mô hình đằng sau Work và Codex được giữ nguyên.
Hai chi tiết quan trọng cho so sánh này. Trải nghiệm ChatGPT được vận hành bởi GPT-6 Sol cho các gói người dùng trả phí — vì vậy GPT-6 mà hơn một tỷ người gặp chính là mô hình bạn gọi qua API, không phải một checkpoint riêng. Và GPT-6 là một họ mô hình, không phải một mô hình đơn lẻ: GPT-6 Astra nằm trên Sol ở mức $10.00 / $50.00 và GPT-6 Luna nằm dưới ở mức $0.10 / $0.50. Khi một so sánh nêu tên “GPT-6” đối chiếu với Qwen3.8 Max mà không nói rõ là phiên bản nào, thường thì mặc định là đang so với Sol, và so với Astra khi muốn đưa ra trường hợp mạnh nhất. Việc nêu rõ phiên bản là khác biệt giữa một so sánh công bằng và một so sánh mang tính tu từ.
Chi phí, được đo theo hình dạng thay vì tỷ lệ
Vì mức giá đầu vào ngang nhau và mức giá đầu ra khác biệt, bên thắng phụ thuộc hoàn toàn vào tỷ lệ token đầu vào so với token đầu ra. Khi đối chiếu với mức giá đã công bố của từng nhà cung cấp, không tính đến caching:
• Phân tích video và bản chép lời (500K đầu vào, 6K đầu ra): Qwen3.8 Max ≈ $1.04, GPT-6 Sol không áp dụng — không có đầu vào video
• Phân tích tài liệu (250K đầu vào, 5K đầu ra): Qwen3.8 Max ≈ $0.53, GPT-6 Sol ≈ $0.55 trước khi ngưỡng 272K của nó được áp dụng, và cao hơn một khi toàn bộ yêu cầu được tính lại giá
• Tạo nội dung dài (40K đầu vào, 80K đầu ra): Qwen3.8 Max ≈ $0.56, GPT-6 Sol ≈ $0.88
• Vòng lặp tác tử cân bằng (60K đầu vào, 20K đầu ra): Qwen3.8 Max ≈ $0.24, GPT-6 Sol ≈ $0.32
Hình thái của kết quả vẫn ổn định: Qwen3.8 Max là mô hình rẻ hơn cho cùng một tổ hợp token, bởi vì mức giá đầu vào ngang nhau và giá đầu ra của nó thấp hơn. Lập luận phản bác của GPT-6 Sol hoàn toàn không nằm ở giá — mà là điểm tổng hợp về suy luận, sự kiểm chứng trên bề mặt người tiêu dùng, và một trần đầu ra được ghi nhận giúp việc lập ngân sách trở nên đơn giản.
Một lưu ý vận hành đáng nêu ra vì các thẻ model không đề cập điều đó. Được đo trên playground của OrcaRouter trong tuần đầu tiên của tháng 10 năm 2026, tuyến Qwen3.8 Max cho thấy độ trễ token đầu tiên trung vị khoảng 5.809 ms và khoảng 50 token đầu ra mỗi giây, với tỷ lệ lỗi thấp; tuyến GPT-6 Sol trong cùng khoảng thời gian đo được thông lượng nhanh hơn nhưng tỷ lệ lỗi cao hơn đáng kể. Đây là những quan sát trên tuyến chia sẻ, không phải SLA của nhà cung cấp, và chúng thay đổi theo từng tuần — đó là lý do để đo lưu lượng của chính bạn thay vì tin vào thẻ của bất kỳ model nào.
Chạy cả hai dưới một khóa
Câu trả lời thực tế cho một đội vừa có công việc video ở một bên, vừa có công việc nặng về suy luận ở bên kia, là không mô hình nào thắng tuyệt đối và cả hai đều thuộc về stack. Đó chính là trường hợp mà một gateway sinh ra để giải quyết. Trên OrcaRouter, cả qwen/qwen3.8-max lẫn GPT-6 Sol đều là những route đang hoạt động trong cùng một danh mục, phía sau một API tương thích OpenAI, theo đúng giá niêm yết của nhà cung cấp với mức markup 0% — nên khi Alibaba hay OpenAI thay đổi giá, bạn biết được ngay trong cùng ngày thay vì phải đợi đến kỳ đối chiếu hoá đơn tiếp theo, và không cần bộ thông tin xác thực riêng hay đường dẫn SDK riêng cho từng nhà cung cấp.
Hai tính năng đảm nhiệm những công việc cụ thể ở đây. Chuyển đổi dự phòng tự động giữ cho pipeline luôn hoạt động khi tuyến của một nhà cung cấp bị suy giảm, điều này đặc biệt quan trọng vì hai tuyến đó đã hành xử rất khác nhau trong cùng một cửa sổ đo lường. Và DSL định tuyến cho phép yêu cầu tự quyết định: gửi mọi thứ mang đầu vào video đến Qwen3.8 Max, gửi công việc suy luận ngữ cảnh dài đến GPT-6 Sol, và để một vị từ dựa trên phương thức đầu vào và kích thước yêu cầu đưa ra lựa chọn thay vì một model id cứng phải được thay đổi thủ công khi lưu lượng thay đổi.

Nói ngắn gọn: nếu đầu vào của bạn có video, Qwen3.8 Max là mẫu duy nhất trong hai mẫu có thể tiếp nhận chúng, và đây là mẫu rẻ hơn ở mọi tổ hợp token một khi bạn đã có yêu cầu. Nếu công việc của bạn là suy luận văn bản và hình ảnh với nhu cầu về đầu ra dài, có giới hạn và một mặc định cấp tiêu dùng đã được kiểm chứng, GPT-6 Sol là lựa chọn mạnh hơn trên chỉ số tổng hợp và là mẫu có giới hạn đầu ra được ghi nhận rõ ràng. Khi bạn cần cả hai, hãy định tuyến — và để phương thức của yêu cầu làm khóa định tuyến thay vì chu kỳ phát hành.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
