
GPT-6.1 Sol vs Qwen3.8-Max: Hóa đơn, không phải bảng giá
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Hãy lấy một tác vụ bảo trì kho mã chạy hằng đêm, chạy nó mỗi đêm một lần trong suốt một tháng, rồi lần lượt đặt GPT-6.1 Sol và Qwen3.8-Max vào đó. Theo số liệu theo từng tác vụ v4.3.2 của Artificial Analysis, GPT-6.1 Sol tốn 21,72 đô la cho ba mươi đêm đó còn Qwen3.8-Max tốn 162,27 đô la — chênh lệch 140,55 đô la một tháng, khoảng 1.690 đô la một năm, cho một tác vụ mà bảng giá theo token ghi 2,00 đô la đầu vào và 10,00 đô la đầu ra so với 2,00 đô la đầu vào và 6,00 đô la đầu ra. Mức giá trên mỗi triệu token gần như không khác nhau ở đầu vào, chỉ nằm trong sai số làm tròn, và mô hình Trung Quốc rẻ hơn 40% ở đầu ra, vậy mà hóa đơn lại chênh nhau 7,5 lần. Nhà cung cấp đã phát hành GPT-6.1 Sol vào ngày 29 tháng 9 năm 2026; Qwen3.8-Max đã hoạt động từ ngày 3 tháng 8 năm 2026.
Khoảng cách đó không phải là một chiêu trò định giá và cũng không phải là một hệ quả giả tạo của phép đo chuẩn — nó chính là toàn bộ điều mà sự so sánh này muốn nói, và nó đến từ một con số mà không bảng giá cước nào cho bạn thấy.
Mỗi mô hình là gì
GPT-6.1 Sol là mẫu chủ lực hiện tại của OpenAI về suy luận và lập trình, ra mắt một tuần sau GPT-6 Sol mà nó kế nhiệm, với cùng mức giá niêm yết $2.00 / $10.00, cùng mức giá $0.10 cho input đã lưu trong bộ nhớ đệm và cửa sổ ngữ cảnh 1.050.000 token. Nó được bán cho các tác vụ agentic: các thẻ best-for trên model card của chính chúng tôi ghi là reasoning, coding và agentic, và nó đạt điểm chất lượng ở hạng cao nhất.
Qwen3.8-Max là mẫu flagship dạng tác tử của Alibaba — một mô hình đóng, chỉ dùng qua API, nhận đầu vào văn bản, hình ảnh và video, đồng thời có ngữ cảnh 1.000.000 token. Khác với các bản phát hành Qwen nhỏ hơn, bản này không công bố trọng số. Trên Artificial Analysis, nó đạt 45,42 trên Chỉ số Thông minh, xếp thứ 17 trong số 147 mô hình, với chỉ số lập trình 76,2 xếp thứ 9 trong lĩnh vực đó. Đây không phải là một mô hình yếu. Nó chỉ đơn giản là một mô hình tốn kém nếu để nó suy nghĩ.
Con số không có trên bảng giá

Artificial Analysis ghi nhận 107.730 token đầu ra cho mỗi tác vụ đối với Qwen3.8-Max, trong đó 70.830 là token suy luận. GPT-6.1 Sol tạo ra 38.128 token đầu ra, 25.190 trong số đó là token suy luận. Mô hình Trung Quốc viết lượng token nhiều gấp 2,8 lần để trả lời cùng một câu hỏi, và viết với chi phí thấp hơn 40% trên mỗi token.
• Token đầu ra trên mỗi tác vụ — 38.128 so với 107.730; Qwen viết nhiều hơn 2,8 lần
• Trong đó phần suy luận — 25.190 so với 70.830
• Chi phí mỗi tác vụ — $0.724 so với $5.409; Qwen tốn kém hơn 7.5 lần
• Thời gian mỗi tác vụ — 640 giây so với 2.152 giây; khoảng 11 phút so với khoảng 36
• Thời gian đến token trả lời đầu tiên — 332,0 giây so với 55,1 giây
• Intelligence Index — 51,83 so với 45,42
• Cửa sổ ngữ cảnh — 1.050.000 so với 1.000.000 token
• Đầu vào được chấp nhận — văn bản, hình ảnh và tệp so với văn bản, hình ảnh và video
Cứ nhân lên là mức chiết khấu biến mất. Một mô hình phát ra lượng token gần gấp ba lần với đơn giá thấp hơn 40% không hề rẻ hơn — riêng chi phí đầu ra đã cao hơn khoảng 1,7 lần, và con số đo được trên mỗi tác vụ cho thấy bội số thực tế là 7,5 khi đã tính đến đầu vào, các lần đọc từ bộ nhớ đệm và độ dài của câu trả lời hữu ích.
Hãy chú ý đến dòng thứ tư và thứ năm, vì chúng chỉ theo hai hướng ngược nhau và cùng nhau giải thích Qwen3.8-Max là gì. Nó trả về token đầu tiên trong 55 giây, trong khi GPT-6.1 Sol mất năm phút rưỡi, rồi dành ba mươi sáu phút để hoàn thành tác vụ, trong khi mô hình của OpenAI xong trong mười một phút. Đó là một mô hình bắt đầu nói ngay lập tức và suy nghĩ cực kỳ dài. Với một giao diện trò chuyện có câu trả lời truyền phát, điều đó được cảm nhận như khả năng phản hồi nhanh. Với một tác vụ chạy đêm không cần giám sát, đó là thời gian đồng hồ mà bạn cũng đang phải trả tiền.
Ba điểm mà Qwen3.8-Max thực sự nổi trội
Khoảng cách chỉ số là 6,4 điểm trên toàn bộ bộ khảo sát, một con số kiểu đó thường được trích dẫn như thể nó đồng nhất. Thực tế thì không phải vậy, và sự bất đồng ấy rất đáng suy ngẫm:
• GPQA Diamond — Qwen3.8-Max 0.9283 so với GPT-6.1 Sol không được công bố trong lần chạy này
• GDPval — 1.671,4 so với 1.575,09
• Terminal-Bench 2.1 — 0.8876 so với không được công bố trong lần chạy này
• AutomationBench — 0.5619 so với 0.6487
• SciCode — không được công bố trong lần chạy này, so với 0.5417 của GPT-6.1 Sol
• CritPT — 0.1771 so với 0.3171
Qwen3.8-Max thắng ở các câu hỏi khoa học trình độ sau đại học và mẫu tác vụ nghề nghiệp, đây là một kết quả thực sự đối với một mô hình thuộc thế hệ của nó và là lý do chỉ số lập trình của nó đứng thứ 9 trong số 138. Nó thua ở các đánh giá khó hơn, gần với nghiên cứu — CritPT kém 14 điểm — và thua AutomationBench 8,7 điểm, đây là bài đánh giá giống nhất với công việc máy tính không cần giám sát. Bạn tin yếu tố nào trong hai yếu tố đó quan trọng hơn đối với khối lượng công việc của mình thì đó mới là quyết định thực sự; con số nổi bật 6,4 điểm chỉ là mức trung bình của một sự bất đồng, chứ không phải là một phán quyết.
Những token bổ sung mang lại những gì, và không mang lại những gì
Các dấu vết suy luận dài không mặc nhiên là lãng phí. Một mô hình dành 70.830 token để cân nhắc cho một tác vụ khó đang làm điều gì đó mà mô hình ngắn hơn có thể đang bỏ qua, và trong những đánh giá mà Qwen3.8-Max dẫn đầu, sự cân nhắc đó có khả năng chính là lý do. Chế độ thất bại nằm ở chỗ bạn phải trả giá cho nó ở mọi tác vụ, không chỉ những tác vụ khó. Số lượng token suy luận là một thuộc tính của độ hiệu chỉnh của mô hình, không phải của độ khó câu hỏi, và một mô hình suy nghĩ quá nhiều cho một phép trích xuất một dòng sẽ tính phí bạn vì điều đó.
Cách để biết nhiệm vụ nào của bạn là nhiệm vụ nào là ngừng coi việc lựa chọn mô hình là toàn cục. Điều đó đưa chúng ta đến phần là một thay đổi cấu hình.
Thẻ mô hình của chính chúng tôi dành cho GPT-6.1 Sol mang các con số được phục vụ của đối tượng: mức $2.00 / $10.00, cửa sổ ngữ cảnh 1.050.000 token, p50 4,54 giây đến token đầu tiên, và một khối chỉ số Artificial Analysis được lưu trên cùng trang với mức giá mà một ứng dụng thực sự sẽ căn cứ vào để định tuyến.

Một chìa khóa, một chìa khóa, hai mẫu
Cả hai mô hình đều có thể truy cập qua một endpoint OrcaRouter duy nhất — một API cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên qua ở mức đánh dấu 0%. Thẻ OrcaRouter cho Qwen3.8-Max mang mức giá phục vụ cùng với cửa sổ ngữ cảnh 1.000.000 token, các phương thức đầu vào văn bản/hình ảnh/video và khối lượng bảy ngày là 101,4 triệu token — những con số mà một ứng dụng dùng để định tuyến, bên cạnh những con số mà bài viết đang tranh luận. Việc chuyển nguyên đó đặc biệt quan trọng đối với Qwen3.8-Max, bởi vì một mô hình mà nền kinh tế của nó bị chi phối bởi khối lượng token đầu ra là mô hình mà nhà cung cấp có thể định giá lại bất cứ lúc nào, và một đồng hồ đo chuyển nguyên nghĩa là thay đổi đó sẽ đến hóa đơn của bạn ngay ngày Alibaba công bố nó thay vì theo lịch của một nhà bán lại.

Cách sử dụng thú vị hơn của lớp định tuyến ở đây là DSL định tuyến, cho phép bạn kết hợp các mô hình vào một lệnh gọi duy nhất thay vì chọn một mô hình cho toàn bộ ứng dụng. Hãy tách công việc chạy hằng đêm: một mô hình rẻ tiền phân loại và trích xuất, GPT-6.1 Sol đảm nhiệm các bước suy luận và xác minh, còn Qwen3.8-Max được dành riêng cho những tác vụ mà khả năng cân nhắc lâu dài và sức mạnh khoa học tầm cỡ GPQA của nó thực sự làm thay đổi câu trả lời. Tự động chuyển đổi dự phòng bao quát phần còn lại — nếu một nhà cung cấp suy giảm giữa lúc chạy, yêu cầu sẽ được chuyển đi thay vì làm hỏng cả lô.
Không điều nào trong hai điều này là lý do để chọn một mô hình. Chúng là lý do bạn không phải đưa ra lựa chọn một lần rồi sống mãi với nó.
Cuộc gọi, và điều cần chú ý
Chỉ trả gấp 7.5 lần khi việc cân nhắc kỹ xứng đáng với nó. Với một công việc chạy đêm đa dụng, GPT-6.1 Sol ở mức $0.724 mỗi tác vụ là lựa chọn mặc định có thể biện minh được, và $1,690 một năm là con số thật. Ở những tác vụ khoa học khó hoặc suy luận nghề nghiệp với đáp án có thể kiểm chứng, mức 0.9283 của Qwen3.8-Max trên GPQA Diamond là đáng từng token — đó chính là điều cụ thể mà nó làm tốt hơn.
Điều cần để mắt tới là liệu Alibaba có định giá lại hay không. Một mô hình 2,8× token ở mức $2.00/$6.00 được định giá như thể token là thứ khan hiếm; trong khi chính hành vi của mô hình lại khiến token trở nên dồi dào. Nếu mức giá đầu ra thay đổi đáng kể, thì phép tính trong bài này cũng thay đổi theo, và thước đo mức độ chuyển tiếp sẽ cho bạn thấy điều đó ngay trong ngày nó xảy ra.
So sánh trong bài viết này3
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
