
Solar Mini 4 vs Qwen3.8-Max: Hai mươi điểm chỉ số cuối cùng thực sự tốn bao nhiêu
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 trên 1 triệu token
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 trên 1 triệu token · 159 tok/s
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 220 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Solar Mini 4 có giá 0,10 USD cho mỗi triệu token đầu vào và 0,40 USD cho mỗi triệu token đầu ra. Qwen3.8-Max, mô hình mà hầu hết mọi người ám chỉ khi họ gõ "Qwen 3.8" và hỏi về API, có giá 2,00 USD và 6,00 USD. Trên một bảng giá, điều đó đọc ra như mức chênh lệch gấp hai mươi lần về giá đầu vào. Trong đánh giá độc lập mà cả hai mô hình hiện đã trải qua, con số trung thực là Qwen3.8-Max đạt 45,4 trên Artificial Analysis Intelligence Index, so với 24,1 của Solar Mini 4 — năng lực đo được gần gấp đôi — trong khi tốn khoảng mười lăm lần chi phí cho mỗi tác vụ hoàn thành. Mọi điều đáng biết về cặp mô hình này nằm ở khoảng cách giữa hai tỷ lệ đó, và ở chỗ mô hình của Upstage chạy ở 204 token mỗi giây trong khi mô hình chủ lực của Alibaba chạy ở 39.
Một lưu ý về cách đặt tên trước khi đến các con số, vì nó thay đổi thứ bạn đang mua. Qwen 3.8 là một thế hệ, không phải một mô hình: bản chủ lực được lưu trữ trực tuyến là Qwen3.8-Max, được làm mới dưới dạng snapshot 0902 có ghi ngày, và thành viên cùng thế hệ có thể tải xuống là Qwen3.8-2.4T-A95B, trọng số 2,4 nghìn tỷ tham số mà Alibaba đã công bố ngày 12 tháng 8 năm 2026. Solar Mini 4, phát hành ngày 22 tháng 9 năm 2026, là mô hình mixture-of-experts thưa 35 tỷ tham số của Upstage với khoảng 3 tỷ tham số hoạt động mỗi token và không có trọng số mở ở bất kỳ mức giá nào.
Hai cột, xét trên các khía cạnh quyết định việc mua sắm
• Intelligence Index — 45,4 cho Qwen3.8-Max (0902) so với 24,1 của Solar Mini 4, cả hai đều theo Intelligence Index v4.3.2.
• Chi phí cho mỗi tác vụ đã hoàn thành — $5.41 cho Qwen3.8-Max so với $0.36 cho Solar Mini 4. Khoảng mười lăm trên một, và tỷ lệ mà không ai đề cập đến.
• Bảng giá — $2.00 / $6.00 mỗi triệu token, đầu vào được lưu đệm $0.25, cho Qwen3.8-Max so với $0.10 / $0.40, đầu vào được lưu đệm $0.01, cho Solar Mini 4.
• Ngữ cảnh — 1.000.000 token ở cả hai, và đây là khía cạnh duy nhất mà mô hình giá rẻ không hề thua kém. Artificial Analysis liệt kê 983.616 cho Qwen3.8-Max và 1.048.576 cho Solar Mini 4; còn tài liệu của chính Upstage lại ghi 512K, nên giới hạn của mô hình nhỏ là con số kém chắc chắn hơn trong hai.
• Trọng số — Qwen3.8-Max là độc quyền, được lưu trữ trên máy chủ; phiên bản mở cùng dòng Qwen3.8-2.4T-A95B có thể tải xuống theo giấy phép tùy chỉnh và đạt 39,9 trên cùng chỉ số với ngữ cảnh 262.000 token. Solar Mini 4 là độc quyền và không có phiên bản mở cùng dòng.
• Thông lượng — 204 token đầu ra mỗi giây đối với Solar Mini 4, so với 39,5 của Qwen3.8-Max, theo đo lường từ cùng một phòng thí nghiệm. Mô hình có chi phí chỉ bằng một phần mười lăm cho mỗi tác vụ lại nhanh hơn gấp năm lần khi thực hiện tác vụ đó.
Hai mươi mốt điểm chỉ số mua được gì

Họ chọn mua phần khó nhất của phân bố. Trên Humanity's Last Exam, Qwen3.8-Max trả lời đúng 43,1% số câu, so với 25,8% của Solar Mini 4. Về lập trình khoa học, con số là 52,1% so với 47,6%. Ở mảng công việc tri thức dạng tác tử, khoảng cách mở rộng sang một đẳng cấp khác: Qwen3.8-Max đạt 1663 Elo trên GDPval-AA, trong khi Solar Mini 4 chỉ đạt 1072 — gần sáu trăm điểm Elo, không phải một khác biệt do làm tròn mà là sự thay đổi về những gì mô hình có thể được tin cậy giao phó để tự vận hành mà không cần giám sát.
Bài đánh giá duy nhất mà mô hình nhỏ không chỉ trụ vững mà còn giành chiến thắng là suy luận ngữ cảnh dài. Solar Mini 4 đạt 83,3% trên AA-LCR v1.1 và Qwen3.8-Max đạt 80,3%. Đó là lập luận mạnh nhất ủng hộ Solar Mini 4 trong toàn bộ so sánh này: trên bộ chuẩn được xây dựng để kiểm tra “đọc một tài liệu rất dài và suy luận xuyên suốt nó”, mức giá cao gấp mười lăm lần cho mỗi tác vụ lại đổi lấy một kết quả kém hơn ba điểm.
Nơi cả hai mô hình đều không phải là công cụ phù hợp là công việc terminal tự động. Solar Mini 4 đạt 1% trên Terminal-Bench 4.0; Qwen3.8-Max đạt 38.9%. Một mô hình hoàn thành tám trong số hai mươi tác vụ terminal khó thì thực sự dùng được ở đó, còn mô hình kia thì không, đây là ví dụ rõ ràng nhất trong so sánh này về khoảng cách về bản chất chứ không phải về mức độ.
Tại sao hóa đơn cho mỗi tác vụ của mẫu chủ lực lại tệ hơn nhiều so với mức mà giá token gợi ý
Qwen3.8-Max tạo ra nhiều đầu ra hơn trên mỗi tác vụ so với Solar Mini 4 — 107.700 token so với 88.300 — và nó tạo ra chúng với mức 6,00 USD mỗi triệu token thay vì 0,40 USD. Đó là phần lớn khoảng cách ngay tại đó, trước khi xét đến hành vi bộ nhớ đệm. Alibaba đúng là có mức giá 0,25 USD cho đầu vào được lưu đệm, một mức giảm giá thực sự so với mức giá đầu vào 2,00 USD của mình, và người anh em mở cùng dòng, Qwen3.8-2.4T-A95B, là một mô hình thưa 2,4 nghìn tỷ tham số với khoảng 95 tỷ tham số hoạt động, nên mỗi token nó tạo ra đều được tạo bởi một cỗ máy lớn hơn đáng kể. Không điều nào trong số đó là lời chỉ trích. Đó là lý do tồn tại hệ số nhân gấp mười lăm lần trên mỗi tác vụ, và là lý do việc so sánh giá trên mỗi token giữa hai mô hình này gây hiểu lầm theo cả hai hướng.
Hệ quả thực tế: Solar Mini 4 không phải là “Qwen 3.8 bản giá rẻ”. Nó là một mô hình chuyên biệt mà tình cờ lại rẻ, nhanh và mạnh trên đúng một trục — tài liệu dài — nhưng yếu trên trục mà nếu mắc lỗi sẽ tốn kém nhất, đó là độ tin cậy agentic. Qwen3.8-Max là mô hình tổng quát mà lợi thế thể hiện đúng ở nơi một câu trả lời sai gây tốn kém.
Chạy cả cặp thay vì chọn giữa chúng
Đây là trường hợp bất thường trong dòng Solar Mini 4, khi cả hai bên của phép so sánh đều là những tuyến mà chúng tôi thực sự có thể bán cho bạn. Qwen3.8-Max và bản snapshot 0902 đã cũ của nó nằm trên OrcaRouter với mức giá niêm yết $2.00 / $6.00 của chính nhà cung cấp, song song với Qwen3.8-Flash ở mức $0.15 / $0.47 và Qwen3.8-27B ở mức $0.33 / $2.40 — ba bậc của cùng một thế hệ, một khóa, không cần hợp đồng thứ hai và không cần thay đổi mã ngoài một chuỗi model. Tính đến ngày 1 tháng 10 năm 2026, phép đo trên playground của chính chúng tôi cho thấy Qwen3.8-Max đạt p50 là 2,5 giây với 87,7 token đầu ra mỗi giây trong bảy ngày gần nhất; khung thời gian đó luôn dịch chuyển, nên hãy đọc thẻ model trực tiếp thay vì câu này. Các model của Upstage không có sẵn qua chúng tôi, và Solar Mini 4 phải được truy cập thông qua API riêng của Upstage.

Điều đó giúp khả thi hóa sự phân tách mà so sánh này cổ vũ: gửi lưu lượng tài liệu dài, tiếng Hàn và trích xuất có cấu trúc đến một nơi rẻ, định tuyến các yêu cầu nặng về suy luận và dùng công cụ đến mô hình chủ lực, và để chuyển đổi dự phòng bao phủ nhà cung cấp gặp sự cố tạm thời. Đây cũng là nơi DSL định tuyến khẳng định giá trị của nó — việc kết hợp các mô hình vào một lệnh gọi duy nhất nghĩa là một lượt chạy đầu rẻ và một lượt xác minh đắt đỏ có thể chỉ là một yêu cầu gửi tới một endpoint thay vì hai tích hợp phải được giữ đồng bộ.
Phiên bản ngắn

Nếu khối lượng công việc của bạn là ngữ cảnh dài, một dạng đầu ra cố định và ngân sách độ trễ có thể chấp nhận được, thì Solar Mini 4 mang lại cho bạn 83% kết quả ngữ cảnh dài với một phần mười lăm chi phí tác vụ và gấp năm lần thông lượng, còn hai mươi mốt điểm chỉ số còn thiếu sẽ không bao giờ xuất hiện trên bảng điều khiển của bạn. Nếu khối lượng công việc của bạn liên quan đến công cụ, tác nhân đa bước hoặc những câu hỏi mà ở đó một câu trả lời sai đầy tự tin còn tệ hơn là không có câu trả lời, thì những điểm còn thiếu chính là toàn bộ sản phẩm và Qwen3.8-Max đáng giá gấp mười lăm lần mức giá. Mọi số liệu được ghi cho Artificial Analysis ở trên đều là đo lường độc lập của tổ chức đó; cách đặt tên và ngày phát hành Qwen3.8 là của Alibaba, còn các số liệu phục vụ của OrcaRouter là đo lường trong sân chơi của chính chúng tôi trên cửa sổ bảy ngày trượt.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
