
Solar Mini 4 vs Qwen3.8-Max: 20 คะแนนดัชนีสุดท้ายต้องแลกมาด้วยอะไรจริง ๆ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 ต่อ 1 ล้านโทเค็น
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 ต่อ 1 ล้านโทเค็น · 159 tok/s
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 220 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Solar Mini 4 มีค่าใช้จ่าย $0.10 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $0.40 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน Qwen3.8-Max ซึ่งเป็นโมเดลที่คนส่วนใหญ่หมายถึงเมื่อพิมพ์ "Qwen 3.8" แล้วขอ API มีค่าใช้จ่าย $2.00 และ $6.00 บนเรตการ์ดที่อ่านได้ว่าเป็นความแตกต่างของราคาอินพุตถึงยี่สิบเท่า ในการประเมินอิสระที่ทั้งสองโมเดลได้ผ่านมาแล้ว ตัวเลขที่ตรงไปตรงมาคือ Qwen3.8-Max ได้ 45.4 บน Artificial Analysis Intelligence Index เทียบกับ 24.1 ของ Solar Mini 4 — ความสามารถที่วัดได้ประมาณสองเท่า — ในขณะที่มีค่าใช้จ่ายประมาณสิบห้าเท่าต่องานที่ทำสำเร็จหนึ่งงาน ทุกอย่างที่ควรรู้เกี่ยวกับการจับคู่นี้อยู่ในช่องว่างระหว่างอัตราส่วนทั้งสองนั้น และในข้อเท็จจริงที่ว่าโมเดลของ Upstage ทำงานที่ 204 โทเคนต่อวินาที ในขณะที่เรือธงของ Alibaba ทำงานที่ 39
หมายเหตุเรื่องชื่อหนึ่งข้อก่อนตัวเลข เพราะมันเปลี่ยนสิ่งที่คุณกำลังซื้อ Qwen 3.8 เป็นเจเนอเรชัน ไม่ใช่โมเดล: เรือธงที่โฮสต์คือ Qwen3.8-Max ซึ่งรีเฟรชเป็นสแนปช็อต 0902 ที่ลงวันที่ และสมาชิกที่ดาวน์โหลดได้ของเจเนอเรชันเดียวกันคือ Qwen3.8-2.4T-A3B เวตขนาด 2.4 ล้านล้านพารามิเตอร์ที่ Alibaba เผยแพร่เมื่อวันที่ 12 สิงหาคม 2026 Solar Mini 4 ที่เปิดตัวเมื่อวันที่ 22 กันยายน 2026 เป็น sparse mixture-of-experts ขนาด 35 พันล้านพารามิเตอร์ของ Upstage โดยมี 3 พันล้านพารามิเตอร์ที่ทำงานต่อโทเคน และไม่มีเวตแบบเปิดให้ใช้ไม่ว่าจะราคาใด
สองคอลัมน์ ในมิติที่ใช้ตัดสินการจัดซื้อจัดจ้าง
• Intelligence Index — 45.4 สำหรับ Qwen3.8-Max (0902) เทียบกับ 24.1 สำหรับ Solar Mini 4 ทั้งคู่เป็น Intelligence Index v4.3.2
• ค่าใช้จ่ายต่องานที่ทำเสร็จ — $5.41 สำหรับ Qwen3.8-Max เทียบกับ $0.36 สำหรับ Solar Mini 4 คิดเป็นประมาณสิบห้าต่อหนึ่ง และเป็นอัตราส่วนที่ไม่มีใครพูดถึง
• อัตราค่าบริการ — $2.00 / $6.00 ต่อล้านโทเค็น อินพุตแบบแคช $0.25 สำหรับ Qwen3.8-Max เทียบกับ $0.10 / $0.40 อินพุตแบบแคช $0.01 สำหรับ Solar Mini 4
• บริบท — 1,000,000 โทเค็นทั้งสองรุ่น ซึ่งเป็นมิติเดียวที่โมเดลราคาถูกไม่เป็นรองเลย Artificial Analysis ระบุ 983,616 สำหรับ Qwen3.8-Max และ 1,048,576 สำหรับ Solar Mini 4 ส่วนเอกสารของ Upstage เองระบุว่า 512K ดังนั้นเพดานของโมเดลเล็กจึงเป็นค่าที่แน่นอนน้อยกว่าในสองค่านี้
• น้ำหนักโมเดล — Qwen3.8-Max เป็นโมเดลปิดที่ให้บริการแบบโฮสต์ ส่วนรุ่นพี่น้องแบบโอเพนซอร์สอย่าง Qwen3.8-2.4T-A95B สามารถดาวน์โหลดได้ภายใต้สัญญาอนุญาตแบบกำหนดเอง และได้คะแนน 39.9 บนดัชนีเดียวกันที่ขนาดบริบท 262,000 โทเคน ส่วน Solar Mini 4 เป็นโมเดลปิดและไม่มีรุ่นพี่น้องแบบโอเพนซอร์ส
• อัตราทรูพุต — 204 โทเคนเอาต์พุตต่อวินาทีสำหรับ Solar Mini 4 เทียบกับ 39.5 ของ Qwen3.8-Max ตามการวัดของห้องแล็บเดียวกัน โมเดลที่มีต้นทุนต่องานเพียงหนึ่งในสิบห้าของอีกฝ่าย กลับทำงานได้เร็วกว่าถึงห้าเท่า
Twenty-one index points ซื้ออะไรได้

พวกเขาซื้อส่วนที่ยากของการกระจาย ในการสอบ Humanity's Last Exam, Qwen3.8-Max ตอบถูก 43.1% ของข้อ เทียบกับ 25.8% ของ Solar Mini 4 ในด้านการเขียนโค้ดทางวิทยาศาสตร์ อยู่ที่ 52.1% เทียบกับ 47.6% ในงานความรู้แบบเอเจนต์ ช่องว่างกว้างขึ้นจนกลายเป็นคนละหมวดหมู่: Qwen3.8-Max ทำได้ถึง 1663 Elo บน GDPval-AA ในขณะที่ Solar Mini 4 ทำได้ 1072 — เกือบหกร้อยคะแนน Elo ซึ่งไม่ใช่ความแตกต่างจากการปัดเศษ แต่เป็นการเปลี่ยนแปลงในสิ่งที่โมเดลได้รับความไว้วางใจให้ทำได้โดยไม่มีคนดูแล
การประเมินเพียงหนึ่งเดียวที่โมเดลขนาดเล็กไม่เพียงแต่ยืนหยัดได้ แต่ยังชนะ คือการให้เหตุผลกับบริบทยาว Solar Mini 4 ได้คะแนน 83.3% บน AA-LCR v1.1 และ Qwen3.8-Max ได้ 80.3% นั่นคือข้อโต้แย้งที่แข็งแกร่งที่สุดสำหรับ Solar Mini 4 ในการเปรียบเทียบทั้งหมดนี้: บนเกณฑ์มาตรฐานที่สร้างขึ้นเพื่อทดสอบ "อ่านเอกสารที่ยาวมากและให้เหตุผลเชื่อมโยงทั้งฉบับ" ราคาต่องานที่แพงกว่าสิบห้าเท่าแลกมาซึ่งผลลัพธ์ที่แย่ลงสามจุด
จุดที่โมเดลทั้งสองไม่ใช่เครื่องมือที่เหมาะสมคือการทำงานบนเทอร์มินัลแบบอัตโนมัติ Solar Mini 4 ทำคะแนนได้ 1% บน Terminal-Bench 4.0 ส่วน Qwen3.8-Max ทำได้ 38.9% โมเดลที่ผ่านงานเทอร์มินัลยาก 8 จาก 20 งานถือว่าใช้งานได้จริงในด้านนี้ ส่วนอีกโมเดลหนึ่งใช้ไม่ได้ ซึ่งเป็นตัวอย่างที่ชัดเจนที่สุดในการเปรียบเทียบครั้งนี้ถึงช่องว่างที่เป็นความแตกต่างเชิงคุณภาพ ไม่ใช่เชิงปริมาณ
ทำไมค่าใช้จ่ายต่องานของโมเดลเรือธงจึงแย่กว่าที่ราคาต่อโทเคนของมันบ่งชี้ไว้มาก
Qwen3.8-Max สร้างเอาต์พุตต่องานมากกว่า Solar Mini 4 — 107,700 โทเค็น เทียบกับ 88,300 — และคิดราคาที่ 6.00 ดอลลาร์ต่อล้านโทเค็น แทนที่จะเป็น 0.40 ดอลลาร์ นั่นคือส่วนใหญ่ของช่องว่างตรงนั้นเลย ก่อนที่จะพิจารณาพฤติกรรมแคช Alibaba มีอัตราอินพุตที่แคชไว้ราคา 0.25 ดอลลาร์ ซึ่งเป็นส่วนลดจริงเมื่อเทียบกับราคาอินพุตราคา 2.00 ดอลลาร์ และโมเดลพี่น้องแบบเปิดในตระกูลเดียวกัน Qwen3.8-2.4T-A95B เป็นโมเดลแบบสแปร์สที่มีพารามิเตอร์ 2.4 ล้านล้านตัว โดยมีพารามิเตอร์ประมาณ 95 พันล้านตัวที่ทำงานอยู่ ดังนั้นทุกโทเค็นที่มันสร้างจึงถูกสร้างโดยเครื่องที่ใหญ่กว่าอย่างมาก ไม่มีส่วนใดเป็นการวิพากษ์วิจารณ์ มันเป็นเหตุผลที่ตัวคูณต่องาน 15 เท่ามีอยู่ และเป็นเหตุผลที่การเปรียบเทียบราคาต่อโทเค็นระหว่างสองโมเดลนี้ทำให้เข้าใจผิดทั้งสองทาง
ผลลัพธ์ในทางปฏิบัติ: Solar Mini 4 ไม่ใช่ "Qwen 3.8 ราคาประหยัด" แต่มันคือผู้เชี่ยวชาญเฉพาะทางที่บังเอิญมีราคาถูก เร็ว และแข็งแกร่งในแกนเดียวเท่านั้น — เอกสารยาว — และอ่อนแอในแกนที่ต้นทุนการผิดพลาดสูงที่สุด นั่นคือความน่าเชื่อถือแบบเอเจนต์ Qwen3.8-Max คือผู้รอบรู้ทั่วไปที่ข้อได้เปรียบปรากฏชัดในจุดที่คำตอบผิดมีราคาแพง
รันทั้งคู่แทนที่จะเลือกอย่างใดอย่างหนึ่ง
นี่เป็นกรณีที่พบได้ไม่บ่อยในซีรีส์ Solar Mini 4 ซึ่งทั้งสองฝั่งของการเปรียบเทียบเป็นเส้นทางที่เราขายให้คุณได้จริง Qwen3.8-Max และสแนปช็อต 0902 ที่ระบุวันที่ อยู่บน OrcaRouter ในราคาลิสต์ของผู้จำหน่ายเองที่ $2.00 / $6.00 เคียงข้างQwen3.8-Flash ที่ $0.15 / $0.47 และ Qwen3.8-27B ที่ $0.33 / $2.40 — สามขั้นของเจเนอเรชันเดียวกัน คีย์เดียว ไม่มีสัญญาฉบับที่สอง และไม่ต้องแก้โค้ดใด ๆ นอกเหนือจากสตริงชื่อโมเดล ณ วันที่ 1 ตุลาคม 2026 การวัดใน playground ของเราเองระบุว่า Qwen3.8-Max อยู่ที่ p50 2.5 วินาที ด้วยอัตรา 87.7 โทเคนเอาต์พุตต่อวินาทีในช่วงเจ็ดวันที่ผ่านมา หน้าต่างเวลานั้นหมุนเวียนไปเรื่อย ๆ ดังนั้นควรอ่านการ์ดโมเดลแบบสด ๆ แทนประโยคนี้ โมเดลของ Upstage ไม่มีให้บริการผ่านเรา และ Solar Mini 4 ต้องเข้าถึงผ่าน API ของ Upstage เอง

สิ่งที่ทำให้เป็นไปได้คือการแบ่งแบบที่การเปรียบเทียบนี้เสนอให้ทำ: ส่งทราฟฟิกเอกสารยาว ภาษาเกาหลี และการสกัดข้อมูลแบบมีโครงสร้างไปยังที่ที่ราคาถูก จัดเส้นทางคำขอที่ใช้การให้เหตุผลหนักและใช้เครื่องมือไปยังโมเดลเรือธง และให้ระบบสำรองรองรับผู้ให้บริการที่เกิดปัญหาช่วงหนึ่ง นอกจากนี้ยังเป็นจุดที่ DSL สำหรับจัดเส้นทางพิสูจน์คุณค่าของตัวเอง — การประกอบโมเดลหลายตัวเข้าเป็นการเรียกครั้งเดียวหมายความว่ารอบแรกที่ถูกและรอบตรวจสอบที่แพงสามารถเป็นคำขอเดียวที่ยิงไปยังปลายทางเดียว แทนที่จะเป็นสองการเชื่อมต่อที่ต้องคอยให้ตรงกัน
เวอร์ชันสั้น

ถ้าภาระงานของคุณเป็นแบบ long context มีรูปแบบเอาต์พุตคงที่ และมีงบประมาณความหน่วงที่ยอมรับได้ Solar Mini 4 ให้ผลลัพธ์ long-context ถึง 83% ด้วยต้นทุนงานเพียงหนึ่งในสิบห้า และให้ throughput มากกว่าห้าเท่า และอีก 21 คะแนนดัชนีที่หายไปจะไม่มีวันปรากฏบนแดชบอร์ดของคุณเลย ถ้าภาระงานของคุณเกี่ยวข้องกับเครื่องมือ เอเจนต์แบบหลายขั้นตอน หรือคำถามที่คำตอบผิดอย่างมั่นใจแย่กว่าไม่มีคำตอบเลย คะแนนที่หายไปคือผลิตภัณฑ์ทั้งหมด และ Qwen3.8-Max คุ้มค่ากับราคาที่สูงกว่าสิบห้าเท่า ตัวเลขทุกตัวที่อ้างถึง Artificial Analysis ข้างต้นเป็นการวัดอิสระขององค์กรนั้น ชื่อและการเปิดตัวของ Qwen3.8 เป็นของ Alibaba และตัวเลขการให้บริการของ OrcaRouter มาจากการวัดใน playground ของเราเองบนหน้าต่างแบบหมุนเวียนเจ็ดวัน
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
