
GPT-6 Sol vs Qwen3.8-Max: บรรทัดเดียวที่โมเดลแบบปิดไม่อาจแข่งขันได้
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
การเปรียบเทียบแทบทุกครั้งระหว่าง GPT-6 Solกับ Qwen3.8-Maxจะถูกตัดสินกันที่เรื่องต้นทุน และแทบทุกครั้งก็จะคำนวณต้นทุนผิดไปในทิศทางเดียวกัน Qwen3.8-Max ซึ่งเป็นเรือธงแบบโฮสต์ของผู้ให้บริการ มีราคาอยู่ที่ 2.00 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 6.00 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน นับตั้งแต่เปิดให้บริการทั่วไปเมื่อวันที่ 3 สิงหาคม 2026 โดยมีสแนปช็อตระบุวันที่ Qwen3.8-Max-0902 ที่เปิดตัวเมื่อวันที่ 2 กันยายน GPT-6 Sol เปิดให้บริการทั่วไปเมื่อวันที่ 22 กันยายน 2026 ในราคา 2.00 ดอลลาร์สำหรับอินพุต และ 10.00 ดอลลาร์สำหรับเอาต์พุต ราคาอินพุตเท่ากัน และเอาต์พุตถูกกว่า 40% ตามตารางราคาของ Qwen3.8-Max — แต่บนฮาร์เนสอิสระ กลับมีต้นทุนสูงกว่าประมาณห้าเท่าในการทำงานหนึ่งงานให้เสร็จ
แต่ยังมีความแตกต่างอย่างที่สองที่ชัดเจนกว่า ซึ่งการถกเถียงเรื่องต้นทุนคอยกลบไว้เสมอ และมันคือความแตกต่างที่เป็นตัวตัดสินงานบางประเภทจริง ๆ Qwen3.8-Max รองรับวิดีโอ ส่วน GPT-6 Sol ไม่รองรับ นั่นไม่ใช่ตัวเลขราคาหรือตัวเลข benchmark แต่เป็นความสามารถที่โมเดลหนึ่งมีและอีกโมเดลหนึ่งไม่สามารถเทียบเคียงได้ และเป็นส่วนเดียวของการเปรียบเทียบนี้ที่งานด้านประสิทธิภาพโทเคนไม่ว่าจะทำมากแค่ไหนก็แก้ไม่ได้

เรือธงสองรุ่น สองรูปทรงที่แตกต่างกัน
Qwen3.8-Max เป็นโมเดล sparse mixture-of-experts ที่มีพารามิเตอร์ 2.4 ล้านล้านตัว โดยมีพารามิเตอร์ที่เปิดใช้งานประมาณ 95 พันล้านตัวต่อการสืบค้นหนึ่งครั้ง — เป็นโมเดลโฮสต์ขนาดใหญ่เป็นอันดับสองในการใช้งานจริงรองจาก Kimi K3 หน้าต่างบริบทของมันมีหนึ่งล้านโทเคน โดยมีขีดจำกัดเอาต์พุต 131,072 โทเคน อินพุตมอดัลลิตีของมันคือข้อความ รูปภาพ และวิดีโอ และรองรับความพยายามในการให้เหตุผลในระดับต่ำ ปานกลาง และสูงมาก พร้อมเอาต์พุตแบบมีโครงสร้างและการเรียกใช้เครื่องมือ โมเดลเรือธงที่โฮสต์ไว้นั้นไม่ได้เป็นน้ำหนักเปิด ส่วนอาร์ติแฟกต์ที่ดาวน์โหลดได้ในรุ่นเดียวกันเป็นการเปิดตัวแยกต่างหากที่มีข้อจำกัดของตัวเอง
GPT-6 Sol รับข้อความและรูปภาพเข้า ส่งออกเป็นข้อความ หน้าต่างของมันคือ 1,050,000 โทเคน โดยมีอินพุตสูงสุด 922,000 โทเคน และเพดานเอาต์พุต 128,000 โทเคน ราคาคงที่ที่ $2.00 และ $10.00 พร้อมการอ่านจากแคชที่ $0.20 และการเขียนแคชที่ $2.50 โดยปรับราคาทั้งคำขอใหม่เป็น $4.00 และ $15.00 เมื่ออินพุตเกิน 272,000 โทเคน เป็นโมเดลแบบปิด ใช้ตัวระบุเดียว และ OpenAI ระบุว่าอัตราราคานี้เป็นแบบถาวร ไม่ใช่โปรโมชัน
ตัวเลขของหน้าต่างห่างกันประมาณ 7% และเพดานของเอาต์พุตก็อยู่ในช่วงเดียวกัน รายการมอดาลิตีเป็นช่องว่างเชิงโครงสร้างเพียงอย่างเดียว — และ它也ไปในทิศทางเดียว
ทีละบรรทัด
• อินพุต — GPT-6 Sol $2.00 ต่อล้านโทเค็น เทียบกับ Qwen3.8-Max $2.00 ต่อล้านโทเค็น; ตัวเลขที่ขึ้นพาดหัวเหมือนกันทุกประการ
• เอาต์พุต — GPT-6 Sol $10.00 ต่อล้านโทเคน เทียบกับ Qwen3.8-Max $6.00 ต่อล้านโทเคน; อัตราของ Alibaba ต่ำกว่า 40%
• อินพุตที่แคชไว้ — GPT-6 Sol $0.20 ต่อล้านโทเคน เทียบกับ Qwen3.8-Max $0.25 ต่อล้านโทเคน สำหรับการอ่านแคชโดยปริยาย โดยมีการอ่านแคชแบบระบุชัดเจนที่ $0.17 และการเขียนแคชแบบระบุชัดเจนที่ $2.50
• หน้าต่างบริบท — GPT-6 Sol 1,050,000 โทเคน เทียบกับ Qwen3.8-Max 1,000,000 โทเคน
• เอาต์พุตสูงสุด — GPT-6 Sol 128,000 โทเค็น เทียบกับ Qwen3.8-Max 131,072 โทเค็น
• รูปแบบอินพุต — GPT-6 Sol รองรับข้อความและรูปภาพ เทียบกับ Qwen3.8-Max ที่รองรับข้อความ รูปภาพ และวิดีโอ
• การจัดการบริบทแบบยาว — GPT-6 Sol คิดราคาคำขอทั้งหมดใหม่เมื่อเกิน 272,000 โทเค็นอินพุต ในอัตราอินพุตและแคช 2 เท่า และเอาต์พุต 1.5 เท่า เมื่อเทียบกับ Qwen3.8-Max ที่ใช้อัตราคงที่ระดับเดียวตลอดทั้งหน้าต่าง ซึ่งเป็นจุดเดียวที่ตารางราคาของ Qwen ดีกว่าในเชิงโครงสร้าง ไม่ใช่แค่ถูกกว่าเล็กน้อย
• ความพยายามในการใช้เหตุผล — GPT-6 Sol none, low, medium (ค่าเริ่มต้น), high, xhigh, max เทียบกับ Qwen3.8-Max low, medium และ extra-high
• จุดตัดข้อมูลความรู้ — GPT-6 Sol 20 เมษายน 2026 เทียบกับ Qwen3.8-Max ที่ไม่ได้ระบุเป็นวันที่เดียว
• สแนปช็อตที่ระบุวันที่ — GPT-6 Sol ตัวระบุแบบโรลลิ่งตัวเดียว เทียบกับ Qwen3.8-Max-0902 ที่มีให้ใช้เป็นรีวิชันที่ปักหมุดไว้ ณ วันที่ 2 กันยายน 2026 ในราคาเดียวกัน
เส้นทางบริบทยาวสมควรได้รับความสนใจมากกว่าที่มักได้รับ ค่าธรรมเนียมเพิ่มของ GPT-6 Sol เป็นขั้นตอนที่ใช้กับคำขอทั้งหมด ดังนั้นการรันเอเจนต์ที่ใช้ 900,000 โทเคนจึงถูกคิดค่าบริการที่ $4.00 และ $15.00 ต่อทุกโทเคน ขณะที่ Qwen3.8-Max คิดในอัตราระดับเดียวตลอดทั้งหน้าต่างบริบท สำหรับภาระงานที่อยู่เหนือ 272,000 โทเคนขึ้นไป การ์ดอัตราค่าบริการทั้งสองแบบไม่สามารถนำมาเทียบกันได้เลย — โมเดลที่ถูกกว่าตามพาดหัวข่าวกลับกลายเป็นโมเดลที่แพงกว่าอย่างชัดเจน และทิศทางของช่องว่างนั้นขึ้นอยู่กับว่าบริบทของคุณอยู่ตรงจุดใดทั้งหมด

ตารางราคาบอกว่าถูกกว่า 40% แต่ฮาร์เนสบอกว่าบิลเป็นห้าเท่า
Artificial Analysis วัดค่า Qwen3.8-Max-0902 ได้คะแนน Intelligence Index 45 โดยมีค่าใช้จ่าย $5.41 ต่อหนึ่งงาน index ที่เสร็จสมบูรณ์ และสร้างโทเคนเอาต์พุต 190 ล้านโทเคนตลอดการรัน บทสรุปของมันอธิบายโมเดลนี้ว่า "ช้าอย่างเห็นได้ชัดและละเอียดมากเกินไป" GPT-6 Sol ได้คะแนน 48 ด้วยค่าใช้จ่าย $1.06 ต่อหนึ่งงาน บนโทเคนเอาต์พุต 77 ล้านโทเคน
อ่านสามคู่นั้นประกอบกัน แล้วรูปร่างของการแข่งขันก็ปรากฏขึ้น Qwen ตามหลังอยู่สามจุดดัชนี สร้างโทเค็นเป็น 2.5 เท่า และมีค่าใช้จ่ายต่องานที่เสร็จสิ้นประมาณห้าเท่า — บนเรตการ์ดที่เอาต์พุตของมันถูกกว่า 40% กลไกนี้ไม่ใช่เรื่องที่มองไม่ออก ที่ $6.00 ต่อโทเค็นเอาต์พุตหนึ่งล้าน โทเค็น 190 ล้านมีค่าใช้จ่าย $1.14 ต่อการรันดัชนีหนึ่งครั้ง โดยเป็นเอาต์พุตเพียงอย่างเดียวก่อนจะนับอินพุต; ที่ $10.00 ต่อล้าน 77 ล้านของ Sol มีค่าใช้จ่าย $0.77 อัตราที่ถูกกว่ากำลังซื้อโทเค็นมากขึ้น ไม่ใช่บิลที่เล็กลง
นี่คือรูปแบบเดียวกันที่ปรากฏให้เห็นทั่วทั้งกลุ่มเดือนกันยายน และควรกล่าวถึงมันเป็นกฎ มากกว่าจะเป็นข้อเท็จจริงเกี่ยวกับสองโมเดลนี้: บนตารางอัตราค่าบริการต่อโทเคน ส่วนลดเอาต์พุต 40% ไม่มีค่าอะไรเลย หากโมเดลปล่อยโทเคนออกมามากเป็นสองเท่าครึ่ง ต้นทุนต่องานที่ทำสำเร็จคือตัวเลขเดียวที่ยังคงอยู่
สิ่งที่ Alibaba เผยแพร่ และปัญหาการกำหนดความพยายาม
ตารางเบนช์มาร์กของ Alibaba เองเป็นตารางที่ยาวที่สุดในการเปรียบเทียบนี้ และเปรียบเทียบได้น้อยที่สุด ตัวเลขที่ผู้จำหน่ายรายงานทำให้ Qwen3.8-Max อยู่ข้างหน้าใน PaperBench และ IFBench แต่ตามหลังใน SWE-bench Pro และ Humanity's Last Exam โดยมีมาตรวัดความพยายามในการใช้เหตุผล — low, medium, extra-high — ซึ่งไม่มีการเทียบโดยตรงกับมาตรวัดหกระดับของ OpenAI คะแนนที่เผยแพร่ที่ระดับ extra-high ไม่ใช่ผลิตภัณฑ์เดียวกันกับคะแนนที่เผยแพร่ที่ระดับ medium และไม่มีผู้จำหน่ายรายใดระบุว่าค่าระดับใดให้ตัวเลขที่กำหนดบนแผนภูมิเปรียบเทียบ
นั่นแหละคือเหตุผลที่ตรงไปตรงมาที่ทำให้ไม่ควรไปยึดตารางของผู้ขายรายใดรายหนึ่งตรงนี้ ตัวเลขของ Alibaba นั้นรันบนฮาร์เนสของ Alibaba ด้วยการตั้งค่าระดับความพยายามของ Alibaba ส่วนของ OpenAI ก็รันบนของ OpenAI ตัวเลขของ Artificial Analysis มีอยู่ก็เพราะทั้งสองอย่างนั้นใช้เทียบกันแบบตัวต่อตัวไม่ได้ และเป็นตัวเลขที่ถูกใช้ข้างต้น
การทำซ้ำได้เป็นคุณสมบัติจริง และมันมีราคาเป็นศูนย์
สแนปช็อตที่ระบุวันที่คือรายการที่ถูกประเมินค่าต่ำเกินไปที่สุดในการเปรียบเทียบนี้ Qwen3.8-Max-0902 เป็นรีวิชันที่ปักหมุดไว้ของวันที่ 2 กันยายน 2026 ซึ่ง Alibaba กล่าวว่ามีความสามารถและราคาเดียวกับโมเดลฐาน การปักหมุดไว้หมายความว่าโมเดลที่อยู่เบื้องหลังเอนด์พอยต์ของคุณจะไม่เปลี่ยนไปโดยที่คุณไม่รู้ตัวระหว่างวันอังคารกับวันพฤหัสบดี
GPT-6 Sol ไม่มีสิ่งที่เทียบเท่าได้ มันเป็นตัวระบุแบบหมุนเวียนเพียงตัวเดียว — หน้าโมเดลเดียวกันมีสแนปช็อตค่าเริ่มต้นและไม่มีตัวแปรที่ระบุวันที่ — ซึ่งหมายความว่าสิ่งที่คุณทดสอบในเดือนกันยายนไม่ได้รับประกันว่าจะเป็นสิ่งเดียวกับที่คุณเรียกใช้ในเดือนพฤศจิกายน สำหรับทีมส่วนใหญ่แล้วนั่นก็โอเค สำหรับไปป์ไลน์ที่มีการกำกับดูแลซึ่งต้องแสดงให้เห็นว่าอะไรเป็นผู้สร้างผลลัพธ์ มันเป็นความแตกต่างที่แท้จริง และมันเป็นสิ่งที่ Alibaba ให้ฟรี ในขณะที่ OpenAI ไม่เสนอเลย
สายวิดีโอคือสิ่งที่เป็นตัวตัดสิน
ทุกอย่างข้างต้นเป็นการเปรียบเทียบ ส่วนนี้ไม่ใช่ หากอินพุตของคุณมีวิดีโอ — การบันทึกหน้าจอ ฟุตเทจการตรวจสอบ การบันทึกการบรรยาย หรืออะไรก็ตามที่ข้อมูลอยู่ในภาวะเคลื่อนไหวแทนที่จะเป็นภาพนิ่ง — Qwen3.8-Max รองรับได้แบบเนทีฟ และ GPT-6 Sol ไม่มีเส้นทางไปถึงมัน คุณไม่สามารถใช้พรอมต์เพื่อหลบเลี่ยงข้อจำกัดของโมดัลลิตีได้ คุณไม่สามารถประมวลผลวิดีโอไว้ล่วงหน้าให้เป็นภาพแล้วได้ผลลัพธ์เดียวกัน เพราะประเด็นสำคัญคือข้อมูลเชิงเวลา และไม่ว่าคะแนนดัชนีบนเบนช์มาร์กข้อความจะมีมากเพียงใด ก็ไม่สามารถทดแทนอินพุตที่งานของคุณต้องใช้จริงได้
กรณีกลับกันก็ควรค่าแก่การกล่าวถึงเช่นกัน เพราะนี่คือจุดที่การเปรียบเทียบไม่เอียงไปข้างใดข้างหนึ่งอีกต่อไป หากอินพุตของคุณเป็นข้อความและรูปภาพ Sol มีต้นทุนต่องานต่ำกว่า นำอยู่สี่คะแนนบนกระดานที่เป็นกลาง และถูกกว่าสำหรับการอ่านจากแคช ความสามารถด้านวิดีโอไม่ใช่ตัวตัดสินที่ทำให้คุณได้เปรียบ มันเพียงแค่ไม่ได้ถูกใช้งานเท่านั้น
การกำหนดเส้นทางสำหรับการตัดสินใจที่มีคำตอบแยกกันสองทาง

นี่คือการจับคู่ที่สถาปัตยกรรมที่เหมาะสมนั้นเป็นสองโมเดลจริง ๆ ไม่ใช่โมเดลเดียว และเหตุผลก็คือการแยกนั้นอิงตามรูปแบบของอินพุตมากกว่าความยาก ไปป์ไลน์ที่รับวิดีโอเข้ามาและให้เหตุผลเหนือข้อความจำเป็นต้องใช้ทั้งสอง และกฎการกำหนดเส้นทางเป็นคุณสมบัติของคำขอมากกว่าการตัดสินใจด้วยดุลยพินิจ
Qwen3.8-Max อยู่ในแค็ตตาล็อกของ OrcaRouter — สแนปช็อต qwen/qwen3.8-max-0902 ที่ระบุวันที่นั้นสามารถกำหนดเส้นทางได้ในราคาตามรายการของ Alibaba ภายใต้โมเดลพาสทรู ซึ่งหมายความว่าการเปลี่ยนแปลงอัตราของ Alibaba จะมีผลฝั่งเราในวันเดียวกันแทนที่จะเป็นหลังผู้ขายต่อเจรจาใหม่ GPT-6 Sol ยังไม่อยู่ในแค็ตตาล็อกของเรา ณ เวลาที่เขียนนี้ และเข้าถึงได้ผ่าน API ของ OpenAI เอง DSL สำหรับการกำหนดเส้นทางคือส่วนที่เข้ากับกรณีนี้โดยเฉพาะ: กฎที่ส่งคำขอที่มีวิดีโอไปทางหนึ่งและส่งอย่างอื่นไปอีกทางคือสิ่งที่มันถูกออกแบบมาเพื่อการนี้ และการสลับสำรองอัตโนมัติหมายความว่ากิ่งแยกตามโมดัลลิตีจะไม่กลายเป็นจุดล้มเหลวจุดเดียว
จุดที่แต่ละอันชนะ
• วิดีโอเข้า ข้อความออก — Qwen3.8-Max และไม่มีคู่แข่งใดให้บรรยาย
• ป้อนข้อความและภาพเข้า โดยใช้ต้นทุนต่อภารกิจที่ทำสำเร็จเป็นตัวชี้วัด — GPT-6 Sol ดีกว่าราวห้าเท่าบนฮาร์เนสอิสระ
• งานแบบ cached-prefix — GPT-6 Sol การอ่านจากแคชมีต้นทุนต่ำกว่าเล็กน้อย และปริมาณโทเคนของมันน้อยกว่าครึ่งหนึ่ง
• คำขอที่เกิน 272,000 โทเค็นอินพุต — Qwen3.8-Max การปรับราคาใหม่ทั้งคำขอของ Sol ถือเป็นความแตกต่างด้านต้นทุนที่ใหญ่ที่สุดเพียงหนึ่งเดียวในการเปรียบเทียบนี้ และไม่ปรากฏให้เห็นในอัตราที่ประกาศไว้
• การปักหมุดที่ทำซ้ำได้ — {{1}}Qwen3.8-Max-0902{{/1}} {{2}}ซึ่งไม่มีค่าใช้จ่ายเพิ่มเติมและเป็นเพียงเวอร์ชันที่ปักหมุดไว้เพียงหนึ่งเดียวจากทั้งสอง{{/2}}
• หากคุณเห็นกราฟที่ Qwen ขึ้นนำใน SWE-bench Pro — ให้ตรวจสอบว่า harness ของใครเป็นตัวสร้างกราฟนั้น และตั้งค่า effort ไว้ที่ระดับใด คณะกรรมการอิสระจัดให้ Qwen ตามหลังอยู่สามคะแนนในคะแนนรวม และตารางของผู้จำหน่ายแต่ละรายไม่ได้อยู่ในมาตราเดียวกัน
การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
