
Qwen 4 Max vs Claude Opus 5: เบนช์มาร์กที่ขยับไปภายใต้ทั้งคู่
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen 4 Max ได้รับการเปิดตัวพรีวิวที่งานประชุม Yunqi ในเมืองหางโจวเมื่อวันที่ 22 กันยายน 2026 — เป็นรุ่นเรือธงของตระกูล Qwen 4 ที่มีสี่โมเดล ซึ่งประกาศออกมาแล้วแต่ยังไม่วางจำหน่าย โดยไม่มีราคา ไม่มีหน้าต่างบริบท และไม่มีคะแนนที่เผยแพร่ Claude Opus 5 เปิดให้ใช้งานทั่วไปตั้งแต่เมื่อวันที่ 24 กรกฎาคม 2026 ในราคา 5.00 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 25.00 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน และมันคือเป้าหมายที่เรือธงทุกรุ่นนับตั้งแต่การเปิดตัว Qwen3.8-Max มุ่งหมายจะเอาชนะ วิธีที่เห็นได้ชัดในการเขียนการเปรียบเทียบนี้คือตารางสเปกที่เว้นหนึ่งคอลัมน์ไว้ว่าง ๆ วิธีที่มีประโยชน์คือการสังเกตว่าเมื่อวันที่ 19 กันยายน 2026 สามวันก่อนการประกาศ Artificial Analysis ได้ให้คะแนน Intelligence Index ของตนใหม่ และ Claude Opus 5 ก็ไม่ได้เป็นโมเดลที่อยู่อันดับสูงสุดอีกต่อไป การเปลี่ยนแปลงเพียงครั้งเดียวนั้นทำให้ต้องนิยามใหม่ว่า Qwen 4 Max ต้องเอาชนะอะไร
อะไรเปลี่ยนแปลงไปเมื่อวันที่ 19 กันยายน
Artificial Analysis เผยแพร่การปรับปรุงดัชนีฉบับ v4.3.2 เมื่อวันที่ 19 กันยายน 2026 ภายใต้ฉบับปัจจุบัน Claude Opus 5 ได้คะแนน 51 บน Intelligence Index ที่ระดับความพยายามในการใช้เหตุผลสูงสุด — 50 ที่ xhigh, 48 ที่ high, 45 ที่ medium และ 39 ที่ low — และอยู่ในอันดับรองจาก Claude Fable 5.1 และ GPT-6 Astra ซึ่งได้ 53 ทั้งคู่ ค่าใช้จ่ายต่องานบนดัชนีนั้นอยู่ที่ $5.86
ถ้าอ่านแล้วดูเหมือนเป็นการลดระดับลง มันไม่ใช่เช่นนั้น ตัวโมเดลไม่ได้เปลี่ยน ดัชนีต่างหากที่เปลี่ยน การรายงานของเราเองตลอดเดือนกรกฎาคมและสิงหาคมอ้างว่า Claude Opus 5 อยู่ที่ 61 ถึง 63 และอยู่บนสุดของตาราง และตัวเลขเหล่านั้นถูกต้องภายใต้การแก้ไขที่บังคับใช้ในขณะนั้น ใครก็ตามที่ยังอ้างตัวเลขเหล่านั้นโดยไม่ระบุวันที่แก้ไข กำลังอ้างตัวเลขที่เลิกใช้แล้ว และนี่คือข้อผิดพลาดที่พบบ่อยที่สุดในการเปรียบเทียบที่เขียนในเดือนนี้ ผลที่ตามมาในทางปฏิบัติคือ ข้อกล่าวอ้างอย่าง "Claude Opus 5 เป็นโมเดลที่ได้คะแนนสูงสุดที่มีให้ใช้" ไม่เป็นความจริงอีกต่อไป และการเปรียบเทียบที่สร้างขึ้นบนข้อกล่าวอ้างนั้นก็ล่มสลาย
สำหรับฝั่ง Qwen ผลที่ตามมายิ่งรุนแรงกว่าเดิม ระดับเรือธงที่ประกาศในเดือนกันยายน 2026 กำลังถูกมุ่งเป้าไปยังเป้าหมายที่ถูกนิยามใหม่ในเดือนกันยายน 2026 ไม่ว่าสุดท้าย Alibaba จะเผยแพร่อะไรสำหรับ Qwen 4 Max ก็จะถูกประเมินเทียบกับลีดเดอร์บอร์ดที่ 53 คือตัวเลขที่ต้องเอาชนะ ไม่ใช่ 63

การเปรียบเทียบที่พูดกันตามตรง
ด้านหนึ่งของตารางนี้สมบูรณ์แล้ว ส่วนอีกด้านหนึ่งว่างเปล่า และการแสร้งทำเป็นอย่างอื่นก็จะเป็นความล้มเหลวทั้งหมดของบทความนี้ ต่อไปนี้คือสิ่งที่รู้กันจริง ๆ:
• สถานะ — Claude Opus 5 เปิดให้ใช้งานทั่วไปตั้งแต่ 24 กรกฎาคม 2026 เทียบกับ Qwen 4 Max ที่ประกาศเมื่อ 22 กันยายน 2026 โดยยังไม่มีกำหนดวันเปิดตัว
• ราคาอินพุต — Claude Opus 5 5.00 ดอลลาร์ต่อ 1 ล้านโทเคน เทียบกับ Qwen 4 Max ที่ไม่เปิดเผย
• ราคาเอาต์พุต — Claude Opus 5 $25.00 ต่อ 1 ล้านโทเคน เทียบกับ Qwen 4 Max ที่ไม่เปิดเผย
• อินพุตที่แคชไว้ — Claude Opus 5 $0.50 ต่อ 1M โทเคนสำหรับการอ่านแคช เทียบกับ Qwen 4 Max ที่ไม่เปิดเผย
• บริบท — Claude Opus 5 1M โทเค็นที่ค่าเริ่มต้นและค่าสูงสุด เทียบกับ Qwen 4 Max ที่ไม่เผยแพร่
• ขีดจำกัดผลลัพธ์ — Claude Opus 5 รองรับ 128K โทเคนแบบซิงโครนัส และ 300K บน Batches API เมื่อใช้ beta header เทียบกับ Qwen 4 Max ที่ไม่เปิดเผยข้อมูล
• รูปแบบข้อมูล — Claude Opus 5 รองรับอินพุตข้อความ รูปภาพ และไฟล์ พร้อมเอาต์พุตข้อความ เทียบกับ Qwen 4 Max ที่ไม่เปิดเผย
• การคิดราคาสำหรับบริบทขนาดยาว — Claude Opus 5 ไม่มีค่าธรรมเนียมเพิ่มเติม ดังนั้นคำขอขนาด 900,000 โทเคนจึงถูกเรียกเก็บในอัตราต่อโทเคนเท่ากับคำขอขนาด 9,000 โทเคน เมื่อเทียบกับ Qwen 4 Max ที่ยังไม่เปิดเผย
• คะแนนอิสระ — Claude Opus 5 ได้ 51 คะแนนบน Artificial Analysis Intelligence Index v4.3.2 ที่ระดับความพยายามสูงสุด เทียบกับ Qwen 4 Max ยังไม่มีการประเมินอิสระ
• คะแนนที่ผู้ขายรายงาน — Claude Opus 5 SWE-bench Verified 96.0%, SWE-bench Pro 79.2%, OSWorld 2.0 70.6%, Terminal-Bench 2.1 อยู่ในช่วง 80 กลาง ๆ ขึ้นอยู่กับฮาร์เนส เมื่อเทียบกับ Qwen 4 Max ไม่มีรายงาน
• การควบคุมการให้เหตุผล — Claude Opus 5 เปิดใช้ adaptive thinking เป็นค่าเริ่มต้น พร้อมระดับความพยายามแบบห้าขั้น เทียบกับ Qwen 4 Max ที่ไม่ได้เปิดเผย
สิบแถวที่ระบุว่า "ยังไม่เผยแพร่" ไม่ใช่กลวิธีทางวาทศิลป์ มันคือสภาพของหลักฐาน และข้อสรุปที่ซื่อตรงจากสิ่งนั้นก็คือ ยังไม่มีใครสามารถเปรียบเทียบขีดความสามารถระหว่างสองโมเดลนี้ได้เลยในตอนนี้
ส่วนของช่องว่างที่จะไม่ปิดลง
ราคาและบริบทจะถูกเผยแพร่ในที่สุด ความแตกต่างอย่างหนึ่งจะยังคงอยู่แม้หลังการเปิดตัว และมันคุ้มค่าที่จะตัดสินใจเรื่องนี้ตั้งแต่ตอนนี้มากกว่าในช่วงสัปดาห์ที่ Qwen 4 Max วางจำหน่าย: โมเดลทั้งสองถูกสร้างมาเพื่อให้ซื้อด้วยวิธีที่แตกต่างกัน
Claude Opus 5 เป็นโมเดลปิดเพียงตัวเดียวในราคาเดียวจากผู้ขายรายเดียว โดยมีคำมั่นสัญญาที่เปิดเผยเกี่ยวกับการเลิกให้บริการว่าจะไม่เร็วกว่าวันที่ 24 กรกฎาคม 2027 นั่นเป็นเป้าหมายที่มั่นคงสำหรับการวางแผนความจุ Qwen 4 Max เป็นเรือธงของตระกูลที่ Alibaba เปิดตัวซ้ำแล้วซ้ำเล่าในหลากหลายช่วงราคาที่กว้างขึ้นมาก — รุ่น Qwen 3.8 ครอบคลุมตั้งแต่เรือธงระดับแนวหน้าที่ราคาอินพุต $2.00 ไปจนถึงระดับ Flash ที่ต่ำกว่านั้นมาก — และระดับเรือธงของสาย Qwen ในอดีตเป็นระดับที่มีอายุการใช้งานที่สั้นที่สุด ก่อนที่ระดับที่ถูกกว่าจะไล่ตามทัน
ความแตกต่างอีกประการหนึ่งคือการเปิดเผยเวต (open weights) และมันชี้ไปในทิศทางตรงกันข้าม เจนเนอเรชัน Qwen 3.8 ได้เผยแพร่เวตของโมเดลที่ใหญ่ที่สุดภายใต้สัญญาอนุญาต Qwen แบบกำหนดเอง ซึ่งเป็นสิ่งที่ทำให้การปรับแต่งละเอียด (fine-tuning) การควอนไทซ์ (quantisation) และการโฮสต์เอง (self-hosting) เป็นไปได้เลยด้วยซ้ำ Claude Opus 5 ไม่มีการเผยแพร่เวตและจะไม่มีด้วย หากภาระงานของคุณต้องการโมเดลที่คุณสามารถรันภายในขอบเขตของตนเอง หรือดัดแปลงแก้ไขได้ นั่นคือข้อได้เปรียบเชิงโครงสร้างที่การปรับปรุงเกณฑ์วัด (benchmark) ใด ๆ ก็ไม่อาจพรากไปจาก Alibaba ได้ และมันคือเหตุผลที่หนักแน่นที่สุดที่ทำให้ควรสนใจการเปรียบเทียบเฉพาะครั้งนี้ แทนที่จะมองมันเป็นแค่การเอาเรือธงรุ่นหนึ่งไปเทียบกับอีกรุ่นหนึ่ง

วิธีรันการเปรียบเทียบนี้ในวันนี้
Claude Opus 5 พร้อมใช้งานแล้ว และ OrcaRouter จัดเส้นทางให้มันเป็น anthropic/claude-opus-5 ในราคาตามที่ Anthropic ประกาศ โดยบวกเพิ่ม 0% — อัตราของผู้ให้บริการถูกส่งผ่านไปโดยไม่ถูกแตะต้อง ดังนั้นตัวเลข $5.00 และ $25.00 ข้างต้นจึงเป็นจำนวนที่คุณถูกเรียกเก็บจริง ไม่ใช่ราคาเทียบเท่าที่บวกเพิ่มแล้ว เรื่องนี้สำคัญกว่าปกติสำหรับโมเดลในช่วงราคานี้ เพราะมาร์จินของแพลตฟอร์ม 10 เปอร์เซ็นต์บนอัตราเอาต์พุต $25.00 คิดเป็น $2.50 ต่อล้านโทเคน ซึ่งมากกว่าต้นทุนอินพุตทั้งหมดของทางเลือกแบบเปิดน้ำหนักส่วนใหญ่เสียอีก นอกจากนี้ แคตตาล็อกยังมีโมเดลเกือบ 200 รายการบนเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI พร้อมการสลับไปใช้เส้นทางสำรองอัตโนมัติเมื่อเส้นทางของผู้ให้บริการมีปัญหา และมี DSL สำหรับจัดเส้นทางเพื่อกำหนดนโยบายอย่างชัดเจนแทนการฮาร์ดโค้ดชื่อโมเดลลงในแอปพลิเคชันของคุณ
สิ่งที่ OrcaRouter ไม่มีให้บริการคือ Qwen 4 Max หรือรุ่นใด ๆ ในตระกูล Qwen 4 แคตตาล็อกไม่มีรายการสำหรับตระกูลนี้เลย ซึ่งเป็นสิ่งที่คาดได้สำหรับโมเดลที่ประกาศแล้วแต่ยังไม่เปิดตัว เมื่อรุ่นต่าง ๆ เปิดตัวจริง พวกมันก็จะปรากฏในตำแหน่งเดียวกัน และจนกว่าจะถึงตอนนั้น โมเดล Qwen ที่น่าเปรียบเทียบกับ Claude Opus 5 คือโมเดลที่คุณเรียกใช้ได้จริง: Qwen3.8-Max ซึ่งพร้อมใช้งานทั่วไปตั้งแต่ 3 สิงหาคม 2026 ในราคา $2.00 ต่ออินพุต และ $6.00 ต่อเอาต์พุตต่อล้านโทเค็น โดยมีน้ำหนักโมเดลที่เผยแพร่ และมีคะแนนความฉลาดอิสระที่บันทึกไว้ที่ 56 ในราคา $1.14 ต่องาน — ตัวเลขที่บันทึกไว้ภายใต้การแก้ไขดัชนีเวอร์ชันก่อนหน้า ดังนั้นให้เปรียบเทียบกับ 51 ของ Claude Opus 5 โดยแนบข้อแม้นี้ไว้ด้วย
จะทำอย่างไรกับสิ่งนี้ก่อนที่จะมีโมเดลการ์ด
ไม่มีคำตัดสินใด ๆ ที่จะให้ในที่นี้ เพราะหนึ่งในสองโมเดลไม่ได้มีอยู่จริงในฐานะผลิตภัณฑ์ สิ่งที่พูดได้ก็คือ การเปรียบเทียบได้เปลี่ยนรูปแบบไปเมื่อวันที่ 19 กันยายน 2026 โดยที่ผู้ขายทั้งสองรายไม่ได้ทำอะไรเลย: Claude Opus 5 ไม่ใช่โมเดลที่ได้คะแนนสูงสุดบนดัชนีอิสระที่การเปรียบเทียบส่วนใหญ่พึ่งพาอีกต่อไป และตอนนี้มันตามหลังโมเดลอื่นอีกสองตัวอยู่สองคะแนน การเปิดตัว Qwen 4 Max จะเข้าไปอยู่ในตารางนั้น ไม่ใช่ตารางจากเดือนกรกฎาคม
ดังนั้นการตัดสินใจสำหรับอีกไม่กี่เดือนข้างหน้าจึงไม่ใช่ Qwen 4 Max กับ Claude Opus 5 แต่เป็น Claude Opus 5 กับโมเดล Qwen ที่เปิดตัวไปแล้ว — โมเดลเรือธงในราคาอินพุตหนึ่งในห้า พร้อมเผยแพร่น้ำหนักโมเดล — และการเปรียบเทียบนั้นมีให้ดูได้แล้วตอนนี้ พร้อมตัวเลขจริงจากทั้งสองฝ่าย กลับมาพิจารณาอีกครั้งเมื่อ Alibaba เผยแพร่ model card และให้ถือว่าตาราง benchmark ของ Qwen 4 Max ใด ๆ ที่คุณเห็นก่อนหน้านั้นเป็นข้อมูลที่ยังไม่ได้รับการยืนยัน

การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
