
GPT-6 Astra vs Qwen3.8-Max: สองเรือธงสายเอเจนต์ กับรายละเอียดปลีกย่อยภายใต้แต่ละรุ่น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
เดือนกันยายน 2026 มีเรื่องราวของ “เรือธงเชิงเอเจนต์” สองเรื่อง และ GPT-6 Astra กับ Qwen3.8-Max คือตัวละครหลักของทั้งสองเรื่อง OpenAI เปิดตัว GPT-6 Astra เมื่อวันที่ 3 กันยายน โดยอ้างว่าเป็นโมเดลที่ดีที่สุดในโลกสำหรับการใช้คอมพิวเตอร์ วิศวกรรมซอฟต์แวร์ วิทยาศาสตร์ และความมั่นคงปลอดภัยไซเบอร์ ส่วน Qwen3.8-Max ของ Alibaba ที่ออกมาตั้งแต่วันที่ 3 สิงหาคม เป็นเรือธงเชิงเอเจนต์ของแล็บจีนที่แข็งแกร่งที่สุด ซึ่ง Artificial Analysis จัดอันดับให้อยู่ในระดับแนวหน้าของวงการในดัชนีเอเจนต์ และเป็นคู่แข่งระบบนิเวศเปิดที่ใกล้เคียงที่สุดกับคำกล่าวอ้างเรื่องการทำงานอัตโนมัติระดับแนวหน้า ทั้งสองโมเดลแข็งแกร่งจริง และทั้งคู่ก็ถูกขายพร้อมตัวเลขเด่นที่หดหายเมื่อถูกตรวจสอบอย่างละเอียด: ผล ARC-AGI-3 ของ OpenAI ที่ 99.9% ลดลงเหลือ 62.7% เมื่อ ARC Prize ใช้ชุดทดสอบที่เป็นกลางของตัวเอง ส่วนความเก่งเชิงเอเจนต์ของ Qwen3.8-Max มาพร้อมกับการถดถอยด้านอาการหลอนที่วัดได้โดยอิสระ และนิสัยที่ใช้ 64 รอบกับเงินกว่าหนึ่งดอลลาร์สำหรับงานที่รุ่นก่อนทำเสร็จใน 14 รอบ นี่คือการเปรียบเทียบระหว่างสองโมเดล — และระหว่างสองวิธีในการอ่านเกณฑ์วัดผล
พาดหัวข่าวทั้งสอง
จุดขายของ OpenAI สำหรับ GPT-6 Astra คือความกว้างของขีดความสามารถและการทำงานด้วยตนเอง: โมเดลตัวเดียวที่ควบคุมเบราว์เซอร์ เขียนและแก้ไขโค้ด ดำเนินการวิเคราะห์ทางวิทยาศาสตร์ และ—อย่างไม่เหมือนใคร—ค้นพบช่องโหว่ด้านความปลอดภัยแบบใหม่ได้ดีพอที่ OpenAI จัดระดับความเสี่ยงของทั้งโมเดลว่า 'วิกฤต' ภายใต้กรอบการเตรียมความพร้อม (Preparedness Framework) และจำกัดการตั้งค่าที่ทรงพลังที่สุดให้ใช้งานได้เฉพาะพันธมิตรที่ผ่านการตรวจสอบ เอกสารเปิดตัวอ้างว่าได้คะแนนเต็ม 100% บน ExploitBench, 97.6% บน FrontierMath Tier 4, 96.0% บน GPQA Diamond และคะแนนอิ่มตัว (saturation score) บน ARC-AGI-3 ส่วนจุดขายของ Alibaba สำหรับ Qwen3.8-Max นั้นแคบกว่าแต่เฉียบคม: โมเดลเอเจนต์ที่รับงานหนักได้ในราคา $2/$6 ซึ่งทำคะแนนสูงสุดหรือเกือบสูงสุดในการประเมินความสามารถด้านเอเจนต์โดยหน่วยงานอิสระ โดยเปิดเผยน้ำหนักของโมเดล (ภายใต้ไลเซนส์แบบกำหนดเอง) แทนที่จะซ่อนไว้ในกล่องดำ
กระดานคะแนนอิสระบอกว่าอะไร
Artificial Analysis ในปัจจุบันให้คะแนน GPT-6 Astra (max) ที่ระดับความฉลาด 61 — อยู่อันดับ 8 จาก 202 โมเดลที่มันติดตาม — และ Qwen3.8-Max ที่ระดับความฉลาด 58 อันดับ 24 ช่องว่างสามจุดนี้เล็กกว่าช่องว่างด้านราคา และเล็กกว่าคำโฆษณาของผู้ให้บริการทั้งสองราย ในดัชนี agentic แยกต่างหากของ AA นั้น Qwen3.8-Max ทำได้ 58 ซึ่งทำให้มันอยู่ในระดับเดียวกับโมเดล proprietary ชั้นแนวหน้า ขณะที่ AA ยังไม่ได้เผยแพร่ดัชนี agentic สำหรับ GPT-6 Astra เลย การอ่านอย่างตรงไปตรงมาคือ: ในแง่ความฉลาดที่วัดได้จริง ทั้งสองรุ่นนี้เป็นเพื่อนบ้านที่ใกล้ชิดกัน และการวางกรอบว่าเป็น "โมเดลที่ฉลาดที่สุดในโลก" ในเอกสารเปิดตัวของ OpenAI ไม่ใช่สิ่งที่การประเมินอิสระของ AA แสดงให้เห็น
• ความฉลาด — GPT-6 Astra (max): AA Intelligence 61, อันดับที่ 8/202. Qwen3.8-Max: AA Intelligence 58, อันดับที่ 24/202; AA Agentic 58.
• ราคาตามประกาศ — GPT-6 Astra: $10.00 / $50.00 ต่อ 1M, $1.00 สำหรับการอ่านแคช, 2× สำหรับอินพุตที่เกิน 272K tokens Qwen3.8-Max: $2.00 / $6.00 ต่อ 1M, $0.25 สำหรับการอ่านแคช
• บริบท / เอาต์พุต — GPT-6 Astra: 1.05M อินพุต / 128K เอาต์พุต. Qwen3.8-Max: 1M อินพุต / ~128K เอาต์พุต.
• หลักฐานเชิงเอเจนต์ — GPT-6 Astra: ทำได้ 99.9% บน ARC-AGI-3 (ชุดทดสอบของ OpenAI) เทียบกับ 62.7% (ชุดทดสอบมาตรฐานของ ARC Prize); WANDR 0.682 ที่ $11.98/งาน (รายงานโดย Perplexity). Qwen3.8-Max: ทำได้ 1,739 Elo บน AA GDPval ที่ 64 เทิร์น/งาน (~$1.14/งาน); Code Arena WebDev #1 ด้วย 1,691 Elo.
• ธงแดงอิสระ — GPT-6 Astra: ยังไม่มีในตัวเลือกโมเดลของ ChatGPT, API แบบทยอยเปิดตัว, การยอมผ่อนปรนด้านความสามารถในการตรวจสอบได้ ส่วน Qwen3.8-Max: AA-Omniscience พบการถดถอยด้านอัตราภาพหลอน (hallucination) จาก 23% เป็น 40% เมื่อเทียบกับรุ่นก่อนหน้า
• น้ำหนัก — GPT-6 Astra: เป็นกรรมสิทธิ์ ส่วน Qwen3.8-Max: checkpoint ระดับ Max (Qwen3.8-2.4T-A95B) ซึ่งเผยแพร่ต่อสาธารณะภายใต้ไลเซนส์แบบกำหนดเองตั้งแต่วันที่ 12 สิงหาคม โดย AA ยังคงระบุโมเดลเรือธงที่โฮสต์ไว้ว่าเป็นกรรมสิทธิ์

รายละเอียดปลีกย่อย พร้อมคำอธิบายประกอบ
พิจารณาตัวเลข ARC-AGI-3 ก่อน เพราะมันเป็นตัวอย่างที่ชัดเจนที่สุดของการที่ตัวเลขหนึ่งสามารถเป็นจริงและทำให้เข้าใจผิดได้ในเวลาเดียวกัน OpenAI รายงาน 99.9% สำหรับ GPT-6 Astra บนแฮร์เนส provider-adapter ของตนเอง ซึ่งเป็นระบบที่ปรับแต่งเฉพาะให้กับโมเดล ขณะที่ ARC Prize ซึ่งเป็นองค์กรผู้ดูแล benchmark ได้รัน GPT-6 Astra บนแฮร์เนสมาตรฐานที่เป็นกลางต่อผู้ให้บริการ และได้ผลลัพธ์ 62.7% ผลลัพธ์ทั้งคู่เป็นระดับแนวหน้า แต่ไม่มีตัวใดได้ 99.9% บนแฮร์เนสที่ผู้ผลิตโมเดลไม่ได้ควบคุม ข้อควรระวังเดียวกันนี้ใช้กับการให้คะแนน WANDR ของ Perplexity ที่ 0.682 ซึ่งเป็นค่าสูงสุดที่ Perplexity เคยบันทึกได้ แต่ถูกวัดโดยบริษัทที่กำลังรวม GPT-6 Astra เข้ากับผลิตภัณฑ์ของตัวเองพร้อมกัน จึงมีส่วนได้ส่วนเสียในเชิงพาณิชย์ รูปแบบนี้ควรได้รับการตั้งชื่อ: ตัวเลขที่โดดเด่นที่สุดของ OpenAI ล้วนมาจากแฮร์เนสที่ OpenAI หรือพันธมิตรควบคุม และตัวเลขหนึ่งเดียวที่เป็นอิสระอย่างสมบูรณ์ — AA's Intelligence 61 — เป็นเพียงแค่ยอดเยี่ยมเท่านั้น
รายละเอียดปลีกย่อยของ Qwen3.8-Max กลับเป็นอีกทางหนึ่ง: จุดแข็งของมันถูกวัดอย่างอิสระ และจุดอ่อนของมันก็ถูกวัดอย่างอิสระเช่นกัน คะแนน GDPval ที่ 1,739 Elo นั้นเป็นของจริง — แต่การทดสอบของ Artificial Analysis แสดงให้เห็นว่า Qwen3.8-Max ทำคะแนนนั้นได้โดยใช้ 64 เทิร์นและประมาณ $1.14 ต่องาน ในขณะที่รุ่นก่อนหน้าใช้ 14 เทิร์นและ $0.53 นั่นคือภาษีความพยายาม: โมเดลซื้อเพดานความสามารถแบบ agentic ด้วยโทเค็นสำหรับการคิด ซึ่งสำคัญสำหรับใครก็ตามที่จ่ายต่อโทเค็น และการประเมิน Omniscience ของ AA วัดการถดถอยด้านอาการหลอน (hallucination) จาก 23% เป็น 40% เมื่อเทียบกับ Qwen รุ่นก่อนหน้า — ซึ่งเป็นสัญญาณอิสระที่แท้จริงสำหรับงานแบบอัตโนมัติและหลายขั้นตอน ที่คำตอบที่ผิดอย่างมั่นใจมีราคาแพงที่สุด โมเดลที่พูดโน้มน้าวตัวเองให้ผิดพลาดตลอด 64 เทิร์น ก็ไม่ได้ดูปลอดภัยกว่าที่จะปล่อยใช้งาน เมื่อเทียบกับโมเดลที่ผู้สร้างยอมรับว่าความสามารถในการตรวจสอบลดลง

ราคา การปรับใช้ และวิธีเลือกที่ตรงไปตรงมา
ในเรื่องราคาไม่ต้องแข่งกันเลย: Qwen3.8-Max ที่ราคา $2.00 / $6.00 ต่อล้านโทเคน คิดเป็นหนึ่งในห้าของราคาอินพุตของ GPT-6 Astra และหนึ่งในแปดของราคาเอาต์พุต พร้อมบริบท 1M โทเคนซึ่งไม่มีค่าธรรมเนียมเพิ่มสำหรับพรอมป์ต์ยาวของ Astra ในด้านการปรับใช้งาน Qwen3.8-Max ยังได้เปรียบเพิ่มในสัปดาห์นี้ — เรียกใช้ได้แล้วตั้งแต่วันนี้ และเปิดใช้งานบน OrcaRouter แล้วในราคาตามรายการของ Alibaba โดยส่งผ่านโดยไม่คิดมาร์กอัปเพิ่ม (0%) พร้อมระบบ failover อัตโนมัติ GPT-6 Astra ซึ่งยังอยู่ในระหว่างการทยอยเปิดตัว และยังไม่สามารถเลือกใช้ใน ChatGPT สำหรับผู้ใช้ส่วนใหญ่ ณ วันที่ 4 กันยายน ยังเข้าถึงได้ผ่าน API ของ OpenAI เองและตลาดคลาวด์รายใหญ่ ขณะที่การเข้าถึงกำลังขยายวงกว้างขึ้น รูปแบบที่ใช้งานได้จริงสำหรับทีมที่สร้างไพพ์ไลน์แบบ agentic คือการโหลดงานลงบนโมเดลที่เรียกใช้ได้ในวันนี้ และมองอีกตัวหนึ่งเป็นเพียง benchmark ที่ต้องจับตามอง หากคุณต้องการประเมินคำกล่าวอ้างแบบ “agentic” มากกว่าจะเชื่อถือ ชั้นเส้นทาง (routing layer) คือเครื่องมือที่ใช่: Qwen3.8-Max, Kimi K3, Grok 4.6 และโมเดลอื่น ๆ อีก 200+ รายการอยู่หลังคีย์เดียวบน OrcaRouter และrouting DSL สามารถประกอบโมเดลหลายตัวให้เป็นการเรียกครั้งเดียวได้ — คุณจึงสามารถรันชุดงานทดสอบของตัวเองเทียบกับคู่แข่ง และอ่านผลลัพธ์ด้วยตัวเอง แทนที่จะต้องเลือกระหว่างรายละเอียดปลีกย่อยของผู้ให้บริการสองราย.
การแข่งขันนี้ทำให้เกิดคำถามสองข้ออยู่เรื่อย ๆ
เหตุใด OpenAI จึงรายงานผล 99.9% บน ARC-AGI-3 ในขณะที่ ARC Prize วัดค่าได้ 62.7%? เพราะมันไม่ใช่การทดสอบเดียวกัน ชุดทดสอบแบบ provider-adapter ของ OpenAI เป็นเวอร์ชันหนึ่งของเบนช์มาร์กที่กำหนดค่าตามวิธีที่ GPT-6 Astra ถูกเรียกใช้ในการผลิตจริง ส่วนชุดทดสอบมาตรฐานของ ARC Prize เป็นการกำหนดค่าที่เป็นกลาง ซึ่งออกแบบมาเพื่อเปรียบเทียบโมเดลใด ๆ อย่างยุติธรรม ผลลัพธ์ 62.7% คือค่าที่นำไปใช้อ้างอิงกับสถานการณ์ “ถ้าฉันเรียกใช้โมเดลนี้ด้วยตัวเอง” และก็ยังคงเป็นคะแนนดีที่สุดที่ ARC Prize เคยบันทึกไว้ในชุดทดสอบนั้น
Qwen3.8-Max เป็นโมเดลแบบเปิดน้ำหนัก (open weights) หรือไม่? ตอบว่าเพียงบางส่วน และมีข้อแม้เรื่องใบอนุญาต Alibaba เผยแพร่ checkpoint ระดับ Max อย่าง Qwen3.8-2.4T-A95B เมื่อวันที่ 12 สิงหาคมภายใต้ใบอนุญาตเฉพาะ (custom license) — ตัวน้ำหนักดาวน์โหลดได้จริง แต่ก็ไม่เทียบเท่าความเปิดกว้างแบบ Apache-2.0 ของ Qwen3.8-27B ที่เล็กกว่า และ Artificial Analysis ยังคงจัดให้โมเดลเรือธงที่โฮสต์ให้บริการอยู่นี้เป็น proprietary หากความต้องการของคุณคือ "ฉันต้องรันโมเดลตัวเดียวกับที่จ่ายเงินจริง" ความแตกต่างนี้สำคัญ; แต่ถ้าความต้องการของคุณคือ "ฉันสามารถตรวจสอบสถาปัตยกรรมและโฮสต์เวอร์ชันใกล้เคียงได้เอง" Qwen3.8-Max ก็เข้าข่าย ในขณะที่ GPT-6 Astra ไม่เข้าข่าย
ข้อสรุป
เลือก GPT-6 Astra หากคุณต้องการความสามารถเฉพาะที่มันเท่านั้นที่ทำได้ในตอนนี้ ไม่ว่าจะเป็นงานด้านความมั่นคงปลอดภัยเชิงรุก (offensive security) การใช้เหตุผลทางวิทยาศาสตร์ระดับแนวหน้า หรืองานใช้คอมพิวเตอร์อัตโนมัติที่ยากที่สุด — และองค์กรของคุณสามารถผ่านเกณฑ์การเข้าถึง (gating) และแบกรับราคาได้ เลือก Qwen3.8-Max หากคุณต้องการโมเดลแบบเอเจนต์ (agentic) ระดับแนวหน้าที่คุณสามารถนำไปใช้งานจริงได้ในสัปดาห์นี้ในราคา $2/$6 โดยมีน้ำหนัก (weights) เป็นทางเลือกสำรอง พร้อมกับรู้แล้วว่าต้องทดสอบ regression ด้านการหลอน (hallucination) ที่อาจกลับมา บทเรียนในวงกว้างคือรายละเอียดเล็กๆ น้อยๆ นั้นเอง: ในเดือนกันยายน 2026 เรือธง "เอเจนต์" (agentic) ชั้นนำสองรุ่นถูกวางจำหน่ายพร้อมตัวเลขโฆษณาที่ผู้ผลิตทั้งสองรายไม่ได้ควบคุมอย่างเต็มที่ และผู้ซื้อที่รอบคอบจะอ่านรายละเอียดของชุดทดสอบ (harness) นับจำนวนเทิร์น (turns) และรันงานของตัวเองก่อนจะเลือกข้าง

การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
