
AREX-2 vs Qwen 3.8: ตัวหนึ่งเป็นซับสเตรตที่อีกตัวหนึ่งน่าจะถูกสร้างขึ้นบนนั้น
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 507 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 194 tok/s
- Orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- xAISpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
การปะทะกันระหว่าง AREX-2 กับ Qwen3.8-Maxดูเหมือนเป็นการดวลกันตรง ๆ ระหว่างระบบเรือธงของสองแล็บจีน และมันไม่ใช่การดวลแบบนั้น — ไม่ใช่เพราะ AREX-2 ยังไม่ผ่านการพิสูจน์ แม้ว่ามันจะเป็นเช่นนั้นก็ตาม แต่เพราะทั้งสองอยู่คนละชั้นของสแตกเดียวกัน Qwen3.8-Max เปิดใช้งานจริงมาตั้งแต่ 3 สิงหาคม 2026 ในราคา 2 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน และ 6 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน พร้อมหน้าต่างบริบท 1 ล้านโทเคน พี่น้องตระกูลโอเพนเวตของมันอย่าง Qwen3.8-27 และ Qwen3.8-Flash เปิดตัวเมื่อ 13 สิงหาคม และ 26 สิงหาคม พร้อมเบนช์มาร์กที่เผยแพร่และราคาที่ประกาศไว้ AREX-2 เป็นรีโพซิทอรีที่ BAAI สร้างบน Hugging Face เมื่อ 29 กันยายน 2026 เวลา 17:56 UTC ซึ่งมีเพียง .gitattributes และไม่มีอะไรอื่น และเหตุผลที่ทั้งสองไม่ใช่คู่แข่งกันนั้นอยู่ที่ข้อเท็จจริงพื้นฐานที่ผู้จำหน่ายทั้งสองรายไม่ได้โฆษณาดัง ๆ นั่นคือ ทุกโมเดล AREX ที่ BAAI เปิดตัวมาจนถึงตอนนี้ล้วนสร้างบนแกนกลางของ Qwen
นั่นไม่ใช่การคาดเดาเกี่ยวกับ AREX-2 แต่เป็นสิ่งที่ได้รับการบันทึกไว้สำหรับรุ่นที่มีอยู่จริง AREX-Base เป็น mixture-of-experts ขนาด 122 พันล้านพารามิเตอร์ ที่มีพารามิเตอร์ทำงานอยู่ 10 พันล้านตัว สร้างบน Qwen3.5-122B-A10B และ AREX-Turbo เป็นโมเดล dense ขนาด 4B ที่สร้างบน Qwen3.5-4B ทั้งสองเปิดตัวเมื่อวันที่ 23 กรกฎาคม 2026 ภายใต้ Apache 2.0 ดังนั้นโฉมหน้าที่ตรงไปตรงมาของการเปรียบเทียบนี้จึงไม่ใช่เอเจนต์ปะทะโมเดลเรือธง แต่เป็นว่า: วันนี้ฐานรากของ Alibaba ให้อะไรกับคุณ ชั้นเอเจนต์ของ BAAI เพิ่มอะไรเข้าไปบนนั้น และคำถามข้อที่สองจะตอบได้มากแค่ไหนก่อนที่ BAAI จะอัปโหลดไฟล์
มีอะไรที่เปิดใช้งานอยู่ฝั่ง Qwen และมีค่าใช้จ่ายเท่าไหร่
รุ่น Qwen3.8 นั้นง่ายต่อการวิเคราะห์อย่างผิดปกติ เพราะมีการระบุรายละเอียดอย่างครบถ้วนและเปิดเผยราคาต่อสาธารณะ ในสามระดับที่แตกต่างกัน
• Qwen3.8-Max — เปิดตัวเมื่อวันที่ 3 สิงหาคม 2026 มาพร้อมหน้าต่างบริบทขนาด 1 ล้านโทเคน รองรับอินพุตข้อความ รูปภาพ และวิดีโอแบบเนทีฟ โหมดคิด การเรียกใช้ฟังก์ชัน และเอาต์พุตแบบมีโครงสร้าง รวมถึงรูปแบบการเชื่อมต่อสามแบบ (ที่เข้ากันได้กับ OpenAI, เข้ากันได้กับ Anthropic และ DashScope แบบเนทีฟ) ครอบคลุมห้าภูมิภาค ราคา 2.00 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน และ 6.00 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน โดยการอ่านจากแคชอยู่ที่ 0.25 ดอลลาร์
• Qwen3.8-27B — เปิดตัวเมื่อวันที่ 13 สิงหาคม 2026 เป็นโมเดลแบบ Dense ขนาด 27B พารามิเตอร์ คอนเท็กซ์ 256K (262,144 ตำแหน่ง) รองรับอินพุตข้อความ รูปภาพ และวิดีโอ น้ำหนักภายใต้ Apache 2.0 เผยแพร่บนการ์ดของ Qwen เองด้วยคะแนน 90.3 บน LiveCodeBench v6, 89.2 บน GPQA Diamond, 84.3 บน OSWorld-Verified และ 79.0 บน QwenSWEBench — เป็นตัวเลขที่ผู้พัฒนารายงานเอง ไม่ได้ถูกทำซ้ำโดยอิสระ การวัดผลโดยอิสระระบุว่าอยู่ที่ Artificial Analysis Intelligence Index 33.7 และ 68.1 บน AA Coding index
• Qwen3.8-Flash — เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026 มาพร้อมหน้าต่างบริบท 1 ล้านโทเคนและอินพุตแบบมัลติโมดัลเช่นเดียวกัน ในราคา $0.15 ต่ออินพุตหนึ่งล้านโทเคน และ $0.47 สำหรับเอาต์พุต เป็นระดับราคาย่อมเยาของตระกูลนี้ และเป็นรุ่นที่ทำให้ปริมาณการรับส่งข้อมูลแบบเอเจนต์ในปริมาณมากมีราคาที่จ่ายได้
ยังมีรายการ Qwen3.8ที่ไม่ได้ติดแท็กอยู่ด้วย: เรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ที่ Alibaba ระบุว่าน้ำหนักโมเดลกำลังจะมา และยังไม่สามารถเรียกใช้งานได้จากที่ใดเลย หากคุณกำลังค้นหา "Qwen 3.8" และคาดหวังว่าจะได้หนึ่งโมเดล นั่นคือเหตุผลที่คำตอบคือตระกูลที่มีสี่โมเดล ไม่ใช่หนึ่งเดียว

เมื่อเทียบกับทั้งหมดนั้น สเปกของ AREX-2 มีความยาวเพียงบรรทัดเดียว: รีพอซิทอรี การประทับเวลา และชื่อที่บ่งบอกถึงรุ่นที่สองของบางสิ่งที่ BAAI เคยสร้างมาแล้วครั้งหนึ่ง
รายละเอียดที่ทำให้การเปรียบเทียบทั้งหมดต้องมองใหม่
AREX ไม่ใช่คู่แข่งของ Qwen แต่เป็นผู้ใช้มัน โมเดล AREX รุ่นแรกทั้งสองรุ่นผ่านการ post-train บนแบ็กโบน Qwen3.5 แล้วถูกห่อด้วยเฟรมเวิร์กที่ทำให้พวกมันเป็นเอเจนต์แทนที่จะเป็นโมเดลแชต: ลูปภายในที่ค้นหา เรียกดู และผสานหลักฐานเข้ากับคำตอบที่เป็นตัวเลือกซึ่งมีค่าความเชื่อมั่นกำกับอยู่ และลูปภายนอกที่ตรวจสอบคำตอบนั้นเทียบกับข้อจำกัดดั้งเดิม แล้วเลือกอย่างใดอย่างหนึ่งระหว่างการยอมรับคำตอบนั้น การปรับปรุงคำตอบนั้นให้ละเอียดขึ้น หรือการทิ้งเส้นทางการดำเนินการนั้นแล้วเริ่มต้นใหม่ งานวิศวกรรมที่น่าสนใจใน AREX ไม่ใช่ตัวเครือข่าย แต่เป็นลูป กลไกอัปเดตบริบทที่คอยจัดระเบียบสิ่งที่ค้นพบซึ่งยืนยันแล้ว แคนดิเดตที่ยังเปิดอยู่ และข้อจำกัดที่ยังไม่คลี่คลาย ให้ไม่สับสนตลอดช่วงเวลาอันยาวนาน และอินเทอร์เฟซเครื่องมือที่เปิดให้โมเดลเข้าถึงการค้นหาและการเรียกดูในฐานะแอ็กชันระดับแรก
นั่นคือเหตุผลว่าทำไมตัวเลขที่ตระกูลนี้เผยแพร่เอง — 82.5 บน BrowseComp, 85.4 บน GAIA, 71.0 บน xbench-2510, 89.9 บน DeepSearch QA และ 82.0 บน WideSearch-en สำหรับ 122B Base โดยมี 70.7 / 81.6 / 57.0 / 78.5 / 68.5 สำหรับ 4B Turbo — จึงเทียบไม่ได้กับคะแนนด้านการเขียนโค้ดและเอเจนติกของ Qwen3.8-27B แม้ว่าทั้งสองจะมีเชื้อสายทางสถาปัตยกรรมร่วมกันก็ตาม พวกมันวัดสิ่งที่แตกต่างกัน QwenSWEBench ถามว่าโมเดลสามารถแก้ปัญหาของรีโพซิทอรีได้หรือไม่ BrowseComp ถามว่าเอเจนต์สามารถค้นหาข้อเท็จจริงที่จงใจทำให้หายากได้หรือไม่ ผ่านการค้นหาหลายครั้ง โดยไม่ทำโจทย์หลุดไป เช็กพอยต์ Qwen3.5 แบบดิบได้คะแนนแย่ในอย่างหลังและได้ดีในอย่างแรก ซึ่งเป็นช่องว่างที่โพสต์เทรนนิงและฮาร์เนสของ BAAI มีไว้เพื่อปิดนั่นเอง

สิ่งที่รุ่นที่สองน่าจะเป็นไปได้มากที่สุด
หาก AREX-2 สานต่อรูปแบบนี้ การตีความที่น่าจะเป็นไปได้มากที่สุด — ซึ่งเป็นการอนุมาน ไม่ใช่ข้อเท็จจริง — คือเอเจนต์วิจัยรุ่นที่สองที่ผ่านการโพสต์เทรนบน backbone Qwen ที่ใหม่กว่ารุ่น 3.5 ที่โมเดล AREX ปัจจุบันใช้อยู่ Qwen3.8-27B เป็นแบบ dense, มัลติโมดัล และ Apache 2.0 ซึ่งทำให้มันเป็นตัวเลือกตามธรรมชาติสำหรับเอเจนต์ระดับคุณภาพ; Qwen3.8-Flash มีต้นทุนต่อโทเคนต่ำ ซึ่งสำคัญอย่างมหาศาลเมื่อเอเจนต์ของคุณเรียกใช้หลายสิบครั้งต่อหนึ่งคำถาม และอ่านบริบทที่ขยายใหญ่ขึ้นซ้ำในทุกขั้นตอน
ไม่มีข้อใดในนั้นได้รับการยืนยัน ชื่อนี้ไม่ได้บอกขนาด ไม่ได้บอกแบ็กโบน และไม่ได้บอกวันที่ และการมี "2" ในชื่อสายผลิตภัณฑ์เป็นธรรมเนียมการตั้งชื่อมากกว่าจะเป็นข้อกำหนด สิ่งที่ได้รับการยืนยันนั้นแคบกว่ามาก และควรพูดเช่นนั้น: BAAI สร้างรีโพซิทอรีนี้เมื่อวันที่ 29 กันยายน 2026 ไม่ได้ใส่อะไรลงไป และไม่ได้ประกาศอะไรเลย ไม่มีเวต ไม่มี model card ไม่มีจำนวนพารามิเตอร์ ไม่มีแท็กสัญญาอนุญาต ไม่มี benchmark ไม่มีผู้ให้บริการรายใดที่เสิร์ฟโมเดลนี้ ถ้าคุณเห็นตัวเลขของ AREX-2 ถูกอ้างถึงที่ใดก็ตามในสัปดาห์นี้ พวกมันไม่ใช่ผลการวัด
สิ่งที่คุณสามารถซื้อได้จริงในบ่ายวันนี้
ความไม่สมดุลในทางปฏิบัติระหว่างสองฝ่ายนี้ไม่ได้อยู่ที่คุณภาพ แต่อยู่ที่ว่าฝ่ายหนึ่งมีตารางอัตราค่าบริการ ขณะที่อีกฝ่ายมีเพียงรายชื่อในไดเรกทอรี
ถ้างานของคุณเป็นแบบ agentic และคุณต้องการรากฐานที่ตระกูล AREX ถูกสร้างขึ้นมาบนนั้น แกนหลักที่แท้จริงก็เรียกใช้งานได้: Qwen3.5-122B-A10B อยู่ในแค็ตตาล็อกของ OrcaRouter ในราคา $0.115 ต่อล้านโทเคนอินพุต และ $0.917 ต่อล้านโทเคนเอาต์พุต สูงสุด 128K โทเคน และเพิ่มเป็น $0.287 / $2.294 เมื่อเกินกว่านั้น โดยเปิดใช้งานความสามารถด้านวิชัน การใช้เครื่องมือ และการให้เหตุผล นั่นคือโมเดลที่ AREX-Base นำไป post-train พร้อมใช้งานโดยไม่ต้องรอสิ่งใด
หากคุณต้องการรุ่นปัจจุบัน ทั้งสองระดับของ Qwen3.8 แบบเปิดนั้นอยู่ในแค็ตตาล็อกแล้ว: Qwen3.8-27B ที่ราคา $0.33 ต่ออินพุตหนึ่งล้านโทเค็น และ $2.40 สำหรับเอาต์พุต โดยรันบนโครงสร้างพื้นฐานของเราเอง เพราะน้ำหนักโมเดลเป็นแบบเปิดและไม่มีต้นทุนต่อโทเค็นจากผู้ให้บริการที่ต้องส่งผ่าน และ Qwen3.8-Flashที่ราคา $0.15 / $0.47 สำหรับระดับปริมาณมาก หนึ่ง API ครอบคลุมทั้งสองรุ่น ส่งผ่านราคาตามที่ผู้ให้บริการระบุโดยไม่บวกเพิ่มต่อโทเค็น ดังนั้นเมื่อ Alibaba ปรับราคา ตัวเลขที่นี่ก็ปรับตามในวันเดียวกัน
และเมื่อ AREX-2 ออกวางจำหน่ายจริง เหตุผลที่มันควรอยู่เบื้องหลังเลเยอร์เดียวกันนั้นเป็นเหตุผลเชิงโครงสร้างมากกว่าเชิงโปรโมต ลูปของเอเจนต์ที่เรียกใช้ยี่สิบครั้งต่อหนึ่งคำถามจะคูณอัตราความล้มเหลวของผู้ให้บริการทุกรายด้วยยี่สิบ กฎการจัดเส้นทางที่มีการสลับสำรองอัตโนมัติซึ่งตัดสินใจ ณ เวลาทำงาน คือความแตกต่างระหว่างการที่ไทม์เอาต์กลายเป็นการลองใหม่ กับการที่ไทม์เอาต์กลายเป็นคำตอบที่ผิดอย่างมั่นใจ ข้อโต้แย้งนี้ใช้ได้กับเอเจนต์วิจัยใดก็ตาม และมันจะใช้ได้กับ AREX-2 เมื่อใดก็ตามที่มี AREX-2 ให้จัดเส้นทาง
ใครควรลงมือทำ และลงมือทำในเรื่องใด
ถ้าคุณต้องการเอเจนต์สำหรับงานวิจัยในวันนี้ AREX-Base คือโมเดล AREX ที่มีอยู่จริง มันเปิดตัวในเดือนกรกฎาคมภายใต้ Apache 2.0 และเกณฑ์มาตรฐานด้านเอเจนต์ของมันเป็นของเจ้าของผู้ขายเอง แต่อย่างน้อยก็แนบมากับโมเดลที่ดาวน์โหลดได้ ถ้าคุณต้องการการให้เหตุผลแบบมัลติโมดัลระดับแนวหน้าหรือทราฟฟิกแบบเอเจนต์ปริมาณสูงในวันนี้ ระดับต่าง ๆ ของ Qwen3.8 เปิดใช้งานแล้ว มีการกำหนดราคา และได้รับการให้คะแนนอย่างอิสระบางส่วน และการมีอยู่ของ AREX-2 ก็ไม่ได้เปลี่ยนแปลงการตัดสินใจนั้น
สถานการณ์เดียวที่ AREX-2 มีความสำคัญต่อการตัดสินใจที่คุณกำลังจะทำในสัปดาห์นี้ คือกรณีที่คุณกำลังเลือกแบ็กโบนสำหรับการไฟน์จูน และในกรณีนั้นคำตอบก็ปรากฏอยู่ในแค็ตตาล็อกแล้ว: แบ็กโบน 3.5 ที่ AREX ใช้ยังมีราคาถูกและพร้อมใช้งาน เจเนอเรชัน 3.8 นั้นดีกว่าและก็พร้อมใช้งานเช่นกัน และ AREX รุ่นที่สอง — เมื่อไหร่ก็ตามที่มันมาถึง — แทบจะแน่นอนว่าจะเป็นหลักฐานเกี่ยวกับว่า BAAI คิดว่าฐาน Qwen ตัวไหนที่คุ้มค่าที่จะสร้างต่อยอด ไม่ใช่สิ่งที่จะมาแทนที่มัน
สามสิ่งจะทำให้ส่วนที่เหลือลงตัว: ไฟล์ในทรี การ์ดที่มีจำนวนพารามิเตอร์และฟิลด์โมเดลฐาน และแท็กใบอนุญาต สิ่งแรกในสามสิ่งนี้คือสิ่งที่สำคัญ เพราะจนกว่ามันจะปรากฏ การเปรียบเทียบนี้ก็ยังเป็นแค่การเทียบระหว่างตระกูลที่กำหนดราคาแล้วกับตัวยึดตำแหน่ง
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
