
Nex-N2.5 Pro เทียบกับ Claude Opus 5: Nex-AGI เลือกไม้บรรทัด และไม้บรรทัดก็เป็นฝ่ายชนะ
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0455ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0247ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0247ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0157ความฉลาด82การเขียนโค้ด
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2646ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1849ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1541ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1251ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0547ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0347ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2140ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128ความฉลาด49การเขียนโค้ด
Nex-AGI เลือกเกณฑ์วัดผล และเกณฑ์วัดผลก็เป็นฝ่ายชนะ เมื่อพันธมิตรโมเดลโอเพนซึ่งมีฐานในเซี่ยงไฮ้เปิดตัว Nex-N2.5 Pro เมื่อวันที่ 8 กันยายน 2026 ตารางการใช้งานคอมพิวเตอร์ในการ์ดโมเดลได้วาง Claude Opus 5 ไว้ในคอลัมน์เปรียบเทียบ และวาง Nex-N2.5 Pro ไว้ในช่องผู้ท้าชิง: 68.3 สำหรับ Claude Opus 5 เทียบกับ 56.4 สำหรับ Nex-N2.5 Pro บน OSWorld-2 โดยทั้งสองตัวเลขตรงกับที่ Nex-AGI พิมพ์ลงในการ์ดของตัวเองทุกประการ ลีดเดอร์บอร์ดอิสระนับตั้งแต่นั้นกลับยิ่งขยายช่องว่างให้กว้างขึ้น แทนที่จะแคบลง — สแนปช็อต OSWorld 2.0 ของ BenchLM ณ วันที่ 29 สิงหาคมจัดอันดับให้ Claude Opus 5 อยู่อันดับหนึ่งในสิบห้าโมเดลที่ระบุไว้ ที่คะแนน 70.6 การยอมรับว่าตามหลังผู้นำสนามอยู่สิบสองคะแนนบนเกณฑ์วัดที่คุณเลือกเองว่าจะเผยแพร่ ไม่ใช่ท่าเปิดตัวที่ใครๆ ทำกัน ซึ่งคือเหตุผลว่าทำไมส่วนที่น่าสนใจของการเปรียบเทียบ Nex-N2.5 Pro กับ Claude Opus 5 จึงไม่ใช่ตัวเลขคะแนน หากแต่เป็นสิ่งที่ทั้งสองฝั่งของคะแนนนั้นเป็นจริงๆ: โมเดลใช้งานคอมพิวเตอร์แบบโอเพนขนาด 397 พันล้านพารามิเตอร์ที่ไม่มีใครนอกพันธมิตรสามารถรันหรือตรวจสอบยืนยันได้ กับเรือธงแบบปิดของ Anthropic ที่ครองตำแหน่งผู้นำลีดเดอร์บอร์ดและรองรับทราฟฟิกในระบบการผลิตมาตั้งแต่ปลายเดือนกรกฎาคม
คำสรุปที่ตรงไปตรงมาตั้งแต่ต้น: นี่ไม่ใช่การแข่งขันระหว่างปริมาณที่วัดได้สองฝั่ง เพราะมีเพียงฝั่งเดียวเท่านั้นที่ถูกวัดโดยใครก็ตามที่ไม่ใช่ผู้สร้างมัน Nex-N2.5 Pro เป็นโมเดลแบบ sparse mixture-of-experts มีพารามิเตอร์ที่ใช้งานจริงประมาณ 1.7 หมื่นล้านตัว จากทั้งหมด 397 พันล้านตัว ผ่านการเทรนต่อจากตระกูล Qwen3.5 มุ่งเป้าไปที่การควบคุมคอมพิวเตอร์และเบราว์เซอร์แบบหลายขั้นตอนระยะยาวพร้อมวงจรป้อนกลับทางภาพ โดยตอนนี้มันถูกให้บริการผ่านปลายทางโฮสต์ฟรีที่ลิงก์จากหน้าโมเดลการ์ดของ Nex-AGI ขณะที่น้ำหนักโมเดลภายใต้สัญญา Apache-2.0 ซึ่งเป็นรากฐานของตระกูลนี้ ยังคงถูกระบุว่า "เร็วๆ นี้" โดยไม่มีกำหนดวัน ส่วน Claude Opus 5 คือเรือธงระดับโปรดักชันของ Anthropic สำหรับงานที่ต้องใช้การให้เหตุผล การเขียนโค้ด และงานแบบเอเจนต์ — เป็นโมเดลปิดที่มีบริบท 1 ล้านโทเคน มีแป้นปรับระดับการคิดแบบปรับได้ มีราคาที่ระบุไว้ชัดเจน และมีประวัติการติดอันดับลีดเดอร์บอร์ดสาธารณะและการใช้งานจริงหลายสัปดาห์รองรับ ข้อได้เปรียบทั้งหมดในการประมือครั้งนี้ล้วนมาจากหนึ่งในสองข้อเท็จจริง: โมเดลหนึ่งสามารถรันได้และตรวจสอบได้จริง ส่วนอีกโมเดลหนึ่งไม่มีความสามารถใดๆ เลย
เกณฑ์มาตรฐานที่ทั้งสองฝ่ายเห็นพ้องต้องกัน
เกณฑ์ชี้วัดการใช้งานคอมพิวเตอร์ให้รางวัลกับพฤติกรรมแบบเดียวกับที่โมเดลเหล่านี้ถูกสร้างมาเพื่อจำหน่าย นั่นคือ เอเจนต์ที่มองหน้าจอ ตัดสินใจเลือกการกระทำ ลงมือทำ แล้วอ่านผลจากหน้าจอที่เปลี่ยนไปเพื่อตรวจสอบว่าการกระทำนั้นสำเร็จหรือไม่ Nex-N2.5 Pro ถูกออกแบบสถาปัตยกรรมรอบวงจรป้อนกลับนั้นพอดี — วิทัศน์ไม่ใช่โมดอลิตี้สำหรับรับข้อมูลที่ถูกต่อพ่วงเข้ากับตัวโมเดล แต่คือช่องทางป้อนกลับที่เอเจนต์ใช้ตรวจสอบยืนยันผลการทำงาน Claude Opus 5 มองวงจรเดียวกันนี้เป็นเพียงหนึ่งในเวิร์กโหลดจำนวนมาก แต่มันบังเอิญทำได้ดีมากในเรื่องนี้ ซึ่งเป็นเหตุผลที่ Nex-AGI เลือกใช้มันเป็นจุดอ้างอิงตั้งแต่แรก
พูดอย่างเคร่งครัดแล้ว ตัวเลขทั้งสองค่าไม่ได้มาจากชุดประเมินผล (harness) ชุดเดียวกัน Nex-AGI ได้ตัวเลข OSWorld-2 มาโดยใช้ชุดประเมินผล NexCUA ของตัวเอง ซึ่งบริษัทระบุว่าจะเปิดเป็นโอเพนซอร์สแต่ยังไม่ได้เผยแพร่ ขณะที่ค่า 56.4 ของ Nex-N2.5 Pro เป็นตัวเลขจากผู้พัฒนาที่ยังไม่มีการตรวจสอบซ้ำ ส่วนคะแนน 70.6 ของ Claude Opus 5 บน BenchLM เป็นข้อมูลสแนปชอตจากบุคคลที่สามของ OSWorld 2.0 ลงวันที่ 29 สิงหาคม 2026 และสอดคล้องกับค่า 68.3 ที่ Nex-AGI เองอ้างอิงจากแหล่งลีดเดอร์บอร์ด ด้วยความที่ชุดประเมินผลต่างกันและเวอร์ชันเกณฑ์มาตรฐานคลาดเคลื่อนกันเล็กน้อย ช่องว่างที่แท้จริง — สิบสองคะแนนตามข้อมูลของ Nex-AGI เอง และราวสิบสี่คะแนนตาม BenchLM — จึงควรตีความเป็นเพียงแนวโน้มเท่านั้น อย่างไรก็ตาม ไม่มีข้อโต้แย้งว่า Nex-N2.5 Pro ตามตัวเลขที่ดีที่สุดที่มีอยู่จากทั้งสองฝ่าย อยู่ในระดับต่ำกว่าเอเจนต์ใช้งานคอมพิวเตอร์ระดับแนวหน้าในปัจจุบัน

สองคำตอบสำหรับ "วันนี้ฉันรันมันได้ไหม"

นี่คือทางแยกที่แท้จริงซึ่งชี้ขาดผลแพ้ชนะสำหรับทีมที่ต้องลงมือทำงานจริง และมันไม่ได้เข้าข้างผู้มาใหม่ การ์ด Hugging Face ของ Nex-N2.5 Pro ยังคงขึ้นป้ายไว้ว่า weights จะออกมาเร็ว ๆ นี้ภายใต้สัญญาอนุญาต Apache-2.0 โดยไม่มีการระบุวันปล่อยแต่อย่างใด Build ที่ใช้งานได้จริงในตอนนี้มีเพียงเอนด์พอยต์โฮสต์ฟรีที่ Nex-AGI ลิงก์ไว้จากหน้าการ์ดเท่านั้น — เรียกใช้ได้ก็จริง แต่เป็นของคนอื่น ไม่มีราคาที่ประกาศไว้ ไม่มีข้อกำหนดการให้บริการที่ทีมจะเอาไปใช้วางแผนได้ และไม่มีทางทำซ้ำตัวเลข benchmark ได้แม้แต่ตัวเดียวบนฮาร์ดแวร์ของคุณเอง เมื่อถึงวันที่ weights ถูกปล่อยออกมาจริง ๆ แนวทางการ serve ที่ระบุในเอกสารคือโหนดเดียวที่มี H100 แปดตัวบนอิมเมจ SGLang ที่ปรับแต่งมา — เป็นการใช้ทรัพยากรที่เกิดขึ้นจริงแต่ก็ถือว่าธรรมดาสำหรับ MoE 397B และนี่คือเหตุผลว่าทำไมดีไซน์ 17B-active จึงน่าสนใจ จนกว่าจะถึงตอนนั้น Nex-N2.5 Pro ก็เป็นแค่พรีวิวที่ให้คุณเรียกใช้สอบถามได้ ไม่ใช่โมเดลที่คุณจะเอาไปต่อยอดสร้างอะไรได้
Claude Opus 5 ตรงกันข้ามในทุกแถวเหล่านั้น มันถูกให้บริการผ่าน API ของ Anthropic และบนแพลตฟอร์มที่จัดเส้นทางตั้งแต่วันที่ 24 กรกฎาคม ราคาของมันเปิดเผยและคงที่ น้ำหนักของมันเป็นแบบปิดและจะคงปิดต่อไป และตัวเลขใดๆ ของมันสามารถตรวจสอบได้ในวันนี้โดยการรันมัน ระบบนิเวศโดยรอบ — Claude Code, เครื่องมือ MCP และกลุ่มเอเจนต์การผลิตที่ใช้งานมันอย่างหนักเป็นเวลาหกสัปดาห์ — คือบันทึกสะสมที่โมเดลอายุหนึ่งวันไม่สามารถอ้างได้ สำหรับทีมที่มีข้อกำหนดว่า "โมเดลต้องทำงานได้ในไตรมาสหน้า" บันทึกนั้นคือตัวชี้ขาดทั้งหมด
เอกสารข้อมูลจำเพาะ ซึ่งก็มีอยู่เพียงเท่านี้
วางซองจดหมายสองซองไว้เคียงข้างกัน:
• เผยแพร่ — Nex-N2.5 Pro: 8 กันยายน 2026 (เอนด์พอยต์ที่โฮสต์พร้อมใช้งานแล้ว ยังรอการเผยแพร่น้ำหนัก) Claude Opus 5: 24 กรกฎาคม 2026 พร้อมใช้งานโดยทั่วไป
• ขนาด — Nex-N2.5 Pro: รวม 397B / แอ็กทีฟ ~17B MoE. Claude Opus 5: ไม่เปิดเผยจำนวนพารามิเตอร์.
• โมดาลิตี้ — Nex-N2.5 Pro: รับข้อความและรูปภาพเข้า ส่งออกเป็นข้อความ โดยระบบวิทัศน์เป็นศูนย์กลางของลูปการใช้งานคอมพิวเตอร์ Claude Opus 5: รับข้อความและรูปภาพเข้า ส่งออกเป็นข้อความ พร้อมการวิเคราะห์ภาพที่แข็งแกร่ง
• บริบท / ผลลัพธ์ — Nex-N2.5 Pro: บริบท 262,144 โทเคน ความยาวการให้บริการตามเอกสาร Claude Opus 5: บริบท 1M โทเคน เพดานผลลัพธ์ 128K โทเคน
• การควบคุมการให้เหตุผล — Nex-N2.5 Pro: สวิตช์ reasoning_effort ที่มีค่า ไม่มี / ปานกลาง (ปรับอัตโนมัติ, ค่าเริ่มต้น) / สูง ส่วน Claude Opus 5: การคิดแบบปรับอัตโนมัติเป็นค่าเริ่มต้น พร้อมกับแป้นปรับระดับความพยายามจากต่ำไปสูงสุดอย่างชัดเจน
• น้ำหนัก — Nex-N2.5 Pro: Apache-2.0, เร็วๆ นี้, ไม่มีกำหนดวันที่. Claude Opus 5: ไม่เปิดเผย.
• ราคาต่อ 1M โทเคน — Nex-N2.5 Pro: มีโฮสต์เทียร์ให้ใช้ฟรี ยังไม่มีการประกาศราคาอย่างเป็นทางการ Claude Opus 5: $5.00 อินพุต / $25.00 เอาต์พุต, $0.50 การอ่านแคช, $6.25 การเขียนแคช
ขอบเขตความสามารถของทั้งคู่ต่างกันมากพอจนข้อมูลจำเพาะบนกระดาษมีความหมายจริง: Opus 5 มอบหน้าต่างโทเคนหนึ่งล้านโทเคนและเพดานเอาต์พุต 128K สำหรับเซสชันเอเจนต์ระยะยาว ขณะที่คอนเทกซ์ 262K และระดับฟรีของ Nex-N2.5 Pro เหมาะกับงานอัตโนมัติที่ขับเคลื่อนด้วยหน้าจอในขอบเขตเล็กกว่า สเปกทั้งสองแบบไม่ได้ทำให้อีกแบบซ้ำซ้อน โมเดลทั้งสองต่างเห็นไม่ตรงกันว่าเอเจนต์ควรใช้คอนเทกซ์ไปกับอะไร
การอ่านสกอร์บอร์ดของ Nex-AGI เองอย่างตรงไปตรงมา
การอ่านส่วนที่เหลือของบัตรข้อมูลก็ควรใช้ตัวกรองเดียวกันนี้เช่นกัน คะแนนการใช้งานคอมพิวเตอร์อื่นๆ ของ Nex-N2.5 Pro — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — และแถวด้านการเขียนโค้ด — Terminal-Bench 2.1 ที่ 82.7, SWE-Bench Pro ที่ 61.2, BrowseComp ที่ 89.7 — ล้วนเป็นการวัดโดยผู้ขายผ่านชุดทดสอบของพันธมิตรเอง ซึ่งยังไม่มีการทำซ้ำใน 48 ชั่วโมงแรก ข้อสรุปเดียวที่ผู้อ่านที่เป็นกลางจะได้จากบัตรข้อมูลนี้คือ Nex-AGI เชื่อว่า Nex-N2.5 Pro เป็นโมเดลใช้งานคอมพิวเตอร์ระดับกลางที่แข็งแกร่ง แต่ยังตามหลังเอเจนต์ระดับแนวหน้าในแถวที่สำคัญที่สุด นั่นคือการวางตำแหน่งที่สอดคล้องกัน แม้จะอนุรักษ์นิยม สำหรับโมเดลโอเพนขนาด 397B และยังเป็นข้อกล่าวอ้างที่รอห้องปฏิบัติการที่สองมาพิสูจน์
เงิน เมื่อฝ่ายหนึ่งไม่มีราคา
ไม่มีการเปรียบเทียบราคาที่ตรงไปตรงมาที่จะดำเนินการได้ในที่นี้ เพราะมีเพียงฝ่ายเดียวเท่านั้นที่มีราคา ระดับโฮสต์ฟรีของ Nex-N2.5 Pro ไม่ได้บอกอะไรเกี่ยวกับคุณค่าที่แท้จริงของโมเดล — เอนด์พอยต์ตัวอย่างฟรีเป็นวิธีที่ผู้จำหน่ายใช้รวบรวมปริมาณการใช้งานและความคิดเห็น และ Nex-AGI ยังไม่ได้เผยแพร่อัตราค่าใช้จ่ายต่อโทเค็นสำหรับตระกูลนี้ Claude Opus 5 มีค่าใช้จ่าย 5.00 ดอลลาร์ต่อล้านอินพุต และ 25.00 ดอลลาร์ต่อล้านเอาต์พุต ตามราคารายการของ Anthropic โดยการอ่านแคชอยู่ที่ 0.50 ดอลลาร์ และนั่นคือตัวเลขที่งบประมาณต้องรองรับ หากคุณกำลังจ่ายบิลนั้นอยู่ในปัจจุบันสำหรับเอเจนต์ที่ใช้คอมพิวเตอร์ และต้องการรู้ว่าโมเดลโอเพนที่มีแอคทีฟพารามิเตอร์ 17B จะทำงานเดียวกันได้ถูกกว่าหรือไม่ คำตอบก็คือ: อาจจะ แต่คุณไม่สามารถรู้ได้จนกว่าน้ำหนักจะถูกปล่อยและมีใครบางคนที่เป็นอิสระนำไปทดสอบ การเปรียบเทียบราคาถูกเลื่อนออกไป ไม่ใช่ข้อสรุป และการถือว่าเอนด์พอยต์ฟรีเป็นหลักฐานของความถูก ถือเป็นความผิดพลาดเชิงหมวดหมู่

สิ่งที่คุณทำได้ในวันนี้คือการเตรียมการทดสอบ A/B ไว้ล่วงหน้า สำหรับวันที่มันเป็นไปได้จริง Claude Opus 5 อยู่บน OrcaRouter ในราคารายการของ Anthropic — $5.00 / $25.00 เท่าเดิม ส่งผ่านโดยไม่มีมาร์กอัป ดังนั้นบิลที่นี่จึงตรงกับของ Anthropic และจะขยับตามในวันที่ Anthropic ขยับราคา คีย์ API เดียวทำให้มันอยู่เบื้องหลัง endpoint เดียวกันกับโมเดลอื่นๆ อีก 200+ รายการ พร้อมการ failover อัตโนมัติหากผู้ให้บริการมีปัญหาสะดุด และ routing DSL หากคุณต้องการให้ Opus รับมือกับงานยากๆ และใช้โมเดลที่ถูกกว่าสำหรับงานทั่วไป Nex-N2.5 Pro ยังไม่อยู่บน OrcaRouter — เราตรวจสอบไดเรกทอรีโมเดลของเราก่อนเขียนบทความนี้ และยังไม่มีโมเดล nex-agi ใดๆ ปรากฏอยู่ในนั้น ทันทีที่ผู้ให้บริการเสนอขายในราคารายการ มันจะปรากฏที่นี่ในวันเดียวกัน และการเปรียบเทียบอย่างตรงไปตรงมาที่บทความนี้ยังไม่สามารถทำได้ จะกลายเป็นกฎการจัดเส้นทาง (routing rule) แทนที่จะเป็นการย้ายระบบ
ใครควรลงมือ และใครควรรอ
หากทีมของคุณใช้งานเวิร์กโหลดแบบ computer-use หรือ agentic-coding ในระดับโปรดักชันอยู่จริงในตอนนี้ และต้องการโมเดลที่รู้ราคาที่แน่นอน โปรไฟล์ความล้มเหลวที่ทราบได้ และประวัติผลงานจากแหล่งอิสระ Claude Opus 5 คือตัวเลือกที่สมเหตุสมผลในการประมือครั้งนี้ และไม่มีอะไรในช่วง 48 ชั่วโมงแรกของ Nex-N2.5 Pro ที่จะเปลี่ยนข้อเท็จจริงข้อนั้นได้ หากทีมของคุณกำลังประเมินโมเดล computer-use แบบโอเพนซอร์สสำหรับการสร้างงานในอนาคต Nex-N2.5 Pro สมควรอยู่ในรายการเฝ้าจับตา — โมเดล multimodal MoE ขนาด 397B ที่มีพื้นที่การใช้งาน self-host อย่างสมเหตุสมผลและเรื่องราวเกณฑ์มาตรฐานระดับกลางที่เป็นไปได้ คือโมเดลเปิดประเภทที่เปลี่ยนเส้นต้นทุนได้จริง ตราบใดที่น้ำหนักของโมเดลถูกปล่อยออกมาจริง และตัวเลขบนสเปกชีตยังยืนหยัดได้เมื่อผ่านการทดสอบโดยอิสระ จุดยืนที่สมเหตุสมผลคือถือทั้งสองอย่างพร้อมกัน: คงผู้นำที่พิสูจน์แล้วไว้บนเส้นทางหลัก และปล่อยให้วันที่น้ำหนักถูกปล่อยออกมาเป็นตัวตัดสินว่าผู้มาใหม่คู่ควรแก่การทดลองหรือไม่ นั่นคือการเปรียบเทียบเดียวในศึกนี้ที่ยังไม่เกิดขึ้น — และมันคือการเปรียบเทียบที่จะมีความหมายจริง ๆ
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
